Governança de dades: catàleg, lineage i Data Mesh
Contingut d'ampliació
Aquesta pàgina amplia la Qualitat de dades d'aquest bloc amb continguts de governança que no formen part del repartiment oficial de les 99 hores del currículum. El professorat el pot tractar com a activitat de reforç o ampliació.
Un altre marc: les sis dimensions ISO 8000 / DAMA
Les 5 dimensions de qualitat ja treballades en aquest bloc (completesa, unicitat, validesa, consistència, frescor) es basen en el marc més estès a la indústria del Data Engineering. El model internacional ISO 8000 i el DAMA (Data Management Association) hi afegeixen una sisena dimensió:
| Dimensió | Definició | Exemple de problema |
|---|---|---|
| Completeness | Totes les dades necessàries existeixen | Camp codi_postal nul al 30% de clients |
| Consistency | Les dades són coherents entre sistemes | El CRM diu Barcelona, l'ERP diu Madrid, per al mateix client |
| Accuracy | Les dades reflecteixen la realitat | Una venda registrada a 0€ per error d'entrada |
| Timeliness | Les dades estan actualitzades quan cal | Un inventari que s'actualitza un cop al dia en un e-commerce d'alta freqüència |
| Uniqueness | No hi ha duplicats | Un client registrat tres vegades amb el mateix email |
| Validity (la sisena) | Les dades compleixen el format i les regles de negoci | Un NIF invàlid, un email sense "@", una data de naixement en el futur |
No totes les dimensions són igual de crítiques per a tots els casos d'ús: en un model de frau bancari, Accuracy i Timeliness són crítiques; en un informe de vendes mensual, Completeness i Consistency són les prioritàries.
Apache Atlas: lineage i classificació
Apache Atlas és el sistema de governança de metadades de l'ecosistema Hadoop. Permet fer data lineage (traçar el camí d'una dada des del seu origen fins al dashboard final), classificació (etiquetar camps com a PII, confidencial, restringit) i catàleg (descobrir quines taules i columnes existeixen i què signifiquen).
PostgreSQL.vendes.preu_unitari
-> Delta Lake.staging.stg_vendes (Spark job, cada hora)
-> Delta Lake.marts.vendes_mensual (dbt, cada nit)
-> Metabase.Dashboard_Vendes.KPI_Ingressos (actualitzat cada nit)
DataHub: descobriment de dades
DataHub (originalment de LinkedIn, ara mantingut per Acryl Data) és el successor espiritual d'Atlas amb una UI molt més moderna. Permet cercar taules per paraula clau, propietari o etiqueta, veure el lineage de forma interactiva, i integrar-se amb dbt (important-ne automàticament la documentació).
# Instal·lació de DataHub en local
docker compose -f docker-compose.quickstart.yml up -d
# Ingestió de metadades des de dbt
datahub ingest -c datahub_dbt.yml
Data Mesh: propietat descentralitzada
El Data Mesh, proposat per Zhamak Dehghani (2019), és un paradigma que tracta les dades com a productes i distribueix la responsabilitat de cada domini als equips de negoci, en lloc de centralitzar-la en un únic equip de dades:
graph TD
subgraph Vendes["Domini de Vendes"]
PV[Producte: Dataset Vendes Diaries]
end
subgraph Logistica["Domini de Logistica"]
PL[Producte: Dataset Enviaments]
end
subgraph Plataforma["Plataforma Self-Serve - IT Central"]
INFRA[Infraestructura de Dades]
QUALITAT[Estandards de Qualitat]
CATALOG[Cataleg de Dades]
end
PV --> INFRA
PL --> INFRA
INFRA --> QUALITAT
INFRA --> CATALOG
QUALITAT --> Consum[Consumers - BI, Data Scientists]
CATALOG --> Consum
El Data Mesh no substitueix els contractes de dades ja treballats en aquest bloc: hi encaixa perfectament, ja que cada equip propietari d'un domini de dades és qui defineix i manté el contracte del seu producte.
Miniactivitat — AC5074/05/05
Per a l'empresa de la teva pràctica PR507402, identifica 3 dominis de dades diferents (per exemple: vendes, clients, logística) i indica quin equip en seria el propietari natural sota un plantejament de Data Mesh, i quines dades hauria de publicar cadascun com a "producte de dades".
Bloc 5 | Mòdul M5074 Sistemes de Big Data | Institut Sa Palomera (Blanes) | Curs CEIABD 2026-2027