Salta el contingut

Governança de dades: catàleg, lineage i Data Mesh

Contingut d'ampliació

Aquesta pàgina amplia la Qualitat de dades d'aquest bloc amb continguts de governança que no formen part del repartiment oficial de les 99 hores del currículum. El professorat el pot tractar com a activitat de reforç o ampliació.

Un altre marc: les sis dimensions ISO 8000 / DAMA

Les 5 dimensions de qualitat ja treballades en aquest bloc (completesa, unicitat, validesa, consistència, frescor) es basen en el marc més estès a la indústria del Data Engineering. El model internacional ISO 8000 i el DAMA (Data Management Association) hi afegeixen una sisena dimensió:

Dimensió Definició Exemple de problema
Completeness Totes les dades necessàries existeixen Camp codi_postal nul al 30% de clients
Consistency Les dades són coherents entre sistemes El CRM diu Barcelona, l'ERP diu Madrid, per al mateix client
Accuracy Les dades reflecteixen la realitat Una venda registrada a 0€ per error d'entrada
Timeliness Les dades estan actualitzades quan cal Un inventari que s'actualitza un cop al dia en un e-commerce d'alta freqüència
Uniqueness No hi ha duplicats Un client registrat tres vegades amb el mateix email
Validity (la sisena) Les dades compleixen el format i les regles de negoci Un NIF invàlid, un email sense "@", una data de naixement en el futur

No totes les dimensions són igual de crítiques per a tots els casos d'ús: en un model de frau bancari, Accuracy i Timeliness són crítiques; en un informe de vendes mensual, Completeness i Consistency són les prioritàries.

Apache Atlas: lineage i classificació

Apache Atlas és el sistema de governança de metadades de l'ecosistema Hadoop. Permet fer data lineage (traçar el camí d'una dada des del seu origen fins al dashboard final), classificació (etiquetar camps com a PII, confidencial, restringit) i catàleg (descobrir quines taules i columnes existeixen i què signifiquen).

PostgreSQL.vendes.preu_unitari
    -> Delta Lake.staging.stg_vendes (Spark job, cada hora)
    -> Delta Lake.marts.vendes_mensual (dbt, cada nit)
    -> Metabase.Dashboard_Vendes.KPI_Ingressos (actualitzat cada nit)

DataHub: descobriment de dades

DataHub (originalment de LinkedIn, ara mantingut per Acryl Data) és el successor espiritual d'Atlas amb una UI molt més moderna. Permet cercar taules per paraula clau, propietari o etiqueta, veure el lineage de forma interactiva, i integrar-se amb dbt (important-ne automàticament la documentació).

# Instal·lació de DataHub en local
docker compose -f docker-compose.quickstart.yml up -d

# Ingestió de metadades des de dbt
datahub ingest -c datahub_dbt.yml

Data Mesh: propietat descentralitzada

El Data Mesh, proposat per Zhamak Dehghani (2019), és un paradigma que tracta les dades com a productes i distribueix la responsabilitat de cada domini als equips de negoci, en lloc de centralitzar-la en un únic equip de dades:

graph TD
    subgraph Vendes["Domini de Vendes"]
        PV[Producte: Dataset Vendes Diaries]
    end
    subgraph Logistica["Domini de Logistica"]
        PL[Producte: Dataset Enviaments]
    end
    subgraph Plataforma["Plataforma Self-Serve - IT Central"]
        INFRA[Infraestructura de Dades]
        QUALITAT[Estandards de Qualitat]
        CATALOG[Cataleg de Dades]
    end

    PV --> INFRA
    PL --> INFRA
    INFRA --> QUALITAT
    INFRA --> CATALOG
    QUALITAT --> Consum[Consumers - BI, Data Scientists]
    CATALOG --> Consum

El Data Mesh no substitueix els contractes de dades ja treballats en aquest bloc: hi encaixa perfectament, ja que cada equip propietari d'un domini de dades és qui defineix i manté el contracte del seu producte.

Miniactivitat — AC5074/05/05

Per a l'empresa de la teva pràctica PR507402, identifica 3 dominis de dades diferents (per exemple: vendes, clients, logística) i indica quin equip en seria el propietari natural sota un plantejament de Data Mesh, i quines dades hauria de publicar cadascun com a "producte de dades".


Bloc 5 | Mòdul M5074 Sistemes de Big Data | Institut Sa Palomera (Blanes) | Curs CEIABD 2026-2027