Big Data al núvol
Introducció
Muntar i mantenir un clúster Hadoop/Spark on-premise té un cost operatiu elevat: aprovisionament de màquines, actualitzacions, monitorització de maquinari. Els tres grans proveïdors cloud ofereixen serveis gestionats que eliminen aquesta càrrega, i Databricks ha construït al seu voltant la plataforma de Big Data més completa del mercat.
AWS EMR (Elastic MapReduce)
AWS EMR és un servei gestionat que permet executar Hadoop, Spark, Hive i altres eines de l'ecosistema Big Data sense gestionar la infraestructura manualment.
# Crear un clúster EMR amb Spark
aws emr create-cluster \
--name "Cluster-Analytics-2025" \
--release-label emr-7.0.0 \
--applications Name=Spark Name=Hive Name=Hadoop \
--instance-type m5.xlarge \
--instance-count 5 \
--use-default-roles \
--ec2-attributes KeyName=la-teva-clau \
--auto-terminate
# Submetre un job Spark a EMR
aws emr add-steps \
--cluster-id j-XXXXXXXXXX \
--steps Type=Spark,Name="Analisi Vendes",\
ActionOnFailure=CONTINUE,\
Args=[--deploy-mode,cluster,\
s3://bucket/codi/analisi_vendes.py,\
--input,s3://bucket/dades/,\
--output,s3://bucket/resultats/]
Google Dataproc
L'equivalent de Google Cloud, conegut per la seva velocitat d'aprovisionament (clústers disponibles en 90 segons) i la seva integració nativa amb BigQuery, Cloud Storage i Vertex AI.
Azure HDInsight
La plataforma de Microsoft per a Big Data, integrada amb Azure Data Lake Storage Gen2 i Synapse Analytics.
Databricks
Databricks, fundada pels creadors de Spark i Delta Lake, ofereix el que molts consideren la plataforma de Big Data més completa del 2025. Disponible a AWS, Azure i GCP, ofereix:
- Clústers Spark gestionats amb autoscaling
- Databricks Runtime (versió optimitzada de Spark)
- Delta Lake integrat nativament
- Unity Catalog: governança unificada de dades i ML
- Databricks SQL: SQL Warehouse per a analítica, amb un editor SQL i assistència d'IA per generar consultes en llenguatge natural
- MLflow: plataforma de ML integrada
- Notebooks col·laboratius (com Jupyter però més potents)
Demo: dashboard amb IA a Databricks SQL
Databricks Community Edition (gratuïta) permet crear un catàleg, pujar un CSV com a taula i generar consultes i dashboards assistits per IA sense escriure SQL des de zero:
- Es crea un catàleg nou i es puja un CSV (per exemple, un dataset d'emissions per comtat amb població, coordenades i emissions de GEH); Databricks detecta automàticament les columnes i els tipus de dada.
- Des de l'SQL Editor, es poden llançar consultes manuals (
SELECT * FROM emissions_data) o demanar-les en llenguatge natural ("I want to look at the emissions per person in each county"); l'assistent genera el SQL i, si falla, el pot autodiagnosticar i corregir. - Cada consulta desada es pot convertir en una visualització (mapa de punts amb latitud/longitud, diagrama de dispersió, etc.) i afegir-se a un dashboard, aplicant-hi filtres compartits entre visualitzacions.
Miniactivitat
Accedeix a Databricks Community Edition (gratuït: community.cloud.databricks.com) i crea un notebook PySpark que llegeixi les dades del dataset de vols de airlines (disponible a Databricks Datasets) i calculi els retards mitjans per aerolínia.
RA2 | Mòdul 5075 Big Data Aplicat | Institut Sa Palomera (Blanes) | Curs IABD 2026-2027