○ planned · proyecto
Otorga nivel a: Data Lake · ELT
Usa: Data Warehouse · ELT · Data Mesh · Data Cleaning · Data Lake
Jesús Ramos (No Bullshit Data Science) da un taller práctico para construir un data lake en AWS (Lake Formation + S3 + Glue + Athena + QuickSight), simulando la parte transaccional (Postgres + Lambda) y moviendo datos a capas bronze/silver/gold.
Hallazgos clave
- El data lake es write-once: solo inserts, nunca updates/deletes, porque borrar destruye historia y sesga la analítica.
- Generar metadata en el momento de la carga evita que el lake se convierta en ‘data swamp’.
- Para conectar Glue a Postgres se usa la IP privada de la VPC, no la pública; Lake Formation entra como ‘vecino interno’.
- El nombre del bucket S3 debe ser único a nivel global de AWS; se recomienda prefijo de usuario.
- Costos reales del ejercicio: 264 son de Glue (jobs de Spark) y $3 de EC2.
- schema-on-read (Athena/Presto) permite definir el tipo al leer, sin esquema fijo.
Módulos
- Concepto de data lake, metadata y data swamp.
- Seguridad: usuario IAM, roles y permisos.
- Bucket S3 con capas bronze/silver/gold.
- Simular transaccional: EC2 + Postgres + Lambda + EventBridge.
- VPC endpoint y service role para Glue.
- Blueprint incremental, crawlers, Athena y QuickSight.
Fuente: https://www.youtube.com/watch?v=BO6F7-q3Emo · Transcript local: data/cursos/datapub-data-lakes-aws/data-lakes-aws.srt
Enlaces
Otorga nivel a: Data Lake · ELT Usa: Data Warehouse · ELT · Data Mesh · Data Cleaning · Data Lake