○ planned · proyecto

Otorga nivel a: Data Lake · ELT

Usa: Data Warehouse · ELT · Data Mesh · Data Cleaning · Data Lake

Jesús Ramos (No Bullshit Data Science) da un taller práctico para construir un data lake en AWS (Lake Formation + S3 + Glue + Athena + QuickSight), simulando la parte transaccional (Postgres + Lambda) y moviendo datos a capas bronze/silver/gold.

Hallazgos clave

  • El data lake es write-once: solo inserts, nunca updates/deletes, porque borrar destruye historia y sesga la analítica.
  • Generar metadata en el momento de la carga evita que el lake se convierta en ‘data swamp’.
  • Para conectar Glue a Postgres se usa la IP privada de la VPC, no la pública; Lake Formation entra como ‘vecino interno’.
  • El nombre del bucket S3 debe ser único a nivel global de AWS; se recomienda prefijo de usuario.
  • Costos reales del ejercicio: 264 son de Glue (jobs de Spark) y $3 de EC2.
  • schema-on-read (Athena/Presto) permite definir el tipo al leer, sin esquema fijo.

Módulos

  1. Concepto de data lake, metadata y data swamp.
  2. Seguridad: usuario IAM, roles y permisos.
  3. Bucket S3 con capas bronze/silver/gold.
  4. Simular transaccional: EC2 + Postgres + Lambda + EventBridge.
  5. VPC endpoint y service role para Glue.
  6. Blueprint incremental, crawlers, Athena y QuickSight.

Fuente: https://www.youtube.com/watch?v=BO6F7-q3Emo · Transcript local: data/cursos/datapub-data-lakes-aws/data-lakes-aws.srt

Enlaces

Otorga nivel a: Data Lake · ELT Usa: Data Warehouse · ELT · Data Mesh · Data Cleaning · Data Lake