○ planned · proyecto
Otorga nivel a: Time Series · Feature Engineering
Usa: Time Series · Feature Engineering · Model Selection · Principal Component Analysis · Data Cleaning
Charla sobre el proyecto “TAM Fusion” (2° lugar del Factored Datathon 2024), que construyó un pipeline completo para predecir riesgo global a partir del dataset masivo GDELT (eventos de noticias del mundo). La tesis central: con Python, la nube y los LLM se puede llevar un dataset de cientos de gigabytes hasta un producto de datos desplegado en web en solo dos semanas, siempre que se sepa dividir el problema, prototipar rápido y pivotear sin apegarse a las ideas.
Hallazgos clave
- GDELT (Events + Global Knowledge Graph) codifica eventos de noticias con códigos CAMEO y la Goldstein Scale (−10 a +10 sobre impacto en estabilidad de un país); la métrica propuesta fue un “Goldstein Scale weighted average” ponderado por número de menciones, calculado por día y por país.
- La arquitectura Medallion (bronce→plata→oro) organizó el flujo en Azure: capa cruda (Storage Account/Data Lake Gen2 + Azure Function serverless diaria), transformación con Databricks/Spark, y presentación en SQL Server servida por una web app Streamlit en Docker desplegada con GitHub Actions (CI/CD automático por tag).
- Para hacer forecasting con un modelo tabular (Random Forest) se convirtió la serie de tiempo en características: codificación cíclica (seno/coseno de día, semana, mes), lag features (1, 7, 30 días) y promedios móviles; el pronóstico multi-paso se resolvió de forma recursiva (predecir un día y usar ese valor como lag del siguiente).
- Lección humana del datatón: “haz, haz y haz” (partir el problema en pedazos pequeños), definir una meta de negocio antes de construir, escuchar a los compañeros, y pivotear rápido (abandonaron Taipy tras 3 días de pelea y migraron a Streamlit en media hora, dos días antes de la entrega).
Módulos
- El dataset GDELT y la Goldstein Scale — Entender Events, GKG, códigos CAMEO y métricas de sentimiento (Average Tone) para modelar riesgo por país.
- Arquitectura Medallion en la nube — Diseñar capas bronce/plata/oro con Azure Storage, Data Lake Gen2 y Azure Functions serverless.
- Procesamiento distribuido con Databricks y Spark — Cargar y transformar CSV masivos (de 250 GB a agregados por día-país) sin leerlos localmente.
- Feature engineering para series de tiempo — Codificación cíclica seno/coseno, lag features y rolling averages para convertir la serie en tabla.
- Forecasting recursivo con Random Forest — Entrenar un modelo por país y generar predicciones multi-paso usando el propio valor predicho como lag.
- Producto de datos desplegado — Servir con SQL Server, visualizar con Streamlit + Plotly (cloroplético y alertas por umbral) y automatizar con GitHub Actions y Docker.
Fuente: https://www.youtube.com/watch?v=SPT_cwIzrHo · Transcript local: data/cursos/datapub-prediccion-riesgo-global/prediccion-riesgo-global.srt
Enlaces
Otorga nivel a: Time Series · Feature Engineering Usa: Time Series · Feature Engineering · Model Selection · Principal Component Analysis · Data Cleaning