Catálogo data analysis desde ~/github-backup — 2026-08-24
Ejercicio espejo del catálogo por rol (2026-08-11): seleccionar proyectos con potencial de data analysis escaneando los 168 mirrors (ls-tree por archivos de datos + READMEs). No solo “tiene CSV”: se marca lo que muestra pipeline, pregunta y datos reales.
Tier A — narrativa + datos reales + reproducible (portafolio-first)
- NoEsNormal ★ — Código del análisis estadístico del libro No es normal (desigualdad mexicana). CSVs de fuentes reales (INE, encuestas, Bahamas), estructura por capítulo (Competir/Trabajar/Contribuir). El más “cuenta una historia” de todos: desigualdad + código + libro.
- surtido ★ — Pipeline editorial diario:
ingest.py(fuentes),nlp.py,reporte.py→reporte/2026-08-09.json,indice-credibilidad.json. Análisis de credibilidad de medios con salida visible semanal. Vivo. - rabies ★ — Proyecto epidemiológico completo: GBIF de vampiros (Desmodus), SIRVERA de brotes de rabia, rezago (IRS/IMM 2000-2020), geojson municipal de México + scripts de fetch reproducibles. El más rico en datos geoespaciales + series.
- senate_votes_api ★ — API Rails de votaciones del Senado (Senator, Vote, VotePosition). Datos legislativos reales; falta análisis, pero la base de datos es el activo.
Tier B — datasets/análisis sólidos, formato más académico o de curso
- Prediccion-produccion-electricidad — ARIMA sobre producción eléctrica de EU (FRED, 1990-2025). Series de tiempo clásicas, notebooks completos.
- Aprendizaje-por-Refuerzo — RL + series de energía (Pymgrid/OpenEI/NREL, 8760 mediciones/hora). Bueno si se quiere mostrar RL, no análisis puro.
- Curso_Bourbaki_DL — Churn rate (LightGBM/NN), fraude con autoencoders, anomalías en series de tiempo, LSTM multivariado. Sólido como evidencia de ML aplicado, formato de curso.
- simpsonitos — SQLite de Los Simpson latino: episodios, diálogos, personajes, actores de voz + API FastAPI. Dataset divertido, ideal para análisis de diálogos/texto (¿quién habla más? ¿catchphrases?).
- isochrones-mexico — Isochrones de transporte público CDMX sobre GTFS real (nov 2022). Análisis espacial/geo — buen gancho para mostrar geodata + MapLibre.
- gdp-dashboard — Streamlit + GDP CSV. Plantilla de Streamlit, pero simple y desplegable para demo de dashboard.
- candidatos-judiciales + glvota/landing-win/landinggl — Elección judicial 2025: candidatos (SQLite/Supabase) y visualizaciones de votación. Datos cívicos reales, aún no analizados — oportunidad de “análisis electoral”.
Tier C — pipelines/herramientas (data engineering > analysis)
- data-prep-kit (IBM, parquet pipelines), everything-claude-code (ecc_dashboard.py, métricas de uso), twitter-web-exporter (export de datos de cuenta), web-archiver (crawler+index), public_domain_gem (OAI-PMH de repositorios UNAM), scraping_gem, youtube-automation-agent (analytics agents + dashboard), resend-wrapper (email stats), EDA (fork de Enterprise Data Analytics), exercises-db-1-2 (SQL de inventarios/mediciones), Bourbaki (datasets de examen/ML BBVA), marvelous (SQLite FTS5 con datasets), retrato-hablado (biometría sintética, más DL que análisis).
Vacío / descartar
- mvp-correlation: repo vacío (0 commits). Curar o borrar.
Observaciones
- El tier A es la primera vez que Nef tiene datasets reales y con narrativa mexicana (desigualdad, rabia, senado, elección judicial). Encaja con el reflejo de mirror.md: el DS/ML se “declaró” pero nunca se ejerció — aquí hay evidencia concreta de datos trabajados.
- Recomendación: 3 proyectos portafolio-first = NoEsNormal (historia), surtido (vivo/semanal), senate_votes_api o rabies (datos duros).