Catálogo data analysis desde ~/github-backup — 2026-08-24

Ejercicio espejo del catálogo por rol (2026-08-11): seleccionar proyectos con potencial de data analysis escaneando los 168 mirrors (ls-tree por archivos de datos + READMEs). No solo “tiene CSV”: se marca lo que muestra pipeline, pregunta y datos reales.

Tier A — narrativa + datos reales + reproducible (portafolio-first)

  • NoEsNormal ★ — Código del análisis estadístico del libro No es normal (desigualdad mexicana). CSVs de fuentes reales (INE, encuestas, Bahamas), estructura por capítulo (Competir/Trabajar/Contribuir). El más “cuenta una historia” de todos: desigualdad + código + libro.
  • surtido ★ — Pipeline editorial diario: ingest.py (fuentes), nlp.py, reporte.py → reporte/2026-08-09.json, indice-credibilidad.json. Análisis de credibilidad de medios con salida visible semanal. Vivo.
  • rabies ★ — Proyecto epidemiológico completo: GBIF de vampiros (Desmodus), SIRVERA de brotes de rabia, rezago (IRS/IMM 2000-2020), geojson municipal de México + scripts de fetch reproducibles. El más rico en datos geoespaciales + series.
  • senate_votes_api ★ — API Rails de votaciones del Senado (Senator, Vote, VotePosition). Datos legislativos reales; falta análisis, pero la base de datos es el activo.

Tier B — datasets/análisis sólidos, formato más académico o de curso

  • Prediccion-produccion-electricidad — ARIMA sobre producción eléctrica de EU (FRED, 1990-2025). Series de tiempo clásicas, notebooks completos.
  • Aprendizaje-por-Refuerzo — RL + series de energía (Pymgrid/OpenEI/NREL, 8760 mediciones/hora). Bueno si se quiere mostrar RL, no análisis puro.
  • Curso_Bourbaki_DL — Churn rate (LightGBM/NN), fraude con autoencoders, anomalías en series de tiempo, LSTM multivariado. Sólido como evidencia de ML aplicado, formato de curso.
  • simpsonitos — SQLite de Los Simpson latino: episodios, diálogos, personajes, actores de voz + API FastAPI. Dataset divertido, ideal para análisis de diálogos/texto (¿quién habla más? ¿catchphrases?).
  • isochrones-mexico — Isochrones de transporte público CDMX sobre GTFS real (nov 2022). Análisis espacial/geo — buen gancho para mostrar geodata + MapLibre.
  • gdp-dashboard — Streamlit + GDP CSV. Plantilla de Streamlit, pero simple y desplegable para demo de dashboard.
  • candidatos-judiciales + glvota/landing-win/landinggl — Elección judicial 2025: candidatos (SQLite/Supabase) y visualizaciones de votación. Datos cívicos reales, aún no analizados — oportunidad de “análisis electoral”.

Tier C — pipelines/herramientas (data engineering > analysis)

  • data-prep-kit (IBM, parquet pipelines), everything-claude-code (ecc_dashboard.py, métricas de uso), twitter-web-exporter (export de datos de cuenta), web-archiver (crawler+index), public_domain_gem (OAI-PMH de repositorios UNAM), scraping_gem, youtube-automation-agent (analytics agents + dashboard), resend-wrapper (email stats), EDA (fork de Enterprise Data Analytics), exercises-db-1-2 (SQL de inventarios/mediciones), Bourbaki (datasets de examen/ML BBVA), marvelous (SQLite FTS5 con datasets), retrato-hablado (biometría sintética, más DL que análisis).

Vacío / descartar

  • mvp-correlation: repo vacío (0 commits). Curar o borrar.

Observaciones

  • El tier A es la primera vez que Nef tiene datasets reales y con narrativa mexicana (desigualdad, rabia, senado, elección judicial). Encaja con el reflejo de mirror.md: el DS/ML se “declaró” pero nunca se ejerció — aquí hay evidencia concreta de datos trabajados.
  • Recomendación: 3 proyectos portafolio-first = NoEsNormal (historia), surtido (vivo/semanal), senate_votes_api o rabies (datos duros).