○ planned · proyecto
Otorga nivel a: Feature Engineering · Model Selection
Usa: Feature Engineering · Model Selection · Supervised Learning · Recommendation Systems · Time Series · Data Cleaning
Un matemático con más de década y media de experiencia repasa casos reales de ciencia de datos en ocho industrias: manufactura, fintech, retail, educación, logística, salud, sector público, RH y banca. Su tesis central es que la tecnología y la técnica son herramientas, no protagonistas: lo que importa es el problema, el usuario final y la creatividad/experiencia para elegir la herramienta correcta. Insiste en que nunca habrá datos perfectos y que lo más difícil de todo proyecto son los humanos (resistencia al cambio y comunicación).
Hallazgos clave
- En manufactura sin trazabilidad (planta de 4 km, 500 sensores, variable objetivo 6–7 horas después) hay que hacer inferencia sobre qué influye en qué; el éxito dependió de sesiones de experiencia de usuario con los ingenieros de planta, no de la técnica.
- La regla “adaptarse al cliente, no al revés”: se migró de AWS a Azure porque la empresa mexicana grande ya usa Windows/Office (que “regala” la nube), y se mantuvo SQL Server porque el proveedor de PLCs lo exigía; el mercado no se adapta a tus caprichos.
- En fintech el scoring alternativo se construye con features creativos, no sofisticados: cómo escribía el usuario en Facebook (letras repetidas, mayúsculas) era proxy de mala educación crediticia, y el “número de caras” en la foto de perfil (OpenCV) correlacionaba con el riesgo.
- Los modelos de salud deben ser 100% explicables: un modelo lineal sencillo con el médico como dueño del producto y con la palabra final es preferible a un deep learning opaco; “si el médico no lo entiende, es culpa del que construye”.
- En banca la burocracia ahoga: un piloto de línea colateral tomó 8 meses (15 mil cuentas, árboles de decisión y diseño experimental) y el experimento confirmó que “el cliente no hace cuentas” (tasa menor vs mensualidades gratis dieron la misma respuesta).
Módulos
- El mapa multi-industria de la ciencia de datos — Cómo se ordenan banca, retail, logística, manufactura, salud, RH, educación y sector público por dificultad y madurez de datos.
- Manufactura y calidad predictiva — Series de tiempo de sensores, trazabilidad, intervención humana y UX con ingenieros de planta.
- Fintech y scoring alternativo — Representaciones vectoriales, embedding finance y features creativos sobre datos sociales y transaccionales.
- Optimización vs machine learning — Investigación de operaciones (programas mixtos) para pricing y eficiencia de combustible, y cuándo un modelo de reglas gana a un ML.
- Salud y modelos explicables — Diagnosis asistida, datos sensibles, ausencia de regulación en México y el expediente clínico digital como oportunidad.
- Sector público, RH y banca — Clasificación de texto con OCR on-premise, matching de candidatos y el ciclo completo de un caso de uso (de ideación a pruebas A/B).
Fuente: https://www.youtube.com/watch?v=H-C7I-3Gzok · Transcript local: data/cursos/datapub-ciencia-de-datos-multi-industria/ciencia-de-datos-multi-industria.srt
Enlaces
Otorga nivel a: Feature Engineering · Model Selection Usa: Feature Engineering · Model Selection · Supervised Learning · Recommendation Systems · Time Series · Data Cleaning