○ planned · proyecto
Otorga nivel a: Agentic AI · LLM-as-a-Judge
Usa: Agentic AI · AI Agents · Multi-Agent Systems · LLM-as-a-Judge · Model Evaluation · Retrieval-Augmented Generation · Guardrails
Evento conjunto de GBM, Data Pub y AICDMX sobre IA agéntica en finanzas. León Parafox explica por qué el 95% de los pilotos de IA generativa fallan: se confunde automatización con transformación y se ignoran el gobierno de datos y el pensamiento en sistemas. Juan Guillermo Gómez complementa con cómo evaluar objetivamente modelos de lenguaje (LLM-as-judge, métricas NLP, rubricas) en lugar de evaluar “a ojo”. Cierra un panel sobre agentes, RAG y quién debe liderar estos sistemas.
Hallazgos clave
- GPT significa “General Purpose Technology” (tecnología de propósito general), no solo el chatbot: todas estas tecnologías (electricidad, avión, internet, automóvil) pasan por una fase donde “no sirven para nada” antes de explotar, por lo que declarar muerta la IA en su tercer año es un error histórico.
- La distinción de Erik Brynjolfsson (Stanford) entre automatización (reemplazar un proceso puntual) y aumentación (rediseñar cómo se hacen las cosas) es la causa raíz del fracaso: las consultoras empujan la vía de automatización porque su ADN es replicar el éxito de una empresa en otra, y se saltan el gobierno de datos.
- La anécdota de las hipotecas lo resume: un modelo perfecto ofrecido a 200,000 clientes solo convirtió a 1 porque el proceso físico (llevar escrituras originales a la sucursal) nunca se rediseñó; el piloto era “un parche” sobre un sistema roto, no una transformación del sistema.
- Para evaluar LLMs no basta “ver si la respuesta está bien”: hay tres familias de métodos — evaluación humana (alta fidelidad, no escalable, con sesgo), métricas estadísticas de NLP (ROUGE, BLEU, Levenshtein, similitud por embeddings) y LLM-as-judge (escalable pero con sesgo y alucinaciones), orquestables con la librería Ragas y Vertex AI.
- El caso de clustering de tópicos con un LLM pequeño le ahorró a León “20-30 horas por semana” de sentarse con negocio a descifrar qué era cada tópico (que además cambiaba de orden en cada corrida por permutabilidad), un ejemplo de aumentación, no de automatización.
Módulos
- Tecnologías de propósito general y su curva de adopción — por qué los GPT tardan décadas en madurar y qué implica para no matar pilotos prematuramente.
- Automatización vs aumentación — el marco de Brynjolfsson, el ejemplo de Excel y cómo rediseñar flujos de trabajo en lugar de sustituirlos.
- Gobierno de datos no estructurados y pensamiento en sistemas — por qué 15 años de gobernar datos estructurados no sirven para PDFs/PPT/imágenes, y cómo pensar la empresa como sistema, no como silos.
- Evaluación de LLMs con métricas objetivas — ROUGE, BLEU, embeddings y similitud semántica; límites de las métricas palabra-a-palabra.
- LLM-as-judge y rubricas — Ragas, Vertex AI, datasets de ground truth, datos sintéticos y comparación de modelos e hiperparámetros en un pipeline de CI/CD.
- Agentes, RAG y SLMs — por qué RAG ≠ agente, RAG como parche sobre el LLM, fine-tuning y small language models como alternativas, y sistemas multiagentes (co-creación).
Fuente: https://www.youtube.com/watch?v=VTmjk4nEyxk · Transcript local: data/cursos/datapub-agentic-ai-financiero/agentic-ai-financiero.srt
Enlaces
Otorga nivel a: Agentic AI · LLM-as-a-Judge Usa: Agentic AI · AI Agents · Multi-Agent Systems · LLM-as-a-Judge · Model Evaluation · Retrieval-Augmented Generation · Guardrails