○ planned · proyecto
Otorga nivel a: Natural Language Processing · Retrieval-Augmented Generation · Tokenization
Usa: Natural Language Processing · Tokenization · Lemmatization · Stemming · Word Embeddings · Embeddings · Retrieval-Augmented Generation · Large Language Models · Reranking
Carlos Vargas, con doctorado en PLN, argumenta que el auge de los LLMs y el “vibe coding” hace que los equipos construyan rápido sistemas que luego se rompen sin saber por qué. A través de tres casos reales (un router de chatbot, un RAG y el análisis de flujos conversacionales) demuestra que el NLP tradicional —clasificación con n-gramas/TF-IDF, normalización para BM25, NER y LDA— sigue siendo indispensable para entender y corregir lo que la IA generativa hace mal, y que lo correcto es combinarla con los LLMs, no sustituirla.
Hallazgos clave
- La lección fundacional: “.fit y .predict dan el mismo resultado sepas o no lo que pasa por detrás, pero el día que el modelo se rompa no vas a saber por qué”; hay que entender los fundamentos para poder arreglar el sistema cuando falla.
- En un router de chatbot, el prompt engineering sobre un LLM es frágil e inexplicable cuando se rompe; una regresión logística con n-gramas da explicabilidad alta (puedes leer qué tokens empujan hacia cada ruta), mientras TF-IDF y embeddings la reducen progresivamente.
- En RAG, llenar la ventana de contexto provoca “ContextRot”, “needle in a haystack / lost in the middle” y un time-to-first-token que se degrada (simulaciones: ~3s bajo 30k tokens, 3–6s a 100k y 6–10s arriba de 100k), además de costos mayores por API.
- El error clásico del BM25 “ingenuo”: como está basado en TF-IDF, si no normalizas (lowercase, quitar números/puntuación/acentos, stopwords y stemming/lemmatization), “sales” no hace match con “Sales” ni “2024?” con “January 2024”, y todos los documentos reciben el mismo score.
- Los documentos de ventas son semántica y sintácticamente casi idénticos (similitud coseno ~0.95), por lo que el retrieval vectorial se vuelve un “juego de ruleta”; la solución es combinar búsqueda léxica (BM25) y semántica con RRF y, opcionalmente, un cross-encoder/reranker.
- Dejar que un LLM etiquete 100 filas de texto produce 94 tópicos distintos: es basura. El camino correcto es correr NER y LDA (que devuelve las distribuciones theta y beta), ordenar las top palabras de cada tópico y “groundear” al LLM con esos tópicos para que etiquete con sentido.
- Para depurar flujos conversacionales descarrilados (p. ej., el chatbot de Python al que le preguntan quién gana entre Cruz Azul y Pumas), la combinación de NER + distribución de tópicos LDA + analítica descriptiva permite localizar el nodo con mal prompt o el guardrail faltante.
- Los LLMs locales normalmente no tienen sentido: GPT 5.4 Nano cuesta 20 centavos por millón de tokens de input; tu tiempo instalando LM Studio es más caro que usar la API.
Módulos
- Por qué se rompen los sistemas con LLMs — Vibe coding, prompt engineering frágil y la necesidad de entender los fundamentos para poder reparar.
- El router de chatbot como clasificación — Golden dataset, matriz de confusión y el trade-off de explicabilidad: n-gramas vs TF-IDF vs embeddings.
- RAG: ventana de contexto y retrieval — ContextRot, lost in the middle, time-to-first-token, costos por API y cuándo NO usar RAG directo.
- BM25 y búsqueda léxica bien hecha — TF-IDF por detrás, el error de no normalizar y el pipeline correcto (lowercase, tokenización, stopwords, stemming) más RRF con búsqueda semántica.
- Depurar flujos conversacionales con NER y LDA — Entidades, distribuciones de tópicos theta/beta y cómo “groundear” un LLM para etiquetar y encontrar nodos rotos.
- Combinar NLP clásico y LLMs en producción — Analítica descriptiva + insights de ChatGPT, citaciones en RAG, idiomas múltiples y el caso de los LLMs locales vs API.
Fuente: https://www.youtube.com/watch?v=kKeN2vKSwxU · Transcript local: data/cursos/datapub-nlp-tradicional/nlp-tradicional.srt
Enlaces
Otorga nivel a: Natural Language Processing · Retrieval-Augmented Generation · Tokenization Usa: Natural Language Processing · Tokenization · Lemmatization · Stemming · Word Embeddings · Embeddings · Retrieval-Augmented Generation · Large Language Models · Reranking