○ planned · proyecto

Otorga nivel a: Natural Language Processing · Model Selection

Usa: Large Language Models · Natural Language Processing · Tokenization · Embeddings · Fine-tuning · Model Selection · Logistic Regression · Random Forest

Charla sobre el problema de codificación clínica (asignar códigos ICD-10 a las notas médicas) en el hospital gratuito IHH de Karachi, Pakistán, donde solo dos codificadores humanos etiquetan las visitas. La tesis central: antes de saltar a un LLM hay que resolver con la opción más sencilla (information retrieval + machine learning tradicional), porque el contexto (recursos limitados, sin GPU, datos sensibles) y la confianza del partner pesan más que una diferencia marginal de performance.

Hallazgos clave

  • El problema se formula como predicción multi-etiqueta con K=10 espacios por visita (lo que un doctor puede leer): se mide precision@k y, sobre todo, recall@k sobre todos los diagnósticos ICD-10 (no solo los 200 más frecuentes con los que se entrena).
  • Con los 200 códigos ICD-10 más frecuentes se cubre ~85% de los códigos y ~87% de las visitas; en vez de un solo modelo multi-clase se entrenaron 200 modelos separados (uno por código) para tener control granular de cada etiqueta.
  • Se compararon baseline (information retrieval), Random Forest y un LLM (ClinicalBERT fine-tuneado): a k=10 la diferencia es pequeña, pero el LLM exige recursos (GPU, nube) imposibles de justificar en Pakistán y pelea política entre stakeholders, por lo que se siguió con Random Forest en deployment.
  • Los modelos tradicionales sufren con las negaciones (“no DM”, “no HTN”) y las abreviaciones del lingo médico; las notas tienen signos de interrogación que expresan incertidumbre del doctor, y son un ground truth ruidoso que hay que entender antes de modelar.
  • Conclusión: “el contexto es el rey” — el performance no es lo más importante; se empieza por lo sencillo, se valida si funciona, y la confianza del partner vale más que usar la tecnología de moda.

Módulos

  1. El problema de codificación clínica (ICD-10) — Entender la taxonomía de diagnósticos, el flujo de urgencias y por qué la falta de estandarización impide el análisis descriptivo.
  2. Formulación multi-etiqueta con K limitado — Modelar 10 espacios por visita y medir precision@k vs recall@k sobre todos los códigos posibles.
  3. Baselines y machine learning tradicional — Construir information retrieval, Random Forest (un modelo por código) y entender negaciones y abreviaciones en las notas.
  4. Evaluación de LLMs (ClinicalBERT) — Comparar fine-tuning de un LLM contra líneas base, y medir la diferencia real de performance a cada k.
  5. Restricciones de deployment en contextos de bajos recursos — Sin GPU, datos sensibles regulados, sin gente que mantenga el sistema; decidir la solución de menor costo operativo y político.

Fuente: https://www.youtube.com/watch?v=c_cLqbTXYGI · Transcript local: data/cursos/datapub-before-llms/before-llms.srt

Enlaces

Otorga nivel a: Natural Language Processing · Model Selection Usa: Large Language Models · Natural Language Processing · Tokenization · Embeddings · Fine-tuning · Model Selection · Logistic Regression · Random Forest