○ planned · proyecto

Otorga nivel a: Web Scraping · Natural Language Processing · Transfer Learning

Usa: Web Scraping · Natural Language Processing · Word Embeddings · Transfer Learning · Supervised Learning · Embeddings

Estudia a los cárteles mexicanos como organizaciones industriales, construyendo un panel de presencia criminal por municipio (1990-2021) a partir de scraping de Google News y clasificación con NLP/embeddings. Tesis: ante la ausencia de datos oficiales confiables, las notas periodísticas pueden codificarse computacionalmente para medir dónde y cuándo opera cada grupo.

Hallazgos clave

  • Usa la definición de la ONU (4 criterios: 3+ personas, >1 mes, delitos de >4 años, motivo económico) como umbral operativo antes de medir qué es crimen organizado.
  • Medir es difícil porque el criminal corrompe policías/políticos, el cliente no es víctima (no se autodenuncia) y lo que se sabe viene de arrestos de narcomenudistas que no conocen la estructura.
  • Base cualitativa primero: Alcocer y Signoret leyeron 60 documentos oficiales y a 2016 había 79 organizaciones criminales; de ahí salieron 285 términos de búsqueda (los cárteles tienen múltiples alias).
  • Un bot hizo ~3M de búsquedas cartel×municipio en Google (~5M links); News Please extrajo el 80% del texto, una heurística rescató 15% más y se descartó la mitad por no estar en español.
  • ~40% de las notas que mencionan a un narco NO indican presencia real (elogios a cantantes, iglesia de Malverde, cárceles): la co-ocurrencia cartel+municipio es un proxy engañoso.
  • Etiquetó a mano 11,000 párrafos (5,500/5,500) y comparó GloVe+SVM/RandomForest/regresión logística vs transfer learning (Beto, RoBERTa, DistilBERT, ALBERT, ELECTRA, GPT-2); ganó Beto (68% presencia), y SVM/RF con GloVe quedaron bien en solo 5 minutos.
  • NER: Flair/RoBERTa funcionó para ubicaciones (40,000 ‘Juárez’), pero para cárteles usó exact match; validación con correlación alta vs datos codificados a mano y Wikipedia.

Módulos

  1. Definición y medición del crimen organizado — criterios ONU y por qué es tan difícil de medir.
  2. Fuentes de datos — encuestas policiacas, homicidios sin resolver, ENVIPE y periodistas como fuente local.
  3. Base cualitativa de organizaciones — 79 cárteles y sus árboles de fragmentación.
  4. Recolección vía web scraping — bot de Google, pares cartel×municipio, News Please.
  5. Clasificación de presencia con NLP — embeddings, transfer learning y selección de modelo.
  6. Asignación de entidades y panel — NER, fechas y validación contra DEA/otras bases.

Fuente: https://www.youtube.com/watch?v=lM_p0LN0vwE · Transcript local: data/cursos/datapub-crimen-organizado/crimen-organizado.srt

Enlaces

Otorga nivel a: Web Scraping · Natural Language Processing · Transfer Learning Usa: Web Scraping · Natural Language Processing · Word Embeddings · Transfer Learning · Supervised Learning · Embeddings