○ planned · proyecto

Otorga nivel a: Network Science · Anomaly Detection

Usa: Network Science · Graph Theory · Random Forest · Neural Network · Anomaly Detection · Network Motifs · Class Imbalance

Carlos Gershenson (UNAM, Centro de Ciencias de la Complejidad) usa datos masivos anonimizados del SAT (facturas CFDI 2015-2018, 81.5M de RFCs, ~6,000 EFOS) para detectar evasión fiscal combinando clasificación supervisada (DNN + Random Forest) y ciencia de redes. Tesis: automatizar las heurísticas del SAT midiendo la cercanía topológica a EFOS ya detectados.

Hallazgos clave

  • La intersección de ambos clasificadores (43,600 RFCs) es el criterio más robusto; por separado daban 150k (DNN) y 128k (RF) candidatos.
  • La cercanía topológica (distancia en pasos a un EFO definitivo) es predictor fuerte: si facturas a los mismos 20 clientes que un EFO, casi seguro eres de la misma red.
  • La ley de Benford NO sirvió para detectar EFOS (sí la cumplen); PageRank tampoco; graph embeddings no funcionaron.
  • No hay variable individual que delate a un EFO: siempre es una combinación no lineal (dominada por los montos).
  • Sesgo grave: entrena sobre patrones conocidos, no detecta métodos nuevos y puede marcar falsos positivos; sirve para priorizar, no para declarar culpables.

Módulos

  1. Contexto: CFDI, EFOS y EDOS — facturación/deducción simulada.
  2. Construcción de la red temporal de facturas — 81M nodos, 48 capas mensuales.
  3. Clasificación supervisada — DNN y Random Forest (94% acierto).
  4. Ciencia de redes: alcance y cercanía topológica.
  5. Estimación de montos evadidos y limitaciones.

Fuente: https://www.youtube.com/watch?v=cVSN8ZSM-YM · Transcript local: data/cursos/datapub-evasion-fiscal/evasion-fiscal.srt

Enlaces

Otorga nivel a: Network Science · Anomaly Detection Usa: Network Science · Graph Theory · Random Forest · Neural Network · Anomaly Detection · Network Motifs · Class Imbalance