○ planned · proyecto
Otorga nivel a: Network Science · Anomaly Detection
Usa: Network Science · Graph Theory · Random Forest · Neural Network · Anomaly Detection · Network Motifs · Class Imbalance
Carlos Gershenson (UNAM, Centro de Ciencias de la Complejidad) usa datos masivos anonimizados del SAT (facturas CFDI 2015-2018, 81.5M de RFCs, ~6,000 EFOS) para detectar evasión fiscal combinando clasificación supervisada (DNN + Random Forest) y ciencia de redes. Tesis: automatizar las heurísticas del SAT midiendo la cercanía topológica a EFOS ya detectados.
Hallazgos clave
- La intersección de ambos clasificadores (43,600 RFCs) es el criterio más robusto; por separado daban 150k (DNN) y 128k (RF) candidatos.
- La cercanía topológica (distancia en pasos a un EFO definitivo) es predictor fuerte: si facturas a los mismos 20 clientes que un EFO, casi seguro eres de la misma red.
- La ley de Benford NO sirvió para detectar EFOS (sí la cumplen); PageRank tampoco; graph embeddings no funcionaron.
- No hay variable individual que delate a un EFO: siempre es una combinación no lineal (dominada por los montos).
- Sesgo grave: entrena sobre patrones conocidos, no detecta métodos nuevos y puede marcar falsos positivos; sirve para priorizar, no para declarar culpables.
Módulos
- Contexto: CFDI, EFOS y EDOS — facturación/deducción simulada.
- Construcción de la red temporal de facturas — 81M nodos, 48 capas mensuales.
- Clasificación supervisada — DNN y Random Forest (94% acierto).
- Ciencia de redes: alcance y cercanía topológica.
- Estimación de montos evadidos y limitaciones.
Fuente: https://www.youtube.com/watch?v=cVSN8ZSM-YM · Transcript local: data/cursos/datapub-evasion-fiscal/evasion-fiscal.srt
Enlaces
Otorga nivel a: Network Science · Anomaly Detection Usa: Network Science · Graph Theory · Random Forest · Neural Network · Anomaly Detection · Network Motifs · Class Imbalance