○ unseen · kind concept · level 0 · 0h

Double Machine Learning (DML) es un marco de inferencia causal que usa aprendizaje automático para estimar efectos de tratamiento controlando confusores de alta dimensionalidad. Fue desarrollado por Chernozhukov et al. (2018).

Mecanismo: DML separa el problema en dos etapas:

  1. Stage 1 (nuisance models): Se entrenan modelos de ML (regresión, forest, boosting) para predecir el tratamiento T y el outcome Y a partir de los confusores X. Esto captura la relación no lineal compleja entre confusores y variables.
  2. Stage 2 (causal effect): Usando los residuales de las predicciones (Ŷ - E[Ŷ|X], Ť - E[Ť|X]), se estima el efecto causal de T sobre Y mediante regresión simple. El truco de doble ML (cross-fitting) evita el overfitting que sesgaría la estimación.

La clave es que el ML se usa solo para modelar las nuisance functions, no para el efecto causal directo — esto permite usar cualquier modelo flexible sin sesgar la inferencia causal.

Pitfall: DML asume que los confusores están correctamente medidos (no hay confounding no observado). Si hay variables latentes, la estimación está sesgada igual que cualquier método de variablesInstrumentales. También sensible a la elección de los nuisance models: si los modelos de Stage 1 están mal especificados, el efecto causal se sesga.

Temas relacionados: Causal Inference, Supervised Learning, Feature Selection, Econometrics, Confounding.

Enlaces

Fuentes