Diferencia en diferencias 101. ¿Qué es la diferencia en diferencias (DiD… | por Henam Singla | mayo de 2024

Nuestra pregunta de investigación es: ¿cuál es el efecto del tratamiento D sobre el resultado y?? DiD nos permite estimar qué le habría pasado al grupo de tratamiento si la intervención no hubiera ocurrido. Este escenario contrafactual es esencial para comprender el verdadero efecto del tratamiento. Cada trabajo o trabajo gira en torno a responder preguntas similares, como el efecto de las intervenciones, los cambios de políticas o los tratamientos en varios campos. En economía, evalúa el impacto de los recortes de impuestos en el crecimiento económico, mientras que en política pública, evalúa los efectos de las nuevas leyes de tránsito en las tasas de accidentes. En marketing, DiD analiza la influencia de las campañas publicitarias en las ventas.

Diagrama creado por el autor.

Por ejemplo, en el diagrama anterior, tenemos datos de población en nuestra muestra. Dividiremos los datos en tratamiento y control donde el tratamiento recibió la intervención. Podemos observar variables posteriores y previas para ambos grupos.

Estimador de diferencia de tratamiento/control simple

Esta ecuación calculará el efecto del tratamiento comparando los cambios en el resultado a lo largo del tiempo entre los grupos de tratamiento y control.

He creado un ejemplo falso para ayudar a comprender las matemáticas.

El Coeficiente DiD sería 9 utilizando la fórmula mencionada anteriormente.

Estimador DiD: cálculo mediante regresión

DiD ayuda a controlar las características que no varían en el tiempo y que podrían sesgar la estimación de los efectos del tratamiento. Esto significa que elimina la influencia de variables que son constantes en el tiempo (por ejemplo, ubicación geográfica, género, etnia, capacidad innata, etc.). Puede hacerlo porque estas características afectan tanto a los períodos previos como posteriores al tratamiento por igual para cada grupo.

La ecuación central para un modelo DiD básico es:

dónde:

  • y​ es la variable de resultado para el individuo 𝑖 en el grupo j en el tiempo 𝑡.
  • 𝐴𝑓𝑡𝑒𝑟​ es una variable ficticia igual a 1 si la observación es en el período post-tratamiento.
  • 𝑇𝑟𝑒𝑎𝑡𝑚𝑒𝑛𝑡 es una variable ficticia igual a 1 si la observación pertenece al grupo de tratamiento.
  • 𝐴𝑓𝑡𝑒𝑟 × 𝑇𝑟𝑒𝑎𝑡𝑚𝑒𝑛𝑡​ es el término de interacción, con el coeficiente b capturando la estimación de DiD.

El coeficiente del término de interacción es el estimador DiD en y. La regresión es más popular entre los investigadores porque ayuda a generar errores estándar y controlar variables adicionales.

Esta es una de las suposiciones clave en DiD. Se basa en la idea de que, en ausencia de tratamiento, la diferencia entre los grupos de tratamiento y control permanecería constante en el tiempo. En otras palabras, en ausencia de tratamiento, β (estimación DiD) = 0.

Formalmente, esto significa:

Otra forma de pensar en esto es que la diferencia entre los dos grupos se habría mantenido igual a lo largo del tiempo sin el cambio de política. Si las tendencias no son paralelas antes del tratamiento, las estimaciones de DiD pueden estar sesgadas.

Cómo comprobar esta suposición

Ahora la siguiente pregunta es: ¿cómo comprobarlo? La validez del supuesto de tendencias paralelas se puede evaluar mediante análisis gráficos y pruebas de placebo.

Creado por el autor

Se supone que, en ausencia de tratamiento, el grupo de tratamiento (línea naranja) y el grupo de control (línea discontinua azul) seguirían caminos paralelos a lo largo del tiempo. La intervención (línea vertical) marca el punto en el que se aplica el tratamiento, lo que permite comparar las diferencias en las tendencias entre los dos grupos antes y después de la intervención para estimar el efecto del tratamiento.

Ejemplos que violan el supuesto de tendencias paralelas

En palabras sencillas buscamos dos cosas en el tratamiento que son las siguientes:

  1. Cambio de pendiente
Gráfico: Parte (a)
Gráfico: Parte (b)

En los dos casos anteriores, no se cumple el supuesto de tendencia paralela. El resultado del grupo de tratamiento está creciendo más rápido (parte a) o más lentamente (parte b) que el resultado del grupo de control. La forma matemática de decir esto es:

DiD = efecto verdadero + tendencia diferencial (la tendencia diferencial debe ser 0)

La tendencia diferencial podría ser positiva (parte a) o negativa (parte b)

DiD no podrá aislar el impacto de la intervención (efecto verdadero) ya que también tenemos una tendencia diferencial en ella.

2. Saltar en la línea de tratamiento (ya sea hacia arriba o hacia abajo) después de la intervención.

En la imagen de arriba, la tendencia del grupo de tratamiento cambió de manera diferente a la tendencia del grupo de control, que debería haber permanecido constante sin la intervención. No se permite un salto en el estudio de DiD.

Las pruebas de placebo se utilizan para verificar si los efectos observados del tratamiento se deben realmente al tratamiento y no a otros factores de confusión. Implican aplicar el mismo análisis a un período o grupo donde no se espera ningún efecto del tratamiento. Si se encuentra un efecto significativo en estas pruebas con placebo, sugiere que los resultados originales pueden ser falsos.

Por ejemplo, en 2019 se realizó un estudio de intervención sobre la entrega de tabletas a las escuelas secundarias. Podemos hacer una prueba de placebo, lo que significa que podemos crear un año de intervención falso, digamos 2017, en el que sabemos que no se produjo ningún cambio de política. Si la aplicación del análisis del efecto del tratamiento a la fecha del placebo (2017) no muestra ningún cambio significativo, sugerirá que el efecto observado en 2019 (si lo hubo) probablemente se deba a la intervención política real.

  1. Estudio de eventos Hizo: Estima los efectos del tratamiento por año específico, lo cual es útil para evaluar el momento de los efectos del tratamiento y verificar tendencias previas. El modelo permite que el efecto del tratamiento varíe según el año. Podemos estudiar el efecto en el momento. t+1, t+2,…, t+norte
  2. Método de control sintético (SCM): SCM construye un grupo de control sintético ponderando múltiples unidades no tratadas para crear un compuesto que se aproxima a las características de la unidad tratada antes de la intervención. Este método es particularmente útil cuando una sola unidad tratada se compara con un conjunto de unidades no tratadas. Proporciona un contrafactual más creíble al combinar información de varias unidades.

Hay muchos más, pero me limitaré a sólo dos. Quizás escriba un post más adelante explicando detalladamente todo el resto.

En esta publicación, analicé el estimador de diferencias en diferencias (DiD), un método popular para estimar los efectos promedio del tratamiento. DiD se utiliza ampliamente para estudiar los efectos de las políticas comparando los cambios a lo largo del tiempo entre los grupos de tratamiento y control. La ventaja clave de DiD es su capacidad para controlar factores de confusión no observados que permanecen constantes en el tiempo, aislando así el verdadero impacto de una intervención.

También exploramos conceptos clave como el supuesto de tendencias paralelas, la importancia de los datos previos al tratamiento y cómo verificar las violaciones de los supuestos mediante análisis gráfico y pruebas de placebo. Además, hablé de las extensiones y variaciones de DiD, como el estudio de eventos DiD y el método de control sintético, que ofrecen más información y solidez en diferentes escenarios.

[1] Wing, C., Simon, K. y Bello-Gomez, RA (2018). Diseño de estudios de diferencias en diferencias: mejores prácticas para la investigación de políticas de salud pública. Revisión anual de la salud pública, 39453–469.

[2] Callaway, B. y Sant’Anna, PH (2021). Diferencias en diferencias con múltiples períodos de tiempo. Revista de econometría, 225(2), 200–230.

[3] Donald, SG y Lang, K. (2007). Inferencia con diferencias en diferencias y otros datos de panel. La revista de Economía y Estadística, 89(2), 221–233.

¡Gracias por leer!

¡Gracias por leer! 🤗 Si te gustó esta publicación y quieres ver más, considera siguiéndome. También puedes seguirme en LinkedIn. Planeo escribir blogs sobre inferencia causal y análisis de datos, siempre con el objetivo de mantener las cosas simples.

Un pequeño descargo de responsabilidad: escribo para aprender, por lo que pueden ocurrir errores a pesar de mis mejores esfuerzos. Si detecta algún error, hágamelo saber. ¡También acepto sugerencias de nuevos temas!