Estadística

Control Sintético: el grupo de control que no existió

Cuando solo un mercado recibió el cambio, el control sintético arma un control ponderando varios mercados. Cómo calcularlo, validarlo y dónde falla.

Ilustración plana de varias líneas finas que convergen y se funden en una única línea gruesa, que después se separa de una segunda línea y abre una franja sombreada entre las dos

Cuando el cambio alcanzó un solo mercado, no existe grupo de control para comparar, y elegir “el mercado más parecido” es una decisión que cambia el resultado. El control sintético resuelve eso armando el control: una media ponderada de varios mercados, con los pesos elegidos para reproducir el pasado del tratado. En la simulación de esta guía, reprodujo el periodo anterior con error de 0,04061 punto frente a 0,22806 punto del mejor mercado solo, y recuperó un efecto verdadero de 0,31 punto estimando 0,3513. Esta guía muestra cómo armar los pesos, cómo validar el ajuste, cómo calcular el valor-p por permutación, y el límite duro que casi nadie menciona: con pocos mercados, el menor valor-p posible ya nace por encima de 0,05. Forma parte de nuestra guía completa de test A/B y complementa diferencias en diferencias y experimentos geográficos.

El problema del control sintético: un tratado, ningún control obvio

Diferencias en diferencias resuelve el caso en que existe un conjunto de unidades tratadas y un conjunto de controles razonables. Cobra una premisa: la tendencia de los dos lados habría sido la misma.

Solo que muchas cosas ocurren en una sola unidad:

Con una unidad tratada, la pregunta “¿cuál es el control?” deja de tener respuesta obvia. Y es una pregunta cara, porque la elección del control decide el resultado. Con doce mercados candidatos, existen doce respuestas distintas disponibles, y la tentación de elegir la que confirma lo que el equipo ya cree es enorme.

El control sintético cambia la elección por un procedimiento. En vez de elegir un mercado, arma un mercado que no existe: una combinación ponderada de los candidatos, con los pesos elegidos por un criterio declarado antes de mirar el resultado.

Cómo se eligen los pesos

La regla es simple de enunciar. Se busca un conjunto de pesos, uno por mercado donante, tal que:

Las dos primeras restricciones no son un detalle. Garantizan que el sintético sea una media ponderada de cosas que existieron de verdad, y no una extrapolación. Sin ellas, una regresión irrestricta encontraría pesos gigantes y negativos que ajustan el pasado perfectamente y explotan en el futuro.

Cómo se arma el control sintético a partir de mercados donantesDiagrama en tres columnas. En la columna de la izquierda, doce rectángulos apilados representan los mercados donantes disponibles, cada uno con su propia serie. En la columna del medio, una caja describe el criterio de optimización: pesos no negativos, suma de los pesos igual a uno, y minimización del error de ajuste en el periodo anterior al cambio. En la columna de la derecha, una única serie resultante representa el mercado sintético, con la anotación de que no existe en el mundo real y sirve como contrafactual del mercado tratado. Una flecha une las tres columnas de izquierda a derecha, y una nota abajo registra que los pesos se fijan usando solo datos del periodo anterior al cambio, nunca del periodo posterior.El control no se elige, se construye12 mercados donantesninguno de ellos solo sirveelección de los pesos1. todo peso mayor o igual a cero2. suma de los pesos igual a 13. menor error de ajuste posibleen el periodo ANTERIOR al cambioel periodo posterior nunca entra aquímercado sintéticoel contrafactual del tratadono existe en el mundo real,pero está hecho solo de cosas que existieronPeso negativo y suma distinta de 1 darían extrapolación, no media ponderada.Es esa restricción la que impide que el método ajuste el pasado perfectamente y explote en el futuro.El efecto estimado es la distancia entre el tratado y el sintético DESPUÉS del cambio.
Los pesos salen de un criterio fijado antes, usando solo el periodo anterior al cambio. El periodo posterior queda intacto para servir de medida.

Abadie, Diamond y Hainmueller registran por qué esto generaliza diferencias en diferencias. El modelo de diferencias en diferencias, con efectos fijos, admite confusores no observados pero restringe su efecto a ser constante en el tiempo, para que la resta temporal los elimine. El modelo de factores detrás del control sintético permite que el efecto de esos confusores varíe con el tiempo. En la práctica: si tu mercado tratado es más sensible a la estacionalidad de fin de año que la media, diferencias en diferencias no se ocupa de eso y el control sintético sí, eligiendo donantes que comparten esa sensibilidad.

La simulación: 12 donantes, 24 semanas antes, 8 después

Armamos un mercado tratado con estructura de factores conocida y lo comparamos con 12 mercados donantes a lo largo de 24 semanas antes del cambio y 8 semanas después. El efecto verdadero plantado fue de 0,31 punto de conversión.

Una elección importante del diseño: el mercado tratado se construyó a propósito como una mezcla conocida de cuatro donantes (0,35 · 0,25 · 0,30 · 0,10). Es decir, ningún donante solo reproduce al tratado, pero una combinación existe. Es exactamente la situación en la que el método debería brillar, y es común en la vida real, donde un mercado suele ser “un poco de aquí, un poco de allá”.

Las tres lecturas posibles, lado a lado:

lectura error de ajuste en el periodo anterior efecto estimado error contra la verdad
diferencias en diferencias contra la media de los 12 donantes 0,27972 pp 0,2030 pp menos 0,1070 pp
diferencias en diferencias contra el donante más parecido 0,22806 pp 0,3460 pp más 0,0360 pp
control sintético 0,04061 pp 0,3513 pp más 0,0413 pp

Conviene leer esa tabla con honestidad, porque no dice lo que diría un material de ventas. El control sintético no ganó en el error del efecto: el mejor donante solo se equivocó por 0,0360 punto y el sintético se equivocó por 0,0413. En una única realización de ruido, eso pasa.

Lo que el control sintético ganó, y por mucho, fue en el error de ajuste en el periodo anterior: 0,04061 punto contra 0,22806 del mejor donante, una reducción de cerca de cinco veces y media. Y esa es la columna que importa, porque es la única de las tres que puedes observar antes de saber la respuesta. El error del efecto solo es calculable en una simulación donde la verdad es conocida. En la vida real, el ajuste en el periodo anterior es la única señal disponible sobre en cuál de las tres lecturas confiar.

El gap semanal lo deja concreto. En las 24 semanas anteriores, la distancia entre el tratado y el sintético quedó entre menos 0,0924 y más 0,0813 punto, con media de 0,0001. En las 8 semanas posteriores, fue:

semana tras el cambio 1 2 3 4 5 6 7 8
gap (pp) 0,3649 0,3604 0,3643 0,2587 0,3391 0,3423 0,3666 0,4142

Ocho semanas seguidas de gap positivo, todas por encima del techo del periodo anterior. Es ese formato, y no un número único, lo que sostiene la lectura.

Gap semanal entre el mercado tratado y su control sintéticoGráfico de columnas mostrando la diferencia semanal entre el mercado tratado y su control sintético, en puntos porcentuales. A la izquierda de la línea vertical discontinua están las 24 semanas anteriores al cambio, donde las columnas oscilan en torno a cero dentro de una franja sombreada que va de menos 0,0924 a más 0,0813 punto, con media de 0,0001 punto. A la derecha de la línea están las 8 semanas posteriores, todas con columnas positivas y claramente por encima del techo de la franja anterior, con valores de 0,3649, 0,3604, 0,3643, 0,2587, 0,3391, 0,3423, 0,3666 y 0,4142 punto. El efecto verdadero plantado, de 0,31 punto, aparece como una línea horizontal de referencia que atraviesa el periodo posterior.El gap queda pegado a cero por 24 semanas y sube junto con el cambio0+0,25+0,50el cambio entra aquíverdad: +0,3124 semanas antes: franja de menos 0,0924 a más 0,0813 pp, media 0,00018 semanas después: todas positivasAjuste en el periodo anterior: 0,04061 pp de error. Gap medio en el posterior: 0,3513 pp.Es el CONTRASTE entre las dos franjas lo que sostiene la lectura, no la media sola.
Un gap que ya oscilaba antes del cambio no se convierte en efecto después de él. Lo que sostiene la lectura es el silencio de las 24 semanas anteriores.

Los pesos no son un retrato de semejanza

Aquí está el hallazgo más incómodo de nuestra simulación, y el que más discusión ahorra en una reunión.

El mercado tratado fue construido como 0,35 del donante 2, 0,25 del donante 5, 0,30 del donante 9 y 0,10 del donante 11. Esa es la verdad del mundo simulado. Los pesos que el método devolvió:

donante 2 4 6 7 8 9 11 12
peso estimado 0,023 0,196 0,059 0,051 0,290 0,314 0,009 0,057

Ninguna semejanza con la combinación verdadera, salvo el donante 9. El donante 2, que respondía por el 35 por ciento del mercado tratado, salió con peso de 0,023. En cambio, el donante 8, que no entraba en la receta, salió con 0,290.

Y, aun así, el ajuste fue de 0,04061 punto y el efecto estimado quedó en 0,3513 contra la verdad de 0,31.

La conclusión práctica es dura y útil: valida el ajuste, no los pesos. Un control sintético que reproduce el pasado del mercado tratado dentro de un error pequeño sirve como contrafactual, aunque la lista de pesos no cuente ninguna historia bonita sobre “qué mercados se parecen al nuestro”. Cuando alguien en una reunión pregunte “¿por qué México tiene peso alto y Colombia cero?”, la respuesta honesta es que el objetivo del peso es el ajuste de la serie, y que combinaciones distintas pueden ajustar casi igual.

Lo que no se puede hacer es lo inverso: aceptar un sintético con ajuste malo porque la lista de pesos “tiene sentido para el negocio”. Abadie, Diamond y Hainmueller son explícitos al respecto: en algunos casos el ajuste puede ser malo, y ahí no recomiendan usar un control sintético.

El valor-p viene de permutación, y tiene piso

No existe error estándar clásico aquí: hay una unidad tratada. La inferencia se hace por permutación, aplicando el método a cada donante como si él hubiera sido el tratado.

El estadístico usado es la razón entre el error cuadrático medio de predicción después y antes del cambio. La lógica: una unidad genuinamente afectada ajusta bien antes y mal después, así que la razón queda grande. Una unidad que solo ajusta mal en todo tiene razón pequeña, incluso con error grande después.

En nuestra simulación, con 13 unidades en total:

posición unidad razón del error cuadrático después sobre antes
1 tratado 75,9
2 donante 9 4,9
3 donante 12 2,9
4 donante 6 2,2
5 donante 11 2,2

El tratado quedó en primer lugar, con razón quince veces mayor que la del segundo. El valor-p es la posición dividida por el total: 1 dividido por 13, o 0,0769.

Y aquí está el límite que casi ningún material menciona: 0,0769 es el menor valor-p que ese diseño puede producir. Con 13 unidades, ni siquiera un resultado perfecto cruza el corte de 0,05. Si tu comité exige valor-p por debajo de 0,05, está exigiendo, en la práctica, al menos 20 unidades en el grupo donante, porque 1 dividido por 20 es 0,05.

Fue exactamente esa la aritmética del estudio original. Abadie, Diamond y Hainmueller aplicaron el método a la Proposición 99, el programa de control del tabaco que California implantó en 1988, usando datos anuales estatales de 1970 a 2000, con 19 años de periodo anterior. Descartaron del grupo donante los cuatro estados que adoptaron programas propios entre 1989 y 2000 (Massachusetts, Arizona, Oregón y Florida), los siete que subieron impuestos sobre el cigarrillo en 50 centavos o más en el periodo (Alaska, Hawái, Maryland, Míchigan, Nueva Jersey, Nueva York y Washington) y el Distrito de Columbia, quedándose con 38 estados.

La California sintética salió como combinación de cinco estados: Utah con 0,334, Nevada con 0,234, Montana con 0,199, Colorado con 0,164 y Connecticut con 0,069. Todos los demás recibieron peso cero. El ajuste fue bueno: el error cuadrático medio de predicción de California antes de la Proposición 99, entre 1970 y 1988, fue de cerca de 3, contra una mediana de cerca de 6 entre los 38 estados donantes.

El resultado: hacia el año 2000, las ventas anuales de cajetillas de cigarrillos per cápita en California estaban cerca de 26 cajetillas por debajo de lo que habrían sido sin la Proposición 99. Y la inferencia: la razón entre el error cuadrático medio después y antes fue de cerca de 130 veces para California, ningún estado de control llegó a tanto, y la probabilidad de obtener una razón de esa magnitud atribuyendo la intervención al azar es 1 dividido por 39, o 0,026.

Treinta y nueve unidades, valor-p de 0,026. Trece unidades, piso de 0,0769. El grupo donante no es un detalle de implementación, es lo que define si la pregunta puede responderse.

Qué hacer cuando el método dice “no se puede”

Una versión bayesiana y más flexible de esa idea es el modelo de series temporales estructurales de Brodersen, Gallusser, Koehler, Remy y Scott, de Google, que predice el contrafactual con regresión sobre predictores contemporáneos y prior de selección de variables. Ellos listan tres limitaciones de la lectura clásica de diferencias en diferencias que motivan el modelo: suele partir de una regresión estática que asume datos independientes pese al componente temporal del diseño, y cuando se ajusta a datos serialmente correlacionados produce inferencia demasiado optimista con intervalos demasiado estrechos; suele mirar solo dos puntos en el tiempo, cuando el formato del efecto a lo largo del tiempo es justamente lo que interesa; e impone restricciones sobre cómo se arma el control sintético.

El detalle más útil de ese trabajo, para quien necesita convencer a alguien, es la validación. Analizaron una campaña real de Google, seis semanas de anuncios dirigidos a 95 de 190 áreas de mercado sorteadas, y midieron el efecto sobre clics totales. El modelo devolvió 88.400 clics adicionales, un aumento del 22 por ciento con intervalo de credibilidad del 95 por ciento entre 13 y 30 por ciento. La comparación experimental convencional sobre los mismos datos había devuelto 84.700 clics, con intervalo de confianza del 95 por ciento para el efecto relativo entre 19 y 22 por ciento. Es decir: desviación menor que el 5 por ciento entre la lectura contrafactual y la lectura sorteada, con intervalos más anchos en la primera, lo que es esperable.

Esa es la lectura correcta del método. Cuando existe sorteo, él es la referencia. El contrafactual construido llega cerca, con más incertidumbre declarada, y sirve para el caso en que el sorteo no existió.

¿Y si se pudiera sortear?

Siempre vale hacer la cuenta antes de aceptar el cuasi-experimento. Con la base del 4,20 por ciento de nuestro mercado tratado y el mismo efecto de 0,31 punto absoluto que el control sintético estimó, al 95 por ciento de confianza y 80 por ciento de poder:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Devuelve 68.039 visitantes por variación, es decir, 136.078 en total. Con 60.000 visitantes por semana, eso son 16 días. Con 120.000 por semana, 8 días.

Dos semanas de test sorteado, sin premisa de tendencia común, sin grupo donante, sin piso de valor-p. Contra ocho semanas de espera y 12 mercados donantes para llegar a un valor-p de 0,0769. Siempre que el cambio quepa en un sorteo de usuario, esa comparación decide sola. El control sintético existe para cuando no cabe.

Ruta de control sintético en siete pasos

  1. Declara la fecha de corte y la métrica antes de mirar el después. En el plan de análisis preregistrado, igual que en cualquier test.
  2. Arma el grupo donante excluyendo a quien fue contaminado. Todo mercado que recibió el mismo cambio, un cambio parecido o un choque propio en el periodo sale del grupo. Fue lo que hicieron Abadie, Diamond y Hainmueller al sacar 12 unidades del grupo donante antes de empezar.
  3. Usa un periodo anterior largo. Veinticuatro semanas en nuestra simulación, 19 años en el estudio de California. Un periodo anterior corto ajusta cualquier cosa y no prueba nada.
  4. Ajusta los pesos SOLO con datos del periodo anterior. Si el periodo posterior toca la optimización, el resultado deja de ser una medida y se convierte en una descripción.
  5. Reporta el error de ajuste del periodo anterior junto al efecto. Siempre. Un efecto sin ajuste declarado no es interpretable.
  6. Corre la permutación sobre todos los donantes y di el piso del valor-p. “Posición 1 de 13, valor-p 0,0769, y 0,0769 es el mínimo posible con 13 unidades” es una frase completa.
  7. Publica el gap semanal, no la media. Ocho semanas de gap positivo cuentan una historia que una media no cuenta.

Errores comunes

Haz esto automático con Donnu

El control sintético solo es posible cuando existe serie histórica por unidad, con la misma definición de métrica, cubriendo bastante tiempo antes del cambio. Ahí es donde la mayoría de las operaciones se traba: el panel guarda el total del sitio por día, no la métrica por mercado por día, y cuando la pregunta aparece ya no se puede reconstruir el pasado.

Donnu guarda el resultado por unidad y por día con la definición sellada, lo que preserva la posibilidad de hacer esa lectura en el futuro incluso para un cambio que nadie planeó medir. Y, como siempre, existe primero para el caso en que el sorteo cabe: antes de armar grupo donante y permutación, haz la cuenta en la calculadora de tamaño de muestra. Si el test sorteado cabe en dos semanas, responde la misma pregunta sin ninguna de las premisas de este artículo.

Referencias

Lee también: Diferencias en diferencias · Experimentos geográficos · Aleatorización por cluster · Meta-análisis de tests A/B · Plan de análisis preregistrado · Calculadora de tamaño de muestra · Leia em português

Preguntas frecuentes

¿Qué es el control sintético?
Es un método para medir el efecto de un cambio que alcanzó UNA sola unidad, por ejemplo un mercado, un país o una tienda. En vez de elegir un control real, arma un control artificial como media ponderada de varias unidades no tratadas, con los pesos elegidos para reproducir la serie de la unidad tratada en el periodo ANTERIOR al cambio.
¿Cuál es la diferencia entre control sintético y diferencias en diferencias?
Diferencias en diferencias exige que la unidad tratada y el control tengan la misma tendencia, y elimina solo efectos de confusores que sean constantes en el tiempo. Abadie, Diamond y Hainmueller muestran que el control sintético generaliza ese modelo al permitir que el efecto de factores no observados VARÍE en el tiempo. En la simulación de esta guía, eso llevó el error de ajuste en el periodo anterior de 0,27972 punto a 0,04061 punto.
¿Cómo se sabe si un control sintético es fiable?
Por el ajuste en el periodo anterior al cambio, medido por la raíz del error cuadrático medio de predicción. Si el sintético no reproduce el pasado de la unidad tratada, no va a predecir su presente. Abadie, Diamond y Hainmueller son explícitos: cuando el ajuste es malo, no recomiendan usar un control sintético.
¿Cómo se calcula el valor-p de un control sintético?
Por permutación: se aplica el mismo método a cada unidad del grupo donante como si hubiera sido tratada, y se compara la razón entre el error cuadrático medio después y antes. En el estudio de la Proposición 99 de California, esa razón fue cerca de 130 veces para California, ningún estado de control se acercó, y la probabilidad de obtener algo tan grande atribuyendo la intervención al azar es 1 dividido por 39, o 0,026.
¿Cuántas unidades donantes hacen falta?
El piso del valor-p es 1 dividido por el número de unidades del ejercicio de permutación. Con 13 unidades, como en la simulación de esta guía, el menor valor-p posible es 0,0769, por encima del corte habitual de 0,05, por bueno que sea el resultado. Con 39 unidades, como en el estudio de California, el piso baja a 0,026.
¿Los pesos del control sintético dicen qué mercados se parecen al tratado?
No necesariamente. En la simulación de esta guía, el mercado tratado se construyó como una mezcla conocida de cuatro donantes y el método devolvió un conjunto de pesos bastante distinto, y aun así reprodujo el periodo anterior con error de 0,04061 punto y recuperó el efecto. Lo que se valida es el AJUSTE de la serie, no la interpretación de cada peso individual.