Control Sintético: el grupo de control que no existió
Cuando solo un mercado recibió el cambio, el control sintético arma un control ponderando varios mercados. Cómo calcularlo, validarlo y dónde falla.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Cuando el cambio alcanzó un solo mercado, no existe grupo de control para comparar, y elegir “el mercado más parecido” es una decisión que cambia el resultado. El control sintético resuelve eso armando el control: una media ponderada de varios mercados, con los pesos elegidos para reproducir el pasado del tratado. En la simulación de esta guía, reprodujo el periodo anterior con error de 0,04061 punto frente a 0,22806 punto del mejor mercado solo, y recuperó un efecto verdadero de 0,31 punto estimando 0,3513. Esta guía muestra cómo armar los pesos, cómo validar el ajuste, cómo calcular el valor-p por permutación, y el límite duro que casi nadie menciona: con pocos mercados, el menor valor-p posible ya nace por encima de 0,05. Forma parte de nuestra guía completa de test A/B y complementa diferencias en diferencias y experimentos geográficos.
El problema del control sintético: un tratado, ningún control obvio
Diferencias en diferencias resuelve el caso en que existe un conjunto de unidades tratadas y un conjunto de controles razonables. Cobra una premisa: la tendencia de los dos lados habría sido la misma.
Solo que muchas cosas ocurren en una sola unidad:
- el precio cambió en Brasil, y solo en Brasil
- la nueva página de planes salió primero para el mercado de Estados Unidos
- una tienda física piloto recibió el nuevo layout
- la integración con un medio de pago local existe en un solo país
Con una unidad tratada, la pregunta “¿cuál es el control?” deja de tener respuesta obvia. Y es una pregunta cara, porque la elección del control decide el resultado. Con doce mercados candidatos, existen doce respuestas distintas disponibles, y la tentación de elegir la que confirma lo que el equipo ya cree es enorme.
El control sintético cambia la elección por un procedimiento. En vez de elegir un mercado, arma un mercado que no existe: una combinación ponderada de los candidatos, con los pesos elegidos por un criterio declarado antes de mirar el resultado.
Cómo se eligen los pesos
La regla es simple de enunciar. Se busca un conjunto de pesos, uno por mercado donante, tal que:
- todos los pesos sean mayores o iguales a cero, es decir, nada de peso negativo
- la suma de los pesos sea exactamente 1
- la serie ponderada reproduzca de la mejor forma posible la serie del mercado tratado en el periodo ANTERIOR al cambio
Las dos primeras restricciones no son un detalle. Garantizan que el sintético sea una media ponderada de cosas que existieron de verdad, y no una extrapolación. Sin ellas, una regresión irrestricta encontraría pesos gigantes y negativos que ajustan el pasado perfectamente y explotan en el futuro.
Abadie, Diamond y Hainmueller registran por qué esto generaliza diferencias en diferencias. El modelo de diferencias en diferencias, con efectos fijos, admite confusores no observados pero restringe su efecto a ser constante en el tiempo, para que la resta temporal los elimine. El modelo de factores detrás del control sintético permite que el efecto de esos confusores varíe con el tiempo. En la práctica: si tu mercado tratado es más sensible a la estacionalidad de fin de año que la media, diferencias en diferencias no se ocupa de eso y el control sintético sí, eligiendo donantes que comparten esa sensibilidad.
La simulación: 12 donantes, 24 semanas antes, 8 después
Armamos un mercado tratado con estructura de factores conocida y lo comparamos con 12 mercados donantes a lo largo de 24 semanas antes del cambio y 8 semanas después. El efecto verdadero plantado fue de 0,31 punto de conversión.
Una elección importante del diseño: el mercado tratado se construyó a propósito como una mezcla conocida de cuatro donantes (0,35 · 0,25 · 0,30 · 0,10). Es decir, ningún donante solo reproduce al tratado, pero una combinación existe. Es exactamente la situación en la que el método debería brillar, y es común en la vida real, donde un mercado suele ser “un poco de aquí, un poco de allá”.
Las tres lecturas posibles, lado a lado:
| lectura | error de ajuste en el periodo anterior | efecto estimado | error contra la verdad |
|---|---|---|---|
| diferencias en diferencias contra la media de los 12 donantes | 0,27972 pp | 0,2030 pp | menos 0,1070 pp |
| diferencias en diferencias contra el donante más parecido | 0,22806 pp | 0,3460 pp | más 0,0360 pp |
| control sintético | 0,04061 pp | 0,3513 pp | más 0,0413 pp |
Conviene leer esa tabla con honestidad, porque no dice lo que diría un material de ventas. El control sintético no ganó en el error del efecto: el mejor donante solo se equivocó por 0,0360 punto y el sintético se equivocó por 0,0413. En una única realización de ruido, eso pasa.
Lo que el control sintético ganó, y por mucho, fue en el error de ajuste en el periodo anterior: 0,04061 punto contra 0,22806 del mejor donante, una reducción de cerca de cinco veces y media. Y esa es la columna que importa, porque es la única de las tres que puedes observar antes de saber la respuesta. El error del efecto solo es calculable en una simulación donde la verdad es conocida. En la vida real, el ajuste en el periodo anterior es la única señal disponible sobre en cuál de las tres lecturas confiar.
El gap semanal lo deja concreto. En las 24 semanas anteriores, la distancia entre el tratado y el sintético quedó entre menos 0,0924 y más 0,0813 punto, con media de 0,0001. En las 8 semanas posteriores, fue:
| semana tras el cambio | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
|---|---|---|---|---|---|---|---|---|
| gap (pp) | 0,3649 | 0,3604 | 0,3643 | 0,2587 | 0,3391 | 0,3423 | 0,3666 | 0,4142 |
Ocho semanas seguidas de gap positivo, todas por encima del techo del periodo anterior. Es ese formato, y no un número único, lo que sostiene la lectura.
Los pesos no son un retrato de semejanza
Aquí está el hallazgo más incómodo de nuestra simulación, y el que más discusión ahorra en una reunión.
El mercado tratado fue construido como 0,35 del donante 2, 0,25 del donante 5, 0,30 del donante 9 y 0,10 del donante 11. Esa es la verdad del mundo simulado. Los pesos que el método devolvió:
| donante | 2 | 4 | 6 | 7 | 8 | 9 | 11 | 12 |
|---|---|---|---|---|---|---|---|---|
| peso estimado | 0,023 | 0,196 | 0,059 | 0,051 | 0,290 | 0,314 | 0,009 | 0,057 |
Ninguna semejanza con la combinación verdadera, salvo el donante 9. El donante 2, que respondía por el 35 por ciento del mercado tratado, salió con peso de 0,023. En cambio, el donante 8, que no entraba en la receta, salió con 0,290.
Y, aun así, el ajuste fue de 0,04061 punto y el efecto estimado quedó en 0,3513 contra la verdad de 0,31.
La conclusión práctica es dura y útil: valida el ajuste, no los pesos. Un control sintético que reproduce el pasado del mercado tratado dentro de un error pequeño sirve como contrafactual, aunque la lista de pesos no cuente ninguna historia bonita sobre “qué mercados se parecen al nuestro”. Cuando alguien en una reunión pregunte “¿por qué México tiene peso alto y Colombia cero?”, la respuesta honesta es que el objetivo del peso es el ajuste de la serie, y que combinaciones distintas pueden ajustar casi igual.
Lo que no se puede hacer es lo inverso: aceptar un sintético con ajuste malo porque la lista de pesos “tiene sentido para el negocio”. Abadie, Diamond y Hainmueller son explícitos al respecto: en algunos casos el ajuste puede ser malo, y ahí no recomiendan usar un control sintético.
El valor-p viene de permutación, y tiene piso
No existe error estándar clásico aquí: hay una unidad tratada. La inferencia se hace por permutación, aplicando el método a cada donante como si él hubiera sido el tratado.
El estadístico usado es la razón entre el error cuadrático medio de predicción después y antes del cambio. La lógica: una unidad genuinamente afectada ajusta bien antes y mal después, así que la razón queda grande. Una unidad que solo ajusta mal en todo tiene razón pequeña, incluso con error grande después.
En nuestra simulación, con 13 unidades en total:
| posición | unidad | razón del error cuadrático después sobre antes |
|---|---|---|
| 1 | tratado | 75,9 |
| 2 | donante 9 | 4,9 |
| 3 | donante 12 | 2,9 |
| 4 | donante 6 | 2,2 |
| 5 | donante 11 | 2,2 |
El tratado quedó en primer lugar, con razón quince veces mayor que la del segundo. El valor-p es la posición dividida por el total: 1 dividido por 13, o 0,0769.
Y aquí está el límite que casi ningún material menciona: 0,0769 es el menor valor-p que ese diseño puede producir. Con 13 unidades, ni siquiera un resultado perfecto cruza el corte de 0,05. Si tu comité exige valor-p por debajo de 0,05, está exigiendo, en la práctica, al menos 20 unidades en el grupo donante, porque 1 dividido por 20 es 0,05.
Fue exactamente esa la aritmética del estudio original. Abadie, Diamond y Hainmueller aplicaron el método a la Proposición 99, el programa de control del tabaco que California implantó en 1988, usando datos anuales estatales de 1970 a 2000, con 19 años de periodo anterior. Descartaron del grupo donante los cuatro estados que adoptaron programas propios entre 1989 y 2000 (Massachusetts, Arizona, Oregón y Florida), los siete que subieron impuestos sobre el cigarrillo en 50 centavos o más en el periodo (Alaska, Hawái, Maryland, Míchigan, Nueva Jersey, Nueva York y Washington) y el Distrito de Columbia, quedándose con 38 estados.
La California sintética salió como combinación de cinco estados: Utah con 0,334, Nevada con 0,234, Montana con 0,199, Colorado con 0,164 y Connecticut con 0,069. Todos los demás recibieron peso cero. El ajuste fue bueno: el error cuadrático medio de predicción de California antes de la Proposición 99, entre 1970 y 1988, fue de cerca de 3, contra una mediana de cerca de 6 entre los 38 estados donantes.
El resultado: hacia el año 2000, las ventas anuales de cajetillas de cigarrillos per cápita en California estaban cerca de 26 cajetillas por debajo de lo que habrían sido sin la Proposición 99. Y la inferencia: la razón entre el error cuadrático medio después y antes fue de cerca de 130 veces para California, ningún estado de control llegó a tanto, y la probabilidad de obtener una razón de esa magnitud atribuyendo la intervención al azar es 1 dividido por 39, o 0,026.
Treinta y nueve unidades, valor-p de 0,026. Trece unidades, piso de 0,0769. El grupo donante no es un detalle de implementación, es lo que define si la pregunta puede responderse.
Qué hacer cuando el método dice “no se puede”
Una versión bayesiana y más flexible de esa idea es el modelo de series temporales estructurales de Brodersen, Gallusser, Koehler, Remy y Scott, de Google, que predice el contrafactual con regresión sobre predictores contemporáneos y prior de selección de variables. Ellos listan tres limitaciones de la lectura clásica de diferencias en diferencias que motivan el modelo: suele partir de una regresión estática que asume datos independientes pese al componente temporal del diseño, y cuando se ajusta a datos serialmente correlacionados produce inferencia demasiado optimista con intervalos demasiado estrechos; suele mirar solo dos puntos en el tiempo, cuando el formato del efecto a lo largo del tiempo es justamente lo que interesa; e impone restricciones sobre cómo se arma el control sintético.
El detalle más útil de ese trabajo, para quien necesita convencer a alguien, es la validación. Analizaron una campaña real de Google, seis semanas de anuncios dirigidos a 95 de 190 áreas de mercado sorteadas, y midieron el efecto sobre clics totales. El modelo devolvió 88.400 clics adicionales, un aumento del 22 por ciento con intervalo de credibilidad del 95 por ciento entre 13 y 30 por ciento. La comparación experimental convencional sobre los mismos datos había devuelto 84.700 clics, con intervalo de confianza del 95 por ciento para el efecto relativo entre 19 y 22 por ciento. Es decir: desviación menor que el 5 por ciento entre la lectura contrafactual y la lectura sorteada, con intervalos más anchos en la primera, lo que es esperable.
Esa es la lectura correcta del método. Cuando existe sorteo, él es la referencia. El contrafactual construido llega cerca, con más incertidumbre declarada, y sirve para el caso en que el sorteo no existió.
¿Y si se pudiera sortear?
Siempre vale hacer la cuenta antes de aceptar el cuasi-experimento. Con la base del 4,20 por ciento de nuestro mercado tratado y el mismo efecto de 0,31 punto absoluto que el control sintético estimó, al 95 por ciento de confianza y 80 por ciento de poder:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Devuelve 68.039 visitantes por variación, es decir, 136.078 en total. Con 60.000 visitantes por semana, eso son 16 días. Con 120.000 por semana, 8 días.
Dos semanas de test sorteado, sin premisa de tendencia común, sin grupo donante, sin piso de valor-p. Contra ocho semanas de espera y 12 mercados donantes para llegar a un valor-p de 0,0769. Siempre que el cambio quepa en un sorteo de usuario, esa comparación decide sola. El control sintético existe para cuando no cabe.
Ruta de control sintético en siete pasos
- Declara la fecha de corte y la métrica antes de mirar el después. En el plan de análisis preregistrado, igual que en cualquier test.
- Arma el grupo donante excluyendo a quien fue contaminado. Todo mercado que recibió el mismo cambio, un cambio parecido o un choque propio en el periodo sale del grupo. Fue lo que hicieron Abadie, Diamond y Hainmueller al sacar 12 unidades del grupo donante antes de empezar.
- Usa un periodo anterior largo. Veinticuatro semanas en nuestra simulación, 19 años en el estudio de California. Un periodo anterior corto ajusta cualquier cosa y no prueba nada.
- Ajusta los pesos SOLO con datos del periodo anterior. Si el periodo posterior toca la optimización, el resultado deja de ser una medida y se convierte en una descripción.
- Reporta el error de ajuste del periodo anterior junto al efecto. Siempre. Un efecto sin ajuste declarado no es interpretable.
- Corre la permutación sobre todos los donantes y di el piso del valor-p. “Posición 1 de 13, valor-p 0,0769, y 0,0769 es el mínimo posible con 13 unidades” es una frase completa.
- Publica el gap semanal, no la media. Ocho semanas de gap positivo cuentan una historia que una media no cuenta.
Errores comunes
- Aceptar un efecto sin mirar el ajuste del periodo anterior. Es el error central. Un sintético que no reproduce el pasado no predice el presente.
- Interpretar los pesos como semejanza de negocio. En nuestra simulación, el donante que respondía por el 35 por ciento de la receta verdadera del tratado salió con peso de 0,023 y el resultado quedó bien igualmente.
- Dejar en el grupo donante un mercado que también fue tratado. Eso contamina el contrafactual y empuja el efecto estimado hacia cero.
- Comparar el valor-p con 0,05 sin comprobar el piso. Con pocos donantes, el corte es inalcanzable por construcción, no por falta de efecto.
- Usar un periodo anterior corto. Con pocas semanas antes, cualquier combinación ajusta, y la permutación pierde poder de separar tratado de donante.
- Ignorar que el efecto puede ser un choque propio. Un evento local que alcanzó solo al mercado tratado en la misma semana produce exactamente el mismo gráfico. Eso es lo que la permutación intenta detectar, y por eso no es opcional.
- Tratar el resultado como equivalente al de un sorteo. En el trabajo de Brodersen y coautores, la lectura contrafactual coincidió con la sorteada dentro del 5 por ciento, pero con intervalos más anchos. Más incertidumbre es el precio, y debe aparecer en el informe.
- Olvidar que el efecto es de UNA unidad. Lo que se midió fue el efecto en aquel mercado, en aquel periodo. Extrapolar a los otros 12 es una decisión de negocio, no un resultado estadístico, y vale la misma cautela del efecto heterogéneo por segmento.
Haz esto automático con Donnu
El control sintético solo es posible cuando existe serie histórica por unidad, con la misma definición de métrica, cubriendo bastante tiempo antes del cambio. Ahí es donde la mayoría de las operaciones se traba: el panel guarda el total del sitio por día, no la métrica por mercado por día, y cuando la pregunta aparece ya no se puede reconstruir el pasado.
Donnu guarda el resultado por unidad y por día con la definición sellada, lo que preserva la posibilidad de hacer esa lectura en el futuro incluso para un cambio que nadie planeó medir. Y, como siempre, existe primero para el caso en que el sorteo cabe: antes de armar grupo donante y permutación, haz la cuenta en la calculadora de tamaño de muestra. Si el test sorteado cabe en dos semanas, responde la misma pregunta sin ninguna de las premisas de este artículo.
Referencias
- Abadie, A., Diamond, A. y Hainmueller, J. Synthetic Control Methods for Comparative Case Studies: Estimating the Effect of California’s Tobacco Control Program. Journal of the American Statistical Association 105(490), 2010. Fuente de que el modelo de factores detrás del control sintético generaliza el modelo de diferencias en diferencias al permitir que el efecto de confusores no observados varíe en el tiempo, en vez de restringirlo a ser constante; de la recomendación explícita de no usar un control sintético cuando el ajuste es malo; del diseño del estudio de la Proposición 99 con datos anuales estatales de 1970 a 2000 y 19 años de periodo anterior; de las exclusiones del grupo donante (Massachusetts, Arizona, Oregón y Florida por programas propios, y Alaska, Hawái, Maryland, Míchigan, Nueva Jersey, Nueva York y Washington por aumentos de impuesto de 50 centavos o más, además del Distrito de Columbia), dejando 38 estados; de los pesos de la California sintética (Utah 0,334, Nevada 0,234, Montana 0,199, Colorado 0,164 y Connecticut 0,069, con cero para todos los demás); del error cuadrático medio de predicción de cerca de 3 para California entre 1970 y 1988 contra mediana de cerca de 6 en el grupo donante; de la estimación de cerca de 26 cajetillas per cápita menos hacia el año 2000; y de la inferencia por permutación con razón de error cuadrático de cerca de 130 veces y probabilidad de 1 dividido por 39, igual a 0,026. law.upenn.edu.
- Brodersen, K. H., Gallusser, F., Koehler, J., Remy, N. y Scott, S. L. Inferring Causal Impact Using Bayesian Structural Time-Series Models. The Annals of Applied Statistics 9(1), 2015, Google. Fuente de las tres limitaciones señaladas en la lectura clásica de diferencias en diferencias (regresión estática que asume datos independientes pese al componente temporal, produciendo inferencia demasiado optimista con intervalos demasiado estrechos cuando hay correlación serial; uso de solo dos puntos en el tiempo cuando el formato del efecto importa; y restricciones impuestas sobre la construcción del control sintético); y de la validación empírica con una campaña de seis semanas dirigida a 95 de 190 áreas de mercado sorteadas, en la que el modelo devolvió 88.400 clics adicionales, aumento del 22 por ciento con intervalo de credibilidad del 95 por ciento entre 13 y 30 por ciento, contra 84.700 clics e intervalo de 19 a 22 por ciento de la comparación experimental convencional, es decir, desviación menor que el 5 por ciento con intervalos más anchos. research.google.com.
- Bertrand, M., Duflo, E. y Mullainathan, S. How Much Should We Trust Differences-in-Differences Estimates? NBER Working Paper 8841, 2002. Fuente de la recomendación de inferencia basada en tests de aleatorización, que usa la distribución empírica de los efectos estimados para intervenciones ficticias como distribución de referencia, y que funciona bien independientemente del tamaño de la muestra, principio que sostiene la permutación usada en el control sintético. nber.org.
- Blake, T., Nosko, C. y Tadelis, S. Consumer Heterogeneity and Paid Search Effectiveness: A Large Scale Field Experiment. NBER Working Paper 20171, 2014. Fuente del contraste entre lecturas observacionales y experimentales sobre el mismo fenómeno: retorno sobre inversión por encima del 4.100 por ciento por mínimos cuadrados ordinarios y menos 63 por ciento por la variación experimental, con intervalo de confianza del 95 por ciento entre menos 124 y menos 3 por ciento. nber.org.
Lee también: Diferencias en diferencias · Experimentos geográficos · Aleatorización por cluster · Meta-análisis de tests A/B · Plan de análisis preregistrado · Calculadora de tamaño de muestra · Leia em português
Preguntas frecuentes
- ¿Qué es el control sintético?
- Es un método para medir el efecto de un cambio que alcanzó UNA sola unidad, por ejemplo un mercado, un país o una tienda. En vez de elegir un control real, arma un control artificial como media ponderada de varias unidades no tratadas, con los pesos elegidos para reproducir la serie de la unidad tratada en el periodo ANTERIOR al cambio.
- ¿Cuál es la diferencia entre control sintético y diferencias en diferencias?
- Diferencias en diferencias exige que la unidad tratada y el control tengan la misma tendencia, y elimina solo efectos de confusores que sean constantes en el tiempo. Abadie, Diamond y Hainmueller muestran que el control sintético generaliza ese modelo al permitir que el efecto de factores no observados VARÍE en el tiempo. En la simulación de esta guía, eso llevó el error de ajuste en el periodo anterior de 0,27972 punto a 0,04061 punto.
- ¿Cómo se sabe si un control sintético es fiable?
- Por el ajuste en el periodo anterior al cambio, medido por la raíz del error cuadrático medio de predicción. Si el sintético no reproduce el pasado de la unidad tratada, no va a predecir su presente. Abadie, Diamond y Hainmueller son explícitos: cuando el ajuste es malo, no recomiendan usar un control sintético.
- ¿Cómo se calcula el valor-p de un control sintético?
- Por permutación: se aplica el mismo método a cada unidad del grupo donante como si hubiera sido tratada, y se compara la razón entre el error cuadrático medio después y antes. En el estudio de la Proposición 99 de California, esa razón fue cerca de 130 veces para California, ningún estado de control se acercó, y la probabilidad de obtener algo tan grande atribuyendo la intervención al azar es 1 dividido por 39, o 0,026.
- ¿Cuántas unidades donantes hacen falta?
- El piso del valor-p es 1 dividido por el número de unidades del ejercicio de permutación. Con 13 unidades, como en la simulación de esta guía, el menor valor-p posible es 0,0769, por encima del corte habitual de 0,05, por bueno que sea el resultado. Con 39 unidades, como en el estudio de California, el piso baja a 0,026.
- ¿Los pesos del control sintético dicen qué mercados se parecen al tratado?
- No necesariamente. En la simulación de esta guía, el mercado tratado se construyó como una mezcla conocida de cuatro donantes y el método devolvió un conjunto de pesos bastante distinto, y aun así reprodujo el periodo anterior con error de 0,04061 punto y recuperó el efecto. Lo que se valida es el AJUSTE de la serie, no la interpretación de cada peso individual.