Estatística

Controle Sintético: o grupo de controle que não existiu

Quando só um mercado recebeu a mudança, o controle sintético monta um controle pesando vários mercados. Como calcular, como validar e onde ele falha.

Ilustração plana de várias linhas finas que convergem e se fundem numa única linha grossa, que depois se separa de uma segunda linha e abre uma faixa sombreada entre as duas

Quando a mudança atingiu um mercado só, não existe grupo de controle para comparar, e escolher “o mercado mais parecido” é uma decisão que muda o resultado. O controle sintético resolve isso montando o controle: uma média ponderada de vários mercados, com os pesos escolhidos para reproduzir o passado do tratado. Na simulação deste guia, ele reproduziu o período anterior com erro de 0,04061 ponto contra 0,22806 ponto do melhor mercado sozinho, e recuperou um efeito verdadeiro de 0,31 ponto estimando 0,3513. Este guia mostra como montar os pesos, como validar o ajuste, como calcular o valor-p por permutação, e o limite duro que quase ninguém menciona: com poucos mercados, o menor valor-p possível já nasce acima de 0,05. Faz parte do nosso guia completo de teste A/B e complementa diferenças em diferenças e experimentos geográficos.

O problema do controle sintético: um tratado, nenhum controle óbvio

Diferenças em diferenças resolve o caso em que existe um conjunto de unidades tratadas e um conjunto de controles razoáveis. Ele cobra uma premissa: a tendência dos dois lados teria sido a mesma.

Só que muita coisa acontece em uma unidade só:

Com uma unidade tratada, a pergunta “qual é o controle?” deixa de ter resposta óbvia. E ela é uma pergunta cara, porque a escolha do controle decide o resultado. Com doze mercados candidatos, existem doze respostas diferentes disponíveis, e a tentação de escolher a que confirma o que o time já acha é enorme.

O controle sintético troca a escolha por um procedimento. Em vez de eleger um mercado, ele monta um mercado que não existe: uma combinação ponderada dos candidatos, com os pesos escolhidos por um critério declarado antes de olhar para o resultado.

Como os pesos são escolhidos

A regra é simples de enunciar. Procura-se um conjunto de pesos, um por mercado doador, tal que:

As duas primeiras restrições não são detalhe. Elas garantem que o sintético seja uma média ponderada de coisas que existiram de verdade, e não uma extrapolação. Sem elas, uma regressão irrestrita acharia pesos gigantes e negativos que ajustam o passado perfeitamente e explodem no futuro.

Como o controle sintético é montado a partir de mercados doadoresDiagrama em três colunas. Na coluna da esquerda, doze retângulos empilhados representam os mercados doadores disponíveis, cada um com sua própria série. Na coluna do meio, uma caixa descreve o critério de otimização: pesos não negativos, soma dos pesos igual a um, e minimização do erro de ajuste no período anterior à mudança. Na coluna da direita, uma única série resultante representa o mercado sintético, com a anotação de que ele não existe no mundo real e serve como contrafactual do mercado tratado. Uma seta liga as três colunas da esquerda para a direita, e uma nota embaixo registra que os pesos são fixados usando apenas dados do período anterior à mudança, nunca do período posterior.O controle não é escolhido, é construído12 mercados doadoresnenhum deles sozinho serveescolha dos pesos1. todo peso maior ou igual a zero2. soma dos pesos igual a 13. menor erro de ajuste possívelno período ANTERIOR à mudançao período posterior nunca entra aquimercado sintéticoo contrafactual do tratadonão existe no mundo real,mas é feito só de coisas que existiramPeso negativo e soma diferente de 1 dariam extrapolação, não média ponderada.É essa restrição que impede o método de ajustar o passado perfeitamente e explodir no futuro.O efeito estimado é a distância entre o tratado e o sintético DEPOIS da mudança.
Os pesos saem de um critério fixado antes, usando apenas o período anterior à mudança. O período posterior fica intocado para servir de medida.

Abadie, Diamond e Hainmueller registram por que isso generaliza diferenças em diferenças. O modelo de diferenças em diferenças, com efeitos fixos, admite confundidores não observados mas restringe o efeito deles a ser constante no tempo, para que a subtração temporal os elimine. O modelo de fatores por trás do controle sintético permite que o efeito desses confundidores varie com o tempo. Na prática: se o seu mercado tratado é mais sensível a sazonalidade de fim de ano que a média, diferenças em diferenças não trata disso e o controle sintético trata, escolhendo doadores que compartilham essa sensibilidade.

A simulação: 12 doadores, 24 semanas antes, 8 depois

Montamos um mercado tratado com estrutura de fatores conhecida e o comparamos com 12 mercados doadores ao longo de 24 semanas antes da mudança e 8 semanas depois. O efeito verdadeiro plantado foi de 0,31 ponto de conversão.

Uma escolha importante do desenho: o mercado tratado foi construído de propósito como uma mistura conhecida de quatro doadores (0,35 · 0,25 · 0,30 · 0,10). Ou seja, nenhum doador sozinho reproduz o tratado, mas uma combinação existe. É exatamente a situação em que o método deveria brilhar, e é comum na vida real, onde um mercado costuma ser “um pouco daqui, um pouco dali”.

As três leituras possíveis, lado a lado:

leitura erro de ajuste no período anterior efeito estimado erro contra a verdade
diferenças em diferenças contra a média dos 12 doadores 0,27972 pp 0,2030 pp menos 0,1070 pp
diferenças em diferenças contra o doador mais parecido 0,22806 pp 0,3460 pp mais 0,0360 pp
controle sintético 0,04061 pp 0,3513 pp mais 0,0413 pp

Vale ler essa tabela com honestidade, porque ela não diz o que um material de vendas diria. O controle sintético não ganhou no erro do efeito: o melhor doador sozinho errou por 0,0360 ponto e o sintético errou por 0,0413. Numa única realização de ruído, isso acontece.

O que o controle sintético ganhou, e por muito, foi no erro de ajuste no período anterior: 0,04061 ponto contra 0,22806 do melhor doador, uma redução de cerca de cinco vezes e meia. E essa é a coluna que importa, porque é a única das três que você consegue observar antes de saber a resposta. O erro do efeito só é calculável numa simulação onde a verdade é conhecida. Na vida real, o ajuste no período anterior é o único sinal disponível sobre em qual das três leituras confiar.

O gap semanal deixa isso concreto. Nas 24 semanas anteriores, a distância entre o tratado e o sintético ficou entre menos 0,0924 e mais 0,0813 ponto, com média de 0,0001. Nas 8 semanas posteriores, ela foi:

semana após a mudança 1 2 3 4 5 6 7 8
gap (pp) 0,3649 0,3604 0,3643 0,2587 0,3391 0,3423 0,3666 0,4142

Oito semanas seguidas de gap positivo, todas acima do teto do período anterior. É esse formato, e não um número único, que sustenta a leitura.

Gap semanal entre o mercado tratado e o seu controle sintéticoGráfico de colunas mostrando a diferença semanal entre o mercado tratado e o seu controle sintético, em pontos percentuais. À esquerda da linha vertical tracejada estão as 24 semanas anteriores à mudança, onde as colunas oscilam em torno de zero dentro de uma faixa sombreada que vai de menos 0,0924 a mais 0,0813 ponto, com média de 0,0001 ponto. À direita da linha estão as 8 semanas posteriores, todas com colunas positivas e claramente acima do teto da faixa anterior, com valores de 0,3649, 0,3604, 0,3643, 0,2587, 0,3391, 0,3423, 0,3666 e 0,4142 ponto. O efeito verdadeiro plantado, de 0,31 ponto, aparece como uma linha horizontal de referência atravessando o período posterior.O gap fica colado em zero por 24 semanas e sobe junto com a mudança0+0,25+0,50mudança entra aquiverdade: +0,3124 semanas antes: faixa de menos 0,0924 a mais 0,0813 pp, média 0,00018 semanas depois: todas positivasAjuste no período anterior: 0,04061 pp de erro. Gap médio no posterior: 0,3513 pp.É o CONTRASTE entre as duas faixas que sustenta a leitura, não a média sozinha.
Um gap que já oscilava antes da mudança não vira efeito depois dela. O que sustenta a leitura é o silêncio das 24 semanas anteriores.

Os pesos não são um retrato de semelhança

Aqui está o achado mais desconfortável da nossa simulação, e o que mais economiza discussão em reunião.

O mercado tratado foi construído como 0,35 do doador 2, 0,25 do doador 5, 0,30 do doador 9 e 0,10 do doador 11. Essa é a verdade do mundo simulado. Os pesos que o método devolveu:

doador 2 4 6 7 8 9 11 12
peso estimado 0,023 0,196 0,059 0,051 0,290 0,314 0,009 0,057

Nenhuma semelhança com a combinação verdadeira, tirando o doador 9. O doador 2, que respondia por 35 por cento do mercado tratado, saiu com peso de 0,023. Em compensação, o doador 8, que não entrava na receita, saiu com 0,290.

E, ainda assim, o ajuste foi de 0,04061 ponto e o efeito estimado ficou em 0,3513 contra a verdade de 0,31.

A conclusão prática é dura e útil: valide o ajuste, não os pesos. Um controle sintético que reproduz o passado do mercado tratado dentro de um erro pequeno serve como contrafactual, mesmo que a lista de pesos não conte nenhuma história bonita sobre “quais mercados se parecem com o nosso”. Quando alguém em reunião perguntar “por que o México tem peso alto e a Colômbia zero?”, a resposta honesta é que o objetivo do peso é o ajuste da série, e que combinações diferentes podem ajustar quase igual.

O que não se pode fazer é o inverso: aceitar um sintético com ajuste ruim porque a lista de pesos “faz sentido para o negócio”. Abadie, Diamond e Hainmueller são explícitos sobre isso: em alguns casos o ajuste pode ser ruim, e aí eles não recomendam usar um controle sintético.

O valor-p vem de permutação, e ele tem piso

Não existe erro-padrão clássico aqui: há uma unidade tratada. A inferência é feita por permutação, aplicando o método a cada doador como se ele tivesse sido o tratado.

A estatística usada é a razão entre o erro quadrático médio de previsão depois e antes da mudança. A lógica: uma unidade genuinamente afetada ajusta bem antes e mal depois, então a razão fica grande. Uma unidade que só ajusta mal em tudo tem razão pequena, mesmo com erro grande depois.

Na nossa simulação, com 13 unidades no total:

posição unidade razão do erro quadrático depois sobre antes
1 tratado 75,9
2 doador 9 4,9
3 doador 12 2,9
4 doador 6 2,2
5 doador 11 2,2

O tratado ficou em primeiro, com razão quinze vezes maior que a do segundo colocado. O valor-p é a posição dividida pelo total: 1 dividido por 13, ou 0,0769.

E aqui está o limite que quase nenhum material menciona: 0,0769 é o menor valor-p que esse desenho pode produzir. Com 13 unidades, mesmo um resultado perfeito não cruza o corte de 0,05. Se o seu comitê exige valor-p abaixo de 0,05, ele está exigindo, na prática, pelo menos 20 unidades no grupo doador, porque 1 dividido por 20 é 0,05.

Foi exatamente essa a aritmética do estudo original. Abadie, Diamond e Hainmueller aplicaram o método à Proposição 99, o programa de controle do tabaco que a Califórnia implantou em 1988, usando dados anuais estaduais de 1970 a 2000, com 19 anos de período anterior. Eles descartaram do grupo doador os quatro estados que adotaram programas próprios entre 1989 e 2000 (Massachusetts, Arizona, Oregon e Flórida), os sete que subiram impostos sobre cigarro em 50 centavos ou mais no período (Alasca, Havaí, Maryland, Michigan, Nova Jersey, Nova York e Washington) e o Distrito de Columbia, ficando com 38 estados.

A Califórnia sintética saiu como combinação de cinco estados: Utah com 0,334, Nevada com 0,234, Montana com 0,199, Colorado com 0,164 e Connecticut com 0,069. Todos os demais receberam peso zero. O ajuste foi bom: o erro quadrático médio de previsão da Califórnia antes da Proposição 99, entre 1970 e 1988, foi de cerca de 3, contra uma mediana de cerca de 6 entre os 38 estados doadores.

O resultado: por volta do ano 2000, as vendas anuais de maços de cigarro per capita na Califórnia estavam cerca de 26 maços abaixo do que teriam sido sem a Proposição 99. E a inferência: a razão entre o erro quadrático médio depois e antes foi de cerca de 130 vezes para a Califórnia, nenhum estado de controle chegou a tanto, e a probabilidade de obter uma razão dessa magnitude atribuindo a intervenção ao acaso é 1 dividido por 39, ou 0,026.

Trinta e nove unidades, valor-p de 0,026. Treze unidades, piso de 0,0769. O grupo doador não é detalhe de implementação, é o que define se a pergunta pode ser respondida.

O que fazer quando o método diz “não dá”

Uma versão bayesiana e mais flexível dessa ideia é o modelo de séries temporais estruturais de Brodersen, Gallusser, Koehler, Remy e Scott, do Google, que prevê o contrafactual com regressão sobre preditores contemporâneos e prior de seleção de variáveis. Eles listam três limitações da leitura clássica de diferenças em diferenças que motivam o modelo: ela costuma partir de uma regressão estática que assume dados independentes apesar do componente temporal do desenho, e quando ajustada a dados serialmente correlacionados produz inferência otimista demais com intervalos estreitos demais; ela costuma olhar só dois pontos no tempo, quando o formato do efeito ao longo do tempo é justamente o que interessa; e ela impõe restrições sobre como o controle sintético é montado.

O detalhe mais útil desse trabalho, para quem precisa convencer alguém, é a validação. Eles analisaram uma campanha real do Google, seis semanas de anúncios direcionados a 95 de 190 áreas de mercado sorteadas, e mediram o efeito sobre cliques totais. O modelo devolveu 88.400 cliques adicionais, um aumento de 22 por cento com intervalo de credibilidade de 95 por cento entre 13 e 30 por cento. A comparação experimental convencional sobre os mesmos dados tinha devolvido 84.700 cliques, com intervalo de confiança de 95 por cento para o efeito relativo entre 19 e 22 por cento. Ou seja: desvio menor que 5 por cento entre a leitura contrafactual e a leitura sorteada, com intervalos mais largos na primeira, o que é esperado.

Essa é a leitura correta do método. Quando existe sorteio, ele é a referência. O contrafactual construído chega perto, com mais incerteza declarada, e serve para o caso em que o sorteio não existiu.

E se desse para sortear?

Vale sempre fazer a conta antes de aceitar o quase-experimento. Com a base de 4,20 por cento do nosso mercado tratado e o mesmo efeito de 0,31 ponto absoluto que o controle sintético estimou, a 95 por cento de confiança e 80 por cento de poder:

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Ela devolve 68.039 visitantes por variação, ou seja, 136.078 no total. Com 60.000 visitantes por semana, isso são 16 dias. Com 120.000 por semana, 8 dias.

Duas semanas de teste sorteado, sem premissa de tendência comum, sem grupo doador, sem piso de valor-p. Contra oito semanas de espera e 12 mercados doadores para chegar num valor-p de 0,0769. Sempre que a mudança couber num sorteio de usuário, essa comparação decide sozinha. O controle sintético existe para quando ela não cabe.

Roteiro de controle sintético em sete passos

  1. Declare a data de corte e a métrica antes de olhar o depois. No plano de análise pré-registrado, igual a qualquer teste.
  2. Monte o grupo doador excluindo quem foi contaminado. Todo mercado que recebeu a mesma mudança, uma mudança parecida ou um choque próprio no período sai do grupo. Foi o que Abadie, Diamond e Hainmueller fizeram ao tirar 12 unidades do grupo doador antes de começar.
  3. Use um período anterior longo. Vinte e quatro semanas na nossa simulação, 19 anos no estudo da Califórnia. Período anterior curto ajusta qualquer coisa e não prova nada.
  4. Ajuste os pesos SÓ com dados do período anterior. Se o período posterior encostar na otimização, o resultado deixa de ser uma medida e vira uma descrição.
  5. Reporte o erro de ajuste do período anterior junto do efeito. Sempre. Efeito sem ajuste declarado não é interpretável.
  6. Rode a permutação sobre todos os doadores e diga o piso do valor-p. “Posição 1 de 13, valor-p 0,0769, e 0,0769 é o mínimo possível com 13 unidades” é uma frase completa.
  7. Publique o gap semanal, não a média. Oito semanas de gap positivo contam uma história que uma média não conta.

Erros comuns

Faça isso automático na Donnu

O controle sintético só é possível quando existe série histórica por unidade, com a mesma definição de métrica, cobrindo bastante tempo antes da mudança. É aí que a maioria das operações trava: o painel guarda o total do site por dia, não a métrica por mercado por dia, e quando a pergunta aparece já não dá para reconstruir o passado.

A Donnu guarda o resultado por unidade e por dia com a definição carimbada, o que preserva a possibilidade de fazer essa leitura no futuro mesmo para uma mudança que ninguém planejou medir. E, como sempre, ela existe primeiro para o caso em que o sorteio cabe: antes de montar grupo doador e permutação, rode a conta na calculadora de tamanho de amostra. Se o teste sorteado couber em duas semanas, ele responde a mesma pergunta sem nenhuma das premissas deste artigo.

Referências

Leia também: Diferenças em diferenças · Experimentos geográficos · Randomização por cluster · Meta-análise de testes A/B · Plano de análise pré-registrado · Calculadora de tamanho de amostra · Read in English

Perguntas frequentes

O que é controle sintético?
É um método para medir o efeito de uma mudança que atingiu UMA unidade só, por exemplo um mercado, um país ou uma loja. Em vez de escolher um controle real, ele monta um controle artificial como média ponderada de várias unidades não tratadas, com os pesos escolhidos para reproduzir a série da unidade tratada no período ANTERIOR à mudança.
Qual a diferença entre controle sintético e diferenças em diferenças?
Diferenças em diferenças exige que a unidade tratada e o controle tenham a mesma tendência, e remove só efeitos de confundidores que sejam constantes no tempo. Abadie, Diamond e Hainmueller mostram que o controle sintético generaliza esse modelo ao permitir que o efeito de fatores não observados VARIE no tempo. Na simulação deste guia, isso levou o erro de ajuste no período anterior de 0,27972 ponto para 0,04061 ponto.
Como se sabe se um controle sintético é confiável?
Pelo ajuste no período anterior à mudança, medido pela raiz do erro quadrático médio de previsão. Se o sintético não reproduz o passado da unidade tratada, ele não vai prever o presente dela. Abadie, Diamond e Hainmueller são explícitos: quando o ajuste é ruim, eles não recomendam usar um controle sintético.
Como se calcula o valor-p de um controle sintético?
Por permutação: aplica-se o mesmo método a cada unidade do grupo doador como se ela tivesse sido tratada, e compara-se a razão entre o erro quadrático médio depois e antes. No estudo da Proposição 99 da Califórnia, essa razão foi cerca de 130 vezes para a Califórnia, nenhum estado de controle chegou perto, e a probabilidade de obter algo tão grande atribuindo a intervenção ao acaso é 1 dividido por 39, ou 0,026.
Quantas unidades doadoras são necessárias?
O piso do valor-p é 1 dividido pelo número de unidades no exercício de permutação. Com 13 unidades, como na simulação deste guia, o menor valor-p possível é 0,0769, acima do corte usual de 0,05, por melhor que seja o resultado. Com 39 unidades, como no estudo da Califórnia, o piso cai para 0,026.
Os pesos do controle sintético dizem quais mercados são parecidos com o tratado?
Não necessariamente. Na simulação deste guia, o mercado tratado foi construído como uma mistura conhecida de quatro doadores e o método devolveu um conjunto de pesos bem diferente, ainda assim reproduzindo o período anterior com erro de 0,04061 ponto e recuperando o efeito. O que se valida é o AJUSTE da série, não a interpretação de cada peso individual.