Estimador Duplamente Robusto: duas chances de acertar
O estimador duplamente robusto acerta se o modelo de propensão OU o de desfecho estiver certo. A conta, o exemplo em quatro cenários e o limite.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Quando o tratamento não foi sorteado, existem dois caminhos para estimar o efeito: modelar quem recebeu o tratamento, ou modelar o desfecho. Cada um funciona se o seu modelo estiver certo, e cada um erra sozinho se estiver errado. O estimador duplamente robusto usa os dois e acerta se PELO MENOS UM deles estiver certo. No exemplo deste guia, o efeito verdadeiro é mais 3,0000 pontos percentuais e a diferença bruta entre tratados e não tratados devolve mais 5,9091 pontos. Com a propensão certa e o desfecho errado, a ponderação acerta e a regressão erra; com a propensão errada e o desfecho certo, acontece o inverso; o duplamente robusto devolve 3,0000 nos dois casos. Este guia mostra a conta em quatro cenários, o caso em que ele também falha, e por que num experimento aleatorizado de verdade essa robustez vem de graça. Faz parte do nosso guia completo de teste A/B e é a rede de proteção do escore de propensão.
Duas formas de corrigir a mesma distorção
Um produto libera um recurso novo por adesão espontânea. Quem quis, ligou. Meses depois vem a pergunta: o recurso aumentou a conversão?
A comparação direta entre quem ligou e quem não ligou não responde isso, porque quem ligou já era diferente antes de ligar. Existem duas famílias de correção, e elas atacam o problema por lados opostos:
| família | o que modela | como corrige | falha quando |
|---|---|---|---|
| ponderação pelo inverso da propensão | a probabilidade de cada pessoa receber o tratamento, dadas as características | reponderar os observados para reconstruir a população inteira | o modelo de quem foi tratado está errado, ou devolve propensões muito pequenas |
| regressão do desfecho | o desfecho esperado com e sem tratamento, dadas as características | prever os dois desfechos para todo mundo e tirar a diferença média | o modelo do desfecho está errado |
| duplamente robusto | os dois ao mesmo tempo | usa a regressão como base e corrige o resíduo dela com pesos de propensão | os DOIS estão errados |
A terceira linha é a promessa, e Kang e Schafer a formulam com precisão: os procedimentos duplamente robustos aplicam os dois tipos de modelo simultaneamente e produzem uma estimativa consistente do parâmetro se qualquer um dos dois tiver sido especificado corretamente.
O exemplo trabalhado: quatro cenários, uma tabela
Uma base de 100.000 usuários, dois tipos de dispositivo, adesão espontânea a um recurso novo. Os números verdadeiros, que na vida real ninguém observa:
| estrato | pessoas | adesão real | conversão sem o recurso | conversão com o recurso | efeito |
|---|---|---|---|---|---|
| desktop | 60.000 | 75% | 10,0% | 13,0% | mais 3,0 pontos |
| mobile | 40.000 | 25% | 4,0% | 7,0% | mais 3,0 pontos |
| total | 100.000 | 55% | mais 3,0000 pontos |
Note que o efeito é o mesmo nos dois estratos. Não há heterogeneidade nenhuma aqui. O problema é inteiramente de composição: desktop adere muito mais e converte muito mais, então o grupo dos aderentes é dominado por desktop e o grupo dos não aderentes é dominado por mobile.
O que se observa na tabela do banco:
| grupo | pessoas | conversões | taxa |
|---|---|---|---|
| aderiram | 55.000 | 6.550 | 11,9091% |
| não aderiram | 45.000 | 2.700 | 6,0000% |
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Cole essas duas linhas na calculadora acima: mais 5,9091 pontos percentuais, mais 98,48 por cento relativo, valor-p abaixo do exibível. Um resultado espetacular, altamente significativo, e quase o dobro do efeito verdadeiro. A significância não protege contra viés de composição; ela só diz que a diferença observada não é acaso, e ela não é mesmo. Ela é confundimento.
Agora, os quatro cenários. Em cada um, “certo” significa que o modelo reproduz a realidade dos estratos e “errado” significa que ele ignora o dispositivo e usa um número único para toda a base.
| cenário | ponderação por propensão | regressão do desfecho | duplamente robusto |
|---|---|---|---|
| propensão CERTA, desfecho ERRADO | 3,0000 pontos | 5,9091 pontos | 3,0000 pontos |
| propensão ERRADA, desfecho CERTO | 5,9091 pontos | 3,0000 pontos | 3,0000 pontos |
| os dois certos | 3,0000 pontos | 3,0000 pontos | 3,0000 pontos |
| os dois errados | 5,9091 pontos | 5,9091 pontos | 5,9091 pontos |
As duas primeiras linhas são a dupla robustez inteira, em números. Nelas, um dos dois métodos simples entrega o valor verdadeiro e o outro entrega o viés completo, e quem está lendo o relatório não tem como saber qual é qual, porque ambos os modelos são plausíveis e nenhum teste distingue “meu modelo de propensão está certo” de “meu modelo de desfecho está certo”. O estimador duplamente robusto dispensa essa escolha: ele entrega 3,0000 pontos nas duas.
Como o estimador duplamente robusto funciona por dentro
A mecânica é mais simples do que o nome sugere. O estimador duplamente robusto parte da previsão do modelo de desfecho para todo mundo e depois soma uma correção construída a partir do erro que esse modelo cometeu onde ele pode ser conferido, ou seja, nos indivíduos cujo desfecho de fato foi observado, com cada erro reponderado pelo inverso da propensão.
As duas propriedades saem daí:
- Se o modelo de desfecho estiver certo, os erros são zero em média e a correção não faz nada. A estimativa é a da regressão, que está certa, e a propensão pode estar completamente errada sem consequência, porque ela só multiplica zeros.
- Se o modelo de propensão estiver certo, a correção reponderada compensa exatamente o quanto a previsão errou em cada grupo, e o resultado converge para o mesmo valor que a ponderação pura entregaria.
Num experimento aleatorizado, a segunda propriedade é gratuita: a propensão é conhecida por desenho, normalmente 0,5, e por definição não pode estar errada. Rodando o mesmo exemplo com sorteio meio a meio em vez de adesão espontânea, a diferença simples de médias devolve exatamente 3,0000 pontos e o estimador duplamente robusto com um modelo de desfecho totalmente errado devolve os mesmos 3,0000 pontos.
Essa é a ponte entre este assunto e o teste A/B do dia a dia. Num experimento, o termo de correção não conserta viés, porque não há viés: ele reduz variância, e o que sobra é exatamente ajuste por regressão. Um método, duas leituras conforme o sorteio exista ou não.
O limite: dois modelos errados não são melhores que um
Kang e Schafer construíram um estudo de simulação em que os dois modelos estão errados, mas nenhum deles grosseiramente mal especificado, que é a situação realista de qualquer análise observacional. As conclusões deles são desconfortáveis e precisam ser ditas por inteiro:
- métodos que usam o inverso da probabilidade como peso, sejam duplamente robustos ou não, são sensíveis à má especificação do modelo de propensão quando algumas propensões estimadas são pequenas;
- muitos métodos duplamente robustos tiveram desempenho melhor que a ponderação simples pelo inverso da probabilidade;
- nenhum dos métodos duplamente robustos que eles testaram superou a simples predição do desfecho por regressão;
- e a frase que resume tudo: em pelo menos alguns contextos, dois modelos errados não são melhores que um.
A quarta linha da tabela de cenários é a versão aritmética disso. Com os dois modelos errados, o duplamente robusto devolve os mesmos 5,9091 pontos enviesados, sem nenhum sinal de alarme.
O que fazer com o estimador duplamente robusto na prática
A leitura combinada de tudo acima leva a um protocolo, não a uma receita de estimador único:
- Rode os três estimadores e publique os três. Ponderação, regressão e duplamente robusto. A divergência entre eles é a informação mais útil do relatório.
- Se os três coincidem, você está na terceira linha da tabela de cenários, e a estimativa é bem sustentada.
- Se dois divergem e o duplamente robusto acompanha um deles, você está numa das duas primeiras linhas, e o duplamente robusto é a leitura a reportar.
- Se o duplamente robusto não acompanha nenhum dos dois de forma estável, desconfie de propensões extremas antes de qualquer outra coisa.
- Sempre olhe a distribuição das propensões estimadas. Corte ou aparação de valores extremos é decisão a tomar antes de ver o resultado, e a faixa cortada precisa constar no relatório.
- Se usar aprendizado de máquina nos modelos auxiliares, use ajuste cruzado. Chernozhukov e coautores mostram que enfiar estimativas de aprendizado de máquina diretamente nas equações de estimação gera viés pesado no parâmetro de interesse, e que a correção precisa de dois ingredientes: escores ortogonais de Neyman, com sensibilidade reduzida aos parâmetros auxiliares, e ajuste cruzado.
- Nunca esqueça de qual pergunta isso responde. É a segunda melhor resposta. A primeira é sortear, e quando o tratamento não pode ser sorteado diretamente, o desenho de encorajamento costuma ser mais barato do que parece.
Erros comuns
- Apresentar a estimativa duplamente robusta como se fosse imune a viés. Ela é imune a um modelo errado, não a dois.
- Não olhar a distribuição das propensões. É a fragilidade principal, e um único estrato raro pode dominar o erro inteiro.
- Escolher entre os três estimadores depois de ver os três resultados. A regra de qual reportar precisa estar no plano de análise pré-registrado, como qualquer outra decisão de leitura.
- Usar aprendizado de máquina sem ajuste cruzado. O viés de regularização não é pequeno e não desaparece com mais dados.
- Incluir no modelo de propensão variáveis medidas depois do tratamento. Elas não são características de quem foi tratado, são consequências do tratamento, e a inclusão destrói a estimativa.
- Achar que dupla robustez substitui um experimento. Ela reduz a dependência de uma premissa e não elimina a premissa de que todos os confundidores relevantes foram medidos. A quantificação dessa dúvida residual está em confundidor não medido.
- Reportar valor-p de uma estimativa observacional como se fosse de um experimento. No exemplo, o resultado enviesado de 5,9091 pontos é altamente significativo. Significância mede acaso, não confundimento.
Faça isso automático na Donnu
O estimador duplamente robusto vive ou morre pela qualidade das características usadas nos dois modelos, e essas características precisam existir no estado em que estavam antes de o tratamento acontecer. Numa liberação por adesão, isso significa guardar o perfil do usuário no momento em que ele ligou o recurso, e não no momento em que o relatório é gerado.
Reconstruir depois é o erro que mais se comete: o perfil atual de quem adotou já foi mudado pela adoção, e um modelo de propensão treinado sobre ele aprende consequência, não causa. A Donnu carimba o estado do usuário no instante da atribuição e mantém o histórico de exposição por usuário, o que deixa os dois modelos com o insumo certo sem reconstrução manual.
E vale a recomendação de escopo, que é a mais importante deste artigo: quando existe qualquer forma de sortear, sorteie. A dupla robustez é uma boa segunda opção, e continua sendo uma segunda opção. A calculadora de significância fecha a leitura bruta do exemplo e serve como demonstração de por que o valor-p sozinho não distingue efeito de composição.
Referências
- Kang, J. D. Y. e Schafer, J. L. Demystifying Double Robustness: A Comparison of Alternative Strategies for Estimating a Population Mean from Incomplete Data. Statistical Science, volume 22, número 4, 2007, páginas 523 a 539. Fonte da definição de que os procedimentos duplamente robustos aplicam os dois tipos de modelo simultaneamente e produzem uma estimativa consistente do parâmetro se qualquer um dos dois tiver sido corretamente especificado; do desenho de simulação em que os dois modelos estão errados mas nenhum grosseiramente mal especificado; do resultado de que métodos que usam o inverso da probabilidade como peso, duplamente robustos ou não, são sensíveis à má especificação do modelo de propensão quando algumas propensões estimadas são pequenas; do registro de que muitos métodos duplamente robustos superaram a ponderação simples mas nenhum superou a simples predição por regressão; e da conclusão de que, em pelo menos alguns contextos, dois modelos errados não são melhores que um. arxiv.org.
- Chernozhukov, V., Chetverikov, D., Demirer, M., Duflo, E., Hansen, C., Newey, W. e Robins, J. Double/Debiased Machine Learning for Treatment and Structural Parameters. The Econometrics Journal, volume 21, número 1, 2018. Fonte do diagnóstico de que viés de regularização e sobreajuste na estimação dos parâmetros auxiliares causam viés pesado nos estimadores do parâmetro de interesse obtidos por substituição ingênua das estimativas de aprendizado de máquina nas equações de estimação, fazendo o estimador ingênuo deixar de ser consistente na taxa de raiz de N; e da correção em dois ingredientes, escores ortogonais de Neyman com sensibilidade reduzida aos parâmetros auxiliares e ajuste cruzado como forma eficiente de divisão dos dados, com aplicação explícita ao efeito médio de tratamento sob não confundimento. arxiv.org.
- Lin, W. Agnostic Notes on the Regression Adjustment to Experimental Data: Reexamining Freedman’s Critique. Annals of Applied Statistics, volume 7, número 1, 2013, páginas 295 a 318. Usado aqui para o caso aleatorizado, em que a propensão é conhecida por desenho: fonte da demonstração de que o ajuste por mínimos quadrados com o conjunto completo de interações entre tratamento e covariáveis não pode piorar a precisão assintótica, e de que o erro-padrão sanduíche é consistente ou assintoticamente conservador. arxiv.org.
Leia também: Escore de propensão · Ajuste por regressão · Confundidor não medido · Série temporal interrompida · Calculadora de significância · Read in English
Perguntas frequentes
- O que é um estimador duplamente robusto?
- É um estimador que combina dois modelos, um da probabilidade de receber o tratamento e outro do desfecho, e produz uma estimativa consistente do efeito se PELO MENOS UM dos dois estiver corretamente especificado. Kang e Schafer descrevem exatamente isso: os procedimentos duplamente robustos aplicam os dois tipos de modelo ao mesmo tempo e produzem uma estimativa consistente do parâmetro se qualquer um dos dois tiver sido especificado corretamente.
- Quando um teste A/B precisa disso?
- Quando o sorteio não existiu ou não pode ser confiado: adoção espontânea de um recurso, liberação por região, migração que o usuário escolheu aceitar. Num experimento aleatorizado de verdade a probabilidade de tratamento é conhecida por desenho, normalmente 0,5, então ela nunca está errada e a dupla robustez vira automática: o estimador aumentado devolve a resposta certa mesmo com o modelo de desfecho totalmente errado.
- Se os dois modelos estiverem errados, o estimador salva?
- Não, e esse é o limite mais importante. No exemplo deste guia, com os dois modelos errados o estimador duplamente robusto devolve os mesmos 5,9091 pontos percentuais enviesados que os dois métodos simples devolvem, contra o valor verdadeiro de 3,0000 pontos. Kang e Schafer resumem a conclusão do estudo deles em uma frase: em pelo menos alguns cenários, dois modelos errados não são melhores que um.
- Por que a ponderação pelo inverso da propensão fica instável?
- Porque o peso de cada tratado é o inverso da propensão estimada dele, então uma propensão pequena vira um peso enorme. No exemplo com um estrato raro de propensão 0,02, cada tratado carrega peso 50 e apenas 40 pessoas representam 2.000. Se o modelo estimar 0,01 em vez de 0,02, as mesmas 40 pessoas passam a representar 4.000, mais gente do que o estrato inteiro contém, e a estimativa se move de 3,2353 para 3,4120 pontos.
- Qual é a diferença entre isso e o escore de propensão sozinho?
- O escore de propensão sozinho depende inteiramente de o modelo de quem foi tratado estar certo. Se ele estiver errado, não há rede de proteção. O estimador duplamente robusto acrescenta um modelo de desfecho como segunda corda: no cenário em que a propensão está errada e o desfecho está certo, o método por ponderação devolve 5,9091 pontos e o duplamente robusto devolve 3,0000, o valor verdadeiro.
- Preciso de aprendizado de máquina para isso?
- Não precisa, mas é onde ele encaixa bem. Chernozhukov e coautores mostram que enfiar estimativas de aprendizado de máquina diretamente nas equações de estimação gera viés pesado, porque viés de regularização e sobreajuste contaminam o parâmetro de interesse. A correção deles tem dois ingredientes: escores ortogonais de Neyman, menos sensíveis aos modelos auxiliares, e ajuste cruzado, uma forma eficiente de divisão dos dados.