Estatística

Estimador Duplamente Robusto: duas chances de acertar

O estimador duplamente robusto acerta se o modelo de propensão OU o de desfecho estiver certo. A conta, o exemplo em quatro cenários e o limite.

Ilustração plana de uma prancha nivelada sustentada por duas cordas, a da esquerda rompida e solta e a da direita esticada

Quando o tratamento não foi sorteado, existem dois caminhos para estimar o efeito: modelar quem recebeu o tratamento, ou modelar o desfecho. Cada um funciona se o seu modelo estiver certo, e cada um erra sozinho se estiver errado. O estimador duplamente robusto usa os dois e acerta se PELO MENOS UM deles estiver certo. No exemplo deste guia, o efeito verdadeiro é mais 3,0000 pontos percentuais e a diferença bruta entre tratados e não tratados devolve mais 5,9091 pontos. Com a propensão certa e o desfecho errado, a ponderação acerta e a regressão erra; com a propensão errada e o desfecho certo, acontece o inverso; o duplamente robusto devolve 3,0000 nos dois casos. Este guia mostra a conta em quatro cenários, o caso em que ele também falha, e por que num experimento aleatorizado de verdade essa robustez vem de graça. Faz parte do nosso guia completo de teste A/B e é a rede de proteção do escore de propensão.

Duas formas de corrigir a mesma distorção

Um produto libera um recurso novo por adesão espontânea. Quem quis, ligou. Meses depois vem a pergunta: o recurso aumentou a conversão?

A comparação direta entre quem ligou e quem não ligou não responde isso, porque quem ligou já era diferente antes de ligar. Existem duas famílias de correção, e elas atacam o problema por lados opostos:

família o que modela como corrige falha quando
ponderação pelo inverso da propensão a probabilidade de cada pessoa receber o tratamento, dadas as características reponderar os observados para reconstruir a população inteira o modelo de quem foi tratado está errado, ou devolve propensões muito pequenas
regressão do desfecho o desfecho esperado com e sem tratamento, dadas as características prever os dois desfechos para todo mundo e tirar a diferença média o modelo do desfecho está errado
duplamente robusto os dois ao mesmo tempo usa a regressão como base e corrige o resíduo dela com pesos de propensão os DOIS estão errados

A terceira linha é a promessa, e Kang e Schafer a formulam com precisão: os procedimentos duplamente robustos aplicam os dois tipos de modelo simultaneamente e produzem uma estimativa consistente do parâmetro se qualquer um dos dois tiver sido especificado corretamente.

As duas cordas que sustentam a estimativa duplamente robustaUma plataforma que representa a estimativa do efeito é sustentada por duas cordas. A da esquerda é o modelo de propensão e a da direita é o modelo de desfecho. Quando qualquer uma das duas está intacta a plataforma continua nivelada. Quando as duas se rompem ao mesmo tempo a plataforma cai, e a estimativa fica enviesada.o efeito causal verdadeiromodelo de propensãorompidomodelo de desfechointactoestimativa duplamente robusta: mais 3,0000 pontosbasta uma das duas cordas para a estimativa continuar nivelada no valor verdadeiro.se as duas se rompem, ela cai igual a qualquer outro método, e nenhuma matemática avisa que isso aconteceu.
Robustez dupla é redundância, não mágica. Ela compra uma segunda chance, e é exatamente isso que ela compra.

O exemplo trabalhado: quatro cenários, uma tabela

Uma base de 100.000 usuários, dois tipos de dispositivo, adesão espontânea a um recurso novo. Os números verdadeiros, que na vida real ninguém observa:

estrato pessoas adesão real conversão sem o recurso conversão com o recurso efeito
desktop 60.000 75% 10,0% 13,0% mais 3,0 pontos
mobile 40.000 25% 4,0% 7,0% mais 3,0 pontos
total 100.000 55% mais 3,0000 pontos

Note que o efeito é o mesmo nos dois estratos. Não há heterogeneidade nenhuma aqui. O problema é inteiramente de composição: desktop adere muito mais e converte muito mais, então o grupo dos aderentes é dominado por desktop e o grupo dos não aderentes é dominado por mobile.

O que se observa na tabela do banco:

grupo pessoas conversões taxa
aderiram 55.000 6.550 11,9091%
não aderiram 45.000 2.700 6,0000%
Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Cole essas duas linhas na calculadora acima: mais 5,9091 pontos percentuais, mais 98,48 por cento relativo, valor-p abaixo do exibível. Um resultado espetacular, altamente significativo, e quase o dobro do efeito verdadeiro. A significância não protege contra viés de composição; ela só diz que a diferença observada não é acaso, e ela não é mesmo. Ela é confundimento.

Agora, os quatro cenários. Em cada um, “certo” significa que o modelo reproduz a realidade dos estratos e “errado” significa que ele ignora o dispositivo e usa um número único para toda a base.

cenário ponderação por propensão regressão do desfecho duplamente robusto
propensão CERTA, desfecho ERRADO 3,0000 pontos 5,9091 pontos 3,0000 pontos
propensão ERRADA, desfecho CERTO 5,9091 pontos 3,0000 pontos 3,0000 pontos
os dois certos 3,0000 pontos 3,0000 pontos 3,0000 pontos
os dois errados 5,9091 pontos 5,9091 pontos 5,9091 pontos

As duas primeiras linhas são a dupla robustez inteira, em números. Nelas, um dos dois métodos simples entrega o valor verdadeiro e o outro entrega o viés completo, e quem está lendo o relatório não tem como saber qual é qual, porque ambos os modelos são plausíveis e nenhum teste distingue “meu modelo de propensão está certo” de “meu modelo de desfecho está certo”. O estimador duplamente robusto dispensa essa escolha: ele entrega 3,0000 pontos nas duas.

Estimativa de cada método nos quatro cenários de especificaçãoQuatro blocos comparam a estimativa por ponderação, por regressão e duplamente robusta contra o valor verdadeiro de 3 pontos percentuais. Nos dois primeiros cenários um método simples acerta e o outro erra, e o duplamente robusto acerta nos dois. No terceiro, com os dois modelos certos, todos acertam. No quarto, com os dois errados, todos devolvem 5,9091 pontos.verdadeiro: 3,0000propensão certadesfecho erradoponderaçãoregressão: 5,9091duplamente robustopropensão erradadesfecho certoponderação: 5,9091regressãoduplamente robustoos dois certosos três coincidem em 3,0000os dois erradosos três em 5,9091a linha verde é o alvo. Quanto mais à direita, mais enviesado. A quarta faixa é o limite honesto do método.
Nas duas primeiras faixas, o ponto preto está sobre a linha verde nos dois casos, e é isso que a dupla robustez entrega. Na quarta faixa não existe ponto preto sobre a linha.

Como o estimador duplamente robusto funciona por dentro

A mecânica é mais simples do que o nome sugere. O estimador duplamente robusto parte da previsão do modelo de desfecho para todo mundo e depois soma uma correção construída a partir do erro que esse modelo cometeu onde ele pode ser conferido, ou seja, nos indivíduos cujo desfecho de fato foi observado, com cada erro reponderado pelo inverso da propensão.

As duas propriedades saem daí:

Num experimento aleatorizado, a segunda propriedade é gratuita: a propensão é conhecida por desenho, normalmente 0,5, e por definição não pode estar errada. Rodando o mesmo exemplo com sorteio meio a meio em vez de adesão espontânea, a diferença simples de médias devolve exatamente 3,0000 pontos e o estimador duplamente robusto com um modelo de desfecho totalmente errado devolve os mesmos 3,0000 pontos.

Essa é a ponte entre este assunto e o teste A/B do dia a dia. Num experimento, o termo de correção não conserta viés, porque não há viés: ele reduz variância, e o que sobra é exatamente ajuste por regressão. Um método, duas leituras conforme o sorteio exista ou não.

O limite: dois modelos errados não são melhores que um

Kang e Schafer construíram um estudo de simulação em que os dois modelos estão errados, mas nenhum deles grosseiramente mal especificado, que é a situação realista de qualquer análise observacional. As conclusões deles são desconfortáveis e precisam ser ditas por inteiro:

A quarta linha da tabela de cenários é a versão aritmética disso. Com os dois modelos errados, o duplamente robusto devolve os mesmos 5,9091 pontos enviesados, sem nenhum sinal de alarme.

Como uma propensão pequena estimada errado desestabiliza a ponderaçãoNum estrato raro de 2.000 pessoas com propensão verdadeira de 0,02, apenas 40 foram tratadas e cada uma carrega peso 50, representando exatamente as 2.000 pessoas do estrato. Se o modelo estimar a propensão em 0,01, o peso vira 100 e as mesmas 40 pessoas passam a representar 4.000, o dobro do que o estrato contém. A estimativa por ponderação sai de 3,2353 para 3,4120 pontos, enquanto a duplamente robusta com modelo de desfecho correto permanece em 3,2353.estrato raro: 2.000 pessoas, 40 tratadaspropensão estimada 0,02peso 50, representa 2.000estimativa 3,2353propensão estimada 0,01peso 100, representa 4.000, mais gente do que o estrato temestimativa por ponderação: 3,4120duplamente robusto, com modelo de desfecho corretovolta para 3,2353um erro de estimação em 40 pessoas moveu a leitura de toda a base em 0,18 ponto percentual.a segunda corda existe exatamente para esse tipo de acidente.
O estrato raro custa 2 por cento da base e domina o erro. É o mecanismo que Kang e Schafer identificam como a fragilidade central da ponderação.

O que fazer com o estimador duplamente robusto na prática

A leitura combinada de tudo acima leva a um protocolo, não a uma receita de estimador único:

  1. Rode os três estimadores e publique os três. Ponderação, regressão e duplamente robusto. A divergência entre eles é a informação mais útil do relatório.
  2. Se os três coincidem, você está na terceira linha da tabela de cenários, e a estimativa é bem sustentada.
  3. Se dois divergem e o duplamente robusto acompanha um deles, você está numa das duas primeiras linhas, e o duplamente robusto é a leitura a reportar.
  4. Se o duplamente robusto não acompanha nenhum dos dois de forma estável, desconfie de propensões extremas antes de qualquer outra coisa.
  5. Sempre olhe a distribuição das propensões estimadas. Corte ou aparação de valores extremos é decisão a tomar antes de ver o resultado, e a faixa cortada precisa constar no relatório.
  6. Se usar aprendizado de máquina nos modelos auxiliares, use ajuste cruzado. Chernozhukov e coautores mostram que enfiar estimativas de aprendizado de máquina diretamente nas equações de estimação gera viés pesado no parâmetro de interesse, e que a correção precisa de dois ingredientes: escores ortogonais de Neyman, com sensibilidade reduzida aos parâmetros auxiliares, e ajuste cruzado.
  7. Nunca esqueça de qual pergunta isso responde. É a segunda melhor resposta. A primeira é sortear, e quando o tratamento não pode ser sorteado diretamente, o desenho de encorajamento costuma ser mais barato do que parece.

Erros comuns

Faça isso automático na Donnu

O estimador duplamente robusto vive ou morre pela qualidade das características usadas nos dois modelos, e essas características precisam existir no estado em que estavam antes de o tratamento acontecer. Numa liberação por adesão, isso significa guardar o perfil do usuário no momento em que ele ligou o recurso, e não no momento em que o relatório é gerado.

Reconstruir depois é o erro que mais se comete: o perfil atual de quem adotou já foi mudado pela adoção, e um modelo de propensão treinado sobre ele aprende consequência, não causa. A Donnu carimba o estado do usuário no instante da atribuição e mantém o histórico de exposição por usuário, o que deixa os dois modelos com o insumo certo sem reconstrução manual.

E vale a recomendação de escopo, que é a mais importante deste artigo: quando existe qualquer forma de sortear, sorteie. A dupla robustez é uma boa segunda opção, e continua sendo uma segunda opção. A calculadora de significância fecha a leitura bruta do exemplo e serve como demonstração de por que o valor-p sozinho não distingue efeito de composição.

Referências

Leia também: Escore de propensão · Ajuste por regressão · Confundidor não medido · Série temporal interrompida · Calculadora de significância · Read in English

Perguntas frequentes

O que é um estimador duplamente robusto?
É um estimador que combina dois modelos, um da probabilidade de receber o tratamento e outro do desfecho, e produz uma estimativa consistente do efeito se PELO MENOS UM dos dois estiver corretamente especificado. Kang e Schafer descrevem exatamente isso: os procedimentos duplamente robustos aplicam os dois tipos de modelo ao mesmo tempo e produzem uma estimativa consistente do parâmetro se qualquer um dos dois tiver sido especificado corretamente.
Quando um teste A/B precisa disso?
Quando o sorteio não existiu ou não pode ser confiado: adoção espontânea de um recurso, liberação por região, migração que o usuário escolheu aceitar. Num experimento aleatorizado de verdade a probabilidade de tratamento é conhecida por desenho, normalmente 0,5, então ela nunca está errada e a dupla robustez vira automática: o estimador aumentado devolve a resposta certa mesmo com o modelo de desfecho totalmente errado.
Se os dois modelos estiverem errados, o estimador salva?
Não, e esse é o limite mais importante. No exemplo deste guia, com os dois modelos errados o estimador duplamente robusto devolve os mesmos 5,9091 pontos percentuais enviesados que os dois métodos simples devolvem, contra o valor verdadeiro de 3,0000 pontos. Kang e Schafer resumem a conclusão do estudo deles em uma frase: em pelo menos alguns cenários, dois modelos errados não são melhores que um.
Por que a ponderação pelo inverso da propensão fica instável?
Porque o peso de cada tratado é o inverso da propensão estimada dele, então uma propensão pequena vira um peso enorme. No exemplo com um estrato raro de propensão 0,02, cada tratado carrega peso 50 e apenas 40 pessoas representam 2.000. Se o modelo estimar 0,01 em vez de 0,02, as mesmas 40 pessoas passam a representar 4.000, mais gente do que o estrato inteiro contém, e a estimativa se move de 3,2353 para 3,4120 pontos.
Qual é a diferença entre isso e o escore de propensão sozinho?
O escore de propensão sozinho depende inteiramente de o modelo de quem foi tratado estar certo. Se ele estiver errado, não há rede de proteção. O estimador duplamente robusto acrescenta um modelo de desfecho como segunda corda: no cenário em que a propensão está errada e o desfecho está certo, o método por ponderação devolve 5,9091 pontos e o duplamente robusto devolve 3,0000, o valor verdadeiro.
Preciso de aprendizado de máquina para isso?
Não precisa, mas é onde ele encaixa bem. Chernozhukov e coautores mostram que enfiar estimativas de aprendizado de máquina diretamente nas equações de estimação gera viés pesado, porque viés de regularização e sobreajuste contaminam o parâmetro de interesse. A correção deles tem dois ingredientes: escores ortogonais de Neyman, menos sensíveis aos modelos auxiliares, e ajuste cruzado, uma forma eficiente de divisão dos dados.