Estatística

Escore de Propensão: montar o par que o sorteio não montou

O escore de propensão colapsa dezenas de covariáveis num número só para parear tratado e controle. O que ele conserta, o que não conserta e onde piora.

Ilustração plana de dois grupos de círculos de tamanhos variados, alguns ligados por linhas finas ao par de tamanho parecido no outro grupo e os demais desbotados

Comparar quem usou com quem não usou é a leitura mais fácil de produzir e a mais fácil de errar. Na simulação deste guia, a comparação crua entre adotantes e não adotantes de um recurso devolveu mais 216,67 por cento, o pareamento por escore de propensão com covariáveis ricas derrubou isso para mais 24,12 por cento, e o teste sorteado que rodamos em seguida devolveu mais 4,88 por cento, sem significância estatística. O escore de propensão é uma ferramenta legítima e muito bem fundamentada, e ainda assim ela conserta apenas o que você mediu. Este guia mostra a conta, o teto teórico dela, e as três verificações que separam uma leitura defensável de uma justificativa cara. Faz parte do nosso guia completo de teste A/B e complementa diferenças em diferenças e controle sintético.

O problema: quem usou não é igual a quem não usou

A pergunta chega sempre no mesmo formato. Subimos um recurso novo, parte dos usuários adotou, e o time quer saber se adotar aumenta conversão. O dado está todo no banco. A comparação sai em uma consulta.

Só que a adoção não foi sorteada. Quem adotou escolheu adotar, e essa escolha tem causas:

Esse é o problema clássico de confundimento. A diferença observada entre os dois grupos mistura o efeito do recurso com a diferença entre as pessoas. O escore de propensão é uma tentativa organizada de separar as duas coisas usando o que você mediu.

Vale registrar de saída que o caminho preferido continua sendo sortear. Quando dá para sortear a exposição, sorteie, e use a calculadora de tamanho de amostra para saber quanto tempo isso leva. O escore de propensão é o que se faz quando o sorteio não está disponível, não uma alternativa equivalente a ele.

As quatro leituras do mesmo dado, e a calculadora que reproduz cada uma

Simulamos uma base de produto com um recurso novo. Quatro leituras do mesmo fenômeno, da mais crua para a mais cuidadosa, e no fim o experimento sorteado que serve de gabarito.

leitura controle tratado efeito relativo valor-p
crua (todos os não adotantes) 630 de 21.000 = 3,000% 456 de 4.800 = 9,500% mais 216,67% abaixo de 0,0001
pareada por plano e tempo de casa 288 de 4.800 = 6,000% 456 de 4.800 = 9,500% mais 58,33% abaixo de 0,0001
pareada por propensão rica 311 de 4.200 = 7,405% 386 de 4.200 = 9,190% mais 24,12% 0,0030
experimento sorteado 1.517 de 18.500 = 8,200% 1.591 de 18.500 = 8,600% mais 4,88% 0,1655

Cole qualquer uma das quatro linhas na calculadora abaixo e confira. Os números são os mesmos, o veredito muda a cada linha.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Três coisas para reparar nessa tabela.

A taxa do tratado quase não se mexe. Ela sai de 9,500 para 9,190 por cento entre a leitura crua e a pareada rica, e a mudança vem só de perder alguns tratados sem par disponível. O que muda de verdade é a taxa do controle: 3,000, depois 6,000, depois 7,405 por cento. O pareamento não mexe no tratamento, ele troca com quem você compara.

O valor-p continua bonito enquanto o efeito encolhe. Na terceira linha, o efeito já caiu para menos de um nono do original e o valor-p ainda é 0,0030, com intervalo de confiança de 95 por cento entre mais 0,607 e mais 2,965 pontos percentuais. Significância estatística não mede viés. Ela mede ruído amostral, e sobra ruído de menos quando a amostra é grande.

A quarta linha é a única que responde a pergunta feita. Mais 0,400 ponto, mais 4,88 por cento, com intervalo entre menos 0,165 e mais 0,965 ponto e valor-p de 0,1655. Ou seja: nem sequer dá para afirmar que houve efeito. Todas as três leituras observacionais afirmaram, com confiança crescente na aparência e decrescente na realidade.

O que o escore de propensão é, exatamente

O escore de propensão de uma pessoa é a probabilidade estimada de ela ter recebido o tratamento, dado tudo o que você mediu sobre ela antes. Se um usuário tem escore 0,65, o modelo diz que pessoas com aquele perfil adotaram o recurso em cerca de 65 por cento das vezes.

O resultado que fundou o campo veio de Rosenbaum e Rubin, na Biometrika em 1983. O resumo do artigo é direto: a teoria em amostras grandes e pequenas mostra que ajustar pelo escore de propensão escalar é suficiente para remover o viés devido a todas as covariáveis observadas. Repare nas duas palavras que carregam o método inteiro: covariáveis observadas.

Isso é o que torna a técnica tão útil. Você tem 40 variáveis e não consegue parear em todas ao mesmo tempo, porque o número de células cresce de forma explosiva. O escore colapsa as 40 num único número, e parear nesse número entrega, em média, grupos equilibrados nas 40. É uma redução de dimensão com garantia teórica.

Do vetor de covariáveis ao escore escalar e ao parÀ esquerda, uma pilha de barras representa muitas covariáveis medidas de uma pessoa. No meio, um funil as reduz a um único número entre zero e um. À direita, esse número é usado para encontrar a pessoa mais parecida do grupo oposto.1. o que você mediuplano, tempo de casa, tamanho,sessões, canal de origem, país,e mais 34 variáveismodelo deexposição2. um número só0,65chance estimada deter sido exposto3. o par0,65exposto0,64não expostoexpostos sem parsaem da conta
O escore não é uma medida de qualidade da pessoa. É a chance de ela ter sido exposta, e serve só para achar com quem compará-la.

Na prática, três famílias de uso convivem, e elas diferem principalmente em quanto dado jogam fora:

família o que faz descarta dado? quando escolher
pareamento para cada tratado, pega o controle de escore mais próximo sim, e bastante quando você quer o efeito sobre os tratados e prefere transparência a eficiência
estratificação corta a amostra em faixas de escore e compara dentro de cada faixa pouco, só faixas sem os dois grupos quando a sobreposição é razoável e você quer ver o efeito por faixa
ponderação pelo inverso da propensão mantém todo mundo e pesa cada pessoa pelo inverso da chance de estar no grupo em que está não, mas escores extremos viram pesos gigantes quando a sobreposição é boa e você não quer perder amostra

Repare no risco escondido da terceira linha: um controle com escore 0,99, que quase certamente teria sido exposto e não foi, recebe peso enorme. Uma única pessoa passa a mandar na estimativa. É por isso que aparar escores extremos é rotina, não exceção.

A escada de correção, medida contra o gabarito

O melhor teste público dessa escada veio de Gordon, Zettelmeyer, Bhargava e Chapsky, que usaram 12 estudos de mensuração de anúncios do Facebook nos Estados Unidos, com 435 milhões de observações de usuário por estudo e 1,4 bilhão de impressões. Em cada estudo existia um experimento sorteado de verdade servindo de gabarito, e eles refizeram a mesma medição pelos métodos observacionais que a indústria usa.

No estudo 4, a escada foi assim:

método efeito estimado
exposto contra não exposto, sem ajuste mais 416%
pareamento exato em idade e gênero mais 221%
propensão com variáveis comuns da plataforma mais 147%
propensão mais cerca de 40 variáveis de censo mais 154%
propensão mais métrica composta de milhares de sinais comportamentais mais 102%
experimento sorteado (gabarito) mais 77%

O padrão é o mesmo da nossa simulação: cada camada de sofisticação encurta a distância, e nenhuma camada chega ao fim. Ir de pareamento exato para propensão rica levou o efeito de 221 para 102 por cento, o que é uma melhora enorme, e ainda assim sobrou uma diferença de 25 pontos sobre um gabarito de 77.

Olhando o conjunto dos estudos, os autores contaram quantas vezes cada método produziu uma estimativa estatisticamente diferente da experimental. Para os desfechos de checkout, o pareamento exato divergiu do gabarito em 10 dos 11 estudos avaliados, com desvio absoluto médio de 661 pontos percentuais contra um efeito experimental médio de 57 por cento. As especificações de propensão melhoraram esse quadro sem resolvê-lo: 9 de 11 na primeira, 8 de 10 na segunda, 5 de 10 na mais rica, esta última com desvio absoluto médio de 184 pontos. A regressão ajustada com ponderação pelo inverso da propensão e o conjunto mais detalhado de variáveis foi o melhor método do estudo, e ainda divergiu em 3 de 10 casos, com desvio médio de 173 pontos.

Esse é o resultado central para quem trabalha com produto: o escore de propensão melhora muito a leitura e não a torna confiável. Ele reduz o erro em ordem de grandeza e deixa um erro que continua sendo maior que o efeito que você quer medir.

O paradoxo: podar mais pode piorar

Existe um segundo problema, mais sutil e menos conhecido, apontado por Gary King e Richard Nielsen na Political Analysis em 2019, num artigo com o título direto de “Why Propensity Scores Should Not Be Used for Matching”.

O argumento é sobre qual experimento o método está tentando imitar. Pense em dois desenhos experimentais. No experimento completamente aleatorizado, você sorteia quem entra em cada braço e pronto: os grupos ficam iguais em média, com variação amostral. No experimento em blocos, você primeiro agrupa pessoas idênticas nas covariáveis e só então sorteia dentro de cada bloco: os grupos ficam iguais em média e também em cada bloco, o que é mais eficiente.

O pareamento por escore de propensão persegue o primeiro alvo. Ele procura um subconjunto dos dados em que a exposição seja como se fosse completamente aleatória. Métodos que pareiam diretamente nas covariáveis, como distância de Mahalanobis ou pareamento exato grosseiro, perseguem o segundo. Daí vem a consequência que os autores chamam de paradoxo: depois que o pareamento por propensão atinge o próprio alvo, os escores dentro de cada estrato já são aproximadamente constantes, e continuar podando o par de maior distância de escore vira poda aleatória com respeito às covariáveis.

E poda aleatória aumenta desbalanceamento. O argumento mais simples deles cabe numa linha: com um homem e uma mulher no tratamento e um homem e uma mulher no controle, dado perfeitamente balanceado, largar duas das quatro observações ao acaso deixa um par homem com homem ou mulher com mulher em metade das vezes, e um par cruzado, completamente desbalanceado, na outra metade. Na média, o desbalanceamento aumentou.

Desbalanceamento contra observações podadasDuas curvas comparando métodos. A curva do pareamento por propensão desce um pouco e depois sobe continuamente conforme mais observações são podadas. A curva do pareamento direto nas covariáveis desce de forma monótona em toda a faixa.nenhuma observação podadaquase tudo podadomaisdesbal.menosdado originalpropensãopareamento nas covariáveispoda aleatóriaponto em que a propensãojá alcançou o próprio alvo
Depois que a propensão alcança o alvo dela, apertar mais o critério equivale a jogar dados. A curva vermelha reproduz o formato relatado por King e Nielsen nas duas replicações publicadas.

Os autores refizeram duas pesquisas publicadas com dados reais e viram o paradoxo aparecer imediatamente e continuar até não sobrar dado: quanto mais estrito o critério de propensão, pior o balanceamento. A prática consagrada de fixar o limite de aproximação em um quarto do desvio-padrão do escore deixou o balanceamento pior do que a solução básica num dos casos e não trouxe melhora nenhuma no outro. As curvas dos métodos que pareiam direto nas covariáveis desceram na faixa inteira, sem nenhum sinal de reversão.

A lição operacional é curta: se você usa propensão, meça o balanceamento nas covariáveis, não no escore, e desenhe a curva de desbalanceamento contra observações podadas antes de escolher o ponto de corte. Se a curva sobe, você está apertando um parafuso na direção errada.

Sobreposição e teste placebo: as duas verificações que valem mais que o método

Imbens e Xu revisitaram, quatro décadas depois, o experimento que fundou essa discussão: o programa de treinamento avaliado por LaLonde em 1986, cujos dados públicos viraram o campo de testes padrão da área. Eles listam cinco lições da literatura desde então, e duas delas resolvem a maior parte dos problemas do dia a dia.

Sobreposição. As distribuições de covariáveis dos dois grupos precisam ter suporte comum: para cada tratado, precisa existir controle comparável. Sem isso, o modelo não está comparando, está extrapolando. A conclusão deles é forte e prática: quando a sobreposição é ruim, aparar a amostra para garanti-la importa mais do que a escolha do estimador. Na amostra clássica em que a referência experimental era 1.794 dólares, o corte para garantir sobreposição fez as estimativas dos vários métodos convergirem em torno da referência, ao custo de intervalos ligeiramente mais largos. Na amostra pior comportada, as estimativas do dado completo variaram de 4 a 2.420 dólares dependendo do método.

Sobreposição boa e sobreposição ruimDois painéis com distribuições de escore de propensão. No painel da esquerda as curvas de expostos e não expostos se cobrem em quase toda a faixa. No painel da direita elas mal se tocam, e a região comum é uma faixa estreita no meio.sobreposição boa: dá para comparar0,01,0escore de propensãoexpostosnão expostossobreposição ruim: extrapolação0,01,0região comum: quase ninguém
Sem região comum, o pareamento não compara, ele projeta. Nenhuma sofisticação do modelo cria dado onde não existe dado.

Teste placebo. Rode a mesma análise sobre um desfecho que o tratamento não podia ter afetado, tipicamente a métrica num período anterior ao tratamento. Se a análise encontra efeito onde não pode haver, ela está capturando seleção, não causa. Esse é o teste mais barato e mais informativo do repertório, e é o que fecha a discussão nos dados de LaLonde: mesmo onde os métodos modernos reproduzem a referência experimental, o teste placebo não sustenta a premissa de ausência de confundimento. Traduzindo para o dia a dia: quando o teste placebo falha, o número certo que apareceu foi coincidência, e você não teria como saber sem o gabarito.

No seu produto, o placebo é fácil de montar. Pegue a conversão dos usuários nos 30 dias antes da existência do recurso e rode a análise pareada como se o tratamento fosse a adoção futura. Se adotantes futuros já convertiam mais antes do recurso existir, a diferença que você atribuiu ao recurso já estava lá.

Roteiro em oito passos

  1. Escreva a pergunta causal antes de abrir o banco. O que teria acontecido com quem adotou, caso não tivesse adotado. Sem essa frase, o resto é descrição.
  2. Liste as covariáveis pré-tratamento. Só o que existia ANTES da exposição. Variável medida depois pode ser consequência do tratamento, e controlar por ela apaga o efeito que você quer medir.
  3. Estime o escore. Regressão logística serve para começar. Modelo mais flexível ajuda no ajuste, não na premissa.
  4. Olhe a sobreposição antes de qualquer estimativa. Plote as duas distribuições de escore. Se elas mal se tocam, pare: o dado não responde a pergunta.
  5. Apare para garantir sobreposição. Descartar quem não tem par é honesto e muda o que você está estimando; diga no relatório qual população sobrou.
  6. Meça balanceamento nas covariáveis, uma a uma. E desenhe a curva de desbalanceamento contra poda para não cair no paradoxo.
  7. Rode o teste placebo. Desfecho pré-tratamento, mesma análise. Efeito grande ali derruba a leitura.
  8. Publique quanto de confundimento não medido derrubaria o resultado. É a análise de sensibilidade que fecha a peça, tratada em confundidor não medido.

Erros comuns

Faça isso automático na Donnu

O motivo mais comum de uma análise pareada não conseguir nem começar não é estatístico, é de dado: as covariáveis pré-tratamento não foram guardadas como estavam antes da exposição. Quando o banco só tem o estado atual do usuário, tudo o que sobra são variáveis contaminadas pelo próprio tratamento, e o pareamento passa a controlar por consequência.

A Donnu carimba o estado do usuário no momento da atribuição e guarda o resultado com a definição de métrica congelada, o que torna a sobreposição e o teste placebo consultas de minutos em vez de reconstruções de semanas. E, mais importante, ela existe para o caso em que dá para sortear: sempre que a exposição couber num sorteio, esse é o caminho, porque ele dispensa a premissa de ausência de confundimento inteira. Para saber se o seu tráfego comporta o teste sorteado antes de partir para o pareamento, a calculadora de tamanho de amostra responde em segundos, e a calculadora de significância fecha a leitura no fim.

Referências

Leia também: Diferenças em diferenças · Controle sintético · Regressão descontínua · Confundidor não medido · Intenção de tratar · Calculadora de significância · Read in English

Perguntas frequentes

O que é o escore de propensão?
É a probabilidade estimada de uma pessoa receber o tratamento, dado tudo o que você mediu sobre ela antes do tratamento. Rosenbaum e Rubin mostraram em 1983 que ajustar por esse único número escalar já basta para remover o viés causado por todas as covariáveis observadas, o que transforma um problema de parear dezenas de variáveis num problema de parear uma só.
O escore de propensão substitui um teste A/B?
Não. Ele remove viés das variáveis que você mediu, e apenas delas. Nada no método toca no que você não mediu. Na comparação de Gordon, Zettelmeyer, Bhargava e Chapsky com 12 estudos de anúncios do Facebook, a melhor especificação de pareamento por propensão ainda divergiu do resultado sorteado em metade dos casos de checkout, com desvio absoluto médio de 184 pontos percentuais contra uma média de efeito real de 57 por cento.
Quanto o pareamento por propensão corrige, na prática?
Ele encurta a distância, mas em geral não a fecha. Na simulação deste guia, a comparação ingênua de adotantes contra não adotantes devolveu mais 216,67 por cento, o pareamento com duas covariáveis devolveu mais 58,33 por cento, o pareamento com propensão rica devolveu mais 24,12 por cento, e o experimento sorteado que rodamos depois devolveu mais 4,88 por cento sem significância estatística. Cada passo corrige uma parte e nenhum passo chega ao fim.
Podar mais observações melhora o balanceamento?
Nem sempre, e essa é a descoberta contraintuitiva de King e Nielsen. O pareamento por propensão persegue um experimento completamente aleatorizado, não um experimento em blocos. Depois que ele alcança esse alvo, continuar podando o pior par vira poda aleatória, e poda aleatória aumenta o desbalanceamento em vez de reduzir. Nas duas replicações publicadas que eles refizeram, o efeito apareceu logo no início e seguiu até não sobrar dado.
O que verificar antes de acreditar num pareamento?
Três coisas, na ordem. Sobreposição: existe controle comparável para cada tratado, ou você está extrapolando. Balanceamento nas covariáveis, não no escore. E teste placebo: rode a mesma análise num desfecho que o tratamento não podia ter afetado, tipicamente um período anterior ao tratamento. Imbens e Xu mostram que, nos dados clássicos de LaLonde, os métodos modernos até reproduzem a referência experimental, mas o teste placebo não sustenta a premissa que faria isso ter significado causal.
Qual é a premissa que o método exige?
Ausência de confundimento, também chamada de ignorabilidade: condicionado às covariáveis medidas, receber o tratamento é como se fosse sorteado. Ela não é testável com os dados, e é exatamente ela que quebra quando existe um motivo não medido que empurra a pessoa tanto para o tratamento quanto para a conversão. O tamanho desse motivo se mede por análise de sensibilidade, não por mais covariáveis.