Escore de Propensão: montar o par que o sorteio não montou
O escore de propensão colapsa dezenas de covariáveis num número só para parear tratado e controle. O que ele conserta, o que não conserta e onde piora.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Comparar quem usou com quem não usou é a leitura mais fácil de produzir e a mais fácil de errar. Na simulação deste guia, a comparação crua entre adotantes e não adotantes de um recurso devolveu mais 216,67 por cento, o pareamento por escore de propensão com covariáveis ricas derrubou isso para mais 24,12 por cento, e o teste sorteado que rodamos em seguida devolveu mais 4,88 por cento, sem significância estatística. O escore de propensão é uma ferramenta legítima e muito bem fundamentada, e ainda assim ela conserta apenas o que você mediu. Este guia mostra a conta, o teto teórico dela, e as três verificações que separam uma leitura defensável de uma justificativa cara. Faz parte do nosso guia completo de teste A/B e complementa diferenças em diferenças e controle sintético.
O problema: quem usou não é igual a quem não usou
A pergunta chega sempre no mesmo formato. Subimos um recurso novo, parte dos usuários adotou, e o time quer saber se adotar aumenta conversão. O dado está todo no banco. A comparação sai em uma consulta.
Só que a adoção não foi sorteada. Quem adotou escolheu adotar, e essa escolha tem causas:
- quem já ia converter adota mais. O usuário engajado explora o produto, acha o recurso e usa. Ele converteria de qualquer jeito.
- o produto empurrou para quem parecia promissor. Se o recurso foi liberado primeiro para um plano, uma faixa de tamanho de empresa ou uma coorte, a adoção carrega essa seleção inteira.
- a exposição foi decidida por um modelo. Recomendação, segmentação de campanha, gatilho de e-mail. Nesse caso a exposição foi literalmente otimizada para acertar quem tinha mais chance de converter.
- o tempo de casa contamina tudo. Usuário antigo teve mais oportunidades de adotar e mais oportunidades de converter, e as duas coisas crescem juntas sem uma causar a outra.
Esse é o problema clássico de confundimento. A diferença observada entre os dois grupos mistura o efeito do recurso com a diferença entre as pessoas. O escore de propensão é uma tentativa organizada de separar as duas coisas usando o que você mediu.
Vale registrar de saída que o caminho preferido continua sendo sortear. Quando dá para sortear a exposição, sorteie, e use a calculadora de tamanho de amostra para saber quanto tempo isso leva. O escore de propensão é o que se faz quando o sorteio não está disponível, não uma alternativa equivalente a ele.
As quatro leituras do mesmo dado, e a calculadora que reproduz cada uma
Simulamos uma base de produto com um recurso novo. Quatro leituras do mesmo fenômeno, da mais crua para a mais cuidadosa, e no fim o experimento sorteado que serve de gabarito.
| leitura | controle | tratado | efeito relativo | valor-p |
|---|---|---|---|---|
| crua (todos os não adotantes) | 630 de 21.000 = 3,000% | 456 de 4.800 = 9,500% | mais 216,67% | abaixo de 0,0001 |
| pareada por plano e tempo de casa | 288 de 4.800 = 6,000% | 456 de 4.800 = 9,500% | mais 58,33% | abaixo de 0,0001 |
| pareada por propensão rica | 311 de 4.200 = 7,405% | 386 de 4.200 = 9,190% | mais 24,12% | 0,0030 |
| experimento sorteado | 1.517 de 18.500 = 8,200% | 1.591 de 18.500 = 8,600% | mais 4,88% | 0,1655 |
Cole qualquer uma das quatro linhas na calculadora abaixo e confira. Os números são os mesmos, o veredito muda a cada linha.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Três coisas para reparar nessa tabela.
A taxa do tratado quase não se mexe. Ela sai de 9,500 para 9,190 por cento entre a leitura crua e a pareada rica, e a mudança vem só de perder alguns tratados sem par disponível. O que muda de verdade é a taxa do controle: 3,000, depois 6,000, depois 7,405 por cento. O pareamento não mexe no tratamento, ele troca com quem você compara.
O valor-p continua bonito enquanto o efeito encolhe. Na terceira linha, o efeito já caiu para menos de um nono do original e o valor-p ainda é 0,0030, com intervalo de confiança de 95 por cento entre mais 0,607 e mais 2,965 pontos percentuais. Significância estatística não mede viés. Ela mede ruído amostral, e sobra ruído de menos quando a amostra é grande.
A quarta linha é a única que responde a pergunta feita. Mais 0,400 ponto, mais 4,88 por cento, com intervalo entre menos 0,165 e mais 0,965 ponto e valor-p de 0,1655. Ou seja: nem sequer dá para afirmar que houve efeito. Todas as três leituras observacionais afirmaram, com confiança crescente na aparência e decrescente na realidade.
O que o escore de propensão é, exatamente
O escore de propensão de uma pessoa é a probabilidade estimada de ela ter recebido o tratamento, dado tudo o que você mediu sobre ela antes. Se um usuário tem escore 0,65, o modelo diz que pessoas com aquele perfil adotaram o recurso em cerca de 65 por cento das vezes.
O resultado que fundou o campo veio de Rosenbaum e Rubin, na Biometrika em 1983. O resumo do artigo é direto: a teoria em amostras grandes e pequenas mostra que ajustar pelo escore de propensão escalar é suficiente para remover o viés devido a todas as covariáveis observadas. Repare nas duas palavras que carregam o método inteiro: covariáveis observadas.
Isso é o que torna a técnica tão útil. Você tem 40 variáveis e não consegue parear em todas ao mesmo tempo, porque o número de células cresce de forma explosiva. O escore colapsa as 40 num único número, e parear nesse número entrega, em média, grupos equilibrados nas 40. É uma redução de dimensão com garantia teórica.
Na prática, três famílias de uso convivem, e elas diferem principalmente em quanto dado jogam fora:
| família | o que faz | descarta dado? | quando escolher |
|---|---|---|---|
| pareamento | para cada tratado, pega o controle de escore mais próximo | sim, e bastante | quando você quer o efeito sobre os tratados e prefere transparência a eficiência |
| estratificação | corta a amostra em faixas de escore e compara dentro de cada faixa | pouco, só faixas sem os dois grupos | quando a sobreposição é razoável e você quer ver o efeito por faixa |
| ponderação pelo inverso da propensão | mantém todo mundo e pesa cada pessoa pelo inverso da chance de estar no grupo em que está | não, mas escores extremos viram pesos gigantes | quando a sobreposição é boa e você não quer perder amostra |
Repare no risco escondido da terceira linha: um controle com escore 0,99, que quase certamente teria sido exposto e não foi, recebe peso enorme. Uma única pessoa passa a mandar na estimativa. É por isso que aparar escores extremos é rotina, não exceção.
A escada de correção, medida contra o gabarito
O melhor teste público dessa escada veio de Gordon, Zettelmeyer, Bhargava e Chapsky, que usaram 12 estudos de mensuração de anúncios do Facebook nos Estados Unidos, com 435 milhões de observações de usuário por estudo e 1,4 bilhão de impressões. Em cada estudo existia um experimento sorteado de verdade servindo de gabarito, e eles refizeram a mesma medição pelos métodos observacionais que a indústria usa.
No estudo 4, a escada foi assim:
| método | efeito estimado |
|---|---|
| exposto contra não exposto, sem ajuste | mais 416% |
| pareamento exato em idade e gênero | mais 221% |
| propensão com variáveis comuns da plataforma | mais 147% |
| propensão mais cerca de 40 variáveis de censo | mais 154% |
| propensão mais métrica composta de milhares de sinais comportamentais | mais 102% |
| experimento sorteado (gabarito) | mais 77% |
O padrão é o mesmo da nossa simulação: cada camada de sofisticação encurta a distância, e nenhuma camada chega ao fim. Ir de pareamento exato para propensão rica levou o efeito de 221 para 102 por cento, o que é uma melhora enorme, e ainda assim sobrou uma diferença de 25 pontos sobre um gabarito de 77.
Olhando o conjunto dos estudos, os autores contaram quantas vezes cada método produziu uma estimativa estatisticamente diferente da experimental. Para os desfechos de checkout, o pareamento exato divergiu do gabarito em 10 dos 11 estudos avaliados, com desvio absoluto médio de 661 pontos percentuais contra um efeito experimental médio de 57 por cento. As especificações de propensão melhoraram esse quadro sem resolvê-lo: 9 de 11 na primeira, 8 de 10 na segunda, 5 de 10 na mais rica, esta última com desvio absoluto médio de 184 pontos. A regressão ajustada com ponderação pelo inverso da propensão e o conjunto mais detalhado de variáveis foi o melhor método do estudo, e ainda divergiu em 3 de 10 casos, com desvio médio de 173 pontos.
Esse é o resultado central para quem trabalha com produto: o escore de propensão melhora muito a leitura e não a torna confiável. Ele reduz o erro em ordem de grandeza e deixa um erro que continua sendo maior que o efeito que você quer medir.
O paradoxo: podar mais pode piorar
Existe um segundo problema, mais sutil e menos conhecido, apontado por Gary King e Richard Nielsen na Political Analysis em 2019, num artigo com o título direto de “Why Propensity Scores Should Not Be Used for Matching”.
O argumento é sobre qual experimento o método está tentando imitar. Pense em dois desenhos experimentais. No experimento completamente aleatorizado, você sorteia quem entra em cada braço e pronto: os grupos ficam iguais em média, com variação amostral. No experimento em blocos, você primeiro agrupa pessoas idênticas nas covariáveis e só então sorteia dentro de cada bloco: os grupos ficam iguais em média e também em cada bloco, o que é mais eficiente.
O pareamento por escore de propensão persegue o primeiro alvo. Ele procura um subconjunto dos dados em que a exposição seja como se fosse completamente aleatória. Métodos que pareiam diretamente nas covariáveis, como distância de Mahalanobis ou pareamento exato grosseiro, perseguem o segundo. Daí vem a consequência que os autores chamam de paradoxo: depois que o pareamento por propensão atinge o próprio alvo, os escores dentro de cada estrato já são aproximadamente constantes, e continuar podando o par de maior distância de escore vira poda aleatória com respeito às covariáveis.
E poda aleatória aumenta desbalanceamento. O argumento mais simples deles cabe numa linha: com um homem e uma mulher no tratamento e um homem e uma mulher no controle, dado perfeitamente balanceado, largar duas das quatro observações ao acaso deixa um par homem com homem ou mulher com mulher em metade das vezes, e um par cruzado, completamente desbalanceado, na outra metade. Na média, o desbalanceamento aumentou.
Os autores refizeram duas pesquisas publicadas com dados reais e viram o paradoxo aparecer imediatamente e continuar até não sobrar dado: quanto mais estrito o critério de propensão, pior o balanceamento. A prática consagrada de fixar o limite de aproximação em um quarto do desvio-padrão do escore deixou o balanceamento pior do que a solução básica num dos casos e não trouxe melhora nenhuma no outro. As curvas dos métodos que pareiam direto nas covariáveis desceram na faixa inteira, sem nenhum sinal de reversão.
A lição operacional é curta: se você usa propensão, meça o balanceamento nas covariáveis, não no escore, e desenhe a curva de desbalanceamento contra observações podadas antes de escolher o ponto de corte. Se a curva sobe, você está apertando um parafuso na direção errada.
Sobreposição e teste placebo: as duas verificações que valem mais que o método
Imbens e Xu revisitaram, quatro décadas depois, o experimento que fundou essa discussão: o programa de treinamento avaliado por LaLonde em 1986, cujos dados públicos viraram o campo de testes padrão da área. Eles listam cinco lições da literatura desde então, e duas delas resolvem a maior parte dos problemas do dia a dia.
Sobreposição. As distribuições de covariáveis dos dois grupos precisam ter suporte comum: para cada tratado, precisa existir controle comparável. Sem isso, o modelo não está comparando, está extrapolando. A conclusão deles é forte e prática: quando a sobreposição é ruim, aparar a amostra para garanti-la importa mais do que a escolha do estimador. Na amostra clássica em que a referência experimental era 1.794 dólares, o corte para garantir sobreposição fez as estimativas dos vários métodos convergirem em torno da referência, ao custo de intervalos ligeiramente mais largos. Na amostra pior comportada, as estimativas do dado completo variaram de 4 a 2.420 dólares dependendo do método.
Teste placebo. Rode a mesma análise sobre um desfecho que o tratamento não podia ter afetado, tipicamente a métrica num período anterior ao tratamento. Se a análise encontra efeito onde não pode haver, ela está capturando seleção, não causa. Esse é o teste mais barato e mais informativo do repertório, e é o que fecha a discussão nos dados de LaLonde: mesmo onde os métodos modernos reproduzem a referência experimental, o teste placebo não sustenta a premissa de ausência de confundimento. Traduzindo para o dia a dia: quando o teste placebo falha, o número certo que apareceu foi coincidência, e você não teria como saber sem o gabarito.
No seu produto, o placebo é fácil de montar. Pegue a conversão dos usuários nos 30 dias antes da existência do recurso e rode a análise pareada como se o tratamento fosse a adoção futura. Se adotantes futuros já convertiam mais antes do recurso existir, a diferença que você atribuiu ao recurso já estava lá.
Roteiro em oito passos
- Escreva a pergunta causal antes de abrir o banco. O que teria acontecido com quem adotou, caso não tivesse adotado. Sem essa frase, o resto é descrição.
- Liste as covariáveis pré-tratamento. Só o que existia ANTES da exposição. Variável medida depois pode ser consequência do tratamento, e controlar por ela apaga o efeito que você quer medir.
- Estime o escore. Regressão logística serve para começar. Modelo mais flexível ajuda no ajuste, não na premissa.
- Olhe a sobreposição antes de qualquer estimativa. Plote as duas distribuições de escore. Se elas mal se tocam, pare: o dado não responde a pergunta.
- Apare para garantir sobreposição. Descartar quem não tem par é honesto e muda o que você está estimando; diga no relatório qual população sobrou.
- Meça balanceamento nas covariáveis, uma a uma. E desenhe a curva de desbalanceamento contra poda para não cair no paradoxo.
- Rode o teste placebo. Desfecho pré-tratamento, mesma análise. Efeito grande ali derruba a leitura.
- Publique quanto de confundimento não medido derrubaria o resultado. É a análise de sensibilidade que fecha a peça, tratada em confundidor não medido.
Erros comuns
- Tratar significância estatística como evidência de ausência de viés. Na nossa terceira linha, o valor-p era 0,0030 e o efeito estava cinco vezes acima da verdade. Amostra grande estreita o intervalo em torno do número errado.
- Incluir covariáveis pós-tratamento. Sessões durante o período de exposição, cliques no próprio recurso, e-mails abertos depois. Isso é consequência, não confundidor, e controlar por elas destrói a estimativa.
- Medir balanceamento no escore em vez das covariáveis. Escores parecidos com perfis diferentes é exatamente o caso que o paradoxo de King e Nielsen descreve.
- Apertar o limite de aproximação até “melhorar”. Sem a curva de desbalanceamento, apertar é indistinguível de podar ao acaso.
- Confundir sobreposição com tamanho de amostra. Ter 15 mil controles não ajuda se nenhum deles se parece com os tratados. É melhor ter 300 comparáveis.
- Achar que mais covariáveis fecham a conta. Nos dados do Facebook, milhares de variáveis comportamentais reduziram o erro e não o eliminaram. O que falta não está no banco.
- Usar o resultado como se fosse de teste sorteado. Se a decisão é cara, o pareamento serve para priorizar o experimento, não para substituí-lo.
- Ignorar que a exposição foi otimizada por um modelo. Se um algoritmo escolheu quem ver, ele usou sinais que você provavelmente não tem no banco, e é justamente esse o confundidor que sobra.
- Esquecer o viés de instrumentação. Se a medição da conversão difere entre adotantes e não adotantes, nenhum pareamento conserta isso.
Faça isso automático na Donnu
O motivo mais comum de uma análise pareada não conseguir nem começar não é estatístico, é de dado: as covariáveis pré-tratamento não foram guardadas como estavam antes da exposição. Quando o banco só tem o estado atual do usuário, tudo o que sobra são variáveis contaminadas pelo próprio tratamento, e o pareamento passa a controlar por consequência.
A Donnu carimba o estado do usuário no momento da atribuição e guarda o resultado com a definição de métrica congelada, o que torna a sobreposição e o teste placebo consultas de minutos em vez de reconstruções de semanas. E, mais importante, ela existe para o caso em que dá para sortear: sempre que a exposição couber num sorteio, esse é o caminho, porque ele dispensa a premissa de ausência de confundimento inteira. Para saber se o seu tráfego comporta o teste sorteado antes de partir para o pareamento, a calculadora de tamanho de amostra responde em segundos, e a calculadora de significância fecha a leitura no fim.
Referências
- Rosenbaum, P. R. e Rubin, D. B. The Central Role of the Propensity Score in Observational Studies for Causal Effects. Biometrika, volume 70, número 1, abril de 1983, páginas 41 a 55. Fonte da definição do escore de propensão como probabilidade condicional de atribuição ao tratamento dado um vetor de covariáveis observadas, e do resultado de que a teoria em amostras grandes e pequenas mostra que ajustar pelo escore escalar é suficiente para remover o viés devido a todas as covariáveis observadas, com as três aplicações listadas no artigo: pareamento univariado no escore, ajuste multivariado por subclassificação e representação visual do ajuste de covariância. academic.oup.com.
- Gordon, B., Zettelmeyer, F., Bhargava, N. e Chapsky, D. A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook. Versão longa em documento de trabalho, julho de 2016, publicado na Marketing Science em 2019. Fonte dos 12 estudos de mensuração nos Estados Unidos com 435 milhões de observações de usuário por estudo e 1,4 bilhão de impressões; da escada do estudo 4 (mais 416 por cento sem ajuste, mais 221 por cento com pareamento exato, mais 147, 154 e 102 por cento nas três especificações de propensão, contra mais 77 por cento no experimento sorteado); e da Tabela 7, com 10 de 11 estudos de checkout divergindo do gabarito no pareamento exato e desvio absoluto médio de 661 pontos percentuais contra efeito experimental médio de 57 por cento, contra 9 de 11 e 296 pontos, 8 de 10 e 202 pontos, 5 de 10 e 184 pontos nas três especificações de propensão, e 3 de 10 e 173 pontos na regressão ajustada com ponderação mais detalhada. kellogg.northwestern.edu.
- King, G. e Nielsen, R. Why Propensity Scores Should Not Be Used for Matching. Political Analysis, 2019. Fonte de que o pareamento por propensão aproxima um experimento completamente aleatorizado em vez de um experimento em blocos; de que, alcançado esse alvo, continuar podando equivale a poda aleatória, que aumenta desbalanceamento (com o exemplo de quatro observações em que metade dos sorteios devolve um par cruzado); das duas replicações publicadas em que o paradoxo aparece imediatamente e segue até não sobrar dado; e de que o limite de aproximação de um quarto do desvio-padrão do escore deixou o balanceamento pior que a solução básica num caso e sem melhora no outro, enquanto as curvas de pareamento nas covariáveis desceram na faixa inteira. gking.harvard.edu.
- Imbens, G. W. e Xu, Y. Comparing Experimental and Nonexperimental Methods: What Lessons Have We Learned Four Decades After LaLonde (1986)? Journal of Economic Perspectives, versão de maio de 2025. Fonte das cinco lições da literatura desde LaLonde, entre elas a centralidade da ausência de confundimento, a necessidade de inspecionar sobreposição e a importância dos testes placebo; da referência experimental de 1.794 dólares na amostra com controles de pesquisa domiciliar e de 1.911 dólares na versão aparada, com estimativas convergindo em torno dela após o corte; da faixa de 4 a 2.420 dólares entre métodos na amostra pior comportada; e da conclusão de que, mesmo onde os métodos modernos reproduzem a referência experimental, os testes placebo não sustentam a premissa de ausência de confundimento. arxiv.org.
Leia também: Diferenças em diferenças · Controle sintético · Regressão descontínua · Confundidor não medido · Intenção de tratar · Calculadora de significância · Read in English
Perguntas frequentes
- O que é o escore de propensão?
- É a probabilidade estimada de uma pessoa receber o tratamento, dado tudo o que você mediu sobre ela antes do tratamento. Rosenbaum e Rubin mostraram em 1983 que ajustar por esse único número escalar já basta para remover o viés causado por todas as covariáveis observadas, o que transforma um problema de parear dezenas de variáveis num problema de parear uma só.
- O escore de propensão substitui um teste A/B?
- Não. Ele remove viés das variáveis que você mediu, e apenas delas. Nada no método toca no que você não mediu. Na comparação de Gordon, Zettelmeyer, Bhargava e Chapsky com 12 estudos de anúncios do Facebook, a melhor especificação de pareamento por propensão ainda divergiu do resultado sorteado em metade dos casos de checkout, com desvio absoluto médio de 184 pontos percentuais contra uma média de efeito real de 57 por cento.
- Quanto o pareamento por propensão corrige, na prática?
- Ele encurta a distância, mas em geral não a fecha. Na simulação deste guia, a comparação ingênua de adotantes contra não adotantes devolveu mais 216,67 por cento, o pareamento com duas covariáveis devolveu mais 58,33 por cento, o pareamento com propensão rica devolveu mais 24,12 por cento, e o experimento sorteado que rodamos depois devolveu mais 4,88 por cento sem significância estatística. Cada passo corrige uma parte e nenhum passo chega ao fim.
- Podar mais observações melhora o balanceamento?
- Nem sempre, e essa é a descoberta contraintuitiva de King e Nielsen. O pareamento por propensão persegue um experimento completamente aleatorizado, não um experimento em blocos. Depois que ele alcança esse alvo, continuar podando o pior par vira poda aleatória, e poda aleatória aumenta o desbalanceamento em vez de reduzir. Nas duas replicações publicadas que eles refizeram, o efeito apareceu logo no início e seguiu até não sobrar dado.
- O que verificar antes de acreditar num pareamento?
- Três coisas, na ordem. Sobreposição: existe controle comparável para cada tratado, ou você está extrapolando. Balanceamento nas covariáveis, não no escore. E teste placebo: rode a mesma análise num desfecho que o tratamento não podia ter afetado, tipicamente um período anterior ao tratamento. Imbens e Xu mostram que, nos dados clássicos de LaLonde, os métodos modernos até reproduzem a referência experimental, mas o teste placebo não sustenta a premissa que faria isso ter significado causal.
- Qual é a premissa que o método exige?
- Ausência de confundimento, também chamada de ignorabilidade: condicionado às covariáveis medidas, receber o tratamento é como se fosse sorteado. Ela não é testável com os dados, e é exatamente ela que quebra quando existe um motivo não medido que empurra a pessoa tanto para o tratamento quanto para a conversão. O tamanho desse motivo se mede por análise de sensibilidade, não por mais covariáveis.