Confundidor Não Medido: quanto ele teria que ser forte
Toda leitura observacional depende do que você não mediu. A análise de sensibilidade vira número: quanto o confundidor não medido teria que ser forte.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Toda leitura observacional termina na mesma dúvida sem forma: “e se existir algo que eu não medi?”. A análise de sensibilidade transforma essa dúvida num número. Na simulação deste guia, um efeito observacional com razão de risco de 1,2412 e intervalo de 95 por cento entre 1,0757 e 1,4321 tem valor E de 1,79 no ponto e 1,36 no limite inferior: um fator não medido que dobrasse tanto a chance de adotar quanto a de converter derrubaria o resultado inteiro para 0,93, ou seja, o inverteria. Este guia mostra como calcular esse número, como interpretá-lo sem exagerar e como usá-lo para decidir quando a leitura observacional basta e quando ela só serve para justificar o experimento. Faz parte do nosso guia completo de teste A/B e fecha o arco de escore de propensão e série temporal interrompida.
O problema: a premissa que nenhum dado testa
Todo método quase-experimental depende de uma premissa que os dados não podem confirmar. Ela tem nomes diferentes em cada tradição, e o conteúdo é o mesmo:
- em pareamento por propensão, chama-se ausência de confundimento: condicionado ao que você mediu, receber o tratamento é como se fosse sorteado.
- em diferenças em diferenças, chama-se tendência comum: sem a mudança, os dois grupos teriam variado igual.
- em série temporal interrompida, é a premissa de que nada mais mudou na mesma data.
- em controle sintético, é a premissa de que a combinação de doadores continuaria acompanhando o tratado.
Nos quatro casos, a premissa é sobre o que você não observou, e é por isso que nenhum teste estatístico a verifica. O sorteio de um teste A/B resolve tudo isso de uma vez, porque ele equilibra em média até o que ninguém mediu.
A resposta ruim para esse impasse é o silêncio: publicar a estimativa e mencionar “limitações do desenho” em nota de rodapé. A resposta boa é uma pergunta quantificável: quão forte teria que ser um confundidor não medido para explicar tudo isso?
O ponto de partida: uma estimativa observacional e o que ela vale
Retomamos o exemplo do guia de escore de propensão. Depois de parear adotantes e não adotantes de um recurso por um modelo de propensão rico, sobrou isto:
| grupo | usuários | conversões | taxa |
|---|---|---|---|
| não adotantes pareados | 4.200 | 311 | 7,405% |
| adotantes | 4.200 | 386 | 9,190% |
Cole na calculadora abaixo: ela devolve mais 24,12 por cento em termos relativos e valor-p de 0,0030, sobre uma diferença bruta de 1,786 ponto percentual entre as duas taxas.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Na escala de razão de risco, que é a escala em que a análise de sensibilidade trabalha, isso é 9,190 dividido por 7,405, ou seja, razão de risco de 1,2412, com intervalo de confiança de 95 por cento entre 1,0757 e 1,4321.
O intervalo não inclui 1. Pela leitura convencional, o resultado é positivo e significativo. E ainda assim ele não responde a pergunta que importa, porque o intervalo mede ruído amostral, não viés. Se existe um motivo não medido que empurra as mesmas pessoas para adotar e para converter, a estimativa inteira está deslocada, e amostra maior só estreita o intervalo em torno do lugar errado.
O limite que vale sem premissa nenhuma
Ding e VanderWeele demonstraram em 2016 um limite que resolve isso de forma surpreendentemente enxuta. Chame de RR observado a razão que você mediu, ajustada pelo que foi medido. Chame de RR entre exposição e confundidor a maior razão de risco relacionando o tratamento ao fator não medido, e de RR entre confundidor e desfecho a maior razão relacionando esse fator ao desfecho. O resultado deles diz que a razão de risco verdadeira é pelo menos:
RR observado dividido pelo fator de limitação, onde o fator de limitação é o produto das duas associações do confundidor dividido pela soma delas menos um.
A parte notável é o que a demonstração não exige: nada sobre a distribuição do confundidor, nem que ele seja binário, nem que os efeitos sejam homogêneos, nem que não haja interação. É um limite universal.
Esse detalhe do diagrama resolve metade das discussões de reunião. “Mas e o país do usuário?” só é problema se o país prevê tanto a adoção quanto a conversão. Se ele prevê só uma das duas, ele não desloca nada.
Do limite ao valor E: um número em vez de duas incógnitas
O limite acima tem duas incógnitas, e ninguém sabe estimar as duas para um fator que, por definição, não foi medido. VanderWeele e Ding resolveram isso em 2017 com uma escolha simples: iguale as duas associações e pergunte qual valor comum seria necessário para o efeito desaparecer por completo. Esse valor é o valor E.
A conta sai direto do limite. Se as duas associações valem o mesmo número, e você exige que o efeito corrigido chegue exatamente a 1 (nenhum efeito), a equação tem uma solução fechada:
valor E = razão de risco + raiz quadrada de (razão de risco vezes (razão de risco menos 1))
Para a nossa estimativa de 1,2412: 1,2412 mais a raiz de 1,2412 vezes 0,2412, que é 1,2412 mais 0,5450, ou seja, 1,79.
A leitura é literal: um confundidor não medido teria que estar associado tanto à adoção quanto à conversão por razões de risco de pelo menos 1,79 cada, além de tudo o que já foi ajustado, para explicar completamente o efeito de 24 por cento que medimos. Se ambas as associações fossem menores que 1,79, sobraria efeito.
Aplicando ao limite inferior do intervalo, 1,0757, o valor E é 1,36. Esse é, na prática, o número mais útil dos dois: ele diz o que basta para empurrar o intervalo até o nulo, não o que basta para zerar o ponto.
| razão de risco observada | valor E do ponto |
|---|---|
| 1,05 | 1,28 |
| 1,10 | 1,43 |
| 1,20 | 1,69 |
| 1,24 | 1,79 |
| 1,30 | 1,92 |
| 1,50 | 2,37 |
| 2,00 | 3,41 |
| 3,00 | 5,45 |
| 4,00 | 7,46 |
A tabela deixa visível a assimetria que costuma surpreender: efeitos pequenos têm valores E baixos, e efeitos pequenos são exatamente o que a maior parte das otimizações de produto produz. Um resultado observacional de mais 10 por cento cai com um confundidor de 1,43, que é uma associação corriqueira em qualquer base de usuários.
O teste da realidade: o confundidor de 1,79 existe?
O valor E sozinho não decide nada. Ele vira decisão quando comparado com associações que você conhece.
Na nossa base fictícia, três candidatos óbvios a confundidor não medido:
| candidato | associação plausível com adoção | associação plausível com conversão | supera 1,79 nas duas? |
|---|---|---|---|
| engajamento prévio (sessões nos 30 dias anteriores) | alta, algo como 2,5 | alta, algo como 2,0 | sim, com folga |
| intenção declarada no onboarding | moderada, algo como 1,6 | moderada, algo como 1,5 | não |
| fuso horário | baixa | baixa | não |
Basta o primeiro. Um usuário mais engajado explora mais o produto (portanto adota mais) e está mais perto de comprar (portanto converte mais), e nenhuma dessas duas coisas foi medida se o banco só tem plano, tempo de casa e tamanho de empresa. Com as duas associações em 2,0, o fator de limitação vale 1,333, e a razão observada de 1,2412 dividida por ele dá 0,931: o efeito não só desaparece como troca de sinal.
Compare com o cenário oposto, que dá a intuição de quando o valor E protege de verdade. Ding e VanderWeele aplicaram o limite ao estudo clássico de Hammond e Horn sobre cigarro e câncer de pulmão, cuja razão de risco observada era cerca de 10,73, com intervalo de 95 por cento entre 8,02 e 14,36. Com as duas associações do confundidor em 10,73, o fator de limitação vale 5,63, e a estimativa corrigida cai para cerca de 1,91, com intervalo entre 1,42 e 2,55. Ou seja: mesmo um confundidor tão forte quanto a própria associação medida não derrubaria o limite inferior. Traduzido para valor E: 20,95 no ponto e 15,52 no limite inferior. Nenhum fator conhecido chega perto.
A diferença entre os dois casos é o tamanho do efeito. Associação enorme é robusta a confundimento; associação modesta não é. E quase tudo que se mede em produto é modesto.
A escada do guia anterior, agora com valor E em cada degrau
Uma forma útil de sentir a medida é aplicá-la às três leituras observacionais do guia de escore de propensão, do bruto ao pareado, sabendo que o experimento sorteado devolveu razão de risco de cerca de 1,05 sem significância:
| leitura | razão de risco | valor E do ponto | valor E do limite inferior | confundidor necessário existe? |
|---|---|---|---|---|
| crua, todos os não adotantes | 3,1667 | 5,79 | 5,08 | improvável nessa magnitude |
| pareada por plano e tempo de casa | 1,5833 | 2,54 | 2,09 | plausível |
| pareada por propensão rica | 1,2412 | 1,79 | 1,36 | plausível e provável |
Repare no paradoxo prático: quanto mais você conserta a estimativa, mais frágil ela fica à sensibilidade. A leitura crua tem valor E de 5,79, o que soa robusto, e ainda assim ela é a leitura mais errada das três. O valor E não mede qualidade do desenho; ele mede tamanho do efeito restante. Uma estimativa grande e enviesada tem valor E alto, e isso não é defesa nenhuma.
Por isso a ordem importa: primeiro o desenho (sobreposição, balanceamento, placebo), depois a sensibilidade. Calcular valor E sobre uma comparação crua é dar aparência de rigor a uma conta que já estava perdida.
Quando o viés puxa para o lado errado
Existe um caso simétrico que costuma ficar de fora da conversa: o confundidor pode estar escondendo um efeito, não criando um. Se o recurso foi liberado primeiro para as contas com pior conversão, na esperança de ajudá-las, a seleção empurra a estimativa para baixo. Um resultado observacional nulo, nesse caso, é compatível com um efeito positivo real.
A conta é a mesma, aplicada ao inverso. Para uma razão observada abaixo de 1, calcule o valor E sobre o inverso dela: uma razão de 0,80 vira 1,25, cujo valor E é 1,81. E para um resultado nulo, com intervalo cruzando 1, o valor E do ponto é 1 por definição, o que significa apenas “qualquer confundidor mínimo bastaria para mover isso”. Ou seja: leitura observacional nula é ainda menos informativa do que leitura observacional positiva, e nunca deve ser publicada como evidência de que algo não funciona.
Na prática do dia a dia, essa é a assimetria que mais custa dinheiro. Times aceitam um resultado observacional negativo como motivo para arquivar um recurso, quando a leitura sequer tem força para isso. O caminho correto é o mesmo dos casos positivos: tratar como hipótese e, se a decisão for cara, testar.
O que o valor E não faz
Vale ser explícito, porque a medida é fácil de usar mal:
- Ele não descobre o confundidor. Devolve o tamanho necessário, não o nome.
- Ele não prova ausência de viés. Valor E alto significa “um confundidor pequeno não basta”, nunca “não há confundidor”.
- Ele não substitui as verificações do desenho. Sobreposição, balanceamento e teste placebo continuam obrigatórios, e um placebo que falha derruba a leitura antes de qualquer análise de sensibilidade.
- Ele não cobre outros vieses. Seleção, atrito e erro de medição precisam de contas próprias, tratadas em atrito diferencial e viés de instrumentação.
- Ele não vira decisão sozinho. Só ganha sentido comparado com associações reais do domínio, e essa comparação é julgamento, não cálculo.
Quanto confundidor não medido sobra depois de todo o ajuste
Uma pergunta natural é se, com covariáveis suficientes, o confundimento restante fica pequeno o bastante. O melhor dado público sobre isso vem do trabalho de Gordon, Zettelmeyer, Bhargava e Chapsky, que compararam métodos observacionais com experimentos sorteados em 12 estudos de mensuração de anúncios do Facebook, com 435 milhões de observações de usuário por estudo.
O resultado desmonta a esperança. Mesmo a especificação que usava uma métrica composta resumindo milhares de variáveis comportamentais, a mais rica do estudo, ainda produziu estimativa estatisticamente diferente da experimental em 5 dos 10 estudos de checkout avaliados, com desvio absoluto médio de 184 pontos percentuais contra um efeito experimental médio de 57 por cento. O melhor método do artigo, regressão ajustada com ponderação pelo inverso da propensão e o conjunto mais detalhado de variáveis, divergiu em 3 de 10, com desvio de 173 pontos.
Ou seja: numa das bases mais ricas em covariáveis que existem no mundo, com milhares de sinais comportamentais por pessoa, o confundimento residual continuou grande o suficiente para inverter decisões. A quantidade de covariáveis não é o gargalo. O gargalo é que o motivo pelo qual a pessoa foi exposta raramente está no banco de quem analisa.
Como escrever isso num relatório
O bloco de três frases que fecha uma leitura observacional:
- A estimativa e a escala. “O efeito estimado é uma razão de risco de 1,24, com intervalo de 95 por cento entre 1,08 e 1,43.”
- O valor E no ponto e no limite. “Um confundidor não medido precisaria de associações de pelo menos 1,79 com a adoção e com a conversão para explicar todo o efeito, e de 1,36 para levar o intervalo até o nulo.”
- O julgamento explícito. “O engajamento prévio, que não temos medido, plausivelmente supera 1,79 nas duas pontas. Portanto tratamos este resultado como hipótese a testar, não como efeito medido.”
A terceira frase é a que muda a decisão. Ela transforma “achamos que funciona” em “vale gastar 76 dias de tráfego para descobrir”, que é uma frase acionável.
Roteiro de confundidor não medido em sete passos
- Faça o desenho quase-experimental direito primeiro. Sensibilidade não conserta sobreposição ruim nem placebo reprovado.
- Converta a estimativa para razão de risco. É a escala em que o limite funciona.
- Calcule o valor E do ponto. Razão mais a raiz da razão vezes a razão menos um.
- Calcule o valor E do limite do intervalo mais próximo do nulo. É o número que decide.
- Liste candidatos concretos a confundidor não medido, com as duas associações plausíveis de cada um.
- Compare, e diga em voz alta se algum candidato passa. Se passa, a leitura é hipótese, não conclusão.
- Se a decisão for cara, rode o experimento. A calculadora de tamanho de amostra diz em segundos quanto custa a certeza.
Erros comuns
- Publicar a estimativa com “limitações do desenho” em nota de rodapé. É a mesma coisa que não dizer nada, e o leitor vai usar o número mesmo assim.
- Calcular o valor E só no ponto. O limite do intervalo é o que decide, porque é ele que separa “efeito positivo” de “nada demonstrado”.
- Tratar valor E alto como prova de ausência de confundimento. Ele mede o tamanho necessário, não a existência.
- Comparar o valor E com nada. Sem candidatos concretos e associações plausíveis, o número é decoração.
- Esquecer que o ajuste já feito conta. As associações do valor E são condicionais ao que já foi medido, então compare com o que sobra, não com a associação bruta.
- Aplicar a confundimento o que é problema de outra natureza. Perda de dado entre grupos é atrito diferencial, não confundimento.
- Usar valor E para justificar decisão que caberia num teste. Se dá para sortear, sortear é mais barato do que discutir sensibilidade.
- Ignorar que efeito pequeno tem valor E pequeno. É a assimetria da tabela, e ela pega quase toda otimização de produto.
Faça isso automático na Donnu
A análise de sensibilidade é o passo que fecha uma leitura observacional, e ela existe justamente porque a leitura observacional é a segunda melhor opção. O jeito de nunca precisar dela é o mesmo desde o começo: quando a exposição couber num sorteio, sorteie, porque o sorteio equilibra em média até o que ninguém mediu, e é a única coisa nesta lista que faz isso.
A Donnu existe para esse caso. Ela sorteia, carimba a atribuição, guarda o resultado com a definição de métrica congelada e devolve a leitura sem premissa de ausência de confundimento no meio. Quando o sorteio não estiver disponível, use os desenhos deste arco e feche sempre com o valor E declarado no relatório. Para saber se o seu tráfego comporta o teste sorteado, a calculadora de tamanho de amostra responde em segundos, e a calculadora de significância fecha a leitura no fim.
Referências
- Ding, P. e VanderWeele, T. J. Sensitivity Analysis Without Assumptions. Epidemiology, volume 27, número 3, abril de 2016, páginas 368 a 377. Fonte do limite de viés que sustenta toda a conta deste guia: a razão de risco verdadeira é pelo menos a razão observada multiplicada pela soma das duas associações do confundidor menos um e dividida pelo produto dessas associações, sem premissa sobre a distribuição do confundidor; e do exemplo trabalhado com os dados de Hammond e Horn sobre cigarro e câncer de pulmão, com razão de risco observada de cerca de 10,73 e intervalo de 95 por cento entre 8,02 e 14,36, em que assumir as duas associações iguais a 10,73 dá fator de limitação de 5,63, estimativa corrigida de aproximadamente 1,91 e intervalo corrigido entre 1,42 e 2,55, de forma que o confundidor não derrubaria o limite inferior. pmc.ncbi.nlm.nih.gov.
- VanderWeele, T. J. e Ding, P. Sensitivity Analysis in Observational Research: Introducing the E-Value. Annals of Internal Medicine, volume 167, número 4, 2017, páginas 268 a 274. Artigo em que a medida recebeu o nome de valor E, definida como o menor grau de associação, na escala de razão de risco, que um confundidor não medido precisaria ter tanto com o tratamento quanto com o desfecho, condicionado às covariáveis medidas, para explicar completamente a associação observada. A fórmula usada neste guia é a solução fechada do limite de Ding e VanderWeele quando as duas associações são igualadas e o efeito corrigido é levado a um. acpjournals.org.
- Gordon, B., Zettelmeyer, F., Bhargava, N. e Chapsky, D. A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook. Versão longa em documento de trabalho, julho de 2016, publicado na Marketing Science em 2019. Fonte dos 12 estudos com experimento sorteado servindo de gabarito, 435 milhões de observações de usuário por estudo e 1,4 bilhão de impressões; e da Tabela 7, em que a especificação de propensão mais rica ainda divergiu do gabarito em 5 dos 10 estudos de checkout avaliados, com desvio absoluto médio de 184 pontos percentuais contra efeito experimental médio de 57 por cento, e a regressão ajustada com ponderação mais detalhada divergiu em 3 de 10, com desvio médio de 173 pontos. kellogg.northwestern.edu.
- Imbens, G. W. e Xu, Y. Comparing Experimental and Nonexperimental Methods: What Lessons Have We Learned Four Decades After LaLonde (1986)? Journal of Economic Perspectives, versão de maio de 2025. Fonte de que a literatura desenvolveu duas estratégias complementares para avaliar a plausibilidade da premissa de ausência de confundimento, análises placebo e análises de sensibilidade, e de que a premissa em si é fundamentalmente não testável a partir dos dados. arxiv.org.
Leia também: Escore de propensão · Série temporal interrompida · Diferenças em diferenças · Controle sintético · Atrito diferencial · Calculadora de significância · Read in English
Perguntas frequentes
- O que é análise de sensibilidade a confundidor não medido?
- É a conta que responde "o quanto um fator que eu não medi teria que ser forte para derrubar este resultado". Ela não descobre o confundidor nem prova que ele não existe. Ela transforma uma dúvida sem forma numa grandeza comparável com o que você conhece do seu negócio, e por isso é a única forma honesta de fechar uma leitura observacional.
- O que é o valor E?
- É o menor grau de associação, na escala de razão de risco, que um confundidor não medido precisaria ter ao mesmo tempo com o tratamento e com o desfecho para explicar todo o efeito observado. Ele se calcula direto da estimativa: o valor E é a razão de risco somada à raiz quadrada da razão vezes ela menos um. Para uma razão de 1,24, o valor E é 1,79.
- Um valor E alto prova que não há confundimento?
- Não. Ele diz que um confundidor pequeno não basta. Se o valor E é 1,79 e você sabe que o engajamento prévio dobra tanto a chance de adoção quanto a de conversão, então o confundidor necessário existe e cabe folgado. O número só ganha sentido comparado com associações reais do seu domínio.
- Como aplicar isso ao limite do intervalo de confiança?
- Calcule o valor E também no limite do intervalo mais próximo do nulo. Na simulação deste guia, a razão observada era 1,2412 com intervalo de 95 por cento entre 1,0757 e 1,4321. O valor E do ponto é 1,79 e o do limite inferior é 1,36. O segundo número é o que interessa: um confundidor com associações de 1,4 já empurra o intervalo para cima do nulo.
- De onde vem a fórmula do valor E?
- Do limite de viés demonstrado por Ding e VanderWeele em 2016, que vale sem premissa nenhuma sobre a distribuição do confundidor. O limite diz que o efeito verdadeiro é pelo menos o observado dividido por um fator que depende das duas associações do confundidor. Igualar as duas associações e exigir que o limite chegue a um devolve exatamente a fórmula do valor E.
- Quando o valor E deixa de ajudar?
- Quando o problema não é confundimento, e sim seleção, atrito ou erro de medição. O valor E responde só à pergunta do confundidor comum. Perda diferencial de dado entre os grupos, evento de conversão medido de formas diferentes ou população de análise escolhida depois do tratamento exigem outras contas.