Estatística

Confundidor Não Medido: quanto ele teria que ser forte

Toda leitura observacional depende do que você não mediu. A análise de sensibilidade vira número: quanto o confundidor não medido teria que ser forte.

Ilustração plana de dois círculos escuros ligados por uma barra horizontal com uma pequena balança no meio, e acima deles um círculo tracejado translúcido ligado aos dois por linhas finas

Toda leitura observacional termina na mesma dúvida sem forma: “e se existir algo que eu não medi?”. A análise de sensibilidade transforma essa dúvida num número. Na simulação deste guia, um efeito observacional com razão de risco de 1,2412 e intervalo de 95 por cento entre 1,0757 e 1,4321 tem valor E de 1,79 no ponto e 1,36 no limite inferior: um fator não medido que dobrasse tanto a chance de adotar quanto a de converter derrubaria o resultado inteiro para 0,93, ou seja, o inverteria. Este guia mostra como calcular esse número, como interpretá-lo sem exagerar e como usá-lo para decidir quando a leitura observacional basta e quando ela só serve para justificar o experimento. Faz parte do nosso guia completo de teste A/B e fecha o arco de escore de propensão e série temporal interrompida.

O problema: a premissa que nenhum dado testa

Todo método quase-experimental depende de uma premissa que os dados não podem confirmar. Ela tem nomes diferentes em cada tradição, e o conteúdo é o mesmo:

Nos quatro casos, a premissa é sobre o que você não observou, e é por isso que nenhum teste estatístico a verifica. O sorteio de um teste A/B resolve tudo isso de uma vez, porque ele equilibra em média até o que ninguém mediu.

A resposta ruim para esse impasse é o silêncio: publicar a estimativa e mencionar “limitações do desenho” em nota de rodapé. A resposta boa é uma pergunta quantificável: quão forte teria que ser um confundidor não medido para explicar tudo isso?

O ponto de partida: uma estimativa observacional e o que ela vale

Retomamos o exemplo do guia de escore de propensão. Depois de parear adotantes e não adotantes de um recurso por um modelo de propensão rico, sobrou isto:

grupo usuários conversões taxa
não adotantes pareados 4.200 311 7,405%
adotantes 4.200 386 9,190%

Cole na calculadora abaixo: ela devolve mais 24,12 por cento em termos relativos e valor-p de 0,0030, sobre uma diferença bruta de 1,786 ponto percentual entre as duas taxas.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Na escala de razão de risco, que é a escala em que a análise de sensibilidade trabalha, isso é 9,190 dividido por 7,405, ou seja, razão de risco de 1,2412, com intervalo de confiança de 95 por cento entre 1,0757 e 1,4321.

O intervalo não inclui 1. Pela leitura convencional, o resultado é positivo e significativo. E ainda assim ele não responde a pergunta que importa, porque o intervalo mede ruído amostral, não viés. Se existe um motivo não medido que empurra as mesmas pessoas para adotar e para converter, a estimativa inteira está deslocada, e amostra maior só estreita o intervalo em torno do lugar errado.

O limite que vale sem premissa nenhuma

Ding e VanderWeele demonstraram em 2016 um limite que resolve isso de forma surpreendentemente enxuta. Chame de RR observado a razão que você mediu, ajustada pelo que foi medido. Chame de RR entre exposição e confundidor a maior razão de risco relacionando o tratamento ao fator não medido, e de RR entre confundidor e desfecho a maior razão relacionando esse fator ao desfecho. O resultado deles diz que a razão de risco verdadeira é pelo menos:

RR observado dividido pelo fator de limitação, onde o fator de limitação é o produto das duas associações do confundidor dividido pela soma delas menos um.

A parte notável é o que a demonstração não exige: nada sobre a distribuição do confundidor, nem que ele seja binário, nem que os efeitos sejam homogêneos, nem que não haja interação. É um limite universal.

O triângulo do confundimento e as duas associações que importamDiagrama com três nós. O tratamento à esquerda aponta para o desfecho à direita. Acima deles, um nó tracejado representando o confundidor não medido aponta para os dois, com as duas setas rotuladas como as associações que entram no fator de limitação.confundidornão medidotratamento(adoção)desfecho(conversão)o que você quer medirrazão observada 1,2412associação como tratamentoassociação como desfechoO confundidor só atrapalha quando as DUAS setas vermelhas existem. Uma sozinha não gera viés.
Um fator não medido que só se associa ao tratamento, ou só ao desfecho, não é confundidor. É a combinação das duas associações que desloca a estimativa.

Esse detalhe do diagrama resolve metade das discussões de reunião. “Mas e o país do usuário?” só é problema se o país prevê tanto a adoção quanto a conversão. Se ele prevê só uma das duas, ele não desloca nada.

Do limite ao valor E: um número em vez de duas incógnitas

O limite acima tem duas incógnitas, e ninguém sabe estimar as duas para um fator que, por definição, não foi medido. VanderWeele e Ding resolveram isso em 2017 com uma escolha simples: iguale as duas associações e pergunte qual valor comum seria necessário para o efeito desaparecer por completo. Esse valor é o valor E.

A conta sai direto do limite. Se as duas associações valem o mesmo número, e você exige que o efeito corrigido chegue exatamente a 1 (nenhum efeito), a equação tem uma solução fechada:

valor E = razão de risco + raiz quadrada de (razão de risco vezes (razão de risco menos 1))

Para a nossa estimativa de 1,2412: 1,2412 mais a raiz de 1,2412 vezes 0,2412, que é 1,2412 mais 0,5450, ou seja, 1,79.

A leitura é literal: um confundidor não medido teria que estar associado tanto à adoção quanto à conversão por razões de risco de pelo menos 1,79 cada, além de tudo o que já foi ajustado, para explicar completamente o efeito de 24 por cento que medimos. Se ambas as associações fossem menores que 1,79, sobraria efeito.

Aplicando ao limite inferior do intervalo, 1,0757, o valor E é 1,36. Esse é, na prática, o número mais útil dos dois: ele diz o que basta para empurrar o intervalo até o nulo, não o que basta para zerar o ponto.

razão de risco observada valor E do ponto
1,05 1,28
1,10 1,43
1,20 1,69
1,24 1,79
1,30 1,92
1,50 2,37
2,00 3,41
3,00 5,45
4,00 7,46

A tabela deixa visível a assimetria que costuma surpreender: efeitos pequenos têm valores E baixos, e efeitos pequenos são exatamente o que a maior parte das otimizações de produto produz. Um resultado observacional de mais 10 por cento cai com um confundidor de 1,43, que é uma associação corriqueira em qualquer base de usuários.

O teste da realidade: o confundidor de 1,79 existe?

O valor E sozinho não decide nada. Ele vira decisão quando comparado com associações que você conhece.

Na nossa base fictícia, três candidatos óbvios a confundidor não medido:

candidato associação plausível com adoção associação plausível com conversão supera 1,79 nas duas?
engajamento prévio (sessões nos 30 dias anteriores) alta, algo como 2,5 alta, algo como 2,0 sim, com folga
intenção declarada no onboarding moderada, algo como 1,6 moderada, algo como 1,5 não
fuso horário baixa baixa não

Basta o primeiro. Um usuário mais engajado explora mais o produto (portanto adota mais) e está mais perto de comprar (portanto converte mais), e nenhuma dessas duas coisas foi medida se o banco só tem plano, tempo de casa e tamanho de empresa. Com as duas associações em 2,0, o fator de limitação vale 1,333, e a razão observada de 1,2412 dividida por ele dá 0,931: o efeito não só desaparece como troca de sinal.

Compare com o cenário oposto, que dá a intuição de quando o valor E protege de verdade. Ding e VanderWeele aplicaram o limite ao estudo clássico de Hammond e Horn sobre cigarro e câncer de pulmão, cuja razão de risco observada era cerca de 10,73, com intervalo de 95 por cento entre 8,02 e 14,36. Com as duas associações do confundidor em 10,73, o fator de limitação vale 5,63, e a estimativa corrigida cai para cerca de 1,91, com intervalo entre 1,42 e 2,55. Ou seja: mesmo um confundidor tão forte quanto a própria associação medida não derrubaria o limite inferior. Traduzido para valor E: 20,95 no ponto e 15,52 no limite inferior. Nenhum fator conhecido chega perto.

A diferença entre os dois casos é o tamanho do efeito. Associação enorme é robusta a confundimento; associação modesta não é. E quase tudo que se mede em produto é modesto.

Valor E em função da razão de risco observadaCurva crescente mostrando o valor E necessário conforme a razão de risco observada aumenta, com uma faixa sombreada marcando a região de efeitos típicos de produto, onde o valor E fica abaixo de dois.valor E86421nosso caso: 1,24 devolve 1,791,01,52,03,04,0razão de risco observadafaixa típica deefeito em produto
A curva sobe devagar perto de 1. É por isso que quase todo resultado observacional de produto exige um confundidor pequeno para cair, e confundidores pequenos são abundantes.

A escada do guia anterior, agora com valor E em cada degrau

Uma forma útil de sentir a medida é aplicá-la às três leituras observacionais do guia de escore de propensão, do bruto ao pareado, sabendo que o experimento sorteado devolveu razão de risco de cerca de 1,05 sem significância:

leitura razão de risco valor E do ponto valor E do limite inferior confundidor necessário existe?
crua, todos os não adotantes 3,1667 5,79 5,08 improvável nessa magnitude
pareada por plano e tempo de casa 1,5833 2,54 2,09 plausível
pareada por propensão rica 1,2412 1,79 1,36 plausível e provável

Repare no paradoxo prático: quanto mais você conserta a estimativa, mais frágil ela fica à sensibilidade. A leitura crua tem valor E de 5,79, o que soa robusto, e ainda assim ela é a leitura mais errada das três. O valor E não mede qualidade do desenho; ele mede tamanho do efeito restante. Uma estimativa grande e enviesada tem valor E alto, e isso não é defesa nenhuma.

Por isso a ordem importa: primeiro o desenho (sobreposição, balanceamento, placebo), depois a sensibilidade. Calcular valor E sobre uma comparação crua é dar aparência de rigor a uma conta que já estava perdida.

Quando o viés puxa para o lado errado

Existe um caso simétrico que costuma ficar de fora da conversa: o confundidor pode estar escondendo um efeito, não criando um. Se o recurso foi liberado primeiro para as contas com pior conversão, na esperança de ajudá-las, a seleção empurra a estimativa para baixo. Um resultado observacional nulo, nesse caso, é compatível com um efeito positivo real.

A conta é a mesma, aplicada ao inverso. Para uma razão observada abaixo de 1, calcule o valor E sobre o inverso dela: uma razão de 0,80 vira 1,25, cujo valor E é 1,81. E para um resultado nulo, com intervalo cruzando 1, o valor E do ponto é 1 por definição, o que significa apenas “qualquer confundidor mínimo bastaria para mover isso”. Ou seja: leitura observacional nula é ainda menos informativa do que leitura observacional positiva, e nunca deve ser publicada como evidência de que algo não funciona.

Na prática do dia a dia, essa é a assimetria que mais custa dinheiro. Times aceitam um resultado observacional negativo como motivo para arquivar um recurso, quando a leitura sequer tem força para isso. O caminho correto é o mesmo dos casos positivos: tratar como hipótese e, se a decisão for cara, testar.

O que o valor E não faz

Vale ser explícito, porque a medida é fácil de usar mal:

Quanto confundidor não medido sobra depois de todo o ajuste

Uma pergunta natural é se, com covariáveis suficientes, o confundimento restante fica pequeno o bastante. O melhor dado público sobre isso vem do trabalho de Gordon, Zettelmeyer, Bhargava e Chapsky, que compararam métodos observacionais com experimentos sorteados em 12 estudos de mensuração de anúncios do Facebook, com 435 milhões de observações de usuário por estudo.

O resultado desmonta a esperança. Mesmo a especificação que usava uma métrica composta resumindo milhares de variáveis comportamentais, a mais rica do estudo, ainda produziu estimativa estatisticamente diferente da experimental em 5 dos 10 estudos de checkout avaliados, com desvio absoluto médio de 184 pontos percentuais contra um efeito experimental médio de 57 por cento. O melhor método do artigo, regressão ajustada com ponderação pelo inverso da propensão e o conjunto mais detalhado de variáveis, divergiu em 3 de 10, com desvio de 173 pontos.

Ou seja: numa das bases mais ricas em covariáveis que existem no mundo, com milhares de sinais comportamentais por pessoa, o confundimento residual continuou grande o suficiente para inverter decisões. A quantidade de covariáveis não é o gargalo. O gargalo é que o motivo pelo qual a pessoa foi exposta raramente está no banco de quem analisa.

Como escrever isso num relatório

O bloco de três frases que fecha uma leitura observacional:

  1. A estimativa e a escala. “O efeito estimado é uma razão de risco de 1,24, com intervalo de 95 por cento entre 1,08 e 1,43.”
  2. O valor E no ponto e no limite. “Um confundidor não medido precisaria de associações de pelo menos 1,79 com a adoção e com a conversão para explicar todo o efeito, e de 1,36 para levar o intervalo até o nulo.”
  3. O julgamento explícito. “O engajamento prévio, que não temos medido, plausivelmente supera 1,79 nas duas pontas. Portanto tratamos este resultado como hipótese a testar, não como efeito medido.”

A terceira frase é a que muda a decisão. Ela transforma “achamos que funciona” em “vale gastar 76 dias de tráfego para descobrir”, que é uma frase acionável.

Roteiro de confundidor não medido em sete passos

  1. Faça o desenho quase-experimental direito primeiro. Sensibilidade não conserta sobreposição ruim nem placebo reprovado.
  2. Converta a estimativa para razão de risco. É a escala em que o limite funciona.
  3. Calcule o valor E do ponto. Razão mais a raiz da razão vezes a razão menos um.
  4. Calcule o valor E do limite do intervalo mais próximo do nulo. É o número que decide.
  5. Liste candidatos concretos a confundidor não medido, com as duas associações plausíveis de cada um.
  6. Compare, e diga em voz alta se algum candidato passa. Se passa, a leitura é hipótese, não conclusão.
  7. Se a decisão for cara, rode o experimento. A calculadora de tamanho de amostra diz em segundos quanto custa a certeza.

Erros comuns

Faça isso automático na Donnu

A análise de sensibilidade é o passo que fecha uma leitura observacional, e ela existe justamente porque a leitura observacional é a segunda melhor opção. O jeito de nunca precisar dela é o mesmo desde o começo: quando a exposição couber num sorteio, sorteie, porque o sorteio equilibra em média até o que ninguém mediu, e é a única coisa nesta lista que faz isso.

A Donnu existe para esse caso. Ela sorteia, carimba a atribuição, guarda o resultado com a definição de métrica congelada e devolve a leitura sem premissa de ausência de confundimento no meio. Quando o sorteio não estiver disponível, use os desenhos deste arco e feche sempre com o valor E declarado no relatório. Para saber se o seu tráfego comporta o teste sorteado, a calculadora de tamanho de amostra responde em segundos, e a calculadora de significância fecha a leitura no fim.

Referências

Leia também: Escore de propensão · Série temporal interrompida · Diferenças em diferenças · Controle sintético · Atrito diferencial · Calculadora de significância · Read in English

Perguntas frequentes

O que é análise de sensibilidade a confundidor não medido?
É a conta que responde "o quanto um fator que eu não medi teria que ser forte para derrubar este resultado". Ela não descobre o confundidor nem prova que ele não existe. Ela transforma uma dúvida sem forma numa grandeza comparável com o que você conhece do seu negócio, e por isso é a única forma honesta de fechar uma leitura observacional.
O que é o valor E?
É o menor grau de associação, na escala de razão de risco, que um confundidor não medido precisaria ter ao mesmo tempo com o tratamento e com o desfecho para explicar todo o efeito observado. Ele se calcula direto da estimativa: o valor E é a razão de risco somada à raiz quadrada da razão vezes ela menos um. Para uma razão de 1,24, o valor E é 1,79.
Um valor E alto prova que não há confundimento?
Não. Ele diz que um confundidor pequeno não basta. Se o valor E é 1,79 e você sabe que o engajamento prévio dobra tanto a chance de adoção quanto a de conversão, então o confundidor necessário existe e cabe folgado. O número só ganha sentido comparado com associações reais do seu domínio.
Como aplicar isso ao limite do intervalo de confiança?
Calcule o valor E também no limite do intervalo mais próximo do nulo. Na simulação deste guia, a razão observada era 1,2412 com intervalo de 95 por cento entre 1,0757 e 1,4321. O valor E do ponto é 1,79 e o do limite inferior é 1,36. O segundo número é o que interessa: um confundidor com associações de 1,4 já empurra o intervalo para cima do nulo.
De onde vem a fórmula do valor E?
Do limite de viés demonstrado por Ding e VanderWeele em 2016, que vale sem premissa nenhuma sobre a distribuição do confundidor. O limite diz que o efeito verdadeiro é pelo menos o observado dividido por um fator que depende das duas associações do confundidor. Igualar as duas associações e exigir que o limite chegue a um devolve exatamente a fórmula do valor E.
Quando o valor E deixa de ajudar?
Quando o problema não é confundimento, e sim seleção, atrito ou erro de medição. O valor E responde só à pergunta do confundidor comum. Perda diferencial de dado entre os grupos, evento de conversão medido de formas diferentes ou população de análise escolhida depois do tratamento exigem outras contas.