Análise de Mediação: por onde o efeito do teste A/B passou
Análise de mediação separa o efeito direto do indireto. A conta, a armadilha de segmentar depois do sorteio e a premissa que ninguém testa.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Saber que a variação funcionou é diferente de saber por onde ela funcionou. No exemplo deste guia, um checklist de onboarding subiu a retenção de 30 dias de 23,00 para 26,16 por cento, um efeito total de 3,16 pontos com valor-p da ordem de 2,2 vezes 10 elevado a menos 16; a decomposição atribui 2,46 pontos ao caminho que passa pela criação do primeiro projeto e 0,70 ponto a todo o resto. E a leitura ingênua do mesmo dado, comparando os dois braços dentro de quem criou projeto e dentro de quem não criou, devolve dois resultados sem significância, valores-p 0,1163 e 0,2558. O efeito total é garantido pelo sorteio. A divisão entre direto e indireto, que é o que a análise de mediação entrega, não é, e este guia mostra exatamente quanto ela depende de uma premissa que nenhum dado testa. Faz parte do nosso guia completo de teste A/B e complementa métrica substituta, que responde uma pergunta parecida por outro critério.
A pergunta que vem depois do resultado
O teste venceu. A próxima pergunta na sala é sempre a mesma, e ela é legítima: por quê? Não por curiosidade, mas porque a resposta muda o que se constrói em seguida.
- se o checklist funcionou porque empurrou as pessoas a criar o primeiro projeto, então vale investir em qualquer caminho que leve a essa criação, e o checklist é só um deles.
- se o checklist funcionou por outro motivo, por exemplo por ter deixado o produto parecer mais organizado, então otimizar a criação do primeiro projeto é investir na coisa errada.
Análise de mediação é a tentativa formal de responder isso. E ela é o lugar da experimentação onde mais gente escorrega, porque a conta é fácil, o gráfico é bonito, e a premissa que sustenta tudo é invisível.
O desenho da análise de mediação: um mediador entre a variação e o desfecho
VanderWeele organiza as premissas em quatro. É preciso controlar o confundimento entre exposição e desfecho, entre mediador e desfecho, entre exposição e mediador, e é preciso que nenhum confundidor da relação mediador-desfecho seja ele próprio afetado pela exposição. A frase que interessa a quem roda teste A/B é esta:
a suposição de controle do confundimento entre mediador e desfecho não é necessária para a análise de efeitos totais num ensaio aleatorizado, mas é necessária para a análise de efeitos direto e indireto. Ela é necessária mesmo no contexto do ensaio aleatorizado porque, num ensaio, embora a exposição tenha sido aleatorizada, o mediador tipicamente não foi.
O sorteio compra o efeito total e não compra a decomposição. Imai, Keele e Tingley chamam a premissa correspondente de ignorabilidade sequencial e são igualmente diretos: ela é a suposição-chave e ainda assim não testável, e enfatizam que o segundo estágio é uma suposição forte, que precisa ser feita com cuidado, porque sempre é possível que existam variáveis não observadas confundindo a relação entre desfecho e mediador mesmo depois de condicionar no tratamento e nas covariáveis observadas.
Exemplo trabalhado: o checklist de onboarding
Um produto testa um checklist de primeiros passos com 25.000 usuários por braço. O mediador escolhido é ter criado o primeiro projeto na primeira semana. O desfecho é retenção no dia 30.
| medida | controle | checklist |
|---|---|---|
| criou o primeiro projeto | 10.000 de 25.000 = 40,0% | 13.000 de 25.000 = 52,0% |
| retidos entre quem criou | 3.500 de 10.000 = 35,0% | 4.680 de 13.000 = 36,0% |
| retidos entre quem não criou | 2.250 de 15.000 = 15,0% | 1.860 de 12.000 = 15,5% |
| retidos no total | 5.750 de 25.000 = 23,00% | 6.540 de 25.000 = 26,16% |
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Cole a última linha na calculadora: 25.000 e 5.750 contra 25.000 e 6.540. O efeito total é mais 3,1600 pontos, mais 13,74 por cento relativo, com intervalo de confiança de 95 por cento entre mais 2,4057 e mais 3,9143 pontos e valor-p da ordem de 2,2 vezes 10 elevado a menos 16, que a calculadora exibe como abaixo de 0,0001. Cole também a primeira linha, o efeito sobre o mediador: mais 12,0000 pontos, mais 30,00 por cento. O z das duas leituras não aparece na tela, porque é o passo intermediário do teste: ele vale 8,2056 no efeito total e 26,9191 no mediador.
Duas coisas são inquestionáveis aqui, porque as duas vêm direto do sorteio: a variação aumentou a retenção e a variação aumentou a criação de projeto. Tudo o que vem a seguir é interpretação.
A armadilha: segmentar por um passo pós-tratamento
A leitura que quase todo mundo faz primeiro é comparar os braços dentro de cada grupo do mediador. Ela parece inocente e é o erro mais caro da área.
| recorte | controle | checklist | efeito | valor-p |
|---|---|---|---|---|
| só quem criou projeto | 3.500 de 10.000 = 35,00% | 4.680 de 13.000 = 36,00% | mais 1,0000 ponto | 0,1163 |
| só quem não criou | 2.250 de 15.000 = 15,00% | 1.860 de 12.000 = 15,50% | mais 0,5000 ponto | 0,2558 |
| população inteira | 5.750 de 25.000 = 23,00% | 6.540 de 25.000 = 26,16% | mais 3,1600 pontos | abaixo de 0,0001 |
Cole as três na calculadora acima e confira. O resultado é desconcertante: o efeito é altamente significativo no todo e desaparece nas duas metades. Nenhum dos dois recortes cruza a linha de 5 por cento.
A explicação é aritmética, não estatística. O tratamento moveu gente entre os dois grupos: 3.000 pessoas que estariam no grupo sem projeto foram para o grupo com projeto. Como o grupo com projeto retém muito mais, o total sobe sem que a taxa dentro de nenhum dos dois grupos precise subir quase nada. Os recortes não são comparáveis porque não contêm as mesmas pessoas.
Dmitriev, Gupta, Kim e Vaz registram o caso espelhado, num experimento de ranqueamento do Bing: os dois grupos definidos por ter visto ou não um deeplink mostraram aumento estatisticamente significativo em sessões por usuário, e a combinação dos dois não mostrou mudança. A causa foi a mesma: a fração de usuários no primeiro grupo caiu no tratamento, e quem saiu era menos ativo que a média daquele grupo e mais ativo que a média do outro. A lição que eles tiram é a regra que fecha esta seção: garanta que a condição usada para definir o segmento não seja impactada pelo tratamento.
Ou seja, a decomposição correta não pode ser feita comparando dentro dos grupos do mediador. Precisa de outra conta.
A conta certa: fixar a distribuição do mediador
A decomposição em efeitos naturais responde uma pergunta contrafactual: quanto do efeito sobraria se a variação continuasse ativa mas o mediador se comportasse como no controle?
Basta aplicar as taxas de retenção do braço tratado sobre a distribuição de mediador do braço de controle:
retenção do tratado com a mistura do controle = 0,40 vezes 36,00 mais 0,60 vezes 15,50 = 14,40 mais 9,30 = 23,70 por cento.
Com esse número, a decomposição sai inteira:
| componente | conta | valor |
|---|---|---|
| efeito total | 26,16 menos 23,00 | mais 3,1600 pontos |
| efeito direto natural | 23,70 menos 23,00 | mais 0,7000 ponto |
| efeito indireto natural | 26,16 menos 23,70 | mais 2,4600 pontos |
| soma dos dois | 0,70 mais 2,46 | mais 3,1600 pontos |
| proporção mediada | 2,46 dividido por 3,16 | 77,85% |
O indireto também sai por um caminho mais curto e vale conferir: a variação moveu o mediador em 12 pontos, e a distância de retenção entre quem criou e quem não criou, dentro do braço tratado, é 36,00 menos 15,50, ou seja, 20,5 pontos. O produto 0,12 vezes 20,5 dá exatamente 2,46 pontos. É esse produto que carrega a premissa inteira, porque ele trata os 20,5 pontos como se fossem um efeito causal de criar o projeto, e não a diferença entre duas populações de pessoas diferentes.
Quanto isso aguenta: a varredura que deveria acompanhar todo número
A decomposição inteira depende de os 20,5 pontos serem causa e não seleção. E é claro que parte deles é seleção: quem cria projeto na primeira semana é, em média, mais motivado, e teria retido mais de qualquer forma.
Imai, Keele e Tingley resolvem isso com um parâmetro de sensibilidade, a correlação entre os erros do modelo do mediador e do modelo do desfecho, que vale zero sob ignorabilidade sequencial e cujos valores diferentes de zero representam desvios dela. A versão de guardanapo dessa ideia, que qualquer analista roda numa planilha, é assumir que uma fração do contraste entre quem passou e quem não passou pelo mediador é confundimento:
| fração do contraste que é confundimento | efeito indireto | efeito direto | proporção mediada |
|---|---|---|---|
| 0% (ignorabilidade sequencial perfeita) | 2,460 pontos | 0,700 ponto | 77,8% |
| 25% | 1,845 ponto | 1,315 ponto | 58,4% |
| 50% | 1,230 ponto | 1,930 ponto | 38,9% |
| 75% | 0,615 ponto | 2,545 pontos | 19,5% |
| 100% (nada do contraste é causal) | 0,000 ponto | 3,160 pontos | 0,0% |
Repare na coluna que não se move: o efeito total é 3,160 pontos em todas as linhas, porque ele vem do sorteio e nenhuma premissa sobre o mediador o toca. O que se move é a história inteira sobre o mecanismo, de “quase tudo passou pelo primeiro projeto” a “o primeiro projeto não teve nada a ver com isso”.
Essa tabela é o resultado honesto de uma análise de mediação. Um número único de proporção mediada, sem ela, é uma opinião com casas decimais.
Mediador não é métrica substituta
As duas ideias se parecem e servem para coisas diferentes:
| mediador | métrica substituta | |
|---|---|---|
| pergunta | por onde o efeito passou | posso decidir antes do desfecho chegar |
| critério | causal, e não testável | preditivo, e verificável em histórico |
| quando é útil | depois do teste, para orientar o roadmap | durante o teste, para encurtar a espera |
| falha típica | confundimento entre mediador e desfecho | o substituto capta só parte do efeito |
Uma métrica pode ser excelente substituta e péssima mediadora, e vice-versa. O tratamento completo do lado preditivo está em métrica substituta em teste A/B; aqui o assunto é só o lado causal.
O que fazer quando a decomposição não convence
Se a varredura de sensibilidade mostra que a história muda de figura no meio da faixa, e ela quase sempre mostra, existem três saídas, em ordem de custo:
- Reportar total e mecanismo separados. O total decide se a variação fica. O mecanismo entra como hipótese, com a faixa de sensibilidade ao lado. É honesto e não custa nada.
- Medir mais covariáveis pré-tratamento. Quanto mais do perfil de motivação da pessoa você tiver medido antes do sorteio, menos sobra para o confundidor não medido. Isso encolhe a faixa, não a elimina.
- Aleatorizar o mediador. Se a decisão de produto realmente depende de saber se criar o primeiro projeto causa retenção, o caminho é um segundo experimento cujo alvo seja essa criação. Quando o passo não pode ser imposto, o desenho de encorajamento é exatamente a ferramenta para isso, e ele traz o seu próprio conjunto de premissas, mais fracas do que as da mediação.
O ponto três é o que fecha o assunto de verdade, e vale registrar que ele quase nunca é a primeira opção proposta na reunião, porque parece caro. Comparado com um ano de roadmap construído sobre uma decomposição frágil, é barato.
Escolher o mediador antes de ver o dado
O mediador precisa ser declarado no plano de análise, junto com a métrica primária, e não escolhido depois entre os candidatos que sobraram. Três critérios ajudam a decidir qual passo merece essa vaga:
| critério | pergunta | por que importa |
|---|---|---|
| ordem temporal limpa | o mediador acontece depois da exposição e antes do desfecho, sem janela sobreposta? | mediador medido junto com o desfecho não permite separar causa de consequência |
| plausibilidade de mecanismo | existe uma história de produto que explique por que esse passo levaria ao desfecho? | sem mecanismo declarado, a decomposição vira ajuste de curva |
| acionabilidade | se o caminho for real, existe alguma coisa que o time faria diferente? | mediador que não muda decisão nenhuma não vale a análise |
O terceiro critério elimina a maioria dos candidatos, e isso é bom. Criar o primeiro projeto passa nos três: acontece na primeira semana, tem mecanismo óbvio (quem já investiu trabalho no produto volta) e é acionável de várias formas diferentes do checklist testado.
Vale um último cuidado de escopo: o mediador deve ser um evento único e bem definido, não uma métrica composta. Um índice de engajamento que soma cliques, sessões e tempo de tela não tem ordem temporal clara em relação ao desfecho, e a decomposição sobre ele não significa nada.
Um roteiro de seis passos
- Declare o mediador no plano de análise, antes de rodar, junto da métrica primária. O plano pré-registrado é o lugar dessa declaração.
- Leia primeiro o efeito total. Se ele não existe, não há o que decompor, e procurar mecanismo num resultado nulo é a forma mais rápida de encontrar um falso positivo.
- Leia o efeito da variação sobre o mediador. Se a variação não moveu o mediador, o efeito indireto é zero por construção e a resposta é que o caminho não é esse.
- Monte a barra do meio. Aplique as taxas do braço tratado sobre a distribuição de mediador do braço de controle. É uma linha de planilha e é a única conta que a decomposição exige.
- Rode a varredura de sensibilidade com pelo menos as cinco linhas da tabela acima. Publique a faixa, não só o ponto.
- Nunca segmente por mediador para comparar braços. Se alguém pedir esse recorte na reunião, mostre a tabela da terceira seção, com o efeito significativo no todo e nulo nas duas metades.
Erros comuns
- Segmentar por comportamento pós-tratamento e chamar de análise de mediação. É a armadilha da terceira seção, e produz o padrão em que o efeito some das duas metades.
- Reportar proporção mediada sem faixa de sensibilidade. O número existe, mas ele é o menos estável do relatório.
- Escolher o mediador depois de ver os dados. Testar dez candidatos e reportar o que deu a maior proporção mediada é o mesmo problema de múltiplas métricas, agravado pela ausência de correção.
- Usar um mediador medido depois do desfecho. A ordem temporal precisa ser variação, depois mediador, depois desfecho, sem sobreposição de janela.
- Somar proporções mediadas de vários mediadores. VanderWeele registra que essa abordagem informal falha se os mediadores se afetam entre si, e continua falhando se houver interação entre os efeitos deles sobre o desfecho, mesmo que um não afete o outro.
- Confundir efeito direto pequeno com efeito direto ausente. Os 0,70 ponto deste exemplo continuam sendo quase um quarto do efeito total.
Faça isso automático na Donnu
Nada de mediação é possível sem uma coisa decidida antes do teste: o mediador precisa ser um evento registrado com carimbo de tempo próprio, separado do desfecho, e as covariáveis pré-tratamento precisam ter sido guardadas no estado em que estavam no instante do sorteio. Reconstruir isso depois, a partir do estado atual do usuário, contamina justamente as variáveis que serviriam para encolher a faixa de sensibilidade.
A Donnu carimba o estado do usuário na atribuição e mantém cada evento intermediário como evento próprio, o que deixa a tabela de quatro linhas do exemplo acima disponível sem reconstrução manual. E vale a regra geral: quando o passo intermediário puder ser aleatorizado, aleatorize, porque isso troca uma premissa não testável por um segundo experimento. A calculadora de significância fecha as leituras de efeito total e de primeiro estágio com os mesmos números que você colaria à mão.
Referências
- VanderWeele, T. J. Mediation Analysis: A Practitioner’s Guide. Annual Review of Public Health, volume 37, 2016, páginas 17 a 32. Fonte das quatro suposições de confundimento numeradas no artigo (exposição e desfecho, mediador e desfecho, exposição e mediador, e a exigência de que nenhum confundidor da relação mediador-desfecho seja afetado pela exposição); da afirmação de que a suposição sobre confundimento entre mediador e desfecho não é necessária para a análise de efeitos totais num ensaio aleatorizado mas é necessária para efeitos direto e indireto, e é necessária mesmo no ensaio aleatorizado porque o mediador tipicamente não foi aleatorizado; e do registro de que somar a proporção mediada de vários mediadores um a um falha quando os mediadores se afetam entre si e também quando há interação entre os efeitos deles sobre o desfecho. annualreviews.org.
- Imai, K., Keele, L. e Tingley, D. A General Approach to Causal Mediation Analysis. Psychological Methods, volume 15, número 4, 2010, páginas 309 a 334. Fonte da definição de ignorabilidade sequencial em duas partes (o tratamento é independente dos desfechos e mediadores potenciais dadas as covariáveis pré-tratamento, e o mediador observado é independente dos desfechos potenciais dado o tratamento observado e as covariáveis pré-tratamento); do registro de que essa é a suposição-chave e não testável para a identificação; do alerta de que o segundo estágio é uma suposição forte e sempre pode ser violado por variáveis não observadas que confundem a relação entre mediador e desfecho; e da proposta de análise de sensibilidade pela correlação entre os erros do modelo do mediador e do modelo do desfecho, que vale zero sob ignorabilidade sequencial. imai.fas.harvard.edu.
- Dmitriev, P., Gupta, S., Kim, D. W. e Vaz, G. A Dirty Dozen: Twelve Common Metric Interpretation Pitfalls in Online Controlled Experiments. KDD 2017. Fonte do caso do Bing em que os dois grupos definidos por ter visto ou não um deeplink mostraram aumento estatisticamente significativo em sessões por usuário enquanto a combinação dos dois não mostrou mudança, com a explicação de que a fração de usuários no primeiro grupo caiu no tratamento e os que saíram eram menos ativos que a média daquele grupo e mais ativos que a média do outro; e da lição de garantir que a condição usada para definir o segmento não seja impactada pelo tratamento, verificável por um teste de proporção de amostra em cada grupo do segmento. exp-platform.com.
Leia também: Métrica substituta · Desenho de encorajamento · Efeito heterogêneo por segmento · Paradoxo de Simpson · Confundidor não medido · Calculadora de significância · Read in English
Perguntas frequentes
- O que é análise de mediação num teste A/B?
- É a decomposição do efeito total da variação em duas partes: o efeito indireto, que passa por um passo intermediário que a variação mexeu, e o efeito direto, que é tudo o mais. No exemplo deste guia, um checklist de onboarding subiu a retenção de 30 dias em 3,16 pontos percentuais, e a decomposição atribui 2,46 pontos ao caminho que passa pela criação do primeiro projeto e 0,70 ponto a todo o resto, ou seja, 77,85 por cento do efeito mediado.
- Aleatorizar o teste já basta para calcular efeito direto e indireto?
- Não. VanderWeele é explícito: a suposição de controle do confundimento entre mediador e desfecho não é necessária para a análise do efeito total, mas é necessária para a análise dos efeitos direto e indireto, e é necessária mesmo quando a exposição foi aleatorizada, porque num experimento o mediador tipicamente não foi aleatorizado. O sorteio garante o total, não a decomposição.
- Por que não posso simplesmente comparar quem passou pelo passo intermediário nos dois braços?
- Porque esse recorte é definido por um comportamento que o próprio tratamento alterou, e comparar dentro dele quebra o sorteio. No exemplo, o efeito total é altamente significativo, com valor-p da ordem de 2,2 vezes 10 elevado a menos 16, e ainda assim os dois recortes pós-tratamento saem sem significância, com valores-p 0,1163 e 0,2558. O efeito some das duas metades e continua existindo no todo.
- Quanto a decomposição depende da premissa não testável?
- Muito. O efeito total é fixo pelo sorteio, mas a divisão entre direto e indireto se move inteira. Se metade do contraste entre quem passou e quem não passou pelo mediador for confundimento e não causa, a proporção mediada cai de 77,8 para 38,9 por cento. No limite em que tudo for confundimento, ela cai a zero e o mesmo efeito total passa a ser inteiramente direto.
- Mediador e métrica substituta são a mesma coisa?
- Não. A métrica substituta existe para você poder ler o resultado antes do desfecho final chegar, e o critério de aceitação é preditivo. O mediador existe para explicar por onde o efeito passou, e o critério é causal. Uma métrica pode ser um bom substituto sem ser mediadora, e um mediador pode ser péssimo substituto por chegar tarde demais.
- O que fazer quando a decomposição não se sustenta?
- Reportar o efeito total, que é sólido, e apresentar a decomposição como hipótese de mecanismo com a sua faixa de sensibilidade, nunca como número único. Se a decisão de produto depende de saber se o caminho é real, o passo seguinte não é mais estatística, é um segundo experimento que aleatorize o próprio mediador ou um desenho que encoraje o passo intermediário diretamente.