Estatística

Análise de Mediação: por onde o efeito do teste A/B passou

Análise de mediação separa o efeito direto do indireto. A conta, a armadilha de segmentar depois do sorteio e a premissa que ninguém testa.

Ilustração plana de dois caminhos ligando um círculo cheio a um anel, um passando por um círculo intermediário acima e outro seguindo reto

Saber que a variação funcionou é diferente de saber por onde ela funcionou. No exemplo deste guia, um checklist de onboarding subiu a retenção de 30 dias de 23,00 para 26,16 por cento, um efeito total de 3,16 pontos com valor-p da ordem de 2,2 vezes 10 elevado a menos 16; a decomposição atribui 2,46 pontos ao caminho que passa pela criação do primeiro projeto e 0,70 ponto a todo o resto. E a leitura ingênua do mesmo dado, comparando os dois braços dentro de quem criou projeto e dentro de quem não criou, devolve dois resultados sem significância, valores-p 0,1163 e 0,2558. O efeito total é garantido pelo sorteio. A divisão entre direto e indireto, que é o que a análise de mediação entrega, não é, e este guia mostra exatamente quanto ela depende de uma premissa que nenhum dado testa. Faz parte do nosso guia completo de teste A/B e complementa métrica substituta, que responde uma pergunta parecida por outro critério.

A pergunta que vem depois do resultado

O teste venceu. A próxima pergunta na sala é sempre a mesma, e ela é legítima: por quê? Não por curiosidade, mas porque a resposta muda o que se constrói em seguida.

Análise de mediação é a tentativa formal de responder isso. E ela é o lugar da experimentação onde mais gente escorrega, porque a conta é fácil, o gráfico é bonito, e a premissa que sustenta tudo é invisível.

O desenho da análise de mediação: um mediador entre a variação e o desfecho

Caminho direto e caminho indireto entre variação e desfechoA variação sorteada aponta para o mediador e também direto para o desfecho. O mediador aponta para o desfecho. Uma nuvem de confundidores não medidos aponta ao mesmo tempo para o mediador e para o desfecho, e é ela que quebra a decomposição.variaçãosorteadamediadornão sorteadodesfechoretenção D30efeito direto: 0,70 ppindireto: 2,46 pp no totalconfundidores não medidoso sorteio corta qualquer seta que chegue na variação. Ele não corta nenhuma das duas setas vermelhas.
A aleatorização resolve o lado esquerdo do diagrama por completo e não toca no lado direito. É exatamente aí que mora a fragilidade da decomposição.

VanderWeele organiza as premissas em quatro. É preciso controlar o confundimento entre exposição e desfecho, entre mediador e desfecho, entre exposição e mediador, e é preciso que nenhum confundidor da relação mediador-desfecho seja ele próprio afetado pela exposição. A frase que interessa a quem roda teste A/B é esta:

a suposição de controle do confundimento entre mediador e desfecho não é necessária para a análise de efeitos totais num ensaio aleatorizado, mas é necessária para a análise de efeitos direto e indireto. Ela é necessária mesmo no contexto do ensaio aleatorizado porque, num ensaio, embora a exposição tenha sido aleatorizada, o mediador tipicamente não foi.

O sorteio compra o efeito total e não compra a decomposição. Imai, Keele e Tingley chamam a premissa correspondente de ignorabilidade sequencial e são igualmente diretos: ela é a suposição-chave e ainda assim não testável, e enfatizam que o segundo estágio é uma suposição forte, que precisa ser feita com cuidado, porque sempre é possível que existam variáveis não observadas confundindo a relação entre desfecho e mediador mesmo depois de condicionar no tratamento e nas covariáveis observadas.

Exemplo trabalhado: o checklist de onboarding

Um produto testa um checklist de primeiros passos com 25.000 usuários por braço. O mediador escolhido é ter criado o primeiro projeto na primeira semana. O desfecho é retenção no dia 30.

medida controle checklist
criou o primeiro projeto 10.000 de 25.000 = 40,0% 13.000 de 25.000 = 52,0%
retidos entre quem criou 3.500 de 10.000 = 35,0% 4.680 de 13.000 = 36,0%
retidos entre quem não criou 2.250 de 15.000 = 15,0% 1.860 de 12.000 = 15,5%
retidos no total 5.750 de 25.000 = 23,00% 6.540 de 25.000 = 26,16%
Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Cole a última linha na calculadora: 25.000 e 5.750 contra 25.000 e 6.540. O efeito total é mais 3,1600 pontos, mais 13,74 por cento relativo, com intervalo de confiança de 95 por cento entre mais 2,4057 e mais 3,9143 pontos e valor-p da ordem de 2,2 vezes 10 elevado a menos 16, que a calculadora exibe como abaixo de 0,0001. Cole também a primeira linha, o efeito sobre o mediador: mais 12,0000 pontos, mais 30,00 por cento. O z das duas leituras não aparece na tela, porque é o passo intermediário do teste: ele vale 8,2056 no efeito total e 26,9191 no mediador.

Duas coisas são inquestionáveis aqui, porque as duas vêm direto do sorteio: a variação aumentou a retenção e a variação aumentou a criação de projeto. Tudo o que vem a seguir é interpretação.

A armadilha: segmentar por um passo pós-tratamento

A leitura que quase todo mundo faz primeiro é comparar os braços dentro de cada grupo do mediador. Ela parece inocente e é o erro mais caro da área.

recorte controle checklist efeito valor-p
só quem criou projeto 3.500 de 10.000 = 35,00% 4.680 de 13.000 = 36,00% mais 1,0000 ponto 0,1163
só quem não criou 2.250 de 15.000 = 15,00% 1.860 de 12.000 = 15,50% mais 0,5000 ponto 0,2558
população inteira 5.750 de 25.000 = 23,00% 6.540 de 25.000 = 26,16% mais 3,1600 pontos abaixo de 0,0001

Cole as três na calculadora acima e confira. O resultado é desconcertante: o efeito é altamente significativo no todo e desaparece nas duas metades. Nenhum dos dois recortes cruza a linha de 5 por cento.

A explicação é aritmética, não estatística. O tratamento moveu gente entre os dois grupos: 3.000 pessoas que estariam no grupo sem projeto foram para o grupo com projeto. Como o grupo com projeto retém muito mais, o total sobe sem que a taxa dentro de nenhum dos dois grupos precise subir quase nada. Os recortes não são comparáveis porque não contêm as mesmas pessoas.

Dmitriev, Gupta, Kim e Vaz registram o caso espelhado, num experimento de ranqueamento do Bing: os dois grupos definidos por ter visto ou não um deeplink mostraram aumento estatisticamente significativo em sessões por usuário, e a combinação dos dois não mostrou mudança. A causa foi a mesma: a fração de usuários no primeiro grupo caiu no tratamento, e quem saiu era menos ativo que a média daquele grupo e mais ativo que a média do outro. A lição que eles tiram é a regra que fecha esta seção: garanta que a condição usada para definir o segmento não seja impactada pelo tratamento.

Ou seja, a decomposição correta não pode ser feita comparando dentro dos grupos do mediador. Precisa de outra conta.

A conta certa: fixar a distribuição do mediador

A decomposição em efeitos naturais responde uma pergunta contrafactual: quanto do efeito sobraria se a variação continuasse ativa mas o mediador se comportasse como no controle?

Basta aplicar as taxas de retenção do braço tratado sobre a distribuição de mediador do braço de controle:

retenção do tratado com a mistura do controle = 0,40 vezes 36,00 mais 0,60 vezes 15,50 = 14,40 mais 9,30 = 23,70 por cento.

Com esse número, a decomposição sai inteira:

componente conta valor
efeito total 26,16 menos 23,00 mais 3,1600 pontos
efeito direto natural 23,70 menos 23,00 mais 0,7000 ponto
efeito indireto natural 26,16 menos 23,70 mais 2,4600 pontos
soma dos dois 0,70 mais 2,46 mais 3,1600 pontos
proporção mediada 2,46 dividido por 3,16 77,85%

O indireto também sai por um caminho mais curto e vale conferir: a variação moveu o mediador em 12 pontos, e a distância de retenção entre quem criou e quem não criou, dentro do braço tratado, é 36,00 menos 15,50, ou seja, 20,5 pontos. O produto 0,12 vezes 20,5 dá exatamente 2,46 pontos. É esse produto que carrega a premissa inteira, porque ele trata os 20,5 pontos como se fossem um efeito causal de criar o projeto, e não a diferença entre duas populações de pessoas diferentes.

Decomposição do efeito total em direto e indiretoTrês barras horizontais empilhadas mostram a retenção do controle em 23 por cento, a retenção contrafactual do tratado com a mistura de mediador do controle em 23,7 por cento, e a retenção observada do tratado em 26,16 por cento. As duas distâncias são rotuladas como efeito direto de 0,70 ponto e efeito indireto de 2,46 pontos.retenção em 30 diascontrole: 23,00%tratado com a mistura do controle: 23,70%tratado como observado: 26,16%direto 0,70 ppindireto 2,46 ppa barra do meio é contrafactual: ninguém no experimento viveu essa combinação.
A barra do meio nunca foi observada. Ela é construída aplicando as taxas de um braço sobre a mistura de mediador do outro, e é essa construção que exige a premissa não testável.

Quanto isso aguenta: a varredura que deveria acompanhar todo número

A decomposição inteira depende de os 20,5 pontos serem causa e não seleção. E é claro que parte deles é seleção: quem cria projeto na primeira semana é, em média, mais motivado, e teria retido mais de qualquer forma.

Imai, Keele e Tingley resolvem isso com um parâmetro de sensibilidade, a correlação entre os erros do modelo do mediador e do modelo do desfecho, que vale zero sob ignorabilidade sequencial e cujos valores diferentes de zero representam desvios dela. A versão de guardanapo dessa ideia, que qualquer analista roda numa planilha, é assumir que uma fração do contraste entre quem passou e quem não passou pelo mediador é confundimento:

fração do contraste que é confundimento efeito indireto efeito direto proporção mediada
0% (ignorabilidade sequencial perfeita) 2,460 pontos 0,700 ponto 77,8%
25% 1,845 ponto 1,315 ponto 58,4%
50% 1,230 ponto 1,930 ponto 38,9%
75% 0,615 ponto 2,545 pontos 19,5%
100% (nada do contraste é causal) 0,000 ponto 3,160 pontos 0,0%

Repare na coluna que não se move: o efeito total é 3,160 pontos em todas as linhas, porque ele vem do sorteio e nenhuma premissa sobre o mediador o toca. O que se move é a história inteira sobre o mecanismo, de “quase tudo passou pelo primeiro projeto” a “o primeiro projeto não teve nada a ver com isso”.

Essa tabela é o resultado honesto de uma análise de mediação. Um número único de proporção mediada, sem ela, é uma opinião com casas decimais.

Mediador não é métrica substituta

As duas ideias se parecem e servem para coisas diferentes:

mediador métrica substituta
pergunta por onde o efeito passou posso decidir antes do desfecho chegar
critério causal, e não testável preditivo, e verificável em histórico
quando é útil depois do teste, para orientar o roadmap durante o teste, para encurtar a espera
falha típica confundimento entre mediador e desfecho o substituto capta só parte do efeito

Uma métrica pode ser excelente substituta e péssima mediadora, e vice-versa. O tratamento completo do lado preditivo está em métrica substituta em teste A/B; aqui o assunto é só o lado causal.

O que fazer quando a decomposição não convence

Se a varredura de sensibilidade mostra que a história muda de figura no meio da faixa, e ela quase sempre mostra, existem três saídas, em ordem de custo:

  1. Reportar total e mecanismo separados. O total decide se a variação fica. O mecanismo entra como hipótese, com a faixa de sensibilidade ao lado. É honesto e não custa nada.
  2. Medir mais covariáveis pré-tratamento. Quanto mais do perfil de motivação da pessoa você tiver medido antes do sorteio, menos sobra para o confundidor não medido. Isso encolhe a faixa, não a elimina.
  3. Aleatorizar o mediador. Se a decisão de produto realmente depende de saber se criar o primeiro projeto causa retenção, o caminho é um segundo experimento cujo alvo seja essa criação. Quando o passo não pode ser imposto, o desenho de encorajamento é exatamente a ferramenta para isso, e ele traz o seu próprio conjunto de premissas, mais fracas do que as da mediação.

O ponto três é o que fecha o assunto de verdade, e vale registrar que ele quase nunca é a primeira opção proposta na reunião, porque parece caro. Comparado com um ano de roadmap construído sobre uma decomposição frágil, é barato.

Escolher o mediador antes de ver o dado

O mediador precisa ser declarado no plano de análise, junto com a métrica primária, e não escolhido depois entre os candidatos que sobraram. Três critérios ajudam a decidir qual passo merece essa vaga:

critério pergunta por que importa
ordem temporal limpa o mediador acontece depois da exposição e antes do desfecho, sem janela sobreposta? mediador medido junto com o desfecho não permite separar causa de consequência
plausibilidade de mecanismo existe uma história de produto que explique por que esse passo levaria ao desfecho? sem mecanismo declarado, a decomposição vira ajuste de curva
acionabilidade se o caminho for real, existe alguma coisa que o time faria diferente? mediador que não muda decisão nenhuma não vale a análise

O terceiro critério elimina a maioria dos candidatos, e isso é bom. Criar o primeiro projeto passa nos três: acontece na primeira semana, tem mecanismo óbvio (quem já investiu trabalho no produto volta) e é acionável de várias formas diferentes do checklist testado.

Vale um último cuidado de escopo: o mediador deve ser um evento único e bem definido, não uma métrica composta. Um índice de engajamento que soma cliques, sessões e tempo de tela não tem ordem temporal clara em relação ao desfecho, e a decomposição sobre ele não significa nada.

Um roteiro de seis passos

  1. Declare o mediador no plano de análise, antes de rodar, junto da métrica primária. O plano pré-registrado é o lugar dessa declaração.
  2. Leia primeiro o efeito total. Se ele não existe, não há o que decompor, e procurar mecanismo num resultado nulo é a forma mais rápida de encontrar um falso positivo.
  3. Leia o efeito da variação sobre o mediador. Se a variação não moveu o mediador, o efeito indireto é zero por construção e a resposta é que o caminho não é esse.
  4. Monte a barra do meio. Aplique as taxas do braço tratado sobre a distribuição de mediador do braço de controle. É uma linha de planilha e é a única conta que a decomposição exige.
  5. Rode a varredura de sensibilidade com pelo menos as cinco linhas da tabela acima. Publique a faixa, não só o ponto.
  6. Nunca segmente por mediador para comparar braços. Se alguém pedir esse recorte na reunião, mostre a tabela da terceira seção, com o efeito significativo no todo e nulo nas duas metades.

Erros comuns

Faça isso automático na Donnu

Nada de mediação é possível sem uma coisa decidida antes do teste: o mediador precisa ser um evento registrado com carimbo de tempo próprio, separado do desfecho, e as covariáveis pré-tratamento precisam ter sido guardadas no estado em que estavam no instante do sorteio. Reconstruir isso depois, a partir do estado atual do usuário, contamina justamente as variáveis que serviriam para encolher a faixa de sensibilidade.

A Donnu carimba o estado do usuário na atribuição e mantém cada evento intermediário como evento próprio, o que deixa a tabela de quatro linhas do exemplo acima disponível sem reconstrução manual. E vale a regra geral: quando o passo intermediário puder ser aleatorizado, aleatorize, porque isso troca uma premissa não testável por um segundo experimento. A calculadora de significância fecha as leituras de efeito total e de primeiro estágio com os mesmos números que você colaria à mão.

Referências

Leia também: Métrica substituta · Desenho de encorajamento · Efeito heterogêneo por segmento · Paradoxo de Simpson · Confundidor não medido · Calculadora de significância · Read in English

Perguntas frequentes

O que é análise de mediação num teste A/B?
É a decomposição do efeito total da variação em duas partes: o efeito indireto, que passa por um passo intermediário que a variação mexeu, e o efeito direto, que é tudo o mais. No exemplo deste guia, um checklist de onboarding subiu a retenção de 30 dias em 3,16 pontos percentuais, e a decomposição atribui 2,46 pontos ao caminho que passa pela criação do primeiro projeto e 0,70 ponto a todo o resto, ou seja, 77,85 por cento do efeito mediado.
Aleatorizar o teste já basta para calcular efeito direto e indireto?
Não. VanderWeele é explícito: a suposição de controle do confundimento entre mediador e desfecho não é necessária para a análise do efeito total, mas é necessária para a análise dos efeitos direto e indireto, e é necessária mesmo quando a exposição foi aleatorizada, porque num experimento o mediador tipicamente não foi aleatorizado. O sorteio garante o total, não a decomposição.
Por que não posso simplesmente comparar quem passou pelo passo intermediário nos dois braços?
Porque esse recorte é definido por um comportamento que o próprio tratamento alterou, e comparar dentro dele quebra o sorteio. No exemplo, o efeito total é altamente significativo, com valor-p da ordem de 2,2 vezes 10 elevado a menos 16, e ainda assim os dois recortes pós-tratamento saem sem significância, com valores-p 0,1163 e 0,2558. O efeito some das duas metades e continua existindo no todo.
Quanto a decomposição depende da premissa não testável?
Muito. O efeito total é fixo pelo sorteio, mas a divisão entre direto e indireto se move inteira. Se metade do contraste entre quem passou e quem não passou pelo mediador for confundimento e não causa, a proporção mediada cai de 77,8 para 38,9 por cento. No limite em que tudo for confundimento, ela cai a zero e o mesmo efeito total passa a ser inteiramente direto.
Mediador e métrica substituta são a mesma coisa?
Não. A métrica substituta existe para você poder ler o resultado antes do desfecho final chegar, e o critério de aceitação é preditivo. O mediador existe para explicar por onde o efeito passou, e o critério é causal. Uma métrica pode ser um bom substituto sem ser mediadora, e um mediador pode ser péssimo substituto por chegar tarde demais.
O que fazer quando a decomposição não se sustenta?
Reportar o efeito total, que é sólido, e apresentar a decomposição como hipótese de mecanismo com a sua faixa de sensibilidade, nunca como número único. Se a decisão de produto depende de saber se o caminho é real, o passo seguinte não é mais estatística, é um segundo experimento que aleatorize o próprio mediador ou um desenho que encoraje o passo intermediário diretamente.