Estatística

Meta-análise de Testes A/B: leia o programa inteiro

Meta-análise de testes A/B: juntar 12 experimentos numa estimativa só, medir heterogeneidade com I quadrado e corrigir o exagero de 1,34 vez.

Ilustração plana de uma coluna de doze barras horizontais verdes empilhadas uma sobre a outra, com um losango largo centralizado logo abaixo delas

Um programa de experimentação não é uma lista de vereditos independentes, é uma amostra de efeitos, e ele tem uma média que nenhum teste isolado enxerga. No exemplo deste artigo, 12 testes com só 2 vencedores declarados devolvem, agrupados, um ganho médio de 0,1483 ponto percentual com valor-p de 0,009037. Aqui a gente mostra como fazer a meta-análise desses experimentos com o método de variância inversa, como medir se eles estão medindo a mesma coisa, por que a escolha entre efeito fixo e efeito aleatório vira o veredito do programa, e quanto a média dos vencedores exagera (1,34 vez, medido em 5 mil programas simulados). Faz parte do nosso guia completo de teste A/B e complementa a maldição do vencedor.

A pergunta que nenhum teste responde sozinho

Todo mundo que roda experimentação chega, cedo ou tarde, na reunião em que alguém pergunta quanto o programa entregou no trimestre. A resposta padrão é somar os ganhos dos testes que venceram, e ela é errada por dois motivos independentes, que este artigo trata separadamente: os testes que não venceram também carregam informação, e os que venceram carregam exagero.

A ferramenta certa para essa pergunta é velha e vem da pesquisa clínica: meta-análise. O Manual Cochrane define o método genérico de variância inversa em uma linha de álgebra: a estimativa combinada é a média das estimativas individuais ponderada pelo inverso do quadrado do erro-padrão de cada uma. Os dados necessários, escrevem os autores, são apenas uma estimativa do efeito e o erro-padrão dela, por estudo.

Repare no que isso significa para experimentação online: você já tem os dois números para todo teste que rodou, inclusive os que deram inconclusivo. Nada precisa ser instrumentado de novo.

E existe um motivo estrutural para a leitura de programa importar mais aqui do que em outros campos. Kohavi, Deng, Longbotham e Xu escrevem que em sites como o Bing, onde milhares de experimentos rodam por ano, a maioria falha, e os que dão certo melhoram as métricas-chave entre 0,1 e 1,0 por cento depois de diluídos no impacto geral. A mudança pequena com impacto enorme existe, mas os autores a estimam na casa de um em 500 experimentos. Quando o efeito típico é dessa ordem, o teste isolado quase nunca tem poder para enxergá-lo, e o conjunto tem.

O programa de exemplo

Simulamos um trimestre inteiro com semente fixa. Doze testes, cada um com 25 mil visitantes por braço e taxa de conversão base de 5 por cento. Os efeitos verdadeiros de cada teste foram sorteados de uma distribuição normal com média de 0,10 ponto percentual e desvio de 0,30, ou seja, um programa em que a mudança típica é levemente positiva mas muitas mudanças pioram as coisas.

# Conv. A Conv. B Taxa A Taxa B Diferença EP z valor-p Veredito Efeito real
1 1.240 1.278 4,960% 5,112% 0,1520 pp 0,1956 0,7771 0,437100 inconclusivo 0,4718 pp
2 1.239 1.241 4,956% 4,964% 0,0080 pp 0,1942 0,0412 0,967140 inconclusivo -0,1842 pp
3 1.264 1.304 5,056% 5,216% 0,1600 pp 0,1974 0,8104 0,417697 inconclusivo -0,0011 pp
4 1.240 1.435 4,960% 5,740% 0,7800 pp 0,2012 3,8754 0,000107 vence 0,5993 pp
5 1.301 1.202 5,204% 4,808% -0,3960 pp 0,1950 -2,0303 0,042328 perde -0,2265 pp
6 1.253 1.320 5,012% 5,280% 0,2680 pp 0,1976 1,3562 0,175032 inconclusivo 0,1589 pp
7 1.290 1.295 5,160% 5,180% 0,0200 pp 0,1980 0,1010 0,919560 inconclusivo 0,0641 pp
8 1.255 1.323 5,020% 5,292% 0,2720 pp 0,1978 1,3752 0,169073 inconclusivo 0,1112 pp
9 1.281 1.184 5,124% 4,736% -0,3880 pp 0,1936 -2,0037 0,045098 perde -0,2213 pp
10 1.229 1.215 4,916% 4,860% -0,0560 pp 0,1929 -0,2904 0,771529 inconclusivo -0,3515 pp
11 1.256 1.351 5,024% 5,404% 0,3800 pp 0,1988 1,9111 0,055993 inconclusivo 0,0753 pp
12 1.225 1.391 4,900% 5,564% 0,6640 pp 0,1991 3,3339 0,000856 vence 0,5136 pp

A última coluna é o luxo que só a simulação permite: o efeito verdadeiro de cada teste, que na vida real ninguém vê. É o que vai deixar a gente medir, no fim do artigo, quem estava certo e quem estava exagerando.

Cole a linha 4 na calculadora abaixo (25.000 e 1.240 contra 25.000 e 1.435) e ela devolve z de 3,8754, valor-p de 0,000107, ganho relativo de 15,73 por cento e intervalo de 0,3856 a 1,1744 ponto percentual. Toda a tabela acima sai da mesma matemática.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Lendo teste a teste, o trimestre parece morno: dois vencedores, dois perdedores, oito nadas. Um relatório honesto diria que 2 em 12 pegaram, o que aliás bate com as taxas de vitória publicadas pela indústria.

Juntando os doze: o modelo de efeito fixo

O agrupamento de variância inversa pesa cada teste pelo inverso da variância dele. Como os 12 têm quase o mesmo tamanho, os pesos ficam quase iguais (de 7,96 a 8,67 por cento cada). O resultado:

Efeito combinado de 0,1483 ponto percentual, erro-padrão de 0,0568, z de 2,6107, valor-p de 0,009037, intervalo de confiança de 0,0370 a 0,2596 ponto percentual.

Sobre uma base de 5 por cento, isso é um ganho relativo médio de 2,965 por cento por mudança lançada. O erro-padrão combinado é 3,46 vezes menor que o de um teste isolado, que é exatamente a raiz de 12, como esperado.

Gráfico de floresta dos 12 testes e do efeito combinadoDoze linhas horizontais empilhadas, uma por teste, cada uma com um quadrado no centro marcando a diferença observada e barras para os limites do intervalo de confiança de 95 por cento. Uma linha vertical tracejada marca o zero. Nove dos doze intervalos cruzam o zero. O teste 4 e o teste 12 ficam inteiramente à direita do zero, o teste 5 e o teste 9 inteiramente à esquerda. Abaixo de todos, um losango estreito centrado em 0,1483 ponto percentual representa o efeito combinado por variância inversa, e ele não toca o zero.-0,800,81,6diferença em pontos percentuaisteste 1teste 2teste 3teste 4teste 5teste 6teste 7teste 8teste 9teste 10teste 11teste 12combinado0,1483 pp
Nove dos doze intervalos cruzam o zero. O losango combinado, com o erro-padrão 3,46 vezes menor, não cruza: o programa mexeu o ponteiro mesmo com a maioria dos testes calada.

Cuidado com a leitura errada mais tentadora desse resultado. O agrupamento NÃO diz que o teste 6 na verdade venceu, nem autoriza lançar as oito mudanças inconclusivas. Ele estima a média de um conjunto. É a diferença entre “esta mudança específica funciona” e “mudanças deste tipo, em média, funcionam”, e só a segunda foi respondida.

Eles estão medindo a mesma coisa?

O modelo de efeito fixo carrega uma suposição forte, e o Manual Cochrane a enuncia sem meias palavras: para calcular o intervalo de confiança de uma meta-análise de efeito fixo, assume-se que o efeito verdadeiro da intervenção é o mesmo valor em cada estudo, o que implica que as diferenças observadas entre os resultados vêm exclusivamente do acaso.

Em experimentação de produto essa suposição é quase sempre falsa por construção. Os 12 testes do exemplo mudam coisas diferentes em lugares diferentes; não há razão nenhuma para eles compartilharem um efeito verdadeiro único. A pergunta é quanto isso importa, e existem duas medidas para responder.

Q de Cochran mede a dispersão observada entre os estudos em relação ao que o acaso sozinho produziria. No nosso programa, Q vale 36,2028 com 11 graus de liberdade e valor-p de 0,000157: os 12 testes estão muito mais espalhados do que o erro amostral explica.

I quadrado traduz isso em fração. Ele descreve, nas palavras do Manual, o percentual da variabilidade nas estimativas de efeito que se deve a heterogeneidade em vez de erro amostral. No nosso programa, I quadrado vale 69,62 por cento. O guia aproximado do Manual para ensaios randomizados coloca esse valor na faixa de heterogeneidade substancial:

I quadrado Interpretação (guia do Manual Cochrane)
0% a 40% pode não ser importante
30% a 60% pode representar heterogeneidade moderada
50% a 90% pode representar heterogeneidade substancial
75% a 100% heterogeneidade considerável

Os autores avisam que esses limiares podem enganar, porque a importância da inconsistência depende da magnitude e da direção dos efeitos e da força da evidência. E fazem uma observação que vale ouro para quem roda experimentação: o teste de heterogeneidade é irrelevante para a escolha da análise, porque a heterogeneidade sempre existe, quer a gente consiga detectá-la estatisticamente ou não.

Em um programa de produto, um I quadrado alto não é defeito. É o objetivo. Se todos os seus testes tivessem o mesmo efeito verdadeiro, você estaria testando a mesma coisa doze vezes.

Efeito aleatório: a mesma tabela, outro veredito

O modelo de efeitos aleatórios troca a suposição. Em vez de assumir um efeito único, assume que os efeitos verdadeiros variam e seguem uma distribuição, normalmente a normal, e estima a variância dessa distribuição, chamada tau ao quadrado. O Manual registra que a versão mais simples de estimar tau ao quadrado é o método de DerSimonian e Laird, que é o que usamos aqui.

No nosso programa, tau ao quadrado sai em 8,8687 vezes 10 elevado a menos 6, ou seja, tau de 0,2978 ponto percentual. O valor verdadeiro usado na simulação era 0,30. O estimador acertou quase em cima.

Refazendo o agrupamento com esse tau embutido em cada peso:

Modelo Efeito combinado Erro-padrão Estatística valor-p IC 95% Veredito
Efeito fixo 0,1483 pp 0,0568 z 2,6107 0,009037 0,0370 a 0,2596 pp significante
Efeitos aleatórios 0,1532 pp 0,1030 z 1,4866 0,137128 -0,0488 a 0,3551 pp não significante

Os mesmos 12 testes, a mesma aritmética de variância inversa, e vereditos opostos. O ponto estimado mal se move (0,1483 contra 0,1532), mas o erro-padrão quase dobra, porque o modelo aleatório agora precisa carregar a incerteza sobre para onde a próxima mudança vai puxar, e não só a incerteza de medida dos 12 experimentos que já rodaram. O Manual antecipa esse comportamento: quando há heterogeneidade, o intervalo do modelo aleatório é mais largo que o do fixo, e isso acontece sempre que o I quadrado for maior que zero, mesmo quando o teste de heterogeneidade não detecta nada.

Intervalo do efeito fixo contra o intervalo dos efeitos aleatóriosDuas barras horizontais de intervalo de confiança sobre um eixo em pontos percentuais de menos 0,1 a mais 0,4. A barra do efeito fixo vai de 0,0370 a 0,2596 e fica inteiramente à direita da linha do zero. A barra dos efeitos aleatórios vai de menos 0,0488 a 0,3551 e cruza a linha do zero. Os dois pontos centrais, 0,1483 e 0,1532, ficam quase no mesmo lugar.0-0,10,20,35efeito combinado em pontos percentuaisefeito fixo: p 0,0090efeitos aleatórios: p 0,1371
O ponto quase não se mexe, o intervalo quase dobra. A escolha do modelo não é técnica, é uma declaração sobre a que pergunta você quer responder.

Qual dos dois está certo? Medimos

Argumento não decide isso; simulação decide. Rodamos 5 mil programas completos, cada um com os mesmos 12 testes e a mesma distribuição de efeitos verdadeiros, e perguntamos com que frequência o intervalo de 95 por cento de cada modelo contém a média verdadeira do processo (0,10 ponto percentual).

Modelo Cobertura do IC 95% Nominal
Efeito fixo 70,86% 95%
Efeitos aleatórios 92,16% 95%

O intervalo do efeito fixo erra o alvo quase três vezes mais do que promete. O de efeitos aleatórios com DerSimonian e Laird chega perto, ficando um pouco abaixo do nominal, que é o comportamento conhecido do método quando o número de estudos é modesto. O Manual dedica uma seção inteira à interpretação cuidadosa de meta-análise de efeitos aleatórios com poucos estudos, justamente porque a variância entre estudos é mal estimada quando k é pequeno.

A regra prática que sai daí: se você vai combinar experimentos que testaram coisas diferentes, use efeitos aleatórios. O modelo fixo só é honesto quando os experimentos são réplicas do mesmo tratamento, o que em experimentação online acontece basicamente em uma situação, a de repetir literalmente o mesmo teste em janelas ou mercados diferentes.

Outras medidas dos mesmos 5 mil programas, todas úteis para calibrar expectativa:

O exagero dos vencedores, quantificado

Chegamos ao segundo motivo pelo qual somar as vitórias declaradas superestima o programa. Para um teste ser declarado vencedor ele precisa de duas coisas: efeito real e sorte. Isso significa que a fatia dos vencedores é sistematicamente enriquecida por quem teve sorte, e o ganho observado deles é maior que o ganho verdadeiro. É a maldição do vencedor, e a meta-análise permite medi-la.

Nos 5 mil programas simulados, 12.633 testes foram declarados vencedores. O ganho médio observado deles foi de 0,5942 ponto percentual. O efeito verdadeiro médio dos mesmos testes foi de 0,4424.

Exagero de 1,343 vez. O vencedor típico entrega 74,5 por cento do que mostrou no relatório.

No exemplo trabalhado, os dois vencedores (testes 4 e 12) mostraram média de 0,7220 ponto percentual contra efeito verdadeiro médio de 0,5564, um exagero de 1,298 vez, bem em cima do valor agregado.

Ganho observado contra ganho verdadeiro dos testes declarados vencedoresGráfico de barras com dois pares. No primeiro par, agregado de 12.633 vencedores em 5 mil programas simulados, a barra do ganho observado alcança 0,5942 ponto percentual e a do ganho verdadeiro 0,4424. No segundo par, os dois vencedores do exemplo trabalhado, a barra observada alcança 0,7220 e a verdadeira 0,5564. Em ambos os pares a barra observada é visivelmente mais alta.0,59420,44240,72200,556412.633 vencedores (5 mil programas)2 vencedores (exemplo deste artigo)exagero de 1,343xexagero de 1,298xobservadoverdadeiro
A seleção pelo valor-p enriquece a amostra de vencedores com quem teve sorte. Somar os ganhos declarados para calcular o impacto anual infla o número em cerca de um terço.

O encolhimento: a correção que a meta-análise entrega de graça

Estimado o tau ao quadrado, sai de brinde a correção para cada teste individual. A estimativa encolhida de um experimento é a média do programa mais um pedaço do desvio dele em relação a essa média:

estimativa encolhida = média do programa + peso vezes (observado menos média do programa)

com o peso valendo tau ao quadrado dividido pela soma de tau ao quadrado e da variância daquele teste. Um teste muito preciso (variância pequena) mantém quase todo o seu desvio; um teste ruidoso é puxado quase até a média. É o mesmo mecanismo dos priors bayesianos, só que com o prior estimado dos seus próprios dados em vez de escolhido a dedo.

No exemplo trabalhado, com tau ao quadrado de 8,8687 vezes 10 elevado a menos 6 e variâncias parecidas entre os testes, os pesos ficam todos por volta de 0,69:

# Observado Peso Encolhido Efeito real
4 0,7800 pp 0,6865 0,5820 pp 0,5993 pp
12 0,6640 pp 0,6910 0,5046 pp 0,5136 pp
11 0,3800 pp 0,6917 0,3086 pp 0,0753 pp
10 -0,0560 pp 0,7045 0,0044 pp -0,3515 pp
5 -0,3960 pp 0,6998 -0,2326 pp -0,2265 pp

Olhe as duas primeiras linhas. O teste 4 mostrou 0,7800 e valia 0,5993; o encolhimento devolveu 0,5820. O teste 12 mostrou 0,6640 e valia 0,5136; o encolhimento devolveu 0,5046. Nos dois vencedores, a estimativa encolhida chegou muito mais perto da verdade do que a observada.

Não funciona sempre: nos testes 10 e 11 o encolhimento piorou, porque o efeito verdadeiro daqueles dois estava longe da média do programa. A promessa do encolhimento é sobre o conjunto, não sobre cada linha. E no conjunto ela se cumpre:

Estimador Erro quadrático médio Redução
Observado, exemplo trabalhado 4,1404 vezes 10 elevado a -6 referência
Encolhido, exemplo trabalhado 3,2041 vezes 10 elevado a -6 22,61%
Observado, 5 mil programas 3,8571 vezes 10 elevado a -6 referência
Encolhido com tau de DerSimonian e Laird 3,0219 vezes 10 elevado a -6 21,65%
Encolhido com o tau verdadeiro 2,7081 vezes 10 elevado a -6 29,79%

A diferença entre a linha de DerSimonian e Laird e a do tau verdadeiro (21,65 contra 29,79 por cento) é o preço de ter que estimar a variância entre estudos com apenas 12 experimentos. Ele não anula o ganho, só o encolhe, o que é uma piada apropriada ao tema.

O que dá para fazer com isso na segunda-feira

Cinco usos concretos, todos possíveis com os dados que você já tem guardados:

  1. Reportar o programa, não a lista. Trocar “tivemos 2 vitórias em 12” por “o conjunto entregou 0,15 ponto percentual em média, intervalo de menos 0,05 a 0,36” muda a conversa com a diretoria de anedota para estimativa.
  2. Corrigir a projeção anual. Antes de multiplicar as vitórias por 12 meses, aplique o encolhimento. Um exagero de 1,34 vez em cima de um caso de negócio é a diferença entre um projeto que se paga e um que não.
  3. Comparar áreas do produto. Rodando a meta-análise por superfície (checkout, onboarding, precificação) você descobre onde o efeito médio das mudanças é maior. Isso é meta-regressão, e é como se prioriza um roadmap com dado em vez de opinião.
  4. Calibrar o MDE dos próximos testes. O tau estimado é uma medida direta do tamanho típico das suas mudanças. Se tau vale 0,30 ponto percentual sobre uma base de 5 por cento, planejar testes com MDE de 20 por cento relativo é planejar para não achar nada. Veja efeito mínimo detectável.
  5. Alimentar priors honestos. Quem usa análise bayesiana pode parar de inventar o prior: a distribuição estimada dos efeitos do próprio programa é o prior empírico certo.

Nada disso funciona sem um repositório de experimentos que guarde os inconclusivos junto com os vencedores. Um programa que só arquiva vitória não pode ser meta-analisado, porque a amostra já nasce selecionada, e todo número que sair dela vai estar enviesado para cima pelo mesmo mecanismo da maldição do vencedor.

Quatro armadilhas

Combinar testes sobrepostos no tempo. Se dois experimentos rodaram sobre os mesmos usuários e podem ter interagido, eles não são observações independentes, e o agrupamento de variância inversa assume que são. Veja testes simultâneos.

Combinar métricas diferentes. Só entra no mesmo pote o que estiver na mesma escala. Diferença absoluta de taxa de conversão com diferença absoluta de taxa de conversão; ganho relativo com ganho relativo. Misturar as duas escalas produz um número sem significado.

Escolher o que entra depois de ver o resultado. Definir o conjunto de testes a combinar é uma decisão de análise, e ela precisa ser tomada por um critério (todos os testes daquela superfície naquele trimestre) e não por conveniência. Rodar a meta-análise, achar o valor-p feio e tirar um teste é o mesmo peeking que a gente critica no nível do experimento.

Ler o combinado como se fosse um veredito de lançamento. Vale repetir porque é o erro que mais aparece: efeito de programa positivo não autoriza lançar mudanças individuais que não venceram.

Faça isso automático na Donnu

O obstáculo prático para meta-analisar um programa raramente é a matemática, é que os resultados dos testes antigos vivem em capturas de tela e planilhas mortas, sem erro-padrão guardado. Na Donnu todo experimento encerrado deixa efeito e erro-padrão no histórico, então o agrupamento fica a um filtro de distância: escolha o recorte (trimestre, superfície, tipo de mudança) e o painel devolve o efeito combinado nos dois modelos, o Q, o I quadrado, o tau estimado e o gráfico de floresta com as estimativas encolhidas ao lado das observadas. A projeção anual de impacto usa a estimativa encolhida por padrão, não a observada, porque somar vitórias declaradas é a forma mais silenciosa de um programa prometer um terço a mais do que vai entregar.

Perguntas frequentes

As respostas curtas estão na seção de perguntas frequentes desta página, montadas a partir dos mesmos cálculos apresentados aqui.

Referências

Leia também

Read in English

Perguntas frequentes

O que é meta-análise de testes A/B?
É combinar os resultados de vários experimentos em uma estimativa só, ponderando cada um pelo inverso da variância dele. O Manual Cochrane descreve o método genérico de variância inversa, que precisa apenas do efeito estimado e do erro-padrão de cada estudo. Aplicado a um programa de experimentação, ele responde uma pergunta que nenhum teste isolado responde: o conjunto do que a gente lançou no trimestre mexeu o ponteiro?
Meta-análise serve para salvar um teste que deu inconclusivo?
Não, e essa é a confusão mais cara. Ela não recupera o veredito de um experimento individual; ela estima a média do programa. No nosso exemplo com 12 testes, o agrupamento devolveu 0,1483 ponto percentual com valor-p de 0,009037, mas isso não quer dizer que o teste 6 tenha vencido. Quer dizer que o conjunto das 12 mudanças, tomado como um bloco, produziu ganho médio positivo.
Qual a diferença entre efeito fixo e efeito aleatório?
O modelo de efeito fixo assume que todos os experimentos estimam o MESMO efeito verdadeiro e que a diferença entre eles é só acaso. O de efeitos aleatórios assume que os efeitos verdadeiros variam e seguem uma distribuição. No nosso exemplo, o fixo devolveu valor-p de 0,009037 e o aleatório 0,137128 sobre exatamente os mesmos 12 testes. Em 5 mil programas simulados, o intervalo do fixo cobriu a média verdadeira em só 70,86 por cento das vezes contra 92,16 do aleatório.
O que é I quadrado e qual valor é preocupante?
É a fração da variação entre estudos que vem de heterogeneidade real em vez de acaso amostral. O Manual Cochrane dá um guia aproximado: de 0 a 40 por cento pode não ser importante, de 30 a 60 pode ser heterogeneidade moderada, de 50 a 90 substancial e de 75 a 100 considerável. Programas de experimentação costumam viver na faixa alta, porque testar coisas diferentes é o objetivo. Nos nossos 5 mil programas simulados o I quadrado médio ficou em 63,61 por cento.
Por que a média dos vencedores exagera o resultado?
Porque para ser declarado vencedor o teste precisa ter tido sorte, além de ter efeito real. Nos nossos 5 mil programas, os 12.633 vencedores declarados mostraram ganho médio de 0,5942 ponto percentual quando o efeito verdadeiro médio deles era 0,4424. O vencedor típico entrega 74,5 por cento do que mostrou. Somar as vitórias declaradas para calcular o impacto anual do programa é o jeito mais rápido de superestimá-lo em cerca de um terço.
O encolhimento realmente melhora a estimativa de cada teste?
Melhora, e dá para medir. Puxando cada estimativa em direção à média do programa, com peso proporcional à precisão dela, o erro quadrático médio caiu 21,65 por cento nos nossos 5 mil programas usando a variância entre estudos estimada por DerSimonian e Laird, e 29,79 por cento usando a variância verdadeira. No exemplo trabalhado a queda foi de 22,61 por cento.