Meta-análise de Testes A/B: leia o programa inteiro
Meta-análise de testes A/B: juntar 12 experimentos numa estimativa só, medir heterogeneidade com I quadrado e corrigir o exagero de 1,34 vez.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Um programa de experimentação não é uma lista de vereditos independentes, é uma amostra de efeitos, e ele tem uma média que nenhum teste isolado enxerga. No exemplo deste artigo, 12 testes com só 2 vencedores declarados devolvem, agrupados, um ganho médio de 0,1483 ponto percentual com valor-p de 0,009037. Aqui a gente mostra como fazer a meta-análise desses experimentos com o método de variância inversa, como medir se eles estão medindo a mesma coisa, por que a escolha entre efeito fixo e efeito aleatório vira o veredito do programa, e quanto a média dos vencedores exagera (1,34 vez, medido em 5 mil programas simulados). Faz parte do nosso guia completo de teste A/B e complementa a maldição do vencedor.
A pergunta que nenhum teste responde sozinho
Todo mundo que roda experimentação chega, cedo ou tarde, na reunião em que alguém pergunta quanto o programa entregou no trimestre. A resposta padrão é somar os ganhos dos testes que venceram, e ela é errada por dois motivos independentes, que este artigo trata separadamente: os testes que não venceram também carregam informação, e os que venceram carregam exagero.
A ferramenta certa para essa pergunta é velha e vem da pesquisa clínica: meta-análise. O Manual Cochrane define o método genérico de variância inversa em uma linha de álgebra: a estimativa combinada é a média das estimativas individuais ponderada pelo inverso do quadrado do erro-padrão de cada uma. Os dados necessários, escrevem os autores, são apenas uma estimativa do efeito e o erro-padrão dela, por estudo.
Repare no que isso significa para experimentação online: você já tem os dois números para todo teste que rodou, inclusive os que deram inconclusivo. Nada precisa ser instrumentado de novo.
E existe um motivo estrutural para a leitura de programa importar mais aqui do que em outros campos. Kohavi, Deng, Longbotham e Xu escrevem que em sites como o Bing, onde milhares de experimentos rodam por ano, a maioria falha, e os que dão certo melhoram as métricas-chave entre 0,1 e 1,0 por cento depois de diluídos no impacto geral. A mudança pequena com impacto enorme existe, mas os autores a estimam na casa de um em 500 experimentos. Quando o efeito típico é dessa ordem, o teste isolado quase nunca tem poder para enxergá-lo, e o conjunto tem.
O programa de exemplo
Simulamos um trimestre inteiro com semente fixa. Doze testes, cada um com 25 mil visitantes por braço e taxa de conversão base de 5 por cento. Os efeitos verdadeiros de cada teste foram sorteados de uma distribuição normal com média de 0,10 ponto percentual e desvio de 0,30, ou seja, um programa em que a mudança típica é levemente positiva mas muitas mudanças pioram as coisas.
| # | Conv. A | Conv. B | Taxa A | Taxa B | Diferença | EP | z | valor-p | Veredito | Efeito real |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 1.240 | 1.278 | 4,960% | 5,112% | 0,1520 pp | 0,1956 | 0,7771 | 0,437100 | inconclusivo | 0,4718 pp |
| 2 | 1.239 | 1.241 | 4,956% | 4,964% | 0,0080 pp | 0,1942 | 0,0412 | 0,967140 | inconclusivo | -0,1842 pp |
| 3 | 1.264 | 1.304 | 5,056% | 5,216% | 0,1600 pp | 0,1974 | 0,8104 | 0,417697 | inconclusivo | -0,0011 pp |
| 4 | 1.240 | 1.435 | 4,960% | 5,740% | 0,7800 pp | 0,2012 | 3,8754 | 0,000107 | vence | 0,5993 pp |
| 5 | 1.301 | 1.202 | 5,204% | 4,808% | -0,3960 pp | 0,1950 | -2,0303 | 0,042328 | perde | -0,2265 pp |
| 6 | 1.253 | 1.320 | 5,012% | 5,280% | 0,2680 pp | 0,1976 | 1,3562 | 0,175032 | inconclusivo | 0,1589 pp |
| 7 | 1.290 | 1.295 | 5,160% | 5,180% | 0,0200 pp | 0,1980 | 0,1010 | 0,919560 | inconclusivo | 0,0641 pp |
| 8 | 1.255 | 1.323 | 5,020% | 5,292% | 0,2720 pp | 0,1978 | 1,3752 | 0,169073 | inconclusivo | 0,1112 pp |
| 9 | 1.281 | 1.184 | 5,124% | 4,736% | -0,3880 pp | 0,1936 | -2,0037 | 0,045098 | perde | -0,2213 pp |
| 10 | 1.229 | 1.215 | 4,916% | 4,860% | -0,0560 pp | 0,1929 | -0,2904 | 0,771529 | inconclusivo | -0,3515 pp |
| 11 | 1.256 | 1.351 | 5,024% | 5,404% | 0,3800 pp | 0,1988 | 1,9111 | 0,055993 | inconclusivo | 0,0753 pp |
| 12 | 1.225 | 1.391 | 4,900% | 5,564% | 0,6640 pp | 0,1991 | 3,3339 | 0,000856 | vence | 0,5136 pp |
A última coluna é o luxo que só a simulação permite: o efeito verdadeiro de cada teste, que na vida real ninguém vê. É o que vai deixar a gente medir, no fim do artigo, quem estava certo e quem estava exagerando.
Cole a linha 4 na calculadora abaixo (25.000 e 1.240 contra 25.000 e 1.435) e ela devolve z de 3,8754, valor-p de 0,000107, ganho relativo de 15,73 por cento e intervalo de 0,3856 a 1,1744 ponto percentual. Toda a tabela acima sai da mesma matemática.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Lendo teste a teste, o trimestre parece morno: dois vencedores, dois perdedores, oito nadas. Um relatório honesto diria que 2 em 12 pegaram, o que aliás bate com as taxas de vitória publicadas pela indústria.
Juntando os doze: o modelo de efeito fixo
O agrupamento de variância inversa pesa cada teste pelo inverso da variância dele. Como os 12 têm quase o mesmo tamanho, os pesos ficam quase iguais (de 7,96 a 8,67 por cento cada). O resultado:
Efeito combinado de 0,1483 ponto percentual, erro-padrão de 0,0568, z de 2,6107, valor-p de 0,009037, intervalo de confiança de 0,0370 a 0,2596 ponto percentual.
Sobre uma base de 5 por cento, isso é um ganho relativo médio de 2,965 por cento por mudança lançada. O erro-padrão combinado é 3,46 vezes menor que o de um teste isolado, que é exatamente a raiz de 12, como esperado.
Cuidado com a leitura errada mais tentadora desse resultado. O agrupamento NÃO diz que o teste 6 na verdade venceu, nem autoriza lançar as oito mudanças inconclusivas. Ele estima a média de um conjunto. É a diferença entre “esta mudança específica funciona” e “mudanças deste tipo, em média, funcionam”, e só a segunda foi respondida.
Eles estão medindo a mesma coisa?
O modelo de efeito fixo carrega uma suposição forte, e o Manual Cochrane a enuncia sem meias palavras: para calcular o intervalo de confiança de uma meta-análise de efeito fixo, assume-se que o efeito verdadeiro da intervenção é o mesmo valor em cada estudo, o que implica que as diferenças observadas entre os resultados vêm exclusivamente do acaso.
Em experimentação de produto essa suposição é quase sempre falsa por construção. Os 12 testes do exemplo mudam coisas diferentes em lugares diferentes; não há razão nenhuma para eles compartilharem um efeito verdadeiro único. A pergunta é quanto isso importa, e existem duas medidas para responder.
Q de Cochran mede a dispersão observada entre os estudos em relação ao que o acaso sozinho produziria. No nosso programa, Q vale 36,2028 com 11 graus de liberdade e valor-p de 0,000157: os 12 testes estão muito mais espalhados do que o erro amostral explica.
I quadrado traduz isso em fração. Ele descreve, nas palavras do Manual, o percentual da variabilidade nas estimativas de efeito que se deve a heterogeneidade em vez de erro amostral. No nosso programa, I quadrado vale 69,62 por cento. O guia aproximado do Manual para ensaios randomizados coloca esse valor na faixa de heterogeneidade substancial:
| I quadrado | Interpretação (guia do Manual Cochrane) |
|---|---|
| 0% a 40% | pode não ser importante |
| 30% a 60% | pode representar heterogeneidade moderada |
| 50% a 90% | pode representar heterogeneidade substancial |
| 75% a 100% | heterogeneidade considerável |
Os autores avisam que esses limiares podem enganar, porque a importância da inconsistência depende da magnitude e da direção dos efeitos e da força da evidência. E fazem uma observação que vale ouro para quem roda experimentação: o teste de heterogeneidade é irrelevante para a escolha da análise, porque a heterogeneidade sempre existe, quer a gente consiga detectá-la estatisticamente ou não.
Em um programa de produto, um I quadrado alto não é defeito. É o objetivo. Se todos os seus testes tivessem o mesmo efeito verdadeiro, você estaria testando a mesma coisa doze vezes.
Efeito aleatório: a mesma tabela, outro veredito
O modelo de efeitos aleatórios troca a suposição. Em vez de assumir um efeito único, assume que os efeitos verdadeiros variam e seguem uma distribuição, normalmente a normal, e estima a variância dessa distribuição, chamada tau ao quadrado. O Manual registra que a versão mais simples de estimar tau ao quadrado é o método de DerSimonian e Laird, que é o que usamos aqui.
No nosso programa, tau ao quadrado sai em 8,8687 vezes 10 elevado a menos 6, ou seja, tau de 0,2978 ponto percentual. O valor verdadeiro usado na simulação era 0,30. O estimador acertou quase em cima.
Refazendo o agrupamento com esse tau embutido em cada peso:
| Modelo | Efeito combinado | Erro-padrão | Estatística | valor-p | IC 95% | Veredito |
|---|---|---|---|---|---|---|
| Efeito fixo | 0,1483 pp | 0,0568 | z 2,6107 | 0,009037 | 0,0370 a 0,2596 pp | significante |
| Efeitos aleatórios | 0,1532 pp | 0,1030 | z 1,4866 | 0,137128 | -0,0488 a 0,3551 pp | não significante |
Os mesmos 12 testes, a mesma aritmética de variância inversa, e vereditos opostos. O ponto estimado mal se move (0,1483 contra 0,1532), mas o erro-padrão quase dobra, porque o modelo aleatório agora precisa carregar a incerteza sobre para onde a próxima mudança vai puxar, e não só a incerteza de medida dos 12 experimentos que já rodaram. O Manual antecipa esse comportamento: quando há heterogeneidade, o intervalo do modelo aleatório é mais largo que o do fixo, e isso acontece sempre que o I quadrado for maior que zero, mesmo quando o teste de heterogeneidade não detecta nada.
Qual dos dois está certo? Medimos
Argumento não decide isso; simulação decide. Rodamos 5 mil programas completos, cada um com os mesmos 12 testes e a mesma distribuição de efeitos verdadeiros, e perguntamos com que frequência o intervalo de 95 por cento de cada modelo contém a média verdadeira do processo (0,10 ponto percentual).
| Modelo | Cobertura do IC 95% | Nominal |
|---|---|---|
| Efeito fixo | 70,86% | 95% |
| Efeitos aleatórios | 92,16% | 95% |
O intervalo do efeito fixo erra o alvo quase três vezes mais do que promete. O de efeitos aleatórios com DerSimonian e Laird chega perto, ficando um pouco abaixo do nominal, que é o comportamento conhecido do método quando o número de estudos é modesto. O Manual dedica uma seção inteira à interpretação cuidadosa de meta-análise de efeitos aleatórios com poucos estudos, justamente porque a variância entre estudos é mal estimada quando k é pequeno.
A regra prática que sai daí: se você vai combinar experimentos que testaram coisas diferentes, use efeitos aleatórios. O modelo fixo só é honesto quando os experimentos são réplicas do mesmo tratamento, o que em experimentação online acontece basicamente em uma situação, a de repetir literalmente o mesmo teste em janelas ou mercados diferentes.
Outras medidas dos mesmos 5 mil programas, todas úteis para calibrar expectativa:
- O agrupamento por efeito fixo detecta o programa (valor-p abaixo de 0,05) em 45,38 por cento das vezes.
- Pelo menos um teste individual sai significante em 98,52 por cento dos programas, o que soa ótimo até você lembrar que a maioria desses é falso positivo ou exagero.
- Ao menos um vencedor positivo declarado aparece em 94,18 por cento dos programas, mesmo quando a média verdadeira do processo é de meros 0,10 ponto percentual.
- O efeito combinado médio saiu em 0,0945 ponto percentual contra os 0,1000 verdadeiros: o agrupamento é praticamente não enviesado.
- O tau ao quadrado médio estimado por DerSimonian e Laird saiu em 8,9415 vezes 10 elevado a menos 6, contra o verdadeiro 9,0000. Razão de 0,994, ou seja, o estimador acerta na média, mas oscila bastante de programa para programa.
- O I quadrado médio ficou em 63,61 por cento.
O exagero dos vencedores, quantificado
Chegamos ao segundo motivo pelo qual somar as vitórias declaradas superestima o programa. Para um teste ser declarado vencedor ele precisa de duas coisas: efeito real e sorte. Isso significa que a fatia dos vencedores é sistematicamente enriquecida por quem teve sorte, e o ganho observado deles é maior que o ganho verdadeiro. É a maldição do vencedor, e a meta-análise permite medi-la.
Nos 5 mil programas simulados, 12.633 testes foram declarados vencedores. O ganho médio observado deles foi de 0,5942 ponto percentual. O efeito verdadeiro médio dos mesmos testes foi de 0,4424.
Exagero de 1,343 vez. O vencedor típico entrega 74,5 por cento do que mostrou no relatório.
No exemplo trabalhado, os dois vencedores (testes 4 e 12) mostraram média de 0,7220 ponto percentual contra efeito verdadeiro médio de 0,5564, um exagero de 1,298 vez, bem em cima do valor agregado.
O encolhimento: a correção que a meta-análise entrega de graça
Estimado o tau ao quadrado, sai de brinde a correção para cada teste individual. A estimativa encolhida de um experimento é a média do programa mais um pedaço do desvio dele em relação a essa média:
estimativa encolhida = média do programa + peso vezes (observado menos média do programa)
com o peso valendo tau ao quadrado dividido pela soma de tau ao quadrado e da variância daquele teste. Um teste muito preciso (variância pequena) mantém quase todo o seu desvio; um teste ruidoso é puxado quase até a média. É o mesmo mecanismo dos priors bayesianos, só que com o prior estimado dos seus próprios dados em vez de escolhido a dedo.
No exemplo trabalhado, com tau ao quadrado de 8,8687 vezes 10 elevado a menos 6 e variâncias parecidas entre os testes, os pesos ficam todos por volta de 0,69:
| # | Observado | Peso | Encolhido | Efeito real |
|---|---|---|---|---|
| 4 | 0,7800 pp | 0,6865 | 0,5820 pp | 0,5993 pp |
| 12 | 0,6640 pp | 0,6910 | 0,5046 pp | 0,5136 pp |
| 11 | 0,3800 pp | 0,6917 | 0,3086 pp | 0,0753 pp |
| 10 | -0,0560 pp | 0,7045 | 0,0044 pp | -0,3515 pp |
| 5 | -0,3960 pp | 0,6998 | -0,2326 pp | -0,2265 pp |
Olhe as duas primeiras linhas. O teste 4 mostrou 0,7800 e valia 0,5993; o encolhimento devolveu 0,5820. O teste 12 mostrou 0,6640 e valia 0,5136; o encolhimento devolveu 0,5046. Nos dois vencedores, a estimativa encolhida chegou muito mais perto da verdade do que a observada.
Não funciona sempre: nos testes 10 e 11 o encolhimento piorou, porque o efeito verdadeiro daqueles dois estava longe da média do programa. A promessa do encolhimento é sobre o conjunto, não sobre cada linha. E no conjunto ela se cumpre:
| Estimador | Erro quadrático médio | Redução |
|---|---|---|
| Observado, exemplo trabalhado | 4,1404 vezes 10 elevado a -6 | referência |
| Encolhido, exemplo trabalhado | 3,2041 vezes 10 elevado a -6 | 22,61% |
| Observado, 5 mil programas | 3,8571 vezes 10 elevado a -6 | referência |
| Encolhido com tau de DerSimonian e Laird | 3,0219 vezes 10 elevado a -6 | 21,65% |
| Encolhido com o tau verdadeiro | 2,7081 vezes 10 elevado a -6 | 29,79% |
A diferença entre a linha de DerSimonian e Laird e a do tau verdadeiro (21,65 contra 29,79 por cento) é o preço de ter que estimar a variância entre estudos com apenas 12 experimentos. Ele não anula o ganho, só o encolhe, o que é uma piada apropriada ao tema.
O que dá para fazer com isso na segunda-feira
Cinco usos concretos, todos possíveis com os dados que você já tem guardados:
- Reportar o programa, não a lista. Trocar “tivemos 2 vitórias em 12” por “o conjunto entregou 0,15 ponto percentual em média, intervalo de menos 0,05 a 0,36” muda a conversa com a diretoria de anedota para estimativa.
- Corrigir a projeção anual. Antes de multiplicar as vitórias por 12 meses, aplique o encolhimento. Um exagero de 1,34 vez em cima de um caso de negócio é a diferença entre um projeto que se paga e um que não.
- Comparar áreas do produto. Rodando a meta-análise por superfície (checkout, onboarding, precificação) você descobre onde o efeito médio das mudanças é maior. Isso é meta-regressão, e é como se prioriza um roadmap com dado em vez de opinião.
- Calibrar o MDE dos próximos testes. O tau estimado é uma medida direta do tamanho típico das suas mudanças. Se tau vale 0,30 ponto percentual sobre uma base de 5 por cento, planejar testes com MDE de 20 por cento relativo é planejar para não achar nada. Veja efeito mínimo detectável.
- Alimentar priors honestos. Quem usa análise bayesiana pode parar de inventar o prior: a distribuição estimada dos efeitos do próprio programa é o prior empírico certo.
Nada disso funciona sem um repositório de experimentos que guarde os inconclusivos junto com os vencedores. Um programa que só arquiva vitória não pode ser meta-analisado, porque a amostra já nasce selecionada, e todo número que sair dela vai estar enviesado para cima pelo mesmo mecanismo da maldição do vencedor.
Quatro armadilhas
Combinar testes sobrepostos no tempo. Se dois experimentos rodaram sobre os mesmos usuários e podem ter interagido, eles não são observações independentes, e o agrupamento de variância inversa assume que são. Veja testes simultâneos.
Combinar métricas diferentes. Só entra no mesmo pote o que estiver na mesma escala. Diferença absoluta de taxa de conversão com diferença absoluta de taxa de conversão; ganho relativo com ganho relativo. Misturar as duas escalas produz um número sem significado.
Escolher o que entra depois de ver o resultado. Definir o conjunto de testes a combinar é uma decisão de análise, e ela precisa ser tomada por um critério (todos os testes daquela superfície naquele trimestre) e não por conveniência. Rodar a meta-análise, achar o valor-p feio e tirar um teste é o mesmo peeking que a gente critica no nível do experimento.
Ler o combinado como se fosse um veredito de lançamento. Vale repetir porque é o erro que mais aparece: efeito de programa positivo não autoriza lançar mudanças individuais que não venceram.
Faça isso automático na Donnu
O obstáculo prático para meta-analisar um programa raramente é a matemática, é que os resultados dos testes antigos vivem em capturas de tela e planilhas mortas, sem erro-padrão guardado. Na Donnu todo experimento encerrado deixa efeito e erro-padrão no histórico, então o agrupamento fica a um filtro de distância: escolha o recorte (trimestre, superfície, tipo de mudança) e o painel devolve o efeito combinado nos dois modelos, o Q, o I quadrado, o tau estimado e o gráfico de floresta com as estimativas encolhidas ao lado das observadas. A projeção anual de impacto usa a estimativa encolhida por padrão, não a observada, porque somar vitórias declaradas é a forma mais silenciosa de um programa prometer um terço a mais do que vai entregar.
Perguntas frequentes
As respostas curtas estão na seção de perguntas frequentes desta página, montadas a partir dos mesmos cálculos apresentados aqui.
Referências
- Jonathan J. Deeks, Julian P. T. Higgins, Douglas G. Altman, Joanne E. McKenzie e Areti Angeliki Veroniki. Analysing data and undertaking meta-analyses, capítulo 10 do Cochrane Handbook for Systematic Reviews of Interventions, versão atual. Seção 10.3.1 é a fonte do método genérico de variância inversa e do registro de que a meta-análise de efeito fixo é válida sob a suposição de que todas as estimativas medem o mesmo efeito subjacente; a 10.3.2 é a fonte do modelo de efeitos aleatórios e da identificação do método de DerSimonian e Laird de 1986 como a versão mais simples; a 10.10.2 é a fonte do I quadrado como percentual da variabilidade devido a heterogeneidade em vez de acaso, do guia aproximado de interpretação (0 a 40 por cento pode não ser importante, 30 a 60 moderada, 50 a 90 substancial, 75 a 100 considerável, com a ressalva de que os limiares podem enganar) e da afirmação de que o teste de heterogeneidade é irrelevante para a escolha da análise; a 10.10.4.1 é a fonte do contraste entre o efeito fixo como efeito típico e o aleatório como efeito médio sobre uma distribuição assumida, e do registro de que o intervalo do modelo aleatório é mais largo sempre que o I quadrado for maior que zero; e a 10.10.4.5 é a fonte da advertência sobre interpretar meta-análise de efeitos aleatórios com poucos estudos.
- Nicholas Larsen, Jonathan Stallrich, Srijan Sengupta, Alex Deng, Ron Kohavi e Nathaniel T. Stevens. Statistical Challenges in Online Controlled Experiments: A Review of A/B Testing Methodology, arXiv 2212.11366, 2024. Usado aqui como panorama do estado da arte em experimentação online, incluindo o tratamento de efeitos heterogêneos entre subgrupos e a discussão de vieses que exageram a diferença medida entre tratamento e controle quando o desenho não isola os braços.
- Ron Kohavi, Alex Deng, Roger Longbotham e Ya Xu. Seven Rules of Thumb for Web Site Experimenters, KDD 2014. A regra 2 é a fonte da afirmação de que em sites como o Bing, onde milhares de experimentos rodam por ano, a maioria falha e os que dão certo melhoram as métricas-chave entre 0,1 e 1,0 por cento depois de diluídos no impacto geral; a regra 1 é a fonte do registro de que a mudança pequena com impacto grande é exceção, na ordem de talvez um em 500 experimentos no Bing, e do alerta contra o incrementalismo; e o resumo do artigo é a fonte da conclusão de que a maior parte do progresso vem de muitas melhorias pequenas ao longo do tempo.
Leia também
Perguntas frequentes
- O que é meta-análise de testes A/B?
- É combinar os resultados de vários experimentos em uma estimativa só, ponderando cada um pelo inverso da variância dele. O Manual Cochrane descreve o método genérico de variância inversa, que precisa apenas do efeito estimado e do erro-padrão de cada estudo. Aplicado a um programa de experimentação, ele responde uma pergunta que nenhum teste isolado responde: o conjunto do que a gente lançou no trimestre mexeu o ponteiro?
- Meta-análise serve para salvar um teste que deu inconclusivo?
- Não, e essa é a confusão mais cara. Ela não recupera o veredito de um experimento individual; ela estima a média do programa. No nosso exemplo com 12 testes, o agrupamento devolveu 0,1483 ponto percentual com valor-p de 0,009037, mas isso não quer dizer que o teste 6 tenha vencido. Quer dizer que o conjunto das 12 mudanças, tomado como um bloco, produziu ganho médio positivo.
- Qual a diferença entre efeito fixo e efeito aleatório?
- O modelo de efeito fixo assume que todos os experimentos estimam o MESMO efeito verdadeiro e que a diferença entre eles é só acaso. O de efeitos aleatórios assume que os efeitos verdadeiros variam e seguem uma distribuição. No nosso exemplo, o fixo devolveu valor-p de 0,009037 e o aleatório 0,137128 sobre exatamente os mesmos 12 testes. Em 5 mil programas simulados, o intervalo do fixo cobriu a média verdadeira em só 70,86 por cento das vezes contra 92,16 do aleatório.
- O que é I quadrado e qual valor é preocupante?
- É a fração da variação entre estudos que vem de heterogeneidade real em vez de acaso amostral. O Manual Cochrane dá um guia aproximado: de 0 a 40 por cento pode não ser importante, de 30 a 60 pode ser heterogeneidade moderada, de 50 a 90 substancial e de 75 a 100 considerável. Programas de experimentação costumam viver na faixa alta, porque testar coisas diferentes é o objetivo. Nos nossos 5 mil programas simulados o I quadrado médio ficou em 63,61 por cento.
- Por que a média dos vencedores exagera o resultado?
- Porque para ser declarado vencedor o teste precisa ter tido sorte, além de ter efeito real. Nos nossos 5 mil programas, os 12.633 vencedores declarados mostraram ganho médio de 0,5942 ponto percentual quando o efeito verdadeiro médio deles era 0,4424. O vencedor típico entrega 74,5 por cento do que mostrou. Somar as vitórias declaradas para calcular o impacto anual do programa é o jeito mais rápido de superestimá-lo em cerca de um terço.
- O encolhimento realmente melhora a estimativa de cada teste?
- Melhora, e dá para medir. Puxando cada estimativa em direção à média do programa, com peso proporcional à precisão dela, o erro quadrático médio caiu 21,65 por cento nos nossos 5 mil programas usando a variância entre estudos estimada por DerSimonian e Laird, e 29,79 por cento usando a variância verdadeira. No exemplo trabalhado a queda foi de 22,61 por cento.