Os erros que invalidam um teste A/B (e como evitar cada um)
Peeking, amostra pequena, SRM, testar demais e rodar pouco tempo: os erros que viram um teste A/B em ruído, com o sinal e a correção de cada um.
📚 Este artigo faz parte do guia O que é teste A/B? O guia completo (2026).
Um teste A/B mal conduzido é pior que nenhum teste: ele te dá confiança numa decisão errada. Estes são os erros que mais invalidam resultados, e como fugir de cada um.
1. Parar cedo (peeking)
Olhar o resultado todos os dias e encerrar assim que “deu vitória” infla o falso positivo de forma brutal: um teste desenhado para 5% de erro pode chegar perto de 25% se você fica espiando e parando. Correção: defina antes a duração/amostra e só decida no fim, ou use inferência sequencial que permite olhar sem penalizar.
2. Amostra pequena
Sem visitantes suficientes, o vencedor é sorte. Correção: calcule o tamanho de amostra antes de começar e respeite-o.
3. Divisão desigual (SRM)
Se A recebeu 60% do tráfego e B 40% sem motivo, algo quebrou (bug de redirecionamento, bot, cache) e o resultado não vale. Correção: monitore a proporção; se destoar do esperado, investigue antes de confiar no número.
4. Testar coisas demais de uma vez
Mudou botão, título, imagem e preço juntos? Você não sabe qual moveu o ponteiro. Correção: isole a variável, ou use um teste multivariado desenhado para isso.
5. Rodar por poucos dias
O comportamento de segunda é diferente do de domingo. Correção: rode ciclos inteiros (uma a duas semanas), nunca só os “dias bons”.
A regra de ouro: um vencedor honesto precisa de amostra suficiente, tempo suficiente e uma diferença sólida, ao mesmo tempo.
Faça isso automático na Donnu
A Donnu já bloqueia esses erros por padrão: calcula a amostra, checa SRM, e só declara vencedor com evidência de verdade. Sem peeking, sem achismo.
Perguntas frequentes
- O que é peeking em teste A/B?
- É olhar o resultado enquanto o teste roda e encerrar assim que a diferença "dá vitória". A prática infla o falso positivo de forma brutal: um teste desenhado para 5% de erro pode chegar perto de 25% se você fica espiando e parando. A correção é definir duração e amostra antes e só decidir no fim, ou usar inferência sequencial, que permite olhar sem penalizar.
- O que é SRM e por que ele invalida um teste?
- SRM (sample ratio mismatch) é a divisão de tráfego que destoa da esperada, por exemplo A com 60% e B com 40% num teste desenhado para 50/50. Quando isso acontece sem motivo, algo quebrou (bug de redirecionamento, bot, cache) e o resultado não vale, mesmo que pareça significativo. Monitore a proporção e investigue antes de confiar no número.
- Posso testar várias mudanças ao mesmo tempo?
- Pode, mas então você não saberá qual delas moveu o ponteiro. Se mudou botão, título, imagem e preço juntos, o teste responde se o pacote é melhor, não qual peça funcionou. Isole a variável quando quiser aprender, ou use um teste multivariado, que é desenhado para separar os efeitos.
- Por quanto tempo um teste A/B precisa rodar?
- Por ciclos inteiros, uma a duas semanas no mínimo, nunca só os dias bons. O comportamento de segunda é diferente do de domingo, e alguns dias de pico dão um resultado que não se repete quando a mudança vai para todo mundo.
- Qual é o sinal de que o vencedor do meu teste é honesto?
- Três coisas ao mesmo tempo: amostra suficiente por variação, tempo suficiente em ciclos completos e uma diferença estatisticamente sólida. Faltando qualquer uma das três, o vencedor pode ser ruído, por mais convincente que o gráfico pareça.