Teste A/B

Os erros que invalidam um teste A/B (e como evitar cada um)

Peeking, amostra pequena, SRM, testar demais e rodar pouco tempo: os erros que viram um teste A/B em ruído, com o sinal e a correção de cada um.

Um teste A/B mal conduzido é pior que nenhum teste: ele te dá confiança numa decisão errada. Estes são os erros que mais invalidam resultados, e como fugir de cada um.

1. Parar cedo (peeking)

Olhar o resultado todos os dias e encerrar assim que “deu vitória” infla o falso positivo de forma brutal: um teste desenhado para 5% de erro pode chegar perto de 25% se você fica espiando e parando. Correção: defina antes a duração/amostra e só decida no fim, ou use inferência sequencial que permite olhar sem penalizar.

2. Amostra pequena

Sem visitantes suficientes, o vencedor é sorte. Correção: calcule o tamanho de amostra antes de começar e respeite-o.

3. Divisão desigual (SRM)

Se A recebeu 60% do tráfego e B 40% sem motivo, algo quebrou (bug de redirecionamento, bot, cache) e o resultado não vale. Correção: monitore a proporção; se destoar do esperado, investigue antes de confiar no número.

4. Testar coisas demais de uma vez

Mudou botão, título, imagem e preço juntos? Você não sabe qual moveu o ponteiro. Correção: isole a variável, ou use um teste multivariado desenhado para isso.

5. Rodar por poucos dias

O comportamento de segunda é diferente do de domingo. Correção: rode ciclos inteiros (uma a duas semanas), nunca só os “dias bons”.

A regra de ouro: um vencedor honesto precisa de amostra suficiente, tempo suficiente e uma diferença sólida, ao mesmo tempo.

Faça isso automático na Donnu

A Donnu já bloqueia esses erros por padrão: calcula a amostra, checa SRM, e só declara vencedor com evidência de verdade. Sem peeking, sem achismo.

Perguntas frequentes

O que é peeking em teste A/B?
É olhar o resultado enquanto o teste roda e encerrar assim que a diferença "dá vitória". A prática infla o falso positivo de forma brutal: um teste desenhado para 5% de erro pode chegar perto de 25% se você fica espiando e parando. A correção é definir duração e amostra antes e só decidir no fim, ou usar inferência sequencial, que permite olhar sem penalizar.
O que é SRM e por que ele invalida um teste?
SRM (sample ratio mismatch) é a divisão de tráfego que destoa da esperada, por exemplo A com 60% e B com 40% num teste desenhado para 50/50. Quando isso acontece sem motivo, algo quebrou (bug de redirecionamento, bot, cache) e o resultado não vale, mesmo que pareça significativo. Monitore a proporção e investigue antes de confiar no número.
Posso testar várias mudanças ao mesmo tempo?
Pode, mas então você não saberá qual delas moveu o ponteiro. Se mudou botão, título, imagem e preço juntos, o teste responde se o pacote é melhor, não qual peça funcionou. Isole a variável quando quiser aprender, ou use um teste multivariado, que é desenhado para separar os efeitos.
Por quanto tempo um teste A/B precisa rodar?
Por ciclos inteiros, uma a duas semanas no mínimo, nunca só os dias bons. O comportamento de segunda é diferente do de domingo, e alguns dias de pico dão um resultado que não se repete quando a mudança vai para todo mundo.
Qual é o sinal de que o vencedor do meu teste é honesto?
Três coisas ao mesmo tempo: amostra suficiente por variação, tempo suficiente em ciclos completos e uma diferença estatisticamente sólida. Faltando qualquer uma das três, o vencedor pode ser ruído, por mais convincente que o gráfico pareça.