Quantos visitantes um teste A/B precisa? A regra prática
A resposta honesta sobre amostra em teste A/B: os 3 fatores que definem o número, a regra de bolso e por que pouca gente leva a decisões erradas.
📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
“Quantos visitantes eu preciso?” é a pergunta que decide se o seu teste A/B vale alguma coisa ou é ruído. A resposta curta: depende de três coisas e quase sempre é mais gente do que você imagina.
Os 3 fatores que definem a amostra
- Taxa de conversão atual. Quanto menor a taxa, maior a amostra. Detectar melhora numa página que converte 1% exige muito mais gente do que numa que converte 10%.
- Efeito mínimo detectável (MDE). Qual o menor ganho que vale a pena descobrir? Detectar +20% é barato; detectar +2% custa uma amostra enorme.
- Rigor (confiança e poder). O padrão de mercado é 95% de confiança e 80% de poder. Mais rigor, mais amostra.
A regra de bolso
Para uma taxa base de ~5% e um ganho relativo de ~10%, você precisa de milhares de visitantes por variação, rodando por pelo menos uma a duas semanas inteiras. Rodar com 200 pessoas e “ver quem ganhou” é o caminho mais curto para uma decisão errada.
Amostra pequena não dá um resultado “menos preciso”: dá um resultado enganoso. O vencedor vira sorte.
E se meu tráfego é baixo?
Se você não alcança o tamanho de amostra num prazo razoável, teste mudanças maiores (não microcopy), foque na métrica mais frequente do funil, ou use abordagens sequenciais/bayesianas que lidam melhor com volume baixo. Testar o irrelevante com pouca gente só gera falsa confiança.
Faça isso automático na Donnu
A Donnu calcula o tamanho de amostra e a duração pra você, e usa estatística bayesiana que evita a armadilha de parar cedo. Você foca na hipótese; a matemática fica com a gente.
Perguntas frequentes
- Quantos visitantes um teste A/B precisa?
- Depende de três fatores: a sua taxa de conversão atual, o efeito mínimo detectável (MDE) que você quer enxergar e o rigor escolhido. Com o padrão de mercado de 95% de confiança e 80% de poder, detectar um ganho relativo de 10% sobre uma taxa base de 5% exige cerca de 31 mil visitantes por variação. Não existe número único que sirva para todo site.
- Por que uma taxa de conversão baixa exige amostra maior?
- Porque quanto menor a taxa, menos conversões cada visitante gera e mais tempo o teste leva para separar sinal de ruído. Detectar uma melhora numa página que converte 1% exige muito mais gente do que na mesma melhora sobre uma página que converte 10%.
- O que é o efeito mínimo detectável (MDE)?
- É o menor ganho que você quer ser capaz de enxergar com confiança. Ele entra na conta antes do teste, não depois: detectar um ganho de 20% é barato em amostra, detectar um ganho de 2% custa uma amostra enorme. Escolher um MDE realista é a alavanca mais forte de quem tem pouco tráfego.
- Posso rodar um teste A/B com 200 visitantes?
- Não com resultado confiável. Amostra pequena não entrega um resultado menos preciso, entrega um resultado enganoso: o vencedor vira sorte. Rodar com 200 pessoas e ver quem ganhou é o caminho mais curto para uma decisão errada.
- E se o meu tráfego não alcança essa amostra?
- Teste mudanças maiores em vez de microcopy, foque na métrica mais frequente do funil (cliques e etapas intermediárias convertem mais que a compra) ou use abordagens sequenciais e bayesianas, que lidam melhor com volume baixo. Testar o irrelevante com pouca gente só gera falsa confiança.
- Quanto tempo o teste precisa rodar, além da amostra?
- Pelo menos uma a duas semanas inteiras, mesmo que a amostra seja atingida antes. O comportamento de segunda é diferente do de domingo, e rodar só os dias bons distorce o resultado com sazonalidade.