Calculadora de teste A/A (checagem de randomização)
Rode um teste A/A com dois grupos idênticos e descubra se a sua ferramenta divide o tráfego de forma justa e mede a conversão sem viés. Cole os números dos dois grupos e receba split, valor-p e veredito. Grátis, sem cadastro, com a conta explicada.
Esta é a calculadora que valida a sua ferramenta, não o seu teste. Um teste A/A roda duas cópias do mesmo controle: como nada muda entre os grupos, o esperado é split equilibrado e conversão indistinguível. Se acusar um vencedor, o problema está na randomização ou no tracking, não na página. É diferente da calculadora de significância, que existe para achar um vencedor real num A/B, e mais completa que o verificador de SRM, que só olha o split: aqui checamos as duas coisas de uma vez, split e conversão.
Um teste A/A roda duas cópias do mesmo controle. Como nada muda entre elas, o esperado é split equilibrado e conversão indistinguível. Qualquer alarme aqui aponta bug de randomização, de tracking ou de instrumentação, não uma variação vencedora. Passe no A/A antes de confiar no seu A/B.
Como usar
- Configure na sua ferramenta duas variações idênticas (o mesmo controle nas duas), com o split que você usa nos testes reais (em geral 50/50).
- Deixe o teste rodar até acumular um volume parecido com o dos seus A/B, na casa dos milhares de visitantes por grupo.
- Cole os visitantes e as conversões de cada grupo nos campos acima.
- Leia o veredito: passou (grupos equivalentes) ou alarme (conversão diferente, split desbalanceado, ou os dois).
- Confira as duas leituras separadas: a de conversão (valor-p e z) e a de split (χ² e valor-p do sample ratio mismatch).
Como funciona: as duas contas
O teste A/A combina duas checagens independentes. A primeira, de conversão, é um teste z de duas proporções, o mesmo da calculadora de significância. Num A/A você quer que o valor-p fique ALTO (acima de 0,05): isso confirma que a diferença entre os grupos é compatível com o acaso.
A segunda, de split, é um qui-quadrado de aderência entre os visitantes que caíram em cada grupo e a divisão esperada (50/50). Aqui você também quer o valor-p ALTO (acima de 0,01): um valor baixo é sample ratio mismatch, sinal de que o motor de divisão está quebrado.
Onde p̄ é a taxa combinada dos dois grupos, Oi é o número observado em cada grupo e Ei é o esperado pelo split. O A/A só passa quando as DUAS leituras ficam tranquilas.
Exemplo trabalhado (reproduz o resultado padrão)
Com os valores que já vêm preenchidos: A1 com 20.000 visitantes e 1.000 conversões (5,00%) e A2 com 20.000 visitantes e 1.040 conversões (5,20%). A taxa combinada é 2.040/40.000 = 5,10%. O erro padrão agrupado dá √(0,051·0,949·(1/20000 + 1/20000)) ≈ 0,0022, então:
z = (0,052 − 0,050) / 0,0022 ≈ 0,91, que corresponde a um valor-p de cerca de 0,36. Bem acima de 0,05, ou seja, sem diferença significativa. No split, 20.000 contra 20.000 dá um esperado de 20.000 por grupo, então χ² = 0 e valor-p 1: perfeitamente equilibrado. As duas leituras passam, e o veredito é passou no teste A/A. É exatamente o que a ferramenta mostra ao abrir a página.
Como interpretar e onde ela engana
O veredito verde quer dizer que a sua ferramenta se comportou como deveria: dividiu o tráfego de forma justa e mediu a conversão sem viés perceptível. Um veredito vermelho é o alerta valioso. Se a bandeira é de conversão, os grupos idênticos converteram diferente, o que aponta randomização injusta ou tracking enviesado. Se é de split, o motor de divisão não entregou o 50/50. Se são as duas, algo está bem errado na instrumentação.
O limite mais importante: um A/A que passa NÃO prova que a ferramenta é perfeita, só que ela não falhou naquele volume. E lembre do falso positivo: mesmo com tudo certo, cerca de 5% dos testes A/A vão acusar uma diferença de conversão por puro acaso, a 95% de confiança. Por isso, um único alarme merece um segundo A/A antes de você concluir que há bug. Depois de calibrar a ferramenta, vá para a calculadora de significância ler o seu teste A/B de verdade, e entenda o contexto no guia o que é teste A/B.
Boas práticas com o teste A/A
O A/A é um exame de rotina da sua ferramenta, não algo que você roda só quando desconfia. Use estas regras para tirar valor dele.
- Rode um A/A ao adotar uma ferramenta nova, ao mudar a instalação do snippet ou ao trocar a fonte dos dados de conversão.
- Use volume de verdade: um A/A com poucos visitantes passa fácil e não prova nada.
- Trate um único alarme como suspeita, não como sentença. Confirme com um segundo A/A antes de caçar o bug.
- Não deixe o A/A rodando para sempre concorrendo com testes reais: ele consome tráfego que renderia mais num A/B.
Perguntas frequentes
- O que é um teste A/A?
- É um teste em que as duas variações são exatamente iguais: os dois grupos recebem o mesmo controle, sem nenhuma mudança. Como nada difere entre eles, o esperado é que a divisão de tráfego fique equilibrada e que a conversão dos dois seja estatisticamente indistinguível. Serve para validar que a sua ferramenta de teste divide o tráfego de forma justa e mede a conversão sem viés, antes de você confiar em qualquer teste A/B.
- Para que serve rodar um A/A antes do A/B?
- Para calibrar a ferramenta. Se um teste A/A acusa um vencedor onde não deveria haver nenhum, você descobre um bug de randomização, de tracking ou de instrumentação antes de tomar decisões com dinheiro em cima. Rodar um A/A de tempos em tempos, ou ao trocar de ferramenta de teste, é a forma mais barata de garantir que os seus resultados de A/B são confiáveis.
- Meu teste A/A deu diferença significativa. O que houve?
- Num A/A a diferença de conversão não deveria ser significativa. Se deu, há três suspeitos: a randomização não é justa (o motor de divisão manda perfis diferentes para cada grupo), o tracking está enviesado (uma variação dispara o pixel em momento diferente, ou perde eventos) ou é só o acaso do falso positivo, que acontece em cerca de 5% dos A/A a 95% de confiança. Rode de novo com mais dados: se persistir, é bug, não acaso.
- Qual a diferença entre esta calculadora e a de significância?
- A de significância existe para achar um vencedor num teste A/B: você quer que a diferença seja real. Esta é o contrário: as duas versões são iguais e você quer confirmar que NÃO há diferença. Além disso, o teste A/A também checa o equilíbrio do split (sample ratio mismatch), coisa que a calculadora de significância não faz. Pense nela como o exame de sanidade da sua ferramenta, não o veredito do seu teste.
- Quantos visitantes preciso para um teste A/A?
- Quanto mais, melhor: com pouca amostra o teste quase nunca acusa nada, então um A/A pequeno passa fácil sem provar que a ferramenta está boa. Use um volume parecido com o dos seus testes A/B reais, na casa dos milhares de visitantes por grupo, para ter poder de detectar um problema de verdade. Se você não tem esse tráfego, veja o guia de quantos visitantes um teste precisa.
Continue
Ferramenta calibrada? Leia o seu teste A/B na calculadora de significância estatística e cheque o equilíbrio do split de qualquer teste com o verificador de SRM. Para dimensionar o próximo teste, use a calculadora de tamanho de amostra.