Ferramenta

Calculadora de teste A/A (checagem de randomização)

Rode um teste A/A com dois grupos idênticos e descubra se a sua ferramenta divide o tráfego de forma justa e mede a conversão sem viés. Cole os números dos dois grupos e receba split, valor-p e veredito. Grátis, sem cadastro, com a conta explicada.

Esta é a calculadora que valida a sua ferramenta, não o seu teste. Um teste A/A roda duas cópias do mesmo controle: como nada muda entre os grupos, o esperado é split equilibrado e conversão indistinguível. Se acusar um vencedor, o problema está na randomização ou no tracking, não na página. É diferente da calculadora de significância, que existe para achar um vencedor real num A/B, e mais completa que o verificador de SRM, que só olha o split: aqui checamos as duas coisas de uma vez, split e conversão.

Calculadora de teste A/A
Grupo A1
Grupo A2

Taxa A1-
Taxa A2-
Diferença-
z-
valor-p (conversão)-
χ² (split)-
valor-p (split)-

Um teste A/A roda duas cópias do mesmo controle. Como nada muda entre elas, o esperado é split equilibrado e conversão indistinguível. Qualquer alarme aqui aponta bug de randomização, de tracking ou de instrumentação, não uma variação vencedora. Passe no A/A antes de confiar no seu A/B.

Como usar

  1. Configure na sua ferramenta duas variações idênticas (o mesmo controle nas duas), com o split que você usa nos testes reais (em geral 50/50).
  2. Deixe o teste rodar até acumular um volume parecido com o dos seus A/B, na casa dos milhares de visitantes por grupo.
  3. Cole os visitantes e as conversões de cada grupo nos campos acima.
  4. Leia o veredito: passou (grupos equivalentes) ou alarme (conversão diferente, split desbalanceado, ou os dois).
  5. Confira as duas leituras separadas: a de conversão (valor-p e z) e a de split (χ² e valor-p do sample ratio mismatch).

Como funciona: as duas contas

O teste A/A combina duas checagens independentes. A primeira, de conversão, é um teste z de duas proporções, o mesmo da calculadora de significância. Num A/A você quer que o valor-p fique ALTO (acima de 0,05): isso confirma que a diferença entre os grupos é compatível com o acaso.

z = (p̂B − p̂A) / √( p̄·(1−p̄)·(1/nA + 1/nB) )

A segunda, de split, é um qui-quadrado de aderência entre os visitantes que caíram em cada grupo e a divisão esperada (50/50). Aqui você também quer o valor-p ALTO (acima de 0,01): um valor baixo é sample ratio mismatch, sinal de que o motor de divisão está quebrado.

χ² = Σ (Oi − Ei)² / Ei

Onde é a taxa combinada dos dois grupos, Oi é o número observado em cada grupo e Ei é o esperado pelo split. O A/A só passa quando as DUAS leituras ficam tranquilas.

Exemplo trabalhado (reproduz o resultado padrão)

Com os valores que já vêm preenchidos: A1 com 20.000 visitantes e 1.000 conversões (5,00%) e A2 com 20.000 visitantes e 1.040 conversões (5,20%). A taxa combinada é 2.040/40.000 = 5,10%. O erro padrão agrupado dá √(0,051·0,949·(1/20000 + 1/20000)) ≈ 0,0022, então:

z = (0,052 − 0,050) / 0,0022 ≈ 0,91, que corresponde a um valor-p de cerca de 0,36. Bem acima de 0,05, ou seja, sem diferença significativa. No split, 20.000 contra 20.000 dá um esperado de 20.000 por grupo, então χ² = 0 e valor-p 1: perfeitamente equilibrado. As duas leituras passam, e o veredito é passou no teste A/A. É exatamente o que a ferramenta mostra ao abrir a página.

Como interpretar e onde ela engana

O veredito verde quer dizer que a sua ferramenta se comportou como deveria: dividiu o tráfego de forma justa e mediu a conversão sem viés perceptível. Um veredito vermelho é o alerta valioso. Se a bandeira é de conversão, os grupos idênticos converteram diferente, o que aponta randomização injusta ou tracking enviesado. Se é de split, o motor de divisão não entregou o 50/50. Se são as duas, algo está bem errado na instrumentação.

O limite mais importante: um A/A que passa NÃO prova que a ferramenta é perfeita, só que ela não falhou naquele volume. E lembre do falso positivo: mesmo com tudo certo, cerca de 5% dos testes A/A vão acusar uma diferença de conversão por puro acaso, a 95% de confiança. Por isso, um único alarme merece um segundo A/A antes de você concluir que há bug. Depois de calibrar a ferramenta, vá para a calculadora de significância ler o seu teste A/B de verdade, e entenda o contexto no guia o que é teste A/B.

Boas práticas com o teste A/A

O A/A é um exame de rotina da sua ferramenta, não algo que você roda só quando desconfia. Use estas regras para tirar valor dele.

Perguntas frequentes

O que é um teste A/A?
É um teste em que as duas variações são exatamente iguais: os dois grupos recebem o mesmo controle, sem nenhuma mudança. Como nada difere entre eles, o esperado é que a divisão de tráfego fique equilibrada e que a conversão dos dois seja estatisticamente indistinguível. Serve para validar que a sua ferramenta de teste divide o tráfego de forma justa e mede a conversão sem viés, antes de você confiar em qualquer teste A/B.
Para que serve rodar um A/A antes do A/B?
Para calibrar a ferramenta. Se um teste A/A acusa um vencedor onde não deveria haver nenhum, você descobre um bug de randomização, de tracking ou de instrumentação antes de tomar decisões com dinheiro em cima. Rodar um A/A de tempos em tempos, ou ao trocar de ferramenta de teste, é a forma mais barata de garantir que os seus resultados de A/B são confiáveis.
Meu teste A/A deu diferença significativa. O que houve?
Num A/A a diferença de conversão não deveria ser significativa. Se deu, há três suspeitos: a randomização não é justa (o motor de divisão manda perfis diferentes para cada grupo), o tracking está enviesado (uma variação dispara o pixel em momento diferente, ou perde eventos) ou é só o acaso do falso positivo, que acontece em cerca de 5% dos A/A a 95% de confiança. Rode de novo com mais dados: se persistir, é bug, não acaso.
Qual a diferença entre esta calculadora e a de significância?
A de significância existe para achar um vencedor num teste A/B: você quer que a diferença seja real. Esta é o contrário: as duas versões são iguais e você quer confirmar que NÃO há diferença. Além disso, o teste A/A também checa o equilíbrio do split (sample ratio mismatch), coisa que a calculadora de significância não faz. Pense nela como o exame de sanidade da sua ferramenta, não o veredito do seu teste.
Quantos visitantes preciso para um teste A/A?
Quanto mais, melhor: com pouca amostra o teste quase nunca acusa nada, então um A/A pequeno passa fácil sem provar que a ferramenta está boa. Use um volume parecido com o dos seus testes A/B reais, na casa dos milhares de visitantes por grupo, para ter poder de detectar um problema de verdade. Se você não tem esse tráfego, veja o guia de quantos visitantes um teste precisa.
Incorporar esta ferramenta no seu site

Cole este código onde quiser exibir a calculadora. O link de crédito abaixo do quadro nos ajuda e é livre para manter.

Continue

Ferramenta calibrada? Leia o seu teste A/B na calculadora de significância estatística e cheque o equilíbrio do split de qualquer teste com o verificador de SRM. Para dimensionar o próximo teste, use a calculadora de tamanho de amostra.

Ferramentas relacionadas

Ver todas as ferramentas →