Teste Unicaudal x Bicaudal em Teste A/B: qual usar
Teste unicaudal ou bicaudal em teste A/B: o que muda no z crítico, quanto de amostra economiza, o risco de escolher a cauda depois e quando é legítimo.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Teste unicaudal é o teste de hipótese que procura diferença numa única direção, escolhida antes de coletar os dados, e por isso coloca todo o risco de falso positivo numa cauda só; o teste bicaudal procura diferença nas duas direções e divide esse risco ao meio. A 95 por cento de confiança, o unicaudal declara vitória a partir de z igual a 1,645 e o bicaudal só a partir de 1,96. Na prática, o unicaudal pede cerca de 21 por cento menos visitantes e, quando o efeito vai na direção prevista, devolve um valor-p que é exatamente metade do bicaudal. O preço é ficar cego para a variação que piora e, se a cauda for escolhida depois de ver o dado, dobrar o erro que você acha que está controlando. Este texto faz parte do nosso guia de significância estatística em teste A/B, que recomenda o bicaudal como padrão em um parágrafo; aqui está a conta inteira por trás dessa recomendação, com simulação, fontes dos dois lados, ferramentas e um exemplo trabalhado de ecommerce e SaaS, e as exceções em que ela não vale.
O que é teste unicaudal e o que é teste bicaudal
Todo teste A/B frequentista tem uma hipótese nula, a que você tenta derrubar, e uma alternativa, a que você quer mostrar. A diferença entre unicaudal e bicaudal está inteira em como a alternativa é escrita.
- Teste bicaudal (ou bilateral): a alternativa é “a taxa de B é diferente da de A”. Um resultado muito acima ou muito abaixo do esperado conta como evidência, e o alfa (o risco de falso positivo) é repartido entre as duas caudas.
- Teste unicaudal (ou unilateral): a alternativa é “a taxa de B é maior que a de A” (ou menor, se a direção de interesse for a queda). Só a direção escolhida conta, e o alfa inteiro fica nela.
A calculadora de amostra deste blog usa “bilateral” e “unilateral”; em inglês, two-tailed e one-tailed, ou two-sided e one-sided. É a mesma coisa.
| bicaudal | unicaudal (direção: B melhor) | |
|---|---|---|
| hipótese nula | B igual a A | B menor ou igual a A |
| hipótese alternativa | B diferente de A | B maior que A |
| onde fica o alfa de 5% | 2,5% em cada cauda | 5% na cauda de cima |
| z crítico a 95% | 1,96 em módulo | 1,645 |
| pode declarar que B piorou? | sim | não |
| pergunta que responde | B é diferente de A? | B é melhor que A? |
Nada muda na fórmula do escore z, que continua sendo a diferença entre as taxas dividida pelo erro padrão. Muda só a régua contra a qual esse z é comparado.
O que muda na região crítica: 1,645 contra 1,96
A região crítica é o conjunto de valores de z que levam a rejeitar a nula. No bicaudal a 95 por cento, são os valores acima de 1,96 ou abaixo de menos 1,96: cada faixa tem 2,5 por cento de probabilidade sob a nula. No unicaudal a 95 por cento, são os valores acima de 1,645, uma faixa só, com 5 por cento.
A faixa entre 1,645 e 1,96 é a zona de discordância: significativa para quem registrou unicaudal, não significativa para quem registrou bicaudal. Sob a nula, ela tem 2,5 por cento de probabilidade, a fatia que reaparece no custo de escolher a cauda depois. Os valores críticos, calculados com zCritical(alpha, sided) do motor estatístico do blog:
| confiança | alfa | z crítico unicaudal | z crítico bicaudal |
|---|---|---|---|
| 90% | 0,10 | 1,2816 | 1,6449 |
| 95% | 0,05 | 1,6449 | 1,9600 |
| 99% | 0,01 | 2,3263 | 2,5758 |
Repare na diagonal: o unicaudal a 95 por cento usa o mesmo número que o bicaudal a 90 por cento. Guarde isso, porque explica de onde vem a economia de amostra.
Valor-p unicaudal é metade do bicaudal, quando o efeito vai na direção prevista
O valor-p bicaudal soma a área das duas caudas além do z observado, em módulo. O unicaudal soma só a área da cauda escolhida. Como a curva normal é simétrica, a relação é exata:
A GraphPad registra as duas metades na sua página de perguntas frequentes: na direção prevista, o valor-p unicaudal é metade do bicaudal; na oposta, a diferença, mesmo grande, teria de ser atribuída ao acaso e chamada de não significativa.
É essa relação que permite ler um unicaudal registrado com a calculadora de significância deste guia, que é sempre bicaudal: se a variação está na frente, na direção declarada, divida por 2 o valor-p da tela. Se está atrás, o valor-p unicaudal é 1 menos a metade, e para esse teste a piora não existe como conclusão.
Quanto de amostra o teste unicaudal economiza
A fórmula de amostra de duas proporções eleva ao quadrado a soma do z crítico com o z do poder. Trocar 1,96 por 1,645 encolhe essa soma: com 80 por cento de poder (z de 0,8416), a razão fica perto de (1,645 + 0,8416)² ÷ (1,96 + 0,8416)², cerca de 0,79. Calculado com sampleSizePerVariant, a 95 por cento de confiança e 80 por cento de poder:
| contexto típico | taxa base | efeito mínimo (relativo) | bicaudal, por variação | unicaudal, por variação | economia |
|---|---|---|---|---|---|
| ecommerce, visitante para compra | 2% | 10% | 80.682 | 63.553 | 21,2% |
| ecommerce, visitante para compra | 2% | 20% | 21.109 | 16.627 | 21,2% |
| ecommerce, página de produto | 3% | 10% | 53.211 | 41.914 | 21,2% |
| ecommerce, página de produto | 3% | 20% | 13.914 | 10.960 | 21,2% |
| SaaS, visitante para trial | 5% | 10% | 31.234 | 24.603 | 21,2% |
| SaaS, visitante para trial | 5% | 20% | 8.158 | 6.426 | 21,2% |
| SaaS, trial para pago | 10% | 10% | 14.751 | 11.620 | 21,2% |
| SaaS, trial para pago | 10% | 5% | 57.763 | 45.500 | 21,2% |
Três leituras. A economia é quase constante: cerca de 21 por cento a 80 por cento de poder, em qualquer base e efeito; a 90 por cento de poder, cerca de 18,5 por cento (71.233 contra 58.057 na linha de 3 e 10 por cento). Não é desconto: cada número da coluna unicaudal é idêntico à amostra do bicaudal a 90 por cento de confiança, e o guia de CRO para sites de baixo tráfego usa o mesmo par, 13.914 no bicaudal contra 10.960 no unicaudal. É o mesmo orçamento de erro gasto numa cauda só. É uma alavanca pequena: mudar o efeito mínimo de 10 para 20 por cento corta cerca de 74 por cento da amostra (de 53.211 para 13.914), porque a amostra cai com o quadrado do efeito, como detalha o guia de efeito mínimo detectável; mudar a cauda corta 21.
Georgiev, que defende o unicaudal no blog da Analytics-Toolkit, escreve que o bicaudal a 95 por cento precisa de 20 a 60 por cento mais amostra que o unicaudal para detectar o mesmo efeito. É compatível com a tabela: 53.211 é 27 por cento mais que 41.914, e ele diz que a faixa varia com o limiar de significância exigido.
A economia que desaparece no calendário
Existe um detalhe operacional que muda a conta: teste A/B deve rodar semanas inteiras, para cobrir o ciclo de comportamento dos dias úteis e do fim de semana, como detalha o guia de ciclo semanal em teste A/B. Arredondada para semanas completas, a economia pode virar uma semana inteira ou pode virar zero.
| cenário | tráfego semanal | bicaudal | unicaudal | semanas inteiras, bicaudal | semanas inteiras, unicaudal |
|---|---|---|---|---|---|
| ecommerce, base 3%, efeito 10% | 42.000 | 53.211 por variação, 18 dias | 41.914 por variação, 14 dias | 3 | 2 |
| SaaS, base 8%, efeito 15% | 6.000 | 8.568 por variação, 20 dias | 6.749 por variação, 16 dias | 3 | 3 |
O outro lado da mesma moeda é o poder. Se você mantém a amostra do bicaudal e analisa como unicaudal, o poder sobe: na base de 3 por cento com efeito de 10 por cento, 53.211 visitantes por variação dão 80 por cento de poder no bicaudal e 87,63 por cento no unicaudal, pelo powerForSample do motor. É a mesma troca vista de outro ângulo, e a calculadora de poder estatístico faz a conta para o seu caso.
O custo 1: ficar cego para a variação que piora
A economia do unicaudal é paga com uma conclusão a menos. O teste registrado como “B é melhor que A” só tem dois resultados: evidência de que B é melhor, ou ausência dessa evidência. A variação que derruba a conversão cai no segundo balde, junto com a neutra.
Com números: a loja do exemplo trabalhado roda outra variação por duas semanas, 42.000 visitantes por braço. O controle converte 1.260 (3,00 por cento); a variação, 1.150 (2,74 por cento), uma queda de 8,7 por cento relativo.
- Leitura bicaudal: z de menos 2,2736, valor-p de 0,0230, intervalo de 95 por cento da diferença de menos 0,4877 a menos 0,0361 ponto percentual. Significativo: A vence. A equipe sabe que a ideia machucou a conversão e registra o aprendizado.
- Leitura unicaudal, direção B melhor: valor-p de 0,9885. Não significativo. O relatório diz o mesmo que diria diante de um empate.
Na calculadora de significância mais abaixo, esses números aparecem como 3,00% e 2,74%, melhora relativa de -8,7%, valor-p de 0,0230, intervalo de -0,5% … -0,0% (pp) e Vencedora com significância · A vence.
Quanto isso importa depende do que a piora mudaria na decisão. Se “B piorou” e “B empatou” levam ao mesmo lugar, não lançar, a cegueira custa pouco para essa decisão. Mas custa no aprendizado (a hipótese que machucou volta ao backlog em seis meses) e na validação de mudanças que já foram ao ar sem teste. Com a amostra planejada para o unicaudal (41.914 por variação), um bicaudal teria 74,22 por cento de poder para flagrar uma queda de 10 por cento relativo; o unicaudal não tem essa conclusão no desenho.
O custo 2: escolher a cauda depois de ver o dado
O teste unicaudal controla o erro em 5 por cento se a direção foi escolhida antes. Se a equipe olha o resultado e só então decide para que lado testar, a direção vira um reflexo do próprio dado.
A conta é curta. Sob a nula, o z fica acima de 1,645 em 5 por cento dos testes e abaixo de menos 1,645 em outros 5. Quem testa unicaudal “para o lado em que a variação foi” rejeita nos dois casos: 10 por cento. Quem roda bicaudal e, quando não dá, troca para unicaudal só se a variação está na frente, rejeita acima de 1,645 (5 por cento) ou abaixo de menos 1,96 (2,5 por cento): 7,5 por cento.
Para não depender só da álgebra, rodamos uma simulação com semente fixa: 20.000 testes A/A, 5.000 visitantes por braço, conversão real de 5 por cento nos dois (nenhuma diferença verdadeira), gerador pseudoaleatório mulberry32 com semente 20260915, cada teste analisado com a mesma função significance das calculadoras.
| regra de análise | taxa de “diferença significativa” | falsa vitória da variação | falsa vitória do controle | teoria |
|---|---|---|---|---|
| bicaudal registrado antes | 5,00% (999) | 2,57% (513) | 2,43% (486) | 5% |
| unicaudal registrado antes, B melhor | 5,12% (1.023) | 5,12% (1.023) | não existe | 5% |
| unicaudal na direção que o dado mostrou | 9,89% (1.978) | 5,12% (1.023) | 4,78% (955) | 10% |
| resgate: bicaudal, e se falhar com B na frente, unicaudal | 7,54% (1.509) | 5,12% (1.023) | 2,43% (486) | 7,5% |
Aqui as fontes sérias discordam, e vale ler as duas.
Quem defende o unicaudal. Georgi Georgiev, autor da Analytics-Toolkit e do site onesided.org, sustenta que valores-p e limites de confiança unilaterais oferecem as mesmas probabilidades de erro que os bilaterais, cada um sob a sua própria nula, e chega a afirmar que uma afirmação direcional pode ser apoiada no teste unicaudal correspondente sem previsão prévia. A simulação concorda com a parte técnica: “B é melhor que A” afirmado com unicaudal a 5 por cento erra, sob a nula, em cerca de 5 por cento das vezes (5,12 na tabela), prevista ou não.
Quem pede a direção antes. A simulação também mostra que a equipe que se permite as duas afirmações, “B é melhor” ou “A é melhor”, conforme o dado, faz alguma afirmação falsa em quase 10 por cento dos A/A. A UCLA é taxativa: escolher unicaudal só para obter significância, ou depois de um bicaudal que não rejeitou a nula, não é apropriado, por mais perto que o bicaudal tenha chegado. A GraphPad recomenda usar só valores-p bicaudais, entre outros motivos para evitar a tentação de mudar a análise depois do resultado.
As posições se conciliam quando se pergunta qual erro importa para a sua decisão:
- Controle atual contra variação nova. Só a vitória de B vira lançamento, então importa a coluna “falsa vitória da variação”: 2,57 por cento no bicaudal registrado e 5,12 no resgate. O resgate não é pior que o unicaudal honesto; o problema é a equipe achar que está no bicaudal de 95 por cento, com metade desse risco, e reportar assim.
- Duas versões novas sem incumbente (dois títulos, duas ofertas, qualquer uma pode ir ao ar). As duas vitórias viram lançamento, e “unicaudal para o lado do dado” lança uma versão por puro acaso em 9,89 por cento dos casos.
- Base de aprendizados. Se “a mudança piorou a conversão” vira conhecimento do time, a falsa vitória do controle também custa, e vale a taxa total.
O defeito não é a cauda. É a confiança anunciada não bater com o procedimento usado, o mesmo mecanismo do problema do peeking e dos caminhos que se bifurcam do plano de análise pré-registrado.
Quando o teste unicaudal é legítimo
O teste unicaudal é legítimo quando três condições valem juntas.
- A direção está escrita antes do teste. No plano de análise ou na configuração da ferramenta, não no slide do resultado.
- Um resultado na direção oposta levaria à mesma decisão que um empate. A UCLA formula o critério pelas consequências: o unicaudal cabe quando o custo de perder um efeito na direção não testada é desprezível, e de forma alguma irresponsável. Em teste de conversão isso é quase verdade (não lançar), mas não totalmente (o aprendizado se perde).
- A confiança reportada é a do procedimento. O relatório diz “unicaudal a 95 por cento”, e não “95 por cento de confiança”, que qualquer leitor entende como bicaudal.
Há contextos em que o unicaudal não é atalho, é a pergunta certa:
- Guardrails. Numa métrica de proteção, só a piora importa. A documentação do Statsig cita detectar regressões em guardrails como uso típico, com o exemplo de uma funcionalidade em que pode não importar se a taxa de falhas cai, mas importa se ela sobe. Ver métricas de guardrail.
- Não inferioridade. Mostrar que uma mudança mais barata ou exigida por conformidade não piora a conversão além de uma margem é unicaudal por natureza. A ICH E9 manda usar intervalo unilateral nesses estudos, e o guia de teste de equivalência trabalha o caso com margem declarada.
- Superioridade com margem. Se lançar só compensa acima de um ganho mínimo, a nula pode ser “B não supera A em pelo menos X”, o que põe a direção e o custo de implementação na mesma hipótese.
A mesma ICH E9 traz a posição mais conservadora. Ela reconhece que o tema é controverso, pede justificativa prospectiva para o teste unilateral e diz que, em ambiente regulatório, é preferível fixar o erro tipo I unilateral em metade do bilateral, 2,5 por cento. Com essa régua, o unicaudal não economiza amostra: z crítico de 1,96 dos dois jeitos. Teste de conversão não precisa do rigor de ensaio de medicamento, mas o raciocínio serve: se a economia de amostra é o único motivo, você está afrouxando a régua, não refinando a pergunta.
O que as fontes sérias e as ferramentas dizem
A tabela resume a posição de cada fonte lida para este guia. Documentação de ferramenta muda; as linhas de ferramenta foram conferidas em 15/09/2026.
| fonte | posição | o que sustenta |
|---|---|---|
| Georgiev, Analytics-Toolkit (2017, atualizado em 2018) e onesided.org | a favor do unicaudal na maioria dos testes A/B | unicaudal quando a ação depende de diferença numa direção; não permite mais erro tipo I que o bicaudal; bicaudal pede 20 a 60% mais amostra |
| GraphPad, FAQ 1318 | recomenda só valores-p bicaudais | p unicaudal é metade do bicaudal na direção prevista; direção precisa ser prevista antes dos dados |
| UCLA, Statistical Consulting | unicaudal só com justificativa de consequências | não é apropriado escolher unicaudal para obter significância ou depois de bicaudal que falhou |
| ICH E9 (diretriz de ensaios clínicos) | unilateral exige justificativa prospectiva; alfa de metade do bilateral em ambiente regulatório | intervalo unilateral em não inferioridade |
| Optimizely, Statistical significance | usa bicaudal | bicaudal é exigido pelo controle de taxa de falsas descobertas do Stats Engine |
| Statsig, One-Sided Test | padrão bicaudal; unicaudal configurável por métrica | unicaudal não detecta movimento na direção não especificada; usos em guardrail |
| Convert, Next Generation of Convert Experiences | oferece unicaudal e bicaudal no modo frequentista | escolha de cauda à esquerda ou à direita no unicaudal |
Sobre as ferramentas, só o que as páginas lidas afirmam. O Statsig deixa trocar a cauda por métrica na configuração do experimento, mostra intervalo unilateral que se estende ao infinito do lado não testado e avisa que rodar dois testes unilaterais dá um teste menos poderoso, com intervalos que parecem mais estreitos do que deveriam. A Convert, em texto atualizado em 27 de agosto de 2026, permite escolher também a cauda à esquerda ou à direita. O artigo de Georgiev listava vários fornecedores como bicaudais, com base num levantamento da ConversionXL de julho de 2015; com mais de dez anos e motores trocados desde então, a lista não entra aqui como retrato atual. As calculadoras deste blog: a de significância faz teste z bicaudal; a de amostra tem seletor bilateral e unilateral.
Exemplo trabalhado: ecommerce e SaaS com as calculadoras
Ecommerce: planejar com a calculadora de amostra
Cenário. Uma loja com conversão de 3,00 por cento na página de produto e 42.000 visitantes por semana (6.000 por dia) quer testar um bloco de prova social acima do botão de compra. A decisão é binária: lançar o bloco se ele aumentar a conversão; não lançar se não aumentar. Um resultado pior levaria à mesma decisão que um empate, e a equipe registra no plano, antes de começar, teste unicaudal, direção variação melhor, 95 por cento de confiança, 80 por cento de poder, efeito mínimo de 10 por cento relativo.
Na calculadora abaixo, digite: Taxa de conversão atual 3; Efeito mínimo detectável 10, com a opção relativo (%); Confiança 95; Poder 80; Visitantes por semana (total) 42000; Teste bilateral.
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
A tela mostra 53.211 visitantes por variação, 106.422 no total e 18 na duração estimada, em dias. Agora troque só o campo Teste para unilateral: a tela passa a mostrar 41.914 por variação, 83.828 no total e 14 dias. Arredondado para semanas completas, é a diferença entre três semanas e duas. Para o cenário de SaaS abaixo, os mesmos passos com taxa 8, efeito 15 e 6000 visitantes por semana mostram 8.568, 17.136 e 20 dias no bilateral, e 6.749, 13.498 e 16 dias no unilateral.
Ecommerce: o resultado e a calculadora de significância
Depois de 14 dias, com 42.000 visitantes por braço (acima dos 41.914 planejados):
| braço | visitantes | conversões | taxa |
|---|---|---|---|
| A, controle | 42.000 | 1.260 | 3,00% |
| B, com prova social | 42.000 | 1.350 | 3,21% |
Cole na calculadora: Controle (A) com 42000 visitantes e 1260 conversões; Variação (B) com 42000 visitantes e 1350 conversões; Confiança 95%.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
A tela mostra taxa de 3,00% no controle e 3,21% na variação, melhora relativa de +7,1%, valor-p de 0,0735, intervalo de 95 por cento da diferença de -0,0% … +0,4% (pp) e o veredito Ainda sem significância. Esse veredito é o do teste bicaudal, porque é o único que a calculadora faz.
A conta por trás, em precisão cheia:
- Taxa combinada: (1.260 + 1.350) ÷ 84.000 = 3,1071%.
- Erro padrão da diferença sob a nula: √[0,031071 · 0,968929 · (1÷42.000 + 1÷42.000)] ≈ 0,001197.
- Diferença: 3,2143% − 3,0000% = +0,2143 ponto percentual.
- Escore z: 0,002143 ÷ 0,001197 ≈ 1,7897.
- Valor-p bicaudal: 0,073505. O intervalo de 95 por cento vai de menos 0,0204 a mais 0,4490 ponto percentual; o “-0,0%” da tela é esse menos 0,0204 arredondado para uma casa.
Agora a leitura unicaudal registrada. O efeito foi para o lado previsto (B na frente), então o valor-p unicaudal é o bicaudal dividido por 2: 0,073505 ÷ 2 = 0,036752, abaixo de 0,05. Pelo plano registrado, B vence. O limite inferior unilateral de 95 por cento da diferença, que é o limite inferior do intervalo bilateral de 90 por cento, fica em mais 0,0173 ponto percentual: acima de zero, por pouco.
Há um atalho na própria calculadora. Troque Confiança para 90%: o valor-p continua 0,0735, o intervalo passa a +0,0% … +0,4% (pp) e o veredito vira Vencedora com significância · B vence. Isso acontece porque o bicaudal a 90 por cento usa a mesma linha de corte do unicaudal a 95 por cento, 1,645, e para o lado da variação as duas decisões coincidem. Duas ressalvas: o intervalo exibido é o bicaudal de 90 por cento (o rótulo do campo continua escrito “IC 95% da diferença”, mas os limites já são os de 90), e a 90 por cento a calculadora também declararia A vence se o z ficasse abaixo de menos 1,645, uma conclusão que o unicaudal registrado não tem.
SaaS: quando a cauda não economiza calendário e muda o veredito
Cenário. Um SaaS B2B com 6.000 visitantes por semana na página de preços, dos quais 8,00 por cento iniciam trial, testa uma tabela de planos com o plano intermediário destacado. Efeito mínimo de 15 por cento relativo. Como mostrou a figura de semanas, o bicaudal pede 20 dias e o unicaudal 16, e os dois arredondam para três semanas. A equipe roda 21 dias e chega a 9.000 visitantes por braço.
| braço | visitantes | trials | taxa |
|---|---|---|---|
| A, tabela atual | 9.000 | 720 | 8,00% |
| B, plano intermediário destacado | 9.000 | 785 | 8,72% |
Na mesma calculadora de significância, com 9000 e 720 no controle, 9000 e 785 na variação e confiança de 95%, a tela mostra 8,00% e 8,72%, melhora relativa de +9,0%, valor-p de 0,0801, intervalo de -0,1% … +1,5% (pp) e Ainda sem significância. Em precisão cheia: diferença de mais 0,7222 ponto percentual, z de 1,7503, valor-p bicaudal de 0,080072 e intervalo de menos 0,0865 a mais 1,5309 ponto percentual.
Se a equipe tivesse registrado unicaudal antes, o valor-p seria 0,080072 ÷ 2 = 0,040036 e B venceria, com limite inferior unilateral de mais 0,0436 ponto percentual. Se a equipe tinha registrado bicaudal, o resultado é “sem significância”, e trocar agora para unicaudal é exatamente o resgate da simulação: a falsa vitória da variação passa de cerca de 2,5 para cerca de 5 por cento, sem que ninguém escreva isso no relatório.
A cauda não economizou um dia de teste; só mudou o veredito de um resultado que caiu entre 1,645 e 1,96. É assim que o unicaudal costuma aparecer na vida real: depois do resultado, não no planejamento. Se o plano era bicaudal, a leitura honesta é inconclusivo com sinal positivo: o intervalo vai de uma pequena perda a um ganho de 1,5 ponto, e a decisão é estender até a amostra do efeito que interessa ou repetir com a direção registrada, sem cair na armadilha do poder observado.
Checklist: teste unicaudal ou bicaudal?
Responda antes de configurar o experimento, e guarde as respostas junto com o plano.
| pergunta | se a resposta for sim | se a resposta for não |
|---|---|---|
| A direção de interesse está escrita antes de qualquer dado? | unicaudal é possível | bicaudal |
| Um resultado pior levaria à mesma decisão que um empate? | unicaudal é possível | bicaudal |
| O aprendizado “a ideia piorou” vale alguma coisa para o time? | prefira bicaudal | unicaudal é possível |
| As duas versões são novas e qualquer uma pode ir ao ar? | bicaudal | siga a lista |
| A métrica é de proteção (guardrail) ou de não inferioridade? | unicaudal na direção da piora | siga a lista |
| O relatório vai dizer “unicaudal” ao lado da confiança? | unicaudal é possível | bicaudal |
| A economia de amostra muda o número de semanas do teste? | a economia é real | a cauda não compra calendário |
| O único motivo para o unicaudal é o teste terminar antes? | reconsidere: é afrouxar a régua | siga a lista |
Se todas as linhas apontam para “unicaudal é possível”, registre a direção e siga. Se alguma aponta para bicaudal, use bicaudal. Na dúvida, bicaudal: ele erra do lado conservador, e o custo é cerca de 21 por cento a mais de amostra, não uma conclusão errada.
Erros comuns
- Dividir o valor-p por 2 depois de ver que não deu. É o resgate da simulação. Se o plano era bicaudal, o valor-p é o bicaudal.
- Dividir por 2 quando a variação está atrás. O valor-p unicaudal nesse caso é 1 menos a metade do bicaudal: 0,9632 no exemplo de ecommerce invertido, e não 0,0368.
- Chamar unicaudal a 95 por cento de “95 por cento de confiança” sem qualificar. O leitor entende bicaudal. A mesma régua, dita em bicaudal, é 90 por cento.
- Usar unicaudal para economizar amostra em teste de SaaS de tráfego baixo e esquecer as semanas. No exemplo, a economia foi zero dias de calendário. Para tráfego baixo, o guia de CRO para sites de baixo tráfego lista alavancas maiores.
- Rodar unicaudal e ignorar a queda. O teste não declara piora, mas os números estão ali. Olhe o intervalo de confiança bicaudal de qualquer jeito, ou mantenha um guardrail unicaudal na direção da piora.
- Rodar dois unicaudais, um para cada lado, e ficar com o que deu. É um bicaudal com o dobro do alfa, e o Statsig alerta que isso gera intervalos estreitos demais.
- Achar que a escola bayesiana resolve a cauda. A probabilidade de B ser melhor é direcional por construção, e parar quando ela passa de 95 por cento num dia qualquer é o peeking de sempre. O guia de teste A/B bayesiano mostra como definir a regra antes.
Faça isso automático na Donnu
A dor específica deste guia não é a estatística do unicaudal, que cabe numa linha. É a escolha feita depois de olhar o dado, sem que ninguém perceba, por um time que queria ver a variação vencer.
O relatório da Donnu A/B é bayesiano: em vez de valor-p e seletor de cauda, mostra dia a dia a probabilidade de a variação ser melhor que o controle, com uma faixa de 95 por cento no gráfico e a orientação de que a decisão só amadureceu quando a linha cruza a faixa e fica lá. Probabilidade baixa aparece no mesmo gráfico que probabilidade alta, então a piora não some. Não há configuração de cauda para trocar depois do resultado, e o relatório exige um mínimo de visitantes por variação e de dias antes de declarar vencedora. Isso não substitui o plano: métrica primária e efeito que interessa continuam decisões suas, tomadas antes.
Se você roda testes frequentistas em outra ferramenta, as calculadoras gratuitas fazem as contas deste guia: tamanho de amostra com seletor bilateral e unilateral, significância bicaudal, valor-p e o simulador de peeking. Para um relatório que não pede para você escolher a cauda, comece um teste grátis de 14 dias.
Referências
- Georgiev, G. One-tailed vs Two-tailed Tests of Significance in A/B Testing. Blog da Analytics-Toolkit.com, publicado em 2017 e atualizado em 8 de agosto de 2018. Fonte da defesa do unicaudal quando a ação depende de uma diferença significativa numa direção, da estimativa de que o bicaudal a 95 por cento precisa de 20 a 60 por cento mais amostra que o unicaudal a 95 por cento, e da afirmação de que o unicaudal não permite mais erro tipo I. Página lida. blog.analytics-toolkit.com.
- Georgiev, G. 12 myths about one-tailed vs. two-tailed tests of significance. OneSided.org. Fonte da posição de que valores-p e limites de confiança unilaterais oferecem as mesmas probabilidades de erro que os bilaterais sob as respectivas nulas, e de que uma afirmação direcional pode ser apoiada em teste unicaudal sem previsão prévia. Página lida. onesided.org.
- ICH. E9: Statistical Principles for Clinical Trials. International Council for Harmonisation, 1998. Fonte da exigência de justificar de forma prospectiva o uso de testes unilaterais, do reconhecimento de que o tema é controverso, da preferência regulatória por erro tipo I unilateral de metade do bilateral e do uso de intervalo unilateral em estudos de não inferioridade. PDF lido, com extração do texto. database.ich.org.
- GraphPad. P values. One-tail or two-tail? (FAQ 1318). Fonte da relação de metade entre os valores-p na direção prevista, da regra de prever a direção antes de coletar dados, da consequência de atribuir ao acaso uma diferença na direção oposta e da recomendação de usar só valores-p bicaudais. Página lida. graphpad.com.
- UCLA Statistical Methods and Data Analytics. FAQ: What are the differences between one-tailed and two-tailed tests? Fonte da divisão do alfa entre as caudas, do critério de consequências para usar unicaudal e da proibição de escolher unicaudal para obter significância ou depois de um bicaudal que falhou. Página lida. stats.oarc.ucla.edu.
- Optimizely. Statistical significance. Central de ajuda, conferido em 15/09/2026. Fonte de que a Optimizely usa testes bicaudais porque eles são exigidos pelo controle de taxa de falsas descobertas do Stats Engine, e das definições de teste bicaudal e unicaudal. support.optimizely.com.
- Statsig. One-Sided Test. Documentação, conferido em 15/09/2026. Fonte do padrão bicaudal, do uso de unicaudal para regressões em guardrails e mudanças com impacto numa direção só, da alocação do alfa inteiro na direção de interesse, dos intervalos unilaterais que vão ao infinito e dos alertas sobre direção não especificada e sobre rodar dois testes unilaterais. docs.statsig.com.
- Convert. The Next Generation of Convert Experiences. Blog da Convert, atualizado em 27 de agosto de 2026, conferido em 15/09/2026. Fonte de que o modo frequentista oferece testes unicaudal, bicaudal e sequencial, com correções de Bonferroni e Sidak, e escolha de cauda à esquerda ou à direita. convert.com.
Leia também: Significância estatística em teste A/B · O problema do peeking · Efeito mínimo detectável · Teste de equivalência · Plano de análise pré-registrado · Quantos visitantes um teste A/B precisa · Calculadora de poder estatístico · Read in English
Perguntas frequentes
- Qual a diferença entre teste unicaudal e bicaudal?
- O teste bicaudal procura diferença nas duas direções e divide o risco de falso positivo entre as duas caudas: a 95 por cento de confiança, 2,5 por cento de cada lado, com z crítico de 1,96. O teste unicaudal procura diferença numa direção só, escolhida antes do teste, e põe os 5 por cento inteiros nela, com z crítico de 1,645. Ele exige menos evidência para declarar melhora e não tem como declarar piora.
- O valor-p unicaudal é sempre metade do bicaudal?
- Só quando o efeito observado vai na direção prevista. Nesse caso o valor-p unicaudal é exatamente metade do bicaudal: no exemplo deste guia, 0,0735 vira 0,0368. Se o efeito vai para o lado oposto, o valor-p unicaudal é 1 menos a metade do bicaudal, 0,9632 no mesmo exemplo, e o resultado não é significativo por mais forte que seja a piora.
- Quanto de amostra o teste unicaudal economiza?
- Com 95 por cento de confiança e 80 por cento de poder, cerca de 21 por cento dos visitantes, em qualquer taxa base: 41.914 contra 53.211 por variação para detectar 10 por cento relativo sobre 3 por cento de conversão. Com 90 por cento de poder a economia cai para cerca de 18,5 por cento. Quando o teste precisa rodar semanas inteiras, parte dessa economia some no arredondamento.
- Escolher a cauda depois de ver o resultado é trapaça?
- É o uso que infla o erro. Na simulação deste guia, com 20.000 testes A/A e semente fixa, testar unicaudal na direção que os dados mostraram declarou diferença significativa em 9,89 por cento dos casos, contra 5,00 por cento do bicaudal. E a equipe que roda bicaudal e troca para unicaudal só quando a variação está na frente dobra a taxa de falsa vitória da variação, de 2,57 para 5,12 por cento.
- Quando o teste unicaudal é legítimo em teste A/B?
- Quando a direção foi registrada antes do teste e um resultado pior levaria à mesma decisão que um empate, por exemplo não lançar a variação. Também é a forma natural de guardrails e de testes de não inferioridade, em que só a piora importa. Fora disso, o bicaudal é o padrão mais seguro, e é o que Optimizely usa e o que Statsig traz como configuração inicial.
- A calculadora de significância deste guia faz teste unicaudal?
- Não. Ela faz teste z bicaudal de duas proporções. Para obter o valor-p unicaudal, divida por 2 o valor mostrado quando a variação está na frente, na direção que você registrou antes. Escolher 90 por cento de confiança reproduz a decisão de um unicaudal a 95 por cento para o lado da variação, mas o intervalo exibido passa a ser o bicaudal de 90 por cento, ainda que o rótulo do campo continue dizendo 95 por cento.