Estatística

Teste Unicaudal x Bicaudal em Teste A/B: qual usar

Teste unicaudal ou bicaudal em teste A/B: o que muda no z crítico, quanto de amostra economiza, o risco de escolher a cauda depois e quando é legítimo.

Ilustração plana de duas curvas em forma de sino verde-escuras lado a lado sobre fundo verde-menta, com uma pequena área sobreposta mais clara entre elas e uma linha vertical tracejada à esquerda

Teste unicaudal é o teste de hipótese que procura diferença numa única direção, escolhida antes de coletar os dados, e por isso coloca todo o risco de falso positivo numa cauda só; o teste bicaudal procura diferença nas duas direções e divide esse risco ao meio. A 95 por cento de confiança, o unicaudal declara vitória a partir de z igual a 1,645 e o bicaudal só a partir de 1,96. Na prática, o unicaudal pede cerca de 21 por cento menos visitantes e, quando o efeito vai na direção prevista, devolve um valor-p que é exatamente metade do bicaudal. O preço é ficar cego para a variação que piora e, se a cauda for escolhida depois de ver o dado, dobrar o erro que você acha que está controlando. Este texto faz parte do nosso guia de significância estatística em teste A/B, que recomenda o bicaudal como padrão em um parágrafo; aqui está a conta inteira por trás dessa recomendação, com simulação, fontes dos dois lados, ferramentas e um exemplo trabalhado de ecommerce e SaaS, e as exceções em que ela não vale.

O que é teste unicaudal e o que é teste bicaudal

Todo teste A/B frequentista tem uma hipótese nula, a que você tenta derrubar, e uma alternativa, a que você quer mostrar. A diferença entre unicaudal e bicaudal está inteira em como a alternativa é escrita.

A calculadora de amostra deste blog usa “bilateral” e “unilateral”; em inglês, two-tailed e one-tailed, ou two-sided e one-sided. É a mesma coisa.

bicaudal unicaudal (direção: B melhor)
hipótese nula B igual a A B menor ou igual a A
hipótese alternativa B diferente de A B maior que A
onde fica o alfa de 5% 2,5% em cada cauda 5% na cauda de cima
z crítico a 95% 1,96 em módulo 1,645
pode declarar que B piorou? sim não
pergunta que responde B é diferente de A? B é melhor que A?

Nada muda na fórmula do escore z, que continua sendo a diferença entre as taxas dividida pelo erro padrão. Muda só a régua contra a qual esse z é comparado.

O que muda na região crítica: 1,645 contra 1,96

A região crítica é o conjunto de valores de z que levam a rejeitar a nula. No bicaudal a 95 por cento, são os valores acima de 1,96 ou abaixo de menos 1,96: cada faixa tem 2,5 por cento de probabilidade sob a nula. No unicaudal a 95 por cento, são os valores acima de 1,645, uma faixa só, com 5 por cento.

Região crítica do teste bicaudal e do teste unicaudal a 95 por cento de confiançaDois gráficos de curva normal lado a lado. À esquerda, o teste bicaudal: as duas caudas extremas estão pintadas, abaixo de menos 1,96 e acima de 1,96, cada uma com 2,5 por cento da área. À direita, o teste unicaudal: só a cauda de cima está pintada, a partir de 1,645, com 5 por cento da área. Uma nota indica que um z entre 1,645 e 1,96 é significativo no unicaudal e não no bicaudal.bicaudal: alfa dividido em duas caudasunicaudal: alfa inteiro numa cauda-1,9601,962,5%2,5%01,6455%um z entre 1,645 e 1,96 é significativo no unicaudal e não no bicaudal: sob a nula, isso acontece em 2,5% dos testes.curvas da distribuição do escore z sob a hipótese nula; áreas pintadas são as regiões de rejeição
O teste é o mesmo escore z. O que muda é onde fica a linha de corte, e se existe linha de corte do lado da piora.

A faixa entre 1,645 e 1,96 é a zona de discordância: significativa para quem registrou unicaudal, não significativa para quem registrou bicaudal. Sob a nula, ela tem 2,5 por cento de probabilidade, a fatia que reaparece no custo de escolher a cauda depois. Os valores críticos, calculados com zCritical(alpha, sided) do motor estatístico do blog:

confiança alfa z crítico unicaudal z crítico bicaudal
90% 0,10 1,2816 1,6449
95% 0,05 1,6449 1,9600
99% 0,01 2,3263 2,5758

Repare na diagonal: o unicaudal a 95 por cento usa o mesmo número que o bicaudal a 90 por cento. Guarde isso, porque explica de onde vem a economia de amostra.

Valor-p unicaudal é metade do bicaudal, quando o efeito vai na direção prevista

O valor-p bicaudal soma a área das duas caudas além do z observado, em módulo. O unicaudal soma só a área da cauda escolhida. Como a curva normal é simétrica, a relação é exata:

p unicaudal = p bicaudal ÷ 2, se o efeito vai na direção registrada · p unicaudal = 1 − p bicaudal ÷ 2, se vai na direção oposta

A GraphPad registra as duas metades na sua página de perguntas frequentes: na direção prevista, o valor-p unicaudal é metade do bicaudal; na oposta, a diferença, mesmo grande, teria de ser atribuída ao acaso e chamada de não significativa.

Por que o valor-p unicaudal é metade do bicaudalCurva normal com o escore z observado de 1,79 marcado à direita. A área à direita de 1,79 está pintada em verde e vale 0,0368, o valor-p unicaudal. A área espelhada à esquerda de menos 1,79 está pintada em laranja claro; somada à da direita dá 0,0735, o valor-p bicaudal. Marcas finas indicam as linhas de corte 1,645 e 1,96: o z de 1,79 fica entre elas.o mesmo z observado, duas áreas diferentes01,6451,96-1,79z observado = 1,79cauda de cimap unicaudal 0,0368cauda espelhadaentra só no bicaudalp bicaudal = 0,0368 + 0,0368 = 0,0735. Se o z fosse -1,79, o p unicaudal (direção B melhor) seria 0,9632.
Valores do exemplo de ecommerce deste guia. A soma exata sai 0,073505 e a metade, 0,036752; na figura aparecem arredondados.

É essa relação que permite ler um unicaudal registrado com a calculadora de significância deste guia, que é sempre bicaudal: se a variação está na frente, na direção declarada, divida por 2 o valor-p da tela. Se está atrás, o valor-p unicaudal é 1 menos a metade, e para esse teste a piora não existe como conclusão.

Quanto de amostra o teste unicaudal economiza

A fórmula de amostra de duas proporções eleva ao quadrado a soma do z crítico com o z do poder. Trocar 1,96 por 1,645 encolhe essa soma: com 80 por cento de poder (z de 0,8416), a razão fica perto de (1,645 + 0,8416)² ÷ (1,96 + 0,8416)², cerca de 0,79. Calculado com sampleSizePerVariant, a 95 por cento de confiança e 80 por cento de poder:

contexto típico taxa base efeito mínimo (relativo) bicaudal, por variação unicaudal, por variação economia
ecommerce, visitante para compra 2% 10% 80.682 63.553 21,2%
ecommerce, visitante para compra 2% 20% 21.109 16.627 21,2%
ecommerce, página de produto 3% 10% 53.211 41.914 21,2%
ecommerce, página de produto 3% 20% 13.914 10.960 21,2%
SaaS, visitante para trial 5% 10% 31.234 24.603 21,2%
SaaS, visitante para trial 5% 20% 8.158 6.426 21,2%
SaaS, trial para pago 10% 10% 14.751 11.620 21,2%
SaaS, trial para pago 10% 5% 57.763 45.500 21,2%

Três leituras. A economia é quase constante: cerca de 21 por cento a 80 por cento de poder, em qualquer base e efeito; a 90 por cento de poder, cerca de 18,5 por cento (71.233 contra 58.057 na linha de 3 e 10 por cento). Não é desconto: cada número da coluna unicaudal é idêntico à amostra do bicaudal a 90 por cento de confiança, e o guia de CRO para sites de baixo tráfego usa o mesmo par, 13.914 no bicaudal contra 10.960 no unicaudal. É o mesmo orçamento de erro gasto numa cauda só. É uma alavanca pequena: mudar o efeito mínimo de 10 para 20 por cento corta cerca de 74 por cento da amostra (de 53.211 para 13.914), porque a amostra cai com o quadrado do efeito, como detalha o guia de efeito mínimo detectável; mudar a cauda corta 21.

Georgiev, que defende o unicaudal no blog da Analytics-Toolkit, escreve que o bicaudal a 95 por cento precisa de 20 a 60 por cento mais amostra que o unicaudal para detectar o mesmo efeito. É compatível com a tabela: 53.211 é 27 por cento mais que 41.914, e ele diz que a faixa varia com o limiar de significância exigido.

A economia que desaparece no calendário

Existe um detalhe operacional que muda a conta: teste A/B deve rodar semanas inteiras, para cobrir o ciclo de comportamento dos dias úteis e do fim de semana, como detalha o guia de ciclo semanal em teste A/B. Arredondada para semanas completas, a economia pode virar uma semana inteira ou pode virar zero.

Duração do teste em dias e em semanas inteiras, bicaudal e unicaudalBarras horizontais de duração sobre uma escala de 0 a 21 dias, com linhas verticais a cada 7 dias. Ecommerce com 42.000 visitantes por semana: bicaudal precisa de 18 dias e arredonda para 21; unicaudal precisa de 14 dias e fica em 14. SaaS com 6.000 visitantes por semana: bicaudal precisa de 20 dias e unicaudal de 16; os dois arredondam para 21 dias.dias calculados (barra cheia) e semanas inteiras (contorno)07 dias14 dias21 diasecommerce, bicaudal53.211 por variação18 diasecommerce, unicaudal41.914 por variação14 dias1 semana a menosSaaS, bicaudal8.568 por variação20 diasSaaS, unicaudal6.749 por variação16 diasecommerce: base 3%, efeito de 10%. SaaS: base 8%, efeito de 15%. Ambos a 95% de confiança e 80% de poder.
No ecommerce, o unicaudal cabe em duas semanas e o bicaudal pede três. No SaaS, os dois terminam na terceira semana: a cauda não economizou um dia de calendário.
cenário tráfego semanal bicaudal unicaudal semanas inteiras, bicaudal semanas inteiras, unicaudal
ecommerce, base 3%, efeito 10% 42.000 53.211 por variação, 18 dias 41.914 por variação, 14 dias 3 2
SaaS, base 8%, efeito 15% 6.000 8.568 por variação, 20 dias 6.749 por variação, 16 dias 3 3

O outro lado da mesma moeda é o poder. Se você mantém a amostra do bicaudal e analisa como unicaudal, o poder sobe: na base de 3 por cento com efeito de 10 por cento, 53.211 visitantes por variação dão 80 por cento de poder no bicaudal e 87,63 por cento no unicaudal, pelo powerForSample do motor. É a mesma troca vista de outro ângulo, e a calculadora de poder estatístico faz a conta para o seu caso.

O custo 1: ficar cego para a variação que piora

A economia do unicaudal é paga com uma conclusão a menos. O teste registrado como “B é melhor que A” só tem dois resultados: evidência de que B é melhor, ou ausência dessa evidência. A variação que derruba a conversão cai no segundo balde, junto com a neutra.

Com números: a loja do exemplo trabalhado roda outra variação por duas semanas, 42.000 visitantes por braço. O controle converte 1.260 (3,00 por cento); a variação, 1.150 (2,74 por cento), uma queda de 8,7 por cento relativo.

Na calculadora de significância mais abaixo, esses números aparecem como 3,00% e 2,74%, melhora relativa de -8,7%, valor-p de 0,0230, intervalo de -0,5% … -0,0% (pp) e Vencedora com significância · A vence.

O que cada teste consegue dizer em cada realidadeMatriz com três colunas de realidade, B melhor, B igual e B pior, e duas linhas de teste. Na linha do bicaudal, as três colunas têm conclusões distintas: B vence, sem significância e A vence. Na linha do unicaudal com direção B melhor, só a primeira coluna tem conclusão própria, B vence; as colunas B igual e B pior mostram a mesma conclusão, sem significância, destacada em laranja.o que o relatório consegue dizerB é melhorB é igualB é piorbicaudalB diferente de AB vencesem significânciaA venceunicaudalB maior que AB vencesem significânciaempate e piora recebem o mesmo rótulono exemplo: 1.260 contra 1.150 conversões em 42.000 visitantes por braço.bicaudal: p de 0,0230, A vence. unicaudal (B melhor): p de 0,9885, sem significância.
Cada conclusão verde é uma decisão possível. O unicaudal tem uma a menos, e é justamente a que avisaria que a ideia machucou.

Quanto isso importa depende do que a piora mudaria na decisão. Se “B piorou” e “B empatou” levam ao mesmo lugar, não lançar, a cegueira custa pouco para essa decisão. Mas custa no aprendizado (a hipótese que machucou volta ao backlog em seis meses) e na validação de mudanças que já foram ao ar sem teste. Com a amostra planejada para o unicaudal (41.914 por variação), um bicaudal teria 74,22 por cento de poder para flagrar uma queda de 10 por cento relativo; o unicaudal não tem essa conclusão no desenho.

O custo 2: escolher a cauda depois de ver o dado

O teste unicaudal controla o erro em 5 por cento se a direção foi escolhida antes. Se a equipe olha o resultado e só então decide para que lado testar, a direção vira um reflexo do próprio dado.

A conta é curta. Sob a nula, o z fica acima de 1,645 em 5 por cento dos testes e abaixo de menos 1,645 em outros 5. Quem testa unicaudal “para o lado em que a variação foi” rejeita nos dois casos: 10 por cento. Quem roda bicaudal e, quando não dá, troca para unicaudal só se a variação está na frente, rejeita acima de 1,645 (5 por cento) ou abaixo de menos 1,96 (2,5 por cento): 7,5 por cento.

Para não depender só da álgebra, rodamos uma simulação com semente fixa: 20.000 testes A/A, 5.000 visitantes por braço, conversão real de 5 por cento nos dois (nenhuma diferença verdadeira), gerador pseudoaleatório mulberry32 com semente 20260915, cada teste analisado com a mesma função significance das calculadoras.

regra de análise taxa de “diferença significativa” falsa vitória da variação falsa vitória do controle teoria
bicaudal registrado antes 5,00% (999) 2,57% (513) 2,43% (486) 5%
unicaudal registrado antes, B melhor 5,12% (1.023) 5,12% (1.023) não existe 5%
unicaudal na direção que o dado mostrou 9,89% (1.978) 5,12% (1.023) 4,78% (955) 10%
resgate: bicaudal, e se falhar com B na frente, unicaudal 7,54% (1.509) 5,12% (1.023) 2,43% (486) 7,5%
Falsos positivos em 20.000 testes A/A por regra de análiseBarras horizontais empilhadas numa escala de 0 a 10 por cento. Bicaudal registrado antes: 2,57 por cento de falsa vitória da variação e 2,43 do controle, total 5,00. Unicaudal registrado antes: 5,12 por cento, só do lado da variação. Unicaudal na direção do dado: 5,12 mais 4,78, total 9,89. Resgate: 5,12 mais 2,43, total 7,54. Uma linha tracejada marca os 5 por cento prometidos.20.000 testes A/A, nenhuma diferença real, semente 202609155% prometidos0%10%bicaudal registrado5,00%unicaudal registrado5,12%cauda escolhida depois9,89%resgate do bicaudal7,54%falsa vitória da variaçãofalsa vitória do controle5.000 visitantes por braço, conversão real de 5% nos dois, gerador mulberry32
O resgate é o caso mais comum na vida real e o mais traiçoeiro: a taxa total parece só um pouco acima de 5%, mas a falsa vitória da variação, que é a que vira lançamento, dobrou.

Aqui as fontes sérias discordam, e vale ler as duas.

Quem defende o unicaudal. Georgi Georgiev, autor da Analytics-Toolkit e do site onesided.org, sustenta que valores-p e limites de confiança unilaterais oferecem as mesmas probabilidades de erro que os bilaterais, cada um sob a sua própria nula, e chega a afirmar que uma afirmação direcional pode ser apoiada no teste unicaudal correspondente sem previsão prévia. A simulação concorda com a parte técnica: “B é melhor que A” afirmado com unicaudal a 5 por cento erra, sob a nula, em cerca de 5 por cento das vezes (5,12 na tabela), prevista ou não.

Quem pede a direção antes. A simulação também mostra que a equipe que se permite as duas afirmações, “B é melhor” ou “A é melhor”, conforme o dado, faz alguma afirmação falsa em quase 10 por cento dos A/A. A UCLA é taxativa: escolher unicaudal só para obter significância, ou depois de um bicaudal que não rejeitou a nula, não é apropriado, por mais perto que o bicaudal tenha chegado. A GraphPad recomenda usar só valores-p bicaudais, entre outros motivos para evitar a tentação de mudar a análise depois do resultado.

As posições se conciliam quando se pergunta qual erro importa para a sua decisão:

O defeito não é a cauda. É a confiança anunciada não bater com o procedimento usado, o mesmo mecanismo do problema do peeking e dos caminhos que se bifurcam do plano de análise pré-registrado.

Quando o teste unicaudal é legítimo

O teste unicaudal é legítimo quando três condições valem juntas.

  1. A direção está escrita antes do teste. No plano de análise ou na configuração da ferramenta, não no slide do resultado.
  2. Um resultado na direção oposta levaria à mesma decisão que um empate. A UCLA formula o critério pelas consequências: o unicaudal cabe quando o custo de perder um efeito na direção não testada é desprezível, e de forma alguma irresponsável. Em teste de conversão isso é quase verdade (não lançar), mas não totalmente (o aprendizado se perde).
  3. A confiança reportada é a do procedimento. O relatório diz “unicaudal a 95 por cento”, e não “95 por cento de confiança”, que qualquer leitor entende como bicaudal.

Há contextos em que o unicaudal não é atalho, é a pergunta certa:

A mesma ICH E9 traz a posição mais conservadora. Ela reconhece que o tema é controverso, pede justificativa prospectiva para o teste unilateral e diz que, em ambiente regulatório, é preferível fixar o erro tipo I unilateral em metade do bilateral, 2,5 por cento. Com essa régua, o unicaudal não economiza amostra: z crítico de 1,96 dos dois jeitos. Teste de conversão não precisa do rigor de ensaio de medicamento, mas o raciocínio serve: se a economia de amostra é o único motivo, você está afrouxando a régua, não refinando a pergunta.

O que as fontes sérias e as ferramentas dizem

A tabela resume a posição de cada fonte lida para este guia. Documentação de ferramenta muda; as linhas de ferramenta foram conferidas em 15/09/2026.

fonte posição o que sustenta
Georgiev, Analytics-Toolkit (2017, atualizado em 2018) e onesided.org a favor do unicaudal na maioria dos testes A/B unicaudal quando a ação depende de diferença numa direção; não permite mais erro tipo I que o bicaudal; bicaudal pede 20 a 60% mais amostra
GraphPad, FAQ 1318 recomenda só valores-p bicaudais p unicaudal é metade do bicaudal na direção prevista; direção precisa ser prevista antes dos dados
UCLA, Statistical Consulting unicaudal só com justificativa de consequências não é apropriado escolher unicaudal para obter significância ou depois de bicaudal que falhou
ICH E9 (diretriz de ensaios clínicos) unilateral exige justificativa prospectiva; alfa de metade do bilateral em ambiente regulatório intervalo unilateral em não inferioridade
Optimizely, Statistical significance usa bicaudal bicaudal é exigido pelo controle de taxa de falsas descobertas do Stats Engine
Statsig, One-Sided Test padrão bicaudal; unicaudal configurável por métrica unicaudal não detecta movimento na direção não especificada; usos em guardrail
Convert, Next Generation of Convert Experiences oferece unicaudal e bicaudal no modo frequentista escolha de cauda à esquerda ou à direita no unicaudal

Sobre as ferramentas, só o que as páginas lidas afirmam. O Statsig deixa trocar a cauda por métrica na configuração do experimento, mostra intervalo unilateral que se estende ao infinito do lado não testado e avisa que rodar dois testes unilaterais dá um teste menos poderoso, com intervalos que parecem mais estreitos do que deveriam. A Convert, em texto atualizado em 27 de agosto de 2026, permite escolher também a cauda à esquerda ou à direita. O artigo de Georgiev listava vários fornecedores como bicaudais, com base num levantamento da ConversionXL de julho de 2015; com mais de dez anos e motores trocados desde então, a lista não entra aqui como retrato atual. As calculadoras deste blog: a de significância faz teste z bicaudal; a de amostra tem seletor bilateral e unilateral.

Exemplo trabalhado: ecommerce e SaaS com as calculadoras

Ecommerce: planejar com a calculadora de amostra

Cenário. Uma loja com conversão de 3,00 por cento na página de produto e 42.000 visitantes por semana (6.000 por dia) quer testar um bloco de prova social acima do botão de compra. A decisão é binária: lançar o bloco se ele aumentar a conversão; não lançar se não aumentar. Um resultado pior levaria à mesma decisão que um empate, e a equipe registra no plano, antes de começar, teste unicaudal, direção variação melhor, 95 por cento de confiança, 80 por cento de poder, efeito mínimo de 10 por cento relativo.

Na calculadora abaixo, digite: Taxa de conversão atual 3; Efeito mínimo detectável 10, com a opção relativo (%); Confiança 95; Poder 80; Visitantes por semana (total) 42000; Teste bilateral.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

A tela mostra 53.211 visitantes por variação, 106.422 no total e 18 na duração estimada, em dias. Agora troque só o campo Teste para unilateral: a tela passa a mostrar 41.914 por variação, 83.828 no total e 14 dias. Arredondado para semanas completas, é a diferença entre três semanas e duas. Para o cenário de SaaS abaixo, os mesmos passos com taxa 8, efeito 15 e 6000 visitantes por semana mostram 8.568, 17.136 e 20 dias no bilateral, e 6.749, 13.498 e 16 dias no unilateral.

Ecommerce: o resultado e a calculadora de significância

Depois de 14 dias, com 42.000 visitantes por braço (acima dos 41.914 planejados):

braço visitantes conversões taxa
A, controle 42.000 1.260 3,00%
B, com prova social 42.000 1.350 3,21%

Cole na calculadora: Controle (A) com 42000 visitantes e 1260 conversões; Variação (B) com 42000 visitantes e 1350 conversões; Confiança 95%.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

A tela mostra taxa de 3,00% no controle e 3,21% na variação, melhora relativa de +7,1%, valor-p de 0,0735, intervalo de 95 por cento da diferença de -0,0% … +0,4% (pp) e o veredito Ainda sem significância. Esse veredito é o do teste bicaudal, porque é o único que a calculadora faz.

A conta por trás, em precisão cheia:

Agora a leitura unicaudal registrada. O efeito foi para o lado previsto (B na frente), então o valor-p unicaudal é o bicaudal dividido por 2: 0,073505 ÷ 2 = 0,036752, abaixo de 0,05. Pelo plano registrado, B vence. O limite inferior unilateral de 95 por cento da diferença, que é o limite inferior do intervalo bilateral de 90 por cento, fica em mais 0,0173 ponto percentual: acima de zero, por pouco.

Há um atalho na própria calculadora. Troque Confiança para 90%: o valor-p continua 0,0735, o intervalo passa a +0,0% … +0,4% (pp) e o veredito vira Vencedora com significância · B vence. Isso acontece porque o bicaudal a 90 por cento usa a mesma linha de corte do unicaudal a 95 por cento, 1,645, e para o lado da variação as duas decisões coincidem. Duas ressalvas: o intervalo exibido é o bicaudal de 90 por cento (o rótulo do campo continua escrito “IC 95% da diferença”, mas os limites já são os de 90), e a 90 por cento a calculadora também declararia A vence se o z ficasse abaixo de menos 1,645, uma conclusão que o unicaudal registrado não tem.

SaaS: quando a cauda não economiza calendário e muda o veredito

Cenário. Um SaaS B2B com 6.000 visitantes por semana na página de preços, dos quais 8,00 por cento iniciam trial, testa uma tabela de planos com o plano intermediário destacado. Efeito mínimo de 15 por cento relativo. Como mostrou a figura de semanas, o bicaudal pede 20 dias e o unicaudal 16, e os dois arredondam para três semanas. A equipe roda 21 dias e chega a 9.000 visitantes por braço.

braço visitantes trials taxa
A, tabela atual 9.000 720 8,00%
B, plano intermediário destacado 9.000 785 8,72%

Na mesma calculadora de significância, com 9000 e 720 no controle, 9000 e 785 na variação e confiança de 95%, a tela mostra 8,00% e 8,72%, melhora relativa de +9,0%, valor-p de 0,0801, intervalo de -0,1% … +1,5% (pp) e Ainda sem significância. Em precisão cheia: diferença de mais 0,7222 ponto percentual, z de 1,7503, valor-p bicaudal de 0,080072 e intervalo de menos 0,0865 a mais 1,5309 ponto percentual.

Se a equipe tivesse registrado unicaudal antes, o valor-p seria 0,080072 ÷ 2 = 0,040036 e B venceria, com limite inferior unilateral de mais 0,0436 ponto percentual. Se a equipe tinha registrado bicaudal, o resultado é “sem significância”, e trocar agora para unicaudal é exatamente o resgate da simulação: a falsa vitória da variação passa de cerca de 2,5 para cerca de 5 por cento, sem que ninguém escreva isso no relatório.

A cauda não economizou um dia de teste; só mudou o veredito de um resultado que caiu entre 1,645 e 1,96. É assim que o unicaudal costuma aparecer na vida real: depois do resultado, não no planejamento. Se o plano era bicaudal, a leitura honesta é inconclusivo com sinal positivo: o intervalo vai de uma pequena perda a um ganho de 1,5 ponto, e a decisão é estender até a amostra do efeito que interessa ou repetir com a direção registrada, sem cair na armadilha do poder observado.

Checklist: teste unicaudal ou bicaudal?

Responda antes de configurar o experimento, e guarde as respostas junto com o plano.

pergunta se a resposta for sim se a resposta for não
A direção de interesse está escrita antes de qualquer dado? unicaudal é possível bicaudal
Um resultado pior levaria à mesma decisão que um empate? unicaudal é possível bicaudal
O aprendizado “a ideia piorou” vale alguma coisa para o time? prefira bicaudal unicaudal é possível
As duas versões são novas e qualquer uma pode ir ao ar? bicaudal siga a lista
A métrica é de proteção (guardrail) ou de não inferioridade? unicaudal na direção da piora siga a lista
O relatório vai dizer “unicaudal” ao lado da confiança? unicaudal é possível bicaudal
A economia de amostra muda o número de semanas do teste? a economia é real a cauda não compra calendário
O único motivo para o unicaudal é o teste terminar antes? reconsidere: é afrouxar a régua siga a lista

Se todas as linhas apontam para “unicaudal é possível”, registre a direção e siga. Se alguma aponta para bicaudal, use bicaudal. Na dúvida, bicaudal: ele erra do lado conservador, e o custo é cerca de 21 por cento a mais de amostra, não uma conclusão errada.

Erros comuns

Faça isso automático na Donnu

A dor específica deste guia não é a estatística do unicaudal, que cabe numa linha. É a escolha feita depois de olhar o dado, sem que ninguém perceba, por um time que queria ver a variação vencer.

O relatório da Donnu A/B é bayesiano: em vez de valor-p e seletor de cauda, mostra dia a dia a probabilidade de a variação ser melhor que o controle, com uma faixa de 95 por cento no gráfico e a orientação de que a decisão só amadureceu quando a linha cruza a faixa e fica lá. Probabilidade baixa aparece no mesmo gráfico que probabilidade alta, então a piora não some. Não há configuração de cauda para trocar depois do resultado, e o relatório exige um mínimo de visitantes por variação e de dias antes de declarar vencedora. Isso não substitui o plano: métrica primária e efeito que interessa continuam decisões suas, tomadas antes.

Se você roda testes frequentistas em outra ferramenta, as calculadoras gratuitas fazem as contas deste guia: tamanho de amostra com seletor bilateral e unilateral, significância bicaudal, valor-p e o simulador de peeking. Para um relatório que não pede para você escolher a cauda, comece um teste grátis de 14 dias.

Referências

Leia também: Significância estatística em teste A/B · O problema do peeking · Efeito mínimo detectável · Teste de equivalência · Plano de análise pré-registrado · Quantos visitantes um teste A/B precisa · Calculadora de poder estatístico · Read in English

Perguntas frequentes

Qual a diferença entre teste unicaudal e bicaudal?
O teste bicaudal procura diferença nas duas direções e divide o risco de falso positivo entre as duas caudas: a 95 por cento de confiança, 2,5 por cento de cada lado, com z crítico de 1,96. O teste unicaudal procura diferença numa direção só, escolhida antes do teste, e põe os 5 por cento inteiros nela, com z crítico de 1,645. Ele exige menos evidência para declarar melhora e não tem como declarar piora.
O valor-p unicaudal é sempre metade do bicaudal?
Só quando o efeito observado vai na direção prevista. Nesse caso o valor-p unicaudal é exatamente metade do bicaudal: no exemplo deste guia, 0,0735 vira 0,0368. Se o efeito vai para o lado oposto, o valor-p unicaudal é 1 menos a metade do bicaudal, 0,9632 no mesmo exemplo, e o resultado não é significativo por mais forte que seja a piora.
Quanto de amostra o teste unicaudal economiza?
Com 95 por cento de confiança e 80 por cento de poder, cerca de 21 por cento dos visitantes, em qualquer taxa base: 41.914 contra 53.211 por variação para detectar 10 por cento relativo sobre 3 por cento de conversão. Com 90 por cento de poder a economia cai para cerca de 18,5 por cento. Quando o teste precisa rodar semanas inteiras, parte dessa economia some no arredondamento.
Escolher a cauda depois de ver o resultado é trapaça?
É o uso que infla o erro. Na simulação deste guia, com 20.000 testes A/A e semente fixa, testar unicaudal na direção que os dados mostraram declarou diferença significativa em 9,89 por cento dos casos, contra 5,00 por cento do bicaudal. E a equipe que roda bicaudal e troca para unicaudal só quando a variação está na frente dobra a taxa de falsa vitória da variação, de 2,57 para 5,12 por cento.
Quando o teste unicaudal é legítimo em teste A/B?
Quando a direção foi registrada antes do teste e um resultado pior levaria à mesma decisão que um empate, por exemplo não lançar a variação. Também é a forma natural de guardrails e de testes de não inferioridade, em que só a piora importa. Fora disso, o bicaudal é o padrão mais seguro, e é o que Optimizely usa e o que Statsig traz como configuração inicial.
A calculadora de significância deste guia faz teste unicaudal?
Não. Ela faz teste z bicaudal de duas proporções. Para obter o valor-p unicaudal, divida por 2 o valor mostrado quando a variação está na frente, na direção que você registrou antes. Escolher 90 por cento de confiança reproduz a decisão de um unicaudal a 95 por cento para o lado da variação, mas o intervalo exibido passa a ser o bicaudal de 90 por cento, ainda que o rótulo do campo continue dizendo 95 por cento.