Fator de Bayes em Teste A/B: o peso da evidência
O fator de Bayes mede quanto os dados moveram a crença entre duas hipóteses. A conta, o paradoxo de Lindley em números e o limite do método.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
O fator de Bayes responde uma pergunta que o valor-p não responde: quantas vezes os dados observados são mais prováveis sob a hipótese de que existe diferença do que sob a hipótese de que não existe. Ele é o multiplicador que transforma a sua chance a priori em chance a posteriori, e pode apontar para os dois lados. No exemplo trabalhado deste guia, uma leitura de 4.200 visitantes com 210 conversões contra 4.200 com 273 devolve um valor-p de 0,003150, considerado significativo por qualquer critério usual, e um fator de Bayes de 0,9992 com prior uniforme, ou seja, evidência praticamente nula em qualquer direção. Este guia mostra a conta fechada para duas proporções, o paradoxo de Lindley em cinco linhas calculadas, o caso em que o fator cresce sem limite, a única situação em que ele diz com clareza que não há efeito, e o preço que ele cobra em escolha de prior. Faz parte do nosso guia completo de teste A/B e complementa o guia de teste A/B bayesiano.
A pergunta que o valor-p não responde
O valor-p mede uma coisa só: a probabilidade de observar dados tão extremos quanto os seus SE a hipótese nula fosse verdadeira. Ele não olha para a hipótese alternativa em momento nenhum, e por isso não pode ser lido como probabilidade de a alternativa ser verdadeira.
Jeffreys resumiu o desconforto com o método numa frase que Wagenmakers reproduz: o que o uso do valor-p implica é que uma hipótese que pode ser verdadeira é rejeitada porque ela não previu resultados observáveis que não ocorreram, o que parece um procedimento notável.
Berger dá o tamanho concreto do problema. Ele descreve um aplicativo que simula uma longa série de testes com dados normais e registra com que frequência a hipótese nula é verdadeira em cada faixa de valor-p. Se metade das hipóteses nulas dessa série é verdadeira a priori, entre os testes com valor-p perto de 0,05 pelo menos 22 por cento e tipicamente mais de 50 por cento das nulas correspondentes serão verdadeiras. Ele acrescenta um segundo cenário: quando cerca de 90 por cento das nulas são verdadeiras a priori, como estimado para a literatura de epidemiologia, entre os testes com valor-p perto de 0,05 pelo menos 72 por cento e tipicamente mais de 90 por cento das nulas serão verdadeiras.
O fator de Bayes é a resposta direta para essa lacuna. A definição operacional cabe em uma linha:
chance a posteriori = chance a priori vezes o fator de Bayes.
Deng, Lu e Chen escrevem exatamente essa relação ao formalizar o teste bayesiano para experimentos online, e ela é o que dá ao fator de Bayes a interpretação de peso da evidência trazida pelos dados: é o quanto a sua crença precisa se mover, e a direção para onde ela precisa se mover.
A conta, para duas proporções
Para um teste A/B de conversão a conta fecha em forma exata, sem simulação. As duas hipóteses são:
- Sem diferença: existe uma única taxa de conversão comum aos dois braços.
- Com diferença: cada braço tem a sua própria taxa, e as duas são livres.
Sob cada hipótese, calcula-se a probabilidade dos dados observados na média de todos os valores que os parâmetros poderiam assumir, ponderados pelo prior. O fator de Bayes é a razão entre essas duas médias. Como os dois braços são binomiais com os mesmos dados, os coeficientes binomiais aparecem nas duas contas e se cancelam, e sobra apenas uma razão de funções beta que qualquer planilha calcula.
O ponto sutil está no “na média”. Wagenmakers explica a consequência: uma das vantagens de tirar a média em vez de maximizar é que a média incorpora automaticamente uma penalidade por complexidade do modelo. Um modelo em que a taxa é livre para assumir qualquer valor no intervalo de 0 a 1 é mais complexo do que o modelo que fixa uma taxa comum, e valores que se revelam muito implausíveis à luz dos dados observados puxam a média para baixo.
É essa penalidade que faz o fator de Bayes discordar do valor-p. O valor-p compara o seu dado com o melhor caso da hipótese nula. O fator de Bayes compara o dado com a média da hipótese alternativa inteira, incluindo todos os efeitos gigantescos que ela permite e que o seu dado não mostrou.
O exemplo trabalhado: valor-p de 0,0031 e fator de Bayes de 0,9992
O exemplo de referência das nossas calculadoras é uma leitura de 4.200 visitantes por braço, com 210 conversões no controle e 273 na variação. Cole na calculadora abaixo:
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Ela devolve 5,00 por cento contra 6,50 por cento, mais 30,0 por cento relativo e valor-p de 0,0031. A tela arredonda para quatro casas; a diferença absoluta é de 1,5000 ponto percentual e o valor-p com mais casas é 0,003150. Pelo critério clássico, isso é significativo com folga: o resultado passa por 0,05 e passa por 0,01.
O fator de Bayes dessa mesma leitura, com prior uniforme nas duas taxas, é 0,9992. Com chances a priori iguais, a probabilidade a posteriori de existir diferença fica em 49,98 por cento, praticamente idêntica aos 50 por cento de onde saiu.
Os dois números estão certos e respondem perguntas diferentes. O valor-p diz: se não houvesse diferença nenhuma, um resultado assim ou mais extremo apareceria em cerca de 3 de cada 1.000 testes. O fator de Bayes diz: esses dados são igualmente prováveis sob as duas hipóteses, porque a hipótese de que existe diferença tem que dividir a sua credibilidade entre um efeito de 1,5 ponto e todos os efeitos de 10, 20 ou 40 pontos que ela também permite, e os quais o dado não sustenta.
Um teste bayesiano que responde outra pergunta ainda, a de qual variação é melhor e por quanto, é o da calculadora abaixo. Ela não calcula fator de Bayes: ela calcula a probabilidade de a variação ser melhor e a perda esperada de escolher errado.
Modelo Beta-Binomial com prior uniforme Beta(1,1) e intervalo de credibilidade de 95%. Cálculo determinístico, recalcula ao vivo.
Essas três leituras não são substitutas. Valor-p, fator de Bayes e probabilidade de superar respondem, respectivamente, a compatibilidade com o nulo, o peso da evidência entre duas hipóteses, e a direção da decisão. A ferramenta de decisão prática num teste A/B costuma ser a terceira, junto com a perda esperada. O fator de Bayes é a ferramenta de leitura da evidência.
O paradoxo de Lindley, em cinco linhas calculadas
Aqui está a demonstração mais desconfortável do método. Nas cinco leituras abaixo, o valor-p é o mesmo, sempre perto de 0,05. A única coisa que muda é o tamanho do teste.
| por braço | controle | variação | efeito | valor-p | fator de Bayes | evidência CONTRA haver efeito |
|---|---|---|---|---|---|---|
| 1.000 | 50 | 71 | mais 2,1000 pp | 0,048884 | 0,1849 | 5,41 vezes |
| 5.000 | 250 | 294 | mais 0,8800 pp | 0,052381 | 0,0746 | 13,41 vezes |
| 20.000 | 1.000 | 1.087 | mais 0,4350 pp | 0,050452 | 0,0378 | 26,49 vezes |
| 100.000 | 5.000 | 5.193 | mais 0,1930 pp | 0,049728 | 0,0169 | 59,16 vezes |
| 500.000 | 25.000 | 25.429 | mais 0,0858 pp | 0,049944 | 0,0075 | 133,42 vezes |
O valor-p fica parado e o fator de Bayes anda 18 vezes, sempre na mesma direção: contra a existência de efeito. Um resultado “significativo a 5 por cento” num teste de meio milhão por braço é, em termos de peso de evidência, um resultado que favorece a hipótese de que não há diferença por mais de 130 para 1.
O resultado é geral, não um artefato do prior escolhido. Wagenmakers registra que, para qualquer prior contínuo e estritamente positivo, a probabilidade a posteriori da hipótese nula converge para 1 conforme a amostra cresce, desde que o valor-p permaneça constante, e credita o resultado a Berger e Sellke e a Lindley. A conclusão dele é direta: não existe prior plausível para o qual a probabilidade a posteriori da hipótese nula seja monotonicamente relacionada ao valor-p conforme o número de observações aumenta.
A leitura prática para quem roda testes A/B em escala grande: num teste de centenas de milhares de visitantes por braço, um valor-p apertado de 0,04 ou 0,05 não é um resultado marginalmente positivo, é um resultado que mede um efeito pequeno demais para justificar a hipótese de que ele existe. É o mesmo alerta que aparece na região de equivalência prática, por outro caminho.
Quando o efeito é real, o fator cresce sem limite
O paradoxo acima não significa que o fator de Bayes seja pessimista por natureza. Ele significa que ele exige que o efeito não encolha conforme a amostra cresce. Segure o efeito verdadeiro em mais 1 ponto percentual sobre uma base de 5 por cento e veja o que acontece:
| por braço | controle | variação | valor-p | fator de Bayes | leitura |
|---|---|---|---|---|---|
| 2.000 | 100 | 120 | 0,165416 | 0,0472 | contra o efeito, 21 para 1 |
| 5.000 | 250 | 300 | 0,028295 | 0,1265 | contra o efeito, 8 para 1 |
| 10.000 | 500 | 600 | 0,001925 | 0,9941 | empate |
| 20.000 | 1.000 | 1.200 | 0,000012 | 86,81 | a favor, 87 para 1 |
| 40.000 | 2.000 | 2.400 | abaixo do exibível | 936.314 | a favor, esmagador |
| 80.000 | 4.000 | 4.800 | abaixo do exibível | mais de 100 trilhões | a favor, absoluto |
Duas coisas saltam dessa tabela.
Primeira: o valor-p declara vitória em 5.000 por braço e o fator de Bayes só empata em 10.000. Com 5.000 por braço o resultado já é significativo a 5 por cento, com valor-p de 0,028295, e o peso da evidência ainda é 8 para 1 CONTRA a existência do efeito. Quem lança com base nesse teste está lançando com evidência desfavorável, por mais estranho que isso soe.
Segunda: a partir de 20.000 por braço a evidência vira e não para de crescer. O fator sai de 86,81 para 936.314 ao dobrar a amostra, e para mais de 100 trilhões ao dobrar de novo. O crescimento do fator de Bayes é exponencial no tamanho da amostra quando o efeito é real, e isso é uma propriedade e não um defeito.
Vale notar de onde vem a assimetria dos 5.000: o tamanho de amostra que a nossa calculadora recomenda para detectar um efeito relativo de 20 por cento sobre uma base de 5 por cento, com 80 por cento de poder, é 8.158 por variação. Ou seja, o teste de 5.000 por braço está subdimensionado, e a significância que ele produziu é a significância de um teste que ainda não tinha dados suficientes.
O que o valor-p nunca consegue dizer
O caso mais útil do fator de Bayes é o que o teste clássico simplesmente não cobre: evidência a favor de não haver efeito.
| por braço | leitura | valor-p | fator de Bayes | evidência a favor de NÃO haver diferença |
|---|---|---|---|---|
| 2.000 | 100 contra 100 | 1,0000 | 0,0173 | 57,86 para 1 |
| 10.000 | 500 contra 500 | 1,0000 | 0,0077 | 129,42 para 1 |
| 50.000 | 2.500 contra 2.500 | 1,0000 | 0,0035 | 289,42 para 1 |
| 200.000 | 10.000 contra 10.000 | 1,0000 | 0,0017 | 578,84 para 1 |
O valor-p é 1,0000 nas quatro linhas e não distingue uma da outra. O fator de Bayes distingue: um empate em 2.000 por braço é um resultado morno e um empate em 200.000 por braço é uma afirmação forte de que aquela mudança não moveu nada. Essa distinção é a que o time de produto precisa para decidir se arquiva a hipótese ou se volta a ela com um teste maior.
A parte incômoda: o prior importa, e muito
Nada do que está acima sai de graça. O fator de Bayes depende do prior escolhido para a hipótese alternativa, e a dependência não é decorativa. Tome uma leitura intermediária, 20.000 por braço com 1.000 conversões no controle e 1.080 na variação, que na calculadora devolve mais 8,0 por cento relativo e valor-p de 0,0716. A diferença absoluta é de mais 0,4000 ponto percentual e o intervalo vai de menos 0,0351 a mais 0,8351 ponto, ou seja, ele cruza o zero por pouco.
| prior sobre cada taxa | o que ele afirma | fator de Bayes | probabilidade a posteriori de haver efeito |
|---|---|---|---|
| uniforme entre 0 e 1 | qualquer taxa é igualmente plausível | 0,0282 | 2,74% |
| média 5%, concentração fraca | taxas em torno de 5%, com muita folga | 0,4823 | 32,54% |
| média 5%, concentração média | taxas em torno de 5%, com folga moderada | 0,9333 | 48,27% |
| média 5%, concentração forte | taxas próximas de 5%, com pouca folga | 1,3559 | 57,55% |
O mesmo dado atravessa o valor 1 quando o prior muda. O prior uniforme é o mais desfavorável possível para a hipótese de que existe efeito, porque ele espalha credibilidade por taxas de 40, 70 ou 95 por cento, que ninguém que trabalhe com conversão considera plausíveis, e a penalidade por complexidade cobra por cada uma delas.
A conclusão prática não é abandonar o método, é declarar o prior antes de olhar os dados, exatamente como se declara o nível de significância num teste clássico. E existe um caminho objetivo: Deng, Lu e Chen registram que boa parte da dificuldade de escolher um prior pode ser mitigada usando dados de testes A/B históricos para aprender o prior empiricamente, quando é razoável supor que os testes anteriores vêm da mesma distribuição de ideias. Esse é o mesmo raciocínio de priors bayesianos e de encolhimento bayesiano: o histórico do programa é informação.
Monitoramento contínuo: onde o método é mais confortável
Existe uma vantagem operacional concreta. No teste clássico, olhar o resultado todo dia e parar quando ele fica significativo infla o erro tipo I, e é por isso que o problema do peeking exige correção sequencial.
Deng, Lu e Chen provam formalmente a validade do teste bayesiano com monitoramento contínuo quando regras de parada apropriadas são usadas, e ilustram o resultado com simulações. Eles também apontam as práticas ruins em que a regra de parada não é apropriada, e comparam a abordagem com as correções do teste clássico.
Duas ressalvas importam. Primeira, “regra apropriada” é uma condição, não uma dispensa: eles registram explicitamente que a propriedade não vale se o fator de Bayes é calculado sobre um subconjunto selecionado dos dados. Segunda, isso trata do erro de espiar, não do erro de decidir cedo demais: um fator de Bayes de 3 num teste de dois dias continua sendo um fator de Bayes de 3, com toda a incerteza que ele carrega.
Como usar o fator de Bayes na prática
- Declare o prior no plano de análise, antes de rodar. Sem isso, o fator de Bayes vira um parâmetro ajustável até o resultado agradar.
- Reporte fator de Bayes E valor-p, sem escolher só um. Quando os dois concordam, a leitura é fácil. Quando discordam, a discordância é a informação.
- Trate a discordância como sinal de efeito pequeno. Fator de Bayes baixo com valor-p baixo quer dizer, quase sempre, que o efeito medido é pequeno em relação ao que a hipótese alternativa permitiria.
- Use o fator de Bayes para arquivar hipóteses. É a única das três réguas que autoriza dizer “isso não move o ponteiro, pare de tentar”.
- Não converta o fator de Bayes em uma decisão sozinho. A decisão de lançar depende de custo, risco e valor, e a régua para isso é a perda esperada ou uma análise de valor da informação.
- Dimensione o teste antes. Um fator de Bayes calculado sobre um teste subdimensionado é honesto e inútil ao mesmo tempo: ele vai dizer, corretamente, que os dados não sustentam nada.
- Se for monitorar continuamente, fixe a regra de parada antes. Ela é a condição do resultado, não um detalhe.
Erros comuns
- Ler o fator de Bayes como probabilidade. Ele é um multiplicador de chances, não uma probabilidade. Só com chance a priori declarada ele vira probabilidade a posteriori.
- Escolher o prior depois de ver os dados. É a versão bayesiana de mudar o nível de significância no fim do teste.
- Concluir que o valor-p está errado. Ele não está errado, ele responde outra pergunta. O erro é interpretá-lo como probabilidade de a hipótese nula ser verdadeira.
- Usar prior uniforme em taxa de conversão e não avisar. Uniforme entre 0 e 1 é um prior fortíssimo, e a favor do nulo, num contexto em que ninguém acredita numa taxa de 60 por cento.
- Achar que fator de Bayes dispensa dimensionar o teste. Não dispensa. Veja quantos visitantes você precisa.
- Apresentar um fator entre 0,3 e 3 como conclusão. Essa faixa é, em qualquer escala de interpretação, o território do “os dados não decidiram”.
- Comparar fatores de Bayes calculados com priors diferentes. Eles não estão na mesma escala e a comparação não significa nada.
Faça isso automático na Donnu
O fator de Bayes precisa de duas coisas que a maioria dos painéis não guarda: os quatro números crus do teste, sem arredondamento, e o registro de qual prior estava valendo quando a análise foi planejada. O segundo é o que separa um teste bayesiano honesto de um resultado ajustado depois.
A Donnu guarda os contadores de exposição e conversão por braço no nível bruto e mantém o histórico de configuração do experimento, incluindo o que foi decidido antes de o teste começar. Isso deixa o cálculo do fator de Bayes reproduzível meses depois, com o prior que valia na época e não com o que parece conveniente hoje.
E vale a recomendação de escopo: o fator de Bayes é uma régua de evidência, não uma régua de decisão. Para a decisão, a calculadora bayesiana entrega probabilidade de superar e perda esperada, que é o que a maior parte dos times realmente precisa olhar antes de lançar.
Referências
- Wagenmakers, E. J. A Practical Solution to the Pervasive Problems of p Values. Psychonomic Bulletin and Review, volume 14, número 5, 2007, páginas 779 a 804. Fonte da relação entre chances a priori, fator de Bayes e chances a posteriori; da explicação de que tirar a média da verossimilhança sobre o prior incorpora automaticamente uma penalidade por complexidade do modelo, porque valores implausíveis à luz dos dados reduzem a probabilidade preditiva a priori; da citação de Jeffreys, página 385 da Theory of Probability de 1961, de que o uso do valor-p implica rejeitar uma hipótese que pode ser verdadeira porque ela não previu resultados observáveis que não ocorreram; e do registro de que, para qualquer prior contínuo e estritamente positivo, a probabilidade a posteriori da hipótese nula converge para 1 conforme a amostra cresce com valor-p constante, creditado a Berger e Sellke e a Lindley. ejwagenmakers.com.
- Berger, J. O. Could Fisher, Jeffreys and Neyman Have Agreed on Testing? Statistical Science, volume 18, número 1, 2003, páginas 1 a 32. Fonte do resultado de que, numa longa série de testes em que metade das hipóteses nulas é verdadeira a priori, entre os testes com valor-p perto de 0,05 pelo menos 22 por cento e tipicamente mais de 50 por cento das nulas correspondentes serão verdadeiras; e do segundo cenário, com cerca de 90 por cento de nulas verdadeiras a priori, em que pelo menos 72 por cento e tipicamente mais de 90 por cento das nulas serão verdadeiras na mesma faixa de valor-p. www2.stat.duke.edu.
- Deng, A., Lu, J. e Chen, S. Continuous Monitoring of A/B Tests without Pain: Optional Stopping in Bayesian Testing. 2016. Fonte da formulação de que a chance a posteriori é a chance a priori multiplicada pelo fator de Bayes, com o fator definido como a razão de verossimilhanças entre as duas hipóteses; da prova formal da validade do teste bayesiano sob monitoramento contínuo quando regras de parada apropriadas são usadas, com a ressalva de que a propriedade não vale se o fator é calculado sobre um subconjunto selecionado dos dados; e do registro de que a dificuldade de escolher prior pode ser mitigada aprendendo o prior empiricamente a partir de testes A/B históricos. arxiv.org.
Leia também: Teste A/B bayesiano · Perda esperada · Priors bayesianos · Região de equivalência prática · Problema do peeking · Calculadora bayesiana · Read in English
Perguntas frequentes
- O que é o fator de Bayes num teste A/B?
- É a razão entre a probabilidade dos dados observados sob a hipótese de que existe diferença e a probabilidade dos mesmos dados sob a hipótese de que não existe. Ele é o número pelo qual você multiplica a sua chance a priori para obter a chance a posteriori. Um fator de 10 significa que os dados são dez vezes mais prováveis se houver diferença; um fator de 0,1 significa o contrário, e o valor-p não tem como expressar essa segunda situação.
- Um valor-p de 0,003 é sempre evidência forte?
- Não. No exemplo trabalhado deste guia, a leitura de 4.200 visitantes com 210 conversões contra 4.200 com 273 devolve um valor-p de 0,003150 e um fator de Bayes de 0,9992 com prior uniforme, ou seja, os dados são praticamente igualmente prováveis sob as duas hipóteses. Berger registra que, numa longa série de testes em que metade das hipóteses nulas é verdadeira, entre os testes com valor-p perto de 0,05 pelo menos 22 por cento e tipicamente mais de 50 por cento das nulas correspondentes serão verdadeiras.
- O que é o paradoxo de Lindley?
- É o fato de que, mantendo o valor-p fixo, o fator de Bayes se move CONTRA a hipótese de que existe efeito conforme a amostra cresce. Nos cinco casos calculados neste guia, todos com valor-p perto de 0,05, o fator de Bayes cai de 0,1849 com 1.000 por braço para 0,0075 com 500.000 por braço. Ou seja, a mesma significância vira evidência 5 vezes contra a hipótese num teste pequeno e 133 vezes contra num teste enorme.
- O fator de Bayes consegue dizer que NÃO existe efeito?
- Sim, e é a diferença prática mais útil dele. Um valor-p alto só significa ausência de evidência contra a hipótese nula. Num empate exato de 200.000 por braço com a mesma taxa, o fator de Bayes calculado aqui é 0,0017, ou seja, os dados são 579 vezes mais prováveis sob a hipótese de que não há diferença. O valor-p nessa mesma leitura é 1,0000 e não distingue esse caso de um teste com 200 visitantes.
- O prior muda muito o resultado?
- Muda, e esse é o custo honesto do método. Com a mesma leitura de 20.000 por braço, 1.000 contra 1.080 conversões, o fator de Bayes vai de 0,0282 com prior uniforme a 1,3559 com um prior Beta de média 5 por cento e forte concentração, atravessando o valor 1. O prior precisa ser declarado antes de olhar os dados, exatamente como o nível de significância num teste clássico.
- Posso olhar o fator de Bayes todo dia sem penalidade?
- Com regra de parada apropriada, sim. Deng, Lu e Chen provam formalmente a validade do teste bayesiano sob monitoramento contínuo quando as regras de parada são apropriadas, e apontam as práticas ruins em que a regra não é apropriada. Isso é diferente do teste clássico, em que espiar sem correção infla o erro tipo I.