Estatística

Fator de Bayes em Teste A/B: o peso da evidência

O fator de Bayes mede quanto os dados moveram a crença entre duas hipóteses. A conta, o paradoxo de Lindley em números e o limite do método.

Ilustração plana de uma balança de dois pratos em equilíbrio, com um cubo pequeno e denso de um lado e grãos espalhados do outro

O fator de Bayes responde uma pergunta que o valor-p não responde: quantas vezes os dados observados são mais prováveis sob a hipótese de que existe diferença do que sob a hipótese de que não existe. Ele é o multiplicador que transforma a sua chance a priori em chance a posteriori, e pode apontar para os dois lados. No exemplo trabalhado deste guia, uma leitura de 4.200 visitantes com 210 conversões contra 4.200 com 273 devolve um valor-p de 0,003150, considerado significativo por qualquer critério usual, e um fator de Bayes de 0,9992 com prior uniforme, ou seja, evidência praticamente nula em qualquer direção. Este guia mostra a conta fechada para duas proporções, o paradoxo de Lindley em cinco linhas calculadas, o caso em que o fator cresce sem limite, a única situação em que ele diz com clareza que não há efeito, e o preço que ele cobra em escolha de prior. Faz parte do nosso guia completo de teste A/B e complementa o guia de teste A/B bayesiano.

A pergunta que o valor-p não responde

O valor-p mede uma coisa só: a probabilidade de observar dados tão extremos quanto os seus SE a hipótese nula fosse verdadeira. Ele não olha para a hipótese alternativa em momento nenhum, e por isso não pode ser lido como probabilidade de a alternativa ser verdadeira.

Jeffreys resumiu o desconforto com o método numa frase que Wagenmakers reproduz: o que o uso do valor-p implica é que uma hipótese que pode ser verdadeira é rejeitada porque ela não previu resultados observáveis que não ocorreram, o que parece um procedimento notável.

Berger dá o tamanho concreto do problema. Ele descreve um aplicativo que simula uma longa série de testes com dados normais e registra com que frequência a hipótese nula é verdadeira em cada faixa de valor-p. Se metade das hipóteses nulas dessa série é verdadeira a priori, entre os testes com valor-p perto de 0,05 pelo menos 22 por cento e tipicamente mais de 50 por cento das nulas correspondentes serão verdadeiras. Ele acrescenta um segundo cenário: quando cerca de 90 por cento das nulas são verdadeiras a priori, como estimado para a literatura de epidemiologia, entre os testes com valor-p perto de 0,05 pelo menos 72 por cento e tipicamente mais de 90 por cento das nulas serão verdadeiras.

O fator de Bayes é a resposta direta para essa lacuna. A definição operacional cabe em uma linha:

chance a posteriori = chance a priori vezes o fator de Bayes.

Deng, Lu e Chen escrevem exatamente essa relação ao formalizar o teste bayesiano para experimentos online, e ela é o que dá ao fator de Bayes a interpretação de peso da evidência trazida pelos dados: é o quanto a sua crença precisa se mover, e a direção para onde ela precisa se mover.

A chance a priori multiplicada pelo fator de Bayes vira chance a posterioriUm diagrama em três blocos ligados por setas. O primeiro bloco é a chance a priori, o que você acreditava antes do teste. O segundo bloco é o fator de Bayes, descrito como tudo o que os dados acrescentam. O terceiro bloco é a chance a posteriori. Abaixo, uma faixa mostra que um fator maior que um empurra a crença na direção de existir efeito e um fator menor que um empurra na direção contrária, enquanto um fator igual a um deixa a crença exatamente onde estava.chance a priorio que você já achavaxfator de Bayestudo o que os dados acrescentam=chance a posteriorio que você deve achar agora1,00abaixo de 1: evidência a favor de NÃO haver diferençaacima de 1: a favor de haverexatamente 1: o teste não trouxe informação nenhumao valor-p só sabe apontar para um dos lados desta reta, e nunca sabe apontar para o centro.
A escala é multiplicativa e simétrica. Um fator de 0,05 é tão informativo quanto um fator de 20, só que na direção oposta.

A conta, para duas proporções

Para um teste A/B de conversão a conta fecha em forma exata, sem simulação. As duas hipóteses são:

Sob cada hipótese, calcula-se a probabilidade dos dados observados na média de todos os valores que os parâmetros poderiam assumir, ponderados pelo prior. O fator de Bayes é a razão entre essas duas médias. Como os dois braços são binomiais com os mesmos dados, os coeficientes binomiais aparecem nas duas contas e se cancelam, e sobra apenas uma razão de funções beta que qualquer planilha calcula.

O ponto sutil está no “na média”. Wagenmakers explica a consequência: uma das vantagens de tirar a média em vez de maximizar é que a média incorpora automaticamente uma penalidade por complexidade do modelo. Um modelo em que a taxa é livre para assumir qualquer valor no intervalo de 0 a 1 é mais complexo do que o modelo que fixa uma taxa comum, e valores que se revelam muito implausíveis à luz dos dados observados puxam a média para baixo.

É essa penalidade que faz o fator de Bayes discordar do valor-p. O valor-p compara o seu dado com o melhor caso da hipótese nula. O fator de Bayes compara o dado com a média da hipótese alternativa inteira, incluindo todos os efeitos gigantescos que ela permite e que o seu dado não mostrou.

O exemplo trabalhado: valor-p de 0,0031 e fator de Bayes de 0,9992

O exemplo de referência das nossas calculadoras é uma leitura de 4.200 visitantes por braço, com 210 conversões no controle e 273 na variação. Cole na calculadora abaixo:

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Ela devolve 5,00 por cento contra 6,50 por cento, mais 30,0 por cento relativo e valor-p de 0,0031. A tela arredonda para quatro casas; a diferença absoluta é de 1,5000 ponto percentual e o valor-p com mais casas é 0,003150. Pelo critério clássico, isso é significativo com folga: o resultado passa por 0,05 e passa por 0,01.

O fator de Bayes dessa mesma leitura, com prior uniforme nas duas taxas, é 0,9992. Com chances a priori iguais, a probabilidade a posteriori de existir diferença fica em 49,98 por cento, praticamente idêntica aos 50 por cento de onde saiu.

Os dois números estão certos e respondem perguntas diferentes. O valor-p diz: se não houvesse diferença nenhuma, um resultado assim ou mais extremo apareceria em cerca de 3 de cada 1.000 testes. O fator de Bayes diz: esses dados são igualmente prováveis sob as duas hipóteses, porque a hipótese de que existe diferença tem que dividir a sua credibilidade entre um efeito de 1,5 ponto e todos os efeitos de 10, 20 ou 40 pontos que ela também permite, e os quais o dado não sustenta.

Um teste bayesiano que responde outra pergunta ainda, a de qual variação é melhor e por quanto, é o da calculadora abaixo. Ela não calcula fator de Bayes: ela calcula a probabilidade de a variação ser melhor e a perda esperada de escolher errado.

Calculadora bayesiana de teste A/B
A (controle)
B (variação)
-probabilidade de B vencer A
Taxa de A (posterior)-
Taxa de B (posterior)-
Probabilidade de A vencer-
Risco ao escolher B (perda esperada)-
Melhora relativa (médias)-

Modelo Beta-Binomial com prior uniforme Beta(1,1) e intervalo de credibilidade de 95%. Cálculo determinístico, recalcula ao vivo.

Essas três leituras não são substitutas. Valor-p, fator de Bayes e probabilidade de superar respondem, respectivamente, a compatibilidade com o nulo, o peso da evidência entre duas hipóteses, e a direção da decisão. A ferramenta de decisão prática num teste A/B costuma ser a terceira, junto com a perda esperada. O fator de Bayes é a ferramenta de leitura da evidência.

O paradoxo de Lindley, em cinco linhas calculadas

Aqui está a demonstração mais desconfortável do método. Nas cinco leituras abaixo, o valor-p é o mesmo, sempre perto de 0,05. A única coisa que muda é o tamanho do teste.

por braço controle variação efeito valor-p fator de Bayes evidência CONTRA haver efeito
1.000 50 71 mais 2,1000 pp 0,048884 0,1849 5,41 vezes
5.000 250 294 mais 0,8800 pp 0,052381 0,0746 13,41 vezes
20.000 1.000 1.087 mais 0,4350 pp 0,050452 0,0378 26,49 vezes
100.000 5.000 5.193 mais 0,1930 pp 0,049728 0,0169 59,16 vezes
500.000 25.000 25.429 mais 0,0858 pp 0,049944 0,0075 133,42 vezes

O valor-p fica parado e o fator de Bayes anda 18 vezes, sempre na mesma direção: contra a existência de efeito. Um resultado “significativo a 5 por cento” num teste de meio milhão por braço é, em termos de peso de evidência, um resultado que favorece a hipótese de que não há diferença por mais de 130 para 1.

Valor-p constante e fator de Bayes decrescente conforme a amostra cresceDuas séries desenhadas sobre o mesmo eixo horizontal de tamanho de amostra por braço, de mil a quinhentos mil. A série do valor-p é uma linha praticamente horizontal em torno de zero vírgula cinco por cento acima do eixo, sempre perto de zero vírgula zero cinco. A série do fator de Bayes desce continuamente, de zero vírgula um oito quatro nove para zero vírgula zero zero sete cinco. As duas contam histórias opostas sobre os mesmos dados.1.0005.00020.000100.000500.000visitantes por braço, escala aproximadamente logarítmicavalor-p: sempre perto de 0,050,18490,03780,0075os mesmos dados, duas conclusões que se afastam com o tamanho do testequanto maior a amostra, mais a mesma significância vira evidência contra o efeito.
A linha vermelha é a que a maioria dos relatórios olha. A verde é a que muda de conclusão.

O resultado é geral, não um artefato do prior escolhido. Wagenmakers registra que, para qualquer prior contínuo e estritamente positivo, a probabilidade a posteriori da hipótese nula converge para 1 conforme a amostra cresce, desde que o valor-p permaneça constante, e credita o resultado a Berger e Sellke e a Lindley. A conclusão dele é direta: não existe prior plausível para o qual a probabilidade a posteriori da hipótese nula seja monotonicamente relacionada ao valor-p conforme o número de observações aumenta.

A leitura prática para quem roda testes A/B em escala grande: num teste de centenas de milhares de visitantes por braço, um valor-p apertado de 0,04 ou 0,05 não é um resultado marginalmente positivo, é um resultado que mede um efeito pequeno demais para justificar a hipótese de que ele existe. É o mesmo alerta que aparece na região de equivalência prática, por outro caminho.

Quando o efeito é real, o fator cresce sem limite

O paradoxo acima não significa que o fator de Bayes seja pessimista por natureza. Ele significa que ele exige que o efeito não encolha conforme a amostra cresce. Segure o efeito verdadeiro em mais 1 ponto percentual sobre uma base de 5 por cento e veja o que acontece:

por braço controle variação valor-p fator de Bayes leitura
2.000 100 120 0,165416 0,0472 contra o efeito, 21 para 1
5.000 250 300 0,028295 0,1265 contra o efeito, 8 para 1
10.000 500 600 0,001925 0,9941 empate
20.000 1.000 1.200 0,000012 86,81 a favor, 87 para 1
40.000 2.000 2.400 abaixo do exibível 936.314 a favor, esmagador
80.000 4.000 4.800 abaixo do exibível mais de 100 trilhões a favor, absoluto

Duas coisas saltam dessa tabela.

Primeira: o valor-p declara vitória em 5.000 por braço e o fator de Bayes só empata em 10.000. Com 5.000 por braço o resultado já é significativo a 5 por cento, com valor-p de 0,028295, e o peso da evidência ainda é 8 para 1 CONTRA a existência do efeito. Quem lança com base nesse teste está lançando com evidência desfavorável, por mais estranho que isso soe.

Segunda: a partir de 20.000 por braço a evidência vira e não para de crescer. O fator sai de 86,81 para 936.314 ao dobrar a amostra, e para mais de 100 trilhões ao dobrar de novo. O crescimento do fator de Bayes é exponencial no tamanho da amostra quando o efeito é real, e isso é uma propriedade e não um defeito.

Vale notar de onde vem a assimetria dos 5.000: o tamanho de amostra que a nossa calculadora recomenda para detectar um efeito relativo de 20 por cento sobre uma base de 5 por cento, com 80 por cento de poder, é 8.158 por variação. Ou seja, o teste de 5.000 por braço está subdimensionado, e a significância que ele produziu é a significância de um teste que ainda não tinha dados suficientes.

O que o valor-p nunca consegue dizer

O caso mais útil do fator de Bayes é o que o teste clássico simplesmente não cobre: evidência a favor de não haver efeito.

por braço leitura valor-p fator de Bayes evidência a favor de NÃO haver diferença
2.000 100 contra 100 1,0000 0,0173 57,86 para 1
10.000 500 contra 500 1,0000 0,0077 129,42 para 1
50.000 2.500 contra 2.500 1,0000 0,0035 289,42 para 1
200.000 10.000 contra 10.000 1,0000 0,0017 578,84 para 1

O valor-p é 1,0000 nas quatro linhas e não distingue uma da outra. O fator de Bayes distingue: um empate em 2.000 por braço é um resultado morno e um empate em 200.000 por braço é uma afirmação forte de que aquela mudança não moveu nada. Essa distinção é a que o time de produto precisa para decidir se arquiva a hipótese ou se volta a ela com um teste maior.

Evidência a favor da ausência de efeito cresce com a amostra num empate exatoQuatro barras horizontais, uma para cada tamanho de amostra num empate exato entre controle e variação. A barra cresce de cinquenta e sete para um em dois mil por braço até quinhentos e setenta e oito para um em duzentos mil por braço. Ao lado, uma linha única marca que o valor-p é igual a um ponto zero em todos os quatro casos, sem distinguir nenhum deles.empate exato: quanto o fator de Bayes favorece a ausência de efeito2.000 por braço57,86 para 110.000 por braço129,42 para 150.000 por braço289,42 para 1200.000 por braço578,84 para 1valor-p1,0000 nos quatro casos, sem distinção nenhumaausência de evidência e evidência de ausência são coisas diferentes, e só uma das duas réguas mede a segunda.
Quatro empates idênticos aos olhos do valor-p, com pesos de evidência que diferem por um fator de dez.

A parte incômoda: o prior importa, e muito

Nada do que está acima sai de graça. O fator de Bayes depende do prior escolhido para a hipótese alternativa, e a dependência não é decorativa. Tome uma leitura intermediária, 20.000 por braço com 1.000 conversões no controle e 1.080 na variação, que na calculadora devolve mais 8,0 por cento relativo e valor-p de 0,0716. A diferença absoluta é de mais 0,4000 ponto percentual e o intervalo vai de menos 0,0351 a mais 0,8351 ponto, ou seja, ele cruza o zero por pouco.

prior sobre cada taxa o que ele afirma fator de Bayes probabilidade a posteriori de haver efeito
uniforme entre 0 e 1 qualquer taxa é igualmente plausível 0,0282 2,74%
média 5%, concentração fraca taxas em torno de 5%, com muita folga 0,4823 32,54%
média 5%, concentração média taxas em torno de 5%, com folga moderada 0,9333 48,27%
média 5%, concentração forte taxas próximas de 5%, com pouca folga 1,3559 57,55%

O mesmo dado atravessa o valor 1 quando o prior muda. O prior uniforme é o mais desfavorável possível para a hipótese de que existe efeito, porque ele espalha credibilidade por taxas de 40, 70 ou 95 por cento, que ninguém que trabalhe com conversão considera plausíveis, e a penalidade por complexidade cobra por cada uma delas.

A conclusão prática não é abandonar o método, é declarar o prior antes de olhar os dados, exatamente como se declara o nível de significância num teste clássico. E existe um caminho objetivo: Deng, Lu e Chen registram que boa parte da dificuldade de escolher um prior pode ser mitigada usando dados de testes A/B históricos para aprender o prior empiricamente, quando é razoável supor que os testes anteriores vêm da mesma distribuição de ideias. Esse é o mesmo raciocínio de priors bayesianos e de encolhimento bayesiano: o histórico do programa é informação.

Monitoramento contínuo: onde o método é mais confortável

Existe uma vantagem operacional concreta. No teste clássico, olhar o resultado todo dia e parar quando ele fica significativo infla o erro tipo I, e é por isso que o problema do peeking exige correção sequencial.

Deng, Lu e Chen provam formalmente a validade do teste bayesiano com monitoramento contínuo quando regras de parada apropriadas são usadas, e ilustram o resultado com simulações. Eles também apontam as práticas ruins em que a regra de parada não é apropriada, e comparam a abordagem com as correções do teste clássico.

Duas ressalvas importam. Primeira, “regra apropriada” é uma condição, não uma dispensa: eles registram explicitamente que a propriedade não vale se o fator de Bayes é calculado sobre um subconjunto selecionado dos dados. Segunda, isso trata do erro de espiar, não do erro de decidir cedo demais: um fator de Bayes de 3 num teste de dois dias continua sendo um fator de Bayes de 3, com toda a incerteza que ele carrega.

Como usar o fator de Bayes na prática

  1. Declare o prior no plano de análise, antes de rodar. Sem isso, o fator de Bayes vira um parâmetro ajustável até o resultado agradar.
  2. Reporte fator de Bayes E valor-p, sem escolher só um. Quando os dois concordam, a leitura é fácil. Quando discordam, a discordância é a informação.
  3. Trate a discordância como sinal de efeito pequeno. Fator de Bayes baixo com valor-p baixo quer dizer, quase sempre, que o efeito medido é pequeno em relação ao que a hipótese alternativa permitiria.
  4. Use o fator de Bayes para arquivar hipóteses. É a única das três réguas que autoriza dizer “isso não move o ponteiro, pare de tentar”.
  5. Não converta o fator de Bayes em uma decisão sozinho. A decisão de lançar depende de custo, risco e valor, e a régua para isso é a perda esperada ou uma análise de valor da informação.
  6. Dimensione o teste antes. Um fator de Bayes calculado sobre um teste subdimensionado é honesto e inútil ao mesmo tempo: ele vai dizer, corretamente, que os dados não sustentam nada.
  7. Se for monitorar continuamente, fixe a regra de parada antes. Ela é a condição do resultado, não um detalhe.

Erros comuns

Faça isso automático na Donnu

O fator de Bayes precisa de duas coisas que a maioria dos painéis não guarda: os quatro números crus do teste, sem arredondamento, e o registro de qual prior estava valendo quando a análise foi planejada. O segundo é o que separa um teste bayesiano honesto de um resultado ajustado depois.

A Donnu guarda os contadores de exposição e conversão por braço no nível bruto e mantém o histórico de configuração do experimento, incluindo o que foi decidido antes de o teste começar. Isso deixa o cálculo do fator de Bayes reproduzível meses depois, com o prior que valia na época e não com o que parece conveniente hoje.

E vale a recomendação de escopo: o fator de Bayes é uma régua de evidência, não uma régua de decisão. Para a decisão, a calculadora bayesiana entrega probabilidade de superar e perda esperada, que é o que a maior parte dos times realmente precisa olhar antes de lançar.

Referências

Leia também: Teste A/B bayesiano · Perda esperada · Priors bayesianos · Região de equivalência prática · Problema do peeking · Calculadora bayesiana · Read in English

Perguntas frequentes

O que é o fator de Bayes num teste A/B?
É a razão entre a probabilidade dos dados observados sob a hipótese de que existe diferença e a probabilidade dos mesmos dados sob a hipótese de que não existe. Ele é o número pelo qual você multiplica a sua chance a priori para obter a chance a posteriori. Um fator de 10 significa que os dados são dez vezes mais prováveis se houver diferença; um fator de 0,1 significa o contrário, e o valor-p não tem como expressar essa segunda situação.
Um valor-p de 0,003 é sempre evidência forte?
Não. No exemplo trabalhado deste guia, a leitura de 4.200 visitantes com 210 conversões contra 4.200 com 273 devolve um valor-p de 0,003150 e um fator de Bayes de 0,9992 com prior uniforme, ou seja, os dados são praticamente igualmente prováveis sob as duas hipóteses. Berger registra que, numa longa série de testes em que metade das hipóteses nulas é verdadeira, entre os testes com valor-p perto de 0,05 pelo menos 22 por cento e tipicamente mais de 50 por cento das nulas correspondentes serão verdadeiras.
O que é o paradoxo de Lindley?
É o fato de que, mantendo o valor-p fixo, o fator de Bayes se move CONTRA a hipótese de que existe efeito conforme a amostra cresce. Nos cinco casos calculados neste guia, todos com valor-p perto de 0,05, o fator de Bayes cai de 0,1849 com 1.000 por braço para 0,0075 com 500.000 por braço. Ou seja, a mesma significância vira evidência 5 vezes contra a hipótese num teste pequeno e 133 vezes contra num teste enorme.
O fator de Bayes consegue dizer que NÃO existe efeito?
Sim, e é a diferença prática mais útil dele. Um valor-p alto só significa ausência de evidência contra a hipótese nula. Num empate exato de 200.000 por braço com a mesma taxa, o fator de Bayes calculado aqui é 0,0017, ou seja, os dados são 579 vezes mais prováveis sob a hipótese de que não há diferença. O valor-p nessa mesma leitura é 1,0000 e não distingue esse caso de um teste com 200 visitantes.
O prior muda muito o resultado?
Muda, e esse é o custo honesto do método. Com a mesma leitura de 20.000 por braço, 1.000 contra 1.080 conversões, o fator de Bayes vai de 0,0282 com prior uniforme a 1,3559 com um prior Beta de média 5 por cento e forte concentração, atravessando o valor 1. O prior precisa ser declarado antes de olhar os dados, exatamente como o nível de significância num teste clássico.
Posso olhar o fator de Bayes todo dia sem penalidade?
Com regra de parada apropriada, sim. Deng, Lu e Chen provam formalmente a validade do teste bayesiano sob monitoramento contínuo quando as regras de parada são apropriadas, e apontam as práticas ruins em que a regra não é apropriada. Isso é diferente do teste clássico, em que espiar sem correção infla o erro tipo I.