CRO

Taxa de Vitória em Teste A/B: o que os dados mostram

Qual é a taxa de vitória em teste A/B segundo dados publicados, por que ela varia tanto e por que uma taxa alta costuma ser sinal de problema.

Ilustração de uma longa fileira de barras baixas com três barras mais altas e um troféu simples sobre a mais alta

A taxa de vitória em teste A/B, ou seja, a proporção de experimentos que melhoram a métrica alvo, não tem um benchmark universal. Os dados públicos mais citáveis abrem uma faixa larga: Ronny Kohavi documentou que na Microsoft aproximadamente um terço das ideias testadas melhora a métrica, um terço fica neutro e um terço piora; Kohavi, Deng e Vermeer reuniram as taxas de sucesso já publicadas por diferentes operações e chegaram a uma faixa que vai de 8% a 33%. Este artigo mostra o que cada número realmente mede, por que eles divergem tanto, por que uma taxa alta costuma ser sintoma de processo frouxo e, principalmente, a conta que quase ninguém faz: quantos dos seus vencedores são falsos positivos, dado que a maioria das ideias não funciona. Faz parte do guia de como construir uma cultura de experimentação.

O que os dados publicados realmente mostram

Três referências sustentam praticamente todas as citações de taxa de vitória que circulam no mercado. Vale ler o que cada uma mede, porque elas não estão medindo a mesma coisa.

Fonte O que reporta O que isso mede de fato
Kohavi, KDD 2015 (Microsoft) Cerca de um terço melhora a métrica alvo, um terço é neutro, um terço piora Ideias testadas num programa maduro, contando as três direções
Kohavi, Deng e Vermeer, KDD 2022 Compilação de taxas de sucesso já publicadas: 33% (Microsoft), 20% (Kaushik), 15% (Bing), 10% (Booking.com, Google Ads, Netflix), 8% (Airbnb Search) Estimativas de origens diferentes, reunidas para calcular o risco de falso positivo de cada uma
Thomke, HBR 2020 (Booking.com) Programa com dezenas de milhares de experimentos por ano e ênfase pública no aprendizado com falhas Volume e cultura, mais do que uma taxa comparável

A distância entre “um terço” e “10%” costuma ser lida como contradição e não é. Os dois extremos da faixa saem da mesma tabela do artigo de 2022: 33% é a linha da Microsoft, e é exatamente a proporção de um terço documentada em 2015; 10% é a linha atribuída a Booking.com, Google Ads e Netflix. Entre elas ficam Bing com 15% e uma estimativa de Avinash Kaushik com 20%. Não são medições de um mesmo estudo comparando empresas: são números publicados em momentos e contextos diferentes, e os autores dizem com todas as letras que os critérios de contagem variam entre as fontes e que servem como ordem de grandeza. Uma faixa de 8% a 33% não é ruído de medição, é o efeito de quatro variáveis que a próxima seção destrincha.

Os números públicos de taxa de vitória não medem a mesma coisaA proporção documentada por Kohavi para a Microsoft divide os experimentos em um terço que melhora, um terço neutro e um terço que piora. Já a tabela de Kohavi, Deng e Vermeer de 2022 reúne taxas de sucesso publicadas por operações diferentes: 33 por cento na Microsoft, 20 por cento numa estimativa de Avinash Kaushik, 15 por cento no Bing, 10 por cento em Booking.com, Google Ads e Netflix, e 8 por cento no Airbnb Search. São números de origens diferentes reunidos numa tabela, não uma medição única comparando empresas.Microsoft (Kohavi, 2015): distribuição dentro de um programamelhora (1/3)neutro (1/3)piora (1/3)Taxas de sucesso publicadas, reunidas por Kohavi, Deng e Vermeer (2022)Microsoft33%Avinash Kaushik20%Bing15%Booking.com, Google Ads, Netflix10%Airbnb Search8%Os autores avisam que essas estimativas usam critérios de contagem diferentes entre si e valem como ordem de grandeza.Não é um estudo comparando empresas: são números publicados em contextos diferentes e reunidos numa tabela.
Os dois números mais citados sobre taxa de vitória respondem perguntas diferentes. Um descreve a divisão interna de um programa; o outro é uma compilação de taxas publicadas por operações distintas, que vai de 8% a 33%.

Por que as taxas variam tanto

Quatro variáveis explicam quase toda a diferença entre times, e nenhuma delas é talento.

Antes de comparar a sua taxa com qualquer benchmark, escreva a sua definição de vitória. Na maior parte dos casos essa frase explica a diferença inteira.

Taxa de vitória alta costuma ser sinal de alerta

Este é o ponto contraintuitivo que a maioria dos artigos sobre benchmark ignora. Se as fontes públicas apontam para algo entre 8% e um terço, um programa reportando 60% ou 70% de vitórias merece uma auditoria antes de merecer uma comemoração. As quatro causas mais comuns, em ordem de frequência:

Causa provável Como identificar O que fazer
Parada antecipada ao ver o painel Testes encerrados em datas irregulares, sempre logo depois de um pico favorável Fixar duração antes de rodar; ver o problema do peeking
Testes sem poder estatístico Amostra por variação bem abaixo da necessária para o MDE declarado Dimensionar antes; aceitar rodar menos testes e melhores
Troca de métrica depois do resultado A métrica primária do relatório não é a do planejamento Registrar métrica primária e guardrails antes do início
Empate contado como vitória Vitórias reportadas sem valor-p nem intervalo Reportar sempre o intervalo, não só a direção

As duas primeiras causas se reforçam. Um teste sem poder quase nunca cruza a linha de significância por efeito real: quando cruza, é porque pegou um sorteio favorável. Se além disso o time olha o painel todo dia e para quando gosta do que vê, a taxa de vitória sobe justamente porque a taxa de acerto caiu.

A conta que quase ninguém faz: quantos vencedores são falsos

Aqui está a parte que muda decisões. A pergunta “quantos dos meus vencedores são reais” não se responde com o valor-p sozinho. Ela depende também da proporção de ideias suas que realmente funcionam, e é aí que a taxa de vitória vira uma informação útil de verdade.

Considere 1.000 testes rodados com 95% de confiança bilateral e 80% de poder, num cenário em que 10% das ideias testadas produzem efeito real.

Ou seja: mesmo com estatística correta, mesmo sem peeking, mesmo com poder adequado, cerca de um em cada cinco vencedores desse programa não é uma vitória. E isso piora rápido conforme a proporção de ideias boas cai ou o poder diminui.

Proporção real de ideias que funcionam Poder do teste Vencedores verdadeiros por 1.000 Falsos vencedores por 1.000 Falsos entre os vencedores
5% 80% 40,0 23,8 37,3%
10% 80% 80,0 22,5 22,0%
20% 80% 160,0 20,0 11,1%
33% 80% 266,6 16,7 5,9%
10% 50% 50,0 22,5 31,0%

Cálculo com alfa de 5% bilateral, contando como “vencedor” apenas o resultado significativo na direção positiva.

Vale registrar que essa conta não é nossa invenção: é exatamente o cálculo que Kohavi, Deng e Vermeer aplicam na tabela do artigo de 2022, e os valores batem linha a linha com os que eles publicam. Para as taxas de sucesso da compilação, o risco de falso positivo que eles reportam é de 5,9% (Microsoft, 33%), 11,1% (Kaushik, 20%), 15,0% (Bing, 15%), 22,0% (Booking.com, Google Ads e Netflix, 10%) e 26,4% (Airbnb Search, 8%). É o motivo pelo qual a tabela existe no artigo original: mostrar que quanto menor a taxa de sucesso de um programa, maior a fatia dos seus vencedores que não é vitória nenhuma.

De 1.000 testes a 102,5 vencedores, dos quais 22,5 são falsosCom 10 por cento de ideias realmente eficazes, 100 dos 1.000 testes têm efeito real e 80 são detectados com poder de 80 por cento. Dos 900 sem efeito, cerca de 22,5 aparecem como significativos na direção positiva. O conjunto de vencedores soma 102,5, e 22 por cento deles são falsos positivos.1.000 testes100 com efeito reala taxa base de ideias boas900 sem efeitoa maioria das ideias80 detectadospoder de 80%22,5 falsos positivos2,5% na direção positiva102,5 vencedores no painel22% deles não são vitórias reais
A proporção de falsos positivos entre os vencedores depende da taxa base de ideias boas, não apenas do valor-p. É por isso que um vencedor surpreendente merece replicação antes de virar decisão.

Exemplo trabalhado: lendo um vencedor com essa lente

Um teste no fluxo de checkout roda 12.000 visitantes por variação. O controle converte 360 vezes (3,00%) e a variação converte 420 vezes (3,50%). Rodando o teste z de duas proporções, bilateral, com 95% de confiança:

Confira esse cálculo com os mesmos números, ou com os seus:

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Pelo critério clássico, é vitória: o valor-p ficou abaixo de 0,05 e o intervalo não inclui zero. Duas leituras adicionais, porém, mudam o que fazer com essa vitória.

A primeira é o intervalo. Ele vai de +0,05 a +0,95 ponto percentual, uma faixa que em termos relativos vai de aproximadamente +1,7% a +31,7%. O efeito ponto de +16,67% é o centro dessa faixa, não uma previsão. Prometer +16% de ganho de conversão para a diretoria a partir desse teste é prometer o meio de um intervalo que quase toca zero.

A segunda é a taxa base. Se esse time historicamente acerta em torno de 10% das hipóteses, cerca de 22% dos vencedores dele são falsos, e um resultado com valor-p de 0,029 (perto da linha, não longe dela) está justamente na região onde os falsos positivos se concentram. A conduta correta não é descartar o resultado, é subir a mudança e confirmar o efeito no acompanhamento, ou replicar o teste se a mudança for cara ou arriscada de reverter.

Como calcular a sua própria taxa direito

Antes de comparar com qualquer benchmark, o número precisa ser calculado de um jeito que sobreviva a uma auditoria. O erro mais comum não está no numerador, está no denominador.

O denominador honesto é todo teste que começou a coletar dados, não todo teste que chegou ao fim. Testes abortados no meio, testes descartados por problema de implementação e testes que ninguém encerrou formalmente saem da conta com muita frequência, e eles saem de forma enviesada: um teste é muito mais abandonado quando os primeiros dias parecem ruins do que quando parecem bons. Excluir os abandonados infla a taxa sem que nada tenha melhorado.

O numerador honesto tem três definições possíveis, e o único erro é não escolher uma e escrevê-la:

Times maduros reportam as três, e a distância entre elas é diagnóstica. Uma vitória estatística muito maior que a realizada aponta para efeitos inflados pela maldição do vencedor ou para ganhos que decaem depois do lançamento. Uma vitória de decisão muito maior que a estatística indica que boa parte do valor do programa está vindo de empates informativos, o que é legítimo, desde que esteja escrito.

Um cuidado final sobre a janela de tempo: taxa de vitória calculada por trimestre balança muito em programas que rodam poucos testes. Com 5 testes no trimestre, um único resultado move a taxa em 20 pontos. Abaixo de mais ou menos 20 testes na janela, o número diz mais sobre o acaso do que sobre o time, e a leitura anual é a única que se sustenta.

O que medir em vez da taxa de vitória

Taxa de vitória é fácil de calcular, fácil de comparar e fácil de inflar, que é a combinação exata de um indicador ruim. Três medidas resistem melhor ao incentivo perverso:

Indicador Como medir Por que resiste à manipulação
Efeito acumulado realizado no ano Soma dos ganhos que continuaram no ar após o lançamento, medidos e não estimados Só cresce se as vitórias forem reais e sobreviverem
Testes com hipótese registrada antes de rodar Proporção de testes com hipótese, métrica primária e duração escritas antes do início Não pode ser inflado sem melhorar o planejamento
Resultados documentados, incluindo empates e derrotas Proporção de testes com entrada completa no repositório Mede o aprendizado, que é o produto real do programa

Os dois últimos vêm do processo, não do resultado, e é exatamente por isso que funcionam: nenhum deles melhora quando alguém para um teste mais cedo. O terceiro depende de ter onde registrar, o que é o assunto do template de roadmap de experimentação e da rotina de documentação do programa.

Um quarto indicador vale para times com mais maturidade: a proporção da capacidade estatística aproveitada, ou seja, quantos dos testes rodados no ano tinham amostra suficiente para o efeito que se propunham a detectar. Um programa com muitos testes subdimensionados vai ter, ao mesmo tempo, uma taxa de vitória alta e um efeito acumulado baixo, que é a assinatura clássica de um painel bonito sem receita atrás.

Faça isso automático na Donnu

Ler uma vitória direito exige três coisas ao mesmo tempo: a duração fixada antes de começar, o intervalo de confiança reportado junto do efeito, e o histórico do programa para saber onde o seu resultado cai. A Donnu entrega as três por padrão: dimensiona o teste contra o seu tráfego real e mostra a duração antes de você começar, apresenta o intervalo junto de todo resultado em vez de um número solto, e mantém o registro de cada experimento com os números congelados como foram lidos. A taxa de vitória vira consequência do processo, não uma meta a perseguir.

Comece um teste grátis de 14 dias e leia seus resultados com o intervalo à vista. Para dimensionar quantos testes o seu tráfego banca antes de prometer cadência, veja quantos testes A/B você deveria rodar por mês.

Referências

Leia também:

Perguntas frequentes

Qual é a taxa de vitória média em testes A/B?
Não existe um número único, e os dados públicos disponíveis abrem uma faixa larga. Ronny Kohavi documentou que, na Microsoft, aproximadamente um terço das ideias testadas melhora a métrica alvo, um terço fica neutro e um terço piora. Já Kohavi, Deng e Vermeer reuniram as taxas de sucesso publicadas por várias operações e chegaram a uma faixa de 8% (Airbnb Search) a 33% (Microsoft), com 10% reportado para Booking.com, Google Ads e Netflix. Os próprios autores avisam que esses números usam critérios de contagem diferentes entre si e valem como ordem de grandeza, não como benchmark comparável.
Uma taxa de vitória alta é boa?
Nem sempre, e acima de um certo ponto ela é sinal de alerta. Taxas muito acima de um terço costumam indicar problemas de processo antes de indicar talento: parada antecipada ao ver o painel favorável, testes sem poder estatístico onde só o acaso favorável cruza a linha, troca de métrica primária depois do resultado, ou contagem de "vitória" incluindo empates lidos como ganho. Antes de comemorar uma taxa alta, vale auditar como o número foi contado.
Por que a taxa de vitória de um programa cai com o tempo?
Porque as melhorias óbvias acabam. Um programa novo colhe problemas grandes e evidentes, com efeitos grandes e fáceis de detectar. Depois de alguns trimestres, o que sobra são efeitos menores, que exigem mais amostra para aparecer e produzem mais empates. Uma taxa de vitória caindo com um aprendizado acumulando é o desenho normal de um programa saudável, não um sintoma.
Se 10% dos testes vencem, quantos dos vencedores são falsos positivos?
Cerca de 22%, e esse é o número que Kohavi, Deng e Vermeer publicam para uma taxa de sucesso de 10%. Com 95% de confiança bilateral e 80% de poder, a cada 1.000 testes você encontra cerca de 80 vencedores verdadeiros e 22,5 falsos positivos na direção positiva, ou seja, aproximadamente 22% dos seus "vencedores" não são vitórias. Essa conta depende da taxa base de ideias boas, não só do valor-p, e é o motivo pelo qual replicar um vencedor surpreendente antes de subir vale a pena.
O que medir em vez da taxa de vitória?
Três números dizem mais: o efeito acumulado realizado no ano (a soma dos ganhos que sobreviveram no ar, não a contagem de vitórias), a proporção de testes com hipótese registrada antes de rodar, e a proporção de resultados documentados incluindo empates e derrotas. Taxa de vitória é um indicador de sorte e de dificuldade das apostas; nenhum dos três acima pode ser inflado sem melhorar o processo de verdade.
Vale a pena comparar a minha taxa de vitória com a de outra empresa?
Só como conversa, nunca como meta. A taxa depende do tráfego disponível, do efeito mínimo detectável escolhido, do quanto o site já foi otimizado e da definição interna de vitória. Duas empresas com processos igualmente bons podem ter taxas muito diferentes por causa dessas quatro variáveis, então uma meta de taxa de vitória copiada de fora acaba pressionando o time a inflar o número em vez de melhorar as decisões.