Valor da Informação: vale a pena rodar esse teste?
O valor da informação põe preço no que um teste A/B compra. A conta do teto, o valor por tamanho de amostra e quando a resposta é não testar.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Todo teste A/B tem um preço em janela de tráfego e um valor em decisão melhorada, e quase ninguém calcula o segundo. O valor da informação é essa conta: quanto a decisão melhora por você ter medido, em vez de ter decidido com o que já sabia. Ela tem teto, e o teto é o valor de saber a verdade com certeza. No exemplo trabalhado deste guia, uma loja de 30.000 visitantes por semana vale 3.432.000 reais por ponto percentual de conversão por ano, o teto de qualquer teste sobre uma mudança específica é 661.285,36 reais, e o primeiro dia de teste já compra 58,23 por cento desse teto. Os 100 dias seguintes compram menos de 5 por cento. Este guia mostra a conta completa, a tabela de valor por tamanho de amostra, os priors em que a resposta honesta é não testar, e como usar tudo isso para escolher qual teste ocupa a próxima janela. Faz parte do nosso guia completo de teste A/B e é a régua que falta ao lado de quantos testes A/B por mês.
Primeiro, quanto vale acertar
Sem um número de valor, nada disso funciona. A âncora do exemplo é uma loja com:
| parâmetro | valor |
|---|---|
| tráfego | 30.000 visitantes por semana, 1.560.000 por ano |
| taxa de conversão atual | 5,00% |
| ticket médio | R$ 220 |
| receita anual atual | R$ 17.160.000 |
| valor de 1 ponto percentual de conversão | R$ 3.432.000 por ano |
| valor de 0,1 ponto percentual | R$ 343.200 por ano |
Esse último número é o que transforma estatística em decisão. Um ponto percentual sobre uma base de 5 por cento é um ganho relativo de 20 por cento na conversão e, com ticket médio constante, 20 por cento na receita.
A proposta em análise é reordenar a página de preços. O time acha que ajuda, mas sem convicção. Escrevendo isso como número: a expectativa a priori é de mais 0,10 ponto percentual, com desvio de 0,60 ponto. Isso quer dizer que efeitos entre menos 1,1 e mais 1,3 ponto são todos plausíveis, e que a probabilidade de a mudança PIORAR a conversão é de 43,38 por cento.
Duas leituras já saem daí, antes de qualquer teste:
- Lançar direto vale, em expectativa, 0,10 vezes 3.432.000, ou seja, R$ 343.200 por ano.
- Não lançar vale zero, por definição.
Lançar direto é positivo em expectativa, e ainda assim é uma aposta que perde em quase metade dos mundos possíveis. É exatamente essa combinação que faz um teste valer a pena.
O teto: valor da informação perfeita
Imagine um oráculo que diga a verdade de graça e na hora. Com ele, a regra fica trivial: lançar quando o efeito verdadeiro é positivo, não lançar quando é negativo, e nunca errar. O valor esperado dessa política, sobre a distribuição de crenças declarada acima, é R$ 1.004.485,36 por ano.
O ganho do oráculo sobre a melhor decisão sem informação nenhuma é o valor da informação perfeita:
R$ 1.004.485,36 menos R$ 343.200,00 = R$ 661.285,36
Esse número é o mais útil do artigo, porque ele limita a discussão. Nenhum desenho de teste, nenhuma sofisticação estatística, nenhum aumento de tráfego entrega mais do que R$ 661.285,36 nessa decisão. Se alguém propõe um teste de quatro meses para “ter certeza”, o teto está aí para dizer quanto essa certeza pode render, no máximo.
O valor da informação de um teste de tamanho n
Um teste real não é o oráculo. Ele devolve uma leitura com erro, e quanto maior a amostra, menor o erro. O valor esperado da informação de amostra é a mesma conta do teto, com a incerteza que sobra depois de ver o resultado.
Azevedo, Deng, Montiel Olea, Rao e Weyl formalizam exatamente esse objeto e chamam de função de produção da informação: o valor de investir dados de n usuários numa ideia é o valor esperado da parte positiva da média a posteriori, menos o valor esperado da parte positiva do que se sabia antes. É a definição usada nesta tabela.
| por variação | erro-padrão da leitura | valor da informação | % do teto | dias a 30 mil/semana | valor por dia |
|---|---|---|---|---|---|
| 2.000 | 0,6892 pp | R$ 385.091,05 | 58,23% | 1 | R$ 385.091,05 |
| 5.000 | 0,4359 pp | R$ 507.080,95 | 76,68% | 3 | R$ 169.026,98 |
| 8.158 | 0,3412 pp | R$ 555.572,97 | 84,01% | 4 | R$ 138.893,24 |
| 10.000 | 0,3082 pp | R$ 571.915,07 | 86,49% | 5 | R$ 114.383,01 |
| 20.000 | 0,2179 pp | R$ 612.647,43 | 92,64% | 10 | R$ 61.264,74 |
| 31.234 | 0,1744 pp | R$ 629.105,59 | 95,13% | 15 | R$ 41.940,37 |
| 50.000 | 0,1378 pp | R$ 640.723,97 | 96,89% | 24 | R$ 26.696,83 |
| 85.199 | 0,1056 pp | R$ 649.025,30 | 98,15% | 40 | R$ 16.225,63 |
| 150.000 | 0,0796 pp | R$ 654.252,38 | 98,94% | 70 | R$ 9.346,46 |
| 300.000 | 0,0563 pp | R$ 657.745,66 | 99,46% | 140 | R$ 4.698,18 |
As três linhas destacadas não são arbitrárias. 8.158, 31.234 e 85.199 por variação são exatamente os tamanhos que a nossa calculadora recomenda para detectar efeitos relativos de 20, 10 e 6 por cento sobre uma base de 5 por cento, com 80 por cento de poder e 5 por cento de significância. Confira:
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
O resultado mais desconfortável da tabela: o teste de 1 dia já compra 58,23 por cento do teto. O teste de 15 dias, que é o dimensionamento clássico para um efeito relativo de 10 por cento, compra 95,13 por cento. E o teste de 140 dias compra 99,46 por cento.
O ganho marginal de esticar o teste
A mesma tabela, lida como diferenças, é ainda mais direta:
| esticar de | para | dias a mais | valor a mais | por dia extra |
|---|---|---|---|---|
| 2.000 | 5.000 | 2 | R$ 121.989,90 | R$ 60.994,95 |
| 5.000 | 8.158 | 1 | R$ 48.492,02 | R$ 48.492,02 |
| 8.158 | 10.000 | 1 | R$ 16.342,10 | R$ 16.342,10 |
| 10.000 | 20.000 | 5 | R$ 40.732,36 | R$ 8.146,47 |
| 20.000 | 31.234 | 5 | R$ 16.458,16 | R$ 3.291,63 |
| 31.234 | 50.000 | 9 | R$ 11.618,38 | R$ 1.290,93 |
| 50.000 | 85.199 | 16 | R$ 8.301,33 | R$ 518,83 |
| 85.199 | 150.000 | 30 | R$ 5.227,08 | R$ 174,24 |
| 150.000 | 300.000 | 70 | R$ 3.493,28 | R$ 49,90 |
O último dia de um teste de 140 dias vale cerca de R$ 50. O segundo dia de um teste vale cerca de R$ 61.000. É uma razão de mais de mil para um, dentro da mesma decisão e do mesmo negócio.
A explicação vale a leitura literal de Azevedo e coautores: dados adicionais só ajudam a resolver casos de fronteira, em que o valor de uma inovação é próximo de zero, e errar nesses casos não custa caro, porque mesmo errando a perda associada é pequena. Eles demonstram que, para amostras muito grandes, o produto marginal de dados adicionais cai a uma taxa de um sobre n ao quadrado, independentemente dos detalhes da distribuição de ideias.
É a mesma matemática que aparece na sensibilidade: Kohavi e coautores registram que para aumentar a sensibilidade de um experimento por um fator de 10, digamos de um efeito detectável de 5 por cento para 0,5 por cento, você precisa de 100 vezes mais usuários. Precisão é comprada em escala quadrática, e valor é entregue em escala decrescente.
Quando a resposta honesta é NÃO testar
O valor de um teste depende inteiramente do quanto você não sabe. Mesma decisão, mesmo tamanho de amostra de 31.234 por variação e 15 dias, priors diferentes:
| o que você acha | expectativa | desvio | teto | valor do teste | valor por dia |
|---|---|---|---|---|---|
| moeda ao alto, sem ideia | 0,00 pp | 0,60 | R$ 821.501,94 | R$ 788.853,36 | R$ 52.590,22 |
| aposta grande e muito incerta | mais 0,10 pp | 1,50 | R$ 1.886.717,09 | R$ 1.873.005,61 | R$ 124.867,04 |
| caso base deste guia | mais 0,10 pp | 0,60 | R$ 661.285,36 | R$ 629.105,59 | R$ 41.940,37 |
| suspeita de piora, muita dúvida | menos 0,20 pp | 0,60 | R$ 523.522,96 | R$ 492.709,63 | R$ 32.847,31 |
| quase certeza de efeito pequeno | mais 0,10 pp | 0,20 | R$ 135.767,56 | R$ 78.607,50 | R$ 5.240,50 |
| convencido de que atrapalha | menos 0,40 pp | 0,30 | R$ 43.649,93 | R$ 23.674,04 | R$ 1.578,27 |
| convencido de que funciona | mais 0,90 pp | 0,30 | R$ 393,25 | R$ 58,46 | R$ 3,90 |
A última linha é a mais instrutiva. Quando o time já está convencido de que a mudança funciona e funciona bem, o valor da informação perfeita despenca para R$ 393,25. Não é que o teste seja caro: é que ele não tem o que comprar. Praticamente toda a massa de crença já está do lado positivo, o oráculo quase nunca mudaria a decisão, e portanto quase nunca teria valor.
Repare também que a segunda linha, com o mesmo palpite central do caso base e o dobro e meio da incerteza, vale quase três vezes mais. Incerteza é o insumo do valor da informação. Uma ideia sobre a qual ninguém tem opinião firme é uma ideia cara de não testar.
E existe uma exceção importante à leitura acima: essa conta pressupõe que a decisão é reversível apenas via teste, e que o único custo de lançar errado é o efeito negativo. Quando lançar errado tem custo de reputação, de suporte ou de contrato, o valor do teste sobe, porque ele passa a comprar também a evitação desse custo.
A fila: qual teste ocupa a próxima janela
Num programa com tráfego suficiente, o recurso escasso não é dinheiro, é janela. Enquanto um teste roda, outro não roda no mesmo público. Por isso a régua de priorização não é o valor total do teste, e sim o valor por dia de janela.
| teste na fila | expectativa | desvio | valor do teste (15 dias) | valor por dia |
|---|---|---|---|---|
| refazer o fluxo de checkout | mais 0,30 pp | 1,20 | R$ 1.162.731,35 | R$ 77.515,42 |
| reordenar a página de preços | mais 0,10 pp | 0,60 | R$ 629.105,59 | R$ 41.940,37 |
| botão novo no carrinho | mais 0,05 pp | 0,15 | R$ 65.247,05 | R$ 4.349,80 |
Os três consomem exatamente a mesma janela, e o primeiro vale 17,8 vezes o terceiro. Repare no que produz essa diferença: não é o palpite central, é a incerteza. O botão novo tem desvio de 0,15 ponto, ou seja, todo mundo já sabe mais ou menos o que vai acontecer. O refazimento do checkout tem desvio de 1,20 ponto, e é exatamente essa ignorância que faz medi-lo valer a pena.
Essa é a conclusão contraintuitiva do método: você deve testar prioritariamente aquilo sobre o que menos sabe, e não aquilo em que mais acredita. É a lógica oposta à que domina a maioria das reuniões de priorização, e conversa direto com a priorização por PIE e ICE e com a velocidade de experimentação.
Azevedo e coautores chegam empiricamente ao mesmo lugar. Eles estimam no Bing um coeficiente de cauda bem abaixo de 3, o que favorece uma estratégia enxuta de experimentação, com mais ideias testadas e amostras possivelmente menores. Num contrafactual em que o Bing experimenta com 20 por cento mais ideias, mantendo o mesmo número de usuários e supondo que as ideias marginais tenham a mesma distribuição de qualidade, eles encontram um aumento de produtividade de 17,05 por cento. E fazem uma conta de guardanapo com a valoração monetária do próprio Bing: mover na direção da experimentação enxuta seria lucrativo mesmo se o custo fixo de rodar um experimento fosse da ordem de centenas de milhares de dólares por ano.
O exemplo trabalhado completo: um teste sem significância que decidiu
O teste da página de preços rodou os 15 dias planejados, 31.234 visitantes por variação. Resultado: 1.562 conversões no controle e 1.656 na variação. Cole na calculadora:
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Ela devolve 5,00 por cento contra 5,30 por cento, mais 6,0 por cento relativo e valor-p de 0,0889, com o veredito “ainda sem significância” na tela. Com mais casas, as taxas são 5,0010 e 5,3020 por cento, a diferença absoluta é mais 0,3010 ponto percentual, o valor-p é 0,088858 e o intervalo de confiança vai de menos 0,0457 a mais 0,6476 ponto. Pelo critério clássico, não deu: o valor-p não passa por 0,05 e o intervalo cruza o zero.
Agora a leitura de decisão. Combinando essa leitura com o prior declarado antes de rodar, a crença atualizada sobre o efeito verdadeiro fica centrada em mais 0,2853 ponto percentual, com desvio de 0,1675. Disso saem três números:
| pergunta | resposta |
|---|---|
| probabilidade de o efeito verdadeiro ser positivo | 95,58% |
| valor esperado de lançar com essa crença | R$ 979.144,91 por ano |
| valor da informação perfeita que ainda resta | R$ 10.419,54 |
A última linha é a que fecha a decisão. Antes do teste, saber a verdade valia R$ 661.285,36. Depois do teste, saber a verdade vale R$ 10.419,54. O teste resolveu 98,4 por cento da dúvida que existia, e o que sobra de incerteza vale menos do que qualquer prolongamento razoável do teste custaria em janela.
A decisão é lançar. Não porque o valor-p passou, ele não passou, mas porque a dúvida que resta não é economicamente relevante. É o mesmo raciocínio da perda esperada e da região de equivalência prática, com a unidade em reais em vez de pontos percentuais.
Como aplicar isso na prática
- Escreva o valor de 1 ponto percentual antes de discutir qualquer teste. É um número por produto, não por teste, e é a âncora de tudo.
- Peça o prior em duas perguntas simples. “Qual é o seu palpite de efeito?” e “qual efeito te surpreenderia, para cima e para baixo?”. A segunda pergunta dá o desvio.
- Calcule o teto antes de dimensionar. Se o teto é pequeno, nenhum dimensionamento salva o teste, e a decisão deve ser tomada sem ele.
- Priorize pelo valor por dia, não pelo valor total. É o único jeito de comparar testes que ocupam a mesma janela.
- Prefira mais testes curtos a menos testes longos, quando o teto for alto e a curva já estiver no platô. É a leitura direta da tabela marginal.
- Não confunda isso com um argumento para parar cedo. Parar cedo por causa do resultado que apareceu é peeking. Dimensionar curto por causa do valor esperado, ANTES de rodar, é planejamento.
- Reveja o prior depois de cada teste do mesmo tipo. O histórico do programa é o melhor prior disponível, e é o que liga esta conta com meta-análise de testes A/B.
Erros comuns
- Tratar o valor da informação como estimativa de receita do teste. Ele mede melhoria de decisão, não ganho de conversão. As duas coisas não são a mesma.
- Usar o método para justificar parar um teste em andamento. O dimensionamento é decidido antes; usar valor da informação para encerrar quando o resultado agrada é peeking com outro nome.
- Escolher o prior depois de ver o resultado. É o mesmo pecado do fator de Bayes, com consequência financeira direta.
- Ignorar custos que não são de tráfego. Esforço de engenharia, risco de suporte e custo de reversão entram na conta e podem mudar a ordem da fila.
- Aplicar prior normal quando a distribuição de ideias tem cauda pesada. Azevedo e coautores mostram que essa premissa muda a estratégia ótima, e que com cauda pesada a estratégia enxuta ganha.
- Concluir que testes longos nunca valem. Eles valem quando o efeito relevante é pequeno e o teto é alto. A tabela deste guia é de uma decisão específica, não uma lei.
- Calcular tudo isso e depois decidir pelo cargo de quem opinou. Se o processo termina no palpite de quem tem o salário mais alto, a conta foi decoração.
Faça isso automático na Donnu
O gargalo dessa conta nunca é a matemática, é ter os dois insumos guardados no lugar certo: o valor por ponto percentual daquele fluxo e o prior declarado antes de o teste rodar. Sem o segundo, todo cálculo de valor da informação feito depois é reconstrução de memória, e memória depois do resultado é sempre otimista.
A Donnu registra a configuração do experimento no momento em que ele é criado, incluindo o que foi declarado como expectativa e como métrica primária, e mantém o histórico por experimento. Isso deixa a comparação entre o que se esperava e o que aconteceu disponível meses depois, que é justamente o insumo para calibrar o prior do próximo teste.
E fica a recomendação mais prática deste guia: antes de aprovar mais duas semanas de teste, calcule quanto essas duas semanas compram. Na tabela acima, esticar de 85.199 para 150.000 por variação custa 30 dias de janela e compra R$ 174,24 por dia. Rodar outro teste nessa mesma janela costuma valer centenas de vezes mais. A calculadora de tamanho de amostra dá o eixo horizontal dessa conta.
Referências
- Azevedo, E. M., Deng, A., Montiel Olea, J. L., Rao, J. e Weyl, E. G. A/B Testing with Fat Tails. Journal of Political Economy, volume 128, número 12, 2020. Fonte da definição da função de produção da informação como o valor esperado da parte positiva da média a posteriori menos o valor esperado da parte positiva do que se sabia antes; do teorema segundo o qual, para amostras grandes, o produto marginal de dados adicionais cai a uma taxa de um sobre n ao quadrado, independentemente dos detalhes da distribuição de ideias; da intuição de que dados adicionais só resolvem casos de fronteira, em que o valor da inovação é próximo de zero e o custo do erro é pequeno; do registro de que mesmo experimentos com dezenas de milhões de usuários geram apenas uma fração do valor da informação perfeita; da estimativa de um coeficiente de cauda bem abaixo de 3 no Bing e do favorecimento da experimentação enxuta que ela implica; e do contrafactual de 20 por cento mais ideias com o mesmo número de usuários, que aumentaria a produtividade em 17,05 por cento, com a conta de guardanapo de que a mudança seria lucrativa mesmo com custo fixo de centenas de milhares de dólares por experimento ao ano. eduardomazevedo.github.io.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. e Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013, Chicago. Fonte da relação quadrática entre sensibilidade e amostra, com o exemplo de que aumentar a sensibilidade por um fator de 10, de um efeito detectável de 5 por cento para 0,5 por cento, exige 100 vezes mais usuários; e do registro de que apenas um terço das ideias testadas na Microsoft melhorou as métricas que elas foram desenhadas para melhorar, número apresentado junto de estimativas publicadas por outras empresas. exp-platform.com.
- Deng, A., Lu, J. e Chen, S. Continuous Monitoring of A/B Tests without Pain: Optional Stopping in Bayesian Testing. 2016. Usado aqui para a leitura de decisão do exemplo trabalhado: fonte da formulação de que a chance a posteriori é a chance a priori multiplicada pelo fator de Bayes, da prova de validade do teste bayesiano sob monitoramento contínuo quando regras de parada apropriadas são usadas, e do registro de que o prior pode ser aprendido empiricamente a partir de testes A/B históricos. arxiv.org.
Leia também: Quantos testes A/B por mês · Velocidade de experimentação · Perda esperada · Fator de Bayes · Efeito mínimo detectável · Calculadora de tamanho de amostra · Read in English
Perguntas frequentes
- O que é valor da informação num teste A/B?
- É quanto dinheiro a decisão melhora por você ter rodado o teste, em vez de decidir só com o que já sabia. Formalmente, é o valor esperado da decisão tomada depois de ver o resultado menos o valor esperado da decisão tomada sem ele. No exemplo deste guia, a loja vale 3.432.000 reais por ponto percentual de conversão por ano, e um teste de 31.234 visitantes por variação vale 629.105,59 reais em melhoria de decisão.
- Existe um teto para o que qualquer teste pode valer?
- Existe, e ele se chama valor da informação perfeita. É quanto valeria saber a verdade com certeza absoluta, sem erro de medição. No exemplo deste guia esse teto é 661.285,36 reais. Nenhum teste, por maior que seja, entrega mais do que isso, e é por esse teto que se mede se um teste está bem dimensionado.
- Por que esticar um teste rende cada vez menos?
- Porque dados adicionais só ajudam a resolver casos de fronteira, em que o valor da mudança é próximo de zero, e errar nesses casos custa pouco. Azevedo, Deng, Montiel Olea, Rao e Weyl demonstram que, para amostras grandes, o produto marginal de dados adicionais cai a uma taxa de um sobre n ao quadrado. No exemplo deste guia, o primeiro dia de teste compra 58,23 por cento do teto e os 70 dias seguintes ao quadragésimo compram 0,79 ponto percentual a mais.
- Quando a resposta honesta é não testar?
- Quando você já está bastante certo do resultado. Com um prior de mais 0,90 ponto percentual e desvio de 0,30, o valor da informação perfeita cai para 393,25 reais e o valor de um teste de 15 dias para 58,46 reais. Testar aí é gastar duas semanas de janela para comprar quase nada. A decisão já está tomada pelo que se sabe.
- Qual é o custo real de rodar um teste?
- Na maioria dos programas com tráfego suficiente, o custo dominante não é dinheiro, é a janela: enquanto esse teste roda, outro não roda. Por isso a régua útil é o valor da informação POR DIA de teste, e não o valor total. Na fila de exemplo deste guia, três testes de 15 dias valem 4.349,80, 41.940,37 e 77.515,42 reais por dia, uma diferença de quase 18 vezes entre o primeiro e o último.
- Um teste sem significância pode decidir?
- Pode. No exemplo trabalhado final, uma leitura de 31.234 por braço devolve valor-p de 0,088858, que não passa em 0,05. Combinada com o prior declarado, ela deixa a probabilidade de o efeito ser positivo em 95,58 por cento e o valor da informação perfeita que ainda resta em 10.419,54 reais, contra 661.285,36 antes do teste. O teste resolveu 98,4 por cento da dúvida que existia, e continuar medindo custa mais do que a dúvida que sobrou.