Estatística

Valor da Informação: vale a pena rodar esse teste?

O valor da informação põe preço no que um teste A/B compra. A conta do teto, o valor por tamanho de amostra e quando a resposta é não testar.

Ilustração plana de uma encosta que sobe forte e depois vira um platô longo e plano, com uma bandeira no ponto em que a subida acaba

Todo teste A/B tem um preço em janela de tráfego e um valor em decisão melhorada, e quase ninguém calcula o segundo. O valor da informação é essa conta: quanto a decisão melhora por você ter medido, em vez de ter decidido com o que já sabia. Ela tem teto, e o teto é o valor de saber a verdade com certeza. No exemplo trabalhado deste guia, uma loja de 30.000 visitantes por semana vale 3.432.000 reais por ponto percentual de conversão por ano, o teto de qualquer teste sobre uma mudança específica é 661.285,36 reais, e o primeiro dia de teste já compra 58,23 por cento desse teto. Os 100 dias seguintes compram menos de 5 por cento. Este guia mostra a conta completa, a tabela de valor por tamanho de amostra, os priors em que a resposta honesta é não testar, e como usar tudo isso para escolher qual teste ocupa a próxima janela. Faz parte do nosso guia completo de teste A/B e é a régua que falta ao lado de quantos testes A/B por mês.

Primeiro, quanto vale acertar

Sem um número de valor, nada disso funciona. A âncora do exemplo é uma loja com:

parâmetro valor
tráfego 30.000 visitantes por semana, 1.560.000 por ano
taxa de conversão atual 5,00%
ticket médio R$ 220
receita anual atual R$ 17.160.000
valor de 1 ponto percentual de conversão R$ 3.432.000 por ano
valor de 0,1 ponto percentual R$ 343.200 por ano

Esse último número é o que transforma estatística em decisão. Um ponto percentual sobre uma base de 5 por cento é um ganho relativo de 20 por cento na conversão e, com ticket médio constante, 20 por cento na receita.

A proposta em análise é reordenar a página de preços. O time acha que ajuda, mas sem convicção. Escrevendo isso como número: a expectativa a priori é de mais 0,10 ponto percentual, com desvio de 0,60 ponto. Isso quer dizer que efeitos entre menos 1,1 e mais 1,3 ponto são todos plausíveis, e que a probabilidade de a mudança PIORAR a conversão é de 43,38 por cento.

Duas leituras já saem daí, antes de qualquer teste:

Lançar direto é positivo em expectativa, e ainda assim é uma aposta que perde em quase metade dos mundos possíveis. É exatamente essa combinação que faz um teste valer a pena.

O teto: valor da informação perfeita

Imagine um oráculo que diga a verdade de graça e na hora. Com ele, a regra fica trivial: lançar quando o efeito verdadeiro é positivo, não lançar quando é negativo, e nunca errar. O valor esperado dessa política, sobre a distribuição de crenças declarada acima, é R$ 1.004.485,36 por ano.

O ganho do oráculo sobre a melhor decisão sem informação nenhuma é o valor da informação perfeita:

R$ 1.004.485,36 menos R$ 343.200,00 = R$ 661.285,36

Valor de lançar direto, valor com informação perfeita e a diferença entre os doisTrês barras horizontais. A primeira mostra o valor esperado de lançar sem teste, trezentos e quarenta e três mil e duzentos reais. A segunda mostra o valor esperado com informação perfeita, um milhão e quatro mil quatrocentos e oitenta e cinco reais. A terceira, destacada, mostra a diferença entre as duas, seiscentos e sessenta e um mil duzentos e oitenta e cinco reais, que é o teto do que qualquer teste pode valer.o que a decisão vale, por anolançar direto, sem testeR$ 343.200,00com informação perfeitaR$ 1.004.485,36a diferença: teto de qualquer testeR$ 661.285,36nenhum teste entrega mais que a barra vermelha, porque ela é o valor de saber a verdade com certeza.a barra verde não é o ganho do teste. Ela inclui os R$ 343.200 que você já teria sem medir nada.testar bem é chegar perto da barra vermelha gastando pouca janela.
O teto existe e é finito. A pergunta operacional é quanto dele você compra, e por quantos dias de tráfego.

Esse número é o mais útil do artigo, porque ele limita a discussão. Nenhum desenho de teste, nenhuma sofisticação estatística, nenhum aumento de tráfego entrega mais do que R$ 661.285,36 nessa decisão. Se alguém propõe um teste de quatro meses para “ter certeza”, o teto está aí para dizer quanto essa certeza pode render, no máximo.

O valor da informação de um teste de tamanho n

Um teste real não é o oráculo. Ele devolve uma leitura com erro, e quanto maior a amostra, menor o erro. O valor esperado da informação de amostra é a mesma conta do teto, com a incerteza que sobra depois de ver o resultado.

Azevedo, Deng, Montiel Olea, Rao e Weyl formalizam exatamente esse objeto e chamam de função de produção da informação: o valor de investir dados de n usuários numa ideia é o valor esperado da parte positiva da média a posteriori, menos o valor esperado da parte positiva do que se sabia antes. É a definição usada nesta tabela.

por variação erro-padrão da leitura valor da informação % do teto dias a 30 mil/semana valor por dia
2.000 0,6892 pp R$ 385.091,05 58,23% 1 R$ 385.091,05
5.000 0,4359 pp R$ 507.080,95 76,68% 3 R$ 169.026,98
8.158 0,3412 pp R$ 555.572,97 84,01% 4 R$ 138.893,24
10.000 0,3082 pp R$ 571.915,07 86,49% 5 R$ 114.383,01
20.000 0,2179 pp R$ 612.647,43 92,64% 10 R$ 61.264,74
31.234 0,1744 pp R$ 629.105,59 95,13% 15 R$ 41.940,37
50.000 0,1378 pp R$ 640.723,97 96,89% 24 R$ 26.696,83
85.199 0,1056 pp R$ 649.025,30 98,15% 40 R$ 16.225,63
150.000 0,0796 pp R$ 654.252,38 98,94% 70 R$ 9.346,46
300.000 0,0563 pp R$ 657.745,66 99,46% 140 R$ 4.698,18

As três linhas destacadas não são arbitrárias. 8.158, 31.234 e 85.199 por variação são exatamente os tamanhos que a nossa calculadora recomenda para detectar efeitos relativos de 20, 10 e 6 por cento sobre uma base de 5 por cento, com 80 por cento de poder e 5 por cento de significância. Confira:

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

O resultado mais desconfortável da tabela: o teste de 1 dia já compra 58,23 por cento do teto. O teste de 15 dias, que é o dimensionamento clássico para um efeito relativo de 10 por cento, compra 95,13 por cento. E o teste de 140 dias compra 99,46 por cento.

O ganho marginal de esticar o teste

A mesma tabela, lida como diferenças, é ainda mais direta:

esticar de para dias a mais valor a mais por dia extra
2.000 5.000 2 R$ 121.989,90 R$ 60.994,95
5.000 8.158 1 R$ 48.492,02 R$ 48.492,02
8.158 10.000 1 R$ 16.342,10 R$ 16.342,10
10.000 20.000 5 R$ 40.732,36 R$ 8.146,47
20.000 31.234 5 R$ 16.458,16 R$ 3.291,63
31.234 50.000 9 R$ 11.618,38 R$ 1.290,93
50.000 85.199 16 R$ 8.301,33 R$ 518,83
85.199 150.000 30 R$ 5.227,08 R$ 174,24
150.000 300.000 70 R$ 3.493,28 R$ 49,90

O último dia de um teste de 140 dias vale cerca de R$ 50. O segundo dia de um teste vale cerca de R$ 61.000. É uma razão de mais de mil para um, dentro da mesma decisão e do mesmo negócio.

Fração do teto comprada em função da duração do testeUma curva sobe muito rápido nos primeiros dias e depois vira quase horizontal. Com um dia de teste ela já está em cinquenta e oito por cento do teto. Com quinze dias, em noventa e cinco por cento. Com cento e quarenta dias, em noventa e nove por cento. O eixo vertical é a fração do valor da informação perfeita e o eixo horizontal é a duração do teste em dias.teto: R$ 661.285,361 dia: 58,23%4 dias: 84,01%15 dias: 95,13%40 dias: 98,15%140 dias: 99,46%1154070140duração do teste em dias, a 30.000 visitantes por semana divididos em dois braçosfração do teto
A curva é quase toda vertical no começo e quase toda horizontal no resto. O dimensionamento clássico cai no joelho dela, não por acaso.

A explicação vale a leitura literal de Azevedo e coautores: dados adicionais só ajudam a resolver casos de fronteira, em que o valor de uma inovação é próximo de zero, e errar nesses casos não custa caro, porque mesmo errando a perda associada é pequena. Eles demonstram que, para amostras muito grandes, o produto marginal de dados adicionais cai a uma taxa de um sobre n ao quadrado, independentemente dos detalhes da distribuição de ideias.

É a mesma matemática que aparece na sensibilidade: Kohavi e coautores registram que para aumentar a sensibilidade de um experimento por um fator de 10, digamos de um efeito detectável de 5 por cento para 0,5 por cento, você precisa de 100 vezes mais usuários. Precisão é comprada em escala quadrática, e valor é entregue em escala decrescente.

Quando a resposta honesta é NÃO testar

O valor de um teste depende inteiramente do quanto você não sabe. Mesma decisão, mesmo tamanho de amostra de 31.234 por variação e 15 dias, priors diferentes:

o que você acha expectativa desvio teto valor do teste valor por dia
moeda ao alto, sem ideia 0,00 pp 0,60 R$ 821.501,94 R$ 788.853,36 R$ 52.590,22
aposta grande e muito incerta mais 0,10 pp 1,50 R$ 1.886.717,09 R$ 1.873.005,61 R$ 124.867,04
caso base deste guia mais 0,10 pp 0,60 R$ 661.285,36 R$ 629.105,59 R$ 41.940,37
suspeita de piora, muita dúvida menos 0,20 pp 0,60 R$ 523.522,96 R$ 492.709,63 R$ 32.847,31
quase certeza de efeito pequeno mais 0,10 pp 0,20 R$ 135.767,56 R$ 78.607,50 R$ 5.240,50
convencido de que atrapalha menos 0,40 pp 0,30 R$ 43.649,93 R$ 23.674,04 R$ 1.578,27
convencido de que funciona mais 0,90 pp 0,30 R$ 393,25 R$ 58,46 R$ 3,90

A última linha é a mais instrutiva. Quando o time já está convencido de que a mudança funciona e funciona bem, o valor da informação perfeita despenca para R$ 393,25. Não é que o teste seja caro: é que ele não tem o que comprar. Praticamente toda a massa de crença já está do lado positivo, o oráculo quase nunca mudaria a decisão, e portanto quase nunca teria valor.

Repare também que a segunda linha, com o mesmo palpite central do caso base e o dobro e meio da incerteza, vale quase três vezes mais. Incerteza é o insumo do valor da informação. Uma ideia sobre a qual ninguém tem opinião firme é uma ideia cara de não testar.

E existe uma exceção importante à leitura acima: essa conta pressupõe que a decisão é reversível apenas via teste, e que o único custo de lançar errado é o efeito negativo. Quando lançar errado tem custo de reputação, de suporte ou de contrato, o valor do teste sobe, porque ele passa a comprar também a evitação desse custo.

A fila: qual teste ocupa a próxima janela

Num programa com tráfego suficiente, o recurso escasso não é dinheiro, é janela. Enquanto um teste roda, outro não roda no mesmo público. Por isso a régua de priorização não é o valor total do teste, e sim o valor por dia de janela.

teste na fila expectativa desvio valor do teste (15 dias) valor por dia
refazer o fluxo de checkout mais 0,30 pp 1,20 R$ 1.162.731,35 R$ 77.515,42
reordenar a página de preços mais 0,10 pp 0,60 R$ 629.105,59 R$ 41.940,37
botão novo no carrinho mais 0,05 pp 0,15 R$ 65.247,05 R$ 4.349,80

Os três consomem exatamente a mesma janela, e o primeiro vale 17,8 vezes o terceiro. Repare no que produz essa diferença: não é o palpite central, é a incerteza. O botão novo tem desvio de 0,15 ponto, ou seja, todo mundo já sabe mais ou menos o que vai acontecer. O refazimento do checkout tem desvio de 1,20 ponto, e é exatamente essa ignorância que faz medi-lo valer a pena.

Essa é a conclusão contraintuitiva do método: você deve testar prioritariamente aquilo sobre o que menos sabe, e não aquilo em que mais acredita. É a lógica oposta à que domina a maioria das reuniões de priorização, e conversa direto com a priorização por PIE e ICE e com a velocidade de experimentação.

Azevedo e coautores chegam empiricamente ao mesmo lugar. Eles estimam no Bing um coeficiente de cauda bem abaixo de 3, o que favorece uma estratégia enxuta de experimentação, com mais ideias testadas e amostras possivelmente menores. Num contrafactual em que o Bing experimenta com 20 por cento mais ideias, mantendo o mesmo número de usuários e supondo que as ideias marginais tenham a mesma distribuição de qualidade, eles encontram um aumento de produtividade de 17,05 por cento. E fazem uma conta de guardanapo com a valoração monetária do próprio Bing: mover na direção da experimentação enxuta seria lucrativo mesmo se o custo fixo de rodar um experimento fosse da ordem de centenas de milhares de dólares por ano.

O exemplo trabalhado completo: um teste sem significância que decidiu

O teste da página de preços rodou os 15 dias planejados, 31.234 visitantes por variação. Resultado: 1.562 conversões no controle e 1.656 na variação. Cole na calculadora:

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Ela devolve 5,00 por cento contra 5,30 por cento, mais 6,0 por cento relativo e valor-p de 0,0889, com o veredito “ainda sem significância” na tela. Com mais casas, as taxas são 5,0010 e 5,3020 por cento, a diferença absoluta é mais 0,3010 ponto percentual, o valor-p é 0,088858 e o intervalo de confiança vai de menos 0,0457 a mais 0,6476 ponto. Pelo critério clássico, não deu: o valor-p não passa por 0,05 e o intervalo cruza o zero.

Agora a leitura de decisão. Combinando essa leitura com o prior declarado antes de rodar, a crença atualizada sobre o efeito verdadeiro fica centrada em mais 0,2853 ponto percentual, com desvio de 0,1675. Disso saem três números:

pergunta resposta
probabilidade de o efeito verdadeiro ser positivo 95,58%
valor esperado de lançar com essa crença R$ 979.144,91 por ano
valor da informação perfeita que ainda resta R$ 10.419,54

A última linha é a que fecha a decisão. Antes do teste, saber a verdade valia R$ 661.285,36. Depois do teste, saber a verdade vale R$ 10.419,54. O teste resolveu 98,4 por cento da dúvida que existia, e o que sobra de incerteza vale menos do que qualquer prolongamento razoável do teste custaria em janela.

A decisão é lançar. Não porque o valor-p passou, ele não passou, mas porque a dúvida que resta não é economicamente relevante. É o mesmo raciocínio da perda esperada e da região de equivalência prática, com a unidade em reais em vez de pontos percentuais.

Como aplicar isso na prática

  1. Escreva o valor de 1 ponto percentual antes de discutir qualquer teste. É um número por produto, não por teste, e é a âncora de tudo.
  2. Peça o prior em duas perguntas simples. “Qual é o seu palpite de efeito?” e “qual efeito te surpreenderia, para cima e para baixo?”. A segunda pergunta dá o desvio.
  3. Calcule o teto antes de dimensionar. Se o teto é pequeno, nenhum dimensionamento salva o teste, e a decisão deve ser tomada sem ele.
  4. Priorize pelo valor por dia, não pelo valor total. É o único jeito de comparar testes que ocupam a mesma janela.
  5. Prefira mais testes curtos a menos testes longos, quando o teto for alto e a curva já estiver no platô. É a leitura direta da tabela marginal.
  6. Não confunda isso com um argumento para parar cedo. Parar cedo por causa do resultado que apareceu é peeking. Dimensionar curto por causa do valor esperado, ANTES de rodar, é planejamento.
  7. Reveja o prior depois de cada teste do mesmo tipo. O histórico do programa é o melhor prior disponível, e é o que liga esta conta com meta-análise de testes A/B.

Erros comuns

Faça isso automático na Donnu

O gargalo dessa conta nunca é a matemática, é ter os dois insumos guardados no lugar certo: o valor por ponto percentual daquele fluxo e o prior declarado antes de o teste rodar. Sem o segundo, todo cálculo de valor da informação feito depois é reconstrução de memória, e memória depois do resultado é sempre otimista.

A Donnu registra a configuração do experimento no momento em que ele é criado, incluindo o que foi declarado como expectativa e como métrica primária, e mantém o histórico por experimento. Isso deixa a comparação entre o que se esperava e o que aconteceu disponível meses depois, que é justamente o insumo para calibrar o prior do próximo teste.

E fica a recomendação mais prática deste guia: antes de aprovar mais duas semanas de teste, calcule quanto essas duas semanas compram. Na tabela acima, esticar de 85.199 para 150.000 por variação custa 30 dias de janela e compra R$ 174,24 por dia. Rodar outro teste nessa mesma janela costuma valer centenas de vezes mais. A calculadora de tamanho de amostra dá o eixo horizontal dessa conta.

Referências

Leia também: Quantos testes A/B por mês · Velocidade de experimentação · Perda esperada · Fator de Bayes · Efeito mínimo detectável · Calculadora de tamanho de amostra · Read in English

Perguntas frequentes

O que é valor da informação num teste A/B?
É quanto dinheiro a decisão melhora por você ter rodado o teste, em vez de decidir só com o que já sabia. Formalmente, é o valor esperado da decisão tomada depois de ver o resultado menos o valor esperado da decisão tomada sem ele. No exemplo deste guia, a loja vale 3.432.000 reais por ponto percentual de conversão por ano, e um teste de 31.234 visitantes por variação vale 629.105,59 reais em melhoria de decisão.
Existe um teto para o que qualquer teste pode valer?
Existe, e ele se chama valor da informação perfeita. É quanto valeria saber a verdade com certeza absoluta, sem erro de medição. No exemplo deste guia esse teto é 661.285,36 reais. Nenhum teste, por maior que seja, entrega mais do que isso, e é por esse teto que se mede se um teste está bem dimensionado.
Por que esticar um teste rende cada vez menos?
Porque dados adicionais só ajudam a resolver casos de fronteira, em que o valor da mudança é próximo de zero, e errar nesses casos custa pouco. Azevedo, Deng, Montiel Olea, Rao e Weyl demonstram que, para amostras grandes, o produto marginal de dados adicionais cai a uma taxa de um sobre n ao quadrado. No exemplo deste guia, o primeiro dia de teste compra 58,23 por cento do teto e os 70 dias seguintes ao quadragésimo compram 0,79 ponto percentual a mais.
Quando a resposta honesta é não testar?
Quando você já está bastante certo do resultado. Com um prior de mais 0,90 ponto percentual e desvio de 0,30, o valor da informação perfeita cai para 393,25 reais e o valor de um teste de 15 dias para 58,46 reais. Testar aí é gastar duas semanas de janela para comprar quase nada. A decisão já está tomada pelo que se sabe.
Qual é o custo real de rodar um teste?
Na maioria dos programas com tráfego suficiente, o custo dominante não é dinheiro, é a janela: enquanto esse teste roda, outro não roda. Por isso a régua útil é o valor da informação POR DIA de teste, e não o valor total. Na fila de exemplo deste guia, três testes de 15 dias valem 4.349,80, 41.940,37 e 77.515,42 reais por dia, uma diferença de quase 18 vezes entre o primeiro e o último.
Um teste sem significância pode decidir?
Pode. No exemplo trabalhado final, uma leitura de 31.234 por braço devolve valor-p de 0,088858, que não passa em 0,05. Combinada com o prior declarado, ela deixa a probabilidade de o efeito ser positivo em 95,58 por cento e o valor da informação perfeita que ainda resta em 10.419,54 reais, contra 661.285,36 antes do teste. O teste resolveu 98,4 por cento da dúvida que existia, e continuar medindo custa mais do que a dúvida que sobrou.