Encolhimento Bayesiano: por que o melhor segmento mente
Encolhimento bayesiano empírico puxa cada segmento para a média do teste. A conta em oito segmentos, o fator de encolhimento e quando o topo é real.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Todo teste A/B com segmentação produz um ranking, e o topo desse ranking quase sempre pertence ao segmento com menos tráfego. Isso não é coincidência: estimativa grande é subproduto de erro-padrão grande. O encolhimento bayesiano empírico corrige isso puxando cada segmento em direção à média do teste, com força proporcional ao ruído daquele segmento. No exemplo trabalhado deste guia, oito segmentos de um mesmo teste têm efeito bruto de mais 0,3000 a mais 2,2500 pontos percentuais, e a dispersão observada entre eles é MENOR do que o acaso sozinho produziria: a variância entre segmentos estimada dá zero e os oito colapsam no mesmo valor, mais 0,8723 ponto percentual. Este guia mostra a conta completa, o caso em que a heterogeneidade é real e o encolhimento é apenas parcial, o que Efron e Morris mediram quando havia resposta conhecida, e por que encolher é diferente de corrigir por múltiplas comparações. Faz parte do nosso guia completo de teste A/B e é a peça que falta ao lado de efeito heterogêneo por segmento.
O relatório que todo mundo já leu
O teste terminou e venceu. Alguém abre o corte por segmento e traz a manchete: “funcionou MUITO bem no aplicativo iOS, mais 2,25 pontos percentuais, quase o triplo da média”. A pergunta que vem em seguida é sempre a mesma: a gente lança só para iOS primeiro? A gente investe no iOS?
Vale olhar o que sustenta esse número antes de responder. São oito segmentos com tamanhos muito diferentes, do e-mail com 1.500 visitantes por braço ao mobile web orgânico com 15.000. E o efeito de cada um foi medido com a precisão que o tamanho dele permite, não com a precisão que a manchete sugere.
| segmento | controle | variação | efeito bruto | erro-padrão | valor-p |
|---|---|---|---|---|---|
| aplicativo iOS | 2.000 / 100 = 5,0000% | 2.000 / 145 = 7,2500% | mais 2,2500 pp | 0,7574 | 0,003005 |
| aplicativo Android | 2.500 / 125 = 5,0000% | 2.500 / 150 = 6,0000% | mais 1,0000 pp | 0,6447 | 0,120948 |
| mobile web orgânico | 15.000 / 750 = 5,0000% | 15.000 / 888 = 5,9200% | mais 0,9200 pp | 0,2623 | 0,000454 |
| retorno direto | 8.000 / 400 = 5,0000% | 8.000 / 469 = 5,8625% | mais 0,8625 pp | 0,3583 | 0,016087 |
| desktop orgânico | 12.000 / 600 = 5,0000% | 12.000 / 703 = 5,8583% | mais 0,8583 pp | 0,2925 | 0,003344 |
| desktop busca paga | 3.000 / 150 = 5,0000% | 3.000 / 172 = 5,7333% | mais 0,7333 pp | 0,5818 | 0,207563 |
| 1.500 / 75 = 5,0000% | 1.500 / 84 = 5,6000% | mais 0,6000 pp | 0,8180 | 0,463285 | |
| mobile web social | 4.000 / 200 = 5,0000% | 4.000 / 212 = 5,3000% | mais 0,3000 pp | 0,4942 | 0,543827 |
Some tudo e o teste global é 48.000 / 2.400 contra 48.000 / 2.823, ou seja, 5,00 por cento contra 5,88 por cento. Cole esses quatro números na calculadora abaixo:
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
O resultado é mais 17,6 por cento relativo, com valor-p tão pequeno que a tela satura em “menor que 0,0001” e intervalo de confiança de mais 0,6 a mais 1,2 ponto. Levando as contas a mais casas, a diferença absoluta é de mais 0,8813 ponto percentual, o valor-p é 0,0000000018 e o intervalo vai de mais 0,5943 a mais 1,1682 ponto. Um teste sólido, sem ambiguidade.
Agora olhe a tabela por segmento de novo, ordenada por efeito bruto. Os dois primeiros lugares são os dois menores segmentos do teste. O terceiro lugar é o maior segmento do teste. Isso não é um padrão de negócio. É um padrão de aritmética.
Estimativa grande é subproduto de erro-padrão grande
Gelman, Hill e Yajima colocam o mecanismo em uma frase que vale a leitura literal: estimativas grandes são, na verdade, um subproduto de erros-padrão grandes. O argumento é geométrico, não estatístico avançado.
Se oito segmentos têm exatamente o mesmo efeito verdadeiro, ordená-los pela estimativa crua é ordená-los pelo ruído. O primeiro colocado é quase sempre o segmento em que o acaso teve mais espaço para trabalhar. Esse é o mesmo mecanismo por trás da maldição do vencedor e da regressão à média: quando você seleciona pelo extremo de uma leitura ruidosa, você seleciona ruído junto.
A correção clássica para isso é alargar os intervalos, com Bonferroni ou com controle da taxa de descoberta falsa. O encolhimento faz outra coisa, e Gelman, Hill e Yajima marcam o contraste com precisão: modelos multinível fazem agrupamento parcial, deslocando as estimativas umas em direção às outras, enquanto os procedimentos clássicos mantêm os centros dos intervalos parados e ajustam por múltiplas comparações tornando os intervalos mais largos. Uma abordagem mexe na barra de erro. A outra mexe no número.
A conta do encolhimento bayesiano, em três passos
O procedimento é curto e roda numa planilha.
Passo 1: a média do conjunto, ponderada pela precisão. Cada segmento entra com peso igual ao inverso do quadrado do seu erro-padrão. Nos oito segmentos acima, isso dá mais 0,8723 ponto percentual, com erro-padrão de 0,1463.
Passo 2: quanto os segmentos se espalham além do acaso. Some, para cada segmento, o quadrado da distância até essa média, dividido pela variância do segmento. Essa soma é o Q de Cochran. Se os oito medissem exatamente o mesmo efeito, Q ficaria em torno de 7, que é o número de graus de liberdade. Aqui Q vale 4,8926 com 7 graus de liberdade. Ou seja, os oito segmentos estão MENOS espalhados do que o acaso sozinho produziria.
Passo 3: a variância entre segmentos, e o fator de encolhimento. A estimativa de momentos subtrai os graus de liberdade de Q e nunca desce abaixo de zero. Com Q abaixo dos graus de liberdade, ela dá exatamente zero. E o fator de encolhimento de cada segmento é a variância entre segmentos dividida pela soma dela com a variância do próprio segmento. Com variância entre segmentos igual a zero, o fator é zero para todos os oito.
| segmento | efeito bruto | erro-padrão | fator de encolhimento | efeito encolhido |
|---|---|---|---|---|
| aplicativo iOS | mais 2,2500 pp | 0,7574 | 0,0000 | mais 0,8723 pp |
| aplicativo Android | mais 1,0000 pp | 0,6447 | 0,0000 | mais 0,8723 pp |
| mobile web orgânico | mais 0,9200 pp | 0,2623 | 0,0000 | mais 0,8723 pp |
| retorno direto | mais 0,8625 pp | 0,3583 | 0,0000 | mais 0,8723 pp |
| desktop orgânico | mais 0,8583 pp | 0,2925 | 0,0000 | mais 0,8723 pp |
| desktop busca paga | mais 0,7333 pp | 0,5818 | 0,0000 | mais 0,8723 pp |
| mais 0,6000 pp | 0,8180 | 0,0000 | mais 0,8723 pp | |
| mobile web social | mais 0,3000 pp | 0,4942 | 0,0000 | mais 0,8723 pp |
Não sobrou ranking. A leitura honesta desses oito segmentos é que o efeito é o mesmo em todos eles, e a melhor estimativa para cada um é a média do teste inteiro. A variação de mais 0,3000 a mais 2,2500 ponto percentual é inteiramente compatível com um único efeito subjacente medido oito vezes com precisões diferentes.
Isso não é um artifício do exemplo: é o comportamento normal de um agrupamento parcial quando não há heterogeneidade nenhuma nos dados. E é uma resposta muito mais útil do que “o iOS teve um valor-p de 0,003005, então o efeito no iOS é real e é enorme”.
Quando a heterogeneidade É real: o encolhimento bayesiano vira parcial
Troque um único segmento. Suponha que a mudança realmente prejudica o público que vem de rede social, e o mobile web social sai de 4.000 / 212 para 4.000 / 128, ou seja, de 5,3000 para 3,2000 por cento, um efeito de menos 1,8000 ponto percentual.
Com esse único segmento trocado, Q sobe de 4,8926 para 37,2859 contra os mesmos 7 graus de liberdade, e a variância entre segmentos deixa de ser zero: o desvio entre segmentos estimado passa a ser 0,8906 ponto percentual. Agora o encolhimento tem de onde puxar.
| segmento | efeito bruto | erro-padrão | fator de encolhimento | efeito encolhido | erro-padrão posterior |
|---|---|---|---|---|---|
| aplicativo iOS | mais 2,2500 pp | 0,7574 | 0,5802 | mais 1,5725 pp | 0,5802 |
| aplicativo Android | mais 1,0000 pp | 0,6447 | 0,6562 | mais 0,8748 pp | 0,5246 |
| mobile web orgânico | mais 0,9200 pp | 0,2623 | 0,9202 | mais 0,8973 pp | 0,2519 |
| retorno direto | mais 0,8625 pp | 0,3583 | 0,8607 | mais 0,8309 pp | 0,3330 |
| desktop orgânico | mais 0,8583 pp | 0,2925 | 0,9026 | mais 0,8367 pp | 0,2782 |
| desktop busca paga | mais 0,7333 pp | 0,5818 | 0,7009 | mais 0,7042 pp | 0,4890 |
| mais 0,6000 pp | 0,8180 | 0,5424 | mais 0,6165 pp | 0,6061 | |
| mobile web social | menos 1,8000 pp | 0,4429 | 0,8017 | menos 1,3169 pp | 0,3976 |
Três leituras dessa tabela, e as três importam:
- O segmento realmente diferente sobrevive. O mobile web social sai de menos 1,8000 para menos 1,3169 ponto percentual. Encolheu, continua negativo, continua sendo o único negativo e continua sendo o achado do relatório.
- O falso primeiro lugar encolhe muito mais. O iOS perde 0,6775 ponto (de 2,2500 para 1,5725) porque o fator dele é 0,5802: quase metade da estimativa dele é substituída pela média do conjunto. O mobile web orgânico, com o dobro do tamanho, tem fator 0,9202 e perde apenas 0,0227 ponto.
- O ranking muda de ordem. Na leitura crua, o mobile web orgânico é o terceiro. Na encolhida, ele é o segundo, à frente do Android, porque a leitura dele é a que menos depende de sorte.
O fator de encolhimento tem uma leitura direta: ele é a fração da estimativa que vem do próprio segmento. Fator 0,92 quer dizer que 92 por cento do número é o segmento falando e 8 por cento é o resto do teste emprestando informação. Fator 0,54 quer dizer que quase metade do número não é daquele segmento.
O que Stein provou, e o que Efron e Morris mediram
A ideia é de 1961 e soa errada quando você a ouve pela primeira vez: para estimar três ou mais médias ao mesmo tempo, existe um estimador que erra menos, no agregado, do que usar cada média amostral por conta própria. Menos, sempre, independentemente de quais sejam os valores verdadeiros.
Efron e Morris testaram isso num caso com gabarito. Pegaram as médias de rebatida de 18 jogadores da liga principal de beisebol nas primeiras 45 tentativas oficiais da temporada de 1970, e usaram só esse pedaço para prever o desempenho de cada um no restante da temporada. O fator de encolhimento estimado foi tal que cada jogador ficou com 0,209 da sua própria média e 0,791 da média do grupo.
Os números: o erro quadrático total da média amostral crua foi 17,56 e o do estimador encolhido foi 5,01. A eficiência, que eles definem como a razão entre as duas perdas, é 3,50. E o encolhido ficou mais perto do valor verdadeiro em 15 dos 18 jogadores, errando mais em apenas 3.
Os 3 em que errou mais têm um nome que interessa: o primeiro deles é o melhor rebatedor da lista, escolhido de propósito pelos autores para testar o método com pelo menos um parâmetro extremo. Sua média crua nas 45 tentativas era 0,400, o encolhimento derrubou para 0,290 e o valor real no restante da temporada foi 0,346.
Essa é a troca inteira, em um caso. O encolhimento acerta mais no conjunto e paga por isso errando mais em quem é genuinamente excepcional. Se a sua pergunta é “qual é a melhor estimativa para cada um dos meus oito segmentos”, o encolhimento é a resposta melhor. Se a sua pergunta é “quem é o extremo verdadeiro”, ele custa caro.
Encolher não é corrigir: as duas contas fazem coisas diferentes
Vale separar bem os dois instrumentos, porque eles são frequentemente apresentados como concorrentes e resolvem problemas distintos.
| correção por múltiplas comparações | encolhimento bayesiano empírico | |
|---|---|---|
| o que muda | a largura do intervalo, ou o limiar do valor-p | a estimativa pontual |
| o que preserva | a estimativa pontual crua | a ordem de grandeza da incerteza |
| pergunta que responde | quantas descobertas falsas eu tolero neste conjunto | qual é a melhor estimativa para cada elemento deste conjunto |
| depende de | número de comparações feitas | dispersão observada entre os elementos |
| efeito no relatório | mais segmentos deixam de ser significativos | o topo desce, o fundo sobe, a ordem muda |
Gelman, Hill e Yajima vão além e argumentam que o erro I nem deveria ser o foco da preocupação, porque raramente se acredita que o efeito de um segmento seja exatamente zero. O que preocupa de verdade são os erros de sinal, chamados por eles de erro do tipo S, e os erros de magnitude, o tipo M: dizer que o efeito é grande quando ele é próximo de zero. Estudos com pouco poder são especialmente vulneráveis ao tipo M, porque incerteza alta produz estimativas grandes.
Isso descreve com exatidão o segmento de 1.500 visitantes por braço no relatório do começo deste guia.
E existe um contraponto honesto, que o encolhimento não dispensa. Heterogeneidade real acontece, e ignorá-la custa caro. Dmitriev, Gupta, Kim e Vaz relatam um experimento no Bing que parecia bem sucedido, aumentando receita em 2,3 por cento e reduzindo o número de anúncios por página em 0,6 por cento. Segmentando por tipo de página, o número de anúncios por página caiu drasticamente, 2,3 por cento, nas páginas recarregadas, e na verdade AUMENTOU 0,3 por cento nas páginas originais, que eram as que importavam. A conclusão do time foi que o experimento não havia cumprido o objetivo. A lição que eles tiram é para evitar a armadilha de assumir que o efeito é homogêneo entre todos os usuários e consultas.
As duas coisas são verdadeiras ao mesmo tempo: olhar segmento é obrigatório, e acreditar no ranking cru dos segmentos é ingênuo. O encolhimento é justamente o que permite fazer a primeira coisa sem cometer a segunda.
Como aplicar isso na prática
- Declare os segmentos no plano de análise, antes de rodar. Encolhimento não conserta segmento pescado depois de ver os dados; ele só torna honesta a leitura de um conjunto definido de antemão.
- Reporte sempre as duas colunas. Bruto e encolhido, lado a lado, com o erro-padrão de cada segmento visível. Esconder o bruto gera desconfiança e esconder o encolhido gera decisão errada.
- Publique o Q e os graus de liberdade. É o número que responde “existe heterogeneidade aqui?” antes de qualquer discussão sobre qual segmento ganhou.
- Não interprete o fator de encolhimento como nota do segmento. Ele mede tamanho de amostra, não qualidade do público.
- Trate um segmento genuinamente negativo como achado, não como ruído. No cenário B, menos 1,3169 ponto percentual depois de encolhido continua sendo motivo para investigar antes de lançar.
- Se um segmento merece decisão própria, ele merece teste próprio. Um efeito de 0,9 ponto sobre uma base de 5 por cento é um efeito relativo de 18 por cento, o que exige cerca de 9.986 visitantes por variação para ser detectado com 80 por cento de poder. O segmento de e-mail, com 3.000 visitantes por semana, levaria 47 dias para chegar lá sozinho. Confira o seu caso na calculadora de tamanho de amostra.
- Quando a pergunta for sobre vários testes em vez de vários segmentos, o instrumento é o mesmo com outro nome: veja meta-análise de testes A/B.
Erros comuns
- Ordenar segmentos por efeito bruto e agir sobre o topo. É o erro central deste artigo. O topo é uma seleção por variância.
- Concluir heterogeneidade sem olhar o Q. No cenário A, oito efeitos brutos de 0,30 a 2,25 pontos percentuais convivem com heterogeneidade estimada em zero.
- Achar que encolhimento apaga achados. No cenário B, o achado negativo sobrevive com folga; o que sumiu foi o falso primeiro lugar.
- Encolher segmentos que não pertencem ao mesmo grupo. Encolher faz sentido quando é razoável pensar nos elementos como amostras de uma mesma distribuição. Encolher a métrica de receita junto com a de cliques não é agrupamento parcial, é confusão.
- Encolher com premissa normal quando a cauda é pesada. Azevedo, Deng, Montiel Olea, Rao e Weyl estimaram no Bing um coeficiente de cauda bem abaixo de 3, e a implicação que eles tiram é dupla: ideias com estatística pequena devem ser encolhidas agressivamente, porque provavelmente foram sorte, e ideias muito fora da curva provavelmente são reais. No Bing, os 2 por cento melhores respondem por 74,8 por cento dos ganhos históricos.
- Aplicar encolhimento e esquecer que o teste ainda precisa ser confiável. Nada disso protege contra divisão desigual de tráfego, viés de instrumentação ou período curto demais.
- Usar o efeito encolhido como se fosse medição direta na projeção de receita. Ele é a melhor estimativa disponível, com incerteza própria, e a coluna de erro-padrão posterior existe para isso.
Faça isso automático na Donnu
Para encolher um conjunto de segmentos você precisa de duas coisas por segmento: o efeito estimado e o erro-padrão dele. Parece trivial e é onde a maioria dos relatórios trava, porque o corte por segmento costuma ser reconstruído depois, no painel de análise, a partir de atributos do usuário no estado ATUAL e não no estado em que ele estava quando entrou no teste.
Quando o atributo mudou depois da atribuição, o segmento deixa de ser um recorte pré-experimento e vira consequência do experimento, e a conta inteira deste artigo perde o sentido. A Donnu carimba o estado do usuário no instante da atribuição, o que deixa cada corte com a definição congelada no momento certo e com o erro-padrão calculado sobre a amostra correta.
O restante é aritmética de planilha, e este guia tem todos os passos. A calculadora de significância fecha a leitura bruta de cada segmento, que continua sendo o insumo do qual todo o resto sai.
Referências
- Efron, B. e Morris, C. Data Analysis Using Stein’s Estimator and Its Generalizations. Journal of the American Statistical Association, volume 70, número 350, 1975, páginas 311 a 319. Fonte do exemplo das médias de rebatida de 18 jogadores nas primeiras 45 tentativas oficiais de 1970; do fator estimado que deixa cada jogador com 0,209 da própria média e 0,791 da média do grupo; do erro quadrático total de 17,56 para a média amostral contra 5,01 para o estimador encolhido, com eficiência de 3,50; do registro de que o encolhido fica mais perto do valor verdadeiro em 15 dos 18 jogadores; e da nota de que o melhor rebatedor foi incluído de propósito para testar o método num parâmetro extremo. faculty.ucmerced.edu.
- Gelman, A., Hill, J. e Yajima, M. Why We (Usually) Don’t Have to Worry About Multiple Comparisons. Journal of Research on Educational Effectiveness, volume 5, 2012, páginas 189 a 211. Fonte do contraste entre agrupamento parcial, que desloca as estimativas umas em direção às outras, e os procedimentos clássicos, que mantêm os centros dos intervalos parados e alargam os intervalos; da afirmação de que estimativas grandes são um subproduto de erros-padrão grandes, ilustrada com duas distribuições amostrais de desvio 1 e 3 sob efeito nulo; e do deslocamento do foco do erro tipo I para os erros de sinal, tipo S, e de magnitude, tipo M. arxiv.org.
- Dmitriev, P., Gupta, S., Kim, D. W. e Vaz, G. A Dirty Dozen: Twelve Common Metric Interpretation Pitfalls in Online Controlled Experiments. KDD 2017, Halifax. Fonte da armadilha de assumir que o efeito é homogêneo entre usuários e consultas, com o experimento do Bing que subiu receita 2,3 por cento e baixou anúncios por página 0,6 por cento no agregado, enquanto o corte por tipo de página mostrava queda de 2,3 por cento nas páginas recarregadas e aumento de 0,3 por cento nas páginas originais. exp-platform.com.
- Azevedo, E. M., Deng, A., Montiel Olea, J. L., Rao, J. e Weyl, E. G. A/B Testing with Fat Tails. Journal of Political Economy, volume 128, número 12, 2020. Usado aqui para o limite do encolhimento sob cauda pesada: fonte da estimativa de um coeficiente de cauda bem abaixo de 3 no Bing, da recomendação de encolher agressivamente ideias com estatística pequena enquanto ideias fora da curva provavelmente são reais, e do registro de que os 2 por cento melhores respondem por 74,8 por cento dos ganhos históricos. eduardomazevedo.github.io.
Leia também: Efeito heterogêneo por segmento · Meta-análise de testes A/B · Maldição do vencedor · Muitas métricas, um teste · Modelagem de uplift · Calculadora de significância · Read in English
Perguntas frequentes
- O que é encolhimento bayesiano empírico num teste A/B?
- É puxar a estimativa de cada segmento em direção à média de todos os segmentos, com força proporcional ao ruído daquele segmento. Segmento pequeno, com erro-padrão grande, é puxado quase até a média. Segmento grande, com erro-padrão pequeno, quase não se move. O resultado é um conjunto de estimativas que erra menos no agregado do que a leitura crua de cada segmento isolado.
- Por que o segmento com o maior efeito costuma ser o menor?
- Porque estimativas grandes são um subproduto de erros-padrão grandes. Gelman, Hill e Yajima descrevem exatamente esse mecanismo: um estimador com desvio maior tem probabilidade muito maior de produzir uma estimativa grande em módulo do que um estimador preciso, mesmo quando o efeito verdadeiro é zero nos dois casos. No exemplo deste guia, o segmento de 2.000 visitantes por braço lidera o ranking com mais 2,2500 pontos percentuais, e o encolhimento derruba esse número para a média de mais 0,8723 ponto.
- Qual é a diferença entre encolher e corrigir por múltiplas comparações?
- A correção clássica, como Bonferroni, mantém a estimativa pontual parada e alarga o intervalo. O encolhimento move a estimativa pontual em direção às outras e não precisa alargar nada. Gelman, Hill e Yajima resumem assim: modelos multinível fazem agrupamento parcial deslocando as estimativas umas em direção às outras, enquanto os procedimentos clássicos mantêm os centros dos intervalos parados e ajustam por múltiplas comparações tornando os intervalos mais largos.
- Encolhimento não apaga um segmento que é realmente diferente?
- Não, e a conta mostra por quê. Quando existe heterogeneidade real, a variância entre segmentos estimada sobe e o fator de encolhimento cai menos. No cenário B deste guia, um segmento com efeito verdadeiro negativo sai de menos 1,8000 para menos 1,3169 ponto percentual, continua sendo o pior do conjunto por larga margem e continua com sinal negativo. O que o encolhimento apaga é a diferença que só o acaso produziu.
- Quanto o encolhimento realmente ganha?
- Efron e Morris mediram isso num caso com resposta conhecida: 18 jogadores de beisebol, 45 rebatidas cada. O erro quadrático total da média amostral foi 17,56 e o do estimador de James e Stein foi 5,01, uma eficiência de 3,50. O estimador encolhido ficou mais perto do valor verdadeiro em 15 dos 18 jogadores, e errou mais em 3.
- Quando NÃO devo encolher?
- Quando a distribuição de efeitos tem cauda pesada e você está justamente atrás dos extremos. Azevedo, Deng, Montiel Olea, Rao e Weyl estimaram no Bing um coeficiente de cauda bem abaixo de 3 e concluem que ideias com estatística pequena devem ser encolhidas agressivamente, enquanto ideias muito fora da curva provavelmente são reais. Encolhimento com premissa normal aplica a mesma força aos dois casos, e é aí que ele erra.