Estatística

Encolhimento Bayesiano: por que o melhor segmento mente

Encolhimento bayesiano empírico puxa cada segmento para a média do teste. A conta em oito segmentos, o fator de encolhimento e quando o topo é real.

Ilustração plana de dezenas de esferas espalhadas puxadas por fios finos até se alinharem numa única faixa central

Todo teste A/B com segmentação produz um ranking, e o topo desse ranking quase sempre pertence ao segmento com menos tráfego. Isso não é coincidência: estimativa grande é subproduto de erro-padrão grande. O encolhimento bayesiano empírico corrige isso puxando cada segmento em direção à média do teste, com força proporcional ao ruído daquele segmento. No exemplo trabalhado deste guia, oito segmentos de um mesmo teste têm efeito bruto de mais 0,3000 a mais 2,2500 pontos percentuais, e a dispersão observada entre eles é MENOR do que o acaso sozinho produziria: a variância entre segmentos estimada dá zero e os oito colapsam no mesmo valor, mais 0,8723 ponto percentual. Este guia mostra a conta completa, o caso em que a heterogeneidade é real e o encolhimento é apenas parcial, o que Efron e Morris mediram quando havia resposta conhecida, e por que encolher é diferente de corrigir por múltiplas comparações. Faz parte do nosso guia completo de teste A/B e é a peça que falta ao lado de efeito heterogêneo por segmento.

O relatório que todo mundo já leu

O teste terminou e venceu. Alguém abre o corte por segmento e traz a manchete: “funcionou MUITO bem no aplicativo iOS, mais 2,25 pontos percentuais, quase o triplo da média”. A pergunta que vem em seguida é sempre a mesma: a gente lança só para iOS primeiro? A gente investe no iOS?

Vale olhar o que sustenta esse número antes de responder. São oito segmentos com tamanhos muito diferentes, do e-mail com 1.500 visitantes por braço ao mobile web orgânico com 15.000. E o efeito de cada um foi medido com a precisão que o tamanho dele permite, não com a precisão que a manchete sugere.

segmento controle variação efeito bruto erro-padrão valor-p
aplicativo iOS 2.000 / 100 = 5,0000% 2.000 / 145 = 7,2500% mais 2,2500 pp 0,7574 0,003005
aplicativo Android 2.500 / 125 = 5,0000% 2.500 / 150 = 6,0000% mais 1,0000 pp 0,6447 0,120948
mobile web orgânico 15.000 / 750 = 5,0000% 15.000 / 888 = 5,9200% mais 0,9200 pp 0,2623 0,000454
retorno direto 8.000 / 400 = 5,0000% 8.000 / 469 = 5,8625% mais 0,8625 pp 0,3583 0,016087
desktop orgânico 12.000 / 600 = 5,0000% 12.000 / 703 = 5,8583% mais 0,8583 pp 0,2925 0,003344
desktop busca paga 3.000 / 150 = 5,0000% 3.000 / 172 = 5,7333% mais 0,7333 pp 0,5818 0,207563
e-mail 1.500 / 75 = 5,0000% 1.500 / 84 = 5,6000% mais 0,6000 pp 0,8180 0,463285
mobile web social 4.000 / 200 = 5,0000% 4.000 / 212 = 5,3000% mais 0,3000 pp 0,4942 0,543827

Some tudo e o teste global é 48.000 / 2.400 contra 48.000 / 2.823, ou seja, 5,00 por cento contra 5,88 por cento. Cole esses quatro números na calculadora abaixo:

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

O resultado é mais 17,6 por cento relativo, com valor-p tão pequeno que a tela satura em “menor que 0,0001” e intervalo de confiança de mais 0,6 a mais 1,2 ponto. Levando as contas a mais casas, a diferença absoluta é de mais 0,8813 ponto percentual, o valor-p é 0,0000000018 e o intervalo vai de mais 0,5943 a mais 1,1682 ponto. Um teste sólido, sem ambiguidade.

Agora olhe a tabela por segmento de novo, ordenada por efeito bruto. Os dois primeiros lugares são os dois menores segmentos do teste. O terceiro lugar é o maior segmento do teste. Isso não é um padrão de negócio. É um padrão de aritmética.

Estimativa grande é subproduto de erro-padrão grande

Gelman, Hill e Yajima colocam o mecanismo em uma frase que vale a leitura literal: estimativas grandes são, na verdade, um subproduto de erros-padrão grandes. O argumento é geométrico, não estatístico avançado.

Duas distribuições amostrais com o mesmo efeito verdadeiro e precisões diferentesDuas curvas em forma de sino centradas no mesmo valor verdadeiro. A curva estreita representa um segmento grande e quase toda a massa dela fica perto do centro. A curva larga representa um segmento pequeno e ela espalha massa considerável para valores muito acima do centro. O topo de qualquer ranking de estimativas cruas tende a vir da curva larga, mesmo quando as duas medem exatamente o mesmo efeito.efeito verdadeiro, igual nos doissegmento grande, erro-padrão 0,26segmento pequeno, erro-padrão 0,82só a curva larga alcança esta faixao topo de um ranking de estimativas cruas é uma seleção por variância, não por desempenho.
As duas curvas medem o mesmo efeito. Só uma delas consegue produzir uma leitura de mais 2,25 pontos, e não é a precisa.

Se oito segmentos têm exatamente o mesmo efeito verdadeiro, ordená-los pela estimativa crua é ordená-los pelo ruído. O primeiro colocado é quase sempre o segmento em que o acaso teve mais espaço para trabalhar. Esse é o mesmo mecanismo por trás da maldição do vencedor e da regressão à média: quando você seleciona pelo extremo de uma leitura ruidosa, você seleciona ruído junto.

A correção clássica para isso é alargar os intervalos, com Bonferroni ou com controle da taxa de descoberta falsa. O encolhimento faz outra coisa, e Gelman, Hill e Yajima marcam o contraste com precisão: modelos multinível fazem agrupamento parcial, deslocando as estimativas umas em direção às outras, enquanto os procedimentos clássicos mantêm os centros dos intervalos parados e ajustam por múltiplas comparações tornando os intervalos mais largos. Uma abordagem mexe na barra de erro. A outra mexe no número.

A conta do encolhimento bayesiano, em três passos

O procedimento é curto e roda numa planilha.

Passo 1: a média do conjunto, ponderada pela precisão. Cada segmento entra com peso igual ao inverso do quadrado do seu erro-padrão. Nos oito segmentos acima, isso dá mais 0,8723 ponto percentual, com erro-padrão de 0,1463.

Passo 2: quanto os segmentos se espalham além do acaso. Some, para cada segmento, o quadrado da distância até essa média, dividido pela variância do segmento. Essa soma é o Q de Cochran. Se os oito medissem exatamente o mesmo efeito, Q ficaria em torno de 7, que é o número de graus de liberdade. Aqui Q vale 4,8926 com 7 graus de liberdade. Ou seja, os oito segmentos estão MENOS espalhados do que o acaso sozinho produziria.

Passo 3: a variância entre segmentos, e o fator de encolhimento. A estimativa de momentos subtrai os graus de liberdade de Q e nunca desce abaixo de zero. Com Q abaixo dos graus de liberdade, ela dá exatamente zero. E o fator de encolhimento de cada segmento é a variância entre segmentos dividida pela soma dela com a variância do próprio segmento. Com variância entre segmentos igual a zero, o fator é zero para todos os oito.

segmento efeito bruto erro-padrão fator de encolhimento efeito encolhido
aplicativo iOS mais 2,2500 pp 0,7574 0,0000 mais 0,8723 pp
aplicativo Android mais 1,0000 pp 0,6447 0,0000 mais 0,8723 pp
mobile web orgânico mais 0,9200 pp 0,2623 0,0000 mais 0,8723 pp
retorno direto mais 0,8625 pp 0,3583 0,0000 mais 0,8723 pp
desktop orgânico mais 0,8583 pp 0,2925 0,0000 mais 0,8723 pp
desktop busca paga mais 0,7333 pp 0,5818 0,0000 mais 0,8723 pp
e-mail mais 0,6000 pp 0,8180 0,0000 mais 0,8723 pp
mobile web social mais 0,3000 pp 0,4942 0,0000 mais 0,8723 pp

Não sobrou ranking. A leitura honesta desses oito segmentos é que o efeito é o mesmo em todos eles, e a melhor estimativa para cada um é a média do teste inteiro. A variação de mais 0,3000 a mais 2,2500 ponto percentual é inteiramente compatível com um único efeito subjacente medido oito vezes com precisões diferentes.

Isso não é um artifício do exemplo: é o comportamento normal de um agrupamento parcial quando não há heterogeneidade nenhuma nos dados. E é uma resposta muito mais útil do que “o iOS teve um valor-p de 0,003005, então o efeito no iOS é real e é enorme”.

Quando a heterogeneidade É real: o encolhimento bayesiano vira parcial

Troque um único segmento. Suponha que a mudança realmente prejudica o público que vem de rede social, e o mobile web social sai de 4.000 / 212 para 4.000 / 128, ou seja, de 5,3000 para 3,2000 por cento, um efeito de menos 1,8000 ponto percentual.

Com esse único segmento trocado, Q sobe de 4,8926 para 37,2859 contra os mesmos 7 graus de liberdade, e a variância entre segmentos deixa de ser zero: o desvio entre segmentos estimado passa a ser 0,8906 ponto percentual. Agora o encolhimento tem de onde puxar.

segmento efeito bruto erro-padrão fator de encolhimento efeito encolhido erro-padrão posterior
aplicativo iOS mais 2,2500 pp 0,7574 0,5802 mais 1,5725 pp 0,5802
aplicativo Android mais 1,0000 pp 0,6447 0,6562 mais 0,8748 pp 0,5246
mobile web orgânico mais 0,9200 pp 0,2623 0,9202 mais 0,8973 pp 0,2519
retorno direto mais 0,8625 pp 0,3583 0,8607 mais 0,8309 pp 0,3330
desktop orgânico mais 0,8583 pp 0,2925 0,9026 mais 0,8367 pp 0,2782
desktop busca paga mais 0,7333 pp 0,5818 0,7009 mais 0,7042 pp 0,4890
e-mail mais 0,6000 pp 0,8180 0,5424 mais 0,6165 pp 0,6061
mobile web social menos 1,8000 pp 0,4429 0,8017 menos 1,3169 pp 0,3976

Três leituras dessa tabela, e as três importam:

  1. O segmento realmente diferente sobrevive. O mobile web social sai de menos 1,8000 para menos 1,3169 ponto percentual. Encolheu, continua negativo, continua sendo o único negativo e continua sendo o achado do relatório.
  2. O falso primeiro lugar encolhe muito mais. O iOS perde 0,6775 ponto (de 2,2500 para 1,5725) porque o fator dele é 0,5802: quase metade da estimativa dele é substituída pela média do conjunto. O mobile web orgânico, com o dobro do tamanho, tem fator 0,9202 e perde apenas 0,0227 ponto.
  3. O ranking muda de ordem. Na leitura crua, o mobile web orgânico é o terceiro. Na encolhida, ele é o segundo, à frente do Android, porque a leitura dele é a que menos depende de sorte.
Efeito bruto e efeito encolhido de cada segmento no cenário com heterogeneidade realOito linhas horizontais, uma por segmento. Cada linha liga o efeito bruto ao efeito encolhido. Os segmentos pequenos, como aplicativo iOS e aplicativo Android, têm linhas longas porque foram puxados com força para a média do conjunto. Os segmentos grandes, como mobile web orgânico e desktop orgânico, têm linhas quase invisíveis. O segmento com efeito negativo real encolhe mas continua claramente abaixo de zero.zeromédia do conjunto: mais 0,6360aplicativo iOS2,2500aplicativo Android1,0000mobile web orgânico0,9200retorno direto0,8625desktop orgânico0,8583desktop busca paga0,7333e-mail0,6000mobile web socialmenos 1,8000efeito brutoencolhidoquanto mais longa a linha, menos o segmento tinha de próprio para dizer.
O comprimento de cada linha é a quantidade de informação que aquele segmento NÃO tinha. Nos dois maiores segmentos ela é quase zero.

O fator de encolhimento tem uma leitura direta: ele é a fração da estimativa que vem do próprio segmento. Fator 0,92 quer dizer que 92 por cento do número é o segmento falando e 8 por cento é o resto do teste emprestando informação. Fator 0,54 quer dizer que quase metade do número não é daquele segmento.

Fator de encolhimento por tamanho do segmentoBarras horizontais mostram o fator de encolhimento de cada segmento no cenário com heterogeneidade real, ordenadas do menor segmento para o maior. O segmento de e-mail, com mil e quinhentos visitantes por braço, fica em zero vírgula cinco quatro dois quatro. O segmento de mobile web orgânico, com quinze mil visitantes por braço, fica em zero vírgula nove dois zero dois. A barra cresce continuamente com o tamanho do segmento.quanto do número é o próprio segmento falandoe-mail, 1.5000,5424iOS, 2.0000,5802Android, 2.5000,6562busca paga, 3.0000,7009social, 4.0000,8017direto, 8.0000,8607orgânico, 12.000 e 15.0000,9202nenhum segmento chega a 1. Nenhum teste, por maior que seja, fala só por si.
O fator sobe com o tamanho e nunca chega a 1. Mesmo o maior segmento do teste empresta um pouco de informação dos outros.

O que Stein provou, e o que Efron e Morris mediram

A ideia é de 1961 e soa errada quando você a ouve pela primeira vez: para estimar três ou mais médias ao mesmo tempo, existe um estimador que erra menos, no agregado, do que usar cada média amostral por conta própria. Menos, sempre, independentemente de quais sejam os valores verdadeiros.

Efron e Morris testaram isso num caso com gabarito. Pegaram as médias de rebatida de 18 jogadores da liga principal de beisebol nas primeiras 45 tentativas oficiais da temporada de 1970, e usaram só esse pedaço para prever o desempenho de cada um no restante da temporada. O fator de encolhimento estimado foi tal que cada jogador ficou com 0,209 da sua própria média e 0,791 da média do grupo.

Os números: o erro quadrático total da média amostral crua foi 17,56 e o do estimador encolhido foi 5,01. A eficiência, que eles definem como a razão entre as duas perdas, é 3,50. E o encolhido ficou mais perto do valor verdadeiro em 15 dos 18 jogadores, errando mais em apenas 3.

Os 3 em que errou mais têm um nome que interessa: o primeiro deles é o melhor rebatedor da lista, escolhido de propósito pelos autores para testar o método com pelo menos um parâmetro extremo. Sua média crua nas 45 tentativas era 0,400, o encolhimento derrubou para 0,290 e o valor real no restante da temporada foi 0,346.

Essa é a troca inteira, em um caso. O encolhimento acerta mais no conjunto e paga por isso errando mais em quem é genuinamente excepcional. Se a sua pergunta é “qual é a melhor estimativa para cada um dos meus oito segmentos”, o encolhimento é a resposta melhor. Se a sua pergunta é “quem é o extremo verdadeiro”, ele custa caro.

Encolher não é corrigir: as duas contas fazem coisas diferentes

Vale separar bem os dois instrumentos, porque eles são frequentemente apresentados como concorrentes e resolvem problemas distintos.

correção por múltiplas comparações encolhimento bayesiano empírico
o que muda a largura do intervalo, ou o limiar do valor-p a estimativa pontual
o que preserva a estimativa pontual crua a ordem de grandeza da incerteza
pergunta que responde quantas descobertas falsas eu tolero neste conjunto qual é a melhor estimativa para cada elemento deste conjunto
depende de número de comparações feitas dispersão observada entre os elementos
efeito no relatório mais segmentos deixam de ser significativos o topo desce, o fundo sobe, a ordem muda

Gelman, Hill e Yajima vão além e argumentam que o erro I nem deveria ser o foco da preocupação, porque raramente se acredita que o efeito de um segmento seja exatamente zero. O que preocupa de verdade são os erros de sinal, chamados por eles de erro do tipo S, e os erros de magnitude, o tipo M: dizer que o efeito é grande quando ele é próximo de zero. Estudos com pouco poder são especialmente vulneráveis ao tipo M, porque incerteza alta produz estimativas grandes.

Isso descreve com exatidão o segmento de 1.500 visitantes por braço no relatório do começo deste guia.

E existe um contraponto honesto, que o encolhimento não dispensa. Heterogeneidade real acontece, e ignorá-la custa caro. Dmitriev, Gupta, Kim e Vaz relatam um experimento no Bing que parecia bem sucedido, aumentando receita em 2,3 por cento e reduzindo o número de anúncios por página em 0,6 por cento. Segmentando por tipo de página, o número de anúncios por página caiu drasticamente, 2,3 por cento, nas páginas recarregadas, e na verdade AUMENTOU 0,3 por cento nas páginas originais, que eram as que importavam. A conclusão do time foi que o experimento não havia cumprido o objetivo. A lição que eles tiram é para evitar a armadilha de assumir que o efeito é homogêneo entre todos os usuários e consultas.

As duas coisas são verdadeiras ao mesmo tempo: olhar segmento é obrigatório, e acreditar no ranking cru dos segmentos é ingênuo. O encolhimento é justamente o que permite fazer a primeira coisa sem cometer a segunda.

Como aplicar isso na prática

  1. Declare os segmentos no plano de análise, antes de rodar. Encolhimento não conserta segmento pescado depois de ver os dados; ele só torna honesta a leitura de um conjunto definido de antemão.
  2. Reporte sempre as duas colunas. Bruto e encolhido, lado a lado, com o erro-padrão de cada segmento visível. Esconder o bruto gera desconfiança e esconder o encolhido gera decisão errada.
  3. Publique o Q e os graus de liberdade. É o número que responde “existe heterogeneidade aqui?” antes de qualquer discussão sobre qual segmento ganhou.
  4. Não interprete o fator de encolhimento como nota do segmento. Ele mede tamanho de amostra, não qualidade do público.
  5. Trate um segmento genuinamente negativo como achado, não como ruído. No cenário B, menos 1,3169 ponto percentual depois de encolhido continua sendo motivo para investigar antes de lançar.
  6. Se um segmento merece decisão própria, ele merece teste próprio. Um efeito de 0,9 ponto sobre uma base de 5 por cento é um efeito relativo de 18 por cento, o que exige cerca de 9.986 visitantes por variação para ser detectado com 80 por cento de poder. O segmento de e-mail, com 3.000 visitantes por semana, levaria 47 dias para chegar lá sozinho. Confira o seu caso na calculadora de tamanho de amostra.
  7. Quando a pergunta for sobre vários testes em vez de vários segmentos, o instrumento é o mesmo com outro nome: veja meta-análise de testes A/B.

Erros comuns

Faça isso automático na Donnu

Para encolher um conjunto de segmentos você precisa de duas coisas por segmento: o efeito estimado e o erro-padrão dele. Parece trivial e é onde a maioria dos relatórios trava, porque o corte por segmento costuma ser reconstruído depois, no painel de análise, a partir de atributos do usuário no estado ATUAL e não no estado em que ele estava quando entrou no teste.

Quando o atributo mudou depois da atribuição, o segmento deixa de ser um recorte pré-experimento e vira consequência do experimento, e a conta inteira deste artigo perde o sentido. A Donnu carimba o estado do usuário no instante da atribuição, o que deixa cada corte com a definição congelada no momento certo e com o erro-padrão calculado sobre a amostra correta.

O restante é aritmética de planilha, e este guia tem todos os passos. A calculadora de significância fecha a leitura bruta de cada segmento, que continua sendo o insumo do qual todo o resto sai.

Referências

Leia também: Efeito heterogêneo por segmento · Meta-análise de testes A/B · Maldição do vencedor · Muitas métricas, um teste · Modelagem de uplift · Calculadora de significância · Read in English

Perguntas frequentes

O que é encolhimento bayesiano empírico num teste A/B?
É puxar a estimativa de cada segmento em direção à média de todos os segmentos, com força proporcional ao ruído daquele segmento. Segmento pequeno, com erro-padrão grande, é puxado quase até a média. Segmento grande, com erro-padrão pequeno, quase não se move. O resultado é um conjunto de estimativas que erra menos no agregado do que a leitura crua de cada segmento isolado.
Por que o segmento com o maior efeito costuma ser o menor?
Porque estimativas grandes são um subproduto de erros-padrão grandes. Gelman, Hill e Yajima descrevem exatamente esse mecanismo: um estimador com desvio maior tem probabilidade muito maior de produzir uma estimativa grande em módulo do que um estimador preciso, mesmo quando o efeito verdadeiro é zero nos dois casos. No exemplo deste guia, o segmento de 2.000 visitantes por braço lidera o ranking com mais 2,2500 pontos percentuais, e o encolhimento derruba esse número para a média de mais 0,8723 ponto.
Qual é a diferença entre encolher e corrigir por múltiplas comparações?
A correção clássica, como Bonferroni, mantém a estimativa pontual parada e alarga o intervalo. O encolhimento move a estimativa pontual em direção às outras e não precisa alargar nada. Gelman, Hill e Yajima resumem assim: modelos multinível fazem agrupamento parcial deslocando as estimativas umas em direção às outras, enquanto os procedimentos clássicos mantêm os centros dos intervalos parados e ajustam por múltiplas comparações tornando os intervalos mais largos.
Encolhimento não apaga um segmento que é realmente diferente?
Não, e a conta mostra por quê. Quando existe heterogeneidade real, a variância entre segmentos estimada sobe e o fator de encolhimento cai menos. No cenário B deste guia, um segmento com efeito verdadeiro negativo sai de menos 1,8000 para menos 1,3169 ponto percentual, continua sendo o pior do conjunto por larga margem e continua com sinal negativo. O que o encolhimento apaga é a diferença que só o acaso produziu.
Quanto o encolhimento realmente ganha?
Efron e Morris mediram isso num caso com resposta conhecida: 18 jogadores de beisebol, 45 rebatidas cada. O erro quadrático total da média amostral foi 17,56 e o do estimador de James e Stein foi 5,01, uma eficiência de 3,50. O estimador encolhido ficou mais perto do valor verdadeiro em 15 dos 18 jogadores, e errou mais em 3.
Quando NÃO devo encolher?
Quando a distribuição de efeitos tem cauda pesada e você está justamente atrás dos extremos. Azevedo, Deng, Montiel Olea, Rao e Weyl estimaram no Bing um coeficiente de cauda bem abaixo de 3 e concluem que ideias com estatística pequena devem ser encolhidas agressivamente, enquanto ideias muito fora da curva provavelmente são reais. Encolhimento com premissa normal aplica a mesma força aos dois casos, e é aí que ele erra.