Estatística

Conversões Modeladas: quando a métrica é uma estimativa

Conversões modeladas diluem o teste A/B: por que um modelo cego à sua variação encolhe o lift medido, quanto isso custa em poder e o que medir no lugar.

Ilustração plana de um cilindro de vidro cheio de esferas, a maioria sólida e opaca e o restante translúcido e fantasmagórico, sobre fundo verde menta

Uma conversão modelada é uma conversão que a plataforma não viu e estimou no lugar. Não é erro de arredondamento: é uma fatia crescente dos números dos seus relatórios, e tem um efeito específico e previsível sobre experimentos. O modelo que preenche a lacuna foi construído para responder “uma interação com anúncio levou a uma conversão”, não “qual variação da sua página esta pessoa viu”. O seu braço de experimento é uma variável que só você conhece. Então a parte modelada das suas conversões cai nos dois braços em proporção aproximadamente igual, não carrega informação sobre a diferença entre eles e puxa o seu lift medido em direção ao zero por uma quantidade que você consegue calcular exatamente. Este guia cobre de onde vem a modelagem, por que a diluição é aritmética e não defeito do modelo, um exemplo trabalhado em que um lift verdadeiro de 11,98 por cento lê como 6,42 por cento, quanto isso custa em tamanho de amostra e o hábito de reconciliação que transforma uma divergência de relatório num intervalo de confiança fabricado. Este guia faz parte do nosso guia completo de teste A/B.

De onde vêm as conversões modeladas

O Google Ads é explícito na definição: conversões modeladas usam dados que não identificam usuários individuais para estimar conversões que o Google não consegue observar diretamente. A documentação descreve várias situações que acionam isso; estas quatro são as que mais aparecem num experimento.

gatilho o que está faltando o que o modelo usa no lugar
entre dispositivos a interação com o anúncio e a conversão aconteceram em aparelhos diferentes comportamento do grande número de usuários logados nas propriedades do Google, extrapolado para jornadas semelhantes
iOS e App Tracking Transparency o elo entre anúncio e desfecho no tráfego afetado padrões agregados, já que o elo por usuário não existe
consentimento a conversão de quem recusou o armazenamento de analytics ou de anúncios a relação observada entre usuários que consentem e que não consentem
entre navegadores a medição em navegadores que bloqueiam cookies de terceiros a mesma extrapolação agregada

Para o consent mode especificamente, a régua de elegibilidade é pública: implementação correta do consent mode ou do IAB Transparency and Consent Framework, e um limiar diário de 700 cliques em anúncio ao longo de 7 dias, por agrupamento de país e domínio. Abaixo disso, o Google não reporta conversão modelada nenhuma para aquele agrupamento.

Mais dois fatos documentados enquadram tudo o que vem a seguir.

Primeiro, as conversões modeladas aparecem na coluna de Conversões e se refletem em todos os relatórios derivados que usam esse dado, com a mesma granularidade das observadas. Não existe coluna separada para excluir. Se você puxa conversões da plataforma, você está puxando uma mistura.

Segundo, e este é o que mais importa para experimentos: quem consente tem tipicamente de 2 a 5 vezes mais chance de converter do que quem não consente, segundo a própria documentação de consent mode do Google. As pessoas que caem no balde modelado não são uma amostra aleatória do seu tráfego. A ilustração do próprio Google é reveladora na outra direção também: um anunciante com taxa de consentimento de 50 por cento viu apenas 18 por cento de aumento de conversão vindo da modelagem, justamente porque a metade não consentida converte muito menos.

Como um total de conversões reportado é montado a partir de partes observadas e modeladasUma barra larga única representando o total de conversões reportado, dividida em dois segmentos. O segmento maior, à esquerda, é rotulado como observado, significando conversões que a plataforma mediu diretamente e que carregam a identidade necessária para atribuí-las a um braço de experimento. O segmento menor, à direita, é rotulado como modelado, significando conversões estimadas a partir de padrões agregados sem identificar usuários individuais. Abaixo da barra, duas notas registram que o segmento observado pode ser quebrado por variação e o modelado não, porque o modelo não tem conhecimento do braço do experimento.a coluna de Conversões é uma mistura, e só uma metade pode ser quebrada por variaçãoobservadomodeladomedido direto, com identidade anexadaestimado a partir de agregadosdá para quebrar por braço do experimentocada evento carrega a variação que você atribuiunão dá para quebraro modelo nunca viu o seu braçopor isso os números por variação não vão somar o total reportadoessa diferença é esperada, e tentar fechá-la dentro do teste é onde o estrago acontece
Conversões observadas e modeladas chegam na mesma coluna. Só a metade observada carrega a identidade por usuário que permite atribuir um desfecho à variação que você sorteou.

A sua variação é uma variável que o modelo nunca ouviu falar

Este é o argumento inteiro, e ele é mais simples do que parece.

Quando você roda um teste A/B no seu próprio site, é você quem decide qual variação cada visitante vê. Esse sorteio vive no seu código, no seu cookie, na sua camada de dados. Não é um sinal que o Google tem, não é uma feature do modelo do Google, e não existe mecanismo pelo qual uma extrapolação agregada sobre comportamento de gente logada pudesse recuperá-lo.

Então, quando o modelo imputa um bloco de conversões, esse bloco é alocado pelos sinais que o modelo de fato tem: dispositivo, navegador, geografia, horário, campanha. Nenhum deles se correlaciona com o seu sorteio de variação, justamente porque você sorteou. O sorteio, que normalmente protege você, aqui garante que o bloco modelado se divide por igual entre os seus braços.

Uma divisão igual entre braços é exatamente um efeito nulo. Misture um efeito nulo com um efeito real e você obtém um efeito menor.

Repare no limite importante: se o seu experimento é implementado dentro da plataforma de anúncios, como duas campanhas ou dois grupos de anúncios, então a modelagem acontece por campanha e o bloco modelado carrega alguma informação de braço. É outra situação, com problemas próprios, coberta em teste A/B na plataforma de anúncios. Este guia trata do caso bem mais comum: você sorteia no seu site e lê conversões de uma plataforma ou ferramenta de analytics que modela.

Por que um bloco modelado cego à variação encolhe o lift medidoDuas colunas representando o braço A e o braço B. Na fileira de cima, as conversões observadas diferem entre os braços, com o braço B mais alto que o A, e a diferença é rotulada como o efeito real. Na fileira de baixo, um bloco modelado idêntico é somado ao topo de cada braço, desenhado com a mesma altura nos dois. As barras combinadas ficam mais altas, mas a distância entre elas continua igual em termos absolutos enquanto as bases cresceram, então a diferença relativa fica menor. Uma nota registra que a diferença absoluta sobrevive e o lift relativo é diluído.o bloco modelado soma a mesma quantidade nos dois braçosa distância fica; as bases crescem; a razão encolhesó observadoABo efeito realcomo reportado, com modelagemABmesma distânciasobre base mais altabloco tracejado = modelado, idêntico nos dois braçosa diferença absoluta sobrevive, o lift relativo é diluído
Um bloco modelado que não carrega informação de braço se comporta como uma constante somada aos dois lados. A diferença absoluta entre braços é preservada; o lift relativo, que divide pela base, não é.

A diluição é exata, e você consegue calculá-la

Suponha que o braço de controle tenha cA conversões observadas e o braço variante tenha cB, com tráfego igual. O bloco modelado de tamanho M se divide por igual, somando h = M / 2 a cada braço. O lift relativo reportado fica:

lift relativo reportado = (cB + h menos cA menos h) dividido por (cA + h), que é (cB menos cA) dividido por (cA + h).

O lift relativo verdadeiro é (cB menos cA) dividido por cA. Portanto o fator de atenuação é exatamente cA dividido por (cA + h): a fração observada das conversões reportadas do braço de controle. Sem aproximação, sem suposição sobre a acurácia do modelo. Um modelo perfeitamente acurado que não conhece a sua variação produz exatamente essa diluição.

Veja essa aritmética em números reais. Um site roda um teste com 27.440 visitantes por braço. As conversões observadas são 384 no braço de controle e 430 no braço variante.

A comparação honesta, só com dado observado: 1,3994 por cento contra 1,5671 por cento. Lift relativo de mais 11,98 por cento, diferença absoluta de mais 0,1676 ponto percentual, intervalo de 95 por cento de menos 0,0346 a mais 0,3699 ponto percentual, p-valor 0,1043. Promissor, ainda não resolvido.

Agora some um bloco modelado que se divide por igual e leia o mesmo experimento pela coluna reportada:

fatia modelada das conversões reportadas controle reportado variante reportado lift relativo reportado fator de atenuação p-valor no reportado
0 por cento, só observado 384 430 mais 11,98 por cento 1,0000 0,1043
15 por cento 456 502 mais 10,09 por cento 0,8421 0,1338
30 por cento 558,5 604,5 mais 8,24 por cento 0,6876 0,1728
45 por cento 717 763 mais 6,42 por cento 0,5356 0,2254

Leia a última coluna com atenção. O p-valor sobe conforme a modelagem cresce, de 0,1043 para 0,2254. Isso não é o teste ficando conservador de um jeito útil. É a mesma diferença real sendo reportada como evidência mais fraca, porque metade do denominador é ruído que não tem como diferir entre braços.

Cole a primeira linha na calculadora para reproduzir o resultado só com dado observado:

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Um esclarecimento, porque isso muda como você lê os seus próprios números: esta é uma afirmação sobre o lift relativo. A diferença absoluta de conversões entre braços é preservada pela divisão igual, porque a mesma quantidade é somada aos dois lados. Se você reporta diferenças absolutas com os intervalos delas em vez de lift percentual, fica bem menos exposto a esse efeito. É mais um argumento para o hábito que recomendamos o tempo todo: reporte o efeito absoluto com o intervalo, e trate o número relativo como enfeite.

Quanto a atenuação custa em tamanho de amostra

O tamanho de amostra escala aproximadamente com o inverso do quadrado do efeito que você quer detectar. Encolher o efeito medido, portanto, não custa um pouco de poder, custa muito.

Tome uma taxa de conversão de base de 1,4 por cento e um lift relativo verdadeiro de 12 por cento, a 95 por cento de confiança e 80 por cento de poder:

o que você está de fato detectando efeito depois da atenuação visitantes por braço múltiplo da exigência honesta
efeito verdadeiro, dado observado 12,0 por cento 81.312 1,00
15 por cento modelado 10,2 por cento 111.602 1,37
30 por cento modelado 8,4 por cento 163.168 2,01
45 por cento modelado 6,6 por cento 262.056 3,22

Com 30 por cento de conversões modeladas você precisa do dobro do tráfego para chegar à mesma conclusão. Com 45 por cento, de mais que o triplo. Nada mudou no seu site, na sua hipótese ou nos seus visitantes; você simplesmente escolheu ler o resultado numa coluna que contém um modelo.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

A armadilha da reconciliação

Aqui está a sequência que destrói uma análise, e ela acontece em times bem organizados porque parece zelo.

Um analista percebe que as contagens de conversão por variação não somam o total da plataforma. Ele está certo de que os números divergem, e está certo sobre o motivo: o Google declara que os dados modelados não estão disponíveis em Públicos, nas explorações de usuário, de coorte e de tempo de vida, em segmentos com sequência, em relatórios de retenção, em métricas preditivas nem na exportação de dados, como a exportação para o BigQuery. O seu braço de experimento é uma dimensão no escopo do usuário. Então o número de topo é modelado e a quebra por variação não é.

Aí o analista “conserta” escalando os dois braços para cima até que a soma bata com o total reportado. E é esse o estrago.

Escalar os dois braços por um fator comum k deixa o lift relativo intocado, porque a razão não muda. Mas multiplica as contagens de conversão que entram no cálculo da variância. O erro padrão de uma proporção encolhe com a raiz quadrada das contagens, então inflar as contagens por k encolhe o erro padrão por aproximadamente a raiz de k, e o p-valor cai junto. Você fica com a mesma estimativa pontual e um intervalo de confiança que não conquistou.

O que escalar contagens por variação para bater com um total modelado faz com o intervalo de confiançaDuas barras de intervalo horizontais em torno da mesma estimativa pontual. A barra de cima, rotulada como honesta, é calculada a partir das contagens observadas e é larga o bastante para cruzar o zero. A barra de baixo, rotulada como depois de escalar para bater com o total modelado, está centrada na estimativa pontual idêntica, mas é visivelmente mais estreita e já não cruza o zero. Uma nota registra que a estimativa pontual não se moveu, só a largura mudou, e que o estreitamento é artefato de inflar as contagens, e não de ter coletado mais evidência.escalar as contagens não acrescenta evidência, só estreita o intervalozerohonestocontagens observadascruza o zero: não resolvidodepois de escalarcontagens infladas até bater o totalagora passa do zero, sem dado novoestimativa pontual idêntica nas duas linhasreconcilie totais no relatório, nunca dentro do teste estatístico
A estimativa pontual não muda com a escala, e por isso a prática parece inofensiva. O intervalo muda, e é o intervalo que decide se você sobe a mudança.

A regra é curta: reconcilie totais na camada de relatório, nunca dentro do teste estatístico. O teste roda sobre eventos que você observou e atribuiu a um braço. O número do financeiro pode ser o modelado. Eles respondem a perguntas diferentes e têm o direito de divergir.

O que medir no lugar

decisão fonte errada fonte certa por quê
qual variação venceu coluna de Conversões da plataforma seus próprios eventos observados, com o braço anexado o modelo não enxerga o braço
quanta receita a campanha gerou só observado total misturado da plataforma a parte modelada é uma tentativa real de cobrir o desfecho que faltou
nível de taxa de conversão para planejamento só observado misturado, declarado como misturado só observado subestima o nível, porque quem consente converte mais
qual lift você conseguiria detectar o efeito verdadeiro que você espera o efeito atenuado que você mediria senão você dimensiona o teste para uma sensibilidade que não tem
se um efeito é real lift relativo diferença absoluta com o intervalo a diferença absoluta sobrevive a uma divisão modelada igual

A objeção a usar dado só observado para a decisão é boa e merece resposta: dado observado é enviesado, porque quem consente converte de 2 a 5 vezes mais do que quem não consente. É verdade, e importa para o nível. Importa bem menos para a comparação, porque esse viés se aplica aos dois braços e em boa parte se cancela na diferença. O lugar onde ele não se cancela é quando as próprias taxas de consentimento diferem entre braços, o que acontece se a sua variação mexe no banner de consentimento ou no momento em que ele aparece. Esse é um modo de falha real e específico, tem nome, e cobrimos em perda de rastreamento por consentimento e bloqueador: acompanhe a taxa de consentimento como métrica de guarda, exatamente como você acompanha desequilíbrio de amostra.

O movimento complementar é reduzir quanto precisa ser modelado, para começo de conversa: medição server-side do evento de conversão, um identificador de dados first-party que sobrevive às restrições de terceiros do navegador, e um evento de conversão que seja seu, em vez de um que você infere de um pixel de plataforma.

Erros comuns

Faça isso automático na Donnu

A solução não é estatística engenhosa. É ser dono do evento. Uma decisão de experimento deve rodar sobre desfechos que você observou, atribuídos ao braço que você sorteou, no seu próprio repositório, com o efeito absoluto e o intervalo dele reportados ao lado.

Na Donnu o sorteio e o evento de conversão vivem no mesmo lugar, então toda conversão contada carrega a variação que a produziu e nada precisa ser imputado para saber a que braço ela pertence. A taxa de consentimento fica ao lado da razão de amostra como métrica de guarda, então uma variação que mexe no banner aparece como alerta em vez de virar lift. E o resultado é reportado como diferença absoluta com o intervalo, que é a forma que sobrevive a uma divisão modelada igual. A Donnu é uma opção entre várias; o que importa é a separação: guarde o total modelado para a conversa de orçamento e mantenha o experimento sobre eventos observados e atribuíveis ao braço.

Perguntas frequentes

As perguntas no topo desta página cobrem o que são conversões modeladas, se elas quebram o seu teste, quanto encolhem o lift medido, por que escalar as contagens é o conserto errado, por que a sua quebra por variação não é modelada e em qual número rodar a decisão.

Referências

Leia também: Perda de rastreamento por consentimento e bloqueador · Dados first-party e teste A/B · Desequilíbrio de amostra · GA4 e teste A/B · Teste A/B na plataforma de anúncios · Análise por gatilho e diluição · Read in English

Perguntas frequentes

O que são conversões modeladas?
São conversões que a plataforma não observou e estimou no lugar. O Google Ads declara que conversões modeladas usam dados que não identificam usuários individuais para estimar conversões que o Google não consegue observar diretamente, e que elas aparecem na coluna de Conversões junto das observadas. A modelagem é acionada por jornadas entre dispositivos, navegadores que bloqueiam medição de terceiros, tráfego afetado pelo App Tracking Transparency e usuários que recusaram consentimento.
Conversão modelada quebra o meu teste A/B?
Ela não quebra o sorteio, ela dilui a medição. Se uma parte das conversões reportadas vem de um modelo que não faz ideia de qual variação cada pessoa viu, essa parte não carrega informação nenhuma sobre a diferença entre os seus braços. Ela cai nos dois braços em proporção aproximadamente igual e encolhe o lift relativo medido em direção ao zero. O sorteio continua válido; a estimativa é que fica atenuada.
Quanto a modelagem encolhe o meu lift medido?
O fator de atenuação é exatamente a fração observada das conversões reportadas do braço de controle. No exemplo trabalhado deste guia, um lift relativo verdadeiro de 11,98 por cento lê como 10,09 por cento quando 15 por cento das conversões são modeladas, 8,24 por cento a 30 por cento modeladas e 6,42 por cento a 45 por cento modeladas. A aritmética é exata e não depende de o modelo estar errado: um modelo perfeitamente acurado que não enxerga a sua variação dilui a comparação do mesmo jeito.
Posso só escalar os números por variação para bater com o total reportado?
Não, e esse é o conserto mais comum que piora tudo. Escalar os dois braços pelo mesmo fator deixa o lift relativo intacto, mas multiplica as contagens de conversão, o que encolhe o erro padrão e faz um resultado não significante parecer significante. Você termina com a mesma estimativa pontual e um intervalo de confiança fabricado. Se precisar reconciliar os totais, reconcilie no relatório, nunca dentro do teste estatístico.
A minha quebra por variação é modelada?
Em geral não, e é daí que vem quase toda a confusão. O Google declara que os dados de modelagem comportamental não estão disponíveis em Públicos, nas explorações de usuário, de coorte e de tempo de vida, em segmentos com sequência, em relatórios de retenção, em métricas preditivas nem na exportação de dados, como a exportação para o BigQuery. O seu braço de experimento é uma dimensão no escopo do usuário, então o número de topo dos seus relatórios pode incluir dados modelados enquanto a quebra por variação não inclui. Os dois não vão fechar, e isso é o esperado.
Em qual número eu devo rodar o teste?
No número observado, saído da sua própria medição, com a variação anexada a cada evento. Ele é menor e é enviesado como nível, porque quem consente converte diferente de quem não consente, mas o viés atinge os dois braços e em boa parte se cancela na comparação. Use o total da plataforma para orçamento e relatório; use eventos observados e atribuíveis à variação para a decisão do experimento, e declare qual é qual.