Conversões Modeladas: quando a métrica é uma estimativa
Conversões modeladas diluem o teste A/B: por que um modelo cego à sua variação encolhe o lift medido, quanto isso custa em poder e o que medir no lugar.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Uma conversão modelada é uma conversão que a plataforma não viu e estimou no lugar. Não é erro de arredondamento: é uma fatia crescente dos números dos seus relatórios, e tem um efeito específico e previsível sobre experimentos. O modelo que preenche a lacuna foi construído para responder “uma interação com anúncio levou a uma conversão”, não “qual variação da sua página esta pessoa viu”. O seu braço de experimento é uma variável que só você conhece. Então a parte modelada das suas conversões cai nos dois braços em proporção aproximadamente igual, não carrega informação sobre a diferença entre eles e puxa o seu lift medido em direção ao zero por uma quantidade que você consegue calcular exatamente. Este guia cobre de onde vem a modelagem, por que a diluição é aritmética e não defeito do modelo, um exemplo trabalhado em que um lift verdadeiro de 11,98 por cento lê como 6,42 por cento, quanto isso custa em tamanho de amostra e o hábito de reconciliação que transforma uma divergência de relatório num intervalo de confiança fabricado. Este guia faz parte do nosso guia completo de teste A/B.
De onde vêm as conversões modeladas
O Google Ads é explícito na definição: conversões modeladas usam dados que não identificam usuários individuais para estimar conversões que o Google não consegue observar diretamente. A documentação descreve várias situações que acionam isso; estas quatro são as que mais aparecem num experimento.
| gatilho | o que está faltando | o que o modelo usa no lugar |
|---|---|---|
| entre dispositivos | a interação com o anúncio e a conversão aconteceram em aparelhos diferentes | comportamento do grande número de usuários logados nas propriedades do Google, extrapolado para jornadas semelhantes |
| iOS e App Tracking Transparency | o elo entre anúncio e desfecho no tráfego afetado | padrões agregados, já que o elo por usuário não existe |
| consentimento | a conversão de quem recusou o armazenamento de analytics ou de anúncios | a relação observada entre usuários que consentem e que não consentem |
| entre navegadores | a medição em navegadores que bloqueiam cookies de terceiros | a mesma extrapolação agregada |
Para o consent mode especificamente, a régua de elegibilidade é pública: implementação correta do consent mode ou do IAB Transparency and Consent Framework, e um limiar diário de 700 cliques em anúncio ao longo de 7 dias, por agrupamento de país e domínio. Abaixo disso, o Google não reporta conversão modelada nenhuma para aquele agrupamento.
Mais dois fatos documentados enquadram tudo o que vem a seguir.
Primeiro, as conversões modeladas aparecem na coluna de Conversões e se refletem em todos os relatórios derivados que usam esse dado, com a mesma granularidade das observadas. Não existe coluna separada para excluir. Se você puxa conversões da plataforma, você está puxando uma mistura.
Segundo, e este é o que mais importa para experimentos: quem consente tem tipicamente de 2 a 5 vezes mais chance de converter do que quem não consente, segundo a própria documentação de consent mode do Google. As pessoas que caem no balde modelado não são uma amostra aleatória do seu tráfego. A ilustração do próprio Google é reveladora na outra direção também: um anunciante com taxa de consentimento de 50 por cento viu apenas 18 por cento de aumento de conversão vindo da modelagem, justamente porque a metade não consentida converte muito menos.
A sua variação é uma variável que o modelo nunca ouviu falar
Este é o argumento inteiro, e ele é mais simples do que parece.
Quando você roda um teste A/B no seu próprio site, é você quem decide qual variação cada visitante vê. Esse sorteio vive no seu código, no seu cookie, na sua camada de dados. Não é um sinal que o Google tem, não é uma feature do modelo do Google, e não existe mecanismo pelo qual uma extrapolação agregada sobre comportamento de gente logada pudesse recuperá-lo.
Então, quando o modelo imputa um bloco de conversões, esse bloco é alocado pelos sinais que o modelo de fato tem: dispositivo, navegador, geografia, horário, campanha. Nenhum deles se correlaciona com o seu sorteio de variação, justamente porque você sorteou. O sorteio, que normalmente protege você, aqui garante que o bloco modelado se divide por igual entre os seus braços.
Uma divisão igual entre braços é exatamente um efeito nulo. Misture um efeito nulo com um efeito real e você obtém um efeito menor.
Repare no limite importante: se o seu experimento é implementado dentro da plataforma de anúncios, como duas campanhas ou dois grupos de anúncios, então a modelagem acontece por campanha e o bloco modelado carrega alguma informação de braço. É outra situação, com problemas próprios, coberta em teste A/B na plataforma de anúncios. Este guia trata do caso bem mais comum: você sorteia no seu site e lê conversões de uma plataforma ou ferramenta de analytics que modela.
A diluição é exata, e você consegue calculá-la
Suponha que o braço de controle tenha cA conversões observadas e o braço variante tenha cB, com tráfego igual. O bloco modelado de tamanho M se divide por igual, somando h = M / 2 a cada braço. O lift relativo reportado fica:
lift relativo reportado = (cB + h menos cA menos h) dividido por (cA + h), que é (cB menos cA) dividido por (cA + h).
O lift relativo verdadeiro é (cB menos cA) dividido por cA. Portanto o fator de atenuação é exatamente cA dividido por (cA + h): a fração observada das conversões reportadas do braço de controle. Sem aproximação, sem suposição sobre a acurácia do modelo. Um modelo perfeitamente acurado que não conhece a sua variação produz exatamente essa diluição.
Veja essa aritmética em números reais. Um site roda um teste com 27.440 visitantes por braço. As conversões observadas são 384 no braço de controle e 430 no braço variante.
A comparação honesta, só com dado observado: 1,3994 por cento contra 1,5671 por cento. Lift relativo de mais 11,98 por cento, diferença absoluta de mais 0,1676 ponto percentual, intervalo de 95 por cento de menos 0,0346 a mais 0,3699 ponto percentual, p-valor 0,1043. Promissor, ainda não resolvido.
Agora some um bloco modelado que se divide por igual e leia o mesmo experimento pela coluna reportada:
| fatia modelada das conversões reportadas | controle reportado | variante reportado | lift relativo reportado | fator de atenuação | p-valor no reportado |
|---|---|---|---|---|---|
| 0 por cento, só observado | 384 | 430 | mais 11,98 por cento | 1,0000 | 0,1043 |
| 15 por cento | 456 | 502 | mais 10,09 por cento | 0,8421 | 0,1338 |
| 30 por cento | 558,5 | 604,5 | mais 8,24 por cento | 0,6876 | 0,1728 |
| 45 por cento | 717 | 763 | mais 6,42 por cento | 0,5356 | 0,2254 |
Leia a última coluna com atenção. O p-valor sobe conforme a modelagem cresce, de 0,1043 para 0,2254. Isso não é o teste ficando conservador de um jeito útil. É a mesma diferença real sendo reportada como evidência mais fraca, porque metade do denominador é ruído que não tem como diferir entre braços.
Cole a primeira linha na calculadora para reproduzir o resultado só com dado observado:
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Um esclarecimento, porque isso muda como você lê os seus próprios números: esta é uma afirmação sobre o lift relativo. A diferença absoluta de conversões entre braços é preservada pela divisão igual, porque a mesma quantidade é somada aos dois lados. Se você reporta diferenças absolutas com os intervalos delas em vez de lift percentual, fica bem menos exposto a esse efeito. É mais um argumento para o hábito que recomendamos o tempo todo: reporte o efeito absoluto com o intervalo, e trate o número relativo como enfeite.
Quanto a atenuação custa em tamanho de amostra
O tamanho de amostra escala aproximadamente com o inverso do quadrado do efeito que você quer detectar. Encolher o efeito medido, portanto, não custa um pouco de poder, custa muito.
Tome uma taxa de conversão de base de 1,4 por cento e um lift relativo verdadeiro de 12 por cento, a 95 por cento de confiança e 80 por cento de poder:
| o que você está de fato detectando | efeito depois da atenuação | visitantes por braço | múltiplo da exigência honesta |
|---|---|---|---|
| efeito verdadeiro, dado observado | 12,0 por cento | 81.312 | 1,00 |
| 15 por cento modelado | 10,2 por cento | 111.602 | 1,37 |
| 30 por cento modelado | 8,4 por cento | 163.168 | 2,01 |
| 45 por cento modelado | 6,6 por cento | 262.056 | 3,22 |
Com 30 por cento de conversões modeladas você precisa do dobro do tráfego para chegar à mesma conclusão. Com 45 por cento, de mais que o triplo. Nada mudou no seu site, na sua hipótese ou nos seus visitantes; você simplesmente escolheu ler o resultado numa coluna que contém um modelo.
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
A armadilha da reconciliação
Aqui está a sequência que destrói uma análise, e ela acontece em times bem organizados porque parece zelo.
Um analista percebe que as contagens de conversão por variação não somam o total da plataforma. Ele está certo de que os números divergem, e está certo sobre o motivo: o Google declara que os dados modelados não estão disponíveis em Públicos, nas explorações de usuário, de coorte e de tempo de vida, em segmentos com sequência, em relatórios de retenção, em métricas preditivas nem na exportação de dados, como a exportação para o BigQuery. O seu braço de experimento é uma dimensão no escopo do usuário. Então o número de topo é modelado e a quebra por variação não é.
Aí o analista “conserta” escalando os dois braços para cima até que a soma bata com o total reportado. E é esse o estrago.
Escalar os dois braços por um fator comum k deixa o lift relativo intocado, porque a razão não muda. Mas multiplica as contagens de conversão que entram no cálculo da variância. O erro padrão de uma proporção encolhe com a raiz quadrada das contagens, então inflar as contagens por k encolhe o erro padrão por aproximadamente a raiz de k, e o p-valor cai junto. Você fica com a mesma estimativa pontual e um intervalo de confiança que não conquistou.
A regra é curta: reconcilie totais na camada de relatório, nunca dentro do teste estatístico. O teste roda sobre eventos que você observou e atribuiu a um braço. O número do financeiro pode ser o modelado. Eles respondem a perguntas diferentes e têm o direito de divergir.
O que medir no lugar
| decisão | fonte errada | fonte certa | por quê |
|---|---|---|---|
| qual variação venceu | coluna de Conversões da plataforma | seus próprios eventos observados, com o braço anexado | o modelo não enxerga o braço |
| quanta receita a campanha gerou | só observado | total misturado da plataforma | a parte modelada é uma tentativa real de cobrir o desfecho que faltou |
| nível de taxa de conversão para planejamento | só observado | misturado, declarado como misturado | só observado subestima o nível, porque quem consente converte mais |
| qual lift você conseguiria detectar | o efeito verdadeiro que você espera | o efeito atenuado que você mediria | senão você dimensiona o teste para uma sensibilidade que não tem |
| se um efeito é real | lift relativo | diferença absoluta com o intervalo | a diferença absoluta sobrevive a uma divisão modelada igual |
A objeção a usar dado só observado para a decisão é boa e merece resposta: dado observado é enviesado, porque quem consente converte de 2 a 5 vezes mais do que quem não consente. É verdade, e importa para o nível. Importa bem menos para a comparação, porque esse viés se aplica aos dois braços e em boa parte se cancela na diferença. O lugar onde ele não se cancela é quando as próprias taxas de consentimento diferem entre braços, o que acontece se a sua variação mexe no banner de consentimento ou no momento em que ele aparece. Esse é um modo de falha real e específico, tem nome, e cobrimos em perda de rastreamento por consentimento e bloqueador: acompanhe a taxa de consentimento como métrica de guarda, exatamente como você acompanha desequilíbrio de amostra.
O movimento complementar é reduzir quanto precisa ser modelado, para começo de conversa: medição server-side do evento de conversão, um identificador de dados first-party que sobrevive às restrições de terceiros do navegador, e um evento de conversão que seja seu, em vez de um que você infere de um pixel de plataforma.
Erros comuns
- Rodar o teste de significância na coluna de Conversões da plataforma. Ela contém um modelo cego à sua variação. O resultado sai atenuado por um fator que você consegue calcular e não pretendia.
- Escalar contagens por variação para bater com um total modelado. Mesma estimativa pontual, intervalo fabricado. É o hábito mais destrutivo deste guia.
- Tratar a diferença por variação como bug de rastreamento. É comportamento documentado: dado modelado não está disponível em públicos, segmentos com sequência, explorações no nível do usuário nem exportação de dados.
- Dimensionar o teste para o efeito verdadeiro. Você vai medir o atenuado. Com 30 por cento modelado, é preciso aproximadamente o dobro do tráfego.
- Reportar só lift relativo. O lift relativo é justamente a quantidade que a diluição ataca. A diferença absoluta entre braços sobrevive a uma divisão igual.
- Assumir que a fatia modelada é estável. Ela se move com taxas de consentimento, política de navegador, mix de dispositivo e sazonalidade. Uma fatia que cresce no meio do teste muda a atenuação no meio do teste.
- Esquecer o limiar. Abaixo de 700 cliques em anúncio ao longo de 7 dias por agrupamento de país e domínio, o Google não reporta modelagem de consent mode nenhuma, então contas pequenas veem uma mistura diferente das grandes, e as duas não são comparáveis.
- Ignorar a taxa de consentimento como métrica de guarda. Se a sua variação toca no banner, no fluxo ou na velocidade da página antes do consentimento, ela pode mover a própria taxa de consentimento, e aí o viés deixa de se cancelar entre braços.
Faça isso automático na Donnu
A solução não é estatística engenhosa. É ser dono do evento. Uma decisão de experimento deve rodar sobre desfechos que você observou, atribuídos ao braço que você sorteou, no seu próprio repositório, com o efeito absoluto e o intervalo dele reportados ao lado.
Na Donnu o sorteio e o evento de conversão vivem no mesmo lugar, então toda conversão contada carrega a variação que a produziu e nada precisa ser imputado para saber a que braço ela pertence. A taxa de consentimento fica ao lado da razão de amostra como métrica de guarda, então uma variação que mexe no banner aparece como alerta em vez de virar lift. E o resultado é reportado como diferença absoluta com o intervalo, que é a forma que sobrevive a uma divisão modelada igual. A Donnu é uma opção entre várias; o que importa é a separação: guarde o total modelado para a conversa de orçamento e mantenha o experimento sobre eventos observados e atribuíveis ao braço.
Perguntas frequentes
As perguntas no topo desta página cobrem o que são conversões modeladas, se elas quebram o seu teste, quanto encolhem o lift medido, por que escalar as contagens é o conserto errado, por que a sua quebra por variação não é modelada e em qual número rodar a decisão.
Referências
- Google Ads Help. About consent mode modeling. Fonte dos requisitos de elegibilidade, do limiar diário de 700 cliques em anúncio ao longo de 7 dias por agrupamento de país e domínio, da afirmação de que conversões modeladas aparecem na coluna de Conversões e em todos os relatórios derivados com a mesma granularidade das observadas, da afirmação de que quem consente tem tipicamente de 2 a 5 vezes mais chance de converter do que quem não consente, e da ilustração de um anunciante com taxa de consentimento de 50 por cento que viu 18 por cento de aumento de conversão vindo da modelagem. Conferido em 23 de setembro de 2026. support.google.com.
- Google Ads Help. About modeled online conversions. Fonte da definição de que conversões modeladas usam dados que não identificam usuários individuais para estimar conversões que o Google não consegue observar diretamente, e dos quatro gatilhos: jornadas entre dispositivos, tráfego afetado pelo App Tracking Transparency, usuários não consentidos sob consent mode e navegadores que não permitem medição com cookies de terceiros. Conferido em 23 de setembro de 2026. support.google.com.
- Google Analytics Help. Behavioural modelling for consent mode. Fonte dos limiares de ativação de pelo menos 1.000 eventos por dia com armazenamento de analytics negado por pelo menos 7 dias e pelo menos 1.000 usuários diários com armazenamento concedido em pelo menos 7 dos 28 dias anteriores, e da lista de lugares onde o dado modelado não está disponível: públicos, explorações de usuário, de coorte e de tempo de vida, segmentos com sequência, relatórios de retenção, métricas preditivas e exportação de dados como a do BigQuery. Conferido em 23 de setembro de 2026. support.google.com.
Leia também: Perda de rastreamento por consentimento e bloqueador · Dados first-party e teste A/B · Desequilíbrio de amostra · GA4 e teste A/B · Teste A/B na plataforma de anúncios · Análise por gatilho e diluição · Read in English
Perguntas frequentes
- O que são conversões modeladas?
- São conversões que a plataforma não observou e estimou no lugar. O Google Ads declara que conversões modeladas usam dados que não identificam usuários individuais para estimar conversões que o Google não consegue observar diretamente, e que elas aparecem na coluna de Conversões junto das observadas. A modelagem é acionada por jornadas entre dispositivos, navegadores que bloqueiam medição de terceiros, tráfego afetado pelo App Tracking Transparency e usuários que recusaram consentimento.
- Conversão modelada quebra o meu teste A/B?
- Ela não quebra o sorteio, ela dilui a medição. Se uma parte das conversões reportadas vem de um modelo que não faz ideia de qual variação cada pessoa viu, essa parte não carrega informação nenhuma sobre a diferença entre os seus braços. Ela cai nos dois braços em proporção aproximadamente igual e encolhe o lift relativo medido em direção ao zero. O sorteio continua válido; a estimativa é que fica atenuada.
- Quanto a modelagem encolhe o meu lift medido?
- O fator de atenuação é exatamente a fração observada das conversões reportadas do braço de controle. No exemplo trabalhado deste guia, um lift relativo verdadeiro de 11,98 por cento lê como 10,09 por cento quando 15 por cento das conversões são modeladas, 8,24 por cento a 30 por cento modeladas e 6,42 por cento a 45 por cento modeladas. A aritmética é exata e não depende de o modelo estar errado: um modelo perfeitamente acurado que não enxerga a sua variação dilui a comparação do mesmo jeito.
- Posso só escalar os números por variação para bater com o total reportado?
- Não, e esse é o conserto mais comum que piora tudo. Escalar os dois braços pelo mesmo fator deixa o lift relativo intacto, mas multiplica as contagens de conversão, o que encolhe o erro padrão e faz um resultado não significante parecer significante. Você termina com a mesma estimativa pontual e um intervalo de confiança fabricado. Se precisar reconciliar os totais, reconcilie no relatório, nunca dentro do teste estatístico.
- A minha quebra por variação é modelada?
- Em geral não, e é daí que vem quase toda a confusão. O Google declara que os dados de modelagem comportamental não estão disponíveis em Públicos, nas explorações de usuário, de coorte e de tempo de vida, em segmentos com sequência, em relatórios de retenção, em métricas preditivas nem na exportação de dados, como a exportação para o BigQuery. O seu braço de experimento é uma dimensão no escopo do usuário, então o número de topo dos seus relatórios pode incluir dados modelados enquanto a quebra por variação não inclui. Os dois não vão fechar, e isso é o esperado.
- Em qual número eu devo rodar o teste?
- No número observado, saído da sua própria medição, com a variação anexada a cada evento. Ele é menor e é enviesado como nível, porque quem consente converte diferente de quem não consente, mas o viés atinge os dois braços e em boa parte se cancela na comparação. Use o total da plataforma para orçamento e relatório; use eventos observados e atribuíveis à variação para a decisão do experimento, e declare qual é qual.