Estatística

Teste de Incrementalidade: o lift real da mídia paga

Teste de incrementalidade com holdout: como medir o lift real da mídia paga, o iROAS e o custo por conversão incremental sem confiar no ROAS atribuído.

Ilustração plana de dois grupos de pessoas separados, à esquerda alguns em volta de um celular grande e de um cartão cinza vazio, à direita quatro pessoas sem tela nenhuma, com uma sacola de compras verde e uma seta tracejada sobre cada grupo, em fundo verde-menta

Um teste de incrementalidade separa, por sorteio, uma parte do público da campanha num grupo de controle que não recebe o anúncio e mede quantas conversões a mais o grupo de teste gerou. Essa diferença é o lift, e é o único número que responde “quanto essa mídia causou?”. O ROAS que a plataforma atribui responde outra pergunta, e costuma ser bem maior: no exemplo trabalhado deste guia, a campanha mostra ROAS atribuído de 8,0 e o holdout mede iROAS de 1,80, abaixo do ponto de equilíbrio. Este artigo faz parte do nosso guia completo de teste A/B e cobre os três jeitos de montar o controle (anúncio de utilidade pública, anúncio fantasma e intenção de tratar), as métricas que saem do teste, o problema de poder estatístico com taxas baixas, a diluição causada por quem nunca viu o anúncio e quando trocar o holdout por usuário por um experimento geográfico.

O que é um teste de incrementalidade

A pergunta que a mídia paga quer responder é contrafactual: quantas dessas vendas não teriam acontecido sem o anúncio? Como ninguém observa a mesma pessoa com e sem anúncio ao mesmo tempo, o experimento cria dois grupos parecidos por sorteio e deixa só um deles receber a campanha.

A documentação do Google Ads, conferida em 16/09/2026, descreve o Conversion Lift assim: o público é separado em quem vê os anúncios (tratamento) e quem não vê (controle), e a diferença de conversões entre os dois grupos é o lift, o aumento causado pela presença do anúncio. A central de ajuda da Meta, conferida na mesma data, usa a mesma definição e acrescenta um detalhe que muda a leitura do resultado: o Conversion Lift da Meta adota a abordagem de intenção de tratar. O grupo de teste reúne quem pode ver o anúncio, e dentro dele há quem viu e quem não viu, por limite de entrega ou porque não rolou a tela até o anúncio.

Três termos aparecem em todo relatório desse tipo:

Não confunda com três vizinhos. O holdout de longo prazo mantém um grupo sem uma mudança de produto por meses para medir se o efeito sobrevive. O teste A/B de criativo compara dois anúncios entre si e diz qual é melhor, não se algum dos dois vale o dinheiro. E o atribuindo receita ao vencedor trata de projetar o valor de uma variação de página que já ganhou. Aqui o foco é outro: sortear quem recebe mídia e ler o lift que ela causa.

Por que o ROAS atribuído mente

O ROAS atribuído divide a receita que o modelo de atribuição credita à campanha pelo gasto. O problema não é a conta, é o crédito. Três mecanismos inflam o número, e os três estão documentados em experimentos grandes.

1. A plataforma escolhe quem tem mais chance de comprar. Gordon, Zettelmeyer, Bhargava e Chapsky analisaram 15 experimentos de anúncio nos Estados Unidos, no Facebook, somando 500 milhões de observações do tipo usuário-experimento e 1,6 bilhão de impressões. Eles descrevem que o sistema de entrega dá mais peso a usuários com maior previsão de conversão, e que por isso comparar expostos com não expostos superestima o efeito do anúncio. Descrevem também o “viés de atividade”: para ser exposto, o usuário precisa ter entrado na plataforma durante a campanha, e quem está mais ativo online também tende a converter mais online, com ou sem anúncio.

2. A busca paga pela própria marca captura quem já estava a caminho. Blake, Nosko e Tadelis relatam que, quando o eBay desligou os anúncios de busca para termos da própria marca no Yahoo! e no MSN, 99,5 por cento dos cliques perdidos foram recuperados pelo resultado orgânico. Para as palavras não relacionadas à marca, num experimento por regiões, as estimativas não experimentais de retorno passavam de 4.100 por cento sem controles de tempo e região, e de 1.400 por cento com eles; o experimento mediu retorno de menos 63 por cento, com intervalo de 95 por cento de menos 124 a menos 3 por cento.

3. Remarketing fala com quem já estava decidido. Johnson, Lewis e Nubbemeyer lembram que a eficácia do remarketing é controversa justamente por isso: quem recebe o anúncio é um grupo muito selecionado, que talvez comprasse de qualquer jeito. No caso que eles mediram, o efeito existia (mais sobre isso adiante), mas só o experimento conseguiu mostrar o tamanho.

A tabela abaixo reproduz parte da tabela 6 da versão dos autores de Gordon e coautores, com a métrica de checkout. A coluna “expostos contra não expostos” é o que um painel de atribuição ingênuo tende a mostrar; a coluna do experimento é o lift causal.

estudo lift estimado comparando expostos com não expostos lift medido pelo experimento
11 392% 8,6%
3 198% 8,8%
2 377% 1,3%
4 316% 73%
9 4.074% 2,4%
13 61% -15%

Não é que a comparação ingênua erre sempre para o mesmo lado ou pelo mesmo fator. Os autores relatam que, em metade dos estudos, a estimativa percentual de aumento em compras erra por um fator de três em todos os métodos observacionais que testaram, e que em alguns casos o erro é para baixo. O ponto é que você não sabe de antemão o tamanho nem a direção do erro, e por isso precisa do controle sorteado.

ROAS atribuído contra iROAS no exemplo de ecommerceDuas barras horizontais. Compras atribuídas pela plataforma: 4.800, ROAS atribuído de 8,0. Compras incrementais medidas pelo holdout: 1.080, iROAS de 1,80. Uma linha vertical tracejada marca o iROAS de equilíbrio de 2,5 para uma margem de 40 por cento.a mesma campanha, duas contas: o que a atribuição credita e o que o anúncio causoucompras atribuídasjanela da plataforma4.800 compras, ROAS 8,0compras incrementaisteste menos controle escalado1.080 compras, iROAS 1,80a barra de baixo tem 22,5 por cento do comprimento da de cimacom margem de 40 por cento, o equilíbrio exige iROAS de 2,5: cada real investido devolve 0,72 de margemcenário ilustrativo calculado com o motor das calculadoras do blog
Olhando só a barra de cima, a campanha parece uma máquina de lucro. A de baixo diz que ela perde dinheiro na margem. Nenhuma das duas está “errada” na própria conta; só a de baixo responde à pergunta causal.

As métricas que saem de um teste de lift

Um teste de incrementalidade produz poucas métricas, e todas derivam da mesma diferença. O Google lista, para o estudo por usuários, conversões incrementais (lift absoluto), lift relativo, valor de conversão incremental, custo por ação incremental (iCPA, o gasto dividido pelas conversões incrementais) e retorno incremental sobre o investimento (iROAS, o valor incremental dividido pelo gasto). A Meta explica um passo que muita gente pula: antes de comparar, ela escala o grupo de controle para o mesmo tamanho do grupo de teste.

métrica como se calcula o que responde cuidado
Taxa de conversão por grupo conversões do grupo divididas pelas pessoas do grupo qual foi o comportamento de cada lado as duas taxas incluem quem não viu o anúncio
Lift relativo taxa do teste menos taxa do controle, dividido pela taxa do controle quanto a campanha aumentou a conversão, em proporção diluído pelo alcance, como mostra a seção de diluição
Conversões incrementais conversões do teste menos conversões do controle escaladas para o tamanho do teste quantas conversões existem por causa da mídia vem com intervalo, nunca é um número exato
iCPA gasto dividido pelas conversões incrementais quanto custou cada conversão causada o intervalo é assimétrico e fica enorme quando o lift é pequeno
iROAS receita incremental dividida pelo gasto quanto de receita cada real de mídia causou compare com o iROAS de equilíbrio, que depende da sua margem
Razão atribuído por incremental conversões atribuídas divididas pelas incrementais quanto a atribuição exagera nesta campanha vale só para esta campanha, nesta janela

A última linha é a mais útil no dia a dia. Uma vez medida, ela serve como fator de correção aproximado para ler o painel de atribuição entre um teste e outro, com a ressalva de que muda quando muda o público, o lance ou o criativo.

O iROAS de equilíbrio sai da margem de contribuição: com margem de 40 por cento, cada real de receita incremental deixa 40 centavos, então o anúncio se paga a partir de iROAS de 2,5 (1 dividido por 0,4). Abaixo disso, a campanha pode até vender, mas destrói margem. A calculadora de ROAS e a calculadora de CPA fazem essas contas com os seus números; o que muda aqui é usar o numerador incremental.

Três jeitos de montar o grupo de controle

O grupo de controle precisa responder “o que teria acontecido com essas mesmas pessoas sem o anúncio”. Johnson, Lewis e Nubbemeyer descrevem os dois desenhos tradicionais, propõem um terceiro e apontam os problemas de cada um.

Anúncio de utilidade pública (PSA). O controle vê um anúncio neutro, de uma causa beneficente, por exemplo, no lugar do anúncio da marca. A vantagem é saber quem, no controle, teria sido exposto. Os autores apontam dois problemas: é caro e sujeito a erro, porque exige coordenar anunciante, veículo e terceiros, e deixa de ser válido quando a entrega é otimizada por algoritmo. Se a plataforma otimiza cada anúncio para o seu próprio resultado, ela entrega o anúncio da marca para um tipo de pessoa e o PSA para outro, e os dois grupos expostos deixam de ser comparáveis.

Intenção de tratar (ITT). Sorteia-se o público elegível, o controle simplesmente não recebe o anúncio, e comparam-se os grupos inteiros. É válido e fácil de implementar, e é o que a Meta informa usar. O custo é precisão: quem foi sorteado para o teste e nunca viu o anúncio entra na conta só como ruído. Os autores notam que, quando todas as impressões são elegíveis, a fração de usuários efetivamente tratados pode ser muito pequena, 3 por cento ou menos. O raciocínio geral de analisar pelo sorteio está no guia de intenção de tratar em teste A/B.

Anúncio fantasma (ghost ads). A plataforma registra, no controle, cada ocasião em que teria entregue o anúncio da marca, mas entrega o que entregaria se a marca não estivesse anunciando. O controle vê a mistura normal de anúncios concorrentes, e o experimentador sabe quem teria sido exposto. Como a exposição prevista existe nos dois grupos, dá para comparar só quem teria visto o anúncio, sem o ruído do resto.

Três desenhos de grupo de controle em teste de anúncioTrês colunas. Anúncio de utilidade pública: o controle vê um anúncio neutro, e a comparação é entre expostos dos dois lados, mas a otimização da entrega quebra a simetria. Intenção de tratar: o controle não recebe nada, e a comparação é entre os grupos inteiros, incluindo quem nunca veria o anúncio. Anúncio fantasma: o controle vê os anúncios que veria de qualquer forma, e a plataforma marca quem teria visto o anúncio da marca, permitindo comparar só essas pessoas.quem entra na comparação muda a precisão e a validade do testeutilidade públicateste: anúncio da marcacontrole: anúncio neutrocompara expostoscom expostos ao neutroproblemacaro de coordenarentrega otimizada escolhepessoas diferentes paracada anúnciointenção de tratarteste: elegível ao anúnciocontrole: não recebe nadacompara os gruposinteiros, como sorteadosproblemaquem nunca viu o anúncioentra como ruído e diluio efeito: pede muito maisamostraanúncio fantasmateste: anúncio da marcacontrole: o que veria sem elecompara quem viu comquem teria vistolimitesó a plataforma consegueregistrar a exposiçãoprevista; você não montaisso por fora
Os três desenhos são experimentos; a diferença é quanto ruído entra na comparação e se a otimização da entrega preserva a simetria entre os grupos.

No caso que Johnson, Lewis e Nubbemeyer mediram, uma campanha de remarketing de um varejista de artigos esportivos na rede de display do Google, a versão de trabalho do artigo (2015) reporta, contando a partir da primeira exposição prevista, aumento de 17,2 por cento nas visitas ao site, 12,0 por cento nas transações e 10,8 por cento nas vendas. A razão entre as variâncias das estimativas por intenção de tratar e por anúncio fantasma ficou entre 5,9 e 16,4, e os autores concluem que um experimento só com intenção de tratar precisaria ser cerca de uma ordem de grandeza maior para chegar à mesma confiança.

desenho quem fica no controle precisão funciona com entrega otimizada? quem consegue rodar
Utilidade pública expostos a um anúncio neutro alta, se a entrega for simétrica não, segundo Johnson e coautores anunciante com veículo parceiro, com custo de mídia no controle
Intenção de tratar todo o público sorteado para fora baixa quando o alcance é baixo sim a própria plataforma, ou você, com listas sorteadas
Anúncio fantasma quem teria sido exposto alta sim só a plataforma que entrega o anúncio
Experimento geográfico regiões inteiras sem a campanha baixa por pessoa, a unidade é a região sim você, com qualquer canal segmentável por região

Como desenhar um teste de incrementalidade com holdout

Antes de pedir o estudo na plataforma, cinco decisões definem se o resultado vai servir para alguma coisa.

  1. A decisão que o teste vai informar. “Dobrar a verba de remarketing?”, “manter a busca de marca?”. Sem decisão, o lift vira curiosidade.
  2. A conversão que decide. Compra, conta paga, venda confirmada. O Google recomenda medir também ações de meio de funil como secundárias, porque mostram lift maior e ajudam quando a conversão final tem pouco volume; a decisão, porém, fica com a conversão que paga a conta.
  3. O tamanho do holdout. Controle maior dá precisão e custa conversões que você deixa de causar. O Google aceita de 1 a 50 por cento no estudo por usuários e diz que holdouts menores exigem estudos mais longos.
  4. A duração. O Google permite estudos de 7 dias, recomenda mais de 14 e relata ter encontrado até 17 por cento de queda no lift absoluto em estudos com atraso de conversão longo que rodaram menos de 14 dias. Semanas completas também evitam que o dia da semana se misture ao efeito.
  5. O congelamento. Durante o estudo, mudanças de criativo e de público dificultam a leitura, segundo a própria ajuda do Google, que recomenda limitar as alterações ao rotineiro, como lances e verba.

As duas plataformas também têm requisitos de entrada. A Meta indica, como referência, uma campanha iniciada no último ano com gasto de pelo menos 5 mil dólares e 500 conversões, com exigências de qualidade de sinal (Conversions API com pontuação de correspondência acima de 5, ou fonte compatível de evento de fundo de funil). O Google não deixa salvar o estudo por usuários com orçamento abaixo de 5 mil dólares, libera resultados direcionais com orçamento acima de 5 mil dólares e mil conversões, e informa que o recurso não está disponível para todas as contas. Tudo isso foi conferido em 16/09/2026 e muda com frequência.

O preço do controle pequeno

O controle pequeno é tentador porque perde menos vendas, mas a precisão depende do grupo menor. Para a mesma precisão, uma divisão com fração q no controle pede o total da divisão 50/50 multiplicado por 1 dividido por 4 vezes q vezes (1 menos q). Com 10 por cento no controle, o fator é 2,78.

A tabela usa o cenário de ecommerce do exemplo abaixo: taxa base de 0,6 por cento, efeito de 10 por cento relativo, 95 por cento de confiança e 80 por cento de poder. A última coluna mostra as compras incrementais que o controle deixa de gerar num público de 2 milhões, se o efeito for mesmo de 10 por cento.

fração no controle pessoas necessárias no total das quais no controle poder com 2 milhões de pessoas compras incrementais que o controle deixa de gerar
5% 2.873.464 143.673 cerca de 63% 60
10% 1.516.550 151.655 cerca de 89% 120
20% 853.060 170.612 cerca de 99% 240
30% 649.950 194.985 acima de 99% 360
50% 545.958 272.979 praticamente 100% 600

Os totais partem do número por grupo da calculadora de amostra (272.979) e da fórmula acima; os poderes vêm da mesma aproximação normal da calculadora, adaptada para grupos desiguais. A leitura: descer de 10 para 5 por cento economiza 60 compras e derruba o poder de 89 para cerca de 63 por cento. É o tipo de economia que faz o teste inteiro virar desperdício.

Poder estatístico com taxas baixas

Mídia paga mexe pouco na conversão de cada pessoa, e a conversão por pessoa é rara. Essa combinação é o assunto de Lewis e Rao, que analisaram 25 experimentos de campo com grandes varejistas e corretoras nos Estados Unidos, somando 2,8 milhões de dólares em mídia digital. O que eles encontraram:

O título do artigo resume: a economia de medir o retorno de publicidade é desfavorável. Não quer dizer que o experimento é inútil, quer dizer que o experimento pequeno é inútil e que você precisa dimensionar antes. Para métrica binária, como compra sim ou não, a calculadora de tamanho de amostra faz a conta; para receita por pessoa, a variância pesa ainda mais, e o raciocínio de efeito mínimo detectável vale igual. A calculadora de poder estatístico mostra o que um teste já rodado conseguia enxergar.

Diluição: quem nunca viu o anúncio

Num teste por intenção de tratar, o grupo de teste inclui quem foi sorteado e nunca recebeu o anúncio. Essas pessoas não têm como ser afetadas, então o efeito médio do grupo todo é o efeito sobre os expostos multiplicado pela fração exposta. Gordon e coautores escrevem essa relação de forma explícita: o efeito sobre os tratados é o efeito por intenção de tratar dividido pela fração do grupo de teste que recebeu o tratamento, quando ninguém do controle é exposto.

Isso tem duas consequências práticas.

A tabela e o gráfico abaixo usam o cenário SaaS do exemplo: taxa base de 2 por cento no grupo todo, efeito fixo de 0,75 ponto percentual entre expostos, 95 por cento de confiança e 80 por cento de poder. É uma simplificação (na vida real, a taxa base dos alcançáveis costuma ser diferente da dos demais), mas mostra a ordem de grandeza.

alcance no grupo de teste efeito no grupo todo lift relativo no grupo todo pessoas por grupo
20% 0,15 pp 7,5% 141.764
40% 0,30 pp 15,0% 36.693
60% 0,45 pp 22,5% 16.864
80% 0,60 pp 30,0% 9.798
100% 0,75 pp 37,5% 6.470
Pessoas por grupo necessárias conforme o alcance da campanhaBarras horizontais para alcance de 20, 40, 60, 80 e 100 por cento, com efeito fixo de 0,75 ponto percentual entre expostos e taxa base de 2 por cento. Pessoas por grupo: 141.764, 36.693, 16.864, 9.798 e 6.470.metade do alcance, cerca de quatro vezes a amostraalcance 20%141.764alcance 40%36.693alcance 60%16.864alcance 80%9.798alcance 100%6.470efeito fixo de 0,75 pp entre expostos, base de 2%, 95% de confiança, 80% de poder, bilateralpessoas por grupo, calculadas com o motor das calculadoras do blog
É por isso que o anúncio fantasma importa: ele tira da comparação quem nunca teria visto o anúncio. Sem ele, cada ponto de alcance perdido custa amostra em proporção quadrática.

Uma armadilha comum: tentar “corrigir” a diluição comparando só os expostos do teste com o controle inteiro. Isso reintroduz o viés de seleção do começo do artigo, porque os expostos foram escolhidos pela entrega. A correção honesta é dividir o efeito por intenção de tratar pela fração exposta (e o intervalo junto), ou usar o desenho que marca a exposição prevista nos dois lados.

Exemplo trabalhado 1: prospecção e remarketing de um ecommerce

Cenário (ilustrativo). Uma loja de artigos para casa investe R$ 150.000 em quatro semanas numa campanha de prospecção e remarketing numa plataforma social. O ticket médio é R$ 250 e a margem de contribuição é 40 por cento. O painel da plataforma atribui 4.800 compras à campanha, o que dá ROAS atribuído de 8,0 e CPA atribuído de R$ 31,25. O time pede um estudo de lift com 10 por cento de holdout sobre um público elegível de 2 milhões de pessoas.

Amostra. Antes de rodar, o time dimensiona. A taxa de compra do público em quatro semanas, sem anúncio, gira em torno de 0,6 por cento, e o menor efeito que mudaria a decisão é de 10 por cento relativo. Na calculadora abaixo, digite: taxa de conversão atual 0,6; efeito mínimo detectável 10, relativo; confiança 95; poder 80; visitantes por semana 500000; teste bilateral.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

A tela mostra 272.979 por variação, 545.958 no total e 8 dias. Esses números valem para uma divisão 50/50, que é o que a calculadora assume. Com 90/10, o total sobe para 1.516.550 pelo fator de 2,78 da seção anterior, e o campo de dias deixa de se aplicar. Com 2 milhões de pessoas e 10 por cento no controle, o poder para um efeito de 10 por cento fica em cerca de 89 por cento.

O resultado.

grupo pessoas compras taxa
controle (sem anúncio) 200.000 1.200 0,60%
teste (elegível ao anúncio) 1.800.000 11.880 0,66%

Cole na calculadora de significância: controle com 200000 visitantes e 1200 conversões; variação com 1800000 visitantes e 11880 conversões; confiança 95.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

A tela mostra 0,60% contra 0,66%, melhora relativa de +10,0%, valor-p de 0,0016, intervalo de +0,0% … +0,1% (pp) e o veredito Vencedora com significância · B vence. O intervalo aparece arredondado a uma casa porque as taxas são pequenas; com mais casas, ele vai de mais 0,0241 a mais 0,0959 ponto percentual, e o valor-p é 0,00159. A calculadora aceita grupos de tamanhos diferentes, então a conta vale para o 90/10.

Do lift ao dinheiro. Agora a parte que o relatório de lift faz e a calculadora não:

passo conta resultado
controle escalado para o tamanho do teste 1.200 vezes 9 10.800 compras
compras incrementais 11.880 menos 10.800 1.080
custo por compra incremental (iCPA) R$ 150.000 divididos por 1.080 R$ 138,89
receita incremental 1.080 vezes R$ 250 R$ 270.000
iROAS R$ 270.000 divididos por R$ 150.000 1,80
razão atribuído por incremental 4.800 divididos por 1.080 4,44
intervalo de 95% das compras incrementais intervalo da diferença vezes 1.800.000 de 435 a 1.725
intervalo de 95% do iROAS mesma proporção de 0,72 a 2,88
intervalo de 95% do iCPA gasto dividido pelos extremos de R$ 86,94 a R$ 345,11
Intervalo de confiança do iROAS contra o ponto de equilíbrioEixo de iROAS de 0 a 4. Estimativa de 1,80 com intervalo de 95 por cento de 0,72 a 2,88. Linha vertical em 2,5, o iROAS de equilíbrio para margem de 40 por cento. Marca do ROAS atribuído de 8,0 fora da escala, à direita.o iROAS mais provável fica abaixo do equilíbrio; o atribuído nem cabe no eixo01234equilíbrio 2,5iROAS 1,800,722,88ROAS atribuído 8,0intervalo de 95% da diferença de taxas convertido em receita incremental por real investidocenário ilustrativo calculado com o motor das calculadoras do blog
O lift é significativo, a campanha causa vendas. O que o intervalo não sustenta é que ela se pague: a estimativa fica abaixo de 2,5 e só a ponta de cima do intervalo passa do equilíbrio.

O que o resultado diz. Duas coisas verdadeiras ao mesmo tempo. A campanha funciona: o valor-p de 0,0016 indica que o lift de 10 por cento dificilmente é ruído. E a campanha provavelmente não se paga com essa margem: a estimativa de iROAS é 1,80, contra 2,5 de equilíbrio. Só 22,5 por cento das compras atribuídas são incrementais. Quem olhasse só o ROAS de 8,0 dobraria a verba.

O que fazer com ele. Não desligar tudo, porque o intervalo vai até 2,88 e um teste só não fecha a questão. O caminho honesto é separar as partes: um estudo só de remarketing e outro só de prospecção, porque as duas podem ter incrementalidade muito diferente, e baixar a verba da parte com pior iROAS enquanto o próximo teste roda. Guarde a razão de 4,44 como fator de leitura do painel até o próximo estudo.

Exemplo trabalhado 2: remarketing de um SaaS com lista sorteada

Cenário (ilustrativo). Um SaaS B2B faz remarketing para quem iniciou trial e não assinou. A lista recebe cerca de 20 mil pessoas novas por semana. Como a plataforma não oferece estudo de lift para essa conta, o time sorteia a própria lista: metade entra na audiência da campanha, metade vai para uma lista de exclusão. É intenção de tratar feita em casa, o que Johnson e coautores descrevem como possível quando o anunciante tem uma lista prévia de elegíveis, com o alerta de que recursos de expansão de público (como públicos semelhantes) podem levar o anúncio a quem está na lista de controle. O time desliga a expansão.

A conversão que decide é conta paga em até 30 dias, com taxa base de 2 por cento. O valor de uma conta no primeiro ano é R$ 1.800. O gasto do período é R$ 24.000, e a plataforma atribui 410 contas pagas: CPA atribuído de R$ 58,54.

Amostra. Na calculadora de amostra lá em cima, troque os campos: taxa atual 2; efeito mínimo 15, relativo; confiança 95; poder 80; visitantes por semana 20000; bilateral. A tela mostra 36.693 por variação, 73.386 no total e 26 dias. O time roda quatro semanas completas, 28 dias, e fecha com 40.000 pessoas em cada grupo. Com esse tamanho, o poder para 15 por cento é de cerca de 83 por cento, e o menor efeito detectável com 80 por cento de poder é de cerca de 13,9 por cento relativo.

O resultado, 30 dias depois do fim da entrada na lista.

grupo pessoas contas pagas taxa
controle (lista de exclusão) 40.000 800 2,00%
teste (audiência da campanha) 40.000 920 2,30%

Na calculadora de significância, digite 40000 e 800 no controle e 40000 e 920 na variação. A tela mostra 2,00% contra 2,30%, melhora de +15,0%, valor-p de 0,0034, intervalo de +0,1% … +0,5% (pp) e Vencedora com significância · B vence. Com mais casas, o intervalo vai de mais 0,0990 a mais 0,5010 ponto percentual.

métrica atribuída pela plataforma medida pelo holdout
contas pagas 410 120 incrementais (intervalo de 40 a 200)
custo por conta R$ 58,54 R$ 200,00 (intervalo de R$ 119,76 a R$ 606,10)
retorno sobre o gasto, valor do 1º ano 30,75 9,0

A leitura da diluição. Pelo relatório da plataforma, o alcance da campanha foi de 40 por cento da audiência: 16.000 das 40.000 pessoas do teste viram o anúncio pelo menos uma vez. As 24.000 restantes não tinham como mudar de comportamento. O aumento de 0,30 ponto percentual no grupo todo corresponde, pela divisão pela fração exposta, a 0,75 ponto percentual entre os expostos. Se, como hipótese ilustrativa, quem a campanha alcança converteria a 3,5 por cento sem anúncio (e os demais a 1,0 por cento, o que mantém a média de 2 por cento), o lift entre expostos é de cerca de 21,4 por cento relativos, bem acima dos 15 por cento do relatório.

Essa leitura também mostra o que um desenho com exposição prevista economizaria. Comparando só os alcançáveis, digite na calculadora de amostra taxa 3,5 e efeito 0,75 no modo absoluto (pp): a tela mostra 10.394 por variação e 20.788 no total. Como só 40 por cento da lista é alcançável, achar 20.788 alcançáveis exige cerca de 52 mil pessoas da lista, o que a 20 mil por semana dá cerca de 19 dias, em vez dos 26 do desenho por intenção de tratar (essa conversão para dias é deste guia, não da calculadora). A economia aqui é modesta porque o alcance é de 40 por cento; com alcance de 3 por cento, a fração de tratados que Johnson e coautores dão como exemplo quando todas as impressões são elegíveis, ela seria muito maior.

O que fazer com ele. O remarketing se paga com folga no valor do primeiro ano, mesmo na ponta ruim do intervalo (R$ 606,10 por conta contra R$ 1.800 de valor). A decisão sensata é manter e testar o próximo degrau: aumentar a frequência ou o alcance e medir de novo, porque o efeito entre expostos sugere que alcançar mais gente da lista vale mais do que parece no lift médio. O que não se faz é orçar pelo CPA atribuído de R$ 58,54, que é 3,4 vezes menor que o incremental.

Quando usar experimento geográfico em vez de holdout por usuário

O holdout por usuário é mais preciso, mas depende de a plataforma conseguir sortear e manter pessoas fora do anúncio e de a conversão poder ser ligada à pessoa. Quando uma dessas condições falha, a unidade de sorteio passa a ser a região.

Árvore de decisão entre holdout por usuário e experimento geográficoTrês perguntas em sequência. A plataforma consegue sortear pessoas e mantê-las fora do anúncio? A conversão pode ser ligada à pessoa, por pixel, API de conversões ou lista? Você quer medir só este canal? Se todas as respostas forem sim, use holdout por usuário. Se qualquer uma for não, use experimento geográfico, com mais orçamento e menos precisão.três perguntas antes de escolher a unidade de sorteio1. a plataforma sorteia pessoas e as mantém fora do anúncio?2. a conversão liga à pessoa (pixel, API, lista)?3. a pergunta é sobre este canal isolado?simsimsim nas três: holdout por usuárionãoexperimentogeográficovenda offline, várioscanais, mídia sem alvomais verba, menos precisão
O experimento geográfico não é um plano B ruim; é o desenho certo quando a pergunta ou a medição não cabem no nível da pessoa. Só não espere dele a precisão do holdout por usuário.

A comparação oficial do Google Ads, conferida em 16/09/2026, descreve as duas opções assim. O estudo por usuários devolve resultado por ação de conversão, categoria, idade, gênero e país, mas depende principalmente de tráfego com consentimento e pode ser afetado por lacunas de medição; o orçamento é definido na configuração com base no histórico de conversões. O estudo por geografia oferece transparência, medição entre canais e conversões online e offline, mas a divisão é mais ruidosa, os resultados não vêm por demografia e o orçamento exigido tende a ser maior.

Os casos típicos para ir de região:

O experimento do eBay com palavras não relacionadas à marca é um exemplo clássico: os anúncios foram desligados em 68 áreas de mercado, e o grupo de comparação foi montado a partir das demais. Como fazer isso com rigor (quantas regiões, período pré-teste, por que o valor-p ingênuo engana) está no guia de experimento geográfico, e a conta do efeito de desenho está em randomização por cluster.

Checklist do teste de lift

  1. Decisão escrita antes: o que muda se o iROAS vier acima ou abaixo do equilíbrio.
  2. iROAS de equilíbrio calculado a partir da margem, antes de ver o resultado.
  3. Conversão primária no nível do dinheiro, com ações de meio de funil só como secundárias.
  4. Amostra dimensionada para a fração de controle escolhida, não para 50/50.
  5. Semanas completas e atraso de conversão coberto, com pelo menos 14 dias.
  6. Congelamento de criativo e público durante o estudo.
  7. Sem vazamento para o controle: expansão de público desligada em listas sorteadas em casa, e a mesma campanha fora de outros estudos.
  8. Alcance registrado, para ler o efeito entre expostos e explicar a diluição.
  9. Intervalo no relatório, não só o ponto: conversões incrementais, iCPA e iROAS com os extremos.
  10. Repetição planejada: o Google observa que a maioria dos anunciantes roda cerca de um a dois estudos por ano, alinhados a ciclos de orçamento; o resultado envelhece quando público e lances mudam.

Erros comuns

Faça isso automático na Donnu

A dor específica deste artigo é que o número que a plataforma de mídia mostra não é o número que decide a verba, e a medição incremental exige conta de amostra, de diluição e de intervalo que o painel não faz por você. A Donnu não roda estudo de lift dentro das plataformas de anúncio; ela testa páginas. Mas duas partes do problema estão ao alcance dela.

A primeira é medir a conversão que vale dinheiro. Na Donnu, a meta de conversão pode ser confirmada a partir do seu servidor (server-to-server), como um pedido pago confirmado pelo gateway, além de cliques, formulários, visitas a páginas e eventos personalizados. A segunda é não confundir o efeito da página com o efeito da mídia: a partir do plano Pro, o relatório de um teste de landing page pode ser filtrado e segmentado por origem do tráfego (utm_source), o que ajuda a ver se uma variação ganha para o tráfego pago e perde para o orgânico, em vez de misturar os dois. Antes de mexer na página que recebe a mídia, vale saber se a mídia causa alguma coisa; antes de escalar a mídia, vale saber se a página converte quem chega.

As contas deste guia estão, de graça, na calculadora de tamanho de amostra, na calculadora de significância, na calculadora de poder estatístico e na calculadora de ROAS, esta última alimentada com a receita incremental em vez da atribuída.

Referências

Leia também: Experimento geográfico · Holdout de longo prazo · Análise por gatilho e diluição · Intenção de tratar · Atribuindo receita ao vencedor · Modelagem de uplift · Read in English

Perguntas frequentes

O que é um teste de incrementalidade?
É um experimento em que parte do público que a campanha poderia atingir é sorteada para um grupo de controle que não recebe o anúncio. A diferença de conversões entre o grupo de teste e o de controle é o efeito causal da mídia, chamado de lift. O Google descreve o Conversion Lift exatamente assim: a diferença de conversões entre quem vê e quem não vê os anúncios mostra o aumento causado pela presença do anúncio. A Meta usa a mesma lógica e informa que o seu Conversion Lift adota a abordagem de intenção de tratar.
Por que o ROAS atribuído é maior que o iROAS?
Porque a atribuição credita ao anúncio compras de pessoas que teriam comprado de qualquer jeito, e a plataforma entrega o anúncio justamente para quem tem mais chance de comprar. Nos 15 experimentos do Facebook analisados por Gordon e coautores, comparar expostos com não expostos indicou, num dos estudos, 392 por cento de lift em checkout, contra 8,6 por cento medidos pelo experimento. No exemplo deste guia, a plataforma atribui 4.800 compras e ROAS de 8,0, e o holdout mede 1.080 compras incrementais e iROAS de 1,80.
Como calcular conversões incrementais, iCPA e iROAS?
Escale as conversões do controle para o tamanho do grupo de teste e subtraia do total do teste. Com 1.800.000 pessoas no teste e 11.880 compras, e 200.000 no controle com 1.200 compras, o controle escalado é 10.800 e as compras incrementais são 1.080. O custo por conversão incremental é o gasto dividido por esse número: 150 mil reais divididos por 1.080 dão 138,89 reais. O iROAS é a receita incremental dividida pelo gasto: 1.080 vezes 250 reais, dividido por 150 mil, dá 1,80.
Qual o tamanho do grupo de controle num teste de incrementalidade?
É uma troca entre precisão e custo de oportunidade. O Google Ads aceita de 1 a 50 por cento de holdout no Conversion Lift por usuários. No exemplo deste guia, com 0,6 por cento de conversão e efeito de 10 por cento, uma divisão 50/50 pede 545.958 pessoas no total, e uma divisão 90/10 pede 1.516.550, cerca de 2,78 vezes mais. Com 2 milhões de pessoas, o controle de 10 por cento dá cerca de 89 por cento de poder, e o de 5 por cento, cerca de 63 por cento.
O que é diluição num teste de holdout de anúncios?
É a perda de sinal causada por quem foi sorteado para o grupo de teste e nunca viu o anúncio. A comparação por sorteio inclui essas pessoas, então o efeito médio fica menor que o efeito sobre quem foi exposto, na proporção do alcance. No exemplo SaaS deste guia, com alcance de 40 por cento, um efeito de 0,75 ponto percentual entre expostos aparece como 0,30 ponto no grupo todo, e a amostra necessária sobe para 36.693 por grupo. Com alcance de 20 por cento, subiria para 141.764.
Quando usar experimento geográfico em vez de holdout por usuário?
Quando a plataforma não consegue sortear pessoas, quando a conversão acontece fora do alcance da identificação, como venda em loja física, ou quando você quer medir vários canais juntos. O Google Ads descreve o Conversion Lift por geografia como compatível com conversões offline e com medição entre canais, mas com divisão de grupos mais ruidosa e orçamento mínimo que tende a ser maior que o dos estudos por usuário. Se dá para sortear e medir por pessoa, o holdout por usuário é mais preciso.