Teste de Incrementalidade: o lift real da mídia paga
Teste de incrementalidade com holdout: como medir o lift real da mídia paga, o iROAS e o custo por conversão incremental sem confiar no ROAS atribuído.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Um teste de incrementalidade separa, por sorteio, uma parte do público da campanha num grupo de controle que não recebe o anúncio e mede quantas conversões a mais o grupo de teste gerou. Essa diferença é o lift, e é o único número que responde “quanto essa mídia causou?”. O ROAS que a plataforma atribui responde outra pergunta, e costuma ser bem maior: no exemplo trabalhado deste guia, a campanha mostra ROAS atribuído de 8,0 e o holdout mede iROAS de 1,80, abaixo do ponto de equilíbrio. Este artigo faz parte do nosso guia completo de teste A/B e cobre os três jeitos de montar o controle (anúncio de utilidade pública, anúncio fantasma e intenção de tratar), as métricas que saem do teste, o problema de poder estatístico com taxas baixas, a diluição causada por quem nunca viu o anúncio e quando trocar o holdout por usuário por um experimento geográfico.
O que é um teste de incrementalidade
A pergunta que a mídia paga quer responder é contrafactual: quantas dessas vendas não teriam acontecido sem o anúncio? Como ninguém observa a mesma pessoa com e sem anúncio ao mesmo tempo, o experimento cria dois grupos parecidos por sorteio e deixa só um deles receber a campanha.
A documentação do Google Ads, conferida em 16/09/2026, descreve o Conversion Lift assim: o público é separado em quem vê os anúncios (tratamento) e quem não vê (controle), e a diferença de conversões entre os dois grupos é o lift, o aumento causado pela presença do anúncio. A central de ajuda da Meta, conferida na mesma data, usa a mesma definição e acrescenta um detalhe que muda a leitura do resultado: o Conversion Lift da Meta adota a abordagem de intenção de tratar. O grupo de teste reúne quem pode ver o anúncio, e dentro dele há quem viu e quem não viu, por limite de entrega ou porque não rolou a tela até o anúncio.
Três termos aparecem em todo relatório desse tipo:
- Holdout (ou controle): a fatia do público que fica de fora da campanha durante o teste.
- Lift: a diferença de conversões entre teste e controle, em número absoluto ou relativo.
- Incremental: o que existe só por causa do anúncio. Conversão incremental, receita incremental, custo por conversão incremental.
Não confunda com três vizinhos. O holdout de longo prazo mantém um grupo sem uma mudança de produto por meses para medir se o efeito sobrevive. O teste A/B de criativo compara dois anúncios entre si e diz qual é melhor, não se algum dos dois vale o dinheiro. E o atribuindo receita ao vencedor trata de projetar o valor de uma variação de página que já ganhou. Aqui o foco é outro: sortear quem recebe mídia e ler o lift que ela causa.
Por que o ROAS atribuído mente
O ROAS atribuído divide a receita que o modelo de atribuição credita à campanha pelo gasto. O problema não é a conta, é o crédito. Três mecanismos inflam o número, e os três estão documentados em experimentos grandes.
1. A plataforma escolhe quem tem mais chance de comprar. Gordon, Zettelmeyer, Bhargava e Chapsky analisaram 15 experimentos de anúncio nos Estados Unidos, no Facebook, somando 500 milhões de observações do tipo usuário-experimento e 1,6 bilhão de impressões. Eles descrevem que o sistema de entrega dá mais peso a usuários com maior previsão de conversão, e que por isso comparar expostos com não expostos superestima o efeito do anúncio. Descrevem também o “viés de atividade”: para ser exposto, o usuário precisa ter entrado na plataforma durante a campanha, e quem está mais ativo online também tende a converter mais online, com ou sem anúncio.
2. A busca paga pela própria marca captura quem já estava a caminho. Blake, Nosko e Tadelis relatam que, quando o eBay desligou os anúncios de busca para termos da própria marca no Yahoo! e no MSN, 99,5 por cento dos cliques perdidos foram recuperados pelo resultado orgânico. Para as palavras não relacionadas à marca, num experimento por regiões, as estimativas não experimentais de retorno passavam de 4.100 por cento sem controles de tempo e região, e de 1.400 por cento com eles; o experimento mediu retorno de menos 63 por cento, com intervalo de 95 por cento de menos 124 a menos 3 por cento.
3. Remarketing fala com quem já estava decidido. Johnson, Lewis e Nubbemeyer lembram que a eficácia do remarketing é controversa justamente por isso: quem recebe o anúncio é um grupo muito selecionado, que talvez comprasse de qualquer jeito. No caso que eles mediram, o efeito existia (mais sobre isso adiante), mas só o experimento conseguiu mostrar o tamanho.
A tabela abaixo reproduz parte da tabela 6 da versão dos autores de Gordon e coautores, com a métrica de checkout. A coluna “expostos contra não expostos” é o que um painel de atribuição ingênuo tende a mostrar; a coluna do experimento é o lift causal.
| estudo | lift estimado comparando expostos com não expostos | lift medido pelo experimento |
|---|---|---|
| 11 | 392% | 8,6% |
| 3 | 198% | 8,8% |
| 2 | 377% | 1,3% |
| 4 | 316% | 73% |
| 9 | 4.074% | 2,4% |
| 13 | 61% | -15% |
Não é que a comparação ingênua erre sempre para o mesmo lado ou pelo mesmo fator. Os autores relatam que, em metade dos estudos, a estimativa percentual de aumento em compras erra por um fator de três em todos os métodos observacionais que testaram, e que em alguns casos o erro é para baixo. O ponto é que você não sabe de antemão o tamanho nem a direção do erro, e por isso precisa do controle sorteado.
As métricas que saem de um teste de lift
Um teste de incrementalidade produz poucas métricas, e todas derivam da mesma diferença. O Google lista, para o estudo por usuários, conversões incrementais (lift absoluto), lift relativo, valor de conversão incremental, custo por ação incremental (iCPA, o gasto dividido pelas conversões incrementais) e retorno incremental sobre o investimento (iROAS, o valor incremental dividido pelo gasto). A Meta explica um passo que muita gente pula: antes de comparar, ela escala o grupo de controle para o mesmo tamanho do grupo de teste.
| métrica | como se calcula | o que responde | cuidado |
|---|---|---|---|
| Taxa de conversão por grupo | conversões do grupo divididas pelas pessoas do grupo | qual foi o comportamento de cada lado | as duas taxas incluem quem não viu o anúncio |
| Lift relativo | taxa do teste menos taxa do controle, dividido pela taxa do controle | quanto a campanha aumentou a conversão, em proporção | diluído pelo alcance, como mostra a seção de diluição |
| Conversões incrementais | conversões do teste menos conversões do controle escaladas para o tamanho do teste | quantas conversões existem por causa da mídia | vem com intervalo, nunca é um número exato |
| iCPA | gasto dividido pelas conversões incrementais | quanto custou cada conversão causada | o intervalo é assimétrico e fica enorme quando o lift é pequeno |
| iROAS | receita incremental dividida pelo gasto | quanto de receita cada real de mídia causou | compare com o iROAS de equilíbrio, que depende da sua margem |
| Razão atribuído por incremental | conversões atribuídas divididas pelas incrementais | quanto a atribuição exagera nesta campanha | vale só para esta campanha, nesta janela |
A última linha é a mais útil no dia a dia. Uma vez medida, ela serve como fator de correção aproximado para ler o painel de atribuição entre um teste e outro, com a ressalva de que muda quando muda o público, o lance ou o criativo.
O iROAS de equilíbrio sai da margem de contribuição: com margem de 40 por cento, cada real de receita incremental deixa 40 centavos, então o anúncio se paga a partir de iROAS de 2,5 (1 dividido por 0,4). Abaixo disso, a campanha pode até vender, mas destrói margem. A calculadora de ROAS e a calculadora de CPA fazem essas contas com os seus números; o que muda aqui é usar o numerador incremental.
Três jeitos de montar o grupo de controle
O grupo de controle precisa responder “o que teria acontecido com essas mesmas pessoas sem o anúncio”. Johnson, Lewis e Nubbemeyer descrevem os dois desenhos tradicionais, propõem um terceiro e apontam os problemas de cada um.
Anúncio de utilidade pública (PSA). O controle vê um anúncio neutro, de uma causa beneficente, por exemplo, no lugar do anúncio da marca. A vantagem é saber quem, no controle, teria sido exposto. Os autores apontam dois problemas: é caro e sujeito a erro, porque exige coordenar anunciante, veículo e terceiros, e deixa de ser válido quando a entrega é otimizada por algoritmo. Se a plataforma otimiza cada anúncio para o seu próprio resultado, ela entrega o anúncio da marca para um tipo de pessoa e o PSA para outro, e os dois grupos expostos deixam de ser comparáveis.
Intenção de tratar (ITT). Sorteia-se o público elegível, o controle simplesmente não recebe o anúncio, e comparam-se os grupos inteiros. É válido e fácil de implementar, e é o que a Meta informa usar. O custo é precisão: quem foi sorteado para o teste e nunca viu o anúncio entra na conta só como ruído. Os autores notam que, quando todas as impressões são elegíveis, a fração de usuários efetivamente tratados pode ser muito pequena, 3 por cento ou menos. O raciocínio geral de analisar pelo sorteio está no guia de intenção de tratar em teste A/B.
Anúncio fantasma (ghost ads). A plataforma registra, no controle, cada ocasião em que teria entregue o anúncio da marca, mas entrega o que entregaria se a marca não estivesse anunciando. O controle vê a mistura normal de anúncios concorrentes, e o experimentador sabe quem teria sido exposto. Como a exposição prevista existe nos dois grupos, dá para comparar só quem teria visto o anúncio, sem o ruído do resto.
No caso que Johnson, Lewis e Nubbemeyer mediram, uma campanha de remarketing de um varejista de artigos esportivos na rede de display do Google, a versão de trabalho do artigo (2015) reporta, contando a partir da primeira exposição prevista, aumento de 17,2 por cento nas visitas ao site, 12,0 por cento nas transações e 10,8 por cento nas vendas. A razão entre as variâncias das estimativas por intenção de tratar e por anúncio fantasma ficou entre 5,9 e 16,4, e os autores concluem que um experimento só com intenção de tratar precisaria ser cerca de uma ordem de grandeza maior para chegar à mesma confiança.
| desenho | quem fica no controle | precisão | funciona com entrega otimizada? | quem consegue rodar |
|---|---|---|---|---|
| Utilidade pública | expostos a um anúncio neutro | alta, se a entrega for simétrica | não, segundo Johnson e coautores | anunciante com veículo parceiro, com custo de mídia no controle |
| Intenção de tratar | todo o público sorteado para fora | baixa quando o alcance é baixo | sim | a própria plataforma, ou você, com listas sorteadas |
| Anúncio fantasma | quem teria sido exposto | alta | sim | só a plataforma que entrega o anúncio |
| Experimento geográfico | regiões inteiras sem a campanha | baixa por pessoa, a unidade é a região | sim | você, com qualquer canal segmentável por região |
Como desenhar um teste de incrementalidade com holdout
Antes de pedir o estudo na plataforma, cinco decisões definem se o resultado vai servir para alguma coisa.
- A decisão que o teste vai informar. “Dobrar a verba de remarketing?”, “manter a busca de marca?”. Sem decisão, o lift vira curiosidade.
- A conversão que decide. Compra, conta paga, venda confirmada. O Google recomenda medir também ações de meio de funil como secundárias, porque mostram lift maior e ajudam quando a conversão final tem pouco volume; a decisão, porém, fica com a conversão que paga a conta.
- O tamanho do holdout. Controle maior dá precisão e custa conversões que você deixa de causar. O Google aceita de 1 a 50 por cento no estudo por usuários e diz que holdouts menores exigem estudos mais longos.
- A duração. O Google permite estudos de 7 dias, recomenda mais de 14 e relata ter encontrado até 17 por cento de queda no lift absoluto em estudos com atraso de conversão longo que rodaram menos de 14 dias. Semanas completas também evitam que o dia da semana se misture ao efeito.
- O congelamento. Durante o estudo, mudanças de criativo e de público dificultam a leitura, segundo a própria ajuda do Google, que recomenda limitar as alterações ao rotineiro, como lances e verba.
As duas plataformas também têm requisitos de entrada. A Meta indica, como referência, uma campanha iniciada no último ano com gasto de pelo menos 5 mil dólares e 500 conversões, com exigências de qualidade de sinal (Conversions API com pontuação de correspondência acima de 5, ou fonte compatível de evento de fundo de funil). O Google não deixa salvar o estudo por usuários com orçamento abaixo de 5 mil dólares, libera resultados direcionais com orçamento acima de 5 mil dólares e mil conversões, e informa que o recurso não está disponível para todas as contas. Tudo isso foi conferido em 16/09/2026 e muda com frequência.
O preço do controle pequeno
O controle pequeno é tentador porque perde menos vendas, mas a precisão depende do grupo menor. Para a mesma precisão, uma divisão com fração q no controle pede o total da divisão 50/50 multiplicado por 1 dividido por 4 vezes q vezes (1 menos q). Com 10 por cento no controle, o fator é 2,78.
A tabela usa o cenário de ecommerce do exemplo abaixo: taxa base de 0,6 por cento, efeito de 10 por cento relativo, 95 por cento de confiança e 80 por cento de poder. A última coluna mostra as compras incrementais que o controle deixa de gerar num público de 2 milhões, se o efeito for mesmo de 10 por cento.
| fração no controle | pessoas necessárias no total | das quais no controle | poder com 2 milhões de pessoas | compras incrementais que o controle deixa de gerar |
|---|---|---|---|---|
| 5% | 2.873.464 | 143.673 | cerca de 63% | 60 |
| 10% | 1.516.550 | 151.655 | cerca de 89% | 120 |
| 20% | 853.060 | 170.612 | cerca de 99% | 240 |
| 30% | 649.950 | 194.985 | acima de 99% | 360 |
| 50% | 545.958 | 272.979 | praticamente 100% | 600 |
Os totais partem do número por grupo da calculadora de amostra (272.979) e da fórmula acima; os poderes vêm da mesma aproximação normal da calculadora, adaptada para grupos desiguais. A leitura: descer de 10 para 5 por cento economiza 60 compras e derruba o poder de 89 para cerca de 63 por cento. É o tipo de economia que faz o teste inteiro virar desperdício.
Poder estatístico com taxas baixas
Mídia paga mexe pouco na conversão de cada pessoa, e a conversão por pessoa é rara. Essa combinação é o assunto de Lewis e Rao, que analisaram 25 experimentos de campo com grandes varejistas e corretoras nos Estados Unidos, somando 2,8 milhões de dólares em mídia digital. O que eles encontraram:
- O desvio-padrão das vendas por pessoa costuma ser 10 vezes a média na janela típica de avaliação.
- Na campanha mediana, para render retorno de 25 por cento, o anúncio precisava aumentar a venda média por pessoa em 35 centavos de dólar, numa variável com média de 7 e desvio-padrão de 75 dólares.
- O erro-padrão mediano do retorno sobre o investimento foi de 26,1 por cento nos experimentos de varejo, o que dá um intervalo de confiança com mais de 100 pontos percentuais de largura.
- Experimentos informativos podem exigir mais de 10 milhões de pessoas-semana.
O título do artigo resume: a economia de medir o retorno de publicidade é desfavorável. Não quer dizer que o experimento é inútil, quer dizer que o experimento pequeno é inútil e que você precisa dimensionar antes. Para métrica binária, como compra sim ou não, a calculadora de tamanho de amostra faz a conta; para receita por pessoa, a variância pesa ainda mais, e o raciocínio de efeito mínimo detectável vale igual. A calculadora de poder estatístico mostra o que um teste já rodado conseguia enxergar.
Diluição: quem nunca viu o anúncio
Num teste por intenção de tratar, o grupo de teste inclui quem foi sorteado e nunca recebeu o anúncio. Essas pessoas não têm como ser afetadas, então o efeito médio do grupo todo é o efeito sobre os expostos multiplicado pela fração exposta. Gordon e coautores escrevem essa relação de forma explícita: o efeito sobre os tratados é o efeito por intenção de tratar dividido pela fração do grupo de teste que recebeu o tratamento, quando ninguém do controle é exposto.
Isso tem duas consequências práticas.
- O lift relativo do relatório é menor que o lift sobre quem viu. Com taxa base de 2 por cento, um lift de 15 por cento no grupo todo (0,30 ponto percentual), com alcance de 40 por cento, corresponde a um aumento de 0,75 ponto percentual por exposto, não de 0,30. A conta da página é a mesma do guia de análise por gatilho e diluição, só que aqui o “gatilho” é a exposição, e só a plataforma sabe quem a teria no controle.
- A amostra necessária cresce com o inverso do quadrado do alcance. Se o efeito por exposto é fixo, cortar o alcance pela metade corta o efeito médio pela metade e, grosso modo, quadruplica a amostra.
A tabela e o gráfico abaixo usam o cenário SaaS do exemplo: taxa base de 2 por cento no grupo todo, efeito fixo de 0,75 ponto percentual entre expostos, 95 por cento de confiança e 80 por cento de poder. É uma simplificação (na vida real, a taxa base dos alcançáveis costuma ser diferente da dos demais), mas mostra a ordem de grandeza.
| alcance no grupo de teste | efeito no grupo todo | lift relativo no grupo todo | pessoas por grupo |
|---|---|---|---|
| 20% | 0,15 pp | 7,5% | 141.764 |
| 40% | 0,30 pp | 15,0% | 36.693 |
| 60% | 0,45 pp | 22,5% | 16.864 |
| 80% | 0,60 pp | 30,0% | 9.798 |
| 100% | 0,75 pp | 37,5% | 6.470 |
Uma armadilha comum: tentar “corrigir” a diluição comparando só os expostos do teste com o controle inteiro. Isso reintroduz o viés de seleção do começo do artigo, porque os expostos foram escolhidos pela entrega. A correção honesta é dividir o efeito por intenção de tratar pela fração exposta (e o intervalo junto), ou usar o desenho que marca a exposição prevista nos dois lados.
Exemplo trabalhado 1: prospecção e remarketing de um ecommerce
Cenário (ilustrativo). Uma loja de artigos para casa investe R$ 150.000 em quatro semanas numa campanha de prospecção e remarketing numa plataforma social. O ticket médio é R$ 250 e a margem de contribuição é 40 por cento. O painel da plataforma atribui 4.800 compras à campanha, o que dá ROAS atribuído de 8,0 e CPA atribuído de R$ 31,25. O time pede um estudo de lift com 10 por cento de holdout sobre um público elegível de 2 milhões de pessoas.
Amostra. Antes de rodar, o time dimensiona. A taxa de compra do público em quatro semanas, sem anúncio, gira em torno de 0,6 por cento, e o menor efeito que mudaria a decisão é de 10 por cento relativo. Na calculadora abaixo, digite: taxa de conversão atual 0,6; efeito mínimo detectável 10, relativo; confiança 95; poder 80; visitantes por semana 500000; teste bilateral.
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
A tela mostra 272.979 por variação, 545.958 no total e 8 dias. Esses números valem para uma divisão 50/50, que é o que a calculadora assume. Com 90/10, o total sobe para 1.516.550 pelo fator de 2,78 da seção anterior, e o campo de dias deixa de se aplicar. Com 2 milhões de pessoas e 10 por cento no controle, o poder para um efeito de 10 por cento fica em cerca de 89 por cento.
O resultado.
| grupo | pessoas | compras | taxa |
|---|---|---|---|
| controle (sem anúncio) | 200.000 | 1.200 | 0,60% |
| teste (elegível ao anúncio) | 1.800.000 | 11.880 | 0,66% |
Cole na calculadora de significância: controle com 200000 visitantes e 1200 conversões; variação com 1800000 visitantes e 11880 conversões; confiança 95.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
A tela mostra 0,60% contra 0,66%, melhora relativa de +10,0%, valor-p de 0,0016, intervalo de +0,0% … +0,1% (pp) e o veredito Vencedora com significância · B vence. O intervalo aparece arredondado a uma casa porque as taxas são pequenas; com mais casas, ele vai de mais 0,0241 a mais 0,0959 ponto percentual, e o valor-p é 0,00159. A calculadora aceita grupos de tamanhos diferentes, então a conta vale para o 90/10.
Do lift ao dinheiro. Agora a parte que o relatório de lift faz e a calculadora não:
| passo | conta | resultado |
|---|---|---|
| controle escalado para o tamanho do teste | 1.200 vezes 9 | 10.800 compras |
| compras incrementais | 11.880 menos 10.800 | 1.080 |
| custo por compra incremental (iCPA) | R$ 150.000 divididos por 1.080 | R$ 138,89 |
| receita incremental | 1.080 vezes R$ 250 | R$ 270.000 |
| iROAS | R$ 270.000 divididos por R$ 150.000 | 1,80 |
| razão atribuído por incremental | 4.800 divididos por 1.080 | 4,44 |
| intervalo de 95% das compras incrementais | intervalo da diferença vezes 1.800.000 | de 435 a 1.725 |
| intervalo de 95% do iROAS | mesma proporção | de 0,72 a 2,88 |
| intervalo de 95% do iCPA | gasto dividido pelos extremos | de R$ 86,94 a R$ 345,11 |
O que o resultado diz. Duas coisas verdadeiras ao mesmo tempo. A campanha funciona: o valor-p de 0,0016 indica que o lift de 10 por cento dificilmente é ruído. E a campanha provavelmente não se paga com essa margem: a estimativa de iROAS é 1,80, contra 2,5 de equilíbrio. Só 22,5 por cento das compras atribuídas são incrementais. Quem olhasse só o ROAS de 8,0 dobraria a verba.
O que fazer com ele. Não desligar tudo, porque o intervalo vai até 2,88 e um teste só não fecha a questão. O caminho honesto é separar as partes: um estudo só de remarketing e outro só de prospecção, porque as duas podem ter incrementalidade muito diferente, e baixar a verba da parte com pior iROAS enquanto o próximo teste roda. Guarde a razão de 4,44 como fator de leitura do painel até o próximo estudo.
Exemplo trabalhado 2: remarketing de um SaaS com lista sorteada
Cenário (ilustrativo). Um SaaS B2B faz remarketing para quem iniciou trial e não assinou. A lista recebe cerca de 20 mil pessoas novas por semana. Como a plataforma não oferece estudo de lift para essa conta, o time sorteia a própria lista: metade entra na audiência da campanha, metade vai para uma lista de exclusão. É intenção de tratar feita em casa, o que Johnson e coautores descrevem como possível quando o anunciante tem uma lista prévia de elegíveis, com o alerta de que recursos de expansão de público (como públicos semelhantes) podem levar o anúncio a quem está na lista de controle. O time desliga a expansão.
A conversão que decide é conta paga em até 30 dias, com taxa base de 2 por cento. O valor de uma conta no primeiro ano é R$ 1.800. O gasto do período é R$ 24.000, e a plataforma atribui 410 contas pagas: CPA atribuído de R$ 58,54.
Amostra. Na calculadora de amostra lá em cima, troque os campos: taxa atual 2; efeito mínimo 15, relativo; confiança 95; poder 80; visitantes por semana 20000; bilateral. A tela mostra 36.693 por variação, 73.386 no total e 26 dias. O time roda quatro semanas completas, 28 dias, e fecha com 40.000 pessoas em cada grupo. Com esse tamanho, o poder para 15 por cento é de cerca de 83 por cento, e o menor efeito detectável com 80 por cento de poder é de cerca de 13,9 por cento relativo.
O resultado, 30 dias depois do fim da entrada na lista.
| grupo | pessoas | contas pagas | taxa |
|---|---|---|---|
| controle (lista de exclusão) | 40.000 | 800 | 2,00% |
| teste (audiência da campanha) | 40.000 | 920 | 2,30% |
Na calculadora de significância, digite 40000 e 800 no controle e 40000 e 920 na variação. A tela mostra 2,00% contra 2,30%, melhora de +15,0%, valor-p de 0,0034, intervalo de +0,1% … +0,5% (pp) e Vencedora com significância · B vence. Com mais casas, o intervalo vai de mais 0,0990 a mais 0,5010 ponto percentual.
| métrica | atribuída pela plataforma | medida pelo holdout |
|---|---|---|
| contas pagas | 410 | 120 incrementais (intervalo de 40 a 200) |
| custo por conta | R$ 58,54 | R$ 200,00 (intervalo de R$ 119,76 a R$ 606,10) |
| retorno sobre o gasto, valor do 1º ano | 30,75 | 9,0 |
A leitura da diluição. Pelo relatório da plataforma, o alcance da campanha foi de 40 por cento da audiência: 16.000 das 40.000 pessoas do teste viram o anúncio pelo menos uma vez. As 24.000 restantes não tinham como mudar de comportamento. O aumento de 0,30 ponto percentual no grupo todo corresponde, pela divisão pela fração exposta, a 0,75 ponto percentual entre os expostos. Se, como hipótese ilustrativa, quem a campanha alcança converteria a 3,5 por cento sem anúncio (e os demais a 1,0 por cento, o que mantém a média de 2 por cento), o lift entre expostos é de cerca de 21,4 por cento relativos, bem acima dos 15 por cento do relatório.
Essa leitura também mostra o que um desenho com exposição prevista economizaria. Comparando só os alcançáveis, digite na calculadora de amostra taxa 3,5 e efeito 0,75 no modo absoluto (pp): a tela mostra 10.394 por variação e 20.788 no total. Como só 40 por cento da lista é alcançável, achar 20.788 alcançáveis exige cerca de 52 mil pessoas da lista, o que a 20 mil por semana dá cerca de 19 dias, em vez dos 26 do desenho por intenção de tratar (essa conversão para dias é deste guia, não da calculadora). A economia aqui é modesta porque o alcance é de 40 por cento; com alcance de 3 por cento, a fração de tratados que Johnson e coautores dão como exemplo quando todas as impressões são elegíveis, ela seria muito maior.
O que fazer com ele. O remarketing se paga com folga no valor do primeiro ano, mesmo na ponta ruim do intervalo (R$ 606,10 por conta contra R$ 1.800 de valor). A decisão sensata é manter e testar o próximo degrau: aumentar a frequência ou o alcance e medir de novo, porque o efeito entre expostos sugere que alcançar mais gente da lista vale mais do que parece no lift médio. O que não se faz é orçar pelo CPA atribuído de R$ 58,54, que é 3,4 vezes menor que o incremental.
Quando usar experimento geográfico em vez de holdout por usuário
O holdout por usuário é mais preciso, mas depende de a plataforma conseguir sortear e manter pessoas fora do anúncio e de a conversão poder ser ligada à pessoa. Quando uma dessas condições falha, a unidade de sorteio passa a ser a região.
A comparação oficial do Google Ads, conferida em 16/09/2026, descreve as duas opções assim. O estudo por usuários devolve resultado por ação de conversão, categoria, idade, gênero e país, mas depende principalmente de tráfego com consentimento e pode ser afetado por lacunas de medição; o orçamento é definido na configuração com base no histórico de conversões. O estudo por geografia oferece transparência, medição entre canais e conversões online e offline, mas a divisão é mais ruidosa, os resultados não vêm por demografia e o orçamento exigido tende a ser maior.
Os casos típicos para ir de região:
- Venda em loja física ou por telefone, sem identificador que ligue exposição e compra.
- Pergunta de portfólio: “e se eu cortar 30 por cento de toda a mídia paga numa praça?”.
- Canais sem segmentação por pessoa, como mídia exterior e rádio.
- Plataformas ou contas sem acesso a estudo de lift, quando a lista sorteada em casa também não é viável.
O experimento do eBay com palavras não relacionadas à marca é um exemplo clássico: os anúncios foram desligados em 68 áreas de mercado, e o grupo de comparação foi montado a partir das demais. Como fazer isso com rigor (quantas regiões, período pré-teste, por que o valor-p ingênuo engana) está no guia de experimento geográfico, e a conta do efeito de desenho está em randomização por cluster.
Checklist do teste de lift
- Decisão escrita antes: o que muda se o iROAS vier acima ou abaixo do equilíbrio.
- iROAS de equilíbrio calculado a partir da margem, antes de ver o resultado.
- Conversão primária no nível do dinheiro, com ações de meio de funil só como secundárias.
- Amostra dimensionada para a fração de controle escolhida, não para 50/50.
- Semanas completas e atraso de conversão coberto, com pelo menos 14 dias.
- Congelamento de criativo e público durante o estudo.
- Sem vazamento para o controle: expansão de público desligada em listas sorteadas em casa, e a mesma campanha fora de outros estudos.
- Alcance registrado, para ler o efeito entre expostos e explicar a diluição.
- Intervalo no relatório, não só o ponto: conversões incrementais, iCPA e iROAS com os extremos.
- Repetição planejada: o Google observa que a maioria dos anunciantes roda cerca de um a dois estudos por ano, alinhados a ciclos de orçamento; o resultado envelhece quando público e lances mudam.
Erros comuns
- Comparar o relatório de lift com o painel de atribuição linha a linha. A Meta avisa que os dois usam metodologias diferentes (datas de início e fim do teste contra janelas de atribuição de 1, 7 ou 28 dias, grupos escalados contra conversões creditadas) e não sugere compará-los. Se usar a razão entre os dois como fator de leitura, trate-a como aproximação desta campanha, não como conciliação.
- Chamar lift de “ROAS verdadeiro” sem intervalo. Com taxas baixas, o intervalo do iROAS é largo, e um ponto sozinho engana.
- Controle de 1 ou 2 por cento “para não perder vendas”. O teste perde poder, e as vendas que você protegeu não pagam um estudo inconclusivo.
- Comparar expostos do teste com o controle inteiro. Reintroduz o viés de seleção que o sorteio tinha removido.
- Ler o lift médio como efeito sobre quem viu. Com alcance baixo, o efeito entre expostos é bem maior.
- Testar remarketing e prospecção juntos e decidir por um número só. Os dois podem ter incrementalidade bem diferente.
- Parar o teste no primeiro dia bonito. O mesmo problema do peeking de qualquer teste A/B vale aqui.
Faça isso automático na Donnu
A dor específica deste artigo é que o número que a plataforma de mídia mostra não é o número que decide a verba, e a medição incremental exige conta de amostra, de diluição e de intervalo que o painel não faz por você. A Donnu não roda estudo de lift dentro das plataformas de anúncio; ela testa páginas. Mas duas partes do problema estão ao alcance dela.
A primeira é medir a conversão que vale dinheiro. Na Donnu, a meta de conversão pode ser confirmada a partir do seu servidor (server-to-server), como um pedido pago confirmado pelo gateway, além de cliques, formulários, visitas a páginas e eventos personalizados. A segunda é não confundir o efeito da página com o efeito da mídia: a partir do plano Pro, o relatório de um teste de landing page pode ser filtrado e segmentado por origem do tráfego (utm_source), o que ajuda a ver se uma variação ganha para o tráfego pago e perde para o orgânico, em vez de misturar os dois. Antes de mexer na página que recebe a mídia, vale saber se a mídia causa alguma coisa; antes de escalar a mídia, vale saber se a página converte quem chega.
As contas deste guia estão, de graça, na calculadora de tamanho de amostra, na calculadora de significância, na calculadora de poder estatístico e na calculadora de ROAS, esta última alimentada com a receita incremental em vez da atribuída.
Referências
- Johnson, G. A., Lewis, R. A. e Nubbemeyer, E. I. Ghost Ads: Improving the Economics of Measuring Online Ad Effectiveness. Journal of Marketing Research, 54(6), 2017. Lida a versão de trabalho do Marketing Science Institute (Report 15-122, 2015). Fonte dos três desenhos de controle (utilidade pública, intenção de tratar, anúncio fantasma), da quebra do PSA com entrega otimizada, dos 3 por cento ou menos de tratados, das lifts de 17,2, 12,0 e 10,8 por cento no remarketing e da razão de variâncias de 5,9 a 16,4. PDF lido na íntegra. thearf-org-unified-admin.s3.amazonaws.com · msi.org.
- Gordon, B. R., Zettelmeyer, F., Bhargava, N. e Chapsky, D. A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook. Marketing Science, 38(2), 2019. Lida a versão dos autores (abril de 2018). Fonte dos 15 experimentos, do viés de atividade e da seleção pela entrega, da relação entre efeito por intenção de tratar e efeito sobre os tratados, da tabela 6 e do erro por fator de três em metade dos estudos. PDF lido na íntegra; a tabela 6 confere com a versão publicada (Articles in Advance). kellogg.northwestern.edu.
- Lewis, R. A. e Rao, J. M. The Unfavorable Economics of Measuring the Returns to Advertising. Quarterly Journal of Economics, 130(4), 2015. Fonte dos 25 experimentos, dos 2,8 milhões de dólares, do desvio-padrão de 10 vezes a média, do exemplo de 35 centavos (meta de retorno de 25 por cento) contra média de 7 e desvio de 75, do erro-padrão mediano de 26,1 por cento e dos mais de 10 milhões de pessoas-semana. PDF lido na íntegra. gwern.net.
- Blake, T., Nosko, C. e Tadelis, S. Consumer Heterogeneity and Paid Search Effectiveness: A Large Scale Field Experiment. Econometrica, 83(1), 2015. Lida a versão dos autores (agosto de 2014). Fonte dos 99,5 por cento de cliques de marca recuperados pelo orgânico, dos retornos não experimentais acima de 4.100 e 1.400 por cento, do retorno experimental de menos 63 por cento com intervalo de menos 124 a menos 3, e das 68 áreas de mercado do teste. PDF lido na íntegra. faculty.haas.berkeley.edu.
- Google Ads Help. About Conversion Lift, Set up Conversion Lift based on users e Comparing lift types. Fonte da definição de lift, das métricas (conversões incrementais, lift relativo, iCPA, iROAS), do holdout de 1 a 50 por cento, do orçamento mínimo de 5 mil dólares, da recomendação de mais de 14 dias e da queda de até 17 por cento no lift absoluto, da frequência de um a dois estudos por ano e da comparação entre estudo por usuários e por geografia. Conferido em 16/09/2026. support.google.com · support.google.com · support.google.com.
- Central de Ajuda da Meta para Empresas. About Conversion Lift e Differences between Conversion Lift test results and other reporting tools. Fonte da abordagem de intenção de tratar, dos grupos de teste com expostos e não expostos, da referência de 5 mil dólares e 500 conversões, dos requisitos de sinal, do uso de inferência bayesiana, do escalonamento do controle para o tamanho do teste e da recomendação de não comparar com o Gerenciador de Anúncios. Conferido em 16/09/2026. facebook.com · facebook.com.
Leia também: Experimento geográfico · Holdout de longo prazo · Análise por gatilho e diluição · Intenção de tratar · Atribuindo receita ao vencedor · Modelagem de uplift · Read in English
Perguntas frequentes
- O que é um teste de incrementalidade?
- É um experimento em que parte do público que a campanha poderia atingir é sorteada para um grupo de controle que não recebe o anúncio. A diferença de conversões entre o grupo de teste e o de controle é o efeito causal da mídia, chamado de lift. O Google descreve o Conversion Lift exatamente assim: a diferença de conversões entre quem vê e quem não vê os anúncios mostra o aumento causado pela presença do anúncio. A Meta usa a mesma lógica e informa que o seu Conversion Lift adota a abordagem de intenção de tratar.
- Por que o ROAS atribuído é maior que o iROAS?
- Porque a atribuição credita ao anúncio compras de pessoas que teriam comprado de qualquer jeito, e a plataforma entrega o anúncio justamente para quem tem mais chance de comprar. Nos 15 experimentos do Facebook analisados por Gordon e coautores, comparar expostos com não expostos indicou, num dos estudos, 392 por cento de lift em checkout, contra 8,6 por cento medidos pelo experimento. No exemplo deste guia, a plataforma atribui 4.800 compras e ROAS de 8,0, e o holdout mede 1.080 compras incrementais e iROAS de 1,80.
- Como calcular conversões incrementais, iCPA e iROAS?
- Escale as conversões do controle para o tamanho do grupo de teste e subtraia do total do teste. Com 1.800.000 pessoas no teste e 11.880 compras, e 200.000 no controle com 1.200 compras, o controle escalado é 10.800 e as compras incrementais são 1.080. O custo por conversão incremental é o gasto dividido por esse número: 150 mil reais divididos por 1.080 dão 138,89 reais. O iROAS é a receita incremental dividida pelo gasto: 1.080 vezes 250 reais, dividido por 150 mil, dá 1,80.
- Qual o tamanho do grupo de controle num teste de incrementalidade?
- É uma troca entre precisão e custo de oportunidade. O Google Ads aceita de 1 a 50 por cento de holdout no Conversion Lift por usuários. No exemplo deste guia, com 0,6 por cento de conversão e efeito de 10 por cento, uma divisão 50/50 pede 545.958 pessoas no total, e uma divisão 90/10 pede 1.516.550, cerca de 2,78 vezes mais. Com 2 milhões de pessoas, o controle de 10 por cento dá cerca de 89 por cento de poder, e o de 5 por cento, cerca de 63 por cento.
- O que é diluição num teste de holdout de anúncios?
- É a perda de sinal causada por quem foi sorteado para o grupo de teste e nunca viu o anúncio. A comparação por sorteio inclui essas pessoas, então o efeito médio fica menor que o efeito sobre quem foi exposto, na proporção do alcance. No exemplo SaaS deste guia, com alcance de 40 por cento, um efeito de 0,75 ponto percentual entre expostos aparece como 0,30 ponto no grupo todo, e a amostra necessária sobe para 36.693 por grupo. Com alcance de 20 por cento, subiria para 141.764.
- Quando usar experimento geográfico em vez de holdout por usuário?
- Quando a plataforma não consegue sortear pessoas, quando a conversão acontece fora do alcance da identificação, como venda em loja física, ou quando você quer medir vários canais juntos. O Google Ads descreve o Conversion Lift por geografia como compatível com conversões offline e com medição entre canais, mas com divisão de grupos mais ruidosa e orçamento mínimo que tende a ser maior que o dos estudos por usuário. Se dá para sortear e medir por pessoa, o holdout por usuário é mais preciso.