Estudo de Lift de Marca: o efeito que não vira clique
Estudo de lift de marca: como funciona o experimento com pesquisa, os vieses que ele carrega e por que o mercado reporta a 80 por cento de confiança.

📚 Este artigo faz parte do guia Otimização de Conversão (CRO): O Guia Completo 2026.
Um estudo de lift de marca é um experimento aleatorizado cujo desfecho é uma resposta de pesquisa, não uma venda. O público que teria visto a sua campanha é dividido antes da entrega, o anúncio é retido do braço de controle, e depois os dois braços recebem a mesma pesquisa de uma pergunta; a diferença nas respostas positivas é o lift. A razão de esse desenho existir não é que memória importe mais que receita. É que receita é barulhenta demais para ser medida nos orçamentos que a maioria das campanhas roda, e uma resposta binária de pesquisa é silenciosa o bastante para ser resolvida com alguns milhares de respostas em vez de alguns milhões de pessoas. Essa troca compra poder estatístico e entrega outro conjunto de problemas: quem pode ser pesquisado não é o público da campanha, quem responde não é quem foi abordado, e a convenção de mercado reporta o resultado a 80 por cento de confiança com teste unicaudal. Este guia cobre o desenho, os vieses nomeados por quem construiu o método, um exemplo trabalhado que você reproduz na calculadora e como ler um número de lift com honestidade. Este guia faz parte do nosso guia completo de teste A/B.
O desenho do estudo de lift de marca, dito com precisão
A descrição publicada mais limpa do mecanismo vem dos próprios estatísticos do Google. Fan, Hesterberg, Liu e Zhang apresentaram Methods for Measuring Brand Lift of Online Ads no Joint Statistical Meetings de 2018, e a montagem que descrevem merece leitura devagar.
A população é os usuários que normalmente veriam um anúncio da campanha, se o experimento não estivesse rodando. Esses usuários são divididos aleatoriamente num braço de tratamento, que vê os anúncios da campanha normalmente, e num braço de controle, para quem o anúncio da campanha é retido; o controle pode ver outro anúncio, ou nenhum. Então vem o passo que faz a coisa toda funcionar: os usuários de tratamento que veem anúncios, e os de controle que teriam visto um, são marcados como elegíveis para a pesquisa.
Essa segunda cláusula é a engenharia do contrafactual. O grupo de controle não é “todo mundo para quem não anunciamos”. É “as pessoas específicas que, na ausência da retenção, teriam recebido esta impressão”. É a mesma lógica de ghost ad que cobrimos em teste de incrementalidade, aplicada a um desfecho de pesquisa em vez de um desfecho de compra.
Parte dos marcados depois visita sites onde podem ser pesquisados, parte desses é de fato pesquisada, e parte dessa responde. Cada um desses três passos descarta pessoas, e cada um as descarta de forma não aleatória.
Mais um detalhe de desenho importa e passa fácil despercebido: os usuários marcados não são pesquisados imediatamente. O Google relata um atraso mínimo de uma hora, especificamente para estimar o efeito persistente dos anúncios em vez do efeito de curtíssimo prazo logo após a impressão, e os usuários não são pesquisados se a última impressão virtual deles for antiga demais. Um estudo de lift de marca é, portanto, uma medição de memória curta por construção, o que é coisa diferente de um holdout de longo prazo.
Por que esse desenho existe: o argumento de poder
A razão honesta de estudos de lift de marca existirem não é filosófica. É aritmética.
Lewis e Rao analisaram 25 grandes experimentos de campo de publicidade digital com varejistas e corretoras dos Estados Unidos, representando 2,8 milhões de dólares em gasto publicitário, e publicaram o resultado no Quarterly Journal of Economics. O achado é brutal: as vendas em nível individual são tão voláteis em relação ao custo per capita da publicidade que um coeficiente de variação de 10 é comum, experimentos informativos podem facilmente exigir mais de dez milhões de pessoas-semana, e o intervalo de confiança mediano sobre retorno de investimento tem mais de 100 pontos percentuais de largura.
Troque o desfecho de uma compra para uma resposta de pesquisa e o ruído desaba. Aqui está a mesma pergunta feita aos dois desfechos, calculada no motor de duas proporções que alimenta a calculadora abaixo.
| desfecho | base | efeito a detectar | amostra por braço |
|---|---|---|---|
| resposta de pesquisa: lembrança de anúncio | 13,6 por cento | mais 3 pontos percentuais | 2.235 |
| resposta de pesquisa: lembrança de anúncio | 13,6 por cento | mais 1 ponto percentual | 19.012 |
| compra | 1,2 por cento | mais 10 por cento relativos | 135.624 |
| compra | 1,2 por cento | mais 3 por cento relativos | 1.457.329 |
As quatro linhas assumem 95 por cento de confiança, bicaudal, com 80 por cento de poder. A distância entre 2.235 respondentes e 1,46 milhão de pessoas é o caso de negócio inteiro da medição por pesquisa.
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
Essa troca é legítima, e também é o que quase todo relatório esquece de declarar. Um estudo de lift de marca não mede venda. Ele mede se as pessoas lembram ou sentem diferente, e depende de você acreditar que memória e sentimento viram venda em algum momento. Se esse elo vale na sua categoria é outra pergunta, e é o mesmo problema de métrica substituta que aparece sempre que um proxy entra no lugar do desfecho que interessa de verdade.
Os dois vieses que o método carrega, nomeados pelos próprios autores
O que torna o artigo do Google especialmente útil é que os autores documentam os modos de falha em vez de escondê-los.
Viés de solicitação é a distância entre quem pode ser solicitado e o público inteiro da campanha. Para ser solicitada, a pessoa precisa visitar uma página onde a pesquisa pode ser exibida dentro de um período especificado após a última impressão virtual. Os autores declaram a consequência sem rodeio: cookies mais ativos têm mais chance de serem solicitados, e eles de fato observam mais atividade de internet e maior frequência de anúncio da campanha entre os cookies solicitados do que entre os não solicitados. Os dois braços são solicitados do mesmo jeito, então o viés é simétrico entre braços. Mas simétrico não quer dizer inofensivo: se usuários pesados têm lift diferente dos leves, o estudo responde a pergunta para os usuários pesados.
Viés de resposta vem das escolhas do próprio público, moldadas pelo mecanismo da pesquisa. A pesquisa é apresentada no lugar de um anúncio antes de um vídeo. Quem não quer responder pode fechar a aba, atualizá-la ou simplesmente esperar a contagem acabar, e tem mais chance de fazer isso se não estiver muito interessado no vídeo que vem a seguir. Respostas enviadas após 30 segundos expiram. Respostas enviadas rápido demais são removidas, porque quem responde assim provavelmente está respondendo ao acaso para chegar logo ao vídeo. E, o mais importante: a pessoa pode ter mais chance de responder se estiver interessada no patrocinador ou no produto, e esse interesse pode ter sido afetado justamente por ela ter visto o anúncio. Essa última cláusula é a perigosa, porque é o único viés da lista que pode diferir entre braços.
| viés | onde entra | simétrico entre braços | o que faz com a estimativa |
|---|---|---|---|
| solicitação | quem pode receber uma pesquisa | sim, os dois braços são solicitados igual | desloca a população de público de campanha para usuários ativos |
| resposta | quem escolhe responder | não necessariamente | pode diferir por braço se o interesse foi movido pelo próprio anúncio |
| cookie contra pessoa | a unidade de medição | sim | enviesa o lift para baixo, então resultado positivo sobrevive |
| impressões depois da pesquisa | o momento da medição | sim | a estimativa cobre só os anúncios vistos antes da pesquisa |
| desequilíbrio de covariáveis | diferenças aleatórias ou sistemáticas entre braços | não | corrigido por regressão em idade, gênero, dispositivo e atividade |
A terceira linha merece frase própria, porque é o único viés aqui cuja direção é garantida. O Google estima lift por cookie e não por pessoa, e declara que isso subestima tanto o lift por pessoa quanto o lift total da campanha, por três razões: cookies de controle podem ter visto anúncios da campanha pelos outros cookies da mesma pessoa, as pessoas podem responder à pesquisa antes de ver todos os anúncios que ainda verão, e os efeitos de exposições múltiplas costumam ser sublineares. Um lift positivo medido é, portanto, um piso conservador, não um teto.
O número que o mercado reporta não é um número de 95 por cento
Esta é a parte da medição de lift de marca que quase nunca chega ao slide, e ela muda como você deveria ler todo número de lift que já lhe mostraram.
Na seção de detalhes de estimação, os autores do Google escrevem que por consistência com a prática de mercado eles determinam a significância estatística do lift usando testes unicaudais com nível de significância 0,1, e produzem intervalos de confiança de 80 por cento.
Leia de novo contra o que quase todo mundo assume ao ver “lift estatisticamente significante”. O modelo mental padrão é teste bicaudal a 95 por cento de confiança. A convenção em medição de marca é teste unicaudal a 90 por cento de confiança com um intervalo de 80 por cento impresso ao lado. Não são a mesma régua, e a diferença é grande o bastante para mudar uma decisão.
Para ser justo com a convenção: desfechos de marca são genuinamente difíceis de mover, a direção de interesse é genuinamente unicaudal, e uma régua de relato mais apertada tornaria muitos estudos não reportáveis. É uma troca de engenharia defensável. Ela deixa de ser defensável no momento em que o número resultante é apresentado ao financeiro como se tivesse o mesmo peso de um resultado de conversão bicaudal a 95 por cento. Declare a régua ao lado do número, sempre.
Exemplo trabalhado: lendo um estudo de lembrança de ponta a ponta
Tome o estudo de caso publicado como âncora. Fan e colegas relatam uma campanha cuja etapa do funil de pergunta é lembrança de anúncio, com o texto perguntando para qual das opções o respondente viu publicidade em vídeo online recentemente, e resposta positiva significando que ele selecionou o anunciante numa lista de múltipla escolha. O artigo reporta o lift aditivo de quatro formas:
| estimativa | tratamento | base | lift aditivo | erro padrão | intervalo |
|---|---|---|---|---|---|
| bruta, tratamento menos controle | 0,169 | 0,136 | 0,033 | 0,011 | 0,018 a 0,048 |
| respondentes corrigidos | 0,169 | 0,139 | 0,030 | 0,012 | 0,015 a 0,045 |
| extrapolada para solicitados | 0,162 | 0,133 | 0,029 | 0,014 | 0,011 a 0,047 |
| extrapolada para todos da campanha | 0,124 | 0,097 | 0,027 | 0,016 | 0,007 a 0,048 |
Os quatro lifts são significativamente positivos, e o artigo registra que os erros padrão crescem conforme você extrapola, porque a incerteza de modelo se soma à incerteza amostral. Leia a tabela de cima para baixo e duas coisas acontecem ao mesmo tempo: a estimativa pontual cai de 0,033 para 0,027, e o erro padrão cresce cerca de 45 por cento. O número honesto é o da última linha, e ele é ao mesmo tempo menor e mais trêmulo que o da primeira.
Agora reconstrua a primeira linha você mesmo. Uma diferença de proporções com erro padrão de 0,011 nessas taxas implica aproximadamente 2.132 respondentes por braço. Com 290 respostas positivas de 2.132 no braço de controle e 360 de 2.132 no braço exposto:
- controle 13,6023 por cento, exposto 16,8856 por cento
- lift aditivo de mais 3,2833 pontos percentuais, lift relativo de mais 24,14 por cento
- erro padrão de 0,01100, batendo com o valor reportado no artigo
- 95 por cento bicaudal: p-valor 0,002861, intervalo de 1,1278 a 5,4388 pontos percentuais
- unicaudal a 0,10 com intervalo de 80 por cento, a convenção de mercado que o artigo do Google declara: p-valor 0,001430, intervalo de 1,8739 a 4,6927 pontos percentuais, que é o 0,018 a 0,048 impresso no artigo
Cole esses quatro números na calculadora e você obtém a linha de 95 por cento acima. A calculadora é bicaudal, então a linha unicaudal com intervalo de 80 por cento não sai dela: ela vem da mesma diferença e do mesmo erro padrão, com o fator 1,2816 no lugar do 1,96.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Repare que o intervalo de 80 por cento impresso no artigo, 0,018 a 0,048, é mais estreito que o intervalo de 95 por cento calculado a partir do mesmo erro padrão, 0,011 a 0,055. Isso não é discrepância. É a convenção de relato fazendo exatamente o que ela diz que faz.
O lift relativo é o número que vai parar no slide, e é o mais mal lido do conjunto. Mais 24,14 por cento soa enorme e descreve um movimento de cerca de 14 pessoas em 100 para cerca de 17 em 100. Imprima sempre o lift absoluto ao lado do relativo.
Checklist antes de contratar um estudo
| pergunta | por que importa | como é uma boa resposta |
|---|---|---|
| qual é a pergunta exata da pesquisa | lembrança, reconhecimento, consideração e intenção são desfechos diferentes, com bases diferentes | uma pergunta, pré-registrada, idêntica nos dois braços |
| quem está no braço de controle | um controle de “gente para quem não anunciamos” não é controle | as pessoas que teriam recebido a impressão, marcadas na hora do leilão |
| qual régua de confiança é reportada | unicaudal a 0,1 com intervalo de 80 por cento é o padrão de mercado | declarada na mesma página do número |
| respondentes por braço | é isso que define o menor lift que você poderia ter enxergado | comparados com a tabela de amostra acima antes de lançar |
| a estimativa é corrigida | lift bruto de respondentes não é lift de campanha | peça a linha extrapolada, e espere que ela seja menor |
| qual é o atraso antes da pesquisa | o mínimo de uma hora mede persistência, não reação imediata | declarado, e igual nos dois braços |
| lift absoluto e relativo juntos | lift relativo grande sobre base pequena é movimento absoluto pequeno | os dois números, sempre |
| que decisão muda | um lift sobre o qual você não agiria é um lift que não deveria comprar | escrita antes de o estudo rodar |
Erros comuns na leitura de um lift de marca
- Reportar só o lift relativo. Mais 24 por cento sobre uma base de 13,6 por cento é mais 3,3 pontos percentuais. O segundo número é o que uma decisão de orçamento consegue usar.
- Assumir 95 por cento. A convenção publicada é unicaudal a 0,1 com intervalo de 80 por cento. Se o fornecedor não declarar a régua, pergunte.
- Tratar o lift bruto de respondentes como lift de campanha. No estudo de caso publicado, a estimativa corrigida e extrapolada é cerca de 18 por cento menor e carrega erro padrão cerca de 45 por cento maior.
- Comparar um número de lift de marca com um de lift de conversão. Desfechos diferentes, populações diferentes, réguas de confiança diferentes. Não cabem na mesma tabela sem uma nota.
- Ignorar a distância entre cookie e pessoa. Lift medido por cookie é enviesado para baixo. Boa notícia para um resultado positivo e má notícia para um nulo, que você então não pode interpretar como “sem efeito”.
- Rodar o estudo num público que você nunca compraria. A população é definida como quem teria visto a campanha. Se a segmentação mudar no meio do voo, a população muda junto.
- Esperar que o lift persista. A pesquisa acontece pelo menos uma hora depois da impressão e dentro de uma janela limitada. Persistência além dessa janela é outro experimento.
Faça isso automático na Donnu
A parte disso que generaliza além da medição de marca é a disciplina: decidir o desfecho, a população e a régua de confiança antes de o experimento começar, e depois reportar o efeito absoluto com o intervalo em vez de um número relativo com um veredito grudado.
Na Donnu você declara a métrica primária e o nível de confiança na criação do experimento, o resultado volta como tamanho de efeito com o intervalo junto, e uma escolha unicaudal precisa ser feita de propósito em vez de herdada do padrão de um fornecedor. Se você roda um experimento com pesquisa nas suas próprias propriedades, a aritmética é o mesmo teste de duas proporções desta página, e a tabela de amostra acima diz, antes do lançamento, se o estudo consegue enxergar o efeito que interessa. A Donnu é uma opção entre várias aqui; o que importa é que a régua seja escolhida por você e impressa ao lado do número.
Perguntas frequentes
As perguntas no topo desta página cobrem o que é um estudo de lift de marca, por que o desenho existe, a régua de confiança que o mercado reporta, o viés de solicitação, por que o lift corrigido sai menor e a distinção entre cookie e pessoa.
Referências
- Fan, R., Hesterberg, T., Liu, Y. e Zhang, L. Methods for Measuring Brand Lift of Online Ads. Google. Proceedings of the 2018 Joint Statistical Meetings, American Statistical Association, 2018. Fonte do desenho do experimento e da marcação dos usuários de controle que teriam visto o anúncio, do atraso mínimo de uma hora até a pesquisa, das definições de viés de solicitação e de resposta incluindo o limite de 30 segundos e a remoção de respostas rápidas demais, da afirmação sobre cookie contra pessoa e da direção descendente desse viés, dos testes unicaudais a nível de significância 0,1 com intervalos de confiança de 80 por cento declarados como prática de mercado, e da tabela completa de quatro linhas do estudo de caso com tratamento, base, lift, erro padrão e intervalo. PDF lido na íntegra. storage.googleapis.com · research.google.
- Lewis, R. A. e Rao, J. M. The Unfavorable Economics of Measuring the Returns to Advertising. Quarterly Journal of Economics, 130(4), 2015. Fonte dos 25 experimentos de campo com varejistas e corretoras dos Estados Unidos, dos 2,8 milhões de dólares gastos, do coeficiente de variação de 10, da exigência de mais de dez milhões de pessoas-semana e do intervalo de confiança mediano sobre retorno de investimento com mais de 100 pontos percentuais de largura. PDF lido na íntegra. gwern.net.
- Google Ads Help. About lift studies. Fonte do posicionamento do lift de marca ao lado do lift de busca e do lift de conversão na família de estudos de lift, e da descrição da plataforma sobre a divisão entre exposto e controle. Conferido em 23 de setembro de 2026. support.google.com.
Leia também: Teste de incrementalidade · Métrica substituta · Holdout de longo prazo · Intenção de tratar · Teste A/B de criativo de anúncio · Fadiga de criativo e frequência · Read in English
Perguntas frequentes
- O que é um estudo de lift de marca?
- É um experimento aleatorizado em que o desfecho é uma resposta de pesquisa em vez de uma compra. O público que normalmente veria a sua campanha é dividido em braço exposto e braço de controle antes da entrega, o anúncio da campanha é retido do controle, e depois os dois braços recebem a mesma pesquisa de uma pergunta. A diferença na proporção de respostas positivas é o lift. Ele mede memória e percepção, que é justamente a parte da publicidade que nunca vira clique.
- Por que estudos de lift de marca existem, se dá para rodar experimento de conversão?
- Por poder estatístico. Vendas individuais são extremamente voláteis em relação ao custo per capita da publicidade: Lewis e Rao, em 25 experimentos de campo, acharam comum um coeficiente de variação de 10 e concluíram que experimentos informativos podem exigir mais de dez milhões de pessoas-semana. Uma resposta binária de pesquisa com base de 13,6 por cento é um desfecho muito mais silencioso. Detectar um lift de 3 pontos percentuais nela exige cerca de 2.235 respondentes por braço, contra aproximadamente 1,46 milhão de pessoas por braço para detectar 3 por cento relativos sobre uma taxa de compra de 1,2 por cento.
- Resultado de lift de marca é reportado a 95 por cento de confiança?
- Muitas vezes não. No artigo de metodologia do Google, de Fan, Hesterberg, Liu e Zhang, os autores declaram que, por consistência com a prática de mercado, determinam a significância estatística usando testes unicaudais a nível de significância 0,1 e produzem intervalos de confiança de 80 por cento. Essa é uma régua materialmente mais fraca do que o bicaudal a 95 por cento que quase todo mundo assume ao ler um número de lift, e ela corta a amostra necessária em cerca de 43 por cento para o mesmo tamanho de efeito.
- O que é viés de solicitação num estudo de lift de marca?
- Viés de solicitação é a distância entre quem pode ser pesquisado e o público inteiro da campanha. Para ser pesquisada, a pessoa precisa visitar uma página onde a pesquisa pode aparecer dentro de uma janela após a última impressão, então contas mais ativas têm mais chance de serem abordadas. O Google relata observar mais atividade de internet e maior frequência de anúncio da campanha entre os cookies solicitados do que entre os não solicitados. Os dois braços são solicitados do mesmo jeito, então o viés é simétrico, mas se pessoas de frequência alta têm lift diferente das de frequência baixa, a sua estimativa é da população solicitada, não da população da campanha.
- Por que o lift reportado encolhe quando é corrigido?
- Porque a correção move a estimativa dos respondentes que você de fato observou para o público de campanha que você quer, e são populações diferentes. No estudo de caso publicado por Fan e colegas, o lift aditivo bruto sobre lembrança de anúncio foi 0,033 com erro padrão de 0,011, e depois da extrapolação para todos os usuários da campanha ficou 0,027 com erro padrão de 0,016. A estimativa pontual caiu e a incerteza cresceu, porque a incerteza de modelo foi somada à incerteza amostral.
- O estudo de lift de marca mede por pessoa ou por cookie?
- Em geral por cookie ou por conta, não por pessoa real. O Google é explícito ao dizer que estima lift por cookie, e que isso subestima o lift por pessoa e o lift total da campanha, porque cookies de controle podem ter visto a campanha pelos outros cookies da mesma pessoa, porque as pessoas podem responder antes de ver todos os anúncios que ainda verão, e porque os efeitos de exposições múltiplas costumam ser sublineares. A direção desse viés é para baixo, então um resultado positivo sobrevive a ele.