CRO

Estudo de Lift de Marca: o efeito que não vira clique

Estudo de lift de marca: como funciona o experimento com pesquisa, os vieses que ele carrega e por que o mercado reporta a 80 por cento de confiança.

Ilustração plana de duas pranchetas idênticas lado a lado sob um brilho suave, cada uma com um cartão em branco e duas caixas de seleção redondas vazias, uma prancheta ligeiramente mais alta que a outra

Um estudo de lift de marca é um experimento aleatorizado cujo desfecho é uma resposta de pesquisa, não uma venda. O público que teria visto a sua campanha é dividido antes da entrega, o anúncio é retido do braço de controle, e depois os dois braços recebem a mesma pesquisa de uma pergunta; a diferença nas respostas positivas é o lift. A razão de esse desenho existir não é que memória importe mais que receita. É que receita é barulhenta demais para ser medida nos orçamentos que a maioria das campanhas roda, e uma resposta binária de pesquisa é silenciosa o bastante para ser resolvida com alguns milhares de respostas em vez de alguns milhões de pessoas. Essa troca compra poder estatístico e entrega outro conjunto de problemas: quem pode ser pesquisado não é o público da campanha, quem responde não é quem foi abordado, e a convenção de mercado reporta o resultado a 80 por cento de confiança com teste unicaudal. Este guia cobre o desenho, os vieses nomeados por quem construiu o método, um exemplo trabalhado que você reproduz na calculadora e como ler um número de lift com honestidade. Este guia faz parte do nosso guia completo de teste A/B.

O desenho do estudo de lift de marca, dito com precisão

A descrição publicada mais limpa do mecanismo vem dos próprios estatísticos do Google. Fan, Hesterberg, Liu e Zhang apresentaram Methods for Measuring Brand Lift of Online Ads no Joint Statistical Meetings de 2018, e a montagem que descrevem merece leitura devagar.

A população é os usuários que normalmente veriam um anúncio da campanha, se o experimento não estivesse rodando. Esses usuários são divididos aleatoriamente num braço de tratamento, que vê os anúncios da campanha normalmente, e num braço de controle, para quem o anúncio da campanha é retido; o controle pode ver outro anúncio, ou nenhum. Então vem o passo que faz a coisa toda funcionar: os usuários de tratamento que veem anúncios, e os de controle que teriam visto um, são marcados como elegíveis para a pesquisa.

Essa segunda cláusula é a engenharia do contrafactual. O grupo de controle não é “todo mundo para quem não anunciamos”. É “as pessoas específicas que, na ausência da retenção, teriam recebido esta impressão”. É a mesma lógica de ghost ad que cobrimos em teste de incrementalidade, aplicada a um desfecho de pesquisa em vez de um desfecho de compra.

Parte dos marcados depois visita sites onde podem ser pesquisados, parte desses é de fato pesquisada, e parte dessa responde. Cada um desses três passos descarta pessoas, e cada um as descarta de forma não aleatória.

Do público da campanha ao respondente da pesquisa, e o que cada etapa removeUm funil de quatro estágios que vai estreitando. O estágio mais largo é o público da campanha, ou seja, todos que teriam visto o anúncio. O segundo estágio é a população marcada, que mantém os usuários de tratamento que viram anúncio e os de controle que teriam visto. O terceiro estágio é a população solicitada, que mantém apenas quem depois visitou uma página onde a pesquisa podia aparecer, introduzindo viés de solicitação. O quarto e mais estreito estágio é o de respondentes, que mantém apenas quem escolheu responder dentro do limite de tempo, introduzindo viés de resposta. Duas notas laterais marcam onde cada viés entra.toda etapa remove gente, e nenhuma delas remove ao acasopúblico da campanha: todos que teriam visto o anúnciomarcados: viram anúncio, ou teriam vistosolicitados: visitaram página pesquisável a temporespondentesentra o viésde solicitaçãoentra o viésde respostaas larguras são ilustrativas; o estreitamento é real, as proporções não são medidas
A cadeia de medição descrita por Fan e colegas. O sorteio acontece no topo, mas o número que você reporta é calculado embaixo, quatro filtros não aleatórios depois. As correções do artigo existem justamente para levar a estimativa de volta funil acima.

Mais um detalhe de desenho importa e passa fácil despercebido: os usuários marcados não são pesquisados imediatamente. O Google relata um atraso mínimo de uma hora, especificamente para estimar o efeito persistente dos anúncios em vez do efeito de curtíssimo prazo logo após a impressão, e os usuários não são pesquisados se a última impressão virtual deles for antiga demais. Um estudo de lift de marca é, portanto, uma medição de memória curta por construção, o que é coisa diferente de um holdout de longo prazo.

Por que esse desenho existe: o argumento de poder

A razão honesta de estudos de lift de marca existirem não é filosófica. É aritmética.

Lewis e Rao analisaram 25 grandes experimentos de campo de publicidade digital com varejistas e corretoras dos Estados Unidos, representando 2,8 milhões de dólares em gasto publicitário, e publicaram o resultado no Quarterly Journal of Economics. O achado é brutal: as vendas em nível individual são tão voláteis em relação ao custo per capita da publicidade que um coeficiente de variação de 10 é comum, experimentos informativos podem facilmente exigir mais de dez milhões de pessoas-semana, e o intervalo de confiança mediano sobre retorno de investimento tem mais de 100 pontos percentuais de largura.

Troque o desfecho de uma compra para uma resposta de pesquisa e o ruído desaba. Aqui está a mesma pergunta feita aos dois desfechos, calculada no motor de duas proporções que alimenta a calculadora abaixo.

desfecho base efeito a detectar amostra por braço
resposta de pesquisa: lembrança de anúncio 13,6 por cento mais 3 pontos percentuais 2.235
resposta de pesquisa: lembrança de anúncio 13,6 por cento mais 1 ponto percentual 19.012
compra 1,2 por cento mais 10 por cento relativos 135.624
compra 1,2 por cento mais 3 por cento relativos 1.457.329

As quatro linhas assumem 95 por cento de confiança, bicaudal, com 80 por cento de poder. A distância entre 2.235 respondentes e 1,46 milhão de pessoas é o caso de negócio inteiro da medição por pesquisa.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Essa troca é legítima, e também é o que quase todo relatório esquece de declarar. Um estudo de lift de marca não mede venda. Ele mede se as pessoas lembram ou sentem diferente, e depende de você acreditar que memória e sentimento viram venda em algum momento. Se esse elo vale na sua categoria é outra pergunta, e é o mesmo problema de métrica substituta que aparece sempre que um proxy entra no lugar do desfecho que interessa de verdade.

Os dois vieses que o método carrega, nomeados pelos próprios autores

O que torna o artigo do Google especialmente útil é que os autores documentam os modos de falha em vez de escondê-los.

Viés de solicitação é a distância entre quem pode ser solicitado e o público inteiro da campanha. Para ser solicitada, a pessoa precisa visitar uma página onde a pesquisa pode ser exibida dentro de um período especificado após a última impressão virtual. Os autores declaram a consequência sem rodeio: cookies mais ativos têm mais chance de serem solicitados, e eles de fato observam mais atividade de internet e maior frequência de anúncio da campanha entre os cookies solicitados do que entre os não solicitados. Os dois braços são solicitados do mesmo jeito, então o viés é simétrico entre braços. Mas simétrico não quer dizer inofensivo: se usuários pesados têm lift diferente dos leves, o estudo responde a pergunta para os usuários pesados.

Viés de resposta vem das escolhas do próprio público, moldadas pelo mecanismo da pesquisa. A pesquisa é apresentada no lugar de um anúncio antes de um vídeo. Quem não quer responder pode fechar a aba, atualizá-la ou simplesmente esperar a contagem acabar, e tem mais chance de fazer isso se não estiver muito interessado no vídeo que vem a seguir. Respostas enviadas após 30 segundos expiram. Respostas enviadas rápido demais são removidas, porque quem responde assim provavelmente está respondendo ao acaso para chegar logo ao vídeo. E, o mais importante: a pessoa pode ter mais chance de responder se estiver interessada no patrocinador ou no produto, e esse interesse pode ter sido afetado justamente por ela ter visto o anúncio. Essa última cláusula é a perigosa, porque é o único viés da lista que pode diferir entre braços.

viés onde entra simétrico entre braços o que faz com a estimativa
solicitação quem pode receber uma pesquisa sim, os dois braços são solicitados igual desloca a população de público de campanha para usuários ativos
resposta quem escolhe responder não necessariamente pode diferir por braço se o interesse foi movido pelo próprio anúncio
cookie contra pessoa a unidade de medição sim enviesa o lift para baixo, então resultado positivo sobrevive
impressões depois da pesquisa o momento da medição sim a estimativa cobre só os anúncios vistos antes da pesquisa
desequilíbrio de covariáveis diferenças aleatórias ou sistemáticas entre braços não corrigido por regressão em idade, gênero, dispositivo e atividade

A terceira linha merece frase própria, porque é o único viés aqui cuja direção é garantida. O Google estima lift por cookie e não por pessoa, e declara que isso subestima tanto o lift por pessoa quanto o lift total da campanha, por três razões: cookies de controle podem ter visto anúncios da campanha pelos outros cookies da mesma pessoa, as pessoas podem responder à pesquisa antes de ver todos os anúncios que ainda verão, e os efeitos de exposições múltiplas costumam ser sublineares. Um lift positivo medido é, portanto, um piso conservador, não um teto.

O número que o mercado reporta não é um número de 95 por cento

Esta é a parte da medição de lift de marca que quase nunca chega ao slide, e ela muda como você deveria ler todo número de lift que já lhe mostraram.

Na seção de detalhes de estimação, os autores do Google escrevem que por consistência com a prática de mercado eles determinam a significância estatística do lift usando testes unicaudais com nível de significância 0,1, e produzem intervalos de confiança de 80 por cento.

Leia de novo contra o que quase todo mundo assume ao ver “lift estatisticamente significante”. O modelo mental padrão é teste bicaudal a 95 por cento de confiança. A convenção em medição de marca é teste unicaudal a 90 por cento de confiança com um intervalo de 80 por cento impresso ao lado. Não são a mesma régua, e a diferença é grande o bastante para mudar uma decisão.

A mesma estimativa de lift de marca sob a régua de 80 por cento do mercado e sob a régua usual de 95 por centoComparação de duas réguas de evidência aplicadas ao mesmo lift aditivo de 0,033 com erro padrão de 0,011. A barra de cima mostra o intervalo de confiança de 80 por cento usado na prática de mercado, indo de 0,019 a 0,047, com meia largura de 0,014. A barra de baixo mostra o intervalo de confiança de 95 por cento bicaudal, indo de 0,011 a 0,055, com meia largura de 0,022. Uma nota indica que o intervalo de 95 por cento é cerca de 53 por cento mais largo e que a amostra exigida para o mesmo tamanho de efeito sobe de 1.284 para 2.235 por braço.a mesma estimativa, sob duas réguas de evidência diferenteslift aditivo 0,033, erro padrão 0,011, como reportado no estudo de caso publicado00,060intervalo 80%prática de mercado0,0190,047intervalo 95%bicaudal, o padrão usual0,0110,055estimativa pontual 0,033mesmos dados: o intervalo de 95% é cerca de 53% mais largo e exige 2.235 por braço em vez de 1.284
Duas réguas aplicadas à estimativa pontual e ao erro padrão publicados. Nada na campanha mudou entre uma barra e outra. O intervalo que você imprime é uma escolha de relato, e o padrão do mercado é o mais estreito.

Para ser justo com a convenção: desfechos de marca são genuinamente difíceis de mover, a direção de interesse é genuinamente unicaudal, e uma régua de relato mais apertada tornaria muitos estudos não reportáveis. É uma troca de engenharia defensável. Ela deixa de ser defensável no momento em que o número resultante é apresentado ao financeiro como se tivesse o mesmo peso de um resultado de conversão bicaudal a 95 por cento. Declare a régua ao lado do número, sempre.

Exemplo trabalhado: lendo um estudo de lembrança de ponta a ponta

Tome o estudo de caso publicado como âncora. Fan e colegas relatam uma campanha cuja etapa do funil de pergunta é lembrança de anúncio, com o texto perguntando para qual das opções o respondente viu publicidade em vídeo online recentemente, e resposta positiva significando que ele selecionou o anunciante numa lista de múltipla escolha. O artigo reporta o lift aditivo de quatro formas:

estimativa tratamento base lift aditivo erro padrão intervalo
bruta, tratamento menos controle 0,169 0,136 0,033 0,011 0,018 a 0,048
respondentes corrigidos 0,169 0,139 0,030 0,012 0,015 a 0,045
extrapolada para solicitados 0,162 0,133 0,029 0,014 0,011 a 0,047
extrapolada para todos da campanha 0,124 0,097 0,027 0,016 0,007 a 0,048

Os quatro lifts são significativamente positivos, e o artigo registra que os erros padrão crescem conforme você extrapola, porque a incerteza de modelo se soma à incerteza amostral. Leia a tabela de cima para baixo e duas coisas acontecem ao mesmo tempo: a estimativa pontual cai de 0,033 para 0,027, e o erro padrão cresce cerca de 45 por cento. O número honesto é o da última linha, e ele é ao mesmo tempo menor e mais trêmulo que o da primeira.

Agora reconstrua a primeira linha você mesmo. Uma diferença de proporções com erro padrão de 0,011 nessas taxas implica aproximadamente 2.132 respondentes por braço. Com 290 respostas positivas de 2.132 no braço de controle e 360 de 2.132 no braço exposto:

Cole esses quatro números na calculadora e você obtém a linha de 95 por cento acima. A calculadora é bicaudal, então a linha unicaudal com intervalo de 80 por cento não sai dela: ela vem da mesma diferença e do mesmo erro padrão, com o fator 1,2816 no lugar do 1,96.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Repare que o intervalo de 80 por cento impresso no artigo, 0,018 a 0,048, é mais estreito que o intervalo de 95 por cento calculado a partir do mesmo erro padrão, 0,011 a 0,055. Isso não é discrepância. É a convenção de relato fazendo exatamente o que ela diz que faz.

O lift relativo é o número que vai parar no slide, e é o mais mal lido do conjunto. Mais 24,14 por cento soa enorme e descreve um movimento de cerca de 14 pessoas em 100 para cerca de 17 em 100. Imprima sempre o lift absoluto ao lado do relativo.

Checklist antes de contratar um estudo

pergunta por que importa como é uma boa resposta
qual é a pergunta exata da pesquisa lembrança, reconhecimento, consideração e intenção são desfechos diferentes, com bases diferentes uma pergunta, pré-registrada, idêntica nos dois braços
quem está no braço de controle um controle de “gente para quem não anunciamos” não é controle as pessoas que teriam recebido a impressão, marcadas na hora do leilão
qual régua de confiança é reportada unicaudal a 0,1 com intervalo de 80 por cento é o padrão de mercado declarada na mesma página do número
respondentes por braço é isso que define o menor lift que você poderia ter enxergado comparados com a tabela de amostra acima antes de lançar
a estimativa é corrigida lift bruto de respondentes não é lift de campanha peça a linha extrapolada, e espere que ela seja menor
qual é o atraso antes da pesquisa o mínimo de uma hora mede persistência, não reação imediata declarado, e igual nos dois braços
lift absoluto e relativo juntos lift relativo grande sobre base pequena é movimento absoluto pequeno os dois números, sempre
que decisão muda um lift sobre o qual você não agiria é um lift que não deveria comprar escrita antes de o estudo rodar

Erros comuns na leitura de um lift de marca

Faça isso automático na Donnu

A parte disso que generaliza além da medição de marca é a disciplina: decidir o desfecho, a população e a régua de confiança antes de o experimento começar, e depois reportar o efeito absoluto com o intervalo em vez de um número relativo com um veredito grudado.

Na Donnu você declara a métrica primária e o nível de confiança na criação do experimento, o resultado volta como tamanho de efeito com o intervalo junto, e uma escolha unicaudal precisa ser feita de propósito em vez de herdada do padrão de um fornecedor. Se você roda um experimento com pesquisa nas suas próprias propriedades, a aritmética é o mesmo teste de duas proporções desta página, e a tabela de amostra acima diz, antes do lançamento, se o estudo consegue enxergar o efeito que interessa. A Donnu é uma opção entre várias aqui; o que importa é que a régua seja escolhida por você e impressa ao lado do número.

Perguntas frequentes

As perguntas no topo desta página cobrem o que é um estudo de lift de marca, por que o desenho existe, a régua de confiança que o mercado reporta, o viés de solicitação, por que o lift corrigido sai menor e a distinção entre cookie e pessoa.

Referências

Leia também: Teste de incrementalidade · Métrica substituta · Holdout de longo prazo · Intenção de tratar · Teste A/B de criativo de anúncio · Fadiga de criativo e frequência · Read in English

Perguntas frequentes

O que é um estudo de lift de marca?
É um experimento aleatorizado em que o desfecho é uma resposta de pesquisa em vez de uma compra. O público que normalmente veria a sua campanha é dividido em braço exposto e braço de controle antes da entrega, o anúncio da campanha é retido do controle, e depois os dois braços recebem a mesma pesquisa de uma pergunta. A diferença na proporção de respostas positivas é o lift. Ele mede memória e percepção, que é justamente a parte da publicidade que nunca vira clique.
Por que estudos de lift de marca existem, se dá para rodar experimento de conversão?
Por poder estatístico. Vendas individuais são extremamente voláteis em relação ao custo per capita da publicidade: Lewis e Rao, em 25 experimentos de campo, acharam comum um coeficiente de variação de 10 e concluíram que experimentos informativos podem exigir mais de dez milhões de pessoas-semana. Uma resposta binária de pesquisa com base de 13,6 por cento é um desfecho muito mais silencioso. Detectar um lift de 3 pontos percentuais nela exige cerca de 2.235 respondentes por braço, contra aproximadamente 1,46 milhão de pessoas por braço para detectar 3 por cento relativos sobre uma taxa de compra de 1,2 por cento.
Resultado de lift de marca é reportado a 95 por cento de confiança?
Muitas vezes não. No artigo de metodologia do Google, de Fan, Hesterberg, Liu e Zhang, os autores declaram que, por consistência com a prática de mercado, determinam a significância estatística usando testes unicaudais a nível de significância 0,1 e produzem intervalos de confiança de 80 por cento. Essa é uma régua materialmente mais fraca do que o bicaudal a 95 por cento que quase todo mundo assume ao ler um número de lift, e ela corta a amostra necessária em cerca de 43 por cento para o mesmo tamanho de efeito.
O que é viés de solicitação num estudo de lift de marca?
Viés de solicitação é a distância entre quem pode ser pesquisado e o público inteiro da campanha. Para ser pesquisada, a pessoa precisa visitar uma página onde a pesquisa pode aparecer dentro de uma janela após a última impressão, então contas mais ativas têm mais chance de serem abordadas. O Google relata observar mais atividade de internet e maior frequência de anúncio da campanha entre os cookies solicitados do que entre os não solicitados. Os dois braços são solicitados do mesmo jeito, então o viés é simétrico, mas se pessoas de frequência alta têm lift diferente das de frequência baixa, a sua estimativa é da população solicitada, não da população da campanha.
Por que o lift reportado encolhe quando é corrigido?
Porque a correção move a estimativa dos respondentes que você de fato observou para o público de campanha que você quer, e são populações diferentes. No estudo de caso publicado por Fan e colegas, o lift aditivo bruto sobre lembrança de anúncio foi 0,033 com erro padrão de 0,011, e depois da extrapolação para todos os usuários da campanha ficou 0,027 com erro padrão de 0,016. A estimativa pontual caiu e a incerteza cresceu, porque a incerteza de modelo foi somada à incerteza amostral.
O estudo de lift de marca mede por pessoa ou por cookie?
Em geral por cookie ou por conta, não por pessoa real. O Google é explícito ao dizer que estima lift por cookie, e que isso subestima o lift por pessoa e o lift total da campanha, porque cookies de controle podem ter visto a campanha pelos outros cookies da mesma pessoa, porque as pessoas podem responder antes de ver todos os anúncios que ainda verão, e porque os efeitos de exposições múltiplas costumam ser sublineares. A direção desse viés é para baixo, então um resultado positivo sobrevive a ele.