CRO

Fadiga de Criativo: como testar frequência de anúncio

Fadiga de criativo: por que a curva de frequência do painel não é causal, o que os dados de campo mostram e como testar um teto de frequência de verdade.

Ilustração plana de cinco cartões retangulares idênticos enfileirados sobre uma superfície lisa, com intensidade de cor decrescente entre eles, sobre fundo verde menta

Fadiga de criativo é a mudança na resposta de uma pessoa ao mesmo anúncio conforme ela o vê mais vezes. O problema de medição é que o número de vezes que ela viu não foi atribuído por você: foi produzido por ela e pelo sistema de entrega, juntos. É por isso que a curva de frequência da sua plataforma de anúncios não é evidência de fadiga, e por isso que lê-la como se fosse leva times a rotacionar criativo num calendário que ninguém nunca testou. A versão limpa da pergunta é um experimento de política: sorteie um teto de frequência, não mexa em mais nada e compare um denominador que existe nos dois braços. Este guia cobre o que é e o que não é fadiga, o que o laboratório e o campo de fato relatam, por que o gráfico do painel nasce confundido e um exemplo trabalhado em que o mesmo teste com teto lê como ganho de 82 por cento, perda de 9 por cento e nenhum efeito, dependendo de qual denominador você usa. Este guia faz parte do nosso guia completo de teste A/B.

O que é fadiga de criativo, e o que não é

Fadiga é uma afirmação sobre o efeito do tratamento, não sobre o público. Ela diz que o efeito de mostrar o seu anúncio para alguém depende de quantas vezes essa pessoa já o viu, e que depois de certo número de exposições a impressão marginal para de ajudar e pode passar a atrapalhar.

Esse é um formato incomum para um experimento. Num teste A/B de página comum o tratamento é constante: todo mundo no braço variante vê a mesma página, e o décimo visitante recebe o mesmo tratamento que o primeiro. Numa pergunta de fadiga o tratamento muda embaixo de você enquanto a campanha roda, e muda num ritmo diferente para cada pessoa.

propriedade teste A/B comum pergunta de fadiga
o que é sorteado a variação que a pessoa vê a política que governa com que frequência ela vê
o tratamento é constante sim, por construção não, ele se acumula por pessoa
quem decide a dose você o leilão, a navegação da pessoa e o seu orçamento
o que varia entre pessoas nada, em expectativa o número de exposições, sistematicamente
unidade de análise honesta o visitante a pessoa alcançada, numa janela fixa
o que mais dá errado peeking, perda de rastreamento condicionar na frequência depois do fato

A última linha é a que arruína em silêncio quase toda análise de fadiga, e merece o resto desta seção.

Frequência é uma variável pós-tratamento. Ninguém foi sorteado para a frequência 8. As pessoas chegaram à frequência 8 porque navegaram muito, porque eram baratas de alcançar, porque o sistema de entrega continuou julgando-as relevantes e porque o seu orçamento durou o bastante. Cada um desses motivos também é plausivelmente ligado a se elas iam comprar de você.

É o mesmo problema estrutural que descrevemos em análise por gatilho e diluição e em viés de instrumentação: no momento em que você fatia o resultado por algo que aconteceu depois do sorteio, as fatias deixam de ser comparáveis, e a diferença entre elas deixa de ser efeito causal de qualquer coisa.

O laboratório diz dez exposições, o painel diz três

Pergunte a um comprador de mídia quando o anúncio fadiga e você vai ouvir, quase sempre, um número entre 2 e 4. Pergunte à literatura acadêmica e a resposta é bem outra.

Schmidt e Eisend publicaram uma meta-análise sobre repetição publicitária no Journal of Advertising em 2015. O resumo do artigo relata que, em ambiente experimental, a atitude máxima em relação à marca é atingida por volta de dez exposições, e que a lembrança cresce de forma linear e não estabiliza antes da oitava exposição. Os autores enquadram o resultado explicitamente como apoio aos repeticionistas contra os minimalistas: são necessárias mais exposições, não menos, para maximizar a resposta do consumidor. Relatam também que os efeitos de repetição decaem com o tempo, tanto para atitude quanto para lembrança, e que baixo envolvimento e exposições espaçadas reforçam o efeito sobre atitude, enquanto exposições concentradas reforçam a lembrança.

Isso é quase o oposto do folclore. Então qual está certo?

Os dois, porque medem coisas diferentes em lugares diferentes. A reconciliação honesta é esta.

Por que estudos de repetição em laboratório e painéis de anúncio discordam sobre fadigaDuas faixas empilhadas. A faixa de cima representa o ambiente de laboratório: um número controlado de exposições é atribuído a cada participante, o desfecho é uma resposta de pesquisa sobre atitude ou lembrança de marca, e o pico relatado fica perto de dez exposições. A faixa de baixo representa o ambiente da plataforma de anúncios: o número de exposições é produzido pela entrega em vez de atribuído, o desfecho é um clique ou uma compra, e a queda aparente começa por volta da frequência três. Uma seta entre as faixas indica que a diferença está no que está sendo medido, e não numa contradição entre os achados.estudo de repetição em laboratórioas exposições são ATRIBUÍDAS pelo pesquisador, iguais para todos numa condiçãoo desfecho é resposta de pesquisa: atitude de marca, lembrançao cenário é uma sessão única, sem dispersão, sem leilãopico por volta de10 exposiçõesrelatório de frequência da plataformaas exposições são PRODUZIDAS pela entrega, diferentes para cada pessoao desfecho é um clique ou uma compra, medido por impressãoo cenário é um leilão que segue escolhendo quem alcançar de novoqueda aparente perto defrequência 3desfecho diferente, sorteio diferente: não é contradição
O pico do laboratório e a queda do painel são respostas a perguntas diferentes. O laboratório atribui a dose e mede memória; a plataforma observa uma dose que não atribuiu e mede um clique. Só um dos dois é uma afirmação causal sobre exposições.

A conclusão prática não é que o número do laboratório seja o seu número. É que você não tem um número, e o que está no slide veio de uma convenção de planejamento, não de uma medição da sua campanha. Qualquer limiar que valha a pena seguir precisa sair de um experimento que você rodou.

O que um bidder em produção realmente enxerga

Existe evidência de campo, e ela é mais interessante do que qualquer um dos lados do folclore.

Moriwaki, Fujita e Yasui, da CyberAgent, com Hoshino, da Universidade Keio e do RIKEN Center for Advanced Intelligence Project, publicaram Fatigue-Aware Ad Creative Selection, descrevendo um algoritmo de seleção de criativo colocado em produção num ambiente de real-time bidding e testado contra dois baselines. Os resultados relatados:

A frase mais útil do artigo, para o nosso propósito, é sobre o formato da relação. Usando apenas os logs do braço de alocação aleatória, justamente para que as escolhas do próprio algoritmo não confundam o quadro, os autores relatam que a taxa de clique cai de forma constante com a fadiga, enquanto a taxa de conversão mostra uma relação mais complexa, com efeitos positivos e negativos.

A explicação que eles propõem vale ser reproduzida em espírito: a pessoa clica num criativo novo e fresco por simples curiosidade, mas não age sobre a oferta até ter entendido a mensagem, e entender exige repetição. Clique premia novidade; conversão premia compreensão.

Taxa de clique e taxa de conversão respondem de formas diferentes à fadiga acumuladaUm gráfico com a fadiga crescendo no eixo horizontal e a resposta no eixo vertical. Uma curva, representando a taxa de clique, cai de forma constante e monotônica da esquerda para a direita. Uma segunda curva, representando a taxa de conversão, sobe no começo, achata e depois cai, ficando acima do nível inicial ao longo do meio da faixa. A figura é uma reconstrução qualitativa da direção relatada por Moriwaki e colegas no braço de alocação aleatória, e não uma reprodução dos valores medidos.a métrica escolhida decide se você vai encontrar fadigaformato qualitativo relatado no braço de alocação aleatória, não valores medidosfadiga acumulada (exposição repetida ao mesmo criativo)respostacai o tempo todosobe, achata, depois caitaxa de cliquetaxa de conversãomeça fadiga no clique e você sempre vai encontrá-la
Direção da relação relatada por Moriwaki e colegas usando apenas o braço de alocação aleatória. A taxa de clique cai de forma constante com a fadiga acumulada; a taxa de conversão não segue o mesmo caminho. As curvas mostram direção e formato, não reproduzem os valores do artigo.

Isso tem uma consequência operacional direta. Se você define fadiga como queda de taxa de clique, você definiu uma métrica que cai com a repetição quase por construção. Você sempre vai conseguir declarar fadiga, sempre vai conseguir justificar uma troca de criativo e nunca vai descobrir se a troca valeu o custo de produção.

Por que o gráfico de frequência do seu painel não prova nada

Toda plataforma grande de anúncios quebra o seu resultado por faixa de frequência. O gráfico quase sempre desce. E quase sempre não informa nada sobre fadiga, por três motivos que se somam.

Seleção para dentro da faixa. Chegar à frequência 10 exige ser alcançável dez vezes dentro da janela. Usuários pesados de plataforma, pessoas com identificador estável, gente cujo feed você compra barato: são eles que povoam as faixas altas. Usuários leves, quem limpou cookies, quem está em inventário caro: ficam nas faixas baixas. São populações diferentes, com taxas de compra de base diferentes, antes de qualquer anúncio ter sido mostrado.

O denominador se move junto com a faixa. Se você plota conversões por impressão contra frequência, a faixa de frequência 10 tem dez impressões no denominador para cada pessoa, e a faixa de frequência 1 tem uma. Uma pessoa que compra depois da primeira impressão contribui com taxa de 1,0 na faixa 1 e de 0,1 na faixa 10, pela mesma compra. O gráfico desce mesmo que a repetição não faça absolutamente nada.

O algoritmo escolheu. Numa plataforma otimizada, o sistema de entrega decide quem recebe a impressão número 7. E decide usando a própria predição de resposta. Essa predição é correlacionada com o desfecho que você está medindo, que é exatamente o problema de alocação endógena que cobrimos em teste A/B na plataforma de anúncios e em teste A/B de criativo de anúncio.

Três razões pelas quais o gráfico de frequência contra desempenho não mede fadigaTrês linhas empilhadas. A primeira, seleção para dentro da faixa, mostra que quem chega a uma frequência alta já era diferente de quem parou numa baixa, antes de qualquer anúncio ter sido servido. A segunda, denominador móvel, mostra que dividir conversões por impressões coloca dez impressões sob cada pessoa de frequência alta e uma sob cada pessoa de frequência baixa, então a razão cai mesmo sem mudança de comportamento. A terceira, escolha algorítmica, mostra que o sistema de entrega seleciona quem recebe mais uma impressão usando a própria predição de resposta, que é correlacionada com o desfecho medido.o gráfico de frequência desce por três motivos, e nenhum deles é fadiga1seleção para dentro da faixaquem chega à frequência 10 já era diferente de quem parou na 1uso mais pesado da plataforma, identificador mais estável, inventário mais barato2o denominador se move com a faixauma compra conta como 1 de 1 impressão na frequência 1, e 1 de 10 na frequência 10a razão cai mecanicamente mesmo com comportamento idêntico3o algoritmo escolheu quem recebe a impressão número 7a entrega usa a própria predição de resposta, correlacionada com o desfecho medidoo sorteio não é independente do desfecho potencialos três empurram na mesma direção, e por isso o gráfico convence e não significa nada
O relatório de frequência descreve como a sua entrega aconteceu, não mede o que a repetição fez. Os três efeitos enviesam na mesma direção, e é por isso que o gráfico parece tão consistente entre contas e campanhas diferentes.

O desenho limpo: sorteie o teto, não a frequência

Você não consegue sortear a frequência de uma pessoa, porque frequência é produzida, não atribuída. Você consegue sortear a política que dá forma a ela. É esse o truque inteiro.

Divida o seu público endereçável em dois braços antes de a entrega começar. Num braço, aplique um teto de frequência. No outro, deixe a entrega sem restrição. Todo o resto segue idêntico: mesmo criativo, mesmo orçamento por braço, mesma estratégia de lance, mesma página de destino, mesma janela. Depois compare os braços num denominador que exista nos dois.

elemento do desenho como definir por que importa
unidade de sorteio a pessoa ou o identificador dela, fixado antes da primeira impressão frequência se acumula por pessoa, então a pessoa é a única unidade estável
tratamento a política de teto, por exemplo no máximo 3 impressões a cada 7 dias uma política pode ser atribuída; uma frequência não
orçamento igual e pacificado de forma independente por braço orçamento compartilhado deixa os braços competirem, e isso é outro viés
métrica primária compras por pessoa alcançada, numa janela fixa o único denominador que significa a mesma coisa nos dois braços
métrica de guarda total de pessoas alcançadas e custo por pessoa alcançada o teto libera orçamento, o que muda o alcance se você deixar
o que você não pode comparar taxa de clique ou custo por impressão o teto apaga por desenho as impressões mais baratas e de menor resposta
janela mesmo tamanho de calendário nos dois braços fadiga é cumulativa, então janela mais curta é dose menor

A penúltima linha é a armadilha que este guia inteiro existe para evitar, então ela ganha um exemplo trabalhado próprio.

Exemplo trabalhado: um teste, três denominadores, três vereditos

Um varejista roda o desenho acima por quatro semanas. O braço A fica sem teto, o braço B fica com teto de 3 impressões por pessoa por semana. Os dois braços alcançam 84 mil pessoas. O braço sem teto serve 840 mil impressões, uma frequência média de 10. O braço com teto serve 420 mil, frequência média de 5.

braço pessoas alcançadas impressões cliques compras
A, sem teto 84.000 840.000 6.552 1.092
B, teto de 3 por semana 84.000 420.000 5.964 1.118

São valores construídos, escolhidos para que as três leituras abaixo sejam internamente consistentes. Toda estatística citada é saída do mesmo motor de duas proporções que alimenta a calculadora desta página, então você pode colar os números e reproduzir cada uma.

Leitura 1, cliques por pessoa alcançada. 6.552 de 84.000 contra 5.964 de 84.000. Isso dá 7,80 por cento contra 7,10 por cento, uma diferença relativa de menos 8,97 por cento, com intervalo de confiança sobre a diferença de menos 0,9511 a menos 0,4489 ponto percentual e p-valor abaixo de 0,000001. O teto perde, de forma decisiva.

Leitura 2, taxa de clique por impressão. 6.552 de 840.000 contra 5.964 de 420.000. Isso dá 0,78 por cento contra 1,42 por cento, uma diferença relativa de mais 82,05 por cento, com intervalo de mais 0,5996 a mais 0,6804 ponto percentual e p-valor abaixo de 0,000001. O teto vence, de forma espetacular.

Leitura 3, compras por pessoa alcançada. 1.092 de 84.000 contra 1.118 de 84.000. Isso dá 1,3000 por cento contra 1,3310 por cento, uma diferença relativa de mais 2,38 por cento, com intervalo de menos 0,0780 a mais 0,1399 ponto percentual e p-valor de 0,5777. Nada a relatar.

O mesmo teste de teto de frequência lido em três denominadores diferentesTrês barras horizontais mostrando diferenças relativas do mesmo experimento. Taxa de clique por impressão mostra mais 82,05 por cento com p-valor abaixo de 0,000001. Cliques por pessoa alcançada mostra menos 8,97 por cento com p-valor abaixo de 0,000001. Compras por pessoa alcançada mostra mais 2,38 por cento com p-valor de 0,5777 e está marcado como não significante. Uma nota indica que as três leituras vêm dos mesmos dados brutos e diferem apenas no que foi colocado no denominador.um experimento, três denominadores, três respostas diferentescontagens brutas idênticas nas três linhas; só o denominador mudasem diferençataxa de cliquepor impressão+82,05%p abaixo de 0,000001cliquespor pessoa alcançada-8,97%p abaixo de 0,000001compraspor pessoa alcançada+2,38%p = 0,5777, não significantesó a terceira linha responde a uma pergunta de negócio
As mesmas 84 mil pessoas por braço, os mesmos cliques e as mesmas compras, divididos de três jeitos. Os mais 82 por cento são artefato de tirar impressões do denominador; os menos 9 por cento são reais, mas medem clique, não venda; a terceira linha é a que você pode usar, e ela diz que você ainda não sabe.

Cole qualquer um dos três pares na calculadora e você obtém os números acima.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

O relato honesto deste teste é curto. O teto cortou as impressões pela metade e não conseguimos detectar diferença em compras por pessoa alcançada. Esse é um achado real e útil, porque metade das impressões custa aproximadamente metade do dinheiro. E não é, de forma alguma, “o teto elevou a conversão em 2,4 por cento”, porque o intervalo cruza o zero e o p-valor é 0,58. Nem é “o teto elevou a taxa de clique em 82 por cento”, porque esse número é aritmética, não comportamento.

Quanto tráfego um teste de fadiga realmente precisa

A razão de quase toda decisão de fadiga do mercado ser tomada no clique é que o clique é a única métrica cujo orçamento de poder fecha numa campanha normal.

Com as taxas de base do exemplo acima, detectar uma mudança relativa de 10 por cento a 95 por cento de confiança e 80 por cento de poder exige:

métrica base pessoas por braço para 10 por cento relativo dias a 60 mil pessoas por semana
cliques por pessoa alcançada 7,80 por cento 19.400 5
compras por pessoa alcançada 1,30 por cento 125.058 30
compras, para resolver os 2,38 por cento vistos acima 1,30 por cento 2.128.761 cerca de 497

A terceira linha é a que assusta. Para estabelecer que a diferença de 2,38 por cento do exemplo trabalhado é real e não ruído, seriam necessárias mais de dois milhões de pessoas por braço. Isso não é defeito do desenho, é a aritmética de um efeito pequeno sobre uma base pequena, e é a mesma parede que Lewis e Rao documentaram em 25 experimentos de campo de publicidade no Quarterly Journal of Economics: as vendas individuais são tão voláteis em relação ao custo per capita da publicidade que experimentos informativos podem exigir mais de dez milhões de pessoas-semana.

Rode os seus próprios números antes de comprometer um mês de orçamento:

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

A saída prática não é desistir da métrica de venda. É dimensionar o teste para uma decisão que você de fato tomaria. Raramente a pergunta é “o efeito é exatamente 2,4 por cento”. Quase sempre a pergunta é “consigo cortar as minhas impressões pela metade sem perder venda”, que é uma pergunta de não inferioridade com uma margem escolhida por você, e que precisa de muito menos tráfego do que resolver um efeito positivo minúsculo.

Escolhendo uma regra de troca que você consegue defender

Depois que você tem um teste de teto em que confia, a pergunta da rotação de criativo fica tratável. O erro é tratar “trocar a cada 14 dias” como achado. É um calendário, e calendário é barato de afirmar e caro de seguir.

regra o que ela assume como merecê-la
trocar em calendário fixo que a fadiga chega na mesma hora em toda campanha nada; isso é um padrão, não um achado
trocar quando a frequência passar de N que a frequência causa a queda exige o experimento de teto acima, por tipo de campanha
trocar quando o custo por resultado dobrar que a alta é do criativo, não do leilão precisa de um holdout, ou o leilão leva a culpa de qualquer jeito
trocar por teste de rotação sorteado nada além do sorteio rode dois braços: rotacionar no calendário contra manter o criativo vigente
parar de trocar quando o criativo novo parar de vencer o antigo que o vigente é o controle certo é o padrão honesto, e o mais barato de manter

A última linha merece ênfase porque inverte o enquadramento habitual. A pergunta não é “este criativo fadigou”. A pergunta é “um criativo novo vence este aqui agora”, e isso é um teste A/B comum com o vigente como controle. Não precisa de teoria de fadiga, nem de limiar, nem de calendário. Se o desafiante vencer, troque. Se não vencer, você acabou de poupar um ciclo de produção.

Isso também contorna o confundimento por inteiro. Você deixa de condicionar na frequência e passa a sortear qual criativo a pessoa vê em seguida, que é algo sob o seu controle.

Erros comuns

Faça isso automático na Donnu

Tudo acima gira em torno de uma disciplina: decidir a métrica e o denominador antes de o teste rodar, e recusar a entrada de qualquer razão por impressão na decisão. É essa a parte que os times perdem sob pressão de prazo, porque o painel oferece o número lisonjeiro primeiro e o número honesto nunca.

Na Donnu você define a métrica primária e o denominador dela na criação do experimento, a plataforma calcula o teste de duas proporções com o intervalo junto em vez de um p-valor solto, e um resultado que cruza o zero aparece como “não resolvido” em vez de virar manchete em silêncio. O teste de teto de frequência deste guia é um experimento comum de dois braços por lá: atribua a política, fixe a janela, acompanhe compras por pessoa alcançada e deixe o intervalo dizer se você já tem resposta. A Donnu é uma opção entre várias para isso; o que importa é o desenho, e ele funciona igual em qualquer ferramenta que deixe você sortear uma política e manter um denominador fixo.

Perguntas frequentes

As perguntas no topo desta página cobrem a definição de fadiga de criativo, se frequência 3 é um limiar real, por que o gráfico do painel não responde à pergunta, como desenhar o teste de teto, onde a fadiga aparece entre cliques e conversões e quanto tráfego o teste exige.

Referências

Leia também: Teste A/B de criativo de anúncio · Teste A/B na plataforma de anúncios · Teste de incrementalidade · Efeito de novidade · Holdout de longo prazo · Análise por gatilho e diluição · Read in English

Perguntas frequentes

O que é fadiga de criativo?
Fadiga de criativo é a mudança na resposta de uma pessoa ao mesmo anúncio conforme ela o vê mais vezes. É uma propriedade do tratamento, não do público: a quinta impressão de um criativo é um tratamento diferente da primeira, entregue à mesma pessoa. É isso que torna a medição desconfortável, porque o número de impressões que cada pessoa recebe é decidido em parte pelo comportamento dela.
Frequência 3 é mesmo o ponto em que o anúncio começa a fadigar?
Não existe experimento publicado que estabeleça um limiar universal, e o número não bate com a evidência acadêmica. A meta-análise de Schmidt e Eisend (Journal of Advertising, 2015) relata que, em ambiente experimental, a atitude máxima em relação à marca é atingida por volta de dez exposições e que a lembrança não estabiliza antes da oitava. O limiar 3 circula como convenção de planejamento, não como resultado medido, e o único jeito de achar o seu número é sortear um teto e medir o resultado que você de fato vende.
Por que não posso simplesmente ler o gráfico de frequência contra desempenho da plataforma?
Porque frequência é desfecho, não sorteio. Quem chega à frequência 10 é diferente de quem parou na frequência 1: passa mais tempo na plataforma, é mais fácil de alcançar e o sistema de entrega escolheu continuar servindo. Comparar desempenho entre faixas de frequência compara pessoas diferentes e condiciona numa variável decidida depois que o tratamento começou. O gráfico descreve a sua entrega, não mede fadiga.
Como testar um teto de frequência do jeito certo?
Sorteie a política, não o desfecho. Divida o público em dois braços antes de a entrega começar, aplique um teto num braço e deixe o outro sem teto, e compare um denominador que existe nos dois, como compras por pessoa alcançada. Nunca compare custo por impressão ou taxa de clique por impressão entre os braços: o teto elimina justamente as impressões mais baratas e de menor resposta, então essas razões melhoram mecanicamente mesmo sem nenhuma mudança de comportamento.
A fadiga aparece no clique ou na conversão?
Não do mesmo jeito. Nos dados de campo publicados por Moriwaki e colegas na CyberAgent, medidos apenas no braço de alocação aleatória de um bidder em produção, a taxa de clique cai de forma constante conforme a medida de fadiga sobe, enquanto a taxa de conversão mostra uma relação mais complexa, com trechos positivos e negativos. Escolher clique como métrica de fadiga garante que você vai encontrar fadiga, tendo ela custado vendas ou não.
Quanto tráfego um teste de teto de frequência precisa?
Muito mais do que o teste de clique a que você está acostumado. Com 7,8 por cento de cliques por pessoa alcançada, detectar uma mudança relativa de 10 por cento exige cerca de 19.400 pessoas por braço. Com 1,3 por cento de compras por pessoa alcançada, a mesma pergunta exige cerca de 125.058 pessoas por braço, o que dá aproximadamente 30 dias a 60 mil pessoas por semana divididas em dois braços. Essa distância é a razão de quase toda decisão de fadiga ser tomada no clique.