Fadiga de Criativo: como testar frequência de anúncio
Fadiga de criativo: por que a curva de frequência do painel não é causal, o que os dados de campo mostram e como testar um teto de frequência de verdade.

📚 Este artigo faz parte do guia Otimização de Conversão (CRO): O Guia Completo 2026.
Fadiga de criativo é a mudança na resposta de uma pessoa ao mesmo anúncio conforme ela o vê mais vezes. O problema de medição é que o número de vezes que ela viu não foi atribuído por você: foi produzido por ela e pelo sistema de entrega, juntos. É por isso que a curva de frequência da sua plataforma de anúncios não é evidência de fadiga, e por isso que lê-la como se fosse leva times a rotacionar criativo num calendário que ninguém nunca testou. A versão limpa da pergunta é um experimento de política: sorteie um teto de frequência, não mexa em mais nada e compare um denominador que existe nos dois braços. Este guia cobre o que é e o que não é fadiga, o que o laboratório e o campo de fato relatam, por que o gráfico do painel nasce confundido e um exemplo trabalhado em que o mesmo teste com teto lê como ganho de 82 por cento, perda de 9 por cento e nenhum efeito, dependendo de qual denominador você usa. Este guia faz parte do nosso guia completo de teste A/B.
O que é fadiga de criativo, e o que não é
Fadiga é uma afirmação sobre o efeito do tratamento, não sobre o público. Ela diz que o efeito de mostrar o seu anúncio para alguém depende de quantas vezes essa pessoa já o viu, e que depois de certo número de exposições a impressão marginal para de ajudar e pode passar a atrapalhar.
Esse é um formato incomum para um experimento. Num teste A/B de página comum o tratamento é constante: todo mundo no braço variante vê a mesma página, e o décimo visitante recebe o mesmo tratamento que o primeiro. Numa pergunta de fadiga o tratamento muda embaixo de você enquanto a campanha roda, e muda num ritmo diferente para cada pessoa.
| propriedade | teste A/B comum | pergunta de fadiga |
|---|---|---|
| o que é sorteado | a variação que a pessoa vê | a política que governa com que frequência ela vê |
| o tratamento é constante | sim, por construção | não, ele se acumula por pessoa |
| quem decide a dose | você | o leilão, a navegação da pessoa e o seu orçamento |
| o que varia entre pessoas | nada, em expectativa | o número de exposições, sistematicamente |
| unidade de análise honesta | o visitante | a pessoa alcançada, numa janela fixa |
| o que mais dá errado | peeking, perda de rastreamento | condicionar na frequência depois do fato |
A última linha é a que arruína em silêncio quase toda análise de fadiga, e merece o resto desta seção.
Frequência é uma variável pós-tratamento. Ninguém foi sorteado para a frequência 8. As pessoas chegaram à frequência 8 porque navegaram muito, porque eram baratas de alcançar, porque o sistema de entrega continuou julgando-as relevantes e porque o seu orçamento durou o bastante. Cada um desses motivos também é plausivelmente ligado a se elas iam comprar de você.
É o mesmo problema estrutural que descrevemos em análise por gatilho e diluição e em viés de instrumentação: no momento em que você fatia o resultado por algo que aconteceu depois do sorteio, as fatias deixam de ser comparáveis, e a diferença entre elas deixa de ser efeito causal de qualquer coisa.
O laboratório diz dez exposições, o painel diz três
Pergunte a um comprador de mídia quando o anúncio fadiga e você vai ouvir, quase sempre, um número entre 2 e 4. Pergunte à literatura acadêmica e a resposta é bem outra.
Schmidt e Eisend publicaram uma meta-análise sobre repetição publicitária no Journal of Advertising em 2015. O resumo do artigo relata que, em ambiente experimental, a atitude máxima em relação à marca é atingida por volta de dez exposições, e que a lembrança cresce de forma linear e não estabiliza antes da oitava exposição. Os autores enquadram o resultado explicitamente como apoio aos repeticionistas contra os minimalistas: são necessárias mais exposições, não menos, para maximizar a resposta do consumidor. Relatam também que os efeitos de repetição decaem com o tempo, tanto para atitude quanto para lembrança, e que baixo envolvimento e exposições espaçadas reforçam o efeito sobre atitude, enquanto exposições concentradas reforçam a lembrança.
Isso é quase o oposto do folclore. Então qual está certo?
Os dois, porque medem coisas diferentes em lugares diferentes. A reconciliação honesta é esta.
A conclusão prática não é que o número do laboratório seja o seu número. É que você não tem um número, e o que está no slide veio de uma convenção de planejamento, não de uma medição da sua campanha. Qualquer limiar que valha a pena seguir precisa sair de um experimento que você rodou.
O que um bidder em produção realmente enxerga
Existe evidência de campo, e ela é mais interessante do que qualquer um dos lados do folclore.
Moriwaki, Fujita e Yasui, da CyberAgent, com Hoshino, da Universidade Keio e do RIKEN Center for Advanced Intelligence Project, publicaram Fatigue-Aware Ad Creative Selection, descrevendo um algoritmo de seleção de criativo colocado em produção num ambiente de real-time bidding e testado contra dois baselines. Os resultados relatados:
- Nos dados reais de bidding, 47,5 por cento dos pares de criativo e usuário aparecem mais de uma vez em 24 horas, o que faz com que 64,6 por cento dos usuários tenham exposição múltipla ao mesmo criativo. Exposição repetida não é caso de borda, é o estado normal da mídia display.
- O teste ao vivo rodou por uma semana em três campanhas, com cerca de 1,08 a 1,10 milhão de impressões em cada um dos três braços: 1.097.261 para o algoritmo consciente de fadiga, 1.081.393 para o baseline e 1.087.931 para alocação aleatória.
- Normalizado contra o braço aleatório, o algoritmo consciente de fadiga chegou a 1,08 em taxa de clique e 1,09 em taxa de conversão pós-impressão, contra 1,04 e 1,04 do baseline. Os autores marcam a diferença de clique contra o baseline no nível de 10 por cento, e a de conversão pós-impressão no nível de 1 por cento.
- Por campanha, as taxas de clique normalizadas foram 1,21, 1,04 e 1,32 para o algoritmo consciente de fadiga, contra 0,95, 1,03 e 1,11 do baseline. O baseline perdeu para a alocação aleatória em uma das três campanhas.
A frase mais útil do artigo, para o nosso propósito, é sobre o formato da relação. Usando apenas os logs do braço de alocação aleatória, justamente para que as escolhas do próprio algoritmo não confundam o quadro, os autores relatam que a taxa de clique cai de forma constante com a fadiga, enquanto a taxa de conversão mostra uma relação mais complexa, com efeitos positivos e negativos.
A explicação que eles propõem vale ser reproduzida em espírito: a pessoa clica num criativo novo e fresco por simples curiosidade, mas não age sobre a oferta até ter entendido a mensagem, e entender exige repetição. Clique premia novidade; conversão premia compreensão.
Isso tem uma consequência operacional direta. Se você define fadiga como queda de taxa de clique, você definiu uma métrica que cai com a repetição quase por construção. Você sempre vai conseguir declarar fadiga, sempre vai conseguir justificar uma troca de criativo e nunca vai descobrir se a troca valeu o custo de produção.
Por que o gráfico de frequência do seu painel não prova nada
Toda plataforma grande de anúncios quebra o seu resultado por faixa de frequência. O gráfico quase sempre desce. E quase sempre não informa nada sobre fadiga, por três motivos que se somam.
Seleção para dentro da faixa. Chegar à frequência 10 exige ser alcançável dez vezes dentro da janela. Usuários pesados de plataforma, pessoas com identificador estável, gente cujo feed você compra barato: são eles que povoam as faixas altas. Usuários leves, quem limpou cookies, quem está em inventário caro: ficam nas faixas baixas. São populações diferentes, com taxas de compra de base diferentes, antes de qualquer anúncio ter sido mostrado.
O denominador se move junto com a faixa. Se você plota conversões por impressão contra frequência, a faixa de frequência 10 tem dez impressões no denominador para cada pessoa, e a faixa de frequência 1 tem uma. Uma pessoa que compra depois da primeira impressão contribui com taxa de 1,0 na faixa 1 e de 0,1 na faixa 10, pela mesma compra. O gráfico desce mesmo que a repetição não faça absolutamente nada.
O algoritmo escolheu. Numa plataforma otimizada, o sistema de entrega decide quem recebe a impressão número 7. E decide usando a própria predição de resposta. Essa predição é correlacionada com o desfecho que você está medindo, que é exatamente o problema de alocação endógena que cobrimos em teste A/B na plataforma de anúncios e em teste A/B de criativo de anúncio.
O desenho limpo: sorteie o teto, não a frequência
Você não consegue sortear a frequência de uma pessoa, porque frequência é produzida, não atribuída. Você consegue sortear a política que dá forma a ela. É esse o truque inteiro.
Divida o seu público endereçável em dois braços antes de a entrega começar. Num braço, aplique um teto de frequência. No outro, deixe a entrega sem restrição. Todo o resto segue idêntico: mesmo criativo, mesmo orçamento por braço, mesma estratégia de lance, mesma página de destino, mesma janela. Depois compare os braços num denominador que exista nos dois.
| elemento do desenho | como definir | por que importa |
|---|---|---|
| unidade de sorteio | a pessoa ou o identificador dela, fixado antes da primeira impressão | frequência se acumula por pessoa, então a pessoa é a única unidade estável |
| tratamento | a política de teto, por exemplo no máximo 3 impressões a cada 7 dias | uma política pode ser atribuída; uma frequência não |
| orçamento | igual e pacificado de forma independente por braço | orçamento compartilhado deixa os braços competirem, e isso é outro viés |
| métrica primária | compras por pessoa alcançada, numa janela fixa | o único denominador que significa a mesma coisa nos dois braços |
| métrica de guarda | total de pessoas alcançadas e custo por pessoa alcançada | o teto libera orçamento, o que muda o alcance se você deixar |
| o que você não pode comparar | taxa de clique ou custo por impressão | o teto apaga por desenho as impressões mais baratas e de menor resposta |
| janela | mesmo tamanho de calendário nos dois braços | fadiga é cumulativa, então janela mais curta é dose menor |
A penúltima linha é a armadilha que este guia inteiro existe para evitar, então ela ganha um exemplo trabalhado próprio.
Exemplo trabalhado: um teste, três denominadores, três vereditos
Um varejista roda o desenho acima por quatro semanas. O braço A fica sem teto, o braço B fica com teto de 3 impressões por pessoa por semana. Os dois braços alcançam 84 mil pessoas. O braço sem teto serve 840 mil impressões, uma frequência média de 10. O braço com teto serve 420 mil, frequência média de 5.
| braço | pessoas alcançadas | impressões | cliques | compras |
|---|---|---|---|---|
| A, sem teto | 84.000 | 840.000 | 6.552 | 1.092 |
| B, teto de 3 por semana | 84.000 | 420.000 | 5.964 | 1.118 |
São valores construídos, escolhidos para que as três leituras abaixo sejam internamente consistentes. Toda estatística citada é saída do mesmo motor de duas proporções que alimenta a calculadora desta página, então você pode colar os números e reproduzir cada uma.
Leitura 1, cliques por pessoa alcançada. 6.552 de 84.000 contra 5.964 de 84.000. Isso dá 7,80 por cento contra 7,10 por cento, uma diferença relativa de menos 8,97 por cento, com intervalo de confiança sobre a diferença de menos 0,9511 a menos 0,4489 ponto percentual e p-valor abaixo de 0,000001. O teto perde, de forma decisiva.
Leitura 2, taxa de clique por impressão. 6.552 de 840.000 contra 5.964 de 420.000. Isso dá 0,78 por cento contra 1,42 por cento, uma diferença relativa de mais 82,05 por cento, com intervalo de mais 0,5996 a mais 0,6804 ponto percentual e p-valor abaixo de 0,000001. O teto vence, de forma espetacular.
Leitura 3, compras por pessoa alcançada. 1.092 de 84.000 contra 1.118 de 84.000. Isso dá 1,3000 por cento contra 1,3310 por cento, uma diferença relativa de mais 2,38 por cento, com intervalo de menos 0,0780 a mais 0,1399 ponto percentual e p-valor de 0,5777. Nada a relatar.
Cole qualquer um dos três pares na calculadora e você obtém os números acima.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
O relato honesto deste teste é curto. O teto cortou as impressões pela metade e não conseguimos detectar diferença em compras por pessoa alcançada. Esse é um achado real e útil, porque metade das impressões custa aproximadamente metade do dinheiro. E não é, de forma alguma, “o teto elevou a conversão em 2,4 por cento”, porque o intervalo cruza o zero e o p-valor é 0,58. Nem é “o teto elevou a taxa de clique em 82 por cento”, porque esse número é aritmética, não comportamento.
Quanto tráfego um teste de fadiga realmente precisa
A razão de quase toda decisão de fadiga do mercado ser tomada no clique é que o clique é a única métrica cujo orçamento de poder fecha numa campanha normal.
Com as taxas de base do exemplo acima, detectar uma mudança relativa de 10 por cento a 95 por cento de confiança e 80 por cento de poder exige:
| métrica | base | pessoas por braço para 10 por cento relativo | dias a 60 mil pessoas por semana |
|---|---|---|---|
| cliques por pessoa alcançada | 7,80 por cento | 19.400 | 5 |
| compras por pessoa alcançada | 1,30 por cento | 125.058 | 30 |
| compras, para resolver os 2,38 por cento vistos acima | 1,30 por cento | 2.128.761 | cerca de 497 |
A terceira linha é a que assusta. Para estabelecer que a diferença de 2,38 por cento do exemplo trabalhado é real e não ruído, seriam necessárias mais de dois milhões de pessoas por braço. Isso não é defeito do desenho, é a aritmética de um efeito pequeno sobre uma base pequena, e é a mesma parede que Lewis e Rao documentaram em 25 experimentos de campo de publicidade no Quarterly Journal of Economics: as vendas individuais são tão voláteis em relação ao custo per capita da publicidade que experimentos informativos podem exigir mais de dez milhões de pessoas-semana.
Rode os seus próprios números antes de comprometer um mês de orçamento:
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
A saída prática não é desistir da métrica de venda. É dimensionar o teste para uma decisão que você de fato tomaria. Raramente a pergunta é “o efeito é exatamente 2,4 por cento”. Quase sempre a pergunta é “consigo cortar as minhas impressões pela metade sem perder venda”, que é uma pergunta de não inferioridade com uma margem escolhida por você, e que precisa de muito menos tráfego do que resolver um efeito positivo minúsculo.
Escolhendo uma regra de troca que você consegue defender
Depois que você tem um teste de teto em que confia, a pergunta da rotação de criativo fica tratável. O erro é tratar “trocar a cada 14 dias” como achado. É um calendário, e calendário é barato de afirmar e caro de seguir.
| regra | o que ela assume | como merecê-la |
|---|---|---|
| trocar em calendário fixo | que a fadiga chega na mesma hora em toda campanha | nada; isso é um padrão, não um achado |
| trocar quando a frequência passar de N | que a frequência causa a queda | exige o experimento de teto acima, por tipo de campanha |
| trocar quando o custo por resultado dobrar | que a alta é do criativo, não do leilão | precisa de um holdout, ou o leilão leva a culpa de qualquer jeito |
| trocar por teste de rotação sorteado | nada além do sorteio | rode dois braços: rotacionar no calendário contra manter o criativo vigente |
| parar de trocar quando o criativo novo parar de vencer o antigo | que o vigente é o controle certo | é o padrão honesto, e o mais barato de manter |
A última linha merece ênfase porque inverte o enquadramento habitual. A pergunta não é “este criativo fadigou”. A pergunta é “um criativo novo vence este aqui agora”, e isso é um teste A/B comum com o vigente como controle. Não precisa de teoria de fadiga, nem de limiar, nem de calendário. Se o desafiante vencer, troque. Se não vencer, você acabou de poupar um ciclo de produção.
Isso também contorna o confundimento por inteiro. Você deixa de condicionar na frequência e passa a sortear qual criativo a pessoa vê em seguida, que é algo sob o seu controle.
Erros comuns
- Ler o gráfico de faixa de frequência como curva dose-resposta. Ele descreve a entrega. Três vieses separados o empurram para baixo antes de a fadiga ter direito a voto.
- Comparar custo por impressão ou taxa de clique entre um braço com teto e um sem teto. O teto apaga as impressões que tinham menos chance de gerar resposta. Toda razão por impressão melhora, mecanicamente.
- Usar uma janela mais curta no braço com teto. Fadiga é cumulativa. Janela mais curta é dose menor, não teste mais limpo.
- Deixar os braços dividirem orçamento. O braço com teto gasta menos por pessoa, então vai alcançar mais gente a não ser que você pacifique o orçamento separadamente. Aí você testa alcance e frequência ao mesmo tempo e não consegue separar.
- Declarar fadiga a partir de métrica de clique. Nos dados de campo da CyberAgent, a taxa de clique cai com a fadiga enquanto a de conversão não segue o mesmo caminho. Uma métrica de fadiga baseada em clique encontra fadiga por construção.
- Rotacionar criativo porque um limiar de agência mandou. Limiares como frequência 3 circulam como convenção de planejamento. Atribua-os como tal se for citá-los, e não os trate como resultado medido na sua conta.
- Esquecer que identificador decai. Se o seu contador de frequência zera quando o cookie é limpo, a frequência medida subestima a dose real, e subestima mais justamente para as pessoas mais difíceis de alcançar.
Faça isso automático na Donnu
Tudo acima gira em torno de uma disciplina: decidir a métrica e o denominador antes de o teste rodar, e recusar a entrada de qualquer razão por impressão na decisão. É essa a parte que os times perdem sob pressão de prazo, porque o painel oferece o número lisonjeiro primeiro e o número honesto nunca.
Na Donnu você define a métrica primária e o denominador dela na criação do experimento, a plataforma calcula o teste de duas proporções com o intervalo junto em vez de um p-valor solto, e um resultado que cruza o zero aparece como “não resolvido” em vez de virar manchete em silêncio. O teste de teto de frequência deste guia é um experimento comum de dois braços por lá: atribua a política, fixe a janela, acompanhe compras por pessoa alcançada e deixe o intervalo dizer se você já tem resposta. A Donnu é uma opção entre várias para isso; o que importa é o desenho, e ele funciona igual em qualquer ferramenta que deixe você sortear uma política e manter um denominador fixo.
Perguntas frequentes
As perguntas no topo desta página cobrem a definição de fadiga de criativo, se frequência 3 é um limiar real, por que o gráfico do painel não responde à pergunta, como desenhar o teste de teto, onde a fadiga aparece entre cliques e conversões e quanto tráfego o teste exige.
Referências
- Moriwaki, D., Fujita, K., Yasui, S. e Hoshino, T. Fatigue-Aware Ad Creative Selection. CyberAgent, Universidade Keio e RIKEN Center for Advanced Intelligence Project, 2019. Fonte dos 47,5 por cento de pares criativo-usuário repetidos em 24 horas, dos 64,6 por cento de usuários com exposição múltipla, do teste ao vivo de uma semana em três campanhas, das 1.097.261 / 1.081.393 / 1.087.931 impressões por braço, dos normalizados 1,08 e 1,09 contra 1,04 e 1,04 com os níveis de significância declarados, dos 1,21 / 1,04 / 1,32 contra 0,95 / 1,03 / 1,11 por campanha, e da afirmação de que a taxa de clique cai de forma constante com a fadiga enquanto a taxa de conversão mostra efeitos positivos e negativos no braço de alocação aleatória. PDF lido na íntegra. arxiv.org.
- Schmidt, S. e Eisend, M. Advertising Repetition: A Meta-Analysis on Effective Frequency in Advertising. Journal of Advertising, 44(4), 2015. Fonte da atitude máxima por volta de dez exposições, da lembrança que não estabiliza antes da oitava exposição, do decaimento dos efeitos de repetição ao longo do tempo e dos moderadores de envolvimento e espaçamento. Resumo lido no registro do repositório institucional dos autores; o texto completo da editora está atrás de paywall e as afirmações acima se limitam ao que o resumo declara. ucrisportal.univie.ac.at · tandfonline.com.
- Lewis, R. A. e Rao, J. M. The Unfavorable Economics of Measuring the Returns to Advertising. Quarterly Journal of Economics, 130(4), 2015. Fonte dos 25 experimentos de campo, dos 2,8 milhões de dólares gastos, do coeficiente de variação de 10, das mais de 10 milhões de pessoas-semana e do intervalo de confiança mediano sobre retorno de investimento com mais de 100 pontos percentuais de largura. PDF lido na íntegra. gwern.net.
- Zajonc, R. B. Attitudinal Effects of Mere Exposure. Journal of Personality and Social Psychology, 9(2), 1968. Citado aqui apenas como origem do resultado de mera exposição sobre o qual o modelo de dois fatores da repetição se apoia, conforme descrito por Moriwaki e colegas. psycnet.apa.org.
Leia também: Teste A/B de criativo de anúncio · Teste A/B na plataforma de anúncios · Teste de incrementalidade · Efeito de novidade · Holdout de longo prazo · Análise por gatilho e diluição · Read in English
Perguntas frequentes
- O que é fadiga de criativo?
- Fadiga de criativo é a mudança na resposta de uma pessoa ao mesmo anúncio conforme ela o vê mais vezes. É uma propriedade do tratamento, não do público: a quinta impressão de um criativo é um tratamento diferente da primeira, entregue à mesma pessoa. É isso que torna a medição desconfortável, porque o número de impressões que cada pessoa recebe é decidido em parte pelo comportamento dela.
- Frequência 3 é mesmo o ponto em que o anúncio começa a fadigar?
- Não existe experimento publicado que estabeleça um limiar universal, e o número não bate com a evidência acadêmica. A meta-análise de Schmidt e Eisend (Journal of Advertising, 2015) relata que, em ambiente experimental, a atitude máxima em relação à marca é atingida por volta de dez exposições e que a lembrança não estabiliza antes da oitava. O limiar 3 circula como convenção de planejamento, não como resultado medido, e o único jeito de achar o seu número é sortear um teto e medir o resultado que você de fato vende.
- Por que não posso simplesmente ler o gráfico de frequência contra desempenho da plataforma?
- Porque frequência é desfecho, não sorteio. Quem chega à frequência 10 é diferente de quem parou na frequência 1: passa mais tempo na plataforma, é mais fácil de alcançar e o sistema de entrega escolheu continuar servindo. Comparar desempenho entre faixas de frequência compara pessoas diferentes e condiciona numa variável decidida depois que o tratamento começou. O gráfico descreve a sua entrega, não mede fadiga.
- Como testar um teto de frequência do jeito certo?
- Sorteie a política, não o desfecho. Divida o público em dois braços antes de a entrega começar, aplique um teto num braço e deixe o outro sem teto, e compare um denominador que existe nos dois, como compras por pessoa alcançada. Nunca compare custo por impressão ou taxa de clique por impressão entre os braços: o teto elimina justamente as impressões mais baratas e de menor resposta, então essas razões melhoram mecanicamente mesmo sem nenhuma mudança de comportamento.
- A fadiga aparece no clique ou na conversão?
- Não do mesmo jeito. Nos dados de campo publicados por Moriwaki e colegas na CyberAgent, medidos apenas no braço de alocação aleatória de um bidder em produção, a taxa de clique cai de forma constante conforme a medida de fadiga sobe, enquanto a taxa de conversão mostra uma relação mais complexa, com trechos positivos e negativos. Escolher clique como métrica de fadiga garante que você vai encontrar fadiga, tendo ela custado vendas ou não.
- Quanto tráfego um teste de teto de frequência precisa?
- Muito mais do que o teste de clique a que você está acostumado. Com 7,8 por cento de cliques por pessoa alcançada, detectar uma mudança relativa de 10 por cento exige cerca de 19.400 pessoas por braço. Com 1,3 por cento de compras por pessoa alcançada, a mesma pergunta exige cerca de 125.058 pessoas por braço, o que dá aproximadamente 30 dias a 60 mil pessoas por semana divididas em dois braços. Essa distância é a razão de quase toda decisão de fadiga ser tomada no clique.