CRO

Teste A/B de Criativo de Anúncio: o que medir de verdade

Teste A/B de criativo de anúncio: por que o criativo escolhe o público, por que a taxa de clique engana e qual métrica sustenta a decisão.

Ilustração plana de dois porta-retratos lado a lado sobre uma superfície, um com uma forma abstrata de montanha e outro vazio, com uma lupa entre os dois, em fundo verde-menta

Teste A/B de criativo de anúncio é o experimento em que a variável trocada é o anúncio, e não a página. Ele tem um problema que nenhum teste de página tem: o sorteio não é seu. O sistema de entrega da plataforma lê o conteúdo do criativo e escolhe para quem mostrar cada versão, então os dois braços não são vistos pelas mesmas pessoas. Ali e colegas (CSCW, 2019) mediram entrega de 91 por cento de homens contra 5 por cento de homens trocando apenas a imagem, com público-alvo, lance e orçamento idênticos. A consequência prática é dura: o que você mede não é “o criativo B é melhor”, é “o pacote criativo B mais o público que a plataforma escolheu para ele é melhor”. Este guia mostra o que ainda dá para aprender dentro dessa restrição, por que a taxa de clique é a métrica mais fácil de mover e a mais fácil de errar, e um exemplo trabalhado em que o criativo vencedor no clique perde na venda. Este guia faz parte do nosso guia completo de teste A/B.

O que muda quando a variável mora dentro da plataforma

Num teste A/B de página, você controla as três coisas que fazem o resultado ser causal: quem entra no experimento, como as pessoas são sorteadas entre os braços e o que cada braço vê. Num teste de criativo, você controla só a terceira.

elemento do experimento teste A/B de página teste de criativo na plataforma
quem entra você define pela regra de público no seu site a plataforma decide dentro do seu público declarado
como é sorteado seu código, por visitante, com peso fixo o sistema de entrega, por leilão, por impressão
o que cada braço vê você define você define
por que uma pessoa viu B e não A acaso puro acaso mais previsão de relevância mais preço do leilão
o que a diferença mede efeito do tratamento efeito do tratamento somado ao efeito da entrega

A última linha é o guia inteiro em uma frase. Quando o mecanismo de alocação usa o próprio tratamento para decidir quem recebe o tratamento, a comparação deixa de ser limpa. O nome técnico do problema é alocação endógena; a consequência prática é que a diferença medida entre dois criativos mistura dois efeitos que você não consegue separar de dentro da plataforma.

Isso não torna o teste inútil. Torna a pergunta diferente. A pergunta honesta deixa de ser “qual criativo é melhor para a mesma pessoa” e passa a ser “qual pacote de criativo mais entrega compra resultado mais barato para mim hoje”. É uma pergunta de negócio legítima, e é a que a maior parte das equipes de mídia realmente quer responder. O erro é declarar a primeira quando você mediu a segunda.

A evidência de que o criativo escolhe o público

Esta não é uma preocupação teórica. Ela foi medida com anúncios reais.

Ali, Sapiezynski, Bogen, Korolova, Mislove e Rieke publicaram na CSCW de 2019 um estudo em que compraram anúncios no Facebook mantendo constantes as três coisas que um anunciante controla: o público-alvo declarado, a estratégia de lance e o orçamento diário. A única coisa que mudava era o criativo. Os resultados principais:

Composição de gênero da entrega conforme os elementos do criativo são ligadosQuatro pares de barras horizontais empilhadas, cada par comparando o anúncio de musculação com o de cosméticos. No primeiro par, só com o link de destino, a fração de homens é 48 por cento no anúncio de musculação e 40 por cento no de cosméticos, quase equilibrada. Nos pares seguintes, conforme título, texto e imagem são devolvidos ao anúncio, as barras se afastam, até o último par, com a imagem ligada, em que a entrega é 91 por cento de homens no anúncio de musculação e 5 por cento de homens no de cosméticos. O público-alvo declarado, o lance e o orçamento são os mesmos em todos os casos.mesmo público declarado, mesmo lance, mesmo orçamento: só o criativo mudabarra cheia = fração de homens na entrega · valores de Ali e colegas (2019)só o link48%40%mais títuloafastaafastamais imagem91%5%anúncio de musculaçãoanúncio de cosméticoso criativo não é só o que a pessoa vê: é parte de quem a plataforma escolhe
Reconstrução dos valores relatados por Ali e colegas (2019) na ablação de elementos do criativo. As barras intermediárias são qualitativas; os extremos, 48 e 40 por cento com só o link, e 91 e 5 por cento com a imagem ligada, são os números do artigo.

Duas leituras práticas saem daí, e as duas mudam como você desenha o teste.

A primeira: a imagem carrega o efeito de entrega muito mais que o texto. Se você vai testar criativo com alguma ambição de aprender, troque uma coisa de cada vez, e saiba que trocar a imagem é a troca que mais mexe no público entregue.

A segunda: não existe teste de criativo “de público controlado” numa plataforma otimizada. Mesmo com o mesmo público declarado, cada braço acaba com uma amostra diferente. Isso é o parente próximo do que discutimos em viés de seleção em teste A/B: a comparação só é válida se a atribuição for independente do resultado potencial, e aqui ela não é por construção.

As três métricas de um teste de criativo e o que cada uma responde

Quase toda confusão em teste de criativo vem de misturar três métricas que têm denominadores diferentes.

métrica conta o que ela responde armadilha
taxa de clique cliques / impressões qual criativo chama mais atenção no feed a mais barata de mover e a mais fraca como proxy de venda
conversão por clique pedidos / cliques qual criativo trouxe cliques que compram mais condicionada no clique: compara populações diferentes, não é causal
conversão por impressão pedidos / impressões qual criativo gera mais venda pelo mesmo espaço entregue a única com denominador comum, e a que pede muito mais amostra
custo por aquisição investimento / pedidos qual criativo compra venda mais barato mistura efeito do criativo com preço do leilão naquele público

A métrica que fecha a decisão de negócio é a conversão por impressão ou, equivalentemente, o custo por aquisição sob orçamento igual. Ela é a única em que o denominador é a mesma unidade entregue nos dois braços, e por isso a única em que “B é melhor” tem um significado direto.

A conversão por clique merece um parágrafo próprio porque ela é enganosa de um jeito específico. Ao dividir por cliques, você condiciona a análise em um evento que aconteceu depois do tratamento e que foi afetado pelo tratamento. Isso é exatamente a estrutura que estudamos em viés de colisor e condicionar depois do tratamento: o grupo dos que clicaram em A e o grupo dos que clicaram em B não são amostras da mesma população, então a diferença entre eles não é um efeito causal. Ela é uma descrição útil, e vale olhar, mas não sustenta sozinha uma decisão.

Exemplo trabalhado: o criativo que ganha no clique e perde na venda

Uma loja roda dois criativos para a mesma campanha, mesmo público declarado, mesmo orçamento, mesma página de destino. O criativo A é a foto do produto no fundo neutro. O criativo B é a foto de estilo de vida, com uma pessoa usando o produto. Ao fim do período, cada um recebeu 420 mil impressões.

criativo impressões cliques taxa de clique pedidos conversão por clique conversão por impressão
A (foto do produto) 420.000 5.040 1,2000% 252 5,0000% 0,0600%
B (estilo de vida) 420.000 6.720 1,6000% 269 4,0030% 0,0640%

As três comparações, calculadas com o mesmo teste z de duas proporções da calculadora abaixo:

comparação denominador lift relativo valor-p IC 95% da diferença leitura
taxa de clique impressões mais 33,33% abaixo de 0,0001 de 0,3498 a 0,4502 ponto percentual B ganha com folga
conversão por impressão impressões mais 6,75% 0,4563 de menos 0,0066 a 0,0147 ponto percentual não conclui nada
conversão por clique cliques menos 19,94% 0,0093 de menos 1,7597 a menos 0,2343 ponto percentual os cliques de B convertem menos
Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Cole 420000 e 5040 no lado A e 420000 e 6720 no lado B para reproduzir a primeira linha: valor-p abaixo de 0,0001 e lift relativo de 33,33 por cento. Troque para 420000 e 252 contra 420000 e 269 e a calculadora devolve valor-p de 0,4563, que é a segunda linha. Por fim, 5040 e 252 contra 6720 e 269 devolve valor-p de 0,0093 com sinal negativo, que é a terceira.

Mesma dupla de criativos lida por três métricas diferentesTrês painéis lado a lado. No primeiro, taxa de clique: o criativo B tem barra bem maior que o criativo A, com marcação de mais 33 vírgula 3 por cento e valor-p abaixo de zero vírgula zero zero zero um. No segundo, conversão por impressão: as duas barras são quase iguais, com marcação de mais 6 vírgula 75 por cento e valor-p de zero vírgula 4563, sem conclusão. No terceiro, conversão por clique: o criativo A tem a barra maior, com marcação de menos 19 vírgula 9 por cento e valor-p de zero vírgula 0093. O rodapé diz que a métrica escolhida decide qual criativo é declarado vencedor.três métricas, três vencedores diferentes, os mesmos dadostaxa de clique1,20%1,60%ABB: mais 33,3%valor-p abaixo de 0,0001conversão por impressão0,060%0,064%ABnão concluivalor-p de 0,4563conversão por clique5,00%4,00%ABA: mais 24,9%valor-p de 0,0093declare a métrica primária antes de rodar, ou o relatório vira escolha de narrativa
O painel do meio é o único cujo denominador é comum aos dois braços. Os outros dois medem coisas reais, mas nenhum deles responde “qual criativo vende mais pelo mesmo espaço entregue”. O valor de mais 24,9 por cento no terceiro painel é a mesma diferença do menos 19,94 por cento da tabela, lida na direção oposta.

A leitura honesta deste teste. O criativo B chama mais atenção: isso está provado. O criativo B vende mais: isso não está provado, o intervalo de confiança da diferença em compras por impressão vai de menos 0,0066 a mais 0,0147 ponto percentual e atravessa o zero com folga. E os cliques que B trouxe convertem menos, o que é consistente com a hipótese de que ele atrai um público mais amplo e menos qualificado, embora essa terceira comparação seja descritiva e não causal pelo motivo explicado acima.

A decisão correta com esses dados não é “troque tudo para B”. É: o teste não respondeu à pergunta que importava, porque não tinha amostra para ela. A próxima seção mostra quanta amostra faltava.

Quanto tráfego cada métrica custa

Esta tabela é a razão pela qual quase todo teste de criativo do mercado é decidido no clique: é a única métrica em que a conta fecha. Valores por criativo, 95 por cento de confiança, 80 por cento de poder, teste bicaudal de duas proporções.

métrica e taxa-base detectar mais 5% relativo detectar mais 10% relativo detectar mais 15% relativo
taxa de clique, base 1,20% 529.742 impressões 135.624 impressões 61.693 impressões
conversão por clique, base 5,00% 122.124 cliques 31.234 cliques 14.193 cliques
conversão por impressão, base 0,06% 10.720.205 impressões 2.745.377 impressões 1.249.200 impressões

Leia a última linha devagar. Para detectar um ganho de 10 por cento na métrica que decide a campanha, com uma taxa de compra por impressão de 0,06 por cento, você precisa de quase 2,75 milhões de impressões por criativo. O teste do exemplo rodou com 420 mil, ou seja, cerca de 15 por cento do necessário. O resultado “não significativo” não diz que os criativos são iguais; diz que o teste nunca teve chance.

Rode os seus números:

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Esse desconforto não é um defeito da sua operação, é uma propriedade da medição de publicidade. Lewis e Rao (Quarterly Journal of Economics, 2015) analisaram 25 experimentos de campo de publicidade digital, com 2,8 milhões de dólares em investimento e campanhas que alcançaram, na mediana, mais de 1 milhão de pessoas. O intervalo de confiança mediano sobre o retorno do investimento ficou acima de 100 pontos percentuais de largura. Num exemplo do artigo, uma campanha bem-sucedida tinha efeito de 0,35 dólar por pessoa contra um desvio-padrão de 75 dólares nas vendas individuais, o que dá um R quadrado de 0,0000054. Com 2 milhões de pessoas divididas entre teste e controle, o teste tinha poder de cerca de 95 por cento; com 200 mil pessoas, o mesmo teste falhava em rejeitar a hipótese nula 74 por cento das vezes mesmo quando o retorno verdadeiro era de 25 por cento.

Três saídas práticas, em ordem de preferência:

  1. Aceite medir no clique e declare isso. Se a pergunta é “qual criativo chama mais atenção”, a taxa de clique responde, o teste é barato e a decisão é legítima. O que não se pode é escrever “aumentou as vendas”.
  2. Teste diferenças grandes, não refinamentos. Foto de produto contra vídeo curto, promessa de benefício contra promessa de preço, formato quadrado contra vertical. Diferenças de 15 a 30 por cento cabem no orçamento; diferenças de 5 por cento não.
  3. Para a pergunta de receita, use desenho de incrementalidade. Um grupo de controle que não vê anúncio nenhum mede o efeito da campanha sobre a venda, e é um desenho muito mais poderoso por real investido que comparar dois criativos entre si. Veja teste de incrementalidade da mídia paga e experimentos geográficos.

Por que “vamos subir dez criativos” piora o problema

A resposta natural de uma equipe de mídia ao teste que não conclui é subir mais variações. Ela piora duas coisas ao mesmo tempo.

Efeito de subir muitos criativos sobre o orçamento por braço e sobre o falso positivoDuas curvas no mesmo eixo horizontal, que vai de dois a dez braços. A curva de cima, em cor escura, é a chance de pelo menos um falso positivo sem correção, subindo de cinco por cento com dois braços para cerca de trinta e sete por cento com dez braços. A curva de baixo, em cor clara, é o orçamento que sobra para cada braço, caindo de cinquenta por cento com dois braços para dez por cento com dez braços. As duas curvas se cruzam perto de quatro braços. O rodapé diz que mais braços compram mais ideias e menos certeza sobre cada uma.cada braço a mais compra uma ideia e vende um pedaço da certeza246810número de braços no experimento5%cerca de 37%chance de ao menos um falso positivo50%10%orçamento por braçocom dez braços, cada criativo recebe um décimo do que receberia num A contra B
A curva escura é a conta clássica de comparações múltiplas com nível de 5 por cento por comparação: 1 menos 0,95 elevado ao número de comparações contra o controle. A curva clara é a divisão simples do orçamento. As duas atuam ao mesmo tempo e na mesma direção.

Primeiro, o orçamento se divide. Com o mesmo investimento e dez braços, cada criativo recebe um décimo do que receberia num teste A contra B, o que joga a amostra por braço para bem longe da tabela da seção anterior. Segundo, o número de comparações cresce. Com nove braços de tratamento contra um controle, a nove comparações a 5 por cento cada, a chance de pelo menos um falso positivo sob a hipótese nula sobe para cerca de 37 por cento se você não corrigir. O procedimento correto está em teste A/B/n com várias variações e em muitas métricas num teste só.

Existe ainda um terceiro efeito, específico de plataforma: com muitos criativos na mesma campanha, o sistema de entrega concentra a verba nos que ele prevê que vão render melhor antes de haver dado suficiente, o que é uma forma de encerramento antecipado embutido no produto. O criativo “vencedor” costuma ser o que teve sorte nas primeiras centenas de impressões. É o mesmo mecanismo de maldição do vencedor, agora automatizado.

A regra que funciona na prática: poucos braços, hipóteses distantes, uma variável trocada por vez. Se você tem dez ideias, escolha as duas mais diferentes entre si e teste primeiro a dimensão, não as dez execuções.

Anúncios responsivos: quando a plataforma já está testando por você

Em busca paga, boa parte do “teste de criativo” já não é seu. Na documentação do Google Ads sobre anúncios responsivos de busca, você fornece até 15 títulos e 4 descrições, e a plataforma “monta o texto em múltiplas combinações de anúncio de um jeito que evita redundância” e, com o tempo, “testa as combinações mais promissoras e aprende quais são mais relevantes para diferentes consultas”. Você pode fixar títulos e descrições em posições específicas, mas a escolha da combinação exibida é do sistema.

Isso tem três consequências para quem quer aprender alguma coisa:

o que você queria o que o formato responsivo entrega o que fazer
tráfego igual entre versões alocação adaptativa, concentrada nas combinações previstas como boas não leia diferença entre combinações como efeito causal
saber qual título funciona desempenho por elemento, agregado sobre combinações desiguais use como pista de geração de hipótese, não como veredito
um teste A contra B limpo um otimizador multiarmado com regra fechada se a pergunta é causal, rode o teste no nível do experimento de campanha

O Google afirma que “anunciantes que melhoram a força do anúncio dos seus anúncios responsivos de busca de fraca para excelente encontram 15 por cento mais cliques e conversões, em média”. Esse número é uma estimativa da própria plataforma, publicada sem metodologia, amostra ou desenho experimental, e deve ser tratado como tal: vale como orientação de produto, não como evidência causal. É o tipo de claim que sempre atribuímos à fonte em vez de repetir como fato.

Se a sua pergunta for mesmo causal, o caminho é rodar o experimento no nível de campanha, e aí o assunto muda de figura por causa do mecanismo de sorteio da plataforma. Isso é o tema de teste A/B na plataforma de anúncios.

Fadiga, novidade e a janela em que o resultado é lido

Um teste de criativo tem duas distorções temporais que um teste de página tem em menor grau.

A primeira é o efeito de novidade: um criativo novo atrai atenção pela própria novidade nas primeiras exposições, e o ganho decai. Ler o resultado nos três primeiros dias é ler o pico, não o patamar. O tratamento correto disso está em efeito de novidade em teste A/B.

A segunda é a fadiga: conforme a mesma pessoa vê o mesmo anúncio várias vezes, a taxa de clique cai. Como os dois braços costumam acumular frequência em ritmos diferentes (afinal, a plataforma entrega quantidades diferentes a públicos diferentes), a diferença medida entre eles muda de tamanho ao longo do teste, o que é um problema de composição e não de efeito.

Três regras práticas, todas fáceis de aplicar:

  1. Rode o teste em semanas inteiras, pelo mesmo motivo que vale em qualquer outro teste: composição de público e comportamento de compra variam por dia da semana. Veja ciclo semanal e duração.
  2. Congele o criativo durante o teste. Trocar a imagem no meio muda a entrega em horas, como Ali e colegas mediram, e o que você tem depois disso são dois experimentos emendados.
  3. Olhe a curva, não só o total. Se a diferença entre os braços encolhe monotonicamente ao longo dos dias, você provavelmente mediu novidade. Se ela cresce, provavelmente mediu aprendizado do sistema de entrega.

Como ler o resultado de um teste de criativo sem se enganar

  1. Qual era a métrica primária declarada antes de rodar? Se não havia uma, o relatório é uma escolha entre as três da tabela, e sempre vai existir uma que favorece a conclusão desejada.
  2. A comparação tem denominador comum? Conversão por clique não tem. Ela é informativa, não decisiva.
  3. A amostra bateu o que a calculadora pede para a métrica primária? Se não, escreva “não conclusivo”, não “empate”.
  4. Os dois braços receberam entrega parecida? Diferenças grandes de impressões, alcance ou frequência entre os braços indicam que a plataforma decidiu por você, e o resultado mistura tratamento e entrega.
  5. O público entregue foi parecido? Compare o recorte por dispositivo, posicionamento e faixa etária entre os braços. Se divergirem muito, você está comparando campanhas diferentes.
  6. Você trocou uma variável ou um pacote? Imagem, título e texto trocados juntos respondem “o pacote novo é melhor”, não “a imagem nova é melhor”.
  7. A diferença sobreviveria a uma semana a mais? Diferença que encolhe ao longo dos dias costuma ser novidade.
  8. O efeito é material? Ganho de 3 por cento relativo numa campanha de 200 pedidos por mês é ruído operacional, mesmo quando é real.

Checklist antes de ligar o teste

  1. Escreva a hipótese, no formato “se eu trocar X por Y, a métrica Z muda porque W”. O gerador de hipótese força esse formato.
  2. Declare a métrica primária e o denominador por escrito, antes de ligar.
  3. Dimensione com a calculadora para essa métrica, não para a mais barata.
  4. Escolha duas ideias distantes, não seis parecidas.
  5. Troque uma dimensão por vez: imagem, ou promessa, ou formato. Nunca as três.
  6. Use a mesma página de destino nos dois braços, senão você está testando duas coisas. O teste do outro lado do clique é o assunto de correspondência de mensagem entre anúncio e página.
  7. Combine o período em semanas inteiras e registre a data de início e fim antes.
  8. Registre a entrega, não só o resultado: impressões, alcance, frequência e recorte de público por braço. É o que vai permitir dizer se a comparação foi limpa.
  9. Para a pergunta de receita, planeje um desenho de incrementalidade em vez de esperar que o teste de criativo responda.

Faça isso automático na Donnu

A dor específica de testar criativo de anúncio é que o pedaço mais fácil de medir, o clique, é o que menos importa, e o pedaço que importa, a venda, acontece depois, no seu site, onde a plataforma não enxerga com precisão.

Na Donnu, a meta de conversão pode ser confirmada pelo seu servidor, com valor do pedido, além de cliques, envios de formulário e visitas a páginas. Isso permite medir o pedido que foi de fato pago, e não o evento de navegador que a plataforma registrou. O experimento pode ser restrito por origem de tráfego, o que permite rodar um teste da página só para quem chegou de uma campanha específica, com o criativo congelado do lado de fora. O relatório é bayesiano, avisa quando a divisão de visitantes se afasta do configurado e só declara vencedora com pelo menos 200 visitantes por variação e 7 dias de teste.

O que continua sendo seu: escolher hipóteses distantes, declarar a métrica primária antes e aceitar que a pergunta de receita pede desenho de incrementalidade. Para o resto, a calculadora de tamanho de amostra, a calculadora de significância e a calculadora de custo por aquisição fazem as contas deste guia com os seus números, de graça.

Referências

Leia também: Teste A/B na plataforma de anúncios · Correspondência de mensagem entre anúncio e página · Teste de incrementalidade da mídia paga · Experimentos geográficos · Efeito de novidade · Teste A/B/n · Maldição do vencedor · Read in English

Perguntas frequentes

O que é um teste A/B de criativo de anúncio?
É o experimento em que a variável trocada é o próprio anúncio (imagem, vídeo, título ou texto) e o resto da campanha fica igual: mesmo público declarado, mesmo orçamento, mesma página de destino. A diferença para um teste A/B de página é que o sorteio não é seu: quem decide qual pessoa vê qual anúncio é o sistema de entrega da plataforma, e ele leva o conteúdo do criativo em conta nessa decisão.
Posso decidir o vencedor pela taxa de clique?
Só se a sua pergunta de negócio for sobre cliques. Taxa de clique é a métrica mais barata de mover e a que menos se correlaciona com o que você vende. No exemplo trabalhado deste guia, o criativo B ganha em taxa de clique com folga (mais 33,3 por cento, valor-p abaixo de 0,0001) e mesmo assim não prova nada em compras por impressão (mais 6,75 por cento, valor-p de 0,4563), enquanto a conversão dos cliques que ele trouxe é pior.
Por que dois criativos nunca são vistos pelas mesmas pessoas?
Porque o sistema de entrega usa o conteúdo do criativo para escolher o público. Ali e colegas (CSCW, 2019) rodaram anúncios com o mesmo público-alvo declarado, o mesmo orçamento e a mesma estratégia de lance, e mediram entrega de mais de 75 por cento homens para um criativo e mais de 90 por cento mulheres para outro. Com só a imagem trocada, a entrega foi de 91 por cento de homens contra 5 por cento de homens. Ou seja, comparar dois criativos é comparar dois pacotes de criativo mais público ao mesmo tempo.
Quanto tráfego preciso para testar criativo?
Depende brutalmente da métrica. Com taxa de clique de 1,2 por cento, detectar 10 por cento relativo pede 135.624 impressões por criativo. Com compra por impressão de 0,06 por cento, a mesma pergunta pede 2.745.377 impressões por criativo. É por isso que quase todo teste de criativo do mercado é decidido por clique: é a única métrica que a conta fecha.
Testar dez criativos de uma vez resolve?
Resolve o problema de ideias e piora o de estatística. Com dez braços contra um controle, você faz nove comparações, e a chance de pelo menos um falso positivo a 5 por cento por comparação sobe para cerca de 37 por cento sem correção. Além disso, cada braço fica com um décimo do orçamento, o que derruba o poder de todos. Poucos braços com hipótese explícita rendem mais que muitos braços sem.
Anúncio responsivo de busca conta como teste A/B?
Não no sentido estrito. Nos anúncios responsivos de busca você fornece até 15 títulos e 4 descrições, e o Google Ads monta e testa as combinações que julga mais promissoras, segundo a documentação da própria plataforma. Isso é otimização adaptativa, não sorteio balanceado: as combinações não recebem tráfego igual, e o resultado por elemento não é um efeito causal isolado.