Teste A/B na Plataforma de Anúncios: o que o leilão quebra
Teste A/B na plataforma de anúncios: split por cookie ou por busca, orçamento compartilhado, entrega otimizada e como ler o resultado sem se enganar.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
O experimento nativo da plataforma de anúncios é um sorteio de verdade, mas com três propriedades que nenhum teste A/B do seu site tem: a unidade sorteada pode ser a busca e não a pessoa, os dois braços costumam competir pelo mesmo orçamento e a entrega dentro de cada braço é decidida por um sistema que reage ao que você está testando. A documentação do Google Ads é explícita sobre a primeira: no split por busca, “o mesmo usuário poderia ver tanto o experimento quanto a sua campanha original”. Isso é contaminação declarada em manual, e ela encolhe o efeito medido. Neste guia: o que cada mecanismo quebra, um exemplo trabalhado em que um efeito real de 0,30 ponto percentual aparece como 0,195 por causa de 35 por cento de sobreposição, por que o verificador de SRM tem que rodar sobre usuários e não sobre cliques, e qual desenho responde a pergunta que o experimento de campanha não responde. Este guia faz parte do nosso guia completo de teste A/B.
Três mecanismos, três problemas diferentes
Antes de olhar números, vale separar o que exatamente está quebrado. São três coisas independentes, e confundi-las leva a consertos errados.
| mecanismo | o que ele faz | o que ele quebra | o que fazer |
|---|---|---|---|
| unidade de sorteio | sorteia por pessoa ou por evento de busca | independência entre observações; no caso do split por busca, contamina os braços de propósito | escolher split por cookie quando a pergunta for causal |
| orçamento compartilhado | os dois braços tiram do mesmo bolso | a independência entre braços: o desempenho de B muda o que sobra para A | ler o resultado como comparação sob restrição, não como efeito isolado |
| entrega otimizada | dentro de cada braço, o sistema escolhe quem vê | a comparabilidade das amostras: cada braço recebe um público diferente | registrar e comparar a composição entregue nos dois braços |
O primeiro é um problema de desenho e tem solução dentro da plataforma. O segundo e o terceiro não têm solução de dentro, só ressalva. Vamos um por um.
Unidade de sorteio: quando a plataforma sorteia a busca, não a pessoa
Na documentação de configuração de experimento personalizado do Google Ads, as duas opções de divisão para campanhas de busca são descritas assim. O split baseado em cookie, marcado como recomendado, “sorteia usuários aleatoriamente para o seu experimento ou para a campanha original e garante que um determinado usuário veja apenas a original ou o experimento”. O split baseado em busca “sorteia usuários para o seu experimento ou para a campanha original toda vez que uma busca acontece”, e a documentação acrescenta: “se um usuário fizer várias buscas, o mesmo usuário poderia ver tanto o experimento quanto a sua campanha original”. O manual registra que essa segunda opção “pode chegar a resultados estatisticamente significativos mais rápido que o split por cookie”.
Essa última frase é verdadeira e perigosa ao mesmo tempo. Ela é verdadeira porque, contando buscas em vez de pessoas, o denominador cresce e o erro-padrão encolhe. É perigosa porque a significância que aparece mais rápido está medindo um efeito diferente do que você quer: se a mesma pessoa vê as duas versões, o que você mediu não é “o efeito de receber a versão B”, é algo entre isso e zero.
A regra prática é curta: se a pergunta é causal, use split por cookie e aceite a espera. O split por busca serve quando você quer uma leitura operacional rápida de algo grosseiro e está disposto a escrever no relatório que o efeito medido é uma cota inferior do efeito real.
Esse é o mesmo problema que tratamos em interferência entre variações sob outro nome: a suposição de que o resultado de uma unidade não depende do tratamento das outras unidades, e aqui de quais outros tratamentos a mesma unidade recebeu.
Orçamento compartilhado: os braços competem entre si
A documentação do Google Ads registra que “o experimento compartilha o tráfego (e o orçamento) da sua campanha original”, e que se a campanha base for pausada ou terminar antes do experimento, o experimento não roda. Em outras palavras, os braços não são dois experimentos independentes rodando em paralelo, são dois pedaços do mesmo orçamento.
Isso cria uma dependência que não existe num teste de página. Se o braço B gasta mais rápido, sobra menos para o braço A naquele dia, e o braço A passa a rodar num regime diferente do que rodaria sozinho. O efeito medido, então, é o efeito de B dado que A também estava competindo pelo mesmo dinheiro, e não o efeito de B se ele fosse a única campanha no ar.
Isso importa por um motivo muito concreto: é exatamente o cenário de implantação que você quer prever quando vai substituir A por B. Se você vencer e desligar o braço A, a campanha B passa a rodar com o orçamento inteiro, e o comportamento do leilão muda. Há evidência direta de que o orçamento sozinho muda quem é alcançado: Ali e colegas (2019) rodaram a mesma campanha com limites diários de 1, 2, 5, 10, 20 e 50 dólares, mantendo criativo e público constantes, e mediram correlação de Pearson de menos 0,88 (valor-p abaixo de 10 elevado a menos 5) entre orçamento diário e fração de homens alcançados quando o alvo eram todos os usuários dos Estados Unidos, e de menos 0,73 (valor-p abaixo de 10 elevado a menos 3) quando o alvo era um público personalizado. Mais orçamento, público diferente.
| o que você mediu | o que você vai implantar | por que difere |
|---|---|---|
| B com metade do orçamento, competindo com A | B com o orçamento inteiro | mais orçamento muda o público alcançado, como mediram Ali e colegas |
| B enquanto A aprendia | B depois que o sistema aprendeu | a fase de aprendizado tem desempenho diferente do regime estável |
| B num período específico | B daqui em diante | leilão, concorrência e sazonalidade mudam |
Nada disso torna o experimento inútil. Torna a extrapolação frágil. A postura honesta é tratar o resultado do experimento de campanha como evidência direcional sob as condições do teste, e confirmar a decisão com o desempenho pós-implantação em vez de considerar a questão encerrada no dia do relatório.
Entrega otimizada: cada braço recebe um público diferente
Este é o terceiro mecanismo, e o menos visível. Dentro de cada braço, o sistema de entrega escolhe quem vê o anúncio com base na previsão de relevância e no preço do leilão. Como os braços têm configurações diferentes (é esse o ponto do teste), eles acabam com públicos diferentes.
Quando a variável testada é o próprio criativo, esse efeito é enorme e está medido: Ali e colegas obtiveram entrega de 91 por cento de homens contra 5 por cento de homens apenas trocando a imagem, com público declarado, lance e orçamento idênticos. A consequência para o desenho de teste de criativo está em teste A/B de criativo de anúncio.
Quando a variável testada é a estratégia de lance, a palavra-chave ou a página de destino, o efeito é menor, mas não é zero: qualquer mudança que altere a previsão de desempenho altera também em quais leilões a campanha entra. Por isso a checagem mais útil de um experimento de campanha não é o valor-p, é a comparação da composição entregue entre os braços.
| o que comparar entre braços | por que | o que fazer se divergir muito |
|---|---|---|
| impressões e alcance | volume desigual sugere que o orçamento não dividiu como o configurado | investigar antes de ler o resultado |
| frequência média | fadiga desigual muda a taxa de clique por razões que não são o tratamento | segmentar a leitura por faixa de frequência |
| recorte por dispositivo e posicionamento | composição diferente muda a taxa-base | ler o efeito dentro de cada recorte, não só no agregado |
| distribuição de consultas ou públicos | o braço pode ter entrado em leilões diferentes | reportar a divergência junto do resultado |
Se os recortes divergirem muito, o que você tem não é um teste A contra B, são duas campanhas diferentes medidas no mesmo período. Isso não é nulo, mas a conclusão tem que ser escrita no nível do pacote, como discutimos em métrica primária e OEC.
Exemplo trabalhado: o mesmo teste, com e sem contaminação
Uma loja quer testar uma estratégia de lance nova numa campanha de busca. O teste roda 50/50 por 14 dias. A taxa de conversão do clique no controle é de 2,50 por cento.
Cenário 1: split por cookie. Cada usuário vê só um dos braços.
| braço | cliques | conversões | taxa de conversão |
|---|---|---|---|
| A (original) | 18.400 | 460 | 2,5000% |
| B (experimento) | 18.700 | 524 | 2,8021% |
O teste z de duas proporções devolve: lift relativo de mais 12,09 por cento, diferença de 0,3021 ponto percentual, valor-p de 0,0702, intervalo de confiança de 95 por cento da diferença indo de menos 0,0247 a mais 0,6290 ponto percentual. Ou seja: não significativo a 5 por cento, com o intervalo quase todo do lado positivo.
Cenário 2: split por busca, com 35 por cento dos usuários vendo os dois braços. O efeito verdadeiro é o mesmo, mas a contaminação puxa as duas taxas uma na direção da outra.
| braço | cliques | conversões | taxa de conversão |
|---|---|---|---|
| A (original) | 18.400 | 469 | 2,5489% |
| B (experimento) | 18.700 | 512 | 2,7380% |
Agora o teste devolve: lift relativo de mais 7,42 por cento, diferença de 0,1891 ponto percentual, valor-p de 0,2565, intervalo de menos 0,1374 a mais 0,5155 ponto percentual.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Cole 18400 e 460 no lado A e 18700 e 524 no lado B para reproduzir o primeiro cenário: valor-p de 0,0702 e lift de 12,09 por cento. Troque para 18400 e 469 contra 18700 e 512 e a calculadora devolve 0,2565 com lift de 7,42 por cento, que é o segundo.
A leitura. Os dois cenários vêm do mesmo mundo, em que o tratamento realmente melhora a conversão em 0,30 ponto percentual. O primeiro chega perto de detectar e não detecta. O segundo nem chega perto, porque a contaminação de 35 por cento comeu 35 por cento do sinal antes de qualquer estatística entrar em cena. E note o detalhe cruel: o cenário contaminado tinha mais observações elegíveis na prática (mais buscas contadas), e ainda assim ficou mais longe da resposta. Mais dados não consertam viés.
O erro de SRM mais comum em experimento de anúncios
O verificador de SRM compara a divisão observada com a configurada. Ele é um dos guardrails mais úteis que existem, e em experimento de anúncios ele costuma ser rodado sobre a métrica errada.
| sobre o que rodar | divisão observada | qui-quadrado | valor-p | veredito |
|---|---|---|---|---|
| usuários (unidade de sorteio) | 51.230 contra 48.770 | 60,52 | abaixo de 0,000001 | SRM: a divisão quebrou |
| cliques (resultado do tratamento) | 18.400 contra 18.700 | 2,43 | 0,1193 | nada a declarar |
Repare que os dois conjuntos de números vêm do mesmo experimento. Se você rodar o verificador sobre cliques, o teste passa e você segue tranquilo com um experimento quebrado nas mãos. Se rodar sobre usuários, descobre que um braço recebeu 51,23 por cento do sorteio em vez de 50, o que a 100 mil usuários é uma discrepância que não acontece por acaso.
A regra é a mesma de qualquer outro contexto e vale repetir: SRM se roda sobre a unidade de sorteio. Cliques, sessões, impressões e conversões são todos afetados pelo tratamento, então diferença neles é o resultado do experimento, não um alarme. O tratamento completo está em SRM e divisão desigual de tráfego, e o verificador de SRM faz a conta.
Em plataforma de anúncios, o SRM tem uma causa específica que vale conhecer: o experimento não começa e termina exatamente junto com a campanha original. Diferença de fuso, atraso de aprovação de anúncio, pausa de um braço por limite de orçamento diário, tudo isso desequilibra a exposição antes de qualquer coisa acontecer no lado do usuário.
Poder: o que o seu teste conseguia detectar
Antes de escrever “não houve diferença”, vale calcular o que o teste era capaz de enxergar. Com 18.500 cliques por braço e taxa-base de 2,5 por cento, a 95 por cento de confiança e 80 por cento de poder, o menor efeito detectável é de 0,4548 ponto percentual, ou 18,19 por cento relativos.
O efeito verdadeiro do exemplo era de 12,09 por cento relativos. Ou seja, o teste foi desenhado para uma régua maior que o efeito que existia. Não detectar era o desfecho mais provável desde o início.
mdeForSample com 18.500 por braço, taxa-base de 2,5 por cento, 95 por cento de confiança e 80 por cento de poder. Um teste cuja régua é maior que o efeito esperado não é um teste inconclusivo por azar, é um teste que nasceu sem chance.| o que você quer detectar | cliques por braço (base 2,5%) | duração com 9.100 cliques por semana |
|---|---|---|
| mais 20% relativo | 16.792 | 26 dias |
| mais 15% relativo | 29.193 | 45 dias |
| mais 10% relativo | 64.199 | 99 dias |
| mais 8% relativo | 99.382 | 153 dias |
| mais 5% relativo | 250.846 | 386 dias |
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
A tabela tem uma implicação estratégica que muita equipe de mídia resiste a aceitar: experimento de campanha não serve para refinamento. Ele serve para decisões grandes, do tipo “esta estratégia de lance inteira contra aquela”, “esta estrutura de campanha contra aquela”. Testar três centavos no lance máximo ou uma palavra no título é matematicamente inviável na maior parte das contas, e o que aparece como “vencedor” nesses testes é ruído, com a inflação de efeito que descrevemos em maldição do vencedor.
Vale registrar a escala do problema medida por quem tinha acesso aos dados: Lewis e Rao (Quarterly Journal of Economics, 2015) analisaram 25 experimentos de campo de publicidade digital, com 2,8 milhões de dólares em investimento e campanhas alcançando mais de 1 milhão de pessoas na mediana, e o intervalo de confiança mediano sobre o retorno do investimento ficou acima de 100 pontos percentuais de largura. Os autores estimam que experimentos informativos de publicidade podem exigir mais de 10 milhões de pessoas-semana.
Quando o desenho da plataforma serve e quando não
Nem toda pergunta precisa de um desenho mais caro. A tabela abaixo é o mapa que usamos.
| pergunta | desenho adequado | por quê |
|---|---|---|
| “esta estratégia de lance é melhor que aquela?” | experimento de campanha, split por cookie | a variável vive dentro da plataforma e o efeito costuma ser grande |
| “esta estrutura de campanha rende mais?” | experimento de campanha, split por cookie | idem, com a ressalva do orçamento compartilhado |
| “este criativo vende mais?” | experimento de campanha, com ressalva forte | a entrega reage ao criativo; ver o guia de criativo |
| “esta página de destino converte melhor?” | teste A/B no seu site, com o anúncio congelado | o sorteio volta a ser seu; ver o guia de correspondência de mensagem |
| “vale a pena anunciar neste canal?” | incrementalidade com grupo de controle sem anúncio | só um controle sem exposição responde isso |
| “quanto a mídia paga soma às vendas totais?” | experimento geográfico | quando o controle por pessoa não é viável |
As duas últimas linhas são o ponto mais importante desta seção. Comparar dois braços de campanha nunca responde se a campanha vale a pena, porque os dois braços têm anúncio. Para essa pergunta, o desenho é outro: veja teste de incrementalidade da mídia paga e experimentos geográficos.
Como ler o relatório de um experimento de campanha
- Qual foi a unidade de sorteio? Se foi a busca, escreva no relatório que o efeito medido é uma cota inferior.
- A divisão bateu com o configurado na unidade de sorteio? Rode o verificador sobre usuários, não sobre cliques.
- Qual era o menor efeito detectável do teste? Sem esse número, “não significativo” não quer dizer nada.
- O orçamento dividiu como esperado ao longo de todos os dias? Um braço que bateu o limite diário antes do outro rodou num regime diferente.
- Os dois braços começaram e terminaram no mesmo instante? Aprovação de anúncio e fuso criam desequilíbrio invisível.
- A composição entregue foi parecida? Compare dispositivo, posicionamento, frequência e faixa de consulta.
- A métrica é de clique ou de negócio? Conversão medida pela plataforma e pedido pago no seu banco costumam divergir; declare qual é a primária.
- O período cobriu semanas inteiras? Veja ciclo semanal e duração.
- Houve mudança na conta durante o teste? Alterar orçamento, público ou criativo no meio emenda dois experimentos.
Checklist antes de ligar o experimento
- Escreva a hipótese e a métrica primária antes de tudo, com o denominador explícito.
- Escolha split por cookie quando a pergunta for causal, mesmo que demore mais.
- Calcule o menor efeito detectável com o tráfego que você realmente tem, e só ligue o teste se ele for menor que o efeito que você espera.
- Use divisão 50/50, que é a que maximiza o poder para um tamanho total dado e é o que a própria documentação do Google Ads recomenda para a melhor comparação.
- Congele tudo o que não é a variável: criativo, público, orçamento total, página de destino.
- Programe o período em semanas inteiras e registre início e fim antes.
- Instrumente a conversão do seu lado também, para poder comparar com o que a plataforma reporta.
- Defina antes o que fará se o resultado for não conclusivo. Na maior parte das contas, esse é o desfecho mais provável, e decidir isso depois vira escolha de narrativa.
- Planeje a confirmação pós-implantação, porque o regime de orçamento muda quando o braço perdedor é desligado.
Faça isso automático na Donnu
A dor específica de testar dentro da plataforma de anúncios é que você não controla o sorteio, não controla a entrega e mede a conversão com o instrumento de quem vende a mídia. Uma parte disso não tem conserto. A outra parte é o que acontece depois do clique, e essa você controla.
Na Donnu, o experimento roda no seu site, com sorteio por visitante e peso fixo, e pode ser restrito por origem de tráfego, o que permite testar a página só para quem chegou de uma campanha específica sem misturar com o tráfego orgânico. A meta de conversão pode ser confirmada pelo seu servidor, com valor do pedido, o que dá um número independente do que a plataforma reporta. O relatório é bayesiano, avisa quando a divisão de visitantes se afasta do configurado, que é o guardrail de SRM rodando sobre a unidade certa, e só declara vencedora com pelo menos 200 visitantes por variação e 7 dias de teste.
O que continua sendo seu: escolher o split certo do lado da plataforma, dimensionar para o efeito que você espera e aceitar que a pergunta de incrementalidade pede outro desenho. Para o resto, a calculadora de tamanho de amostra, a calculadora de menor efeito detectável e o verificador de SRM fazem as contas deste guia com os seus números, de graça.
Referências
- Google. Configurar um experimento personalizado. Central de Ajuda do Google Ads. Página lida na íntegra. Fonte das duas opções de divisão para campanhas de busca, da descrição do split por cookie como o que garante que um usuário veja apenas uma das versões, da descrição do split por busca e do registro explícito de que o mesmo usuário pode ver as duas versões se fizer várias buscas, da recomendação de 50 por cento para a melhor comparação, e do fato de que o experimento compartilha o tráfego e o orçamento da campanha original. Conferido em 22/09/2026. support.google.com.
- Ali, Muhammad; Sapiezynski, Piotr; Bogen, Miranda; Korolova, Aleksandra; Mislove, Alan e Rieke, Aaron. Discrimination through Optimization: How Facebook’s Ad Delivery Can Lead to Biased Outcomes. Proceedings of the ACM on Human-Computer Interaction, v. 3, CSCW, artigo 199, novembro de 2019. Artigo lido na íntegra. Fonte do experimento de orçamento diário de 1 a 50 dólares com criativo e público constantes, das correlações de Pearson de menos 0,88 (valor-p abaixo de 10 elevado a menos 5) para todos os usuários dos Estados Unidos e menos 0,73 (valor-p abaixo de 10 elevado a menos 3) para públicos personalizados, e da entrega de 91 contra 5 por cento de homens ao trocar apenas a imagem. Conferido em 22/09/2026. ccs.neu.edu.
- Lewis, Randall A. e Rao, Justin M. The Unfavorable Economics of Measuring the Returns to Advertising. The Quarterly Journal of Economics, v. 130, n. 4, novembro de 2015, p. 1941-1973. PDF lido nas seções de resumo, introdução e poder estatístico. Fonte dos 25 experimentos de campo, dos 2,8 milhões de dólares em investimento, da mediana de mais de 1 milhão de pessoas alcançadas por campanha, do intervalo de confiança mediano acima de 100 pontos percentuais de largura e da estimativa de mais de 10 milhões de pessoas-semana para um experimento informativo. Conferido em 22/09/2026. gwern.net.
Leia também: Teste A/B de criativo de anúncio · Correspondência de mensagem entre anúncio e página · Teste de incrementalidade da mídia paga · Experimentos geográficos · SRM e divisão desigual de tráfego · Interferência entre variações · Maldição do vencedor · Read in English
Perguntas frequentes
- O experimento da plataforma de anúncios é um teste A/B de verdade?
- É um experimento com sorteio, mas com três diferenças que mudam a leitura: a unidade de sorteio pode não ser a pessoa, os dois braços costumam disputar o mesmo orçamento e a entrega dentro de cada braço é otimizada por um sistema que reage ao que está sendo testado. Nada disso invalida o desenho, mas cada um deles exige uma ressalva explícita no relatório.
- Qual a diferença entre split por cookie e split por busca no Google Ads?
- Segundo a documentação do Google Ads, o split por cookie "sorteia usuários aleatoriamente para o seu experimento ou para a campanha original e garante que um determinado usuário veja apenas a original ou o experimento". O split por busca "sorteia usuários para o seu experimento ou para a campanha original toda vez que uma busca acontece", e a própria documentação registra que, se um usuário fizer várias buscas, "o mesmo usuário poderia ver tanto o experimento quanto a sua campanha original". O segundo contamina os braços de propósito, em troca de chegar antes a um resultado significativo.
- Por que contaminação entre braços reduz o efeito medido?
- Porque quem viu os dois tratamentos carrega um pedaço de cada um. Se uma fração dos usuários é exposta aos dois braços, a diferença medida encolhe aproximadamente na proporção dessa fração. No exemplo deste guia, um efeito real de 0,30 ponto percentual com 35 por cento de sobreposição aparece como 0,195 ponto percentual, o que derruba o valor-p de 0,0702 para 0,2565. O teste não fica só menos preciso, ele fica enviesado para baixo.
- Devo rodar o verificador de SRM num experimento de anúncios?
- Sim, mas sobre a unidade de sorteio, não sobre cliques. Cliques são um resultado do tratamento, então diferença de cliques entre os braços é esperada e não indica nada de errado. No exemplo deste guia, a divisão de cliques 18.400 contra 18.700 passa tranquila (valor-p de 0,1193) enquanto a divisão de usuários 51.230 contra 48.770 reprova com qui-quadrado de 60,52 e valor-p abaixo de 0,000001.
- Resultado não significativo quer dizer que a mudança não funcionou?
- Não. Quer dizer que o teste não conseguiu separar o efeito do ruído. Com 18.500 cliques por braço e 2,5 por cento de conversão, o menor efeito detectável com 80 por cento de poder é de cerca de 18,2 por cento relativos. Um ganho real de 12 por cento fica abaixo dessa régua e não seria detectado na maior parte das vezes, mesmo existindo.
- Qual desenho responde de verdade se a mídia vale a pena?
- Um desenho de incrementalidade, com grupo de controle que não vê anúncio nenhum, ou um experimento geográfico quando o controle por pessoa não é possível. Comparar dois braços de campanha entre si responde "qual configuração é melhor", nunca "vale a pena anunciar". São perguntas diferentes e pedem desenhos diferentes.