Lances Automáticos: o otimizador é parte do seu teste
Lances automáticos recalibram durante o seu teste A/B. Como a fase de aprendizado dilui o efeito medido, o custo em poder e três desenhos que sobrevivem.

📚 Este artigo faz parte do guia Otimização de Conversão (CRO): O Guia Completo 2026.
Lances automáticos não são um ajuste de configuração, são um segundo experimento rodando por cima do seu. Uma estratégia de lance que otimiza no leilão recalibra ao longo do tempo, e o Google Ads declara que essa recalibração pode levar alguns ciclos de conversão, tipicamente 1 ou 2. Se essa janela cai dentro do período que você vai comparar, o braço tratado foi uma coisa nas duas primeiras semanas e outra coisa nas quatro seguintes, e a média das duas não é o efeito de nenhuma. No exemplo trabalhado deste guia, o mesmo experimento devolve três vereditos diferentes conforme a janela lida: o tratamento perde de forma significante nas semanas 1 e 2, empata na janela inteira de 6 semanas e vence de forma significante nas semanas 3 a 6. Nenhum dos três é erro de cálculo. Este guia cobre o que o otimizador faz que o seu plano não previu, por que a diluição é aritmética simples, quanto ela custa em poder, e três desenhos que sobrevivem a um otimizador ligado. Este guia faz parte do nosso guia completo de teste A/B.
O que o lance automático faz que o seu plano não previu
A documentação do Google é direta na definição: lances automáticos inteligentes usam a IA do Google para otimizar para conversões ou valor de conversão em cada leilão, um recurso descrito como lance no momento do leilão. As quatro estratégias desse grupo são CPA desejado, ROAS desejado, maximizar conversões e maximizar valor de conversão.
Repare no “em cada leilão”. Isso quer dizer que o lance não é um número que você fixou e que vale igual do primeiro ao último dia. É uma função que recebe sinais de contexto e devolve um lance diferente a cada consulta. A lista declarada de sinais inclui tipo de dispositivo, localização física, intenção de localização, hora do dia, dia da semana, pertencimento a lista de remarketing, características do anúncio, idioma da interface, navegador, sistema operacional e a própria consulta de busca, além de atributos de produto, competitividade de preço e sazonalidade em alguns tipos de campanha.
Para um experimento, três consequências saem daí.
| o que o otimizador faz | consequência para o teste |
|---|---|
| recalibra com o tempo | o tratamento no dia 3 não é o mesmo tratamento do dia 30 |
| escolhe quem entra | a composição do tráfego do braço muda junto, então a taxa de conversão base se move sem que nada na página tenha mudado |
| persegue um alvo, não um resultado | manter o CPA no alvo pode significar cortar volume, e volume cortado muda o denominador do seu teste |
Nenhuma das três quebra o sorteio. Todas as três mexem no que você está comparando.
A fase de aprendizado tem um tamanho, e ele é medido em conversões
Esta é a parte que quase todo plano de teste ignora, apesar de estar documentada.
O Google Ads declara que pode levar alguns ciclos de conversão, tipicamente 1 ou 2, para a estratégia de lance calibrar para o novo objetivo, e acrescenta que pode ser mais rápido dependendo do volume de dados de conversão presente. A duração depende de três fatores nomeados: o número de conversões que as campanhas, grupos de anúncios, palavras-chave ou produtos obtêm, a duração dos ciclos de conversão, definida como o tempo que um clique leva para resultar numa conversão, e a estratégia de lance escolhida.
Duas consequências práticas saem dessa definição.
A primeira é que a janela de aprendizado não é medida em dias, é medida no seu próprio volume. Os dois primeiros fatores declarados, o número de conversões obtidas e a duração dos ciclos de conversão, são ambos propriedades da sua conta, não do calendário. Uma conta com volume alto e ciclo de conversão de dois dias fecha os ciclos de calibração antes do fim da primeira semana. Uma conta com volume baixo e ciclo de duas semanas gasta quase o teste inteiro para fechar os mesmos ciclos. O mesmo teste, com o mesmo desenho, tem uma janela contaminada curta numa conta e longa na outra.
A segunda é que o status deixar de dizer aprendizado não significa que acabou. A própria documentação afirma que os algoritmos continuam aprendendo mesmo quando o status de lance não mostra mais “Aprendizado”. O indicador visível é um piso, não um teto.
Vale conhecer também os gatilhos declarados do status de aprendizado, porque cada um deles é uma coisa que você pode acidentalmente fazer no meio de um teste:
| gatilho declarado | o que significa | como aparece num teste |
|---|---|---|
| nova estratégia | a estratégia foi criada ou reativada há pouco | é o caso esperado quando a estratégia é o tratamento |
| mudança de configuração | uma configuração da estratégia foi alterada | alguém ajustou o CPA desejado na terceira semana “porque estava caro” |
| mudança de composição | campanhas, grupos de anúncios ou palavras-chave entraram ou saíram da estratégia | uma pausa de palavra-chave de baixo desempenho reinicia o relógio |
Existem ainda os status de estratégia limitada, por inventário, limite de lance, orçamento ou pela própria estratégia. Um braço limitado por orçamento enquanto o outro não está não é um braço tratado, é um braço estrangulado, e essa diferença não tem nada a ver com a hipótese que você escreveu.
Exemplo trabalhado: um teste, três vereditos
Os números abaixo saíram do mesmo motor de estatística que roda nas calculadoras desta página, não de estimativa a olho.
O cenário: uma campanha de busca com 32.000 cliques por semana, dividida meio a meio por cookie entre a campanha original e a de experimento. O controle mantém CPC manual, o tratamento passa a CPA desejado. O teste roda 6 semanas. A taxa de conversão do controle é estável em 4,00 por cento durante todo o período.
A estratégia nova entra em calibração nas duas primeiras semanas e converte pior nesse trecho: 3,70 por cento. A partir da terceira semana, calibrada, ela converte melhor: 4,30 por cento. Vamos ler o mesmo experimento de três maneiras.
| janela lida | controle | tratamento | diferença | lift relativo | valor p | IC 95% (pp) | veredito |
|---|---|---|---|---|---|---|---|
| semanas 1 e 2 | 1.280/32.000 = 4,0000% | 1.184/32.000 = 3,7000% | −0,3000 pp | −7,5000% | 0,048574 | −0,5981 a −0,0019 | o tratamento perde |
| semanas 1 a 6 | 3.840/96.000 = 4,0000% | 3.936/96.000 = 4,1000% | +0,1000 pp | +2,5000% | 0,266396 | −0,0764 a +0,2764 | empate |
| semanas 3 a 6 | 2.560/64.000 = 4,0000% | 2.752/64.000 = 4,3000% | +0,3000 pp | +7,5000% | 0,007129 | +0,0815 a +0,5185 | o tratamento vence |
Três leituras do mesmo experimento, três conclusões incompatíveis, nenhuma delas errada aritmeticamente. Cole os números na calculadora abaixo e reproduza qualquer uma das três linhas.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
A diluição não é misteriosa, é média ponderada. Dois sextos do período tiveram efeito de menos 0,30 pontos e quatro sextos tiveram mais 0,30 pontos:
(2/6) × (−0,30) + (4/6) × (+0,30) = −0,10 + 0,20 = +0,10 pp
Que é exatamente a diferença que a janela inteira reporta. O experimento não mediu o efeito da estratégia nova, mediu a média entre a estratégia se ajustando e a estratégia ajustada, ponderada por quanto tempo cada uma ocupou o relógio.
O que a contaminação custa em poder
Aqui está o detalhe que mais surpreende: incluir a fase de aprendizado deixa você com mais dados e menos poder ao mesmo tempo.
Com 64.000 cliques por braço, apenas as semanas 3 a 6, o poder para detectar o efeito real de mais 7,5 por cento relativos sobre uma base de 4 por cento é de 76,8 por cento. Para chegar a 80 por cento, bastariam 69.379 cliques por braço.
Com 96.000 cliques por braço, as 6 semanas inteiras, o efeito que sobrou para detectar é o diluído, de mais 2,5 por cento relativos. O poder para detectar esse efeito cai para 19,8 por cento, e para chegar a 80 por cento seriam necessários 610.010 cliques por braço, quase nove vezes o tráfego do teste inteiro.
Metade do efeito custa quatro vezes a amostra, porque o tamanho de amostra escala com o inverso do quadrado do efeito. Um período de queima de duas semanas num teste de seis é caro exatamente nessa proporção.
| efeito relativo a detectar | amostra por braço (base 4%, 95%, 80%) | dias a 32.000 cliques/semana |
|---|---|---|
| +15% | 17.943 | 8 |
| +10% | 39.475 | 18 |
| +7,5% (efeito real) | 69.379 | 31 |
| +5% | 154.304 | 68 |
| +2,5% (efeito diluído) | 610.010 | 267 |
Dimensione pelo efeito que você vai medir, não pelo que você espera. Se o plano inclui duas semanas de calibração numa janela de seis, o efeito que você vai medir já nasce um terço menor.
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
Três desenhos que sobrevivem a um otimizador ligado
Não existe um único jeito certo. Existe o desenho certo para o que você está testando.
Desenho 1: período de queima declarado. Use quando a estratégia de lance É o tratamento. Escreva na hipótese, antes de ligar qualquer coisa, que os primeiros N dias ou as primeiras N conversões serão descartados da análise, e que o critério de corte é o mesmo nos dois braços. Isso transforma a contaminação num custo conhecido de desenho, em vez de num viés escondido. O corte precisa estar no plano, nunca no relatório: o mesmo recorte escolhido depois de ver os números infla o falso positivo do mesmo jeito que parar o teste cedo infla.
Desenho 2: congele o lance e teste só a página. Use quando o que você quer testar é a página, não a mídia. Se o sorteio acontece no seu site, depois do clique, o lance automático atua antes e cai nos dois braços por igual. Ele não enviesa a comparação. O que ele faz é mover a composição do tráfego ao longo do tempo, e isso só vira problema se a estratégia mudar no meio do teste. Então não mude: nenhuma alteração de alvo, de orçamento, de composição da estratégia durante a janela.
Desenho 3: divisão por região com controle. Use quando o efeito é de conta inteira, como um alvo novo que reorganiza o gasto entre campanhas, ou quando os dois braços disputariam o mesmo leilão. A divisão por região elimina a disputa interna, ao custo de unidades bem maiores e menos numerosas. O desenho está detalhado em experimentos geográficos e a leitura causal do resultado em teste de incrementalidade.
| situação | desenho | por que |
|---|---|---|
| a estratégia de lance é o tratamento, conta com volume | experimento da plataforma com divisão por cookie + queima declarada | a divisão por cookie mantém a pessoa num braço só; a queima tira a calibração da conta |
| a estratégia é o tratamento, conta de baixo volume | divisão por região com controle | os ciclos de calibração consumiriam o teste inteiro; a região dá unidade maior |
| a página é o tratamento | sorteio no site, estratégia congelada | o lance atua antes do clique e cai igual nos dois braços |
| mudança de alvo que reorganiza gasto entre campanhas | divisão por região com controle | braços na mesma conta canibalizam pelo mesmo leilão |
| o alvo precisa mudar no meio do teste por decisão de negócio | pare o teste e recomece | mudança de configuração reinicia a calibração nos dois braços em momentos diferentes |
A fronteira com o desenho do split da plataforma
Vale separar duas coisas que costumam se confundir.
O mecanismo do sorteio dentro da plataforma, divisão por cookie contra divisão por busca, orçamento compartilhado, entrega otimizada, é assunto de teste A/B na plataforma de anúncios. Sobre isso, a documentação do Google é clara: a divisão por cookie, recomendada, atribui usuários aleatoriamente ao experimento ou à campanha original e garante que um mesmo usuário veja apenas uma das duas, enquanto na divisão por busca o usuário é colocado aleatoriamente a cada busca, de modo que a mesma pessoa pode ver as duas versões.
O que este guia trata é diferente e vem depois: mesmo com um sorteio perfeito, o tratamento muda de forma ao longo da janela. Divisão por cookie impecável, orçamentos separados, e ainda assim as semanas 1 e 2 mediram uma coisa que não existe mais na semana 5.
Duas armadilhas de calendário fecham o quadro:
- O Google recomenda deixar um experimento rodar por pelo menos 4 a 6 semanas para coletar dados suficientes. Isso é bom para volume e ruim para contaminação, porque a janela longa tende a incluir a calibração inteira dentro do período comparado, em vez de deixá-la de fora.
- O ciclo de conversão aparece duas vezes na mesma conta: como fator que alonga a calibração e como atraso entre o clique e o desfecho que você vai contar. Um teste de 4 semanas numa conta com ciclo de 10 dias tem as duas últimas semanas subcontadas no momento em que você olha. Esse mecanismo está detalhado em atraso de conversão.
Métricas de guarda para um teste com lances automáticos
Além das métricas de guarda de sempre, como desequilíbrio de amostra, quatro sinais específicos merecem acompanhamento diário:
| sinal | o que observar | o que fazer se disparar |
|---|---|---|
| status da estratégia | qualquer braço marcado como aprendendo dentro da janela de análise | estenda a queima; não compare ainda |
| limitado por orçamento | um braço limitado e o outro não | corrija o orçamento e reinicie a janela; braço estrangulado não é braço tratado |
| impressões por braço | divergência que cresce com o tempo | investigue canibalização de leilão antes de ler conversão |
| ciclo de conversão | mediana de dias entre clique e conversão contra a data de leitura | espere pelo menos um ciclo depois do fim antes de fechar o número |
A regra que resume as quatro: antes de ler o desfecho, confirme que os dois braços passaram o mesmo tempo sendo a mesma coisa.
Erros comuns
- Ligar a estratégia nova no dia 1 e comparar a partir do dia 1. A janela de análise inclui o período em que o tratamento ainda não existia na forma final.
- Ajustar o CPA desejado no meio do teste. Mudança de configuração é gatilho declarado de aprendizado. Você reiniciou o relógio de um braço só.
- Pausar palavras-chave ruins durante a janela. Mudança de composição também reinicia. A faxina pode esperar o fim do teste.
- Escolher a janela depois de ver o resultado. As três leituras do exemplo trabalhado estão todas disponíveis no mesmo relatório. Escolher entre elas depois é escolher o veredito.
- Dimensionar pelo efeito esperado em vez do efeito medível. Com dois sextos do período contaminados, o efeito que chega ao teste já é um terço menor, e o poder cai muito mais que proporcionalmente.
- Confiar no status de aprendizado como sinal de fim. A documentação afirma que os algoritmos continuam aprendendo mesmo quando o status não mostra mais aprendizado.
- Rodar um braço limitado por orçamento e outro não. A diferença medida inclui o estrangulamento, que não é a sua hipótese.
- Assumir que a janela de calibração é igual entre contas. Ela é contada em conversões e ciclos, então escala com o volume, não com o calendário.
Faça isso automático na Donnu
O conserto não é estatística nova, é separar as duas camadas de decisão.
Quando o sorteio acontece na sua página e é você quem controla quando ele começa e termina, a camada de mídia fica do lado de fora da comparação: ela muda quem chega, e quem chega é sorteado depois. Na Donnu o experimento vive no seu site, com a data de início, o período de queima e a data de leitura declarados antes de o teste subir, e o relatório mostra a diferença absoluta com o intervalo ao lado, que é a forma que não se deixa enganar por uma janela mal escolhida. A Donnu é uma opção entre várias; o que não muda de ferramenta para ferramenta é o princípio: se o tratamento mudou de forma no meio da janela, o número que você leu é uma média de duas coisas, e você precisa decidir qual delas queria medir antes de olhar.
Perguntas frequentes
As perguntas no topo desta página cobrem se lances automáticos atrapalham um teste, quanto dura a fase de aprendizado, se dá para descartar as primeiras semanas, o que acontece com o poder, como testar página com o otimizador ligado e o que fazer quando a própria estratégia é o tratamento.
Referências
- Google Ads Help. About Smart Bidding. Fonte da definição de que lances automáticos inteligentes usam a IA do Google para otimizar para conversões ou valor de conversão em cada leilão, do termo lance no momento do leilão, da lista das quatro estratégias (CPA desejado, ROAS desejado, maximizar conversões e maximizar valor de conversão) e da lista de sinais contextuais considerados. Conferido em 24 de setembro de 2026. support.google.com.
- Google Ads Help. Duration of the learning period for campaigns and what affects it. Fonte da afirmação de que pode levar alguns ciclos de conversão, tipicamente 1 ou 2, para a estratégia calibrar para o novo objetivo, dos três fatores que afetam a duração, da definição de ciclo de conversão como o tempo que um clique leva para resultar numa conversão e da afirmação de que os algoritmos continuam aprendendo mesmo quando o status não mostra mais aprendizado. Conferido em 24 de setembro de 2026. support.google.com.
- Google Ads Help. About bid strategy statuses. Fonte da lista de status e dos três motivos declarados do status de aprendizado (nova estratégia, mudança de configuração e mudança de composição), além dos status de estratégia limitada por inventário, limite de lance, orçamento ou pela própria estratégia. Conferido em 24 de setembro de 2026. support.google.com.
- Google Ads Help. About the “Experiments” page. Fonte da recomendação de deixar o experimento rodar por pelo menos 4 a 6 semanas para coletar dados suficientes para avaliar os resultados. Conferido em 24 de setembro de 2026. support.google.com.
- Google Ads Help. Set up a custom experiment. Fonte da descrição da divisão por cookie, recomendada, que atribui usuários aleatoriamente e garante que um usuário veja apenas uma versão, contra a divisão por busca, em que o usuário é colocado aleatoriamente a cada busca e pode ver as duas. Conferido em 24 de setembro de 2026. support.google.com.
Leia também: Teste A/B na plataforma de anúncios · Teste de incrementalidade · Experimentos geográficos · Atraso de conversão · O problema do peeking · Desequilíbrio de amostra · Fadiga de criativo · Read in English
Perguntas frequentes
- Lances automáticos atrapalham um teste A/B?
- Não atrapalham o sorteio, atrapalham a janela. Uma estratégia de lance automático recalibra ao longo do tempo, e o Google documenta que essa recalibração pode levar alguns ciclos de conversão, tipicamente 1 ou 2. Se essa janela cai dentro do período que você vai comparar, o seu braço tratado passou parte do tempo sendo uma coisa e parte do tempo sendo outra. A média das duas não é o efeito de nenhuma delas.
- Quanto tempo dura a fase de aprendizado do lance?
- O Google Ads afirma que pode levar alguns ciclos de conversão, tipicamente 1 ou 2, para a estratégia calibrar para o novo objetivo, e que pode ser mais rápido dependendo do volume de dados de conversão presente. A duração depende de três fatores declarados: o número de conversões que as campanhas obtêm, a duração dos seus ciclos de conversão e a própria estratégia escolhida. Ciclo de conversão é o tempo que um clique leva para virar conversão.
- Posso simplesmente jogar fora as primeiras semanas do teste?
- Pode, desde que você decida isso antes de olhar o resultado e aplique o corte aos dois braços pelo mesmo critério. Um período de queima declarado no plano é desenho de experimento. O mesmo corte escolhido depois de ver os números é seleção de dados e infla o falso positivo do mesmo jeito que parar cedo infla. Escreva a data de corte na hipótese, não no relatório.
- O que acontece com o poder do teste se eu incluir o aprendizado?
- Ele despenca, porque o efeito medido encolhe. No exemplo trabalhado deste guia, o efeito verdadeiro pós-aprendizado é de mais 7,5 por cento relativos e a janela inteira mede apenas mais 2,5 por cento. Com 96.000 cliques por braço o poder para detectar o efeito diluído é de 19,8 por cento, contra 76,8 por cento para o efeito real com os 64.000 cliques pós-aprendizado. Mais dados e menos poder, ao mesmo tempo.
- Dá para testar a página enquanto a estratégia de lance muda?
- Dá, mas só se as duas mudanças não coincidirem. Se você sorteia visitantes entre duas páginas no seu site, o lance automático atua antes do clique e cai nos dois braços por igual, então ele não enviesa a comparação, apenas mexe na composição do tráfego ao longo do tempo. O problema aparece quando a mudança de estratégia acontece no meio do teste de página: aí a mistura de tráfego muda no meio do caminho e o efeito de período se confunde com o efeito da página.
- E se a própria estratégia de lance for o que eu quero testar?
- Aí ela é o tratamento, e o desenho muda. Um experimento personalizado da plataforma com divisão por cookie e orçamento separado é o caminho mais direto, com a janela de aprendizado excluída da análise por decisão prévia. Quando o efeito é de conta inteira, como uma mudança de alvo que reorganiza o gasto entre campanhas, a divisão por região com grupo de controle mede melhor, porque o braço tratado e o de controle não disputam o mesmo leilão.