CRO

Lances Automáticos: o otimizador é parte do seu teste

Lances automáticos recalibram durante o seu teste A/B. Como a fase de aprendizado dilui o efeito medido, o custo em poder e três desenhos que sobrevivem.

Ilustração plana de um regulador mecânico com volante ajustando sozinho a válvula de um funil que despeja pequenas esferas numa calha, sobre fundo verde menta

Lances automáticos não são um ajuste de configuração, são um segundo experimento rodando por cima do seu. Uma estratégia de lance que otimiza no leilão recalibra ao longo do tempo, e o Google Ads declara que essa recalibração pode levar alguns ciclos de conversão, tipicamente 1 ou 2. Se essa janela cai dentro do período que você vai comparar, o braço tratado foi uma coisa nas duas primeiras semanas e outra coisa nas quatro seguintes, e a média das duas não é o efeito de nenhuma. No exemplo trabalhado deste guia, o mesmo experimento devolve três vereditos diferentes conforme a janela lida: o tratamento perde de forma significante nas semanas 1 e 2, empata na janela inteira de 6 semanas e vence de forma significante nas semanas 3 a 6. Nenhum dos três é erro de cálculo. Este guia cobre o que o otimizador faz que o seu plano não previu, por que a diluição é aritmética simples, quanto ela custa em poder, e três desenhos que sobrevivem a um otimizador ligado. Este guia faz parte do nosso guia completo de teste A/B.

O que o lance automático faz que o seu plano não previu

A documentação do Google é direta na definição: lances automáticos inteligentes usam a IA do Google para otimizar para conversões ou valor de conversão em cada leilão, um recurso descrito como lance no momento do leilão. As quatro estratégias desse grupo são CPA desejado, ROAS desejado, maximizar conversões e maximizar valor de conversão.

Repare no “em cada leilão”. Isso quer dizer que o lance não é um número que você fixou e que vale igual do primeiro ao último dia. É uma função que recebe sinais de contexto e devolve um lance diferente a cada consulta. A lista declarada de sinais inclui tipo de dispositivo, localização física, intenção de localização, hora do dia, dia da semana, pertencimento a lista de remarketing, características do anúncio, idioma da interface, navegador, sistema operacional e a própria consulta de busca, além de atributos de produto, competitividade de preço e sazonalidade em alguns tipos de campanha.

Para um experimento, três consequências saem daí.

o que o otimizador faz consequência para o teste
recalibra com o tempo o tratamento no dia 3 não é o mesmo tratamento do dia 30
escolhe quem entra a composição do tráfego do braço muda junto, então a taxa de conversão base se move sem que nada na página tenha mudado
persegue um alvo, não um resultado manter o CPA no alvo pode significar cortar volume, e volume cortado muda o denominador do seu teste

Nenhuma das três quebra o sorteio. Todas as três mexem no que você está comparando.

Um lance fixo é um número, um lance automático é uma função que muda com o tempoDois painéis lado a lado sobre um mesmo eixo de tempo. No painel da esquerda, rotulado lance manual, uma linha horizontal reta atravessa todo o período, indicando que o mesmo lance vale do primeiro ao último dia. No painel da direita, rotulado lance automático, uma linha irregular sobe e desce nas primeiras semanas e depois se estabiliza numa altura diferente da inicial, indicando que a estratégia recalibra antes de assentar. Uma faixa sombreada cobre o trecho inicial da linha irregular e é identificada como a janela de calibração.o tratamento que você sorteou muda de forma no meio do períodolance manualo mesmo número todos os diasdia 1dia 42lance automáticocalibraçãoassentadonível final diferente do inicialcomparar a janela inteira mistura dois tratamentos diferentes num número só
Um lance manual é constante por construção. Um lance automático é uma função que se ajusta, e o período em que ela se ajusta pertence ao seu experimento tanto quanto o período depois.

A fase de aprendizado tem um tamanho, e ele é medido em conversões

Esta é a parte que quase todo plano de teste ignora, apesar de estar documentada.

O Google Ads declara que pode levar alguns ciclos de conversão, tipicamente 1 ou 2, para a estratégia de lance calibrar para o novo objetivo, e acrescenta que pode ser mais rápido dependendo do volume de dados de conversão presente. A duração depende de três fatores nomeados: o número de conversões que as campanhas, grupos de anúncios, palavras-chave ou produtos obtêm, a duração dos ciclos de conversão, definida como o tempo que um clique leva para resultar numa conversão, e a estratégia de lance escolhida.

Duas consequências práticas saem dessa definição.

A primeira é que a janela de aprendizado não é medida em dias, é medida no seu próprio volume. Os dois primeiros fatores declarados, o número de conversões obtidas e a duração dos ciclos de conversão, são ambos propriedades da sua conta, não do calendário. Uma conta com volume alto e ciclo de conversão de dois dias fecha os ciclos de calibração antes do fim da primeira semana. Uma conta com volume baixo e ciclo de duas semanas gasta quase o teste inteiro para fechar os mesmos ciclos. O mesmo teste, com o mesmo desenho, tem uma janela contaminada curta numa conta e longa na outra.

A segunda é que o status deixar de dizer aprendizado não significa que acabou. A própria documentação afirma que os algoritmos continuam aprendendo mesmo quando o status de lance não mostra mais “Aprendizado”. O indicador visível é um piso, não um teto.

Vale conhecer também os gatilhos declarados do status de aprendizado, porque cada um deles é uma coisa que você pode acidentalmente fazer no meio de um teste:

gatilho declarado o que significa como aparece num teste
nova estratégia a estratégia foi criada ou reativada há pouco é o caso esperado quando a estratégia é o tratamento
mudança de configuração uma configuração da estratégia foi alterada alguém ajustou o CPA desejado na terceira semana “porque estava caro”
mudança de composição campanhas, grupos de anúncios ou palavras-chave entraram ou saíram da estratégia uma pausa de palavra-chave de baixo desempenho reinicia o relógio

Existem ainda os status de estratégia limitada, por inventário, limite de lance, orçamento ou pela própria estratégia. Um braço limitado por orçamento enquanto o outro não está não é um braço tratado, é um braço estrangulado, e essa diferença não tem nada a ver com a hipótese que você escreveu.

A mesma janela de aprendizado ocupa frações diferentes do teste conforme o volume da contaTrês barras horizontais empilhadas, todas do mesmo comprimento, representando um teste de seis semanas em três contas de volume diferente. Na conta de alto volume, o trecho inicial sombreado que representa a calibração é muito curto e ocupa uma fração pequena da barra. Na conta de volume médio, o trecho sombreado ocupa cerca de um terço da barra. Na conta de baixo volume, o trecho sombreado cobre quase toda a barra, indicando que o teste inteiro aconteceu durante a calibração. Uma nota registra que o desenho do teste é idêntico nos três casos e apenas o volume muda.o mesmo teste de 6 semanas, três contas, três janelas contaminadaso trecho escuro é o período de calibração; o claro é o período comparávelalto volume10%volume médio33%baixo volume90%a janela é contada em conversões, não em diaspor isso o mesmo plano de teste é seguro numa conta e inútil na outra
Os mesmos poucos ciclos de conversão significam coisas muito diferentes conforme o volume e o ciclo da conta. O plano de teste que funciona no cliente grande pode medir apenas calibração no cliente pequeno.

Exemplo trabalhado: um teste, três vereditos

Os números abaixo saíram do mesmo motor de estatística que roda nas calculadoras desta página, não de estimativa a olho.

O cenário: uma campanha de busca com 32.000 cliques por semana, dividida meio a meio por cookie entre a campanha original e a de experimento. O controle mantém CPC manual, o tratamento passa a CPA desejado. O teste roda 6 semanas. A taxa de conversão do controle é estável em 4,00 por cento durante todo o período.

A estratégia nova entra em calibração nas duas primeiras semanas e converte pior nesse trecho: 3,70 por cento. A partir da terceira semana, calibrada, ela converte melhor: 4,30 por cento. Vamos ler o mesmo experimento de três maneiras.

janela lida controle tratamento diferença lift relativo valor p IC 95% (pp) veredito
semanas 1 e 2 1.280/32.000 = 4,0000% 1.184/32.000 = 3,7000% −0,3000 pp −7,5000% 0,048574 −0,5981 a −0,0019 o tratamento perde
semanas 1 a 6 3.840/96.000 = 4,0000% 3.936/96.000 = 4,1000% +0,1000 pp +2,5000% 0,266396 −0,0764 a +0,2764 empate
semanas 3 a 6 2.560/64.000 = 4,0000% 2.752/64.000 = 4,3000% +0,3000 pp +7,5000% 0,007129 +0,0815 a +0,5185 o tratamento vence

Três leituras do mesmo experimento, três conclusões incompatíveis, nenhuma delas errada aritmeticamente. Cole os números na calculadora abaixo e reproduza qualquer uma das três linhas.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

A diluição não é misteriosa, é média ponderada. Dois sextos do período tiveram efeito de menos 0,30 pontos e quatro sextos tiveram mais 0,30 pontos:

(2/6) × (−0,30) + (4/6) × (+0,30) = −0,10 + 0,20 = +0,10 pp

Que é exatamente a diferença que a janela inteira reporta. O experimento não mediu o efeito da estratégia nova, mediu a média entre a estratégia se ajustando e a estratégia ajustada, ponderada por quanto tempo cada uma ocupou o relógio.

Intervalos de confiança das três janelas do mesmo experimentoTrês intervalos de confiança horizontais alinhados sobre um eixo comum de diferença em pontos percentuais, com uma linha vertical marcando o zero. O primeiro intervalo, das semanas um e dois, fica inteiramente à esquerda do zero e é rotulado como o tratamento perde. O segundo intervalo, da janela inteira de seis semanas, cruza o zero e é rotulado como empate. O terceiro intervalo, das semanas três a seis, fica inteiramente à direita do zero e é rotulado como o tratamento vence. Uma nota abaixo registra que os três saíram do mesmo experimento e diferem apenas pela janela escolhida.o mesmo experimento, três janelas, três vereditosdiferença entre tratamento e controle, em pontos percentuaiszerosemanas 1 e 2o tratamento perde, p = 0,0486semanas 1 a 6empate, p = 0,2664semanas 3 a 6vence, p = 0,0071escolher a janela depois de ver os números é escolher o veredito
Nenhum dos três intervalos está errado. O que está errado é decidir qual deles reportar depois de olhar para os três.

O que a contaminação custa em poder

Aqui está o detalhe que mais surpreende: incluir a fase de aprendizado deixa você com mais dados e menos poder ao mesmo tempo.

Com 64.000 cliques por braço, apenas as semanas 3 a 6, o poder para detectar o efeito real de mais 7,5 por cento relativos sobre uma base de 4 por cento é de 76,8 por cento. Para chegar a 80 por cento, bastariam 69.379 cliques por braço.

Com 96.000 cliques por braço, as 6 semanas inteiras, o efeito que sobrou para detectar é o diluído, de mais 2,5 por cento relativos. O poder para detectar esse efeito cai para 19,8 por cento, e para chegar a 80 por cento seriam necessários 610.010 cliques por braço, quase nove vezes o tráfego do teste inteiro.

Metade do efeito custa quatro vezes a amostra, porque o tamanho de amostra escala com o inverso do quadrado do efeito. Um período de queima de duas semanas num teste de seis é caro exatamente nessa proporção.

efeito relativo a detectar amostra por braço (base 4%, 95%, 80%) dias a 32.000 cliques/semana
+15% 17.943 8
+10% 39.475 18
+7,5% (efeito real) 69.379 31
+5% 154.304 68
+2,5% (efeito diluído) 610.010 267

Dimensione pelo efeito que você vai medir, não pelo que você espera. Se o plano inclui duas semanas de calibração numa janela de seis, o efeito que você vai medir já nasce um terço menor.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Mais dados e menos poder ao mesmo tempoDuas colunas comparadas. A coluna da esquerda representa a janela pós-calibração, com sessenta e quatro mil cliques por braço e um medidor de poder preenchido até cerca de três quartos. A coluna da direita representa a janela inteira, com noventa e seis mil cliques por braço, uma barra de amostra visivelmente maior, e um medidor de poder preenchido até cerca de um quinto. Uma seta entre as duas colunas aponta da esquerda para a direita e é rotulada como mais cinquenta por cento de dados. Uma nota abaixo registra que o efeito diluído é o que manda no poder, não o tamanho da amostra.incluir a calibração adiciona amostra e destrói podersemanas 3 a 664.000 por braçoefeito a detectar: +7,5%poder 76,8%mais 50%de dadossemanas 1 a 696.000 por braçoefeito a detectar: +2,5%poder 19,8%o poder segue o efeito, e o efeito foi cortado pela metadepara chegar a 80% de poder sobre o efeito diluído seriam 610.010 cliques por braço,quase nove vezes o tráfego que o teste inteiro gerou em seis semanas
Amostra não compra poder quando o que encolheu foi o efeito. Um período de queima dentro da janela de análise ataca o numerador da conta, não o denominador.

Três desenhos que sobrevivem a um otimizador ligado

Não existe um único jeito certo. Existe o desenho certo para o que você está testando.

Desenho 1: período de queima declarado. Use quando a estratégia de lance É o tratamento. Escreva na hipótese, antes de ligar qualquer coisa, que os primeiros N dias ou as primeiras N conversões serão descartados da análise, e que o critério de corte é o mesmo nos dois braços. Isso transforma a contaminação num custo conhecido de desenho, em vez de num viés escondido. O corte precisa estar no plano, nunca no relatório: o mesmo recorte escolhido depois de ver os números infla o falso positivo do mesmo jeito que parar o teste cedo infla.

Desenho 2: congele o lance e teste só a página. Use quando o que você quer testar é a página, não a mídia. Se o sorteio acontece no seu site, depois do clique, o lance automático atua antes e cai nos dois braços por igual. Ele não enviesa a comparação. O que ele faz é mover a composição do tráfego ao longo do tempo, e isso só vira problema se a estratégia mudar no meio do teste. Então não mude: nenhuma alteração de alvo, de orçamento, de composição da estratégia durante a janela.

Desenho 3: divisão por região com controle. Use quando o efeito é de conta inteira, como um alvo novo que reorganiza o gasto entre campanhas, ou quando os dois braços disputariam o mesmo leilão. A divisão por região elimina a disputa interna, ao custo de unidades bem maiores e menos numerosas. O desenho está detalhado em experimentos geográficos e a leitura causal do resultado em teste de incrementalidade.

situação desenho por que
a estratégia de lance é o tratamento, conta com volume experimento da plataforma com divisão por cookie + queima declarada a divisão por cookie mantém a pessoa num braço só; a queima tira a calibração da conta
a estratégia é o tratamento, conta de baixo volume divisão por região com controle os ciclos de calibração consumiriam o teste inteiro; a região dá unidade maior
a página é o tratamento sorteio no site, estratégia congelada o lance atua antes do clique e cai igual nos dois braços
mudança de alvo que reorganiza gasto entre campanhas divisão por região com controle braços na mesma conta canibalizam pelo mesmo leilão
o alvo precisa mudar no meio do teste por decisão de negócio pare o teste e recomece mudança de configuração reinicia a calibração nos dois braços em momentos diferentes
Árvore de decisão para escolher o desenho diante de um lance automáticoUm diagrama de decisão que começa com a pergunta sobre o que é o tratamento. Se o tratamento é a página, o caminho leva a sortear no site e congelar a estratégia de lance durante a janela. Se o tratamento é a própria estratégia de lance, uma segunda pergunta separa contas por volume de conversão. Contas com volume suficiente seguem para experimento da plataforma com divisão por cookie e período de queima declarado. Contas de baixo volume, ou casos em que os dois braços disputariam o mesmo leilão, seguem para divisão por região com grupo de controle.qual desenho usaro que é o tratamento?a páginao lancesorteie no sitee congele a estratégia de lanceo volume fecha os ciclos?simnãoexperimento por cookiecom queima declarada no planodivisão porregiãoem qualquer ramo: nenhuma mudança de configuração durante a janela de análise
A escolha do desenho depende de onde mora o tratamento e de se os dois braços disputariam o mesmo leilão.

A fronteira com o desenho do split da plataforma

Vale separar duas coisas que costumam se confundir.

O mecanismo do sorteio dentro da plataforma, divisão por cookie contra divisão por busca, orçamento compartilhado, entrega otimizada, é assunto de teste A/B na plataforma de anúncios. Sobre isso, a documentação do Google é clara: a divisão por cookie, recomendada, atribui usuários aleatoriamente ao experimento ou à campanha original e garante que um mesmo usuário veja apenas uma das duas, enquanto na divisão por busca o usuário é colocado aleatoriamente a cada busca, de modo que a mesma pessoa pode ver as duas versões.

O que este guia trata é diferente e vem depois: mesmo com um sorteio perfeito, o tratamento muda de forma ao longo da janela. Divisão por cookie impecável, orçamentos separados, e ainda assim as semanas 1 e 2 mediram uma coisa que não existe mais na semana 5.

Duas armadilhas de calendário fecham o quadro:

Métricas de guarda para um teste com lances automáticos

Além das métricas de guarda de sempre, como desequilíbrio de amostra, quatro sinais específicos merecem acompanhamento diário:

sinal o que observar o que fazer se disparar
status da estratégia qualquer braço marcado como aprendendo dentro da janela de análise estenda a queima; não compare ainda
limitado por orçamento um braço limitado e o outro não corrija o orçamento e reinicie a janela; braço estrangulado não é braço tratado
impressões por braço divergência que cresce com o tempo investigue canibalização de leilão antes de ler conversão
ciclo de conversão mediana de dias entre clique e conversão contra a data de leitura espere pelo menos um ciclo depois do fim antes de fechar o número

A regra que resume as quatro: antes de ler o desfecho, confirme que os dois braços passaram o mesmo tempo sendo a mesma coisa.

Erros comuns

Faça isso automático na Donnu

O conserto não é estatística nova, é separar as duas camadas de decisão.

Quando o sorteio acontece na sua página e é você quem controla quando ele começa e termina, a camada de mídia fica do lado de fora da comparação: ela muda quem chega, e quem chega é sorteado depois. Na Donnu o experimento vive no seu site, com a data de início, o período de queima e a data de leitura declarados antes de o teste subir, e o relatório mostra a diferença absoluta com o intervalo ao lado, que é a forma que não se deixa enganar por uma janela mal escolhida. A Donnu é uma opção entre várias; o que não muda de ferramenta para ferramenta é o princípio: se o tratamento mudou de forma no meio da janela, o número que você leu é uma média de duas coisas, e você precisa decidir qual delas queria medir antes de olhar.

Perguntas frequentes

As perguntas no topo desta página cobrem se lances automáticos atrapalham um teste, quanto dura a fase de aprendizado, se dá para descartar as primeiras semanas, o que acontece com o poder, como testar página com o otimizador ligado e o que fazer quando a própria estratégia é o tratamento.

Referências

Leia também: Teste A/B na plataforma de anúncios · Teste de incrementalidade · Experimentos geográficos · Atraso de conversão · O problema do peeking · Desequilíbrio de amostra · Fadiga de criativo · Read in English

Perguntas frequentes

Lances automáticos atrapalham um teste A/B?
Não atrapalham o sorteio, atrapalham a janela. Uma estratégia de lance automático recalibra ao longo do tempo, e o Google documenta que essa recalibração pode levar alguns ciclos de conversão, tipicamente 1 ou 2. Se essa janela cai dentro do período que você vai comparar, o seu braço tratado passou parte do tempo sendo uma coisa e parte do tempo sendo outra. A média das duas não é o efeito de nenhuma delas.
Quanto tempo dura a fase de aprendizado do lance?
O Google Ads afirma que pode levar alguns ciclos de conversão, tipicamente 1 ou 2, para a estratégia calibrar para o novo objetivo, e que pode ser mais rápido dependendo do volume de dados de conversão presente. A duração depende de três fatores declarados: o número de conversões que as campanhas obtêm, a duração dos seus ciclos de conversão e a própria estratégia escolhida. Ciclo de conversão é o tempo que um clique leva para virar conversão.
Posso simplesmente jogar fora as primeiras semanas do teste?
Pode, desde que você decida isso antes de olhar o resultado e aplique o corte aos dois braços pelo mesmo critério. Um período de queima declarado no plano é desenho de experimento. O mesmo corte escolhido depois de ver os números é seleção de dados e infla o falso positivo do mesmo jeito que parar cedo infla. Escreva a data de corte na hipótese, não no relatório.
O que acontece com o poder do teste se eu incluir o aprendizado?
Ele despenca, porque o efeito medido encolhe. No exemplo trabalhado deste guia, o efeito verdadeiro pós-aprendizado é de mais 7,5 por cento relativos e a janela inteira mede apenas mais 2,5 por cento. Com 96.000 cliques por braço o poder para detectar o efeito diluído é de 19,8 por cento, contra 76,8 por cento para o efeito real com os 64.000 cliques pós-aprendizado. Mais dados e menos poder, ao mesmo tempo.
Dá para testar a página enquanto a estratégia de lance muda?
Dá, mas só se as duas mudanças não coincidirem. Se você sorteia visitantes entre duas páginas no seu site, o lance automático atua antes do clique e cai nos dois braços por igual, então ele não enviesa a comparação, apenas mexe na composição do tráfego ao longo do tempo. O problema aparece quando a mudança de estratégia acontece no meio do teste de página: aí a mistura de tráfego muda no meio do caminho e o efeito de período se confunde com o efeito da página.
E se a própria estratégia de lance for o que eu quero testar?
Aí ela é o tratamento, e o desenho muda. Um experimento personalizado da plataforma com divisão por cookie e orçamento separado é o caminho mais direto, com a janela de aprendizado excluída da análise por decisão prévia. Quando o efeito é de conta inteira, como uma mudança de alvo que reorganiza o gasto entre campanhas, a divisão por região com grupo de controle mede melhor, porque o braço tratado e o de controle não disputam o mesmo leilão.