Estatística

Modelo de Atribuição: o mesmo teste, outro veredito

O modelo de atribuição muda quantas conversões o seu teste A/B conta. Por que crédito fracionário quebra o teste de proporção e o que contar no lugar.

Ilustração plana de um caminho de pedras com pequenas luzes de intensidades diferentes sobre cada pedra, levando a um marcador luminoso no fim, sobre fundo verde menta

Um modelo de atribuição não mede conversões, ele reparte crédito. Essa diferença parece semântica até você colocar duas colunas de atribuição diferentes dentro do mesmo teste A/B e ver o veredito virar. No exemplo trabalhado deste guia, o mesmo experimento de página, os mesmos visitantes e os mesmos desfechos reais leem mais 8,33 por cento relativos com valor p de 0,018 sob último clique, e mais 3,79 por cento relativos com valor p de 0,251 sob atribuição orientada a dados. Pior: o segundo valor p não deveria nem ter sido calculado, porque um crédito de 0,63 conversão não é um ensaio de Bernoulli, e o teste de duas proporções assume que é. Este guia cobre o que restou de modelos depois de novembro de 2023, por que a repartição de crédito ataca numerador e denominador ao mesmo tempo, por que um intervalo de confiança sobre crédito fracionário é fabricado, e qual número usar para decidir. Este guia faz parte do nosso guia completo de teste A/B.

O que restou de modelos, e a assimetria que ninguém avisa

O terreno encolheu bastante e vale começar pelo mapa atual.

A documentação do Google Ads afirma que os modelos de primeiro clique, linear, decaimento temporal e baseado em posição não são mais suportados, e que as ações de conversão que os usavam foram migradas para atribuição orientada a dados. Restaram dois: último clique, que dá todo o crédito da conversão ao último anúncio clicado e à palavra-chave correspondente, e orientada a dados, que distribui o crédito com base nos dados passados daquela ação de conversão. O modelo orientado a dados é o padrão para a maioria das ações de conversão.

Até aí, simplificação bem-vinda. A armadilha está no que acontece quando você troca.

produto o que a documentação declara sobre trocar de modelo consequência para quem analisa um teste
Google Ads mudar a configuração de modelo de atribuição de uma ação de conversão só altera a contagem daqui em diante a série temporal ganha um degrau na data da troca; antes e depois não são comparáveis
Google Analytics 4 mudar o modelo de atribuição de relatório se aplica a dados históricos e futuros a série inteira é reescrita; nenhum degrau aparece, e um teste “encerrado” muda de número sem aviso

A mesma decisão, no mesmo dia, produz um degrau visível num produto e uma reescrita silenciosa no outro. Se o seu relatório de experimento cruza as duas fontes, e a maioria cruza, essa assimetria basta para produzir duas verdades sobre o mesmo teste.

Vale registrar também as janelas de retrospectiva do GA4, porque elas definem quanto passado entra na conta: para eventos-chave de aquisição, first_open e first_visit, o padrão é 30 dias com opção de 7; para os demais eventos-chave, o padrão é 90 dias com opções de 30 ou 60. Uma janela de 90 dias significa que a leitura do seu teste de 4 semanas inclui pontos de contato de antes de o teste existir.

Como o mesmo conjunto de jornadas vira dois números diferentes conforme o modeloTrês jornadas de cliente desenhadas como sequências de pontos de contato ligados por setas até uma compra. Na coluna da esquerda, rotulada último clique, apenas o último ponto de contato de cada jornada aparece preenchido, e os anteriores ficam vazios, indicando crédito zero. Na coluna da direita, rotulada orientada a dados, todos os pontos de contato aparecem parcialmente preenchidos em intensidades diferentes, indicando crédito dividido. Abaixo, duas caixas registram o total creditado à mesma campanha em cada modelo, com o total da direita maior mas composto de frações.as jornadas são as mesmas; o que muda é o peso de cada passoúltimo cliqueorientada a dadosnada creditadofraçõescontagem de eventos inteiroscada um vale exatamente 1 ou 0soma de pesos entre 0 e 1um total maior, feito de fraçõessó a coluna da esquerda é uma contagem; a da direita é um valor
Último clique conta eventos. Atribuição orientada a dados soma pesos. As duas colunas se parecem no relatório e são objetos matemáticos diferentes.

Exemplo trabalhado: o mesmo teste sob dois modelos

Os números abaixo saíram do mesmo motor de estatística que roda nas calculadoras desta página.

O cenário: um teste A/B na página de checkout, sorteio no próprio site, 54.000 sessões por braço em 4 semanas, tráfego vindo de uma campanha de busca. A variação B realmente funciona: ela produz 135 compras a mais que o controle. Esse é o efeito verdadeiro, e nenhum modelo de atribuição o altera. O que muda é como ele aparece na coluna que você vai comparar.

Sob último clique, as jornadas em que o anúncio foi o último clique contam inteiras, uma a uma:

A: 1.620 / 54.000 = 3,0000% e B: 1.755 / 54.000 = 3,2500%

Sob atribuição orientada a dados, duas coisas acontecem ao mesmo tempo. Primeiro, jornadas assistidas que o último clique creditava com zero passam a receber crédito parcial. Nesse cenário isso soma 189,0 conversões creditadas em cada braço, igualmente, porque essas jornadas não têm nada a ver com qual variação a pessoa viu. Segundo, as 135 compras incrementais que a variação criou são divididas com os pontos de contato anteriores: a campanha fica com cerca de 50,7 por cento do crédito nelas, ou seja, 68,5 em vez de 135.

A: 1.620 + 189,0 = 1.809,0 / 54.000 = 3,3500% B: 1.755 + 189,0 − 66,5 = 1.877,5 / 54.000 = 3,4769%

leitura controle tratamento diferença lift relativo valor p IC 95% (pp)
último clique 1.620 (3,0000%) 1.755 (3,2500%) +0,2500 pp +8,3333% 0,018227 +0,0425 a +0,4575
orientada a dados 1.809,0 (3,3500%) 1.877,5 (3,4769%) +0,1269 pp +3,7866% 0,250987 −0,0897 a +0,3434

Significante num, não significante no outro. Cole os números da primeira linha na calculadora abaixo e confira; depois cole os da segunda e repare que a calculadora aceita sem reclamar, o que é exatamente o problema da próxima seção.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

A dupla atenuação tem nome próprio para cada metade:

A repartição de crédito ataca numerador e denominador ao mesmo tempoDois pares de barras. No par da esquerda, rotulado último clique, as barras do controle e do tratamento têm bases iguais e o tratamento tem um bloco adicional no topo identificado como o efeito inteiro. No par da direita, rotulado orientada a dados, as duas barras ganham um bloco de base extra idêntico, identificado como crédito assistido que existe nos dois braços, e o bloco adicional do tratamento aparece reduzido a cerca de metade, identificado como a fração do efeito que ficou nesta coluna. Uma nota registra que a base cresceu e o efeito encolheu, e que as duas mudanças empurram o lift relativo para o mesmo lado.base maior e efeito menor, na mesma troca de modeloúltimo cliqueorientada a dadoscontroletratamentoefeito inteirocontroletratamentofraçãocrédito assistidoigual nos dois braçoso lift relativo cai de mais 8,33% para mais 3,79% sem nada mudar na realidade
O crédito assistido engorda a base nos dois braços por igual. A divisão do bloco incremental corta o efeito. As duas coisas empurram o lift relativo na mesma direção.

Por que aquele segundo valor p não vale nada

Esta é a parte técnica que quase nenhum relatório enfrenta, e é a mais importante do guia.

Um teste de duas proporções pressupõe ensaios de Bernoulli: cada unidade da amostra ou converte, valendo 1, ou não converte, valendo 0. A variância de uma proporção estimada nessas condições é p × (1 − p) / n, e é essa fórmula que produz o erro padrão, o valor z, o valor p e o intervalo de confiança.

Crédito fracionário rompe a premissa de um jeito básico. Quando o Google Ads afirma que você vai encontrar decimais nas colunas de Conversões e Todas as conv. pela primeira vez ao mudar para um modelo que não seja o de último clique, ele está dizendo que o conteúdo daquela coluna deixou de ser uma contagem de eventos e virou uma soma de pesos entre zero e um.

Uma soma de pesos entre zero e um com a mesma média tem variância menor que a de uma contagem de sucessos, porque valores intermediários se afastam menos da média do que 0 e 1. Ou seja: a fórmula que a calculadora aplica atribui ao seu estimador uma dispersão que ele não tem, e o intervalo de confiança devolvido não descreve o objeto que você mediu. Ele não é conservador nem anticonservador por regra geral, ele é simplesmente de outro estimador.

Isso muda o que “não significante” significa naquela segunda linha da tabela. O honesto é dizer: aquele valor p não deveria ter sido calculado, e o número de 3,79 por cento é uma estimativa de valor creditado, útil para conversa de orçamento, imprópria como desfecho de experimento.

coluna o que é serve para teste de hipótese?
eventos observados com a variação anexada contagem de 0 e 1 por usuário sorteado sim, é exatamente o objeto que a fórmula descreve
conversões sob último clique contagem de eventos inteiros, filtrada por uma regra sim, com a ressalva de que a regra de filtro precisa ser a mesma nos dois braços
conversões sob atribuição orientada a dados soma de pesos entre 0 e 1 não, a variância do estimador não é p(1−p)/n
valor de conversão soma de valores monetários não como proporção; peça um teste para médias com a variância observada

A regra prática que sai daí é curta: teste de proporção pede contagem; se tem vírgula, não é contagem.

A fronteira com conversões modeladas

Vale separar dois mecanismos que produzem sintomas parecidos e têm causas diferentes.

Em conversões modeladas, a plataforma inventa um bloco de conversões que não observou, usando padrões agregados, e esse bloco cai nos dois braços por igual porque o modelo não conhece a sua variação. A diluição vem de dado que não existe no nível do usuário.

Aqui, a plataforma divide um crédito entre pontos de contato que ela observou. O dado existe, as jornadas são reais, e ainda assim o efeito encolhe, porque parte dele foi contabilizada em outro lugar do relatório.

Os dois mecanismos somam, e é comum encontrar os dois na mesma coluna ao mesmo tempo. O sintoma compartilhado também é o mesmo: a quebra por variação não fecha com o total de topo, e tentar reconciliar os dois dentro do teste é o hábito mais destrutivo dos dois guias. Reconcilie no relatório, nunca dentro do teste estatístico.

O que a mudança de modelo custa em tráfego

Se, apesar de tudo, você precisa ler o experimento na coluna creditada, o custo aparece no tamanho de amostra. O efeito que você vai medir é o atenuado, e amostra escala com o inverso do quadrado do efeito.

leitura base efeito a detectar amostra por braço dias a 27.000 sessões/semana
último clique 3,00% +8,33% relativos 76.095 40
orientada a dados 3,35% +3,79% relativos 321.058 167

Quatro vezes o tráfego e quatro meses de calendário em vez de pouco mais de um mês, para responder exatamente a mesma pergunta de produto. Ajuste os parâmetros na calculadora abaixo com a sua base real.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

O modelo de atribuição também alimenta o otimizador

Um detalhe que fecha o ciclo com a camada de mídia: a documentação do Google Ads afirma que o modelo de atribuição que você seleciona afeta como os seus lances são otimizados quando a campanha usa estratégias que otimizam para conversões, como CPA desejado, CPC otimizado ou ROAS desejado.

Isso quer dizer que trocar de modelo no meio de um teste não muda só o relatório. Muda o alvo que o otimizador persegue, o que muda quais leilões ele compra, o que muda a composição do tráfego que chega ao seu experimento. Uma troca de modelo no dia 12 de um teste de 28 dias é, ao mesmo tempo, uma mudança de métrica e uma mudança de configuração de lance, com tudo o que isso implica de recalibração.

Sobre o calendário, a própria documentação recomenda esperar até que tenha passado o número médio de dias até a conversão antes de avaliar o desempenho depois de uma mudança de modelo, e sugere excluir as semanas mais recentes da análise por causa do atraso. É o mesmo mecanismo tratado em atraso de conversão, agora com um segundo motivo para esperar.

Trocar de modelo no meio de um teste dispara três efeitos encadeadosUm encadeamento horizontal de quatro caixas ligadas por setas. A primeira caixa registra a troca do modelo de atribuição. A segunda registra que a métrica de conversão reportada muda de forma. A terceira registra que o alvo do otimizador de lances muda junto, porque a documentação declara que o modelo selecionado afeta como os lances são otimizados. A quarta registra que a composição do tráfego que chega ao experimento muda em consequência. Uma seta de retorno liga a quarta caixa de volta à segunda, indicando que o efeito realimenta a métrica.uma troca de modelo no meio do teste não é só de relatóriotroca de modelono dia 12 de 28a métrica mudacontagem vira soma de pesoso lance mudaoutro alvo, outra calibraçãoo tráfego mudaoutra composiçãoe realimenta a métricanenhuma dessas quatro mudanças respeita a fronteira entre os braços no tempopor isso a única regra sem exceção é: um modelo por teste, declarado antes de começar
Mudar o modelo de atribuição no meio da janela muda a métrica, o lance e o tráfego. Nenhuma das três mudanças pede licença ao seu desenho experimental.

O protocolo que resolve

Quatro decisões, todas tomadas antes de o teste subir:

  1. Escolha o desfecho da decisão e escreva na hipótese. Para a decisão do experimento, um evento seu, contado por inteiro, um por usuário sorteado, com a variação anexada. Esse número é pequeno, é menos glamouroso que a coluna da plataforma e é o único que a fórmula do teste descreve.
  2. Declare o modelo de atribuição do relatório e não toque nele. Um modelo por teste. Se o negócio precisa mudar de modelo, encerre o teste, mude e comece outro.
  3. Reporte diferença absoluta com intervalo, além do lift relativo. A diferença absoluta é o que sobrevive a um bloco de crédito que cresce igual nos dois braços; o lift relativo é exatamente a quantidade que a diluição ataca.
  4. Mantenha a coluna creditada no relatório, rotulada. Ela responde a outra pergunta, legítima, que é quanto aquela mídia contribuiu. Só não deixe ela responder à pergunta de qual variação venceu.

Erros comuns

Faça isso automático na Donnu

O conserto é de arquitetura, não de estatística.

Um experimento precisa de um desfecho que pertence a ele: um evento, um usuário, um braço, valendo 1 ou 0. Quando o sorteio e o evento de conversão vivem no mesmo lugar, não existe repartição de crédito para fazer, porque não existe disputa entre pontos de contato: a pergunta é apenas se esta pessoa, que viu esta variação, converteu. Na Donnu é assim que o resultado é calculado, e o relatório mostra a diferença absoluta com o intervalo ao lado do lift relativo, para que uma base creditada crescente não se disfarce de queda de desempenho. A Donnu é uma opção entre várias; o princípio vale em qualquer ferramenta: a coluna da plataforma responde quanto a mídia contribuiu, e o seu evento responde qual variação venceu. São duas perguntas, e uma delas não aceita vírgula.

Perguntas frequentes

As perguntas no topo desta página cobrem se o modelo muda o resultado do teste, quais modelos ainda existem, se dá para testar crédito fracionário, por que a atribuição orientada a dados encolhe o lift, se a troca reescreve o histórico e qual modelo usar no experimento.

Referências

Leia também: Conversões modeladas · Lances automáticos · Atraso de conversão · Atribuindo receita ao vencedor · Teste de incrementalidade · Perda de rastreamento · Significância estatística · Read in English

Perguntas frequentes

O modelo de atribuição muda o resultado de um teste A/B?
Muda, porque ele redefine o que conta como conversão daquele canal. No exemplo trabalhado deste guia, o mesmo experimento de página lê mais 8,33 por cento relativos com valor p de 0,018 sob último clique e mais 3,79 por cento relativos com valor p de 0,251 sob atribuição orientada a dados. O sorteio é o mesmo, as pessoas são as mesmas e os desfechos reais são os mesmos. O que mudou foi o peso que cada desfecho recebe na coluna que você comparou.
Quais modelos de atribuição ainda existem no Google Ads?
Dois. A documentação do Google Ads afirma que os modelos de primeiro clique, linear, decaimento temporal e baseado em posição não são mais suportados, e que as ações de conversão que os usavam foram migradas para atribuição orientada a dados. Restaram último clique, que dá todo o crédito ao último anúncio clicado e à palavra-chave correspondente, e orientada a dados, que distribui o crédito com base nos dados passados daquela ação de conversão. O modelo orientado a dados é o padrão para a maioria das ações de conversão.
Posso rodar um teste de significância sobre conversões com crédito fracionário?
Não do jeito padrão. Um teste de duas proporções assume ensaios de Bernoulli: cada unidade converte ou não converte, e a variância é p vezes 1 menos p dividido por n. Quando o crédito é dividido entre pontos de contato, o total deixa de ser uma contagem de sucessos e passa a ser uma soma de pesos entre zero e um, cuja variância é outra. O valor p sai de uma fórmula que não descreve o seu estimador. Rode a decisão sobre desfechos contados por inteiro e guarde o valor creditado para o relatório de negócio.
Por que a atribuição orientada a dados encolhe o lift medido?
Por dois caminhos somados. O bloco incremental que a sua variação criou é dividido com os pontos de contato anteriores, então só uma fração dele aparece na coluna, o que ataca o numerador. E jornadas assistidas que o último clique contava como zero passam a receber crédito parcial nos dois braços por igual, o que engorda a base e ataca o denominador. As duas forças empurram o lift relativo na mesma direção, para perto de zero.
Mudar o modelo de atribuição reescreve o histórico?
Depende do produto, e essa assimetria confunde muita gente. O Google Ads afirma que mudar a configuração de modelo de atribuição de uma ação de conversão só altera a contagem dali em diante. O Google Analytics 4 afirma o contrário para o modelo de relatório: mudar o modelo de atribuição de relatório se aplica a dados históricos e futuros. Uma mesma mudança feita no mesmo dia pode deixar a série do Ads com um degrau e a do Analytics sem degrau nenhum.
Qual modelo eu devo usar no meu experimento?
O que você declarou antes de começar, e apenas um. A pergunta útil não é qual modelo é mais verdadeiro, é qual número você vai comparar entre dois braços sorteados. Para a decisão do experimento, desfechos contados por inteiro no seu próprio evento, com a variação anexada. Para o relatório de mídia, a coluna creditada da plataforma, declarada como tal. Trocar de modelo no meio do teste é o único movimento que não tem defesa.