Estatística

Modelagem de Mix de Marketing calibrada por experimento

Modelagem de mix de marketing tem 156 pontos e 80 parâmetros. Como um experimento vira prior de ROI, com as fórmulas de ajuste e um exemplo ponta a ponta.

Ilustração plana de várias fitas curvas de espessuras diferentes despejando num prato de balança, com um pequeno peso de calibração no prato oposto, sobre fundo verde menta

Modelagem de mix de marketing voltou à moda por um motivo defensável, ela não depende de cookie, e carrega um problema que o marketing raramente enuncia: ela tenta estimar dezenas de parâmetros a partir de poucas centenas de pontos, sem nenhum sorteio para separar efeito de demanda. Chan e Perry, do Google, registram que um conjunto típico de dados, três anos de dados semanais nacionais, tem apenas 156 pontos, dos quais se espera um modelo com 20 ou mais canais, e que a regra de bolso de 7 a 10 pontos por parâmetro é algo de que os modelos típicos ficam aquém. A saída que a prática consolidou não é abandonar o modelo, é amarrá-lo a alguma coisa medida com sorteio. Este guia mostra por que a calibração é necessária, como um experimento geográfico vira um prior de ROI com as fórmulas de ajuste documentadas da Meridian, um exemplo ponta a ponta com números calculados no motor real, e o que a calibração continua não consertando. Este guia faz parte do nosso guia completo de teste A/B.

Por que um modelo de mix de marketing não se sustenta sozinho

Chan e Perry organizam os obstáculos de um modelo de mix de marketing em três áreas: limitações de dados, viés de seleção e seleção e incerteza de modelo. Vale percorrer as três, porque cada uma desemboca num tipo diferente de erro.

Limitações de dados. O número mais citável do artigo é o mais simples: um conjunto típico de dados de mix de marketing, com três anos de dados semanais nacionais, tem apenas 156 pontos. Desses 156 pontos, escrevem os autores, espera-se que o modelador produza um modelo com frequentemente 20 ou mais canais de anúncio. Modelar adequadamente um efeito defasado e um retorno decrescente pode exigir de 3 a 4 parâmetros por canal. Vinte canais a três parâmetros já são 60 parâmetros para 156 pontos. A regra de bolso que eles citam para uma regressão linear estável, deixando de lado se os efeitos causais estão bem estimados, é de 7 a 10 pontos por parâmetro, algo de que, nas palavras do artigo, os modelos típicos ficam aquém.

Duas limitações irmãs completam o grupo. Variáveis de entrada correlacionadas, porque anunciantes alocam gasto entre canais de forma correlacionada, o que produz coeficientes de alta variância e atribuição ruim. E faixa limitada de dados, porque o anunciante já se acomodou numa faixa de gasto, e o modelo é então usado para responder perguntas fora dessa faixa, como dobrar o investimento ou zerá-lo. O artigo registra o caso específico: o modelo pode dar estimativas razoáveis de ROAS marginal, por causa dos dados em torno do gasto atual, e estimativas ruins de ROAS médio, que exigiria extrapolar de volta até gasto zero.

Viés de seleção. Os autores o descrevem como possivelmente o maior obstáculo para um modelo de mix de marketing dar estimativas válidas de efetividade. Ele ocorre quando uma variável de mídia é correlacionada com uma variável de demanda não observável que, por sua vez, dirige as vendas; omitida da regressão, o modelo não tem como separar o que veio do canal e o que veio da demanda subjacente.

origem do viés mecanismo declarado no artigo exemplo do artigo
segmentação de anúncio o anúncio mira uma parcela da população que já demonstrou interesse, e esse interesse não é observável nem entra no modelo remarketing, que mira quem já visitou o site, e busca paga, que mira quem já buscou o termo
sazonalidade a mídia é direcionada para a sazonalidade da demanda, e os proxies usados para controlar sazonalidade não garantem refletir a demanda real remédio para resfriado, com gasto subindo e descendo com a estação
efeitos de funil um canal afeta o nível de outro, e estimar todos numa equação só produz estimativas enviesadas uma campanha de TV gera mais buscas pelo termo, o que aumenta o volume de anúncios de busca paga

O ponto sobre funil merece destaque porque ele não é um problema de dado, é de forma do modelo: anúncios a jusante não deveriam entrar na mesma equação de regressão que anúncios determinados de forma exógena. Os autores notam ainda que as alternativas, como modelos gráficos e equações estruturais, exigem estimar o efeito causal do canal de cima sobre o de baixo, o que tem requisitos de dado tão severos quanto o problema original.

Pontos de dados disponíveis contra parâmetros a estimar num modelo de mix típicoUm gráfico de barras com três barras comparadas. A primeira barra, rotulada pontos disponíveis, tem altura correspondente a cento e cinquenta e seis, representando três anos de dados semanais nacionais. A segunda barra, rotulada parâmetros de vinte canais, tem altura correspondente a sessenta, calculada como vinte canais vezes três parâmetros cada. A terceira barra, bem mais alta que a primeira e rotulada pontos necessários pela regra de bolso, tem altura correspondente a quatrocentos e vinte, calculada como sessenta parâmetros vezes sete pontos por parâmetro. Uma linha tracejada na altura da primeira barra atravessa as demais, mostrando o quanto a exigência supera a oferta de dados.a conta que o modelo de mix não fechatrês anos de dados semanais nacionais, vinte canais, três parâmetros por canal156pontos disponíveis60parâmetros a estimar420pontos que a regra pedea 7 por parâmetroteto real de dadosinformação de fora do conjunto de dados não é luxo, é requisito
Com 156 pontos para 60 parâmetros, o modelo não tem como distinguir sozinho entre muitas respostas que explicam os dados igualmente bem. O prior é o que decide entre elas.

O experimento é a verdade de campo, e vem com intervalo

Chan e Perry são igualmente diretos sobre o remédio e sobre o limite dele: embora experimentos sejam fonte de verdade de campo, eles geralmente fornecem uma estimativa pontual. Essa frase resume o desenho inteiro da calibração. O experimento não substitui o modelo, porque ele responde sobre um canal, num período, num nível de gasto. O modelo não substitui o experimento, porque ele não tem sorteio. A calibração é a costura entre os dois.

Vamos construir o lado do experimento com números reais. Os valores abaixo saíram do mesmo motor de estatística que roda nas calculadoras desta página.

O cenário: um experimento geográfico com grupo de controle, em que regiões sorteadas recebem uma campanha de display e as demais não. Cada braço cobre 1.400.000 pessoas ao longo de 4 semanas. A taxa de compra de base é de 0,90 por cento.

braço pessoas compras taxa
controle 1.400.000 12.600 0,9000%
tratado 1.400.000 13.230 0,9450%

O motor devolve: diferença de +0,0450 pontos percentuais, lift relativo de +5,0000 por cento, z de 3,9381, valor p = 0,000082, e intervalo de 95 por cento de +0,0226 a +0,0674 pontos percentuais.

Traduzindo para o que a calibração precisa, com ticket médio de R$ 180 e gasto de R$ 71.000 no braço tratado:

Esse intervalo largo não é defeito do experimento, é o tamanho honesto da incerteza. Tratando a estimativa de ROI como aproximadamente normal, já que ela é uma transformação linear da diferença de proporções, o desvio padrão implícito é de 0,4056, ou um coeficiente de variação de 0,2539. Guarde esses dois números, eles são a entrada da próxima seção.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Como um resultado de experimento vira um prior

A documentação da Meridian, o modelo bayesiano de mix de marketing do Google, começa com uma honestidade que economiza discussão: não existe uma fórmula única para traduzir um resultado de experimento num prior. O que existe é um construtor de calibração com quatro passos declarados: registrar os experimentos, aplicar ajustes aos resultados, mesclar múltiplos experimentos por atualização bayesiana e encaixar distribuições paramétricas, como lognormal, gama ou normal.

Os ajustes são explícitos, e é onde mora a parte interessante. A documentação registra a média e o desvio ajustados de um experimento como:

μ_ajustado = (γ_duração + γ_universo) × μ_experimento

σ_ajustado = σ_experimento × √(1 + τ_gasto + τ_recência + τ_duração + τ_universo)

com os termos automáticos definidos assim:

termo fórmula documentada o que ele corrige
descasamento de gasto τ_gasto = (1 − r) / r, com r a razão entre o gasto do experimento e o gasto do modelo o experimento cobriu uma fatia do gasto; quanto menor a fatia, mais incerteza ele carrega sobre o todo
recência τ_recência = (1 − λ) / λ, com λ = 0,5^(w/52) e w em semanas meia-vida de 52 semanas; um experimento antigo vale menos
duração γ_duração = 1 / p e τ_duração = max((1 − p) / p, 0), com p a proporção do efeito capturada o experimento pode ter terminado antes de o efeito defasado se completar

Multiplicações de incerteza, não de valor: repare que σ é multiplicado pela raiz da soma dos termos mais um, o que significa que cada desalinhamento entre o experimento e o modelo alarga o prior em vez de deslocá-lo.

A mescla de vários experimentos é uma atualização bayesiana comum, p(θ | dados) ∝ π(θ) ∏ L_i(θ), em que cada experimento é tratado como uma observação ruidosa do ROI verdadeiro do canal sob uma verossimilhança normal. O ajuste final à família paramétrica é feito minimizando entropia cruzada, equivalente a minimizar divergência de Kullback-Leibler. O prior padrão de ROI da documentação, quando nada é informado, é uma lognormal de parâmetros 0,2 e 0,9.

Aplicando os ajustes ao nosso experimento

Vamos levar o resultado da seção anterior até o prior, com três desalinhamentos realistas.

Suponha que o experimento cobriu 45 por cento do gasto do canal no período do modelo (r = 0,45), aconteceu 26 semanas atrás (w = 26) e capturou 80 por cento do efeito defasado (p = 0,8).

termo conta valor
τ_gasto (1 − 0,45) / 0,45 1,2222
λ 0,5^(26/52) 0,7071
τ_recência (1 − 0,7071) / 0,7071 0,4142
γ_duração 1 / 0,8 1,2500
τ_duração (1 − 0,8) / 0,8 0,2500

Aplicando:

μ_ajustado = 1,2500 × 1,5972 = 1,9965

σ_ajustado = 0,4056 × √(1 + 1,2222 + 0,4142 + 0,2500) = 0,4056 × √2,8864 = 0,6890

Ou seja: a duração incompleta empurra a média para cima, de 1,60 para 2,00, porque o experimento mediu só 80 por cento do efeito. E os três desalinhamentos somados quase dobram o desvio, de 0,41 para 0,69, elevando o coeficiente de variação de 0,25 para 0,35. O prior resultante continua muito mais informativo que o padrão, mas não finge saber mais do que o experimento sabia.

Do intervalo do experimento ao prior ajustadoTrês faixas horizontais empilhadas sobre um eixo comum de ROI incremental que vai de zero a quatro. A faixa de cima, rotulada prior padrão sem calibração, é muito larga e cobre quase todo o eixo. A faixa do meio, rotulada resultado bruto do experimento, é estreita e está centrada em cerca de um vírgula seis. A faixa de baixo, rotulada prior ajustado, é intermediária em largura, está centrada em cerca de dois, e é acompanhada de notas indicando que a duração deslocou o centro para cima e que gasto, recência e duração alargaram a faixa.o que a calibração faz com a faixa de ROI plausível01234ROI incrementalprior padrãoquase tudo é plausívelexperimento bruto1,60 com desvio 0,41prior ajustado2,00 com desvio 0,69duração
A calibração não estreita o prior até virar certeza. Ela o move para onde o experimento apontou e o alarga na medida em que o experimento não representa as condições do modelo.

O que a calibração não conserta

Três limites merecem estar no mesmo documento que vende a ideia.

Ela vale para o canal medido, no ponto medido. O experimento mediu um nível de gasto. Amarrar o ROI ali ajuda a ancorar a curva, mas a forma da curva fora daquele ponto continua vindo do modelo e das premissas. É exatamente a extrapolação que Chan e Perry descrevem: o modelo pode estimar razoavelmente o ROAS marginal perto do gasto atual e mal o ROAS médio, que exige voltar até gasto zero.

Ela não corrige má especificação de funil. Se a TV move a busca paga, colocar as duas na mesma equação enviesa a estimativa, e um prior firme sobre a busca paga não desfaz esse viés, apenas o empurra para outro coeficiente. O conserto é de forma do modelo, não de prior.

Um experimento é um ponto no tempo. Por isso a meia-vida de 52 semanas no termo de recência existe: aos 26 semanas o peso já caiu para 0,7071, e o termo de incerteza correspondente já soma 0,4142. Calibração não é um projeto, é uma rotina.

A documentação da Meridian também alerta sobre o custo de não fazer nada: sem boas balizas, o modelo pode estimar que um canal de baixo gasto está gerando receita enorme. Essa é a falha clássica de um canal com pouco dado num modelo com muitos parâmetros.

Que experimento vale a pena rodar para calibrar

Aqui entra o dimensionamento, e ele é implacável em mídia de topo: detectar um efeito pequeno sobre uma taxa pequena custa muita gente.

Com base de compra de 0,90 por cento, 95 por cento de confiança e 80 por cento de poder:

efeito relativo a detectar pessoas por braço dias a 700.000 pessoas/semana
+10% 181.409 4
+5% 708.522 15
+3% 1.949.095 39

O experimento do nosso exemplo, com 1.400.000 por braço, banca confortavelmente um efeito de 5 por cento e não banca um de 3 por cento. Essa é a pergunta que decide o desenho: qual é o menor ROI que mudaria a sua decisão de orçamento? Se você realocaria a partir de 3 por cento, um experimento de 4 semanas não serve, e é melhor saber disso antes.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Sobre prioridade, a regra é contraintuitiva: teste primeiro o canal em que o modelo é mais fraco, não o canal mais importante.

sintoma no modelo por que o canal é candidato tipo de experimento
gasto pequeno e intervalo posterior larguíssimo é onde o modelo inventa mais, e onde a documentação alerta para receita enorme vinda de gasto baixo experimento geográfico com controle
gasto muito correlacionado com outro canal os dados não contêm variação independente para separar os dois desligar um canal por região, não os dois
histórico curto, canal novo poucos pontos, nenhuma faixa de variação teste de incrementalidade por usuário, se a plataforma permitir
estimativa que muda muito ao mexer no modelo sinal clássico de variáveis correlacionadas, descrito por Chan e Perry qualquer experimento com sorteio, mesmo pequeno, já ancora

Erros comuns

Faça isso automático na Donnu

Um modelo de mix de marketing e um teste A/B de página respondem a perguntas de escalas diferentes, e o elo entre eles é o mesmo: um número que veio de sorteio.

A Donnu não é uma ferramenta de mix de marketing, e não há por que fingir o contrário. O que ela faz é a camada que alimenta esse elo: sorteio no seu site, desfecho contado por inteiro com a variação anexada, e o resultado expresso como diferença absoluta com intervalo, que é a forma que um prior consegue consumir. Quando a pergunta é de canal e não de página, o desenho certo é geográfico ou de holdout, e a leitura causal está em teste de incrementalidade. A Donnu é uma opção entre várias; o princípio é independente de ferramenta: um modelo sem nenhuma âncora medida com sorteio não é uma medição, é uma opinião com erro padrão.

Perguntas frequentes

As perguntas no topo desta página cobrem o que é modelagem de mix de marketing, por que ela precisa de calibração, como um experimento vira prior de ROI, quais ajustes a calibração aplica, o que ela não conserta e qual canal testar primeiro.

Referências

Leia também: Teste de incrementalidade · Experimentos geográficos · Modelo de atribuição · Lances automáticos · Estudo de lift de marca · Holdout de longo prazo · Modelo hierárquico · Read in English

Perguntas frequentes

O que é modelagem de mix de marketing?
É uma regressão que explica vendas agregadas a partir de gasto de mídia por canal, mais variáveis de controle como preço, sazonalidade e distribuição. Ela não observa pessoas e não precisa de cookie nenhum, o que a tornou atraente de novo. Em compensação, ela é ajustada sobre dados observacionais, não sobre sorteio, então ela descreve associação e só vira causal na medida em que o desenho e as premissas a sustentem.
Por que um modelo de mix de marketing precisa de calibração?
Porque ele tem pouquíssimos dados para muitos parâmetros e nenhum sorteio para separar efeito de demanda. Chan e Perry, do Google, registram que um conjunto típico de dados, três anos de dados semanais nacionais, tem apenas 156 pontos, dos quais se espera um modelo com 20 ou mais canais, e que modelar efeito defasado e retorno decrescente pede de 3 a 4 parâmetros por canal. A regra de bolso de 7 a 10 pontos por parâmetro, escrevem eles, é algo de que os modelos típicos ficam aquém.
Como um experimento vira prior de ROI?
O experimento devolve um efeito incremental com intervalo. Dividido pelo gasto daquele braço, isso vira um ROI incremental com incerteza. A documentação da Meridian, do Google, afirma que não existe uma fórmula única para traduzir um resultado de experimento num prior, e oferece um construtor que aplica ajustes explícitos de gasto, recência, duração e universo antes de encaixar uma distribuição lognormal. O prior calibrado entra no modelo e limita o espaço de respostas plausíveis daquele canal.
Quais ajustes a calibração aplica sobre o resultado do experimento?
A documentação da Meridian registra a média ajustada como o produto dos fatores de duração e universo pela média do experimento, e o desvio ajustado como o desvio do experimento multiplicado pela raiz de um mais a soma dos termos de gasto, recência, duração e universo. O termo de gasto é um menos a razão de gasto, dividido pela razão. O de recência usa meia-vida de 52 semanas. Cada ajuste aumenta a incerteza do prior conforme o experimento se afasta das condições do modelo.
Calibrar resolve o viés de seleção do modelo?
Resolve para o canal medido, no ponto medido, e não resolve para os outros. Chan e Perry nomeiam o viés de seleção como possivelmente o maior obstáculo para um modelo de mix de marketing dar estimativas válidas, com três origens: segmentação de anúncio, sazonalidade e efeitos de funil. Um experimento amarra um canal a um valor confiável, o que também aperta indiretamente os demais, mas a má especificação de funil continua lá se um canal move o outro.
Qual canal eu devo testar primeiro?
O que tem o prior mais largo e o dado mais fino no modelo: gasto pequeno, gasto muito correlacionado com outro canal, ou histórico curto. Esses são exatamente os canais em que o modelo produz estimativas instáveis, e em que a documentação da Meridian alerta que sem boas balizas o modelo pode estimar que um canal de baixo gasto está gerando receita enorme. Um experimento barato nesse canal vale mais que um experimento caro no canal que o modelo já estima bem.