Modelagem de Mix de Marketing calibrada por experimento
Modelagem de mix de marketing tem 156 pontos e 80 parâmetros. Como um experimento vira prior de ROI, com as fórmulas de ajuste e um exemplo ponta a ponta.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Modelagem de mix de marketing voltou à moda por um motivo defensável, ela não depende de cookie, e carrega um problema que o marketing raramente enuncia: ela tenta estimar dezenas de parâmetros a partir de poucas centenas de pontos, sem nenhum sorteio para separar efeito de demanda. Chan e Perry, do Google, registram que um conjunto típico de dados, três anos de dados semanais nacionais, tem apenas 156 pontos, dos quais se espera um modelo com 20 ou mais canais, e que a regra de bolso de 7 a 10 pontos por parâmetro é algo de que os modelos típicos ficam aquém. A saída que a prática consolidou não é abandonar o modelo, é amarrá-lo a alguma coisa medida com sorteio. Este guia mostra por que a calibração é necessária, como um experimento geográfico vira um prior de ROI com as fórmulas de ajuste documentadas da Meridian, um exemplo ponta a ponta com números calculados no motor real, e o que a calibração continua não consertando. Este guia faz parte do nosso guia completo de teste A/B.
Por que um modelo de mix de marketing não se sustenta sozinho
Chan e Perry organizam os obstáculos de um modelo de mix de marketing em três áreas: limitações de dados, viés de seleção e seleção e incerteza de modelo. Vale percorrer as três, porque cada uma desemboca num tipo diferente de erro.
Limitações de dados. O número mais citável do artigo é o mais simples: um conjunto típico de dados de mix de marketing, com três anos de dados semanais nacionais, tem apenas 156 pontos. Desses 156 pontos, escrevem os autores, espera-se que o modelador produza um modelo com frequentemente 20 ou mais canais de anúncio. Modelar adequadamente um efeito defasado e um retorno decrescente pode exigir de 3 a 4 parâmetros por canal. Vinte canais a três parâmetros já são 60 parâmetros para 156 pontos. A regra de bolso que eles citam para uma regressão linear estável, deixando de lado se os efeitos causais estão bem estimados, é de 7 a 10 pontos por parâmetro, algo de que, nas palavras do artigo, os modelos típicos ficam aquém.
Duas limitações irmãs completam o grupo. Variáveis de entrada correlacionadas, porque anunciantes alocam gasto entre canais de forma correlacionada, o que produz coeficientes de alta variância e atribuição ruim. E faixa limitada de dados, porque o anunciante já se acomodou numa faixa de gasto, e o modelo é então usado para responder perguntas fora dessa faixa, como dobrar o investimento ou zerá-lo. O artigo registra o caso específico: o modelo pode dar estimativas razoáveis de ROAS marginal, por causa dos dados em torno do gasto atual, e estimativas ruins de ROAS médio, que exigiria extrapolar de volta até gasto zero.
Viés de seleção. Os autores o descrevem como possivelmente o maior obstáculo para um modelo de mix de marketing dar estimativas válidas de efetividade. Ele ocorre quando uma variável de mídia é correlacionada com uma variável de demanda não observável que, por sua vez, dirige as vendas; omitida da regressão, o modelo não tem como separar o que veio do canal e o que veio da demanda subjacente.
| origem do viés | mecanismo declarado no artigo | exemplo do artigo |
|---|---|---|
| segmentação de anúncio | o anúncio mira uma parcela da população que já demonstrou interesse, e esse interesse não é observável nem entra no modelo | remarketing, que mira quem já visitou o site, e busca paga, que mira quem já buscou o termo |
| sazonalidade | a mídia é direcionada para a sazonalidade da demanda, e os proxies usados para controlar sazonalidade não garantem refletir a demanda real | remédio para resfriado, com gasto subindo e descendo com a estação |
| efeitos de funil | um canal afeta o nível de outro, e estimar todos numa equação só produz estimativas enviesadas | uma campanha de TV gera mais buscas pelo termo, o que aumenta o volume de anúncios de busca paga |
O ponto sobre funil merece destaque porque ele não é um problema de dado, é de forma do modelo: anúncios a jusante não deveriam entrar na mesma equação de regressão que anúncios determinados de forma exógena. Os autores notam ainda que as alternativas, como modelos gráficos e equações estruturais, exigem estimar o efeito causal do canal de cima sobre o de baixo, o que tem requisitos de dado tão severos quanto o problema original.
O experimento é a verdade de campo, e vem com intervalo
Chan e Perry são igualmente diretos sobre o remédio e sobre o limite dele: embora experimentos sejam fonte de verdade de campo, eles geralmente fornecem uma estimativa pontual. Essa frase resume o desenho inteiro da calibração. O experimento não substitui o modelo, porque ele responde sobre um canal, num período, num nível de gasto. O modelo não substitui o experimento, porque ele não tem sorteio. A calibração é a costura entre os dois.
Vamos construir o lado do experimento com números reais. Os valores abaixo saíram do mesmo motor de estatística que roda nas calculadoras desta página.
O cenário: um experimento geográfico com grupo de controle, em que regiões sorteadas recebem uma campanha de display e as demais não. Cada braço cobre 1.400.000 pessoas ao longo de 4 semanas. A taxa de compra de base é de 0,90 por cento.
| braço | pessoas | compras | taxa |
|---|---|---|---|
| controle | 1.400.000 | 12.600 | 0,9000% |
| tratado | 1.400.000 | 13.230 | 0,9450% |
O motor devolve: diferença de +0,0450 pontos percentuais, lift relativo de +5,0000 por cento, z de 3,9381, valor p = 0,000082, e intervalo de 95 por cento de +0,0226 a +0,0674 pontos percentuais.
Traduzindo para o que a calibração precisa, com ticket médio de R$ 180 e gasto de R$ 71.000 no braço tratado:
- Compras incrementais: 13.230 − 12.600 = 630, com intervalo de 95 por cento de 316,5 a 943,5 (o intervalo em pontos multiplicado pelas 1.400.000 pessoas).
- Receita incremental: 630 × R$ 180 = R$ 113.400.
- ROI incremental: R$ 113.400 ÷ R$ 71.000 = 1,5972, com intervalo de 0,8023 a 2,3921.
Esse intervalo largo não é defeito do experimento, é o tamanho honesto da incerteza. Tratando a estimativa de ROI como aproximadamente normal, já que ela é uma transformação linear da diferença de proporções, o desvio padrão implícito é de 0,4056, ou um coeficiente de variação de 0,2539. Guarde esses dois números, eles são a entrada da próxima seção.
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Como um resultado de experimento vira um prior
A documentação da Meridian, o modelo bayesiano de mix de marketing do Google, começa com uma honestidade que economiza discussão: não existe uma fórmula única para traduzir um resultado de experimento num prior. O que existe é um construtor de calibração com quatro passos declarados: registrar os experimentos, aplicar ajustes aos resultados, mesclar múltiplos experimentos por atualização bayesiana e encaixar distribuições paramétricas, como lognormal, gama ou normal.
Os ajustes são explícitos, e é onde mora a parte interessante. A documentação registra a média e o desvio ajustados de um experimento como:
μ_ajustado = (γ_duração + γ_universo) × μ_experimento
σ_ajustado = σ_experimento × √(1 + τ_gasto + τ_recência + τ_duração + τ_universo)
com os termos automáticos definidos assim:
| termo | fórmula documentada | o que ele corrige |
|---|---|---|
| descasamento de gasto | τ_gasto = (1 − r) / r, com r a razão entre o gasto do experimento e o gasto do modelo |
o experimento cobriu uma fatia do gasto; quanto menor a fatia, mais incerteza ele carrega sobre o todo |
| recência | τ_recência = (1 − λ) / λ, com λ = 0,5^(w/52) e w em semanas |
meia-vida de 52 semanas; um experimento antigo vale menos |
| duração | γ_duração = 1 / p e τ_duração = max((1 − p) / p, 0), com p a proporção do efeito capturada |
o experimento pode ter terminado antes de o efeito defasado se completar |
Multiplicações de incerteza, não de valor: repare que σ é multiplicado pela raiz da soma dos termos mais um, o que significa que cada desalinhamento entre o experimento e o modelo alarga o prior em vez de deslocá-lo.
A mescla de vários experimentos é uma atualização bayesiana comum, p(θ | dados) ∝ π(θ) ∏ L_i(θ), em que cada experimento é tratado como uma observação ruidosa do ROI verdadeiro do canal sob uma verossimilhança normal. O ajuste final à família paramétrica é feito minimizando entropia cruzada, equivalente a minimizar divergência de Kullback-Leibler. O prior padrão de ROI da documentação, quando nada é informado, é uma lognormal de parâmetros 0,2 e 0,9.
Aplicando os ajustes ao nosso experimento
Vamos levar o resultado da seção anterior até o prior, com três desalinhamentos realistas.
Suponha que o experimento cobriu 45 por cento do gasto do canal no período do modelo (r = 0,45), aconteceu 26 semanas atrás (w = 26) e capturou 80 por cento do efeito defasado (p = 0,8).
| termo | conta | valor |
|---|---|---|
τ_gasto |
(1 − 0,45) / 0,45 |
1,2222 |
λ |
0,5^(26/52) |
0,7071 |
τ_recência |
(1 − 0,7071) / 0,7071 |
0,4142 |
γ_duração |
1 / 0,8 |
1,2500 |
τ_duração |
(1 − 0,8) / 0,8 |
0,2500 |
Aplicando:
μ_ajustado = 1,2500 × 1,5972 = 1,9965
σ_ajustado = 0,4056 × √(1 + 1,2222 + 0,4142 + 0,2500) = 0,4056 × √2,8864 = 0,6890
Ou seja: a duração incompleta empurra a média para cima, de 1,60 para 2,00, porque o experimento mediu só 80 por cento do efeito. E os três desalinhamentos somados quase dobram o desvio, de 0,41 para 0,69, elevando o coeficiente de variação de 0,25 para 0,35. O prior resultante continua muito mais informativo que o padrão, mas não finge saber mais do que o experimento sabia.
O que a calibração não conserta
Três limites merecem estar no mesmo documento que vende a ideia.
Ela vale para o canal medido, no ponto medido. O experimento mediu um nível de gasto. Amarrar o ROI ali ajuda a ancorar a curva, mas a forma da curva fora daquele ponto continua vindo do modelo e das premissas. É exatamente a extrapolação que Chan e Perry descrevem: o modelo pode estimar razoavelmente o ROAS marginal perto do gasto atual e mal o ROAS médio, que exige voltar até gasto zero.
Ela não corrige má especificação de funil. Se a TV move a busca paga, colocar as duas na mesma equação enviesa a estimativa, e um prior firme sobre a busca paga não desfaz esse viés, apenas o empurra para outro coeficiente. O conserto é de forma do modelo, não de prior.
Um experimento é um ponto no tempo. Por isso a meia-vida de 52 semanas no termo de recência existe: aos 26 semanas o peso já caiu para 0,7071, e o termo de incerteza correspondente já soma 0,4142. Calibração não é um projeto, é uma rotina.
A documentação da Meridian também alerta sobre o custo de não fazer nada: sem boas balizas, o modelo pode estimar que um canal de baixo gasto está gerando receita enorme. Essa é a falha clássica de um canal com pouco dado num modelo com muitos parâmetros.
Que experimento vale a pena rodar para calibrar
Aqui entra o dimensionamento, e ele é implacável em mídia de topo: detectar um efeito pequeno sobre uma taxa pequena custa muita gente.
Com base de compra de 0,90 por cento, 95 por cento de confiança e 80 por cento de poder:
| efeito relativo a detectar | pessoas por braço | dias a 700.000 pessoas/semana |
|---|---|---|
| +10% | 181.409 | 4 |
| +5% | 708.522 | 15 |
| +3% | 1.949.095 | 39 |
O experimento do nosso exemplo, com 1.400.000 por braço, banca confortavelmente um efeito de 5 por cento e não banca um de 3 por cento. Essa é a pergunta que decide o desenho: qual é o menor ROI que mudaria a sua decisão de orçamento? Se você realocaria a partir de 3 por cento, um experimento de 4 semanas não serve, e é melhor saber disso antes.
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
Sobre prioridade, a regra é contraintuitiva: teste primeiro o canal em que o modelo é mais fraco, não o canal mais importante.
| sintoma no modelo | por que o canal é candidato | tipo de experimento |
|---|---|---|
| gasto pequeno e intervalo posterior larguíssimo | é onde o modelo inventa mais, e onde a documentação alerta para receita enorme vinda de gasto baixo | experimento geográfico com controle |
| gasto muito correlacionado com outro canal | os dados não contêm variação independente para separar os dois | desligar um canal por região, não os dois |
| histórico curto, canal novo | poucos pontos, nenhuma faixa de variação | teste de incrementalidade por usuário, se a plataforma permitir |
| estimativa que muda muito ao mexer no modelo | sinal clássico de variáveis correlacionadas, descrito por Chan e Perry | qualquer experimento com sorteio, mesmo pequeno, já ancora |
Erros comuns
- Tratar a saída do modelo como medida. Ela é uma estimativa condicionada a premissas fortes sobre uma amostra pequena, não uma leitura de instrumento.
- Calibrar com o resultado bruto do experimento, sem ajustes. A cobertura parcial de gasto, a idade do experimento e o efeito ainda não completado mudam tanto o centro quanto a largura do prior.
- Usar um experimento de dois anos atrás. Com meia-vida de 52 semanas, o peso caiu pela metade, e o termo de incerteza correspondente é grande.
- Calibrar só o canal que já ia bem. O ganho de informação está onde o modelo está mais perdido.
- Esperar que o prior conserte efeito de funil. É problema de especificação; prior firme sobre um coeficiente empurra o viés para outro.
- Pedir ao modelo o ROAS médio. Isso exige extrapolar até gasto zero, e a faixa histórica de gasto raramente sustenta isso.
- Dimensionar o experimento pelo efeito esperado em vez do efeito que mudaria a decisão. Um intervalo que atravessa o ponto de decisão não decide nada.
- Rodar a calibração uma vez. Sazonalidade, mix e criativo mudam; o prior envelhece por construção.
Faça isso automático na Donnu
Um modelo de mix de marketing e um teste A/B de página respondem a perguntas de escalas diferentes, e o elo entre eles é o mesmo: um número que veio de sorteio.
A Donnu não é uma ferramenta de mix de marketing, e não há por que fingir o contrário. O que ela faz é a camada que alimenta esse elo: sorteio no seu site, desfecho contado por inteiro com a variação anexada, e o resultado expresso como diferença absoluta com intervalo, que é a forma que um prior consegue consumir. Quando a pergunta é de canal e não de página, o desenho certo é geográfico ou de holdout, e a leitura causal está em teste de incrementalidade. A Donnu é uma opção entre várias; o princípio é independente de ferramenta: um modelo sem nenhuma âncora medida com sorteio não é uma medição, é uma opinião com erro padrão.
Perguntas frequentes
As perguntas no topo desta página cobrem o que é modelagem de mix de marketing, por que ela precisa de calibração, como um experimento vira prior de ROI, quais ajustes a calibração aplica, o que ela não conserta e qual canal testar primeiro.
Referências
- Chan, D. e Perry, M. Challenges and Opportunities in Media Mix Modeling. Google Research, 2017. Artigo lido na íntegra. Fonte da afirmação de que um conjunto típico de dados de mix de marketing com três anos de dados semanais nacionais tem apenas 156 pontos, de que se espera do modelador um modelo com frequentemente 20 ou mais canais, de que modelar efeito defasado e retorno decrescente pode exigir de 3 a 4 parâmetros por canal, da regra de bolso de 7 a 10 pontos por parâmetro da qual os modelos típicos ficam aquém, das três áreas de desafios (limitações de dados, viés de seleção e seleção e incerteza de modelo), das três origens de viés de seleção (segmentação de anúncio, sazonalidade e efeitos de funil) com os exemplos de remarketing, busca paga, remédio para resfriado e TV gerando buscas, da distinção entre ROAS marginal e médio na extrapolação até gasto zero, e da afirmação de que embora experimentos sejam fonte de verdade de campo eles geralmente fornecem uma estimativa pontual. Conferido em 24 de setembro de 2026. research.google.
- Google for Developers. Meridian: Calibrate treatment priors. Fonte da afirmação de que não existe uma fórmula única para traduzir um resultado de experimento num prior, da descrição do construtor de calibração com ajustes de recência, duração e gasto, das funções auxiliares de construção de lognormal a partir de média e desvio ou de faixa, e do alerta de que sem boas balizas o modelo pode estimar que um canal de baixo gasto está gerando receita enorme. Conferido em 24 de setembro de 2026. developers.google.com.
- Google for Developers. Meridian: Set custom ROI priors using past experiments. Fonte das fórmulas de ajuste de média e desvio, dos termos de descasamento de gasto, recência com meia-vida de 52 semanas e proporção de duração capturada, da mescla de múltiplos experimentos por atualização bayesiana tratando cada um como observação ruidosa do ROI verdadeiro, do ajuste paramétrico por minimização de entropia cruzada e do prior padrão lognormal de parâmetros 0,2 e 0,9. Conferido em 24 de setembro de 2026. developers.google.com.
Leia também: Teste de incrementalidade · Experimentos geográficos · Modelo de atribuição · Lances automáticos · Estudo de lift de marca · Holdout de longo prazo · Modelo hierárquico · Read in English
Perguntas frequentes
- O que é modelagem de mix de marketing?
- É uma regressão que explica vendas agregadas a partir de gasto de mídia por canal, mais variáveis de controle como preço, sazonalidade e distribuição. Ela não observa pessoas e não precisa de cookie nenhum, o que a tornou atraente de novo. Em compensação, ela é ajustada sobre dados observacionais, não sobre sorteio, então ela descreve associação e só vira causal na medida em que o desenho e as premissas a sustentem.
- Por que um modelo de mix de marketing precisa de calibração?
- Porque ele tem pouquíssimos dados para muitos parâmetros e nenhum sorteio para separar efeito de demanda. Chan e Perry, do Google, registram que um conjunto típico de dados, três anos de dados semanais nacionais, tem apenas 156 pontos, dos quais se espera um modelo com 20 ou mais canais, e que modelar efeito defasado e retorno decrescente pede de 3 a 4 parâmetros por canal. A regra de bolso de 7 a 10 pontos por parâmetro, escrevem eles, é algo de que os modelos típicos ficam aquém.
- Como um experimento vira prior de ROI?
- O experimento devolve um efeito incremental com intervalo. Dividido pelo gasto daquele braço, isso vira um ROI incremental com incerteza. A documentação da Meridian, do Google, afirma que não existe uma fórmula única para traduzir um resultado de experimento num prior, e oferece um construtor que aplica ajustes explícitos de gasto, recência, duração e universo antes de encaixar uma distribuição lognormal. O prior calibrado entra no modelo e limita o espaço de respostas plausíveis daquele canal.
- Quais ajustes a calibração aplica sobre o resultado do experimento?
- A documentação da Meridian registra a média ajustada como o produto dos fatores de duração e universo pela média do experimento, e o desvio ajustado como o desvio do experimento multiplicado pela raiz de um mais a soma dos termos de gasto, recência, duração e universo. O termo de gasto é um menos a razão de gasto, dividido pela razão. O de recência usa meia-vida de 52 semanas. Cada ajuste aumenta a incerteza do prior conforme o experimento se afasta das condições do modelo.
- Calibrar resolve o viés de seleção do modelo?
- Resolve para o canal medido, no ponto medido, e não resolve para os outros. Chan e Perry nomeiam o viés de seleção como possivelmente o maior obstáculo para um modelo de mix de marketing dar estimativas válidas, com três origens: segmentação de anúncio, sazonalidade e efeitos de funil. Um experimento amarra um canal a um valor confiável, o que também aperta indiretamente os demais, mas a má especificação de funil continua lá se um canal move o outro.
- Qual canal eu devo testar primeiro?
- O que tem o prior mais largo e o dado mais fino no modelo: gasto pequeno, gasto muito correlacionado com outro canal, ou histórico curto. Esses são exatamente os canais em que o modelo produz estimativas instáveis, e em que a documentação da Meridian alerta que sem boas balizas o modelo pode estimar que um canal de baixo gasto está gerando receita enorme. Um experimento barato nesse canal vale mais que um experimento caro no canal que o modelo já estima bem.