Métrica Substituta em Teste A/B: como validar um proxy
Métrica substituta troca o desfecho longo por sinais de curto prazo. Como validar um proxy, por que correlação não basta e o teste que expõe a falha.

📚 Este artigo faz parte do guia Significância Estatística em Teste A/B: O Guia.
Uma métrica substituta troca o desfecho que importa por sinais que aparecem cedo. Ela só é válida se carregar o efeito inteiro do tratamento, e essa condição não se verifica olhando correlação: nos 8 testes limpos deste guia, o proxy ingênuo teve correlação de 0,9981 com o desfecho de 180 dias e mesmo assim errava o tamanho do efeito por um fator de 3,64. Este guia mostra o que uma substituta precisa satisfazer, como montar um índice calibrado em dados históricos, qual protocolo valida a substituta empiricamente, e como fica o estrago quando o tratamento age por um caminho que a substituta não enxerga. Faz parte do nosso guia completo de teste A/B e complementa holdout de longo prazo e métrica primária e OEC.
O problema: a métrica certa chega tarde demais
Quase todo time de experimentação vive a mesma tensão. A métrica que decide o negócio é receita retida em seis meses, valor de vida do cliente, renovação no segundo ano. A métrica que existe quando a decisão precisa ser tomada é cadastro, ativação, cliques na primeira semana.
Athey, Chetty, Imbens e Kang abrem o artigo do índice substituto citando exatamente essa dor no contexto digital, reproduzindo o levantamento de desafios de Gupta e colegas de 2019: enquanto a maioria dos experimentos da indústria roda por duas semanas ou menos, o interesse real é detectar o efeito de longo prazo, e a pergunta operacional é como medir isso sem esperar muito tempo em todos os casos.
A saída óbvia é escolher um sinal de curto prazo e usá-lo como substituto. A parte que quase ninguém faz é verificar se esse sinal merece o cargo.
O critério de Prentice, em uma frase
Prentice formalizou em 1989 a condição que define uma substituta legítima, e Athey e coautores a adotam como a suposição central do método: condicionar na substituta torna o desfecho independente do tratamento.
Em português operacional: se você souber os valores dos sinais de curto prazo de um usuário, saber em que braço ele estava não acrescenta nada sobre o desfecho longo dele. Todo o efeito do tratamento passa pelos sinais.
Duas consequências saem daí, e as duas são desconfortáveis.
A primeira: a suposição não é testável com os dados do experimento. Athey e coautores registram isso explicitamente: se o desfecho longo não é observado na amostra experimental, a condição de substituição não tem implicações testáveis. Você não consegue provar que ela vale olhando o experimento em que quer usá-la.
A segunda: a crítica clássica costuma estar certa. Freedman, Graubard e Schatzkin argumentaram em 1992 que a substituta frequentemente não medeia o efeito inteiro, e Athey e coautores repetem o exemplo: reduzir o tamanho da turma pode afetar salários futuros por habilidades não cognitivas que uma nota padronizada não captura.
O caso GAIN: nove anos de espera contra seis trimestres de sinal
O artigo do índice substituto testa o método num caso onde a resposta verdadeira é conhecida, o que é raro. O programa GAIN foi um treinamento profissional avaliado por sorteio em condados da Califórnia no fim dos anos 1980, com desfechos acompanhados por nove anos, ou 36 trimestres.
Os autores tomaram o site de Riverside como amostra experimental, esconderam dele o desfecho longo, e usaram os outros três locais (Alameda, Los Angeles e San Diego, 13.725 pessoas) como amostra observacional para calibrar o índice. A pergunta: dá para reproduzir o efeito de 36 trimestres com poucos trimestres de sinal?
| trimestres de sinal usados | estimador ingênuo | índice substituto | escore substituto | função de influência |
|---|---|---|---|---|
| 1 | 0,049 (0,013) | 0,011 (0,003) | 0,010 (0,002) | 0,009 (0,003) |
| 2 | 0,087 (0,012) | 0,033 (0,003) | 0,032 (0,003) | 0,032 (0,004) |
| 4 | 0,110 (0,011) | 0,047 (0,005) | 0,050 (0,005) | 0,050 (0,005) |
| 6 | 0,117 (0,010) | 0,061 (0,006) | 0,063 (0,006) | 0,064 (0,006) |
| 12 | 0,108 (0,010) | 0,065 (0,007) | 0,071 (0,008) | 0,072 (0,008) |
| 36 | 0,064 (0,010) | 0,058 (0,009) | 0,065 (0,010) | 0,066 (0,010) |
O benchmark experimental, medido esperando os 36 trimestres, é 0,064 com erro-padrão de 0,012 na taxa de emprego (e 249 dólares com erro-padrão de 83 na renda trimestral).
Duas leituras da tabela. O estimador ingênuo, que soma o desfecho dos primeiros trimestres e o trata como se fosse o de longo prazo, chega a 0,117 no sexto trimestre, quase o dobro do valor certo, e os autores registram que ele precisa de mais de 25 trimestres para chegar a dois erros-padrão do benchmark. Os três estimadores baseados em substitutas ficam dentro de dois erros-padrão já com cinco trimestres de sinal. No resumo do artigo, os autores relatam redução de 35 por cento nos erros-padrão ao usar as taxas de emprego dos seis primeiros trimestres em vez de esperar.
Repare que o erro do ingênuo aqui é para cima. Na nossa simulação, adiante, ele erra para baixo. A direção do erro do proxy ingênuo não é conhecida a priori, e é por isso que corrigir “na mão” com um fator aprendido de um único teste anterior não funciona.
Exemplo trabalhado: montando um índice a partir do histórico
Simulamos um caso de produto para poder comparar cada estimador contra a verdade. O mundo: usuários com qualidade latente própria, três sinais de curto prazo (ativou em 14 dias, sessões na semana 2, receita dos primeiros 14 dias) e um desfecho de 180 dias que depende dos três.
Passo 1: calibrar o índice na amostra observacional. Pegamos 40.000 usuários históricos, sem experimento nenhum, para quem tanto os sinais quanto o desfecho de 180 dias já são conhecidos, e ajustamos uma regressão simples do desfecho sobre os sinais. É exatamente o que Athey e coautores fazem com os três locais fora de Riverside.
| coeficiente | valor ajustado | valor verdadeiro do mundo |
|---|---|---|
| intercepto | 11,4383 | 12 |
| ativou em 14 dias | 54,0811 | 55 |
| sessões na semana 2 | 4,5701 | 4,5 |
| receita dos 14 dias | 2,2277 | 2,2 |
O ajuste explica 64,57 por cento da variação do desfecho de 180 dias, que tem média de 103,4656 e desvio de 67,1266. Não é preciso prever bem o usuário individual, e esse é um ponto que costuma confundir: o índice não precisa acertar quanto cada pessoa vai gastar, precisa acertar a diferença de médias entre dois grupos grandes.
Passo 2: rodar o experimento e ler os sinais. 25.000 usuários por braço. O primeiro sinal já é uma métrica de decisão por si só:
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Colando na calculadora acima o controle com 25.000 visitantes e 10.427 ativações (41,7080 por cento) contra o tratamento com 25.000 visitantes e 11.118 ativações (44,4720 por cento), o resultado é z de 6,2404, valor-p de 4,384 vezes 10 elevado a menos 10, diferença de 2,7640 pontos percentuais, ganho relativo de 6,6270 por cento e intervalo de 1,8962 a 3,6318 pontos percentuais.
Passo 3: aplicar o índice e comparar contra a verdade. Medimos os efeitos verdadeiros nos sinais com uma amostra de 300 mil por braço: mais 2,9183 pontos percentuais de ativação, mais 0,3023 sessão e mais 2,1417 de receita nos 14 dias. Aplicando os coeficientes do mundo, o efeito verdadeiro de 180 dias é 7,6773 de receita por usuário.
| estimador | disponível quando | estimativa | erro-padrão |
|---|---|---|---|
| ingênuo (receita de 14 dias lida como desfecho) | dia 14 | 1,9546 | 0,1026 |
| índice substituto | dia 14 | 7,2558 | 0,4821 |
| esperar e medir os 180 dias | dia 180 | 7,9784 | 0,5988 |
| verdade | nunca observável na prática | 7,6773 | referência |
O ingênuo subestima o efeito real em 3,93 vezes. O índice cai a 0,9 erro-padrão da verdade, e o número medido esperando meio ano cai a 0,5 erro-padrão da verdade pelo outro lado. Além de chegar 166 dias antes, o índice sai com erro-padrão 19,48 por cento menor que o da medição direta, porque ele descarta o ruído do desfecho longo que não tem nada a ver com o tratamento.
Correlação não é calibração
Aqui está o ponto que separa validação de conforto. Rodamos 12 experimentos passados no mesmo mundo simulado, com tamanhos de efeito diferentes, e guardamos o desfecho de 180 dias de todos eles para comparar com o que a substituta previa.
| teste | previsto pelo índice | medido em 180 dias | erro-padrão do medido | proxy ingênuo |
|---|---|---|---|---|
| 1 | 1,9417 | 1,9109 | 0,5984 | 0,5323 |
| 2 | 3,5386 | 3,8283 | 0,5960 | 1,0037 |
| 3 | 6,3744 | 6,0883 | 0,5990 | 1,6914 |
| 4 | 8,1408 | 9,0395 | 0,5994 | 2,3015 |
| 5 | 9,4172 | 9,9360 | 0,5996 | 2,6461 |
| 6 | 11,9146 | 11,6860 | 0,6017 | 3,2845 |
| 7 | 13,9983 | 14,2291 | 0,6013 | 3,8024 |
| 8 | 16,2117 | 15,8901 | 0,6042 | 4,3752 |
| 9 | 6,8887 | menos 5,8053 | 0,6009 | 1,9836 |
| 10 | 6,0512 | menos 0,3250 | 0,6004 | 1,6684 |
| 11 | 11,0089 | 16,5326 | 0,6018 | 3,0772 |
| 12 | 4,0623 | 14,3252 | 0,5977 | 1,1344 |
Os testes de 1 a 8 satisfazem o critério de Prentice por construção. Os de 9 a 12 têm um efeito direto sobre o desfecho longo que não passa pelos sinais.
Olhando só os 8 limpos, a comparação entre índice e proxy ingênuo é reveladora:
| medida | índice substituto | proxy ingênuo |
|---|---|---|
| correlação com o medido | 0,9963 | 0,9981 |
| coeficiente de determinação | 0,9925 | 0,9962 |
| inclinação da reta contra o medido | 0,9830 | 3,6430 |
| erro absoluto médio | 0,3506 | 6,6214 |
O proxy ingênuo tem correlação ligeiramente maior que a do índice e é inútil como estimativa. Ele sobe junto com o desfecho de forma quase perfeita, e cada unidade dele vale 3,64 unidades do que você quer medir. Um time que valida a substituta por correlação aprova esse proxy e depois soma um roadmap inteiro em moeda errada.
A correlação responde “quando isso sobe, aquilo sobe?”. A pergunta certa é “quando isso sobe uma unidade, aquilo sobe quanto?”, e ela se responde por inclinação, com o valor 1 como alvo, não por correlação.
Quando a métrica substituta quebra: o efeito direto
O teste 9 da tabela é o caso que tira o sono. O tratamento move os três sinais na direção certa, e ao mesmo tempo tem um efeito negativo sobre o desfecho de 180 dias que não passa por eles. Pense num desconto agressivo que enche a ativação de curto prazo e atrai um público que não renova.
| leitura | valor |
|---|---|
| proxy ingênuo | mais 2,0572 |
| índice substituto | mais 7,4835 |
| medido em 180 dias | menos 4,4608 |
| erro do índice | 11,9443 de receita por usuário |
Nenhum dos dois estimadores de curto prazo vê o problema. Não é uma questão de precisão nem de amostra: os sinais estão certos e a conta está certa. O que está errado é o mapa. É a mesma família de erro descrita no nosso guia sobre efeito novidade, com a diferença de que ali o sinal se dissolve com o tempo e aqui ele nunca chega a ser o que o índice diz.
Incluindo os 4 testes com efeito direto na validação, o retrato muda por completo:
| medida | só os 8 limpos | todos os 12 |
|---|---|---|
| correlação | 0,9963 | 0,6125 |
| coeficiente de determinação | 0,9925 | 0,3751 |
| erro absoluto médio | 0,3506 | 3,3109 |
| maior erro individual | menos de 0,9 | 12,6940 |
Esse gráfico é o protocolo de validação inteiro. Você não valida uma substituta olhando para um experimento: valida guardando o desfecho longo de uma amostra de experimentos e checando quantos deles caem na diagonal.
O que a métrica substituta compra, e o que ela custa
Vale separar os dois ganhos, porque eles são independentes e os times costumam somar um e esquecer o outro.
O ganho de tempo é o óbvio e o maior. No nosso exemplo, a decisão sai no dia 14 em vez do dia 180. No caso GAIN, seis trimestres em vez de trinta e seis. Esse ganho não é sobre um teste: é sobre a cadência do programa inteiro, porque o mesmo tráfego passa a bancar mais rodadas de aprendizado por ano.
O ganho de precisão é menor e menos intuitivo. O índice descarta a parte do desfecho longo que não tem relação nenhuma com o tratamento, e por isso sai com erro-padrão menor que o da medição direta: 0,4821 contra 0,5988 no nosso exemplo, uma redução de 19,48 por cento. No estudo GAIN a redução relatada no resumo é de 35 por cento com seis trimestres de sinal.
| dimensão | esperar o desfecho | índice substituto |
|---|---|---|
| quando a decisão sai | dia 180 | dia 14 |
| erro-padrão da estimativa | 0,5988 | 0,4821 |
| suposição extra exigida | nenhuma | critério de Prentice |
| falha silenciosa possível | não | sim, por efeito direto |
A coluna que fecha a conta é a última. A substituta troca tempo por uma suposição que pode falhar sem aviso. Esperar o desfecho real é lento e não mente. É por isso que o desenho saudável não é escolher entre os dois: é decidir pela substituta e continuar medindo o desfecho real numa fatia dos testes, que é o que alimenta a validação da próxima seção.
O protocolo de validação, em sete passos
- Escolha os sinais pelo mecanismo, não pela correlação. Pergunte por qual caminho a mudança deveria afetar o desfecho e meça esse caminho. Sinal correlacionado que não está no caminho é enfeite.
- Calibre num histórico observacional onde sinais e desfecho longo coexistem. Não precisa ser experimento: precisa ser a mesma população, com as mesmas definições de métrica.
- Reserve um holdout de desfecho longo para uma amostra dos seus experimentos, do jeito descrito no nosso guia de holdout de longo prazo. Sem isso não existe validação, só esperança.
- Valide por inclinação, não por correlação. A regressão do medido sobre o previsto tem que dar inclinação perto de 1 e intercepto perto de 0. Reporte também o erro absoluto médio, que é o número que a decisão sente.
- Recalibre com periodicidade fixa. O índice é ajustado numa foto do produto. Mudou o público, o preço ou o funil, os coeficientes mudaram junto.
- Trate divergência grande como bandeira vermelha, não como ruído. Um teste em que o índice previu mais 7 e o medido deu menos 4 é uma descoberta sobre o produto, e provavelmente aponta um efeito direto que o seu mapa não tinha.
- Nunca use a substituta para decisão irreversível de alto risco sem pelo menos um teste confirmatório com desfecho real. Substituta é aceleradora de decisão reversível.
Erros comuns
- Validar por correlação. Já dito, e vale repetir porque é o erro dominante: nossos números mostram um proxy com correlação de 0,9981 e erro de escala de 3,64 vezes.
- Somar efeitos de substituta como se fossem receita. O somatório anual de ganhos previstos por um índice não calibrado é o gerador de metas impossíveis mais confiável que conhecemos. É o mesmo mecanismo de exagero descrito em maldição do vencedor, com outra origem.
- Assumir que o erro do proxy tem direção fixa. No caso GAIN o ingênuo exagerou; na nossa simulação ele subestimou por 3,93 vezes. Não existe fator de correção universal.
- Confundir métrica primária com substituta. A métrica primária é a que decide o teste. A substituta é uma tentativa de prever outra métrica que você não conseguiu medir. Podem coincidir, e quando coincidem a exigência de validação é a mesma.
- Achar que o índice precisa prever o usuário individual. Ele precisa prever a diferença de médias entre dois grupos grandes, o que é uma exigência bem menor. Nosso índice explicou 64,57 por cento da variação individual e ainda assim acertou o efeito dentro do erro-padrão.
- Usar substituta para métrica de guardrail. Guardrail existe para pegar dano, e dano costuma vir justamente pelo caminho direto que a substituta não enxerga.
Faça isso automático na Donnu
Todo o protocolo acima depende de uma condição de dados: os sinais de curto prazo e o desfecho longo do mesmo usuário precisam continuar ligados meses depois. É aí que a maioria das montagens falha, porque o experimento é arquivado quando termina e a receita dos seis meses seguintes vive em outro sistema, sem chave em comum.
A Donnu mantém a atribuição do usuário ligada aos eventos depois do fim do experimento, o que é exatamente a condição para reabrir um teste antigo e perguntar quanto ele valeu de verdade. Se a sua montagem atual não permite isso, o passo imediato e barato é congelar hoje a lista de usuários sorteados dos seus últimos experimentos, para poder medir o desfecho longo daqui a alguns meses, e enquanto isso tratar todo número de curto prazo como direção, não como valor. Para checar se o seu sinal de curto prazo tem amostra suficiente para ser lido, a calculadora de significância responde em um minuto.
Referências
- Athey, S., Chetty, R., Imbens, G. W. e Kang, H. The Surrogate Index: Combining Short-Term Proxies to Estimate Long-Term Treatment Effects More Rapidly and Precisely. arXiv 1603.09326, versão de agosto de 2024. Fonte da adoção do critério de Prentice como suposição de substituição, formulada como independência entre tratamento e desfecho condicionada aos sinais e às covariáveis; da definição do índice substituto como a esperança condicional do desfecho dados os sinais; do registro de que, com o desfecho longo não observado na amostra experimental, a suposição não tem implicações testáveis; da crítica de Freedman, Graubard e Schatzkin (1992) de que a substituta pode não mediar o efeito inteiro, com o exemplo de tamanho de turma e habilidades não cognitivas; da citação do levantamento de Gupta e colegas (2019) sobre experimentos de duas semanas contra interesse em efeitos de longo prazo; do desenho empírico com Riverside como amostra experimental e Alameda, Los Angeles e San Diego como amostra observacional de 13.725 pessoas; do benchmark experimental de 0,064 com erro-padrão 0,012 em emprego e 249 dólares com erro-padrão 83 em renda, ambos em média sobre 36 trimestres; da tabela completa de estimativas por número de trimestres usados, incluindo o ingênuo em 0,049, 0,087, 0,110, 0,117, 0,108 e 0,064 e o índice em 0,011, 0,033, 0,047, 0,061, 0,065 e 0,058; do registro de que o ingênuo precisa de mais de 25 trimestres para ficar a dois erros-padrão do benchmark enquanto os três estimadores baseados em substitutas chegam lá com cinco trimestres; e da redução de 35 por cento nos erros-padrão relatada no resumo. arxiv.org.
- Hohnhold, H., O’Brien, D. e Tang, D. Focusing on the Long-term: It’s Good for Users and Business. KDD 2015, Google. Fonte do enquadramento de que o efeito de curto prazo, observado durante o experimento, nem sempre prediz o efeito de longo prazo depois do lançamento e da mudança de comportamento dos usuários, e do uso de métricas mensuráveis no curto prazo para prever o longo prazo. research.google.
- Deng, A. e Shi, X. Data-Driven Metric Development for Online Controlled Experiments: Seven Lessons Learned. KDD 2016. Fonte das duas qualidades obrigatórias de uma métrica, direcionalidade e sensibilidade, que são a base da exigência de calibração deste artigo. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. e Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fonte da exigência de que o critério de decisão seja mensurável em cerca de duas semanas enquanto prediz objetivos de longo prazo, que é a definição operacional do problema que a métrica substituta tenta resolver. exp-platform.com.
Leia também: Holdout de longo prazo · Métrica primária e OEC · Efeito novidade · Maldição do vencedor · Métricas de ativação em SaaS · Calculadora de significância · Read in English
Perguntas frequentes
- O que é uma métrica substituta em teste A/B?
- É uma métrica de curto prazo usada no lugar do desfecho que realmente importa, quando esse desfecho demora demais para aparecer. Ativação em 14 dias no lugar de receita em 180 dias, por exemplo. A substituta não é só um indicador correlacionado: ela precisa carregar o efeito inteiro do tratamento, condição que Prentice formalizou em 1989 e que Athey, Chetty, Imbens e Kang chamam de suposição de substituição.
- Qual a diferença entre um proxy ingênuo e um índice substituto?
- O proxy ingênuo lê o efeito medido no curto prazo como se fosse o efeito de longo prazo. O índice substituto combina vários sinais de curto prazo numa previsão do desfecho longo, calibrada em dados históricos onde os dois foram observados. No exemplo deste guia, o proxy ingênuo subestimou o efeito real em 3,93 vezes, enquanto o índice acertou dentro do próprio erro-padrão.
- Por que correlação alta não basta para validar uma métrica substituta?
- Porque correlação não garante escala. Nos 8 testes limpos deste guia, o proxy ingênuo teve correlação de 0,9981 com o desfecho longo, ligeiramente maior que a do índice, e mesmo assim a reta que liga um ao outro tinha inclinação de 3,6430, ou seja, o número lido precisava ser multiplicado por quase quatro. O erro absoluto médio do proxy foi de 6,6214 contra 0,3506 do índice. Correlação diz que sobe junto; calibração diz quanto.
- Como uma métrica substituta pode dar o sinal errado?
- Quando o tratamento afeta o desfecho por um caminho que não passa pelos sinais medidos, o que viola o critério de Prentice. Na simulação deste guia, um tratamento com efeito direto negativo produziu índice de mais 7,4835 enquanto o desfecho real medido foi de menos 4,4608, um erro de quase 12 unidades de receita por usuário e uma troca de sinal completa.
- Dá para testar se a suposição de substituição vale?
- Não com os dados do experimento sozinho. Athey e coautores registram que, quando o desfecho longo não é observado na amostra experimental, a suposição de substituição não tem implicações testáveis. O que dá para fazer é validar empiricamente: guardar o desfecho longo de uma amostra de experimentos passados e checar se a previsão do índice bate com o medido, em nível e não só em direção.
- Quanto tempo uma métrica substituta economiza de verdade?
- No estudo de Athey e coautores sobre o programa GAIN, seis trimestres de dados de curto prazo bastaram para reproduzir o efeito de nove anos: o índice devolveu 0,061 com erro-padrão de 0,006 contra o benchmark experimental de 0,064 com erro-padrão de 0,012. O estimador ingênuo, que lê o efeito acumulado nos primeiros trimestres, precisava de mais de 25 trimestres para chegar a dois erros-padrão do benchmark.