Estatística

Métrica Substituta em Teste A/B: como validar um proxy

Métrica substituta troca o desfecho longo por sinais de curto prazo. Como validar um proxy, por que correlação não basta e o teste que expõe a falha.

Ilustração plana de uma haste curta e uma haste alta lado a lado, com uma linha pontilhada saindo do topo da curta e alcançando o topo da alta

Uma métrica substituta troca o desfecho que importa por sinais que aparecem cedo. Ela só é válida se carregar o efeito inteiro do tratamento, e essa condição não se verifica olhando correlação: nos 8 testes limpos deste guia, o proxy ingênuo teve correlação de 0,9981 com o desfecho de 180 dias e mesmo assim errava o tamanho do efeito por um fator de 3,64. Este guia mostra o que uma substituta precisa satisfazer, como montar um índice calibrado em dados históricos, qual protocolo valida a substituta empiricamente, e como fica o estrago quando o tratamento age por um caminho que a substituta não enxerga. Faz parte do nosso guia completo de teste A/B e complementa holdout de longo prazo e métrica primária e OEC.

O problema: a métrica certa chega tarde demais

Quase todo time de experimentação vive a mesma tensão. A métrica que decide o negócio é receita retida em seis meses, valor de vida do cliente, renovação no segundo ano. A métrica que existe quando a decisão precisa ser tomada é cadastro, ativação, cliques na primeira semana.

Athey, Chetty, Imbens e Kang abrem o artigo do índice substituto citando exatamente essa dor no contexto digital, reproduzindo o levantamento de desafios de Gupta e colegas de 2019: enquanto a maioria dos experimentos da indústria roda por duas semanas ou menos, o interesse real é detectar o efeito de longo prazo, e a pergunta operacional é como medir isso sem esperar muito tempo em todos os casos.

A saída óbvia é escolher um sinal de curto prazo e usá-lo como substituto. A parte que quase ninguém faz é verificar se esse sinal merece o cargo.

O critério de Prentice, em uma frase

Prentice formalizou em 1989 a condição que define uma substituta legítima, e Athey e coautores a adotam como a suposição central do método: condicionar na substituta torna o desfecho independente do tratamento.

Em português operacional: se você souber os valores dos sinais de curto prazo de um usuário, saber em que braço ele estava não acrescenta nada sobre o desfecho longo dele. Todo o efeito do tratamento passa pelos sinais.

O critério de Prentice como um diagrama de caminhosDiagrama com três blocos. À esquerda o tratamento. No meio, um bloco contendo três sinais de curto prazo: ativação em 14 dias, sessões na semana 2 e receita dos primeiros 14 dias. À direita o desfecho de 180 dias. Uma seta sólida vai do tratamento para o bloco de sinais e outra seta sólida vai dos sinais para o desfecho, formando o caminho permitido. Uma terceira seta, tracejada e marcada com um X, tenta ir direto do tratamento para o desfecho sem passar pelos sinais, e a legenda registra que a existência desse caminho direto é exatamente o que invalida a métrica substituta.Todo o efeito precisa passar pelos sinais medidostratamentosinais de curto prazoativação em 14 diassessões na semana 2receita dos 14 diasdesfecho de180 diasqualquer efeito direto por aqui invalida a substitutaSob o critério de Prentice, conhecer os sinais torna o braço do usuário irrelevante para o desfecho.
A condição de substituição é sobre mediação completa, não sobre correlação. Um caminho direto do tratamento ao desfecho, por menor que seja, quebra a leitura.

Duas consequências saem daí, e as duas são desconfortáveis.

A primeira: a suposição não é testável com os dados do experimento. Athey e coautores registram isso explicitamente: se o desfecho longo não é observado na amostra experimental, a condição de substituição não tem implicações testáveis. Você não consegue provar que ela vale olhando o experimento em que quer usá-la.

A segunda: a crítica clássica costuma estar certa. Freedman, Graubard e Schatzkin argumentaram em 1992 que a substituta frequentemente não medeia o efeito inteiro, e Athey e coautores repetem o exemplo: reduzir o tamanho da turma pode afetar salários futuros por habilidades não cognitivas que uma nota padronizada não captura.

O caso GAIN: nove anos de espera contra seis trimestres de sinal

O artigo do índice substituto testa o método num caso onde a resposta verdadeira é conhecida, o que é raro. O programa GAIN foi um treinamento profissional avaliado por sorteio em condados da Califórnia no fim dos anos 1980, com desfechos acompanhados por nove anos, ou 36 trimestres.

Os autores tomaram o site de Riverside como amostra experimental, esconderam dele o desfecho longo, e usaram os outros três locais (Alameda, Los Angeles e San Diego, 13.725 pessoas) como amostra observacional para calibrar o índice. A pergunta: dá para reproduzir o efeito de 36 trimestres com poucos trimestres de sinal?

trimestres de sinal usados estimador ingênuo índice substituto escore substituto função de influência
1 0,049 (0,013) 0,011 (0,003) 0,010 (0,002) 0,009 (0,003)
2 0,087 (0,012) 0,033 (0,003) 0,032 (0,003) 0,032 (0,004)
4 0,110 (0,011) 0,047 (0,005) 0,050 (0,005) 0,050 (0,005)
6 0,117 (0,010) 0,061 (0,006) 0,063 (0,006) 0,064 (0,006)
12 0,108 (0,010) 0,065 (0,007) 0,071 (0,008) 0,072 (0,008)
36 0,064 (0,010) 0,058 (0,009) 0,065 (0,010) 0,066 (0,010)

O benchmark experimental, medido esperando os 36 trimestres, é 0,064 com erro-padrão de 0,012 na taxa de emprego (e 249 dólares com erro-padrão de 83 na renda trimestral).

Duas leituras da tabela. O estimador ingênuo, que soma o desfecho dos primeiros trimestres e o trata como se fosse o de longo prazo, chega a 0,117 no sexto trimestre, quase o dobro do valor certo, e os autores registram que ele precisa de mais de 25 trimestres para chegar a dois erros-padrão do benchmark. Os três estimadores baseados em substitutas ficam dentro de dois erros-padrão já com cinco trimestres de sinal. No resumo do artigo, os autores relatam redução de 35 por cento nos erros-padrão ao usar as taxas de emprego dos seis primeiros trimestres em vez de esperar.

Repare que o erro do ingênuo aqui é para cima. Na nossa simulação, adiante, ele erra para baixo. A direção do erro do proxy ingênuo não é conhecida a priori, e é por isso que corrigir “na mão” com um fator aprendido de um único teste anterior não funciona.

Exemplo trabalhado: montando um índice a partir do histórico

Simulamos um caso de produto para poder comparar cada estimador contra a verdade. O mundo: usuários com qualidade latente própria, três sinais de curto prazo (ativou em 14 dias, sessões na semana 2, receita dos primeiros 14 dias) e um desfecho de 180 dias que depende dos três.

Passo 1: calibrar o índice na amostra observacional. Pegamos 40.000 usuários históricos, sem experimento nenhum, para quem tanto os sinais quanto o desfecho de 180 dias já são conhecidos, e ajustamos uma regressão simples do desfecho sobre os sinais. É exatamente o que Athey e coautores fazem com os três locais fora de Riverside.

coeficiente valor ajustado valor verdadeiro do mundo
intercepto 11,4383 12
ativou em 14 dias 54,0811 55
sessões na semana 2 4,5701 4,5
receita dos 14 dias 2,2277 2,2

O ajuste explica 64,57 por cento da variação do desfecho de 180 dias, que tem média de 103,4656 e desvio de 67,1266. Não é preciso prever bem o usuário individual, e esse é um ponto que costuma confundir: o índice não precisa acertar quanto cada pessoa vai gastar, precisa acertar a diferença de médias entre dois grupos grandes.

Passo 2: rodar o experimento e ler os sinais. 25.000 usuários por braço. O primeiro sinal já é uma métrica de decisão por si só:

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Colando na calculadora acima o controle com 25.000 visitantes e 10.427 ativações (41,7080 por cento) contra o tratamento com 25.000 visitantes e 11.118 ativações (44,4720 por cento), o resultado é z de 6,2404, valor-p de 4,384 vezes 10 elevado a menos 10, diferença de 2,7640 pontos percentuais, ganho relativo de 6,6270 por cento e intervalo de 1,8962 a 3,6318 pontos percentuais.

Passo 3: aplicar o índice e comparar contra a verdade. Medimos os efeitos verdadeiros nos sinais com uma amostra de 300 mil por braço: mais 2,9183 pontos percentuais de ativação, mais 0,3023 sessão e mais 2,1417 de receita nos 14 dias. Aplicando os coeficientes do mundo, o efeito verdadeiro de 180 dias é 7,6773 de receita por usuário.

estimador disponível quando estimativa erro-padrão
ingênuo (receita de 14 dias lida como desfecho) dia 14 1,9546 0,1026
índice substituto dia 14 7,2558 0,4821
esperar e medir os 180 dias dia 180 7,9784 0,5988
verdade nunca observável na prática 7,6773 referência

O ingênuo subestima o efeito real em 3,93 vezes. O índice cai a 0,9 erro-padrão da verdade, e o número medido esperando meio ano cai a 0,5 erro-padrão da verdade pelo outro lado. Além de chegar 166 dias antes, o índice sai com erro-padrão 19,48 por cento menor que o da medição direta, porque ele descarta o ruído do desfecho longo que não tem nada a ver com o tratamento.

Correlação não é calibração

Aqui está o ponto que separa validação de conforto. Rodamos 12 experimentos passados no mesmo mundo simulado, com tamanhos de efeito diferentes, e guardamos o desfecho de 180 dias de todos eles para comparar com o que a substituta previa.

teste previsto pelo índice medido em 180 dias erro-padrão do medido proxy ingênuo
1 1,9417 1,9109 0,5984 0,5323
2 3,5386 3,8283 0,5960 1,0037
3 6,3744 6,0883 0,5990 1,6914
4 8,1408 9,0395 0,5994 2,3015
5 9,4172 9,9360 0,5996 2,6461
6 11,9146 11,6860 0,6017 3,2845
7 13,9983 14,2291 0,6013 3,8024
8 16,2117 15,8901 0,6042 4,3752
9 6,8887 menos 5,8053 0,6009 1,9836
10 6,0512 menos 0,3250 0,6004 1,6684
11 11,0089 16,5326 0,6018 3,0772
12 4,0623 14,3252 0,5977 1,1344

Os testes de 1 a 8 satisfazem o critério de Prentice por construção. Os de 9 a 12 têm um efeito direto sobre o desfecho longo que não passa pelos sinais.

Olhando só os 8 limpos, a comparação entre índice e proxy ingênuo é reveladora:

medida índice substituto proxy ingênuo
correlação com o medido 0,9963 0,9981
coeficiente de determinação 0,9925 0,9962
inclinação da reta contra o medido 0,9830 3,6430
erro absoluto médio 0,3506 6,6214

O proxy ingênuo tem correlação ligeiramente maior que a do índice e é inútil como estimativa. Ele sobe junto com o desfecho de forma quase perfeita, e cada unidade dele vale 3,64 unidades do que você quer medir. Um time que valida a substituta por correlação aprova esse proxy e depois soma um roadmap inteiro em moeda errada.

A correlação responde “quando isso sobe, aquilo sobe?”. A pergunta certa é “quando isso sobe uma unidade, aquilo sobe quanto?”, e ela se responde por inclinação, com o valor 1 como alvo, não por correlação.

Quando a métrica substituta quebra: o efeito direto

O teste 9 da tabela é o caso que tira o sono. O tratamento move os três sinais na direção certa, e ao mesmo tempo tem um efeito negativo sobre o desfecho de 180 dias que não passa por eles. Pense num desconto agressivo que enche a ativação de curto prazo e atrai um público que não renova.

leitura valor
proxy ingênuo mais 2,0572
índice substituto mais 7,4835
medido em 180 dias menos 4,4608
erro do índice 11,9443 de receita por usuário

Nenhum dos dois estimadores de curto prazo vê o problema. Não é uma questão de precisão nem de amostra: os sinais estão certos e a conta está certa. O que está errado é o mapa. É a mesma família de erro descrita no nosso guia sobre efeito novidade, com a diferença de que ali o sinal se dissolve com o tempo e aqui ele nunca chega a ser o que o índice diz.

Incluindo os 4 testes com efeito direto na validação, o retrato muda por completo:

medida só os 8 limpos todos os 12
correlação 0,9963 0,6125
coeficiente de determinação 0,9925 0,3751
erro absoluto médio 0,3506 3,3109
maior erro individual menos de 0,9 12,6940
Previsto pelo índice contra medido em 180 dias, nos 12 testesGráfico de dispersão. O eixo horizontal traz o efeito previsto pelo índice substituto no dia 14 e o eixo vertical traz o efeito medido depois de 180 dias. Uma linha tracejada diagonal marca a igualdade perfeita entre previsto e medido. Oito pontos escuros, correspondentes aos testes que satisfazem o critério de substituição, ficam praticamente colados nessa diagonal ao longo de toda a faixa de efeitos. Quatro pontos em âmbar, correspondentes aos testes com efeito direto, ficam muito afastados da diagonal: dois deles aparecem bem abaixo, com previsão positiva e resultado medido negativo, e dois aparecem bem acima, com resultado medido muito maior que o previsto.A validação é a distância até a diagonal, não a correlação01020051015previsto igual a medidoteste 9teste 12efeito previsto pelo índice no dia 14círculos: substituição vale · triângulos: efeito direto
Os 8 testes limpos caem sobre a diagonal em toda a faixa de efeitos. Os 4 com efeito direto se afastam dela, inclusive trocando de sinal, e são invisíveis para qualquer leitura de curto prazo.

Esse gráfico é o protocolo de validação inteiro. Você não valida uma substituta olhando para um experimento: valida guardando o desfecho longo de uma amostra de experimentos e checando quantos deles caem na diagonal.

O que a métrica substituta compra, e o que ela custa

Vale separar os dois ganhos, porque eles são independentes e os times costumam somar um e esquecer o outro.

O ganho de tempo é o óbvio e o maior. No nosso exemplo, a decisão sai no dia 14 em vez do dia 180. No caso GAIN, seis trimestres em vez de trinta e seis. Esse ganho não é sobre um teste: é sobre a cadência do programa inteiro, porque o mesmo tráfego passa a bancar mais rodadas de aprendizado por ano.

O ganho de precisão é menor e menos intuitivo. O índice descarta a parte do desfecho longo que não tem relação nenhuma com o tratamento, e por isso sai com erro-padrão menor que o da medição direta: 0,4821 contra 0,5988 no nosso exemplo, uma redução de 19,48 por cento. No estudo GAIN a redução relatada no resumo é de 35 por cento com seis trimestres de sinal.

dimensão esperar o desfecho índice substituto
quando a decisão sai dia 180 dia 14
erro-padrão da estimativa 0,5988 0,4821
suposição extra exigida nenhuma critério de Prentice
falha silenciosa possível não sim, por efeito direto

A coluna que fecha a conta é a última. A substituta troca tempo por uma suposição que pode falhar sem aviso. Esperar o desfecho real é lento e não mente. É por isso que o desenho saudável não é escolher entre os dois: é decidir pela substituta e continuar medindo o desfecho real numa fatia dos testes, que é o que alimenta a validação da próxima seção.

O protocolo de validação, em sete passos

  1. Escolha os sinais pelo mecanismo, não pela correlação. Pergunte por qual caminho a mudança deveria afetar o desfecho e meça esse caminho. Sinal correlacionado que não está no caminho é enfeite.
  2. Calibre num histórico observacional onde sinais e desfecho longo coexistem. Não precisa ser experimento: precisa ser a mesma população, com as mesmas definições de métrica.
  3. Reserve um holdout de desfecho longo para uma amostra dos seus experimentos, do jeito descrito no nosso guia de holdout de longo prazo. Sem isso não existe validação, só esperança.
  4. Valide por inclinação, não por correlação. A regressão do medido sobre o previsto tem que dar inclinação perto de 1 e intercepto perto de 0. Reporte também o erro absoluto médio, que é o número que a decisão sente.
  5. Recalibre com periodicidade fixa. O índice é ajustado numa foto do produto. Mudou o público, o preço ou o funil, os coeficientes mudaram junto.
  6. Trate divergência grande como bandeira vermelha, não como ruído. Um teste em que o índice previu mais 7 e o medido deu menos 4 é uma descoberta sobre o produto, e provavelmente aponta um efeito direto que o seu mapa não tinha.
  7. Nunca use a substituta para decisão irreversível de alto risco sem pelo menos um teste confirmatório com desfecho real. Substituta é aceleradora de decisão reversível.

Erros comuns

Faça isso automático na Donnu

Todo o protocolo acima depende de uma condição de dados: os sinais de curto prazo e o desfecho longo do mesmo usuário precisam continuar ligados meses depois. É aí que a maioria das montagens falha, porque o experimento é arquivado quando termina e a receita dos seis meses seguintes vive em outro sistema, sem chave em comum.

A Donnu mantém a atribuição do usuário ligada aos eventos depois do fim do experimento, o que é exatamente a condição para reabrir um teste antigo e perguntar quanto ele valeu de verdade. Se a sua montagem atual não permite isso, o passo imediato e barato é congelar hoje a lista de usuários sorteados dos seus últimos experimentos, para poder medir o desfecho longo daqui a alguns meses, e enquanto isso tratar todo número de curto prazo como direção, não como valor. Para checar se o seu sinal de curto prazo tem amostra suficiente para ser lido, a calculadora de significância responde em um minuto.

Referências

Leia também: Holdout de longo prazo · Métrica primária e OEC · Efeito novidade · Maldição do vencedor · Métricas de ativação em SaaS · Calculadora de significância · Read in English

Perguntas frequentes

O que é uma métrica substituta em teste A/B?
É uma métrica de curto prazo usada no lugar do desfecho que realmente importa, quando esse desfecho demora demais para aparecer. Ativação em 14 dias no lugar de receita em 180 dias, por exemplo. A substituta não é só um indicador correlacionado: ela precisa carregar o efeito inteiro do tratamento, condição que Prentice formalizou em 1989 e que Athey, Chetty, Imbens e Kang chamam de suposição de substituição.
Qual a diferença entre um proxy ingênuo e um índice substituto?
O proxy ingênuo lê o efeito medido no curto prazo como se fosse o efeito de longo prazo. O índice substituto combina vários sinais de curto prazo numa previsão do desfecho longo, calibrada em dados históricos onde os dois foram observados. No exemplo deste guia, o proxy ingênuo subestimou o efeito real em 3,93 vezes, enquanto o índice acertou dentro do próprio erro-padrão.
Por que correlação alta não basta para validar uma métrica substituta?
Porque correlação não garante escala. Nos 8 testes limpos deste guia, o proxy ingênuo teve correlação de 0,9981 com o desfecho longo, ligeiramente maior que a do índice, e mesmo assim a reta que liga um ao outro tinha inclinação de 3,6430, ou seja, o número lido precisava ser multiplicado por quase quatro. O erro absoluto médio do proxy foi de 6,6214 contra 0,3506 do índice. Correlação diz que sobe junto; calibração diz quanto.
Como uma métrica substituta pode dar o sinal errado?
Quando o tratamento afeta o desfecho por um caminho que não passa pelos sinais medidos, o que viola o critério de Prentice. Na simulação deste guia, um tratamento com efeito direto negativo produziu índice de mais 7,4835 enquanto o desfecho real medido foi de menos 4,4608, um erro de quase 12 unidades de receita por usuário e uma troca de sinal completa.
Dá para testar se a suposição de substituição vale?
Não com os dados do experimento sozinho. Athey e coautores registram que, quando o desfecho longo não é observado na amostra experimental, a suposição de substituição não tem implicações testáveis. O que dá para fazer é validar empiricamente: guardar o desfecho longo de uma amostra de experimentos passados e checar se a previsão do índice bate com o medido, em nível e não só em direção.
Quanto tempo uma métrica substituta economiza de verdade?
No estudo de Athey e coautores sobre o programa GAIN, seis trimestres de dados de curto prazo bastaram para reproduzir o efeito de nove anos: o índice devolveu 0,061 com erro-padrão de 0,006 contra o benchmark experimental de 0,064 com erro-padrão de 0,012. O estimador ingênuo, que lê o efeito acumulado nos primeiros trimestres, precisava de mais de 25 trimestres para chegar a dois erros-padrão do benchmark.