Estadística

Métrica Sustituta en Test A/B: cómo validar un proxy

La métrica sustituta cambia el resultado largo por señales de corto plazo. Cómo validar un proxy, por qué la correlación no basta y qué prueba lo expone.

Ilustración plana de una vara corta y una vara alta lado a lado, con una línea punteada que sale de la punta de la corta y alcanza la punta de la alta

Una métrica sustituta cambia el resultado que importa por señales que aparecen temprano. Solo es válida si carga el efecto entero del tratamiento, y esa condición no se verifica mirando la correlación: en los 8 tests limpios de esta guía, el proxy ingenuo tuvo una correlación de 0,9981 con el resultado de 180 días y aun así erraba el tamaño del efecto por un factor de 3,64. Esta guía muestra qué debe satisfacer una sustituta, cómo montar un índice calibrado con datos históricos, qué protocolo la valida empíricamente, y cómo queda el estropicio cuando el tratamiento actúa por un camino que la sustituta no ve. Forma parte de nuestra guía completa de test A/B y complementa holdout de largo plazo y métrica primaria y OEC.

El problema: la métrica correcta llega demasiado tarde

Casi todo equipo de experimentación vive la misma tensión. La métrica que decide el negocio es el ingreso retenido a seis meses, el valor de vida del cliente, la renovación en el segundo año. La métrica que existe cuando hay que tomar la decisión es el registro, la activación, los clics de la primera semana.

Athey, Chetty, Imbens y Kang abren el artículo del índice sustituto citando exactamente ese dolor en el contexto digital, reproduciendo el relevamiento de desafíos de Gupta y colegas de 2019: mientras la mayoría de los experimentos de la industria corre durante dos semanas o menos, el interés real es detectar el efecto de largo plazo, y la pregunta operativa es cómo medir eso sin esperar mucho tiempo en todos los casos.

La salida obvia es elegir una señal de corto plazo y usarla como sustituta. La parte que casi nadie hace es verificar si esa señal merece el cargo.

El criterio de Prentice, en una frase

Prentice formalizó en 1989 la condición que define a una sustituta legítima, y Athey y coautores la adoptan como la suposición central del método: condicionar en la sustituta vuelve el resultado independiente del tratamiento.

En castellano operativo: si conoces los valores de las señales de corto plazo de un usuario, saber en qué brazo estaba no agrega nada sobre su resultado largo. Todo el efecto del tratamiento pasa por las señales.

El criterio de Prentice como diagrama de caminosDiagrama con tres bloques. A la izquierda el tratamiento. En el medio, un bloque que contiene tres señales de corto plazo: activación a 14 días, sesiones en la semana 2 e ingreso de los primeros 14 días. A la derecha el resultado de 180 días. Una flecha sólida va del tratamiento al bloque de señales y otra flecha sólida va de las señales al resultado, formando el camino permitido. Una tercera flecha, punteada y marcada con una equis, intenta ir directo del tratamiento al resultado sin pasar por las señales, y la leyenda registra que la existencia de ese camino directo es exactamente lo que invalida la métrica sustituta.Todo el efecto debe pasar por las señales medidastratamientoseñales de corto plazoactivación a 14 díassesiones en la semana 2ingreso de los 14 díasresultado de180 díascualquier efecto directo por aquí invalida la sustitutaBajo el criterio de Prentice, conocer las señales vuelve irrelevante el brazo del usuario para el resultado.
La condición de sustitución es sobre mediación completa, no sobre correlación. Un camino directo del tratamiento al resultado, por pequeño que sea, rompe la lectura.

De ahí salen dos consecuencias, y las dos son incómodas.

La primera: la suposición no es contrastable con los datos del experimento. Athey y coautores lo registran explícitamente: si el resultado largo no se observa en la muestra experimental, la condición de sustitución no tiene implicaciones contrastables. No puedes probar que se cumple mirando el experimento en el que quieres usarla.

La segunda: la crítica clásica suele tener razón. Freedman, Graubard y Schatzkin argumentaron en 1992 que la sustituta frecuentemente no media el efecto entero, y Athey y coautores repiten el ejemplo: reducir el tamaño del aula puede afectar los salarios futuros por habilidades no cognitivas que una nota estandarizada no captura.

El caso GAIN: nueve años de espera contra seis trimestres de señal

El artículo del índice sustituto pone a prueba el método en un caso donde la respuesta verdadera es conocida, lo cual es raro. El programa GAIN fue una capacitación profesional evaluada por sorteo en condados de California a finales de los años 1980, con resultados seguidos durante nueve años, o 36 trimestres.

Los autores tomaron el sitio de Riverside como muestra experimental, le escondieron el resultado largo, y usaron los otros tres lugares (Alameda, Los Ángeles y San Diego, 13.725 personas) como muestra observacional para calibrar el índice. La pregunta: ¿se puede reproducir el efecto de 36 trimestres con pocos trimestres de señal?

trimestres de señal usados estimador ingenuo índice sustituto puntaje sustituto función de influencia
1 0,049 (0,013) 0,011 (0,003) 0,010 (0,002) 0,009 (0,003)
2 0,087 (0,012) 0,033 (0,003) 0,032 (0,003) 0,032 (0,004)
4 0,110 (0,011) 0,047 (0,005) 0,050 (0,005) 0,050 (0,005)
6 0,117 (0,010) 0,061 (0,006) 0,063 (0,006) 0,064 (0,006)
12 0,108 (0,010) 0,065 (0,007) 0,071 (0,008) 0,072 (0,008)
36 0,064 (0,010) 0,058 (0,009) 0,065 (0,010) 0,066 (0,010)

El benchmark experimental, medido esperando los 36 trimestres, es 0,064 con error estándar de 0,012 en la tasa de empleo (y 249 dólares con error estándar de 83 en el ingreso trimestral).

Dos lecturas de la tabla. El estimador ingenuo, que suma el resultado de los primeros trimestres y lo trata como si fuera el de largo plazo, llega a 0,117 en el sexto trimestre, casi el doble del valor correcto, y los autores registran que necesita más de 25 trimestres para llegar a dos errores estándar del benchmark. Los tres estimadores basados en sustitutas quedan dentro de dos errores estándar ya con cinco trimestres de señal. En el resumen del artículo, los autores reportan una reducción del 35 por ciento en los errores estándar al usar las tasas de empleo de los seis primeros trimestres en vez de esperar.

Fíjate en que el error del ingenuo aquí es hacia arriba. En nuestra simulación, más adelante, yerra hacia abajo. La dirección del error del proxy ingenuo no se conoce a priori, y por eso corregir “a mano” con un factor aprendido de un único test anterior no funciona.

Ejemplo trabajado: montando un índice a partir del histórico

Simulamos un caso de producto para poder comparar cada estimador contra la verdad. El mundo: usuarios con calidad latente propia, tres señales de corto plazo (activó a 14 días, sesiones en la semana 2, ingreso de los primeros 14 días) y un resultado de 180 días que depende de las tres.

Paso 1: calibrar el índice en la muestra observacional. Tomamos 40.000 usuarios históricos, sin experimento alguno, para quienes tanto las señales como el resultado de 180 días ya son conocidos, y ajustamos una regresión simple del resultado sobre las señales. Es exactamente lo que hacen Athey y coautores con los tres lugares fuera de Riverside.

coeficiente valor ajustado valor verdadero del mundo
intercepto 11,4383 12
activó a 14 días 54,0811 55
sesiones en la semana 2 4,5701 4,5
ingreso de los 14 días 2,2277 2,2

El ajuste explica el 64,57 por ciento de la variación del resultado de 180 días, que tiene una media de 103,4656 y una desviación de 67,1266. No hace falta predecir bien al usuario individual, y ese es un punto que suele confundir: el índice no necesita acertar cuánto va a gastar cada persona, necesita acertar la diferencia de medias entre dos grupos grandes.

Paso 2: correr el experimento y leer las señales. 25.000 usuarios por brazo. La primera señal ya es una métrica de decisión por sí sola:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Pegando en la calculadora de arriba el control con 25.000 visitantes y 10.427 activaciones (41,7080 por ciento) contra el tratamiento con 25.000 visitantes y 11.118 activaciones (44,4720 por ciento), el resultado es una z de 6,2404, un valor p de 4,384 por 10 elevado a menos 10, una diferencia de 2,7640 puntos porcentuales, una ganancia relativa del 6,6270 por ciento y un intervalo de 1,8962 a 3,6318 puntos porcentuales.

Paso 3: aplicar el índice y comparar contra la verdad. Medimos los efectos verdaderos en las señales con una muestra de 300 mil por brazo: más 2,9183 puntos porcentuales de activación, más 0,3023 sesión y más 2,1417 de ingreso en los 14 días. Aplicando los coeficientes del mundo, el efecto verdadero de 180 días es 7,6773 de ingreso por usuario.

estimador disponible cuando estimación error estándar
ingenuo (ingreso de 14 días leído como resultado) día 14 1,9546 0,1026
índice sustituto día 14 7,2558 0,4821
esperar y medir los 180 días día 180 7,9784 0,5988
verdad nunca observable en la práctica 7,6773 referencia

El ingenuo subestima el efecto real en 3,93 veces. El índice cae a 0,9 error estándar de la verdad, y el número medido esperando medio año cae a 0,5 error estándar de la verdad por el otro lado. Además de llegar 166 días antes, el índice sale con un error estándar 19,48 por ciento menor que el de la medición directa, porque descarta el ruido del resultado largo que no tiene nada que ver con el tratamiento.

Correlación no es calibración

Aquí está el punto que separa validación de comodidad. Corrimos 12 experimentos pasados en el mismo mundo simulado, con tamaños de efecto distintos, y guardamos el resultado de 180 días de todos ellos para comparar con lo que la sustituta predecía.

test predicho por el índice medido a 180 días error estándar del medido proxy ingenuo
1 1,9417 1,9109 0,5984 0,5323
2 3,5386 3,8283 0,5960 1,0037
3 6,3744 6,0883 0,5990 1,6914
4 8,1408 9,0395 0,5994 2,3015
5 9,4172 9,9360 0,5996 2,6461
6 11,9146 11,6860 0,6017 3,2845
7 13,9983 14,2291 0,6013 3,8024
8 16,2117 15,8901 0,6042 4,3752
9 6,8887 menos 5,8053 0,6009 1,9836
10 6,0512 menos 0,3250 0,6004 1,6684
11 11,0089 16,5326 0,6018 3,0772
12 4,0623 14,3252 0,5977 1,1344

Los tests del 1 al 8 satisfacen el criterio de Prentice por construcción. Los del 9 al 12 tienen un efecto directo sobre el resultado largo que no pasa por las señales.

Mirando solo los 8 limpios, la comparación entre índice y proxy ingenuo es reveladora:

medida índice sustituto proxy ingenuo
correlación con lo medido 0,9963 0,9981
coeficiente de determinación 0,9925 0,9962
pendiente de la recta contra lo medido 0,9830 3,6430
error absoluto medio 0,3506 6,6214

El proxy ingenuo tiene una correlación ligeramente mayor que la del índice y es inútil como estimación. Sube junto con el resultado de forma casi perfecta, y cada unidad suya vale 3,64 unidades de lo que quieres medir. Un equipo que valida la sustituta por correlación aprueba ese proxy y después suma un roadmap entero en la moneda equivocada.

La correlación responde “cuando esto sube, ¿aquello sube?”. La pregunta correcta es “cuando esto sube una unidad, ¿aquello sube cuánto?”, y esa se responde por pendiente, con el valor 1 como objetivo, no por correlación.

Cuando la métrica sustituta se rompe: el efecto directo

El test 9 de la tabla es el caso que quita el sueño. El tratamiento mueve las tres señales en la dirección correcta, y al mismo tiempo tiene un efecto negativo sobre el resultado de 180 días que no pasa por ellas. Piensa en un descuento agresivo que llena la activación de corto plazo y atrae a un público que no renueva.

lectura valor
proxy ingenuo más 2,0572
índice sustituto más 7,4835
medido a 180 días menos 4,4608
error del índice 11,9443 de ingreso por usuario

Ninguno de los dos estimadores de corto plazo ve el problema. No es una cuestión de precisión ni de muestra: las señales están bien y la cuenta está bien. Lo que está mal es el mapa. Es la misma familia de error descrita en nuestra guía sobre efecto novedad, con la diferencia de que allí la señal se disuelve con el tiempo y aquí nunca llega a ser lo que el índice dice.

Incluyendo los 4 tests con efecto directo en la validación, el retrato cambia por completo:

medida solo los 8 limpios los 12
correlación 0,9963 0,6125
coeficiente de determinación 0,9925 0,3751
error absoluto medio 0,3506 3,3109
mayor error individual menos de 0,9 12,6940
Predicho por el índice contra medido a 180 días, en los 12 testsGráfico de dispersión. El eje horizontal trae el efecto predicho por el índice sustituto en el día 14 y el eje vertical trae el efecto medido después de 180 días. Una línea punteada diagonal marca la igualdad perfecta entre predicho y medido. Ocho puntos oscuros, correspondientes a los tests que satisfacen el criterio de sustitución, quedan prácticamente pegados a esa diagonal a lo largo de todo el rango de efectos. Cuatro puntos en ámbar, correspondientes a los tests con efecto directo, quedan muy alejados de la diagonal: dos de ellos aparecen bien abajo, con predicción positiva y resultado medido negativo, y dos aparecen bien arriba, con resultado medido mucho mayor que el predicho.La validación es la distancia hasta la diagonal, no la correlación01020051015predicho igual a medidotest 9test 12efecto predicho por el índice en el día 14círculos: la sustitución se cumple · triángulos: efecto directo
Los 8 tests limpios caen sobre la diagonal en todo el rango de efectos. Los 4 con efecto directo se alejan de ella, incluso cambiando de signo, y son invisibles para cualquier lectura de corto plazo.

Ese gráfico es el protocolo de validación entero. No validas una sustituta mirando un experimento: la validas guardando el resultado largo de una muestra de experimentos y comprobando cuántos de ellos caen en la diagonal.

Qué compra la métrica sustituta, y qué cuesta

Vale la pena separar las dos ganancias, porque son independientes y los equipos suelen sumar una y olvidar la otra.

La ganancia de tiempo es la obvia y la mayor. En nuestro ejemplo, la decisión sale el día 14 en vez del día 180. En el caso GAIN, seis trimestres en vez de treinta y seis. Esa ganancia no es sobre un test: es sobre la cadencia del programa entero, porque el mismo tráfico pasa a financiar más rondas de aprendizaje por año.

La ganancia de precisión es menor y menos intuitiva. El índice descarta la parte del resultado largo que no tiene relación alguna con el tratamiento, y por eso sale con un error estándar menor que el de la medición directa: 0,4821 contra 0,5988 en nuestro ejemplo, una reducción del 19,48 por ciento. En el estudio GAIN la reducción reportada en el resumen es del 35 por ciento con seis trimestres de señal.

dimensión esperar el resultado índice sustituto
cuándo sale la decisión día 180 día 14
error estándar de la estimación 0,5988 0,4821
suposición extra exigida ninguna criterio de Prentice
fallo silencioso posible no sí, por efecto directo

La columna que cierra la cuenta es la última. La sustituta cambia tiempo por una suposición que puede fallar sin aviso. Esperar el resultado real es lento y no miente. Por eso el diseño saludable no es elegir entre los dos: es decidir por la sustituta y seguir midiendo el resultado real en una porción de los tests, que es lo que alimenta la validación de la próxima sección.

El protocolo de validación, en siete pasos

  1. Elige las señales por el mecanismo, no por la correlación. Pregunta por qué camino debería el cambio afectar al resultado y mide ese camino. Una señal correlacionada que no está en el camino es adorno.
  2. Calibra en un histórico observacional donde señales y resultado largo coexistan. No hace falta que sea un experimento: hace falta que sea la misma población, con las mismas definiciones de métrica.
  3. Reserva un holdout de resultado largo para una muestra de tus experimentos, como se describe en nuestra guía de holdout de largo plazo. Sin eso no existe validación, solo esperanza.
  4. Valida por pendiente, no por correlación. La regresión de lo medido sobre lo predicho tiene que dar una pendiente cerca de 1 y un intercepto cerca de 0. Reporta también el error absoluto medio, que es el número que la decisión siente.
  5. Recalibra con periodicidad fija. El índice se ajusta sobre una foto del producto. Si cambió el público, el precio o el embudo, los coeficientes cambiaron con ellos.
  6. Trata una divergencia grande como bandera roja, no como ruido. Un test en el que el índice predijo más 7 y lo medido dio menos 4 es un hallazgo sobre el producto, y probablemente apunta a un efecto directo que tu mapa no tenía.
  7. Nunca uses la sustituta para una decisión irreversible de alto riesgo sin al menos un test confirmatorio con resultado real. La sustituta acelera decisiones reversibles.

Errores comunes

Hazlo automático en Donnu

Todo el protocolo de arriba depende de una condición de datos: las señales de corto plazo y el resultado largo del mismo usuario tienen que seguir enlazados meses después. Ahí es donde falla la mayoría de los montajes, porque el experimento se archiva cuando termina y el ingreso de los seis meses siguientes vive en otro sistema, sin clave en común.

Donnu mantiene la asignación del usuario ligada a los eventos después del final del experimento, que es exactamente la condición para reabrir un test antiguo y preguntar cuánto valió de verdad. Si tu montaje actual no lo permite, el paso inmediato y barato es congelar hoy la lista de usuarios sorteados de tus últimos experimentos, para poder medir el resultado largo dentro de unos meses, y mientras tanto tratar todo número de corto plazo como dirección, no como valor. Para comprobar si tu señal de corto plazo tiene muestra suficiente para ser leída, la calculadora de significancia responde en un minuto.

Referencias

Lee también: Holdout de largo plazo · Métrica primaria y OEC · Efecto novedad · Maldición del ganador · Métricas de activación en SaaS · Calculadora de significancia · Leia em português

Preguntas frecuentes

¿Qué es una métrica sustituta en un test A/B?
Es una métrica de corto plazo usada en lugar del resultado que de verdad importa, cuando ese resultado tarda demasiado en aparecer. Activación a 14 días en lugar de ingresos a 180 días, por ejemplo. La sustituta no es solo un indicador correlacionado: necesita cargar el efecto entero del tratamiento, condición que Prentice formalizó en 1989 y que Athey, Chetty, Imbens y Kang llaman suposición de sustitución.
¿Cuál es la diferencia entre un proxy ingenuo y un índice sustituto?
El proxy ingenuo lee el efecto medido en el corto plazo como si fuera el efecto de largo plazo. El índice sustituto combina varias señales de corto plazo en una predicción del resultado largo, calibrada con datos históricos donde ambos fueron observados. En el ejemplo de esta guía, el proxy ingenuo subestimó el efecto real en 3,93 veces, mientras que el índice acertó dentro de su propio error estándar.
¿Por qué una correlación alta no basta para validar una métrica sustituta?
Porque la correlación no garantiza la escala. En los 8 tests limpios de esta guía, el proxy ingenuo tuvo una correlación de 0,9981 con el resultado largo, ligeramente mayor que la del índice, y aun así la recta que une uno con otro tenía una pendiente de 3,6430, es decir, el número leído debía multiplicarse por casi cuatro. El error absoluto medio del proxy fue de 6,6214 contra 0,3506 del índice. La correlación dice que suben juntos; la calibración dice cuánto.
¿Cómo puede una métrica sustituta dar la señal equivocada?
Cuando el tratamiento afecta al resultado por un camino que no pasa por las señales medidas, lo que viola el criterio de Prentice. En la simulación de esta guía, un tratamiento con efecto directo negativo produjo un índice de más 7,4835 mientras que el resultado real medido fue de menos 4,4608, un error de casi 12 unidades de ingreso por usuario y un cambio de signo completo.
¿Se puede comprobar si la suposición de sustitución se cumple?
No con los datos del experimento solos. Athey y coautores registran que, cuando el resultado largo no se observa en la muestra experimental, la suposición de sustitución no tiene implicaciones contrastables. Lo que sí se puede hacer es validarla empíricamente: guardar el resultado largo de una muestra de experimentos pasados y comprobar si la predicción del índice coincide con lo medido, en nivel y no solo en dirección.
¿Cuánto tiempo ahorra de verdad una métrica sustituta?
En el estudio de Athey y coautores sobre el programa GAIN, seis trimestres de datos de corto plazo bastaron para reproducir el efecto de nueve años: el índice devolvió 0,061 con error estándar de 0,006 frente al benchmark experimental de 0,064 con error estándar de 0,012. El estimador ingenuo, que lee el resultado acumulado en los primeros trimestres, necesitaba más de 25 trimestres para llegar a dos errores estándar del benchmark.