Métrica Sustituta en Test A/B: cómo validar un proxy
La métrica sustituta cambia el resultado largo por señales de corto plazo. Cómo validar un proxy, por qué la correlación no basta y qué prueba lo expone.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Una métrica sustituta cambia el resultado que importa por señales que aparecen temprano. Solo es válida si carga el efecto entero del tratamiento, y esa condición no se verifica mirando la correlación: en los 8 tests limpios de esta guía, el proxy ingenuo tuvo una correlación de 0,9981 con el resultado de 180 días y aun así erraba el tamaño del efecto por un factor de 3,64. Esta guía muestra qué debe satisfacer una sustituta, cómo montar un índice calibrado con datos históricos, qué protocolo la valida empíricamente, y cómo queda el estropicio cuando el tratamiento actúa por un camino que la sustituta no ve. Forma parte de nuestra guía completa de test A/B y complementa holdout de largo plazo y métrica primaria y OEC.
El problema: la métrica correcta llega demasiado tarde
Casi todo equipo de experimentación vive la misma tensión. La métrica que decide el negocio es el ingreso retenido a seis meses, el valor de vida del cliente, la renovación en el segundo año. La métrica que existe cuando hay que tomar la decisión es el registro, la activación, los clics de la primera semana.
Athey, Chetty, Imbens y Kang abren el artículo del índice sustituto citando exactamente ese dolor en el contexto digital, reproduciendo el relevamiento de desafíos de Gupta y colegas de 2019: mientras la mayoría de los experimentos de la industria corre durante dos semanas o menos, el interés real es detectar el efecto de largo plazo, y la pregunta operativa es cómo medir eso sin esperar mucho tiempo en todos los casos.
La salida obvia es elegir una señal de corto plazo y usarla como sustituta. La parte que casi nadie hace es verificar si esa señal merece el cargo.
El criterio de Prentice, en una frase
Prentice formalizó en 1989 la condición que define a una sustituta legítima, y Athey y coautores la adoptan como la suposición central del método: condicionar en la sustituta vuelve el resultado independiente del tratamiento.
En castellano operativo: si conoces los valores de las señales de corto plazo de un usuario, saber en qué brazo estaba no agrega nada sobre su resultado largo. Todo el efecto del tratamiento pasa por las señales.
De ahí salen dos consecuencias, y las dos son incómodas.
La primera: la suposición no es contrastable con los datos del experimento. Athey y coautores lo registran explícitamente: si el resultado largo no se observa en la muestra experimental, la condición de sustitución no tiene implicaciones contrastables. No puedes probar que se cumple mirando el experimento en el que quieres usarla.
La segunda: la crítica clásica suele tener razón. Freedman, Graubard y Schatzkin argumentaron en 1992 que la sustituta frecuentemente no media el efecto entero, y Athey y coautores repiten el ejemplo: reducir el tamaño del aula puede afectar los salarios futuros por habilidades no cognitivas que una nota estandarizada no captura.
El caso GAIN: nueve años de espera contra seis trimestres de señal
El artículo del índice sustituto pone a prueba el método en un caso donde la respuesta verdadera es conocida, lo cual es raro. El programa GAIN fue una capacitación profesional evaluada por sorteo en condados de California a finales de los años 1980, con resultados seguidos durante nueve años, o 36 trimestres.
Los autores tomaron el sitio de Riverside como muestra experimental, le escondieron el resultado largo, y usaron los otros tres lugares (Alameda, Los Ángeles y San Diego, 13.725 personas) como muestra observacional para calibrar el índice. La pregunta: ¿se puede reproducir el efecto de 36 trimestres con pocos trimestres de señal?
| trimestres de señal usados | estimador ingenuo | índice sustituto | puntaje sustituto | función de influencia |
|---|---|---|---|---|
| 1 | 0,049 (0,013) | 0,011 (0,003) | 0,010 (0,002) | 0,009 (0,003) |
| 2 | 0,087 (0,012) | 0,033 (0,003) | 0,032 (0,003) | 0,032 (0,004) |
| 4 | 0,110 (0,011) | 0,047 (0,005) | 0,050 (0,005) | 0,050 (0,005) |
| 6 | 0,117 (0,010) | 0,061 (0,006) | 0,063 (0,006) | 0,064 (0,006) |
| 12 | 0,108 (0,010) | 0,065 (0,007) | 0,071 (0,008) | 0,072 (0,008) |
| 36 | 0,064 (0,010) | 0,058 (0,009) | 0,065 (0,010) | 0,066 (0,010) |
El benchmark experimental, medido esperando los 36 trimestres, es 0,064 con error estándar de 0,012 en la tasa de empleo (y 249 dólares con error estándar de 83 en el ingreso trimestral).
Dos lecturas de la tabla. El estimador ingenuo, que suma el resultado de los primeros trimestres y lo trata como si fuera el de largo plazo, llega a 0,117 en el sexto trimestre, casi el doble del valor correcto, y los autores registran que necesita más de 25 trimestres para llegar a dos errores estándar del benchmark. Los tres estimadores basados en sustitutas quedan dentro de dos errores estándar ya con cinco trimestres de señal. En el resumen del artículo, los autores reportan una reducción del 35 por ciento en los errores estándar al usar las tasas de empleo de los seis primeros trimestres en vez de esperar.
Fíjate en que el error del ingenuo aquí es hacia arriba. En nuestra simulación, más adelante, yerra hacia abajo. La dirección del error del proxy ingenuo no se conoce a priori, y por eso corregir “a mano” con un factor aprendido de un único test anterior no funciona.
Ejemplo trabajado: montando un índice a partir del histórico
Simulamos un caso de producto para poder comparar cada estimador contra la verdad. El mundo: usuarios con calidad latente propia, tres señales de corto plazo (activó a 14 días, sesiones en la semana 2, ingreso de los primeros 14 días) y un resultado de 180 días que depende de las tres.
Paso 1: calibrar el índice en la muestra observacional. Tomamos 40.000 usuarios históricos, sin experimento alguno, para quienes tanto las señales como el resultado de 180 días ya son conocidos, y ajustamos una regresión simple del resultado sobre las señales. Es exactamente lo que hacen Athey y coautores con los tres lugares fuera de Riverside.
| coeficiente | valor ajustado | valor verdadero del mundo |
|---|---|---|
| intercepto | 11,4383 | 12 |
| activó a 14 días | 54,0811 | 55 |
| sesiones en la semana 2 | 4,5701 | 4,5 |
| ingreso de los 14 días | 2,2277 | 2,2 |
El ajuste explica el 64,57 por ciento de la variación del resultado de 180 días, que tiene una media de 103,4656 y una desviación de 67,1266. No hace falta predecir bien al usuario individual, y ese es un punto que suele confundir: el índice no necesita acertar cuánto va a gastar cada persona, necesita acertar la diferencia de medias entre dos grupos grandes.
Paso 2: correr el experimento y leer las señales. 25.000 usuarios por brazo. La primera señal ya es una métrica de decisión por sí sola:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pegando en la calculadora de arriba el control con 25.000 visitantes y 10.427 activaciones (41,7080 por ciento) contra el tratamiento con 25.000 visitantes y 11.118 activaciones (44,4720 por ciento), el resultado es una z de 6,2404, un valor p de 4,384 por 10 elevado a menos 10, una diferencia de 2,7640 puntos porcentuales, una ganancia relativa del 6,6270 por ciento y un intervalo de 1,8962 a 3,6318 puntos porcentuales.
Paso 3: aplicar el índice y comparar contra la verdad. Medimos los efectos verdaderos en las señales con una muestra de 300 mil por brazo: más 2,9183 puntos porcentuales de activación, más 0,3023 sesión y más 2,1417 de ingreso en los 14 días. Aplicando los coeficientes del mundo, el efecto verdadero de 180 días es 7,6773 de ingreso por usuario.
| estimador | disponible cuando | estimación | error estándar |
|---|---|---|---|
| ingenuo (ingreso de 14 días leído como resultado) | día 14 | 1,9546 | 0,1026 |
| índice sustituto | día 14 | 7,2558 | 0,4821 |
| esperar y medir los 180 días | día 180 | 7,9784 | 0,5988 |
| verdad | nunca observable en la práctica | 7,6773 | referencia |
El ingenuo subestima el efecto real en 3,93 veces. El índice cae a 0,9 error estándar de la verdad, y el número medido esperando medio año cae a 0,5 error estándar de la verdad por el otro lado. Además de llegar 166 días antes, el índice sale con un error estándar 19,48 por ciento menor que el de la medición directa, porque descarta el ruido del resultado largo que no tiene nada que ver con el tratamiento.
Correlación no es calibración
Aquí está el punto que separa validación de comodidad. Corrimos 12 experimentos pasados en el mismo mundo simulado, con tamaños de efecto distintos, y guardamos el resultado de 180 días de todos ellos para comparar con lo que la sustituta predecía.
| test | predicho por el índice | medido a 180 días | error estándar del medido | proxy ingenuo |
|---|---|---|---|---|
| 1 | 1,9417 | 1,9109 | 0,5984 | 0,5323 |
| 2 | 3,5386 | 3,8283 | 0,5960 | 1,0037 |
| 3 | 6,3744 | 6,0883 | 0,5990 | 1,6914 |
| 4 | 8,1408 | 9,0395 | 0,5994 | 2,3015 |
| 5 | 9,4172 | 9,9360 | 0,5996 | 2,6461 |
| 6 | 11,9146 | 11,6860 | 0,6017 | 3,2845 |
| 7 | 13,9983 | 14,2291 | 0,6013 | 3,8024 |
| 8 | 16,2117 | 15,8901 | 0,6042 | 4,3752 |
| 9 | 6,8887 | menos 5,8053 | 0,6009 | 1,9836 |
| 10 | 6,0512 | menos 0,3250 | 0,6004 | 1,6684 |
| 11 | 11,0089 | 16,5326 | 0,6018 | 3,0772 |
| 12 | 4,0623 | 14,3252 | 0,5977 | 1,1344 |
Los tests del 1 al 8 satisfacen el criterio de Prentice por construcción. Los del 9 al 12 tienen un efecto directo sobre el resultado largo que no pasa por las señales.
Mirando solo los 8 limpios, la comparación entre índice y proxy ingenuo es reveladora:
| medida | índice sustituto | proxy ingenuo |
|---|---|---|
| correlación con lo medido | 0,9963 | 0,9981 |
| coeficiente de determinación | 0,9925 | 0,9962 |
| pendiente de la recta contra lo medido | 0,9830 | 3,6430 |
| error absoluto medio | 0,3506 | 6,6214 |
El proxy ingenuo tiene una correlación ligeramente mayor que la del índice y es inútil como estimación. Sube junto con el resultado de forma casi perfecta, y cada unidad suya vale 3,64 unidades de lo que quieres medir. Un equipo que valida la sustituta por correlación aprueba ese proxy y después suma un roadmap entero en la moneda equivocada.
La correlación responde “cuando esto sube, ¿aquello sube?”. La pregunta correcta es “cuando esto sube una unidad, ¿aquello sube cuánto?”, y esa se responde por pendiente, con el valor 1 como objetivo, no por correlación.
Cuando la métrica sustituta se rompe: el efecto directo
El test 9 de la tabla es el caso que quita el sueño. El tratamiento mueve las tres señales en la dirección correcta, y al mismo tiempo tiene un efecto negativo sobre el resultado de 180 días que no pasa por ellas. Piensa en un descuento agresivo que llena la activación de corto plazo y atrae a un público que no renueva.
| lectura | valor |
|---|---|
| proxy ingenuo | más 2,0572 |
| índice sustituto | más 7,4835 |
| medido a 180 días | menos 4,4608 |
| error del índice | 11,9443 de ingreso por usuario |
Ninguno de los dos estimadores de corto plazo ve el problema. No es una cuestión de precisión ni de muestra: las señales están bien y la cuenta está bien. Lo que está mal es el mapa. Es la misma familia de error descrita en nuestra guía sobre efecto novedad, con la diferencia de que allí la señal se disuelve con el tiempo y aquí nunca llega a ser lo que el índice dice.
Incluyendo los 4 tests con efecto directo en la validación, el retrato cambia por completo:
| medida | solo los 8 limpios | los 12 |
|---|---|---|
| correlación | 0,9963 | 0,6125 |
| coeficiente de determinación | 0,9925 | 0,3751 |
| error absoluto medio | 0,3506 | 3,3109 |
| mayor error individual | menos de 0,9 | 12,6940 |
Ese gráfico es el protocolo de validación entero. No validas una sustituta mirando un experimento: la validas guardando el resultado largo de una muestra de experimentos y comprobando cuántos de ellos caen en la diagonal.
Qué compra la métrica sustituta, y qué cuesta
Vale la pena separar las dos ganancias, porque son independientes y los equipos suelen sumar una y olvidar la otra.
La ganancia de tiempo es la obvia y la mayor. En nuestro ejemplo, la decisión sale el día 14 en vez del día 180. En el caso GAIN, seis trimestres en vez de treinta y seis. Esa ganancia no es sobre un test: es sobre la cadencia del programa entero, porque el mismo tráfico pasa a financiar más rondas de aprendizaje por año.
La ganancia de precisión es menor y menos intuitiva. El índice descarta la parte del resultado largo que no tiene relación alguna con el tratamiento, y por eso sale con un error estándar menor que el de la medición directa: 0,4821 contra 0,5988 en nuestro ejemplo, una reducción del 19,48 por ciento. En el estudio GAIN la reducción reportada en el resumen es del 35 por ciento con seis trimestres de señal.
| dimensión | esperar el resultado | índice sustituto |
|---|---|---|
| cuándo sale la decisión | día 180 | día 14 |
| error estándar de la estimación | 0,5988 | 0,4821 |
| suposición extra exigida | ninguna | criterio de Prentice |
| fallo silencioso posible | no | sí, por efecto directo |
La columna que cierra la cuenta es la última. La sustituta cambia tiempo por una suposición que puede fallar sin aviso. Esperar el resultado real es lento y no miente. Por eso el diseño saludable no es elegir entre los dos: es decidir por la sustituta y seguir midiendo el resultado real en una porción de los tests, que es lo que alimenta la validación de la próxima sección.
El protocolo de validación, en siete pasos
- Elige las señales por el mecanismo, no por la correlación. Pregunta por qué camino debería el cambio afectar al resultado y mide ese camino. Una señal correlacionada que no está en el camino es adorno.
- Calibra en un histórico observacional donde señales y resultado largo coexistan. No hace falta que sea un experimento: hace falta que sea la misma población, con las mismas definiciones de métrica.
- Reserva un holdout de resultado largo para una muestra de tus experimentos, como se describe en nuestra guía de holdout de largo plazo. Sin eso no existe validación, solo esperanza.
- Valida por pendiente, no por correlación. La regresión de lo medido sobre lo predicho tiene que dar una pendiente cerca de 1 y un intercepto cerca de 0. Reporta también el error absoluto medio, que es el número que la decisión siente.
- Recalibra con periodicidad fija. El índice se ajusta sobre una foto del producto. Si cambió el público, el precio o el embudo, los coeficientes cambiaron con ellos.
- Trata una divergencia grande como bandera roja, no como ruido. Un test en el que el índice predijo más 7 y lo medido dio menos 4 es un hallazgo sobre el producto, y probablemente apunta a un efecto directo que tu mapa no tenía.
- Nunca uses la sustituta para una decisión irreversible de alto riesgo sin al menos un test confirmatorio con resultado real. La sustituta acelera decisiones reversibles.
Errores comunes
- Validar por correlación. Ya dicho, y vale repetirlo porque es el error dominante: nuestros números muestran un proxy con correlación de 0,9981 y error de escala de 3,64 veces.
- Sumar efectos de sustituta como si fueran ingresos. La suma anual de ganancias predichas por un índice no calibrado es el generador de metas imposibles más confiable que conocemos. Es el mismo mecanismo de exageración descrito en maldición del ganador, con otro origen.
- Asumir que el error del proxy tiene dirección fija. En el caso GAIN el ingenuo exageró; en nuestra simulación subestimó por 3,93 veces. No existe un factor de corrección universal.
- Confundir métrica primaria con sustituta. La métrica primaria es la que decide el test. La sustituta es un intento de predecir otra métrica que no lograste medir. Pueden coincidir, y cuando coinciden la exigencia de validación es la misma.
- Creer que el índice necesita predecir al usuario individual. Necesita predecir la diferencia de medias entre dos grupos grandes, que es una exigencia bastante menor. Nuestro índice explicó el 64,57 por ciento de la variación individual y aun así acertó el efecto dentro del error estándar.
- Usar una sustituta para una métrica de guardrail. El guardrail existe para detectar daño, y el daño suele venir justamente por el camino directo que la sustituta no ve.
Hazlo automático en Donnu
Todo el protocolo de arriba depende de una condición de datos: las señales de corto plazo y el resultado largo del mismo usuario tienen que seguir enlazados meses después. Ahí es donde falla la mayoría de los montajes, porque el experimento se archiva cuando termina y el ingreso de los seis meses siguientes vive en otro sistema, sin clave en común.
Donnu mantiene la asignación del usuario ligada a los eventos después del final del experimento, que es exactamente la condición para reabrir un test antiguo y preguntar cuánto valió de verdad. Si tu montaje actual no lo permite, el paso inmediato y barato es congelar hoy la lista de usuarios sorteados de tus últimos experimentos, para poder medir el resultado largo dentro de unos meses, y mientras tanto tratar todo número de corto plazo como dirección, no como valor. Para comprobar si tu señal de corto plazo tiene muestra suficiente para ser leída, la calculadora de significancia responde en un minuto.
Referencias
- Athey, S., Chetty, R., Imbens, G. W. y Kang, H. The Surrogate Index: Combining Short-Term Proxies to Estimate Long-Term Treatment Effects More Rapidly and Precisely. arXiv 1603.09326, versión de agosto de 2024. Fuente de la adopción del criterio de Prentice como suposición de sustitución, formulada como independencia entre tratamiento y resultado condicionada a las señales y a las covariables; de la definición del índice sustituto como la esperanza condicional del resultado dadas las señales; del registro de que, con el resultado largo no observado en la muestra experimental, la suposición no tiene implicaciones contrastables; de la crítica de Freedman, Graubard y Schatzkin (1992) de que la sustituta puede no mediar el efecto entero, con el ejemplo del tamaño del aula y las habilidades no cognitivas; de la cita del relevamiento de Gupta y colegas (2019) sobre experimentos de dos semanas frente al interés en efectos de largo plazo; del diseño empírico con Riverside como muestra experimental y Alameda, Los Ángeles y San Diego como muestra observacional de 13.725 personas; del benchmark experimental de 0,064 con error estándar 0,012 en empleo y 249 dólares con error estándar 83 en ingreso, ambos en promedio sobre 36 trimestres; de la tabla completa de estimaciones por número de trimestres usados, incluyendo el ingenuo en 0,049, 0,087, 0,110, 0,117, 0,108 y 0,064 y el índice en 0,011, 0,033, 0,047, 0,061, 0,065 y 0,058; del registro de que el ingenuo necesita más de 25 trimestres para quedar a dos errores estándar del benchmark mientras los tres estimadores basados en sustitutas llegan allí con cinco trimestres; y de la reducción del 35 por ciento en los errores estándar reportada en el resumen. arxiv.org.
- Hohnhold, H., O’Brien, D. y Tang, D. Focusing on the Long-term: It’s Good for Users and Business. KDD 2015, Google. Fuente del encuadre de que el efecto de corto plazo, observado durante el experimento, no siempre predice el efecto de largo plazo después del lanzamiento y del cambio de comportamiento de los usuarios, y del uso de métricas medibles en el corto plazo para predecir el largo plazo. research.google.
- Deng, A. y Shi, X. Data-Driven Metric Development for Online Controlled Experiments: Seven Lessons Learned. KDD 2016. Fuente de las dos cualidades obligatorias de una métrica, direccionalidad y sensibilidad, que son la base de la exigencia de calibración de este artículo. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fuente de la exigencia de que el criterio de decisión sea medible en unas dos semanas mientras predice objetivos de largo plazo, que es la definición operativa del problema que la métrica sustituta intenta resolver. exp-platform.com.
Lee también: Holdout de largo plazo · Métrica primaria y OEC · Efecto novedad · Maldición del ganador · Métricas de activación en SaaS · Calculadora de significancia · Leia em português
Preguntas frecuentes
- ¿Qué es una métrica sustituta en un test A/B?
- Es una métrica de corto plazo usada en lugar del resultado que de verdad importa, cuando ese resultado tarda demasiado en aparecer. Activación a 14 días en lugar de ingresos a 180 días, por ejemplo. La sustituta no es solo un indicador correlacionado: necesita cargar el efecto entero del tratamiento, condición que Prentice formalizó en 1989 y que Athey, Chetty, Imbens y Kang llaman suposición de sustitución.
- ¿Cuál es la diferencia entre un proxy ingenuo y un índice sustituto?
- El proxy ingenuo lee el efecto medido en el corto plazo como si fuera el efecto de largo plazo. El índice sustituto combina varias señales de corto plazo en una predicción del resultado largo, calibrada con datos históricos donde ambos fueron observados. En el ejemplo de esta guía, el proxy ingenuo subestimó el efecto real en 3,93 veces, mientras que el índice acertó dentro de su propio error estándar.
- ¿Por qué una correlación alta no basta para validar una métrica sustituta?
- Porque la correlación no garantiza la escala. En los 8 tests limpios de esta guía, el proxy ingenuo tuvo una correlación de 0,9981 con el resultado largo, ligeramente mayor que la del índice, y aun así la recta que une uno con otro tenía una pendiente de 3,6430, es decir, el número leído debía multiplicarse por casi cuatro. El error absoluto medio del proxy fue de 6,6214 contra 0,3506 del índice. La correlación dice que suben juntos; la calibración dice cuánto.
- ¿Cómo puede una métrica sustituta dar la señal equivocada?
- Cuando el tratamiento afecta al resultado por un camino que no pasa por las señales medidas, lo que viola el criterio de Prentice. En la simulación de esta guía, un tratamiento con efecto directo negativo produjo un índice de más 7,4835 mientras que el resultado real medido fue de menos 4,4608, un error de casi 12 unidades de ingreso por usuario y un cambio de signo completo.
- ¿Se puede comprobar si la suposición de sustitución se cumple?
- No con los datos del experimento solos. Athey y coautores registran que, cuando el resultado largo no se observa en la muestra experimental, la suposición de sustitución no tiene implicaciones contrastables. Lo que sí se puede hacer es validarla empíricamente: guardar el resultado largo de una muestra de experimentos pasados y comprobar si la predicción del índice coincide con lo medido, en nivel y no solo en dirección.
- ¿Cuánto tiempo ahorra de verdad una métrica sustituta?
- En el estudio de Athey y coautores sobre el programa GAIN, seis trimestres de datos de corto plazo bastaron para reproducir el efecto de nueve años: el índice devolvió 0,061 con error estándar de 0,006 frente al benchmark experimental de 0,064 con error estándar de 0,012. El estimador ingenuo, que lee el resultado acumulado en los primeros trimestres, necesitaba más de 25 trimestres para llegar a dos errores estándar del benchmark.