Estadística

Holdout de Largo Plazo: el efecto que sobrevive

El efecto de dos semanas no es el efecto final. Cómo el holdout de largo plazo mide lo que queda después de que el usuario aprende y cuánto tráfico cuesta.

Ilustración plana de dos curvas suaves atravesando una franja ancha, una que sube y después decae hacia la otra, con un pequeño bloque reservado destacado en el extremo derecho

Un holdout de largo plazo es una porción de usuarios deliberadamente mantenida fuera de un cambio ya lanzado, para que meses después todavía exista con quién comparar. Existe porque el número que sale de un test de dos semanas mide el efecto sobre un usuario que todavía no se adaptó al cambio, y esa adaptación puede consumir la mitad de la ganancia sin que nada en el informe original lo avise. Esta guía cubre por qué dejar el test corriendo más tiempo no resuelve el problema, un ejemplo trabajado en el que una ganancia de más 5,007 por ciento se convierte en más 2,222 por ciento seis meses después, el diseño de posperiodo que Google publicó para medir aprendizaje, el modelo exponencial que dice cuánto tiempo tiene que durar el estudio, y la cuenta de cuánto tráfico de más cuesta un holdout del 5 por ciento. Forma parte de nuestra guía completa de test A/B y es el complemento natural de efecto novedad en tests A/B.

El efecto de dos semanas mide otra cosa

Hohnhold, O’Brien y Tang, en un artículo de KDD 2015 sobre foco en el largo plazo, separan las dos magnitudes con precisión. El efecto de corto plazo es el impacto observado durante el experimento. El efecto de largo plazo es el impacto final, una vez que el producto se lanzó por completo y los usuarios cambiaron el comportamiento en respuesta a él.

Su afirmación central es directa: en experimentación online es sencillo medir el efecto de corto plazo, pero el efecto de corto plazo no siempre es predictivo del de largo plazo. El desafío, dicen, es determinar el impacto de largo plazo sobre el usuario sin dejar de tomar decisiones a tiempo.

El caso concreto que estudian es la ceguera y la videncia a los anuncios, el fenómeno de que los usuarios cambian su propia propensión inherente a hacer clic o interactuar con anuncios. Es un ejemplo de mecanismo, no una regla sobre tu producto: lo que importa aquí es que existe una clase entera de efectos que solo aparecen después de que la persona convivió con el cambio durante semanas.

La salida obvia no funciona. Podría parecer que basta con dejar el test corriendo tres meses y leer la diferencia al final. Los autores describen exactamente ese diseño ingenuo y explican por qué no entrega mediciones confiables de aprendizaje: el efecto de largo plazo medido al final del periodo puede cambiar por muchas razones no relacionadas con el aprendizaje del usuario, como efectos del sistema, estacionalidad e interacciones con lanzamientos posteriores. Separar esos efectos para medir aprendizaje dentro de un mismo grupo a lo largo del tiempo es, según su experiencia, muy difícil si no imposible.

Ejemplo trabajado: el efecto que encogió

Una suscripción ejecuta un test de dos semanas en la pantalla de planes, con 150.000 usuarios por brazo.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Test original, 2 semanas Usuarios Conversiones Tasa
Control 150.000 6.750 4,500 por ciento
Tratamiento 150.000 7.088 4,725 por ciento

En pantalla, la calculadora muestra tasas de 4,50 y 4,73 por ciento, lift de más 5,0 por ciento, valor p de 0,0033, intervalo de más 0,1 a más 0,4 punto porcentual y B como ganadora. En precisión completa, e incluyendo el puntaje z, que la interfaz no muestra: más 0,225 punto porcentual, más 5,007 por ciento relativo, z = 2,942, valor p de 0,0033, intervalo del 95 por ciento de más 0,075 a más 0,375 punto porcentual. Pasó, subió al 100 por ciento, se convirtió en una línea del informe trimestral.

Solo que el equipo reservó el 5 por ciento de los usuarios fuera del lanzamiento. Seis meses después, la comparación entre el holdout y el resto de la base:

Holdout, 6 meses después Usuarios Conversiones Tasa
Holdout, sin el cambio 200.000 9.000 4,500 por ciento
Base expuesta 3.800.000 174.800 4,600 por ciento

La calculadora muestra tasas de 4,50 y 4,60 por ciento, lift de más 2,2 por ciento, valor p de 0,0374 e intervalo de más 0,0 a más 0,2 punto porcentual. En precisión completa: más 0,100 punto porcentual, más 2,222 por ciento relativo, z = 2,082, valor p de 0,0374, intervalo de más 0,007 a más 0,193 punto porcentual.

El efecto sigue existiendo y sigue siendo positivo. Pero ahora vale el 44,4 por ciento de lo que valía en la lectura de dos semanas. Si el plan financiero se construyó sobre el 5,007 por ciento, está sobrestimando la ganancia en más del doble.

Fíjate también en el intervalo de confianza de la segunda lectura: casi toca el cero, a pesar de los 4 millones de usuarios involucrados. Es la firma de la asignación desbalanceada, y la próxima sección le pone precio.

El diseño: posperiodo, holdout y experimento inverso

Existen tres diseños que se llaman comúnmente “medir el largo plazo”, y no son intercambiables.

Tres diseños para medir el efecto de largo plazoTres líneas de tiempo apiladas. En la primera, el diseño ingenuo: dos grupos reciben tratamientos diferentes de principio a fin y la diferencia se lee al final. En la segunda, el método de posperiodo: un preperiodo en el que los dos grupos reciben lo mismo, después el periodo de tratamiento, después un posperiodo en el que los dos vuelven a recibir lo mismo y se mide la diferencia remanente. En la tercera, el holdout: el cambio sube para casi toda la base y una porción pequeña se mantiene fuera indefinidamente, con la comparación ocurriendo meses después.Tres líneas de tiempo, tres preguntas diferentesingenuo: dejarlo corriendolecturaposperiodo (PP)pre A/Atratamientopos A/Aholdout de largo plazopre A/Alanzado para casi todos, la porción reservada sigue fuerarecibe el cambiono recibe el cambioLa línea de lectura marca dónde se mide la diferencia de interés.En el posperiodo los dos grupos reciben LO MISMO: cualquier diferencia que sobre es comportamiento aprendido.
El posperiodo aísla el aprendizaje; el holdout mide el efecto total que sobrevivió. Son preguntas diferentes, y responder una con el diseño de la otra es el error más común aquí.

Posperiodo. La percepción central de los autores es que, para medir aprendizaje, hace falta comparar los dos grupos mientras reciben el mismo tratamiento. Para eso colocan el periodo de tratamiento entre dos periodos de test A/A: un preperiodo, en el que se garantiza que no existen diferencias estadísticamente significativas entre los grupos al comienzo del estudio, y un posperiodo, en el que se mide cualquier diferencia de comportamiento causada por el aprendizaje. Observan que, para cuantificar aprendizaje, el comportamiento del grupo de tratamiento mientras recibe el tratamiento no interesa: solo importa la medición en el posperiodo. Según el artículo, los posperiodos demostraron dar mediciones confiables y reproducibles de aprendizaje del usuario en Google.

Holdout. La porción reservada sigue fuera del cambio indefinidamente, y la comparación se hace cuando quieras. Kohavi informa que en Bing el 90 por ciento de los usuarios elegibles está en experimentos y el 10 por ciento forma un holdout global, que se cambia una vez al año.

Experimento inverso. Kohavi describe también la práctica de atribuir crédito ejecutando un experimento inverso, es decir, subiendo el cambio y probando en reverso. Es el mismo diseño estadístico del holdout, con la diferencia de que la porción se retira después del lanzamiento, no antes.

Hay dos trampas del posperiodo que los propios autores registran, y vale la pena llevarlas encima:

Cuánto tiene que durar el estudio

Esta es la parte en la que el artículo de Google se convierte en herramienta práctica. Modelan el aprendizaje como un proceso exponencial y estiman la tasa de aprendizaje en aproximadamente 0,012 por día. Con eso, la fracción del aprendizaje capturada por un estudio de duración t vale 1 menos la exponencial de menos 0,012 por t.

Aplicando su modelo:

Duración del estudio Fracción del aprendizaje de larguísimo plazo capturada
7 días 8,1 por ciento
14 días 15,5 por ciento
30 días 30,2 por ciento
60 días 51,3 por ciento
90 días cerca del 65 por ciento (valor informado en el artículo)
180 días 88,5 por ciento

Los autores informan que, con base en esa tasa, pasaron a ejecutar típicamente experimentos largos de escritorio durante 90 días, lo que da un equilibrio razonable entre tiempo de estudio y aprendizaje capturado. Y van más allá en la honestidad de la medición: aplicando el mismo modelo al sesgo de desaprendizaje, si la medición se toma en las dos primeras semanas del posperiodo, el desaprendizaje reduce el efecto observado al 92 por ciento. Combinando los dos factores, el número medido en un estudio estándar es aproximadamente el 60 por ciento del efecto que se observaría en un estudio muy largo.

Fracción del aprendizaje capturada según la duración del estudioCurva creciente y desacelerante que parte de cero y se acerca al cien por ciento. Los marcadores indican 8,1 por ciento a los siete días, 15,5 por ciento a los catorce, 30,2 por ciento a los treinta, 51,3 por ciento a los sesenta y cerca del sesenta y cinco por ciento a los noventa días. Una franja sombreada cubre la región de las dos primeras semanas, mostrando cuánto deja fuera un test corto.Un test de dos semanas ve cerca de un sexto del aprendizaje8,1% a los 7 días15,5% a los 14 días30,2% a los 30 días51,3% a los 60 díascerca del 65% a los 90 díasduración del estudio, en díasCurva del modelo exponencial con tasa de aprendizaje de 0,012 por día publicada por Hohnhold, O’Brien y Tang.
La curva es desacelerante: los primeros días entregan poco y los últimos entregan todavía menos. Por eso 90 días se convierte en un punto de equilibrio defendible, y no en un número mágico.

Los autores llevan esa cuenta hasta la consecuencia de negocio. Definen un factor de corrección que convierte la medición del estudio en el efecto realmente realizado en un lanzamiento, y observan que, como los métodos presentados subestiman el aprendizaje, ese factor es mayor o igual a 1. Del modelo exponencial sale que un estudio de 90 días mide cerca del 65 por ciento del efecto de largo plazo solo por la duración limitada, lo que ya implica un factor de al menos 1,54 para escritorio. En la práctica, dicen, usan valores entre 2 y 3 para escritorio y portátil, para compensar también la inconsistencia de tratamiento, y registran que ese rango es apenas una estimación aproximada.

El precio en tráfico de un holdout pequeño

Un holdout del 5 por ciento parece barato porque solo el 5 por ciento de los usuarios deja de recibir la mejora. Estadísticamente, es el diseño más caro que existe.

La razón es que la asignación desbalanceada desperdicia potencia. Para una razón de asignación k entre el brazo grande y el pequeño, el factor de inflación de tráfico total, comparado con un test 50 contra 50 de la misma potencia, vale el cuadrado de 1 más k, dividido por 4 veces k.

Partiendo del caso de referencia de 31.234 usuarios por variación, que es lo que devuelve el motor para una base del 5 por ciento y un efecto mínimo detectable del 10 por ciento relativo:

Asignación Factor de inflación Brazo menor Tráfico total necesario
50 / 50 1,00 31.234 62.468
80 / 20 1,56 19.522 97.607
90 / 10 2,78 17.353 173.523
95 / 5 5,26 16.439 328.779
99 / 1 25,25 15.775 1.577.475

De ahí salen dos lecturas, y la segunda es la menos obvia:

  1. El total explota. Un holdout del 5 por ciento necesita 5,26 veces más tráfico total que el test balanceado equivalente. Con 200.000 usuarios por semana, el balanceado tarda 3 días y el 95 contra 5 tarda 12.
  2. El brazo reservado es pequeño, y eso es el problema. Fíjate en que el brazo menor del diseño 95 contra 5 tiene 16.439 usuarios, casi la mitad de los 31.234 del balanceado. No es la parte cara. La parte cara es que todo el resto tiene que crecer para compensar la escasez de ese brazo, porque la precisión de una diferencia está limitada por el lado con menos gente.

Como el holdout suele ejecutarse durante meses, el tiempo generalmente resuelve el problema de volumen por sí solo. Lo que no resuelve es la expectativa: un holdout del 1 por ciento en un producto de tráfico medio simplemente nunca va a alcanzar potencia para detectar un efecto realista, por mucho tiempo que esté en el aire. Vale la pena calcularlo antes, con la calculadora de potencia estadística y la calculadora de duración.

Dos escuelas legítimas

No existe una respuesta única sobre cuánto invertir en medición de largo plazo, y vale la pena registrarlo sin inclinarse hacia ningún lado.

Kohavi plantea la tensión de forma explícita al listar los desafíos abiertos del área: existen impactos de largo plazo que no se están viendo en experimentos de 1 a 2 semanas, y Google y Bing actúan de forma diferente en ese punto, con Google ejecutando experimentos largos, por ejemplo de 90 días, y Bing enfocándose en agilidad con experimentos de 1 a 2 semanas e iteraciones.

Las dos elecciones son defendibles y resuelven problemas diferentes:

Postura Gana Pierde
Experimentos largos Mide el efecto que sobrevive; evita sobrestimar la ganancia en el plan financiero Ritmo. Cada decisión tarda meses
Ciclos cortos con iteración Volumen de aprendizaje por trimestre; los errores se corrigen rápido Queda expuesto a efectos que solo aparecen después
Ciclos cortos con holdout global Ritmo en el día a día, más una medición periódica de lo acumulado Cuesta una porción permanente de la base y disciplina para no tocarla

La tercera línea es el término medio que el holdout global hace posible, y es el diseño que describe el relato de Bing: decidir rápido en el día a día y tener, una vez al año, una lectura de lo que el conjunto de lanzamientos entregó realmente.

Checklist del holdout

  1. ¿La porción se reservó antes del lanzamiento? Reservarla después es un experimento inverso, y no mide el mismo periodo.
  2. ¿El tamaño de la porción se calculó, en vez de elegirse por costumbre? El cinco por ciento es convención, no resultado de una cuenta.
  3. ¿Existe un preperiodo limpio? Sin diferencia estadísticamente significativa entre los grupos antes de empezar, que es un test A/A con otro nombre.
  4. ¿La métrica primaria es la misma del test original? Cambiar de métrica a mitad de camino transforma la comparación en narrativa, ver eligiendo la métrica primaria.
  5. ¿Hay alguien encargado de no tocar la porción? Un holdout que recibe “solo un lanzamiento pequeño” deja de ser holdout.
  6. ¿La unidad de sorteo del holdout es la misma del test? Ver unidad de sorteo en test A/B.
  7. ¿La lectura de largo plazo va a sustituir el número del plan, o solo a convivir con él? Si nadie corrige la proyección, medir no cambia nada.

Errores comunes

Hazlo automático con Donnu

Lo que hace fallar al holdout casi nunca es la estadística. Es olvidar que existe: seis meses después, nadie recuerda que esa porción está reservada, alguien sube un lanzamiento en ella, y la medición desaparece sin que nadie se dé cuenta.

En Donnu, la porción reservada es una propiedad del experimento y no una configuración paralela: sigue declarada después del lanzamiento, y cualquier intento de exponer esa porción a un cambio nuevo aparece como conflicto en vez de ocurrir en silencio. La lectura de largo plazo usa la misma matemática y la misma unidad de la lectura original, lado a lado, para que la caída del efecto sea visible en vez de tener que reconstruirse a mano. Para rehacer las cuentas por fuera, la calculadora de valor p y la calculadora de tamaño de muestra aceptan los recuentos brutos de los dos brazos, incluso desbalanceados.

Referencias

Lee también: Efecto novedad en tests A/B · Unidad de sorteo en test A/B · Test A/A: validar el montaje · Maldición del ganador · Métricas de guardrail · Calculadora de potencia estadística · Leia em português

Preguntas frecuentes

¿Qué es un holdout de largo plazo?
Es un grupo de usuarios mantenido fuera del cambio después de que ya se lanzó para todo el mundo, justamente para permitir la comparación meses después. Kohavi informa que en la plataforma de Bing el 90 por ciento de los usuarios elegibles está en experimentos y el 10 por ciento forma un holdout global, que se cambia una vez al año. El holdout responde una pregunta que el test original no responde: cuánto de la ganancia medida en la primera semana todavía existe después de que el comportamiento del usuario se ajustó.
¿Por qué el efecto de corto plazo no predice el de largo plazo?
Porque el usuario aprende. Hohnhold, O Brien y Tang describen el efecto de corto plazo como el impacto observado durante el experimento y el de largo plazo como el impacto final, una vez que el producto ya se lanzó por completo y los usuarios cambiaron el comportamiento en respuesta. Son directos al decir que el efecto de corto plazo no siempre es predictivo del de largo plazo, y que el desafío es determinar el impacto de largo plazo sin dejar de decidir a tiempo.
¿No basta con dejar el test corriendo tres meses?
No, y los autores explican por qué. En ese diseño ingenuo, el efecto medido al final del periodo puede cambiar por muchos motivos que no tienen nada que ver con el aprendizaje del usuario: efectos del sistema, estacionalidad, interacciones con lanzamientos posteriores. Separar esas causas para medir aprendizaje dentro de un mismo grupo a lo largo del tiempo es, según su experiencia, muy difícil si no imposible. Por eso desarrollaron el método de posperiodo.
¿Qué es el método de posperiodo?
Es colocar el periodo de tratamiento entre dos periodos de test A/A. Primero un preperiodo, para garantizar que no existen diferencias estadísticamente significativas entre los grupos al inicio del estudio. Después el tratamiento. Después un posperiodo, en el que los dos grupos vuelven a recibir la misma experiencia. La idea central, según los autores, es que para medir aprendizaje hace falta comparar los dos grupos mientras reciben el mismo tratamiento, porque ahí cualquier diferencia remanente solo puede venir de un cambio de comportamiento.
¿Cuánto tráfico cuesta un holdout del 5 por ciento?
Mucho más de lo que sugiere la intuición, porque la asignación desbalanceada es ineficiente. Para la misma potencia de un test 50 contra 50 que exigiría 62.468 usuarios en total, un diseño 95 contra 5 necesita 328.779, es decir, 5,26 veces más. El brazo pequeño en sí sigue siendo pequeño, con 16.439 usuarios, y justamente por eso el resto tiene que crecer tanto. El factor de inflación es el cuadrado de 1 más la razón de asignación, dividido por 4 veces esa razón.
¿Cuál es la diferencia entre holdout y experimento inverso?
El holdout separa una porción antes del lanzamiento y la mantiene fuera de él. El experimento inverso, o holdback, funciona al revés: el cambio ya está en el aire para todo el mundo y lo apagas para una porción, probando al revés. Kohavi describe ese diseño de atribuir crédito ejecutando un experimento inverso, es decir, subiendo el cambio y probando en reverso. El resultado estadístico es comparable; lo que cambia es el momento en que se tomó la decisión de reservar la porción.