Holdout de Largo Plazo: el efecto que sobrevive
El efecto de dos semanas no es el efecto final. Cómo el holdout de largo plazo mide lo que queda después de que el usuario aprende y cuánto tráfico cuesta.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Un holdout de largo plazo es una porción de usuarios deliberadamente mantenida fuera de un cambio ya lanzado, para que meses después todavía exista con quién comparar. Existe porque el número que sale de un test de dos semanas mide el efecto sobre un usuario que todavía no se adaptó al cambio, y esa adaptación puede consumir la mitad de la ganancia sin que nada en el informe original lo avise. Esta guía cubre por qué dejar el test corriendo más tiempo no resuelve el problema, un ejemplo trabajado en el que una ganancia de más 5,007 por ciento se convierte en más 2,222 por ciento seis meses después, el diseño de posperiodo que Google publicó para medir aprendizaje, el modelo exponencial que dice cuánto tiempo tiene que durar el estudio, y la cuenta de cuánto tráfico de más cuesta un holdout del 5 por ciento. Forma parte de nuestra guía completa de test A/B y es el complemento natural de efecto novedad en tests A/B.
El efecto de dos semanas mide otra cosa
Hohnhold, O’Brien y Tang, en un artículo de KDD 2015 sobre foco en el largo plazo, separan las dos magnitudes con precisión. El efecto de corto plazo es el impacto observado durante el experimento. El efecto de largo plazo es el impacto final, una vez que el producto se lanzó por completo y los usuarios cambiaron el comportamiento en respuesta a él.
Su afirmación central es directa: en experimentación online es sencillo medir el efecto de corto plazo, pero el efecto de corto plazo no siempre es predictivo del de largo plazo. El desafío, dicen, es determinar el impacto de largo plazo sobre el usuario sin dejar de tomar decisiones a tiempo.
El caso concreto que estudian es la ceguera y la videncia a los anuncios, el fenómeno de que los usuarios cambian su propia propensión inherente a hacer clic o interactuar con anuncios. Es un ejemplo de mecanismo, no una regla sobre tu producto: lo que importa aquí es que existe una clase entera de efectos que solo aparecen después de que la persona convivió con el cambio durante semanas.
La salida obvia no funciona. Podría parecer que basta con dejar el test corriendo tres meses y leer la diferencia al final. Los autores describen exactamente ese diseño ingenuo y explican por qué no entrega mediciones confiables de aprendizaje: el efecto de largo plazo medido al final del periodo puede cambiar por muchas razones no relacionadas con el aprendizaje del usuario, como efectos del sistema, estacionalidad e interacciones con lanzamientos posteriores. Separar esos efectos para medir aprendizaje dentro de un mismo grupo a lo largo del tiempo es, según su experiencia, muy difícil si no imposible.
Ejemplo trabajado: el efecto que encogió
Una suscripción ejecuta un test de dos semanas en la pantalla de planes, con 150.000 usuarios por brazo.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
| Test original, 2 semanas | Usuarios | Conversiones | Tasa |
|---|---|---|---|
| Control | 150.000 | 6.750 | 4,500 por ciento |
| Tratamiento | 150.000 | 7.088 | 4,725 por ciento |
En pantalla, la calculadora muestra tasas de 4,50 y 4,73 por ciento, lift de más 5,0 por ciento, valor p de 0,0033, intervalo de más 0,1 a más 0,4 punto porcentual y B como ganadora. En precisión completa, e incluyendo el puntaje z, que la interfaz no muestra: más 0,225 punto porcentual, más 5,007 por ciento relativo, z = 2,942, valor p de 0,0033, intervalo del 95 por ciento de más 0,075 a más 0,375 punto porcentual. Pasó, subió al 100 por ciento, se convirtió en una línea del informe trimestral.
Solo que el equipo reservó el 5 por ciento de los usuarios fuera del lanzamiento. Seis meses después, la comparación entre el holdout y el resto de la base:
| Holdout, 6 meses después | Usuarios | Conversiones | Tasa |
|---|---|---|---|
| Holdout, sin el cambio | 200.000 | 9.000 | 4,500 por ciento |
| Base expuesta | 3.800.000 | 174.800 | 4,600 por ciento |
La calculadora muestra tasas de 4,50 y 4,60 por ciento, lift de más 2,2 por ciento, valor p de 0,0374 e intervalo de más 0,0 a más 0,2 punto porcentual. En precisión completa: más 0,100 punto porcentual, más 2,222 por ciento relativo, z = 2,082, valor p de 0,0374, intervalo de más 0,007 a más 0,193 punto porcentual.
El efecto sigue existiendo y sigue siendo positivo. Pero ahora vale el 44,4 por ciento de lo que valía en la lectura de dos semanas. Si el plan financiero se construyó sobre el 5,007 por ciento, está sobrestimando la ganancia en más del doble.
Fíjate también en el intervalo de confianza de la segunda lectura: casi toca el cero, a pesar de los 4 millones de usuarios involucrados. Es la firma de la asignación desbalanceada, y la próxima sección le pone precio.
El diseño: posperiodo, holdout y experimento inverso
Existen tres diseños que se llaman comúnmente “medir el largo plazo”, y no son intercambiables.
Posperiodo. La percepción central de los autores es que, para medir aprendizaje, hace falta comparar los dos grupos mientras reciben el mismo tratamiento. Para eso colocan el periodo de tratamiento entre dos periodos de test A/A: un preperiodo, en el que se garantiza que no existen diferencias estadísticamente significativas entre los grupos al comienzo del estudio, y un posperiodo, en el que se mide cualquier diferencia de comportamiento causada por el aprendizaje. Observan que, para cuantificar aprendizaje, el comportamiento del grupo de tratamiento mientras recibe el tratamiento no interesa: solo importa la medición en el posperiodo. Según el artículo, los posperiodos demostraron dar mediciones confiables y reproducibles de aprendizaje del usuario en Google.
Holdout. La porción reservada sigue fuera del cambio indefinidamente, y la comparación se hace cuando quieras. Kohavi informa que en Bing el 90 por ciento de los usuarios elegibles está en experimentos y el 10 por ciento forma un holdout global, que se cambia una vez al año.
Experimento inverso. Kohavi describe también la práctica de atribuir crédito ejecutando un experimento inverso, es decir, subiendo el cambio y probando en reverso. Es el mismo diseño estadístico del holdout, con la diferencia de que la porción se retira después del lanzamiento, no antes.
Hay dos trampas del posperiodo que los propios autores registran, y vale la pena llevarlas encima:
- Desaprendizaje. Como los dos grupos reciben el mismo tratamiento en el posperiodo, su comportamiento se va pareciendo más con el tiempo. Idealmente la medición se haría en un intervalo corto justo al comienzo del posperiodo; medir durante más tiempo aumenta la potencia estadística al precio de sesgo por desaprendizaje.
- Ambiente de medición. El tratamiento vigente durante el posperiodo puede afectar la magnitud o la naturaleza del aprendizaje observado. Los autores dan el ejemplo de una función nueva de interfaz con la que los usuarios aprenden a interactuar más a lo largo del tiempo: eso no es observable en un posperiodo en el que la función está ausente. Recomiendan además confirmar que las métricas que no deberían verse afectadas por un cambio de comportamiento sean consistentes entre los grupos, como comprobación de validez.
Cuánto tiene que durar el estudio
Esta es la parte en la que el artículo de Google se convierte en herramienta práctica. Modelan el aprendizaje como un proceso exponencial y estiman la tasa de aprendizaje en aproximadamente 0,012 por día. Con eso, la fracción del aprendizaje capturada por un estudio de duración t vale 1 menos la exponencial de menos 0,012 por t.
Aplicando su modelo:
| Duración del estudio | Fracción del aprendizaje de larguísimo plazo capturada |
|---|---|
| 7 días | 8,1 por ciento |
| 14 días | 15,5 por ciento |
| 30 días | 30,2 por ciento |
| 60 días | 51,3 por ciento |
| 90 días | cerca del 65 por ciento (valor informado en el artículo) |
| 180 días | 88,5 por ciento |
Los autores informan que, con base en esa tasa, pasaron a ejecutar típicamente experimentos largos de escritorio durante 90 días, lo que da un equilibrio razonable entre tiempo de estudio y aprendizaje capturado. Y van más allá en la honestidad de la medición: aplicando el mismo modelo al sesgo de desaprendizaje, si la medición se toma en las dos primeras semanas del posperiodo, el desaprendizaje reduce el efecto observado al 92 por ciento. Combinando los dos factores, el número medido en un estudio estándar es aproximadamente el 60 por ciento del efecto que se observaría en un estudio muy largo.
Los autores llevan esa cuenta hasta la consecuencia de negocio. Definen un factor de corrección que convierte la medición del estudio en el efecto realmente realizado en un lanzamiento, y observan que, como los métodos presentados subestiman el aprendizaje, ese factor es mayor o igual a 1. Del modelo exponencial sale que un estudio de 90 días mide cerca del 65 por ciento del efecto de largo plazo solo por la duración limitada, lo que ya implica un factor de al menos 1,54 para escritorio. En la práctica, dicen, usan valores entre 2 y 3 para escritorio y portátil, para compensar también la inconsistencia de tratamiento, y registran que ese rango es apenas una estimación aproximada.
El precio en tráfico de un holdout pequeño
Un holdout del 5 por ciento parece barato porque solo el 5 por ciento de los usuarios deja de recibir la mejora. Estadísticamente, es el diseño más caro que existe.
La razón es que la asignación desbalanceada desperdicia potencia. Para una razón de asignación k entre el brazo grande y el pequeño, el factor de inflación de tráfico total, comparado con un test 50 contra 50 de la misma potencia, vale el cuadrado de 1 más k, dividido por 4 veces k.
Partiendo del caso de referencia de 31.234 usuarios por variación, que es lo que devuelve el motor para una base del 5 por ciento y un efecto mínimo detectable del 10 por ciento relativo:
| Asignación | Factor de inflación | Brazo menor | Tráfico total necesario |
|---|---|---|---|
| 50 / 50 | 1,00 | 31.234 | 62.468 |
| 80 / 20 | 1,56 | 19.522 | 97.607 |
| 90 / 10 | 2,78 | 17.353 | 173.523 |
| 95 / 5 | 5,26 | 16.439 | 328.779 |
| 99 / 1 | 25,25 | 15.775 | 1.577.475 |
De ahí salen dos lecturas, y la segunda es la menos obvia:
- El total explota. Un holdout del 5 por ciento necesita 5,26 veces más tráfico total que el test balanceado equivalente. Con 200.000 usuarios por semana, el balanceado tarda 3 días y el 95 contra 5 tarda 12.
- El brazo reservado es pequeño, y eso es el problema. Fíjate en que el brazo menor del diseño 95 contra 5 tiene 16.439 usuarios, casi la mitad de los 31.234 del balanceado. No es la parte cara. La parte cara es que todo el resto tiene que crecer para compensar la escasez de ese brazo, porque la precisión de una diferencia está limitada por el lado con menos gente.
Como el holdout suele ejecutarse durante meses, el tiempo generalmente resuelve el problema de volumen por sí solo. Lo que no resuelve es la expectativa: un holdout del 1 por ciento en un producto de tráfico medio simplemente nunca va a alcanzar potencia para detectar un efecto realista, por mucho tiempo que esté en el aire. Vale la pena calcularlo antes, con la calculadora de potencia estadística y la calculadora de duración.
Dos escuelas legítimas
No existe una respuesta única sobre cuánto invertir en medición de largo plazo, y vale la pena registrarlo sin inclinarse hacia ningún lado.
Kohavi plantea la tensión de forma explícita al listar los desafíos abiertos del área: existen impactos de largo plazo que no se están viendo en experimentos de 1 a 2 semanas, y Google y Bing actúan de forma diferente en ese punto, con Google ejecutando experimentos largos, por ejemplo de 90 días, y Bing enfocándose en agilidad con experimentos de 1 a 2 semanas e iteraciones.
Las dos elecciones son defendibles y resuelven problemas diferentes:
| Postura | Gana | Pierde |
|---|---|---|
| Experimentos largos | Mide el efecto que sobrevive; evita sobrestimar la ganancia en el plan financiero | Ritmo. Cada decisión tarda meses |
| Ciclos cortos con iteración | Volumen de aprendizaje por trimestre; los errores se corrigen rápido | Queda expuesto a efectos que solo aparecen después |
| Ciclos cortos con holdout global | Ritmo en el día a día, más una medición periódica de lo acumulado | Cuesta una porción permanente de la base y disciplina para no tocarla |
La tercera línea es el término medio que el holdout global hace posible, y es el diseño que describe el relato de Bing: decidir rápido en el día a día y tener, una vez al año, una lectura de lo que el conjunto de lanzamientos entregó realmente.
Checklist del holdout
- ¿La porción se reservó antes del lanzamiento? Reservarla después es un experimento inverso, y no mide el mismo periodo.
- ¿El tamaño de la porción se calculó, en vez de elegirse por costumbre? El cinco por ciento es convención, no resultado de una cuenta.
- ¿Existe un preperiodo limpio? Sin diferencia estadísticamente significativa entre los grupos antes de empezar, que es un test A/A con otro nombre.
- ¿La métrica primaria es la misma del test original? Cambiar de métrica a mitad de camino transforma la comparación en narrativa, ver eligiendo la métrica primaria.
- ¿Hay alguien encargado de no tocar la porción? Un holdout que recibe “solo un lanzamiento pequeño” deja de ser holdout.
- ¿La unidad de sorteo del holdout es la misma del test? Ver unidad de sorteo en test A/B.
- ¿La lectura de largo plazo va a sustituir el número del plan, o solo a convivir con él? Si nadie corrige la proyección, medir no cambia nada.
Errores comunes
- Leer el holdout como si fuera un test nuevo. No tiene aleatorización fresca en el momento de la lectura; carga meses de historia.
- Dejar el test corriendo y llamar a eso medición de largo plazo. Es el diseño ingenuo que los autores descartan por confundir aprendizaje con estacionalidad, sistema y lanzamientos posteriores.
- Comparar el holdout contra la media histórica. Sin grupo simultáneo, cualquier cosa que haya pasado en el mercado se convierte en tu resultado.
- Contaminar la porción con lanzamientos. Cada excepción reduce el holdout a un grupo parcialmente expuesto, y el efecto medido encoge sin explicación.
- Esperar que el efecto de largo plazo sea siempre menor. No siempre lo es. El artículo de Google describe curvas que suben después del lanzamiento por aprendizaje positivo del usuario; encoger es común, no obligatorio.
- Usar un holdout del 1 por ciento y quejarse del intervalo ancho. El factor de inflación en esa asignación es 25,25. El intervalo ancho es la cuenta, no un defecto de la herramienta.
Hazlo automático con Donnu
Lo que hace fallar al holdout casi nunca es la estadística. Es olvidar que existe: seis meses después, nadie recuerda que esa porción está reservada, alguien sube un lanzamiento en ella, y la medición desaparece sin que nadie se dé cuenta.
En Donnu, la porción reservada es una propiedad del experimento y no una configuración paralela: sigue declarada después del lanzamiento, y cualquier intento de exponer esa porción a un cambio nuevo aparece como conflicto en vez de ocurrir en silencio. La lectura de largo plazo usa la misma matemática y la misma unidad de la lectura original, lado a lado, para que la caída del efecto sea visible en vez de tener que reconstruirse a mano. Para rehacer las cuentas por fuera, la calculadora de valor p y la calculadora de tamaño de muestra aceptan los recuentos brutos de los dos brazos, incluso desbalanceados.
Referencias
- Hohnhold, H., O’Brien, D. y Tang, D. Focusing on the Long-term: It’s Good for Users and Business. KDD 2015, Google. Fuente de la distinción entre efecto de corto plazo como el impacto observado durante el experimento y efecto de largo plazo como el impacto final después de que el producto se lanza y los usuarios cambian el comportamiento, de la afirmación de que el corto plazo no siempre es predictivo del largo plazo, del desafío de decidir a tiempo, de la definición de ceguera y videncia a los anuncios como cambio de la propensión inherente del usuario a hacer clic o interactuar con anuncios, de la explicación de por qué el diseño ingenuo falla a causa de efectos de sistema, estacionalidad e interacciones con lanzamientos posteriores, del método de posperiodo con el tratamiento entre dos periodos A/A y de la percepción de que hace falta comparar los grupos mientras reciben el mismo tratamiento, del registro de que los posperiodos dieron mediciones confiables y reproducibles en Google, de las salvedades de desaprendizaje y de ambiente de medición incluyendo el ejemplo de la función de interfaz ausente en el posperiodo y la comprobación de métricas no afectadas por el comportamiento, de la tasa de aprendizaje de aproximadamente 0,012 por día, de la práctica de ejecutar estudios de escritorio durante 90 días capturando cerca del 65 por ciento del aprendizaje, del factor del 92 por ciento por desaprendizaje en una medición de 14 días y del producto de aproximadamente el 60 por ciento, y del factor de corrección mayor o igual a 1 con valor mínimo de 1,54 y uso práctico entre 2 y 3 en escritorio y portátil. research.google.
- Kohavi, R. Online Controlled Experiments: Lessons from Running A/B/n Tests for 12 Years. Keynote de KDD 2015. Fuente del relato de que el 90 por ciento de los usuarios elegibles de Bing está en experimentos mientras el 10 por ciento forma un holdout global que se cambia una vez al año, de la práctica de atribuir crédito ejecutando un experimento inverso, de la alerta sobre efectos de arrastre de experimentos anteriores, y del registro de que Google y Bing actúan de forma diferente respecto a los impactos de largo plazo, con Google ejecutando experimentos largos de por ejemplo 90 días y Bing enfocándose en agilidad con experimentos de 1 a 2 semanas e iteraciones. exp-platform.com.
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Referencia sobre métricas organizacionales en vez de métricas de función y sobre tratar resultados en el límite de la significancia como provisionales, aplicable a la lectura de un holdout con intervalo cercano a cero. exp-platform.com.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Referencia general sobre efectos de largo plazo, holdouts y asignación desbalanceada. Material complementario en experimentguide.com.
Lee también: Efecto novedad en tests A/B · Unidad de sorteo en test A/B · Test A/A: validar el montaje · Maldición del ganador · Métricas de guardrail · Calculadora de potencia estadística · Leia em português
Preguntas frecuentes
- ¿Qué es un holdout de largo plazo?
- Es un grupo de usuarios mantenido fuera del cambio después de que ya se lanzó para todo el mundo, justamente para permitir la comparación meses después. Kohavi informa que en la plataforma de Bing el 90 por ciento de los usuarios elegibles está en experimentos y el 10 por ciento forma un holdout global, que se cambia una vez al año. El holdout responde una pregunta que el test original no responde: cuánto de la ganancia medida en la primera semana todavía existe después de que el comportamiento del usuario se ajustó.
- ¿Por qué el efecto de corto plazo no predice el de largo plazo?
- Porque el usuario aprende. Hohnhold, O Brien y Tang describen el efecto de corto plazo como el impacto observado durante el experimento y el de largo plazo como el impacto final, una vez que el producto ya se lanzó por completo y los usuarios cambiaron el comportamiento en respuesta. Son directos al decir que el efecto de corto plazo no siempre es predictivo del de largo plazo, y que el desafío es determinar el impacto de largo plazo sin dejar de decidir a tiempo.
- ¿No basta con dejar el test corriendo tres meses?
- No, y los autores explican por qué. En ese diseño ingenuo, el efecto medido al final del periodo puede cambiar por muchos motivos que no tienen nada que ver con el aprendizaje del usuario: efectos del sistema, estacionalidad, interacciones con lanzamientos posteriores. Separar esas causas para medir aprendizaje dentro de un mismo grupo a lo largo del tiempo es, según su experiencia, muy difícil si no imposible. Por eso desarrollaron el método de posperiodo.
- ¿Qué es el método de posperiodo?
- Es colocar el periodo de tratamiento entre dos periodos de test A/A. Primero un preperiodo, para garantizar que no existen diferencias estadísticamente significativas entre los grupos al inicio del estudio. Después el tratamiento. Después un posperiodo, en el que los dos grupos vuelven a recibir la misma experiencia. La idea central, según los autores, es que para medir aprendizaje hace falta comparar los dos grupos mientras reciben el mismo tratamiento, porque ahí cualquier diferencia remanente solo puede venir de un cambio de comportamiento.
- ¿Cuánto tráfico cuesta un holdout del 5 por ciento?
- Mucho más de lo que sugiere la intuición, porque la asignación desbalanceada es ineficiente. Para la misma potencia de un test 50 contra 50 que exigiría 62.468 usuarios en total, un diseño 95 contra 5 necesita 328.779, es decir, 5,26 veces más. El brazo pequeño en sí sigue siendo pequeño, con 16.439 usuarios, y justamente por eso el resto tiene que crecer tanto. El factor de inflación es el cuadrado de 1 más la razón de asignación, dividido por 4 veces esa razón.
- ¿Cuál es la diferencia entre holdout y experimento inverso?
- El holdout separa una porción antes del lanzamiento y la mantiene fuera de él. El experimento inverso, o holdback, funciona al revés: el cambio ya está en el aire para todo el mundo y lo apagas para una porción, probando al revés. Kohavi describe ese diseño de atribuir crédito ejecutando un experimento inverso, es decir, subiendo el cambio y probando en reverso. El resultado estadístico es comparable; lo que cambia es el momento en que se tomó la decisión de reservar la porción.