CUPED: Reduciendo la Varianza del Test A/B
CUPED reduce la varianza del test A/B usando datos pre-experimento como covariable, lo que acorta la duración del test sin perder rigor estadístico.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
CUPED (Controlled-experiment Using Pre-Experiment Data) es una técnica que usa una métrica del período ANTES del test, del mismo usuario, para explicar parte del ruido de la métrica que estás midiendo, lo que reduce la varianza residual y hace el test más sensible sin necesitar más tráfico. Nació en un paper de Microsoft de 2013 y hoy es el método estándar de reducción de varianza en plataformas de experimentación como Netflix, Booking.com y buena parte del mercado de test A/B. Si ya leíste nuestra guía de significancia estadística en tests A/B, CUPED es la respuesta al problema más común que queda fuera de esa guía: qué hacer cuando tu tasa de conversión real es buena, pero el test sigue siendo inconcluyente porque el tráfico no es lo bastante grande para probarlo a tiempo.
El problema: los sitios de tráfico medio pagan caro por poder estadístico
Todo test A/B honesto necesita muestra suficiente para separar un efecto real del azar. El tamaño de esa muestra depende, entre otras cosas, de la varianza de la métrica que estás midiendo: cuanto más oscila esa métrica de visitante a visitante, por razones que no tienen nada que ver con tu cambio, más gente necesitas para ver la señal detrás del ruido. Métricas de ingreso por usuario, número de sesiones o tiempo dedicado al producto suelen tener una varianza bastante más alta que una tasa de conversión binaria simple (compró o no compró), porque un puñado de usuarios que gasta mucho más que el promedio arrastra la varianza entera hacia arriba.
En la práctica, esto significa meses de test para detectar un efecto que existe de verdad. Un equipo con tráfico medio, probando un cambio que mejora el ingreso por usuario en un 5%, puede necesitar una muestra tan grande que el test nunca termine antes de que el roadmap cambie de prioridad. La salida obvia (esperar más) cuesta tiempo de mercado; la salida arriesgada (bajar el rigor) cuesta confiabilidad. CUPED ataca el problema por un tercer camino: en vez de tocar el rigor o esperar más tráfico, reduce el ruido que la muestra necesita vencer.
La idea central: una covariable que ya existía antes del test
La intuición detrás de CUPED es simple de enunciar: si ya sabes, antes de que el test siquiera empiece, que un usuario históricamente gasta mucho o poco, esa información previa explica una parte del valor que va a generar durante el test, independientemente de qué variación vio. Un cliente que gastaba $500 al mes antes del experimento tiende a seguir en un nivel parecido después, y esa tendencia no tiene relación alguna con A o B. Si logras “descontar” esa parte previsible de la métrica, lo que queda (el residuo) tiene menos varianza, y es en ese residuo, más limpio, donde la diferencia entre A y B queda más fácil de ver.
Formalmente, esa covariable pre-experimento se llama X, y la métrica que el test mide se llama Y. La métrica ajustada, llamada Y-CUPED, es:
Donde θ (theta) es el coeficiente que dice cuánto de X explica Y, calculado como:
En palabras, término a término: Y es el valor de la métrica durante el test (ingreso, sesiones, lo que estés midiendo); X es el valor de la misma métrica (o de una métrica correlacionada) en el mismo usuario, antes de que el test empezara; E[X] es el promedio de X en toda la población; y θ es exactamente el coeficiente de una regresión lineal simple de Y sobre X, el valor que minimiza la varianza del residuo. Fíjate en lo que hace esa resta: cuando X está por encima del promedio (el usuario históricamente gasta más), el término θ·(X − E[X]) es positivo y se resta de Y, “descontando” la parte del valor de Y que ya era esperada por el historial del usuario, no por la variación que vio.
De dónde viene la reducción de varianza: el papel de la correlación
La parte más útil de CUPED, en la práctica, es que la reducción de varianza tiene una fórmula cerrada y fácil de aplicar. Eligiendo θ de forma óptima (el coeficiente de regresión que acabamos de ver), la varianza de la métrica ajustada es:
Donde ρ (rho) es la correlación de Pearson entre X e Y, un número entre −1 y 1 que mide cuánto andan juntos los dos. Esta fórmula dice que la varianza que queda después del ajuste es una fracción (1 − ρ²) de la varianza original. Dándole la vuelta: la reducción porcentual de varianza equivale a ρ², el cuadrado de la correlación. Una correlación de 0,5 entre la covariable pre-experimento y la métrica del test reduce la varianza en 0,5² = 25%; una correlación de 0,7 reduce en 0,7² = 49%, casi la mitad.
Esta relación explica por qué CUPED es tan sensible a la elección de la covariable: correlaciones bajas (por debajo de 0,3, por ejemplo) rinden una reducción pequeña, por debajo del 10%, apenas perceptible en la práctica; correlaciones moderadas a altas (0,5 a 0,7), comunes en métricas de ingreso o engagement de usuarios recurrentes, rinden reducciones de 25% a casi 50%, suficiente para acortar un test de meses a semanas.
Un ejemplo trabajado, de punta a punta
Para no dejar esta cuenta en lo abstracto, vamos a reutilizar el mismo escenario usado en nuestra guía de bandits vs. test A/B: una página con 10.000 visitantes por semana, tasa de conversión base de 5% y efecto mínimo detectable de 10% relativo, con 95% de confianza y 80% de poder. El motor de muestra de este blog devuelve, sin CUPED, 31.234 visitantes por variación (62.468 en total), corriendo durante 44 días con ese tráfico semanal. Ese es el punto de partida.
Ahora supón que la métrica primaria del test es ingreso por usuario, y que tienes, para cada visitante, el ingreso que generó en las dos semanas antes de que el test empezara. Una correlación de 0,5 entre ese ingreso pre-experimento y el ingreso durante el test es un número plausible para un producto con buena porción de usuarios recurrentes (Kameleoon, analizando más de 200 experimentos propios, reporta que la reducción de varianza crece con la proporción de visitantes recurrentes en el test). Haciendo la cuenta:
- Reducción de varianza: ρ² = 0,5² = 0,25, es decir, 25% menos varianza en la métrica ajustada.
- Fracción de varianza que queda: 1 − 0,25 = 0,75 (75% de la varianza original).
- Muestra ajustada por variación: 31.234 × 0,75 ≈ 23.426 visitantes (una caída de cerca de 7.808 por variación).
- Muestra total ajustada: 23.426 × 2 ≈ 46.852 visitantes, contra 62.468 sin CUPED.
- Duración ajustada, con el mismo tráfico semanal de 10.000: 46.852 ÷ 10.000 ≈ 4,69 semanas ≈ 33 días, contra 44 días sin CUPED.
- Ahorro: 44 − 33 = 11 días, o aproximadamente 25% menos tiempo de test para la misma confianza y el mismo poder estadístico.
Esta es una aproximación de bastidor sobre el sobre: asume que el resto del diseño (significancia, poder, efecto mínimo) queda igual y que el tamaño de muestra necesario escala de forma aproximadamente lineal con la varianza de la métrica, una simplificación estándar usada por herramientas como GrowthBook y Kameleoon para comunicar la ganancia de CUPED. La ganancia real que reporte tu herramienta puede variar un poco de esta cuenta de bastidor, pero la dirección y el orden de magnitud son los mismos.
La tabla de abajo extiende esta cuenta para otras correlaciones, siempre a partir del mismo escenario base de 31.234 por variación y 44 días:
| Correlación (ρ) | Reducción de varianza (ρ²) | Muestra ajustada por variación | Duración ajustada | Días ahorrados |
|---|---|---|---|---|
| 0,3 | 9% | ~28.423 | ~40 días | ~4 días |
| 0,4 | 16% | ~26.237 | ~37 días | ~7 días |
| 0,5 | 25% | ~23.426 | ~33 días | ~11 días |
| 0,6 | 36% | ~19.990 | ~28 días | ~16 días |
| 0,7 | 49% | ~15.930 | ~23 días | ~21 días |
Declara la significancia sobre la métrica ya ajustada
CUPED no reemplaza el test de significancia, solo cambia la métrica que entra en la cuenta: en vez de comparar la Y bruta de A contra la de B, comparas la Y-CUPED de cada lado, que tiene el mismo promedio pero menos ruido. Después de aplicar la resta en cada visitante (o de usar una herramienta que ya lo hace nativamente), pega las conversiones y los visitantes ajustados en la calculadora de abajo para ver la ganancia de significancia en la práctica:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Si tu métrica es una tasa (conversión binaria), piensa en los números que pegas aquí como el resultado después de que cualquier ajuste de covariable ya fue aplicado entre bastidores por tu herramienta de experimentación; para métricas continuas (ingreso por usuario, sesiones), el mismo razonamiento de significancia se aplica cambiando el test de proporciones por un test-t o equivalente sobre el promedio ajustado, pero la lógica de “menos varianza, mismo efecto, más fácil de detectar” es idéntica.
Cuándo CUPED funciona bien (y cuándo no ayuda casi nada)
CUPED no es universal. La ganancia depende enteramente de que exista una covariable pre-experimento correlacionada, y eso separa con claridad los escenarios en los que vale la pena aplicarlo de los que no:
| Escenario | ¿CUPED ayuda? | Por qué |
|---|---|---|
| Métrica con historial del mismo usuario (ingreso por usuario, sesiones, tiempo en el producto) | Sí, bastante | El comportamiento pre-experimento suele ser un buen predictor del comportamiento durante el test, dando una correlación alta |
| Producto con buena base de usuarios recurrentes | Sí | Más gente con historial disponible como covariable, más gente se beneficia del ajuste |
| Métrica binaria simple (clics, conversión) en un producto con recurrencia | Ayuda moderadamente | La correlación suele ser más baja que en métricas continuas, pero todavía existe alguna ganancia |
| Landing page de adquisición, mayoría de visitantes nuevos | Poco o nada | El visitante nuevo no tiene valor pre-experimento; sin covariable, no hay qué descontar |
| Lanzamiento de producto nuevo, sin datos históricos de la métrica | Nada | No existe período pre-experimento para recolectar X |
| Test muy corto, donde ni da tiempo de calcular una covariable estable | Ganancia reducida | La covariable necesita calcularse sobre una ventana pre-experimento razonable para ser estable |
La regla práctica: pregunta si se puede responder “qué hizo este usuario antes de que el test empezara, en la misma métrica o en una métrica parecida” para la mayoría de quien va a entrar al experimento. Si la respuesta es sí para la mayor parte de la audiencia, CUPED tiende a valer el esfuerzo de implementación. Si la respuesta es no (la audiencia es mayoritariamente nueva), la ganancia queda cerca de cero y el esfuerzo de implementar la técnica no se paga.
CUPED no es peeking, ni es bandit
Vale la pena separar CUPED de otras dos ideas de este blog con las que es fácil confundirlo. El problema del peeking trata sobre cuándo decides parar un test: mirar el resultado repetidas veces y parar demasiado pronto infla el falso positivo; CUPED no tiene relación alguna con esto, cambia qué métrica entra en la cuenta de significancia, no cuándo la miras. Puedes (y debes) seguir respetando la muestra y la duración planeadas incluso usando CUPED, solo que la muestra planeada queda menor.
Ya los multi-armed bandits resuelven un problema totalmente distinto: en vez de reducir la varianza de un test de horizonte fijo, un bandit reasigna tráfico continuamente hacia la variación que parece mejor, cambiando significancia estadística formal por menos costo de oportunidad durante el test. CUPED sigue produciendo un valor p y un intervalo de confianza normales, solo que sobre una métrica con menos ruido; un bandit renuncia al valor p a cambio de otra cosa. Las dos técnicas no compiten, es más, se combinan bien: nada impide aplicar CUPED a la métrica que alimenta un bandit bayesiano, reduciendo la varianza que el propio algoritmo de asignación percibe.
Hazlo automático en Donnu
Reducir la varianza de un test con CUPED exige tres cosas que dan trabajo manual: identificar una covariable pre-experimento correlacionada, calcular la θ óptima por regresión y aplicar el ajuste antes de correr cualquier test de significancia, sin desordenar la matemática congelada que sostiene el resto del experimento. Donnu ya corre sobre un motor bayesiano nativo, la misma base estadística que sostiene ajustes de varianza como CUPED; la lectura de significancia honesta que ya viste en nuestra guía principal es el cimiento sobre el que se apoya este tipo de técnica, sin exigir una hoja de cálculo de regresión paralela para cada test.
Empieza una prueba gratis de 14 días y lee también qué es la significancia estadística y la fórmula detrás de ella, el problema del peeking y por qué parar temprano arruina un test, y bandits vs. test A/B, para cuando el objetivo es optimización continua en vez de un veredicto único.
Referencias
- Deng, A., Xu, Y., Kohavi, R. & Walker, T. Improving the Sensitivity of Online Controlled Experiments by Utilizing Pre-Experiment Data. WSDM 2013 (el paper original que define CUPED). dl.acm.org.
- Kameleoon. What we learned from running 200+ experiments on CUPED. kameleoon.com/blog/cuped.
- GrowthBook. CUPED (documentación técnica, fórmula de θ e implementación). docs.growthbook.io/statistics/cuped.
- Optimizely. CUPED (glosario de optimización). optimizely.com/optimization-glossary/what-is-cuped.
Preguntas frecuentes
- ¿Qué es CUPED, en palabras simples?
- CUPED (Controlled-experiment Using Pre-Experiment Data) es una técnica que usa una métrica recolectada ANTES de que el test empiece, del mismo usuario, para explicar parte del ruido natural de la métrica que estás midiendo. Al remover esa parte previsible del ruido, la varianza de la métrica ajustada queda menor, lo que hace el test más sensible para detectar un efecto real, con el mismo tráfico, o permite alcanzar la misma confianza con menos tráfico y menos tiempo.
- ¿CUPED cambia quién gana el test?
- No cambia la dirección del efecto real, solo reduce el ruido alrededor de él. El promedio de la métrica ajustada tiene el mismo valor esperado que la métrica original; lo que cambia es el error estándar, que queda menor. Esto significa que un efecto verdadero queda más fácil de separar del azar, pero CUPED no crea un ganador que no existía ni esconde un perdedor real.
- ¿Qué covariable debo usar en CUPED?
- La mejor covariable es, casi siempre, la propia métrica que estás probando, medida en el mismo usuario durante un período antes de que el experimento empiece (por ejemplo, ingreso por usuario en las dos semanas anteriores al test, si la métrica primaria es ingreso por usuario durante el test). Cuanto mayor la correlación entre ese valor pre-experimento y el valor durante el experimento, mayor la reducción de varianza. Una covariable débilmente correlacionada (o ninguna) no ayuda mucho.
- ¿CUPED funciona para visitantes nuevos, sin historial?
- Poco o nada. La técnica depende de un valor pre-experimento del mismo usuario para funcionar como covariable; un visitante que nunca fue visto antes no tiene ese valor, así que no hay qué usar para reducir su varianza. Tests dominados por tráfico nuevo (una landing page de adquisición, por ejemplo) obtienen una ganancia mucho menor de CUPED que tests en un producto con una base de usuarios recurrentes.
- ¿Necesito una herramienta especial para usar CUPED, o se puede hacer a mano?
- La matemática cabe en una hoja de cálculo: es una regresión lineal simple entre la métrica pre-experimento y la métrica del test, seguida de una resta. Plataformas como GrowthBook y Statsig ya incorporan CUPED nativamente en el cálculo de significancia. El trabajo manual está en tener los datos pre-experimento organizados por usuario y en recalcular la significancia sobre la métrica ajustada, no sobre la métrica bruta.