Regresión a la Media en Test A/B: el pico no se repite
La regresión a la media hace que la página elegida por ser la peor mejore sola. Cómo separar recuperación estadística de efecto real en el test A/B.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Toda unidad elegida por estar en un extremo tiende a volver sola cerca de la media en la medición siguiente, sin que nadie haga nada. En una simulación con 200 páginas de conversión verdadera idéntica del 3 por ciento, las 20 peores del primer periodo subieron del 2,085 por ciento al 2,885 por ciento en el segundo, una mejora aparente del 38,37 por ciento con valor p de 0,00000028 y ningún cambio implementado. Eso es la regresión a la media, y es la razón por la que las lecturas del tipo antes contra después en páginas seleccionadas por su mal rendimiento casi siempre parecen funcionar. Esta guía muestra el cálculo, la simulación reproducible y el diseño que inmuniza el experimento. Forma parte de nuestra guía completa de test A/B y es el par, en el eje de la selección antes del test, de lo que la maldición del ganador trata en el eje de la selección después del test.
El fenómeno tiene nombre desde 1886
Galton analizó 930 hijos adultos y las 205 familias correspondientes, convirtiendo las estaturas femeninas al equivalente masculino, y fijó lo que llamó nivel de mediocridad de la población en 68 pulgadas y cuarto. La ley que enunció es sobre desviaciones, no sobre valores absolutos: la desviación de estatura del descendiente es, en promedio, dos tercios de la desviación de estatura de la mid-parentage. Padres muy altos tienen hijos altos, aunque menos altos que ellos; padres muy bajos tienen hijos bajos, aunque menos bajos. Galton registra que la razón apareció con una coherencia y precisión inesperadas, y que el mismo patrón ya había surgido en sus experimentos anteriores con semillas, donde la producción convergía hacia un tamaño medio.
La traducción moderna y más cercana a quien mide cosas está en Barnett, van der Pols y Dobson, que definen el efecto como un fenómeno estadístico capaz de hacer que la variación natural en datos repetidos parezca un cambio real, ocurriendo cuando medidas inusualmente grandes o pequeñas tienden a ser seguidas por medidas más cercanas a la media. Los autores registran que el efecto se vuelve más pronunciado con el aumento del error de medición y cuando las medidas de seguimiento se examinan solo en submuestras seleccionadas por los valores de la línea base, y concluyen que puede ser atenuado con mejor diseño de estudio y métodos estadísticos adecuados.
Aquella segunda condición describe, palabra por palabra, lo que un equipo de optimización hace cada semana: elegir la página con la peor conversión e ir a tocarla.
El cálculo en una línea
Si una medida observada está a d unidades de la media de la población y la correlación entre la primera y la segunda medición es r, el valor esperado de la segunda medición queda a r por d de la media. La parte que vuelve sola es, por lo tanto, (1 menos r) por d.
| desviación observada en el periodo 1 | correlación r entre los periodos | desviación esperada en el periodo 2 | recuperación sin intervención |
|---|---|---|---|
| 1,00 pp por debajo de la media | 0,0 | 0,00 pp | 1,00 pp |
| 1,00 pp por debajo de la media | 0,2 | 0,20 pp por debajo | 0,80 pp |
| 1,00 pp por debajo de la media | 0,4 | 0,40 pp por debajo | 0,60 pp |
| 1,00 pp por debajo de la media | 0,6 | 0,60 pp por debajo | 0,40 pp |
| 1,00 pp por debajo de la media | 0,8 | 0,80 pp por debajo | 0,20 pp |
| 1,00 pp por debajo de la media | 1,0 | 1,00 pp por debajo | 0,00 pp |
Los dos extremos de la tabla son los que orientan la intuición. Correlación 1 significa que la diferencia entre las unidades es enteramente real y estable: ahí no existe regresión, lo que era peor sigue siendo peor. Correlación 0 significa que la diferencia observada era enteramente ruido: ahí la regresión es total, y la unidad “peor” vuelve exactamente a la media sin que pase nada.
El caso real casi nunca está en los extremos. Las páginas realmente difieren entre sí, y la medición de cada una tiene ruido muestral. La correlación entre dos periodos mezcla las dos cosas, y es ella la que decide cuánto de la “ganancia” observada ya estaba contratada antes de cualquier cambio.
Simulación reproducible: 200 páginas idénticas
El ejemplo siguiente es una simulación con semilla fija, así que cualquiera reproduce los mismos números. El punto de partida es deliberadamente extremo para aislar el efecto: las 200 páginas tienen exactamente la misma tasa de conversión verdadera, 3,00 por ciento. No existe página mejor ni peor. Toda diferencia observada es ruido muestral puro.
Cada página recibe 1.000 visitantes en el periodo 1 y otros 1.000 en el periodo 2, con aleatorización independiente y ningún cambio entre los dos momentos.
// generador con semilla fija, para que el resultado sea reproducible
function mulberry32(a){return function(){a|=0;a=a+0x6D2B79F5|0;let t=Math.imul(a^a>>>15,1|a);t=t+Math.imul(t^t>>>7,61|t)^t;return ((t^t>>>14)>>>0)/4294967296;}}
const rnd = mulberry32(20260828);
const TASA_VERDADERA = 0.03, PAGINAS = 200, VISITANTES = 1000;
const sortea = () => { let c = 0; for (let i = 0; i < VISITANTES; i++) if (rnd() < TASA_VERDADERA) c++; return c; };
const p1 = Array.from({ length: PAGINAS }, sortea);
const p2 = Array.from({ length: PAGINAS }, sortea);
// ordena por el periodo 1 y separa las 20 peores y las 20 mejores
const orden = p1.map((_, i) => i).sort((x, y) => p1[x] - p1[y]);
const peores = orden.slice(0, 20), mejores = orden.slice(-20);
El resultado:
| grupo | tasa en el periodo 1 | tasa en el periodo 2 | variación relativa |
|---|---|---|---|
| Las 200 páginas | 2,990% | 2,966% | menos 0,80% |
| Las 20 peores del periodo 1 | 2,085% (417 de 20.000) | 2,885% (577 de 20.000) | más 38,37% |
| Las 20 mejores del periodo 1 | 3,910% (782 de 20.000) | 2,840% (568 de 20.000) | menos 27,37% |
| La peor página aislada | 1,60% (16 de 1.000) | 3,30% (33 de 1.000) | más 106% |
La fila del conjunto completo es el control honesto: 2,990 por ciento contra 2,966 por ciento, prácticamente nada, exactamente como debería ser. Las dos filas del medio son el problema entero en dos frases.
El test estadístico no protege contra esto
Aquí está el detalle que hace que este sesgo sobreviva a equipos técnicamente competentes. Si tomas el grupo de las 20 peores páginas y ejecutas un test de dos proporciones comparando periodo 1 contra periodo 2, usando la misma calculadora de significancia que usa el sitio entero, los números son:
- 20.000 visitantes y 417 conversiones contra 20.000 visitantes y 577 conversiones
- lift relativo del 38,37 por ciento, z igual a 5,1391
- valor p de 0,00000028
- intervalo de confianza de 0,495 a 1,105 punto porcentual para la diferencia absoluta
Y del otro lado, para las 20 mejores: lift relativo de menos 27,37 por ciento, z igual a menos 5,9252, valor p de 0,0000000031, intervalo de menos 1,424 a menos 0,716 punto porcentual.
Los dos resultados son altamente significativos. No se hizo ningún cambio. Las páginas son estadísticamente idénticas por construcción, y el generador de números aleatorios no sabe cuál de ellas fue elegida.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
El test de significancia no está equivocado. Está respondiendo con precisión a una pregunta que no es la que interesa. La pregunta que la calculadora responde es: dado este par de muestras, ¿qué tan improbable es esa diferencia bajo la hipótesis nula? La pregunta que importa es: ¿esa diferencia fue causada por el cambio? El puente entre las dos preguntas es la aleatorización, y no existe en una comparación antes contra después de una unidad que fue seleccionada justamente por el valor observado en el primer periodo.
Dónde aparece la regresión a la media en la operación real
- Priorizar por la página de peor conversión. Es el caso canónico. La página entró en la lista por estar en un extremo, y parte de la recuperación ya estaba contratada.
- Optimizar la campaña que tuvo la peor semana. Misma estructura, periodo más corto, ruido mayor, regresión mayor.
- Reaccionar a una caída súbita de métrica. Si la caída fue parcialmente ruido, la recuperación parcial ocurre de todos modos, y quien esté tocando algo en ese momento se lleva el crédito.
- Volver a testear el segmento que fue mal en el test anterior. El segmento fue elegido por un extremo dentro del dato del propio test, lo que combina regresión con efecto heterogéneo mal leído.
- Auditar proveedores por la peor cuenta del trimestre. La peor cuenta del trimestre mejora sola, y la auditoría se convierte en un éxito.
- Reciclar como caso de éxito el test que salvó una página rota. Aquí el efecto se suma a la maldición del ganador y al efecto de novedad.
El paralelo más conocido de esta dinámica está fuera del marketing. Tversky y Kahneman relatan, en 1974, la observación de instructores experimentados de vuelo: el elogio después de un aterrizaje excepcionalmente suave solía ser seguido por un aterrizaje peor en el intento siguiente, mientras que la crítica dura después de un aterrizaje malo solía ser seguida por una mejora. Los instructores concluyeron que la recompensa verbal era perjudicial para el aprendizaje y que el castigo verbal era beneficioso. Los autores registran que esa conclusión es injustificada por la presencia de la regresión a la media: como en otros casos de examen repetido, una mejora suele seguir a un rendimiento malo y un empeoramiento suele seguir a un rendimiento excepcional, aunque el instructor no responda en absoluto a lo que el alumno hizo en el primer intento.
Cambia instructor por analista, aterrizaje por semana y alumno por página, y la estructura es idéntica.
El diseño que inmuniza
En orden práctico:
- Control concurrente siempre. Las dos mitades de la página elegida cargan la misma regresión, y la diferencia entre ellas aísla el efecto. Es la razón de ser del diseño, descrita en cómo hacer un test A/B.
- Separar el periodo de selección del periodo de medición. Si elegiste la página con el dato de agosto, no uses agosto como línea base. Usa septiembre como línea base y octubre como medición, o aleatoriza dentro de septiembre.
- Descontar la recuperación esperada antes de escribir la hipótesis. Estima la correlación entre dos periodos históricos comparables y usa la tabla anterior. Si la recuperación esperada ya es de 0,4 punto porcentual, la hipótesis tiene que apuntar por encima de eso para que el experimento valga la pena.
- Dimensionar el test por el efecto incremental, no por la distancia hasta la media. El error clásico es calcular el tamaño de muestra con un MDE inflado por la distancia que ya iba a volver sola. El criterio correcto está en efecto mínimo detectable.
- Leer los segmentos con la regla de exploración. Un segmento elegido después de ver el resultado es una selección por extremo dentro del propio test, y la regla está en múltiples métricas y FDR.
- Desconfiar de un resultado demasiado bueno en una unidad que estaba rota. Es exactamente el disparador de confirmación descrito en la ley de Twyman.
Errores comunes
- Leer antes contra después en una página elegida por ser la peor. Es la forma pura del sesgo.
- Creer que un valor p pequeño lo resuelve. La simulación anterior produce un valor p de 0,00000028 sin ningún cambio.
- Usar el mismo periodo para seleccionar y para medir la línea base. Eso mete la regresión dentro del punto de partida.
- Prometer en el plan la ganancia medida por la distancia hasta la media del sitio. Buena parte de esa distancia vuelve sola y no es mérito de nadie.
- Interpretar la caída de la cima como fatiga o pérdida de calidad. El extremo bueno también regresa, y por el mismo motivo.
- Confundirlo con el efecto de novedad. La novedad es un cambio real de comportamiento que decae; la regresión es ruido de medición que se corrige. Los dos producen curvas parecidas y piden remedios diferentes.
- Aplicar el argumento a un test aleatorizado. En un test con control concurrente la regresión afecta a los dos brazos y se cancela. Usar la regresión a la media para desacreditar un test bien diseñado es tan erróneo como ignorarla en una lectura antes contra después.
Hazlo automático en Donnu
La regresión a la media no es un problema de cálculo, es un problema de diseño, y el diseño se decide en el momento en que alguien elige dónde tocar. Cuando la herramienta solo entra en escena después de esa elección, hereda el sesgo hecho.
En Donnu, todo experimento nace con control concurrente aleatorizado sobre el mismo tráfico y en el mismo periodo, que es la única estructura que hace que la regresión se cancele entre los brazos, y la lectura estándar del resultado es siempre variante contra control, nunca periodo actual contra periodo anterior. Si quieres comprobar cualquier cálculo a mano, la calculadora de significancia acepta los recuentos de cualquier par de grupos, y el generador de hipótesis pide el efecto esperado antes de que empiece el test, que es el momento correcto de descontar lo que ya iba a volver solo.
Referencias
- Galton, F. Regression towards Mediocrity in Hereditary Stature. Journal of the Anthropological Institute, volumen 15, páginas 246 a 263, 1886. Fuente del enunciado original de la ley en términos de desviaciones: la desviación de estatura del descendiente es, en promedio, dos tercios de la desviación de estatura de la mid-parentage; de los datos usados (930 hijos adultos y 205 familias, con las estaturas femeninas transmutadas al equivalente masculino y multiplicadas por 1,08); del nivel de mediocridad fijado en 68 pulgadas y cuarto sin zapatos; de la observación de que la regresión filial media hacia la mediocridad era directamente proporcional a la desviación parental; y del relato de que el mismo patrón apareció antes en los experimentos con semillas, donde la producción convergía hacia un tamaño medio. stat.ucla.edu.
- Barnett, A. G., van der Pols, J. C. y Dobson, A. J. Regression to the mean: what it is and how to deal with it. International Journal of Epidemiology, volumen 34, número 1, páginas 215 a 220, 2005. Fuente de la definición del fenómeno como algo que puede hacer que la variación natural en datos repetidos parezca un cambio real, ocurriendo cuando medidas inusualmente grandes o pequeñas tienden a ser seguidas por medidas más cercanas a la media; del registro de que los efectos se vuelven más pronunciados con el aumento del error de medición y cuando las medidas de seguimiento se examinan solo en submuestras seleccionadas por los valores de la línea base; y de la conclusión de que el efecto puede ser atenuado con mejor diseño de estudio y uso de métodos estadísticos adecuados. academic.oup.com.
- Tversky, A. y Kahneman, D. Judgment under Uncertainty: Heuristics and Biases. Science, volumen 185, número 4157, páginas 1124 a 1131, 27 de septiembre de 1974. Fuente del relato de los instructores de vuelo en la página 1127: el elogio después de un aterrizaje excepcionalmente suave era típicamente seguido por un aterrizaje peor en el intento siguiente, mientras que la crítica dura después de un aterrizaje malo era usualmente seguida por una mejora, llevando a los instructores a la conclusión injustificada de que las recompensas verbales son perjudiciales y los castigos verbales beneficiosos; y de la explicación de los autores de que esa conclusión no se sostiene por la regresión a la media, ya que una mejora suele seguir a un rendimiento malo y un deterioro suele seguir a un rendimiento excepcional incluso cuando el instructor no responde en absoluto al resultado del primer intento. cs.tufts.edu.
- Crook, T., Frasca, B., Kohavi, R. y Longbotham, R. Seven Pitfalls to Avoid when Running Controlled Experiments on the Web. KDD 2009. Fuente del contexto de por qué la comparación con dato histórico es frágil en entorno online y de por qué los tests controlados con asignación aleatoria y concurrente son el estándar de referencia para separar efecto de variación natural. exp-platform.com.
Lee también: La maldición del ganador · Efecto mínimo detectable · Efecto heterogéneo por segmento · La ley de Twyman · Cómo hacer un test A/B paso a paso · Calculadora de significancia · Leia em português
Preguntas frecuentes
- ¿Qué es la regresión a la media en un test A/B?
- Es la tendencia de una medida extrema a ser seguida por una medida más cercana a la media, sin que nada haya cambiado. Barnett, van der Pols y Dobson definen el fenómeno como algo que hace que la variación natural en datos repetidos parezca un cambio real, y registran que ocurre cuando medidas inusualmente grandes o pequeñas tienden a ser seguidas por medidas más cercanas a la media. En experimentación esto importa porque la página, el segmento o la campaña que elegiste para optimizar casi siempre fue elegida justamente por estar en un extremo.
- ¿La regresión a la media invalida mi test A/B?
- No, si el test es de hecho aleatorizado y comparado contra un control concurrente. La regresión afecta a las dos variantes al mismo tiempo y se cancela en la diferencia entre ellas. Lo que la regresión destruye es la comparación antes contra después: medir la página mala, cambiar algo y volver a medir produce una mejora esperada incluso cuando el cambio no hizo nada. El control concurrente existe exactamente para aislar ese componente.
- ¿Cuánto de un resultado es regresión a la media?
- Depende de la correlación entre las dos mediciones. Si la medida observada está a d unidades de la media y la correlación entre la primera y la segunda medición es r, el valor esperado de la segunda medición queda a r por d de la media. Con correlación cero, toda la distancia vuelve a la media. Con correlación de 0,6 y una desviación inicial de 1 punto porcentual por debajo de la media, la recuperación esperada sin ninguna intervención es de 0,4 punto porcentual. Solo lo que supere eso es candidato a efecto.
- ¿Cómo lo descubrió Galton?
- Analizando 930 hijos adultos y las 205 familias correspondientes, con las estaturas femeninas convertidas al equivalente masculino. Galton fijó el nivel de mediocridad de la población en 68 pulgadas y cuarto y enunció la ley en términos de desviaciones: la desviación de estatura del descendiente es, en promedio, dos tercios de la desviación de estatura de la mid-parentage. Registra que la razón de regresión apareció con una coherencia y precisión inesperadas, y el mismo patrón ya había aparecido antes en sus experimentos con semillas.
- ¿Cuál es la diferencia entre regresión a la media y maldición del ganador?
- Son dos efectos de selección con puntos de aplicación diferentes. La maldición del ganador trata del tamaño del efecto estimado: entre los tests que superaron el umbral de significancia, los que pasaron tienden a ser los que tuvieron suerte, así que el lift publicado exagera el lift verdadero. La regresión a la media trata del nivel de la métrica antes de que empiece el test: la unidad elegida por estar en un extremo tiende a volver sola cerca de la media. Las dos empujan en la misma dirección, que es el optimismo, y por eso suelen aparecer juntas.
- ¿Cómo evitar caer en esa trampa en la priorización?
- Tres hábitos resuelven casi todo. Primero, no leer nunca el resultado por comparación antes contra después cuando la unidad fue elegida por un extremo. Segundo, cuando la selección por extremo sea inevitable, usar un periodo de selección y otro de medición, jamás el mismo dato para las dos cosas. Tercero, estimar la recuperación esperada por la correlación entre periodos y descontarla de la expectativa de ganancia antes de escribir la hipótesis, para que el listón de lo que cuenta como éxito nazca ya en el lugar correcto.