Ajuste por Regresión en Test A/B: menos ruido en el efecto
El ajuste por regresión usa covariables previas al test para encoger el error estándar sin más tráfico. La cuenta, la crítica de Freedman y Lin.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
La muestra que exige un test A/B es proporcional a la varianza de la métrica, y parte de esa varianza usted ya puede explicarla con datos que existían antes del sorteo. El ajuste por regresión cambia la comparación de dos medias crudas por una regresión que incluye esas covariables, mantiene el mismo efecto estimado y encoge el error estándar. En el ejemplo de esta guía, una lectura de 40.000 por brazo con más 0,3000 punto porcentual sale con valor p 0,054907 sin ajuste y 0,044188 cuando las covariables explican 9 por ciento de la varianza. El efecto no cambió; el ruido a su alrededor disminuyó. Esta guía muestra la cuenta, la crítica de Freedman que asustó a una generación de analistas, la corrección de Lin que la resolvió, y la regla de disciplina sin la cual el ajuste se vuelve trampa. Forma parte de nuestra guía completa de test A/B y es la generalización de lo que CUPED hace con una sola covariable.
El tráfico que usted compra es ruido, no señal
El tamaño de muestra de un test lo dictan tres cosas: el efecto que quiere detectar, el riesgo de error que acepta y la varianza de la métrica. Las dos primeras son decisiones suyas. La tercera parece ser una propiedad fija del negocio, y no lo es del todo.
Buena parte de la variación entre usuarios es predecible antes de que empiece el experimento. Quien compró tres veces en los últimos 90 días convierte más que quien nunca compró, y eso es verdad en los dos brazos, porque el sorteo distribuyó los dos tipos por igual. Esa porción predecible no carga ninguna información sobre la variación probada: es ruido puro desde el punto de vista de la pregunta, y aun así usted paga tráfico por ella.
La idea es antigua en muestreo y se llama variable de control. Deng, Xu, Kohavi y Walker la trajeron a la experimentación en línea bajo el nombre CUPED, con la cuenta explícita: eligiendo el coeficiente óptimo, la varianza del estimador pasa a ser la varianza original multiplicada por 1 menos el cuadrado de la correlación entre la métrica y la covariable. Cuanto mayor la correlación, mayor la reducción, y registran que la elección óptima del coeficiente es exactamente la solución de mínimos cuadrados de la regresión del resultado centrado sobre la covariable centrada. Es decir: CUPED es regresión, con una covariable.
El ejemplo trabajado: la misma lectura, dos errores estándar
Un SaaS prueba una nueva pantalla de registro. La métrica primaria es activación en 7 días. El test corre hasta 40.000 visitantes por brazo.
| lectura | control | variación |
|---|---|---|
| visitantes | 40.000 | 40.000 |
| activaciones | 2.000 | 2.120 |
| tasa | 5,000% | 5,300% |
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pegue esos cuatro números en la calculadora de arriba. El resultado es el punto de partida de todo: efecto de más 0,3000 punto porcentual, más 6,00 por ciento relativo, intervalo de confianza de 95 por ciento entre menos 0,0063 y más 0,6063 punto, y valor p 0,054907. El z, que la calculadora no muestra porque es el paso intermedio, vale 1,9196.
Es el peor lugar posible para que termine un test. El intervalo cruza el cero por seis milésimas de punto. Nadie en la reunión va a llamar a eso nulo, y nadie puede llamarlo victoria.
Ahora suponga que, antes del sorteo, usted tenía para cada usuario: número de sesiones en los 14 días anteriores, origen del tráfico, dispositivo y si ya había iniciado un registro antes. Junte todo en una regresión y suponga que ese conjunto explique 9 por ciento de la varianza del resultado, es decir, una correlación múltiple de 0,30 con la activación. El error estándar del efecto queda multiplicado por 0,953939, que es la raíz de 1 menos 0,09.
El efecto sigue siendo exactamente más 0,3000 punto. El z sube de 1,9196 a 2,0123 y el valor p cae a 0,044188.
Dos cosas tienen que quedar claras aquí, porque el gráfico de arriba es seductor y peligroso en la misma medida:
- El ajuste no inventó efecto. Los 0,3000 punto son los mismos. Lo que cayó fue la incertidumbre sobre ellos, porque parte del ruido que competía con el efecto fue explicada por datos que no tienen ninguna relación con la variación probada.
- Si la decisión de ajustar se toma después de ver la barra roja, eso no es análisis, es elección del resultado preferido. La sección sobre disciplina, más adelante, es la parte más importante de este artículo.
Freedman dijo que esto se rompe, y tenía parcialmente razón
En 2008, David Freedman publicó una crítica que se volvió folclore contra el ajuste. Trabajando bajo el modelo de Neyman, en que el efecto puede variar entre individuos, la linealidad no se asume y la aleatorización es la única fuente de variabilidad, mostró tres problemas: el ajuste puede empeorar la precisión asintótica, el error estándar convencional de mínimos cuadrados es inconsistente, y el estimador ajustado tiene sesgo de muestra pequeña. Su frase es directa: la razón del colapso no es difícil de encontrar, porque la aleatorización no justifica los supuestos detrás del modelo de mínimos cuadrados.
La crítica prendió. Lin cita a Berk y coautores resumiendo la lección como “la asignación aleatoria no justifica ninguna forma de regresión con covariables”, con sesgo probable en las estimaciones y errores estándar muy sesgados.
En 2013, Winston Lin reexaminó cada uno de los tres puntos bajo las mismas condiciones de regularidad de Freedman y mostró que, en muestras suficientemente grandes, los problemas son menores o de corrección fácil. Los dos resultados que le interesan a quien corre tests A/B:
- Con el conjunto completo de interacciones entre tratamiento y covariables, el ajuste no puede empeorar la precisión asintótica. Lin es aún más específico: el estimador con interacciones es asintóticamente al menos tan eficiente como la diferencia de medias, y estrictamente más eficiente a menos que las covariables no estén correlacionadas con la media ponderada relevante.
- El error estándar sándwich de Huber y White es consistente o asintóticamente conservador, con o sin las interacciones. La linealidad y la homocedasticidad no son necesarias para ese resultado.
Junto a eso viene un detalle operativo bonito: Lin registra que, cuando el efecto no ajustado se calcula regresando el resultado sobre el indicador de tratamiento, el estimador sándwich corregido HC2 devuelve exactamente la estimación de varianza preferida por Neyman y por el propio Freedman, es decir, la suma de las varianzas muestrales divididas por cada tamaño de grupo. Las dos escuelas dan el mismo número.
| punto de Freedman (2008) | respuesta de Lin (2013) | qué hacer en la práctica |
|---|---|---|
| el ajuste puede empeorar la precisión asintótica | no puede, si el conjunto completo de interacciones tratamiento por covariable está en el modelo | centre siempre las covariables e incluya las interacciones con el indicador de brazo |
| el error estándar convencional de mínimos cuadrados es inconsistente | cierto, y por eso no se usa el convencional; el sándwich es consistente o conservador | use error estándar robusto, prefiriendo la variante HC2 |
| existe sesgo de muestra pequeña en el estimador ajustado | existe, y desaparece con el tamaño; en muestra pequeña o con puntos de alto apalancamiento el sándwich también puede tener sesgo hacia abajo | con pocos miles de unidades, prefiera la diferencia de medias o bootstrap |
El tercer punto es el que cierra la regla honesta: el ajuste por regresión es una técnica de muestra grande. Un experimento de tráfico en línea con decenas de miles de unidades por brazo está cómodamente en ese territorio. Un piloto con 400 usuarios no lo está, y allí la crítica de Freedman sigue valiendo íntegramente.
Cuánto tráfico devuelve el ajuste por regresión
La cuenta es directa: si las covariables explican una fracción de la varianza, el requisito de muestra cae en la misma fracción. Vale la pena ver eso en días de calendario, que es la moneda de quien opera.
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Con tasa base de 5 por ciento, objetivo de más 6 por ciento relativo, 95 por ciento de confianza y 80 por ciento de poder en test de dos colas, la calculadora de arriba devuelve 85.199 visitantes por variación. A 30 mil visitantes por semana divididos entre dos brazos, eso son 40 días. Aplicando la reducción de varianza sobre ese mismo requisito:
| varianza explicada | correlación | visitantes por variación | días a 30 mil por semana |
|---|---|---|---|
| 0% (sin ajuste) | 0,00 | 85.199 | 40 |
| 5% | 0,22 | 80.940 | 38 |
| 9% | 0,30 | 77.532 | 37 |
| 16% | 0,40 | 71.568 | 34 |
| 25% | 0,50 | 63.900 | 30 |
| 30,25% | 0,55 | 59.427 | 28 |
| 50% | 0,71 | 42.600 | 20 |
El piso de 50 por ciento no es hipotético. Deng, Xu, Kohavi y Walker relatan que, en el sistema de experimentación de Bing, la técnica redujo la varianza en cerca de 50 por ciento, lo que describen como equivalente a duplicar el tráfico o reducir a la mitad el tiempo de ejecución para la misma sensibilidad.
Qué covariables valen la pena
Aquí vive la diferencia entre la teoría y la factura. La ganancia depende por completo de cuánto explican las covariables, y la experiencia publicada es clara sobre quién gana:
| covariable | expectativa de ganancia | observación |
|---|---|---|
| la propia métrica del resultado en el período preexperimento | alta | es la mejor covariable aislada, y es exactamente lo que usa CUPED |
| métricas de engagement preexperimento (sesiones, páginas vistas) | media | correlacionadas con casi todo, pero menos que el resultado rezagado |
| dispositivo, canal de adquisición, país | baja | útiles por ser baratas de recolectar, rara vez mueven la aguja solas |
| variables medidas DESPUÉS del sorteo | prohibida | cualquier cosa que el tratamiento pueda haber afectado rompe el sorteo |
Los autores de CUPED son explícitos sobre el primer punto: usar la misma métrica del período preexperimento típicamente da la mayor reducción de varianza. Y miden el retorno de sumarle otra covariable: combinando las dos, ganaron apenas 2 a 3 por ciento más de reducción que con la métrica preexperimento sola. Es decir, el segundo punto de la lista rara vez compensa la complejidad.
Vale la expectativa realista para quien no tiene el resultado rezagado disponible. Lin cita a Schochet, que examinó ocho experimentos sociales con resultados variados y encontró R cuadrado por encima de 0,3 solo cuando el resultado era nota de prueba estandarizada o costo de Medicaid y las covariables incluían el resultado rezagado. Lin registra la conclusión general: la constatación de que el ajuste tiene poco efecto sobre la precisión no es inusual en experimentos sociales, porque las covariables suelen tener correlación débil con el resultado.
La lectura práctica de eso es incómoda y honesta: si usted no consigue medir la métrica del resultado antes del experimento, el ajuste probablemente va a devolver unos pocos por ciento, no 50. Un usuario nuevo, que nunca convirtió, no tiene métrica preexperimento ninguna, y es justamente él quien domina el embudo de adquisición.
La regla que separa el análisis de la trampa
El ajuste por regresión tiene un grado de libertad explosivo: qué covariables entran, en qué forma funcional, con qué interacciones, con qué tratamiento de valores faltantes. Cada una de esas elecciones mueve el valor p. Un analista de buena fe que pruebe tres especificaciones y reporte la mejor está haciendo exactamente lo que mostró el gráfico de la segunda sección, solo que sin darse cuenta.
La regla es simple y no tiene excepción razonable: la especificación del ajuste entra en el plan de análisis preregistrado, antes de que exista la primera lectura. Lo que tiene que estar escrito ahí:
- la lista exacta de covariables, por el nombre del campo;
- la ventana de tiempo de cada una, cerrada en el instante del sorteo;
- que las covariables serán centradas e interactuadas con el indicador de brazo, según Lin;
- que el error estándar será robusto (HC2);
- qué hacer con el valor faltante, decidido antes de saber cuántos existen;
- que la lectura ajustada es la primaria y que la diferencia de medias cruda será reportada junto a ella, siempre, sin depender del resultado.
Este último punto es la protección más barata que existe. Publicar las dos lecturas lado a lado convierte cualquier divergencia grande entre ellas en una señal de diagnóstico, y no en una elección. Si la lectura cruda y la ajustada discrepan mucho, algo está mal con el sorteo o con las covariables, y vale revisar el reparto desigual de tráfico antes que cualquier otra cosa.
Una hoja de ruta de siete pasos para el ajuste por regresión
- Verifique si la métrica del resultado existe en el período preexperimento. Si existe, ella es su mejor covariable y el resto es secundario.
- Congele las covariables en el instante del sorteo. Nada medido después entra, sin excepción, aunque parezca inofensivo.
- Escriba la especificación en el plan de análisis, con nombre de campo y ventana, antes de que exista la primera lectura.
- Centre las covariables e incluya las interacciones con el brazo, que es la forma que Lin mostró que no puede empeorar la precisión asintótica.
- Use error estándar robusto, prefiriendo HC2, y nunca el error estándar convencional de mínimos cuadrados.
- Reporte las dos lecturas, la cruda y la ajustada, siempre juntas, en el mismo informe.
- Si la muestra es pequeña, algunos cientos por brazo, no ajuste: reporte la diferencia de medias y trate la crítica de Freedman como válida, porque en ese régimen lo es.
Errores comunes
- Ajustar por una variable medida después del sorteo. Es el mismo error estructural que segmentar por comportamiento postratamiento, y destruye la garantía que compró el sorteo. El caso completo está en análisis de mediación.
- Decidir ajustar después de ver el valor p crudo. Es el diagrama de la sección anterior, y ninguna corrección posterior lo arregla.
- Usar error estándar convencional de mínimos cuadrados. Freedman mostró que es inconsistente bajo el modelo de Neyman, y ese punto de su crítica sigue en pie.
- Ajustar en un experimento con pocos cientos de unidades por brazo. El sesgo de muestra pequeña y la inestabilidad del sándwich con puntos de alto apalancamiento son reales en ese régimen.
- Esperar 50 por ciento de reducción sin tener el resultado rezagado. La evidencia publicada apunta a unos pocos por ciento cuando las covariables son solo demográficas y de contexto.
- Creer que el ajuste arregla un sorteo roto. Reduce varianza; no corrige sesgo de asignación. Para el desequilibrio de asignación el asunto es otro, y la corrección también.
- Confundirlo con posestratificación. Las dos ideas son parientes y tienen límites diferentes; el techo de cada una está detallado en estratificación en test A/B.
Hágalo automático con Donnu
El ajuste por regresión depende de algo que se decide mucho antes del análisis: las covariables tienen que estar selladas en el instante del sorteo, no reconstruidas después a partir del estado actual del usuario. Un campo de “número de sesiones” leído el día del informe ya contiene las sesiones que causó la variación, y usar eso como covariable previa al test no reduce varianza, contamina la estimación.
Donnu sella el estado del usuario en el momento de la asignación, lo que deja el bloque de covariables disponible sin reconstrucción manual y sin riesgo de fuga postratamiento. Y vale la regla de alcance: cuando la métrica del resultado existe en el período anterior, úsela primero, porque es ella la que carga casi toda la ganancia. La calculadora de tamaño de muestra cierra la cuenta de cuánto calendario devuelve esto, aplicando la fracción de varianza explicada sobre el requisito bruto.
Referencias
- Lin, W. Agnostic Notes on the Regression Adjustment to Experimental Data: Reexamining Freedman’s Critique. Annals of Applied Statistics, volumen 7, número 1, 2013, páginas 295 a 318. Fuente de la demostración de que el ajuste por mínimos cuadrados no puede empeorar la precisión asintótica cuando se incluye el conjunto completo de interacciones entre tratamiento y covariables, y es estrictamente más eficiente a menos que las covariables no estén correlacionadas con la media ponderada relevante; de que el estimador sándwich de Huber y White es consistente o asintóticamente conservador con o sin las interacciones, sin exigir linealidad ni homocedasticidad; del registro de que el HC2 aplicado al estimador no ajustado devuelve exactamente la estimación de varianza preferida por Neyman y Freedman; de la advertencia de que con muestra pequeña o puntos de alto apalancamiento el sándwich puede tener un sesgo hacia abajo sustancial; y de la cita de Schochet sobre R cuadrado por encima de 0,3 en ocho experimentos sociales solo con el resultado rezagado entre las covariables. arxiv.org.
- Freedman, D. A. On Regression Adjustments to Experimental Data. Advances in Applied Mathematics, volumen 40, 2008, páginas 180 a 193. Fuente de la evaluación del ajuste bajo el modelo de Neyman, en que cada individuo tiene dos respuestas potenciales y solo una se observa: las estimaciones de regresión son en general sesgadas, con sesgo pequeño en muestras grandes; el ajuste puede mejorar o empeorar la precisión; y los errores estándar calculados por los procedimientos usuales pueden sobrestimar o subestimar la precisión, por factores grandes. Esos mismos tres puntos están reproducidos y reexaminados íntegramente por Lin, que también registra la lectura de Berk y coautores según la cual la asignación aleatoria no justificaría ninguna forma de regresión con covariables. stat.berkeley.edu.
- Deng, A., Xu, Y., Kohavi, R. y Walker, T. Improving the Sensitivity of Online Controlled Experiments by Utilizing Pre-Experiment Data. WSDM 2013. Fuente de la cuenta de variable de control en que la varianza del estimador con coeficiente óptimo se vuelve la varianza original por 1 menos el cuadrado de la correlación, y del registro de que ese coeficiente óptimo es la solución de mínimos cuadrados de la regresión del resultado centrado sobre la covariable centrada; del resultado empírico de que la misma métrica del período preexperimento típicamente da la mayor reducción de varianza, con ganancia extra de apenas 2 a 3 por ciento al combinarla con otra covariable; y de la validación en Bing con reducción de varianza de cerca de 50 por ciento, descrita como equivalente a duplicar el tráfico o reducir a la mitad la duración. exp-platform.com.
Lea también: Qué es CUPED · Estratificación en test A/B · Efecto mínimo detectable · Plan de análisis preregistrado · Calculadora de tamaño de muestra · Leia em português
Preguntas frecuentes
- ¿Qué es el ajuste por regresión en un test A/B?
- Es estimar el efecto de la variación en una regresión que incluye covariables medidas ANTES del sorteo, en vez de comparar dos medias crudas. El efecto estimado sigue siendo el mismo objetivo, pero el error estándar encoge en proporción a la varianza del resultado que explican las covariables. En el ejemplo de esta guía, una lectura de 40.000 por brazo sale con valor p 0,054907 sin ajuste y 0,044188 con covariables que explican 9 por ciento de la varianza, con el mismo efecto de más 0,3000 punto porcentual.
- ¿El ajuste por regresión sesga el resultado de un test aleatorizado?
- Freedman mostró en 2008 que el ajuste tiene sesgo de muestra pequeña, que la precisión puede empeorar y que el error estándar convencional de mínimos cuadrados es inconsistente. Lin reexaminó la crítica en 2013 y mostró que, en muestras suficientemente grandes, esos problemas son menores o de corrección fácil: incluyendo el conjunto completo de interacciones entre tratamiento y covariables, el ajuste no puede empeorar la precisión asintótica, y el error estándar sándwich de Huber y White es consistente o asintóticamente conservador.
- ¿Cuál es la diferencia entre ajuste por regresión y CUPED?
- CUPED es el caso particular en que la covariable es la propia métrica medida en el período anterior al experimento. La matemática es la misma familia: con la elección óptima del coeficiente, la varianza cae por un factor de 1 menos el cuadrado de la correlación. Deng, Xu, Kohavi y Walker relatan que la misma métrica del período preexperimento suele dar la mayor reducción, y que en Bing la reducción quedó en cerca de 50 por ciento, equivalente a duplicar el tráfico.
- ¿Cuánto tráfico ahorra el ajuste en la práctica?
- Exactamente la fracción de la varianza que explican las covariables. Con tasa base de 5 por ciento y objetivo de más 6 por ciento relativo a 95 por ciento de confianza y 80 por ciento de poder, el test pide 85.199 visitantes por variación. Si las covariables explican 9 por ciento de la varianza, el requisito cae a 77.532; si explican 30,25 por ciento, cae a 59.427, es decir, 28 días en vez de 40 a 30 mil visitantes por semana.
- ¿Puedo decidir ajustar después de ver que el resultado quedó sobre la línea?
- No. Elegir entre la lectura ajustada y la cruda después de ver las dos es el mismo problema de decisión múltiple que el peeking crea en el tiempo, e infla la tasa de falso positivo por un camino que ninguna corrección posterior arregla. La especificación del ajuste, es decir, qué covariables entran y en qué forma, tiene que estar en el plan de análisis antes de que exista la primera lectura.
- ¿Qué covariables funcionan mejor?
- La propia métrica del resultado medida antes del experimento es de lejos la mejor, y la ganancia de sumar otras suele ser pequeña. Deng, Xu, Kohavi y Walker registran que combinar la métrica preexperimento con otra covariable rindió apenas 2 a 3 por ciento más de reducción que la métrica preexperimento sola. Fuera de ella, la expectativa realista es modesta: Lin cita a Schochet, que en ocho experimentos sociales encontró R cuadrado por encima de 0,3 solo cuando el resultado era nota de prueba estandarizada o costo de Medicaid y las covariables incluían el resultado rezagado.