Estadística

Ajuste por Regresión en Test A/B: menos ruido en el efecto

El ajuste por regresión usa covariables previas al test para encoger el error estándar sin más tráfico. La cuenta, la crítica de Freedman y Lin.

Ilustración plana de una nube de puntos dispersos a la izquierda que se concentra en una franja densa a la derecha

La muestra que exige un test A/B es proporcional a la varianza de la métrica, y parte de esa varianza usted ya puede explicarla con datos que existían antes del sorteo. El ajuste por regresión cambia la comparación de dos medias crudas por una regresión que incluye esas covariables, mantiene el mismo efecto estimado y encoge el error estándar. En el ejemplo de esta guía, una lectura de 40.000 por brazo con más 0,3000 punto porcentual sale con valor p 0,054907 sin ajuste y 0,044188 cuando las covariables explican 9 por ciento de la varianza. El efecto no cambió; el ruido a su alrededor disminuyó. Esta guía muestra la cuenta, la crítica de Freedman que asustó a una generación de analistas, la corrección de Lin que la resolvió, y la regla de disciplina sin la cual el ajuste se vuelve trampa. Forma parte de nuestra guía completa de test A/B y es la generalización de lo que CUPED hace con una sola covariable.

El tráfico que usted compra es ruido, no señal

El tamaño de muestra de un test lo dictan tres cosas: el efecto que quiere detectar, el riesgo de error que acepta y la varianza de la métrica. Las dos primeras son decisiones suyas. La tercera parece ser una propiedad fija del negocio, y no lo es del todo.

Buena parte de la variación entre usuarios es predecible antes de que empiece el experimento. Quien compró tres veces en los últimos 90 días convierte más que quien nunca compró, y eso es verdad en los dos brazos, porque el sorteo distribuyó los dos tipos por igual. Esa porción predecible no carga ninguna información sobre la variación probada: es ruido puro desde el punto de vista de la pregunta, y aun así usted paga tráfico por ella.

Descomposición de la varianza de la métrica en parte predecible y parte residualUna barra representa la varianza total de la métrica. Está dividida en dos partes: la fracción explicada por covariables medidas antes del sorteo, que no dice nada sobre el efecto de la variación, y la fracción residual, que es el único ruido contra el que el efecto tiene que competir. El ajuste por regresión quita la primera parte de la cuenta del error estándar.varianza de la métrica de conversióntodo esto es lo que usted paga en tráficopredecible: 30%residual: 70%la parte predecible está igual en los dos brazos por el sorteo, luego no puede explicar ningún efecto.el ajuste por regresión la retira del error estándar, y el efecto estimado sigue siendo el mismo.menos ruido en el denominador del z, mismo numerador: la lectura se vuelve más sensible sin un visitante más.
Cortar la parte predecible de la varianza es la única forma de ganar sensibilidad sin comprar tráfico, cambiar la métrica o aumentar el efecto perseguido.

La idea es antigua en muestreo y se llama variable de control. Deng, Xu, Kohavi y Walker la trajeron a la experimentación en línea bajo el nombre CUPED, con la cuenta explícita: eligiendo el coeficiente óptimo, la varianza del estimador pasa a ser la varianza original multiplicada por 1 menos el cuadrado de la correlación entre la métrica y la covariable. Cuanto mayor la correlación, mayor la reducción, y registran que la elección óptima del coeficiente es exactamente la solución de mínimos cuadrados de la regresión del resultado centrado sobre la covariable centrada. Es decir: CUPED es regresión, con una covariable.

El ejemplo trabajado: la misma lectura, dos errores estándar

Un SaaS prueba una nueva pantalla de registro. La métrica primaria es activación en 7 días. El test corre hasta 40.000 visitantes por brazo.

lectura control variación
visitantes 40.000 40.000
activaciones 2.000 2.120
tasa 5,000% 5,300%
Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Pegue esos cuatro números en la calculadora de arriba. El resultado es el punto de partida de todo: efecto de más 0,3000 punto porcentual, más 6,00 por ciento relativo, intervalo de confianza de 95 por ciento entre menos 0,0063 y más 0,6063 punto, y valor p 0,054907. El z, que la calculadora no muestra porque es el paso intermedio, vale 1,9196.

Es el peor lugar posible para que termine un test. El intervalo cruza el cero por seis milésimas de punto. Nadie en la reunión va a llamar a eso nulo, y nadie puede llamarlo victoria.

Ahora suponga que, antes del sorteo, usted tenía para cada usuario: número de sesiones en los 14 días anteriores, origen del tráfico, dispositivo y si ya había iniciado un registro antes. Junte todo en una regresión y suponga que ese conjunto explique 9 por ciento de la varianza del resultado, es decir, una correlación múltiple de 0,30 con la activación. El error estándar del efecto queda multiplicado por 0,953939, que es la raíz de 1 menos 0,09.

El efecto sigue siendo exactamente más 0,3000 punto. El z sube de 1,9196 a 2,0123 y el valor p cae a 0,044188.

Valor p de la misma lectura según la fracción de la varianza explicada por las covariablesSeis barras horizontales muestran el valor p de la misma lectura de 40.000 por brazo con efecto de 0,3 punto porcentual, para fracciones de varianza explicada de 0, 5, 9, 16, 25 y 30,25 por ciento. Sin ajuste el valor p es 0,054907, por encima de la línea de 5 por ciento. A partir de 5 por ciento de varianza explicada el valor p cruza por debajo de la línea, llegando a 0,021534 cuando las covariables explican 30,25 por ciento.mismo efecto de 0,3000 punto, mismos 40.000 por brazolínea de 5%R² = 0 (sin ajuste)p = 0,054907R² = 0,05p = 0,048898R² = 0,09p = 0,044188R² = 0,16p = 0,036218R² = 0,25p = 0,026652R² = 0,3025p = 0,021534el efecto estimado es 0,3000 punto en todas las filas. Lo único que cambia es el error estándar.y por eso la elección de ajustar tiene que tomarse ANTES de ver cualquiera de estas filas.
La barra roja es la lectura cruda. Las verdes son la misma lectura con covariables previas al test de poder creciente. Ninguna de ellas cambió el efecto estimado.

Dos cosas tienen que quedar claras aquí, porque el gráfico de arriba es seductor y peligroso en la misma medida:

  1. El ajuste no inventó efecto. Los 0,3000 punto son los mismos. Lo que cayó fue la incertidumbre sobre ellos, porque parte del ruido que competía con el efecto fue explicada por datos que no tienen ninguna relación con la variación probada.
  2. Si la decisión de ajustar se toma después de ver la barra roja, eso no es análisis, es elección del resultado preferido. La sección sobre disciplina, más adelante, es la parte más importante de este artículo.

Freedman dijo que esto se rompe, y tenía parcialmente razón

En 2008, David Freedman publicó una crítica que se volvió folclore contra el ajuste. Trabajando bajo el modelo de Neyman, en que el efecto puede variar entre individuos, la linealidad no se asume y la aleatorización es la única fuente de variabilidad, mostró tres problemas: el ajuste puede empeorar la precisión asintótica, el error estándar convencional de mínimos cuadrados es inconsistente, y el estimador ajustado tiene sesgo de muestra pequeña. Su frase es directa: la razón del colapso no es difícil de encontrar, porque la aleatorización no justifica los supuestos detrás del modelo de mínimos cuadrados.

La crítica prendió. Lin cita a Berk y coautores resumiendo la lección como “la asignación aleatoria no justifica ninguna forma de regresión con covariables”, con sesgo probable en las estimaciones y errores estándar muy sesgados.

En 2013, Winston Lin reexaminó cada uno de los tres puntos bajo las mismas condiciones de regularidad de Freedman y mostró que, en muestras suficientemente grandes, los problemas son menores o de corrección fácil. Los dos resultados que le interesan a quien corre tests A/B:

Junto a eso viene un detalle operativo bonito: Lin registra que, cuando el efecto no ajustado se calcula regresando el resultado sobre el indicador de tratamiento, el estimador sándwich corregido HC2 devuelve exactamente la estimación de varianza preferida por Neyman y por el propio Freedman, es decir, la suma de las varianzas muestrales divididas por cada tamaño de grupo. Las dos escuelas dan el mismo número.

punto de Freedman (2008) respuesta de Lin (2013) qué hacer en la práctica
el ajuste puede empeorar la precisión asintótica no puede, si el conjunto completo de interacciones tratamiento por covariable está en el modelo centre siempre las covariables e incluya las interacciones con el indicador de brazo
el error estándar convencional de mínimos cuadrados es inconsistente cierto, y por eso no se usa el convencional; el sándwich es consistente o conservador use error estándar robusto, prefiriendo la variante HC2
existe sesgo de muestra pequeña en el estimador ajustado existe, y desaparece con el tamaño; en muestra pequeña o con puntos de alto apalancamiento el sándwich también puede tener sesgo hacia abajo con pocos miles de unidades, prefiera la diferencia de medias o bootstrap

El tercer punto es el que cierra la regla honesta: el ajuste por regresión es una técnica de muestra grande. Un experimento de tráfico en línea con decenas de miles de unidades por brazo está cómodamente en ese territorio. Un piloto con 400 usuarios no lo está, y allí la crítica de Freedman sigue valiendo íntegramente.

Cuánto tráfico devuelve el ajuste por regresión

La cuenta es directa: si las covariables explican una fracción de la varianza, el requisito de muestra cae en la misma fracción. Vale la pena ver eso en días de calendario, que es la moneda de quien opera.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Con tasa base de 5 por ciento, objetivo de más 6 por ciento relativo, 95 por ciento de confianza y 80 por ciento de poder en test de dos colas, la calculadora de arriba devuelve 85.199 visitantes por variación. A 30 mil visitantes por semana divididos entre dos brazos, eso son 40 días. Aplicando la reducción de varianza sobre ese mismo requisito:

varianza explicada correlación visitantes por variación días a 30 mil por semana
0% (sin ajuste) 0,00 85.199 40
5% 0,22 80.940 38
9% 0,30 77.532 37
16% 0,40 71.568 34
25% 0,50 63.900 30
30,25% 0,55 59.427 28
50% 0,71 42.600 20
Días de test según la fracción de la varianza explicada por las covariablesCinco barras horizontales muestran la duración del mismo test a 30 mil visitantes por semana. Sin ajuste son 40 días. Con 9 por ciento de varianza explicada son 37 días, con 25 por ciento son 30 días, con 30,25 por ciento son 28 días y con 50 por ciento son 20 días, la mitad del calendario original.mismo efecto perseguido, misma tasa base, mismo podersin ajuste40 dR² = 0,0937 dR² = 0,2530 dR² = 0,302528 dR² = 0,5020 d20 días en vez de 40 es la diferencia entre 26 y 13 tests por año en la misma superficie.
La reducción de varianza no es elegancia académica: se convierte en número de experimentos por año, que es la variable que más determina cuánto produce un programa de CRO.

El piso de 50 por ciento no es hipotético. Deng, Xu, Kohavi y Walker relatan que, en el sistema de experimentación de Bing, la técnica redujo la varianza en cerca de 50 por ciento, lo que describen como equivalente a duplicar el tráfico o reducir a la mitad el tiempo de ejecución para la misma sensibilidad.

Qué covariables valen la pena

Aquí vive la diferencia entre la teoría y la factura. La ganancia depende por completo de cuánto explican las covariables, y la experiencia publicada es clara sobre quién gana:

covariable expectativa de ganancia observación
la propia métrica del resultado en el período preexperimento alta es la mejor covariable aislada, y es exactamente lo que usa CUPED
métricas de engagement preexperimento (sesiones, páginas vistas) media correlacionadas con casi todo, pero menos que el resultado rezagado
dispositivo, canal de adquisición, país baja útiles por ser baratas de recolectar, rara vez mueven la aguja solas
variables medidas DESPUÉS del sorteo prohibida cualquier cosa que el tratamiento pueda haber afectado rompe el sorteo

Los autores de CUPED son explícitos sobre el primer punto: usar la misma métrica del período preexperimento típicamente da la mayor reducción de varianza. Y miden el retorno de sumarle otra covariable: combinando las dos, ganaron apenas 2 a 3 por ciento más de reducción que con la métrica preexperimento sola. Es decir, el segundo punto de la lista rara vez compensa la complejidad.

Vale la expectativa realista para quien no tiene el resultado rezagado disponible. Lin cita a Schochet, que examinó ocho experimentos sociales con resultados variados y encontró R cuadrado por encima de 0,3 solo cuando el resultado era nota de prueba estandarizada o costo de Medicaid y las covariables incluían el resultado rezagado. Lin registra la conclusión general: la constatación de que el ajuste tiene poco efecto sobre la precisión no es inusual en experimentos sociales, porque las covariables suelen tener correlación débil con el resultado.

La lectura práctica de eso es incómoda y honesta: si usted no consigue medir la métrica del resultado antes del experimento, el ajuste probablemente va a devolver unos pocos por ciento, no 50. Un usuario nuevo, que nunca convirtió, no tiene métrica preexperimento ninguna, y es justamente él quien domina el embudo de adquisición.

La regla que separa el análisis de la trampa

El ajuste por regresión tiene un grado de libertad explosivo: qué covariables entran, en qué forma funcional, con qué interacciones, con qué tratamiento de valores faltantes. Cada una de esas elecciones mueve el valor p. Un analista de buena fe que pruebe tres especificaciones y reporte la mejor está haciendo exactamente lo que mostró el gráfico de la segunda sección, solo que sin darse cuenta.

Cómo la elección de la especificación después del resultado infla el falso positivoUn mismo conjunto de datos lleva a cuatro especificaciones posibles de ajuste, cada una con un valor p diferente. Elegir entre ellas después de ver los cuatro números es una decisión múltiple disfrazada de análisis único, y la tasa real de falso positivo queda muy por encima del 5 por ciento declarado.un conjuntode datossin ninguna covariablep = 0,0549solo dispositivo y canalp = 0,0489el bloque completop = 0,0442el bloque con interaccionesp = 0,0362elegir aquí,después de ver loscuatro, no esun solo test.
Los cuatro valores p del diagrama son los mismos de la tabla anterior, solo que rotulados como especificaciones plausibles. Sin preregistro, el analista elige cuál reportar después de conocerlos todos.

La regla es simple y no tiene excepción razonable: la especificación del ajuste entra en el plan de análisis preregistrado, antes de que exista la primera lectura. Lo que tiene que estar escrito ahí:

Este último punto es la protección más barata que existe. Publicar las dos lecturas lado a lado convierte cualquier divergencia grande entre ellas en una señal de diagnóstico, y no en una elección. Si la lectura cruda y la ajustada discrepan mucho, algo está mal con el sorteo o con las covariables, y vale revisar el reparto desigual de tráfico antes que cualquier otra cosa.

Una hoja de ruta de siete pasos para el ajuste por regresión

  1. Verifique si la métrica del resultado existe en el período preexperimento. Si existe, ella es su mejor covariable y el resto es secundario.
  2. Congele las covariables en el instante del sorteo. Nada medido después entra, sin excepción, aunque parezca inofensivo.
  3. Escriba la especificación en el plan de análisis, con nombre de campo y ventana, antes de que exista la primera lectura.
  4. Centre las covariables e incluya las interacciones con el brazo, que es la forma que Lin mostró que no puede empeorar la precisión asintótica.
  5. Use error estándar robusto, prefiriendo HC2, y nunca el error estándar convencional de mínimos cuadrados.
  6. Reporte las dos lecturas, la cruda y la ajustada, siempre juntas, en el mismo informe.
  7. Si la muestra es pequeña, algunos cientos por brazo, no ajuste: reporte la diferencia de medias y trate la crítica de Freedman como válida, porque en ese régimen lo es.

Errores comunes

Hágalo automático con Donnu

El ajuste por regresión depende de algo que se decide mucho antes del análisis: las covariables tienen que estar selladas en el instante del sorteo, no reconstruidas después a partir del estado actual del usuario. Un campo de “número de sesiones” leído el día del informe ya contiene las sesiones que causó la variación, y usar eso como covariable previa al test no reduce varianza, contamina la estimación.

Donnu sella el estado del usuario en el momento de la asignación, lo que deja el bloque de covariables disponible sin reconstrucción manual y sin riesgo de fuga postratamiento. Y vale la regla de alcance: cuando la métrica del resultado existe en el período anterior, úsela primero, porque es ella la que carga casi toda la ganancia. La calculadora de tamaño de muestra cierra la cuenta de cuánto calendario devuelve esto, aplicando la fracción de varianza explicada sobre el requisito bruto.

Referencias

Lea también: Qué es CUPED · Estratificación en test A/B · Efecto mínimo detectable · Plan de análisis preregistrado · Calculadora de tamaño de muestra · Leia em português

Preguntas frecuentes

¿Qué es el ajuste por regresión en un test A/B?
Es estimar el efecto de la variación en una regresión que incluye covariables medidas ANTES del sorteo, en vez de comparar dos medias crudas. El efecto estimado sigue siendo el mismo objetivo, pero el error estándar encoge en proporción a la varianza del resultado que explican las covariables. En el ejemplo de esta guía, una lectura de 40.000 por brazo sale con valor p 0,054907 sin ajuste y 0,044188 con covariables que explican 9 por ciento de la varianza, con el mismo efecto de más 0,3000 punto porcentual.
¿El ajuste por regresión sesga el resultado de un test aleatorizado?
Freedman mostró en 2008 que el ajuste tiene sesgo de muestra pequeña, que la precisión puede empeorar y que el error estándar convencional de mínimos cuadrados es inconsistente. Lin reexaminó la crítica en 2013 y mostró que, en muestras suficientemente grandes, esos problemas son menores o de corrección fácil: incluyendo el conjunto completo de interacciones entre tratamiento y covariables, el ajuste no puede empeorar la precisión asintótica, y el error estándar sándwich de Huber y White es consistente o asintóticamente conservador.
¿Cuál es la diferencia entre ajuste por regresión y CUPED?
CUPED es el caso particular en que la covariable es la propia métrica medida en el período anterior al experimento. La matemática es la misma familia: con la elección óptima del coeficiente, la varianza cae por un factor de 1 menos el cuadrado de la correlación. Deng, Xu, Kohavi y Walker relatan que la misma métrica del período preexperimento suele dar la mayor reducción, y que en Bing la reducción quedó en cerca de 50 por ciento, equivalente a duplicar el tráfico.
¿Cuánto tráfico ahorra el ajuste en la práctica?
Exactamente la fracción de la varianza que explican las covariables. Con tasa base de 5 por ciento y objetivo de más 6 por ciento relativo a 95 por ciento de confianza y 80 por ciento de poder, el test pide 85.199 visitantes por variación. Si las covariables explican 9 por ciento de la varianza, el requisito cae a 77.532; si explican 30,25 por ciento, cae a 59.427, es decir, 28 días en vez de 40 a 30 mil visitantes por semana.
¿Puedo decidir ajustar después de ver que el resultado quedó sobre la línea?
No. Elegir entre la lectura ajustada y la cruda después de ver las dos es el mismo problema de decisión múltiple que el peeking crea en el tiempo, e infla la tasa de falso positivo por un camino que ninguna corrección posterior arregla. La especificación del ajuste, es decir, qué covariables entran y en qué forma, tiene que estar en el plan de análisis antes de que exista la primera lectura.
¿Qué covariables funcionan mejor?
La propia métrica del resultado medida antes del experimento es de lejos la mejor, y la ganancia de sumar otras suele ser pequeña. Deng, Xu, Kohavi y Walker registran que combinar la métrica preexperimento con otra covariable rindió apenas 2 a 3 por ciento más de reducción que la métrica preexperimento sola. Fuera de ella, la expectativa realista es modesta: Lin cita a Schochet, que en ocho experimentos sociales encontró R cuadrado por encima de 0,3 solo cuando el resultado era nota de prueba estandarizada o costo de Medicaid y las covariables incluían el resultado rezagado.