Estadística

Ciclo Semanal en Test A/B: ejecuta semanas enteras

Ciclo semanal en test A/B: por qué parar el viernes mide otra cosa, cuánto distorsiona el lift la ventana parcial y por qué estratificar por día no ayuda.

Ilustración plana de dos franjas de colinas verdes redondeadas de perfil, una clara arriba y otra oscura abajo, repitiendo el mismo dibujo de elevaciones a lo largo del cuadro

Un test que se ejecuta de lunes a viernes no mide lo mismo que un test que recorre el ciclo semanal entero. En el modelo de este artículo, la ganancia verdadera de la semana es 6,89 por ciento relativo, y la ventana de lunes a viernes devuelve 6,00 por ciento: 12,86 por ciento menor, sin ningún error de estadística. La comparación en sí sigue siendo válida, con un falso positivo del 4,40 por ciento bajo la nula. Lo que cambió no fue la precisión, fue la pregunta. Esta guía muestra qué está estimando cada ventana de calendario, cuánto contamina el plan de muestra una base equivocada, por qué estratificar por día de la semana no devuelve casi nada de precisión, y dónde queda el límite superior de duración. Forma parte de nuestra guía completa de test A/B y complementa cuántos visitantes necesita un test A/B.

El sitio modelo

Para hablar con números, necesitamos un sitio. El nuestro tiene 40 mil visitantes por semana, con el patrón común del comercio: más gente en los días laborables, público diferente el fin de semana. Y el cambio probado ayuda más a quien navega el sábado y el domingo, lo cual también es común, porque el fin de semana el tráfico es más casual y más móvil.

Día Visitantes Tasa del control Tasa de la variante Ganancia relativa
Lunes a viernes (cada día) 6.400 5,20% 5,512% 6%
Sábado y domingo (cada día) 4.000 3,60% 4,032% 12%
Perfil semanal de tráfico y tasa de conversión del sitio modeloGráfico que combina barras y línea. Las barras muestran los visitantes por día: cinco barras altas iguales de lunes a viernes con 6.400 visitantes y dos barras más bajas el sábado y el domingo con 4.000. La línea sobre las barras muestra la tasa de conversión del control, plana en 5,20 por ciento en los cinco días laborables y cayendo a 3,60 por ciento en los dos días de fin de semana.tasa del control 5,20%3,60%6.4006.4006.4006.4006.4004.0004.000lunmarmiéjueviesábdomDos poblaciones diferentes dentro de la misma semanaEl 80% del tráfico cae en los días laborables, y su tasa es un 44% mayor que la del fin de semana.
No existe “el visitante del sitio”. Existen los visitantes del martes y los del domingo, y la ventana de calendario decide la proporción entre ellos en tu media.

El objetivo, la cantidad que quieres estimar, es la ganancia relativa media sobre una semana completa: 6,8852 por ciento. Sale de una media ponderada, 80 por ciento del tráfico ganando 6 por ciento sobre una base alta y 20 por ciento ganando 12 por ciento sobre una base baja.

El ciclo semanal: qué mide cada ventana de calendario

Con el modelo definido, se puede calcular exactamente qué devuelve cada duración, sin ningún ruido muestral de por medio:

Ventana Base medida Ganancia absoluta Ganancia relativa Error contra la semana entera
Lunes a viernes (5 días) 5,2000% 0,3120 pp 6,0000% menos 12,86%
Lunes a sábado (6 días) 5,0222% 0,3253 pp 6,4779% menos 5,92%
Semana entera (7 días) 4,8800% 0,3360 pp 6,8852% objetivo
9 días (semana más lun y mar) 4,9576% 0,3302 pp 6,6601% menos 3,27%
12 días (semana más lun a vie) 5,0222% 0,3253 pp 6,4779% menos 5,92%
Dos semanas (14 días) 4,8800% 0,3360 pp 6,8852% cero
Solo el fin de semana (2 días) 3,6000% 0,4320 pp 12,0000% más 74,29%
Ganancia relativa medida por ventana de calendarioGráfico de barras con seis columnas y una línea discontinua horizontal marcando el valor objetivo de 6,89 por ciento. La columna de cinco días queda claramente por debajo de la línea, en 6,00 por ciento. Las de seis, nueve y doce días quedan un poco por debajo, entre 6,48 y 6,66. Las columnas de siete y de catorce días tocan exactamente la línea. El eje vertical empieza en 5,5 por ciento para hacer visibles las diferencias.objetivo de la semana entera: 6,89%6,00%6,48%6,89%6,66%6,48%6,89%5 días6 días7 días9 días12 días14 díasSolo los múltiplos de siete aciertan el objetivoEl eje vertical empieza en 5,5% para hacer visibles las diferencias. Valores exactos del modelo, sin ruido muestral.
Siete y catorce días aciertan el objetivo por construcción. Cualquier otra duración devuelve una media ponderada de un conjunto de días que no es tu semana.

Dos lecturas merecen destacarse. La primera: estirar el test sin cerrar la semana puede empeorar en vez de mejorar. Doce días se equivocan tanto como seis (5,92 por ciento), porque doce días son una semana entera más cinco días laborables, es decir, los días laborables entran de nuevo con peso extra. La segunda: el error es sistemático, no aleatorio. Ejecutar más réplicas del test de cinco días no hace que el resultado converja a 6,89 por ciento; converge a 6,00 por ciento, que es la respuesta correcta a una pregunta que nadie hizo.

¿Esto es sesgo o no lo es?

Aquí vale la precisión que suele faltar en la discusión. No es sesgo en la comparación. Los dos brazos reciben exactamente los mismos días, en la misma proporción, así que el estimador sigue estimando correctamente lo que contienen esos días. Lo confirmamos ejecutando 3.000 réplicas bajo la hipótesis nula, con control y variante idénticos:

Ventana Falso positivo medido Ganancia relativa media Error estándar de Monte Carlo
5 días 4,40% 0,0880% 0,40 pp
7 días 5,17% 0,0958% 0,40 pp
9 días 5,00% 0,0357% 0,40 pp

Todas dentro de lo nominal. El problema es de objetivo, no de precisión. Un test de cinco días estima con honestidad el efecto medio entre lunes y viernes; si vas a lanzar el cambio para los siete días de la semana, ese no es el número que sostiene la decisión. La distinción importa porque cambia el remedio: no sirve más muestra, sirve la ventana correcta.

Lo que la base equivocada le hace al plan

El estrago más silencioso ocurre antes de que empiece el test. Si mediste la tasa base en un periodo que no cierra la semana, todo el plan de muestra hereda el error.

De dónde vino la tasa base Tasa base N por variante (MDE 10% relativo) Días a 40 mil por semana
Lunes a viernes 5,2000% 29.966 11
Semana entera 4,8800% 32.045 12
Solo el fin de semana 3,6000% 44.054 16
Calculadora de duración de test A/B
-Duración estimada
Visitantes en total-
Término previsto-

Aproximación normal de dos proporciones, división igual entre las variaciones. La fecha usa tu zona horaria y recalcula en vivo.

Compruébalo en la calculadora: base 4,88, MDE 10 por ciento relativo, 2 variantes, 40.000 visitantes por semana, confianza 95, potencia 80, bilateral. Devuelve los 12 días de la fila del medio. Cambiando la base a 5,2, el plan baja a 11 días y parece haber quedado más barato, cuando en realidad solo quedó 6,5 por ciento optimista. Una tasa base medida en una ventana parcial es la forma más común de subestimar un plan de test, y no deja rastro: el número parece plausible, el plan parece bien hecho, y el test termina demasiado pronto.

La lectura diaria de un test real

Simulamos un único test del sitio modelo ejecutándose durante tres semanas, con el efecto verdadero de 6,89 por ciento, y leímos el panel todos los días:

Día Control Variante Ganancia relativa valor p ¿Por debajo de 0,05?
1 (lun) 177 de 3.200 156 de 3.200 menos 11,86% 0,2372 no
3 (mié) 474 de 9.600 527 de 9.600 11,18% 0,0853 no
7 (dom) 988 de 20.000 1.060 de 20.000 7,29% 0,1024 no
11 (jue) 1.645 de 32.800 1.773 de 32.800 7,78% 0,0245 sí
14 (dom) 1.975 de 40.000 2.128 de 40.000 7,75% 0,0142 sí
17 (mié) 2.522 de 49.600 2.645 de 49.600 4,88% 0,0788 no
21 (dom) 2.995 de 60.000 3.185 de 60.000 6,34% 0,0131 sí

Tres cosas para llevarse de esa tabla. El primer día el panel decía que la variante era 11,86 por ciento PEOR. El día 11 el resultado quedó significativo, el día 17 dejó de serlo, y el día 21 volvió a serlo: parar en cualquiera de esos puntos da una historia diferente, que es exactamente el problema del peeking. Y los tres cierres de semana, en los días 7, 14 y 21, devuelven 7,29, 7,75 y 6,34 por ciento, un intervalo bastante más estrecho y más cerca del 6,89 verdadero que cualquier secuencia de lecturas a mitad de semana.

Ganancia relativa acumulada día a día a lo largo de tres semanasLínea de la ganancia relativa acumulada a lo largo de 21 días. Empieza en menos 11,86 por ciento el primer día, sube abruptamente a la franja de 7 a 11 por ciento en la primera semana, oscila entre 5 y 8 por ciento en la segunda y la tercera, y termina en 6,34 por ciento. Una línea discontinua horizontal marca el valor verdadero de 6,89 por ciento y otra marca el cero. Tres líneas verticales finas marcan los cierres de semana en los días 7, 14 y 21.ceroverdad: 6,89%fin de la semana 1semana 2semana 3día 1: menos 11,86%El mismo test, leído todos los díasUna única simulación con semilla fija, efecto verdadero de 6,89% relativo. Los puntos oscuros son los cierres de semana.
La primera semana es volátil por naturaleza. Los cierres de semana son los puntos en que la lectura pasa a ser comparable con la anterior.

Y cuantas más semanas, más estable queda la lectura, con la potencia subiendo a la par:

Duración Visitantes totales Ganancia relativa media Desviación estándar entre réplicas Detectó en
5 días 32.000 6,252% 5,011 23,80% de las réplicas
7 días 40.000 7,078% 4,746 34,27%
9 días 52.800 6,757% 4,024 40,20%
14 días 80.000 6,942% 3,318 57,70%
21 días 120.000 6,797% 2,689 73,90%

Estratificar por día de la semana no devuelve precisión

Una reacción natural a todo esto es querer corregir el análisis estratificando por día. La cuenta dice que no vale la pena, y la diferencia es lo bastante grande para cerrar la discusión.

Descomponiendo la varianza del indicador de conversión en nuestro modelo, con la tasa media de la semana en 4,88 por ciento:

Componente Valor
Varianza total 4,64185600 por 10 elevado a menos 2
Dentro de los días 4,63776000 por 10 elevado a menos 2
Entre días 4,09600000 por 10 elevado a menos 5
Techo de reducción por estratificar en día 0,0882%

El día de la semana explica menos de una décima de un por ciento de la varianza. Y en la práctica ni esa décima aparece: cuando el reparto de tráfico está equilibrado dentro de cada día, el estimador posestratificado coincide con el agrupado, y la reducción medida en 6.000 réplicas de test A/A fue del 0,0000 por ciento, con varianza idéntica hasta la sexta cifra decimal en ambos.

La razón es que una conversión es un evento binario, y la varianza de un evento binario está dominada por p por 1 menos p, que cambia muy poco entre 3,6 y 5,2 por ciento. El ciclo semanal es un problema de estimando, no de ruido. Si tu objetivo es reducir varianza, el camino es otro, y pasa por covariables continuas de preperiodo, como explicamos en CUPED.

Y el límite superior: cuándo el test es demasiado largo

Ejecutar en múltiplos de semana no quiere decir ejecutar para siempre. Kohavi, Longbotham, Sommerfield y Henne ponen la frontera en números al discutir repartos desiguales: un experimento que necesitara más de 125 días no debería ejecutarse, porque es un periodo demasiado largo para un resultado confiable y porque factores de impacto secundario en tests de pocas semanas, como el cambio de cookie, empiezan a contaminar los datos.

Los mismos autores registran una advertencia aún menos conocida: algunas métricas tienen una mala característica de potencia, en el sentido de que su potencia de hecho empeora conforme el experimento se ejecuta durante más tiempo. Para esas, su recomendación es garantizar un número adecuado de usuarios por día y grupos de tratamiento y control de tamaños iguales, en lugar de simplemente estirar el calendario.

El otro lado de la cuenta es el efecto novedad. Kohavi, Deng, Longbotham y Xu recomiendan ejecutar experimentos durante dos semanas justamente para buscar efectos que desaparecen rápido, y observan que, en la práctica, novedad y primacía son poco comunes y aparecen sobre todo en sistemas de recomendación. Lo tratamos en efecto novedad.

Juntando las tres puntas, la regla práctica queda corta:

  1. Mide la base en una ventana que cierre semana. Si tienes 28 días de histórico, usa 28, no 30.
  2. Planifica en semanas. Toma los días que devolvió la calculadora y redondea hacia arriba hasta el siguiente múltiplo de siete. Doce días se convierten en catorce.
  3. Dos semanas es el piso cómodo, una es el mínimo, y la segunda semana sirve para comparar con la primera.
  4. Para siempre el mismo día de la semana en que empezaste. Una lectura de lunes a domingo es comparable con la anterior; una de miércoles a jueves no lo es.
  5. Por encima de diez o doce semanas, desconfía del diseño, no de la paciencia. El problema probablemente es tráfico insuficiente para el efecto que quieres detectar, y la respuesta está en CRO para sitios de bajo tráfico.

Hazlo automático en Donnu

El error del ciclo semanal casi nunca aparece como error: aparece como un test que terminó el viernes porque el viernes era el fin del sprint. En Donnu la fecha prevista de término ya sale redondeada para cerrar la misma ventana de días de la semana en que empezó el test, y el panel muestra la lectura cerrada por semana junto a la acumulada, para que el equipo compare la semana 1 con la semana 2 en lugar de comparar miércoles con miércoles. Cuando la tasa base del plan se estima a partir de tu histórico, la ventana usada también cierra en múltiplos de siete días, para que el número que entra en la calculadora no venga con el mismo sesgo que describe este artículo.

Preguntas frecuentes

Las respuestas cortas están en la sección de preguntas frecuentes de esta página, montadas a partir de los mismos cálculos presentados aquí.

Referencias

Lee también

Read in English · Leia em português

Preguntas frecuentes

¿Por qué ejecutar un test A/B durante semanas enteras?
Porque la ventana de calendario decide qué días entran en la media, y días diferentes tienen públicos diferentes. Kohavi y coautores recomiendan ejecutar experimentos durante al menos una o dos semanas y después continuar en múltiplos de una semana, justamente para que el efecto de día de la semana pueda analizarse. En el modelo de este artículo, medir de lunes a viernes devolvió 6,00 por ciento de ganancia relativa contra el 6,89 por ciento de la semana entera, una diferencia del 12,86 por ciento en el tamaño del efecto.
¿Parar el test el viernes sesga la comparación entre control y variante?
No en el sentido estadístico estricto, y vale ser preciso. En nuestras 3.000 réplicas bajo la hipótesis nula, la tasa de falso positivo quedó en 4,40 por ciento para 5 días, 5,17 por ciento para 7 y 5,00 por ciento para 9, todas dentro del error de simulación. Los dos brazos ven los mismos días, así que la comparación sigue siendo válida. Lo que cambia es QUÉ se está estimando: la media sobre los días incluidos, no sobre la semana.
¿Vale la pena estratificar el análisis por día de la semana para ganar precisión?
Prácticamente no. Descomponiendo la varianza en nuestro modelo, el día de la semana explica el 0,0882 por ciento del total, y ese es el techo teórico de la ganancia. Cuando el reparto de tráfico está equilibrado dentro de cada día, la estimación posestratificada y la agrupada coinciden, y la reducción medida en 6.000 réplicas fue del 0,0000 por ciento. El ciclo semanal importa para lo que mides, no para la precisión con la que mides.
¿Cuánto tiempo es demasiado tiempo para un test A/B?
Kohavi y coautores dan la frontera práctica: un experimento que exigiría más de 125 días es demasiado largo para dar un resultado confiable, porque factores de impacto secundario en tests de pocas semanas, como el cambio de cookie, empiezan a contaminar los datos. Súmale la advertencia de los mismos autores de que algunas métricas tienen una mala característica de potencia, en el sentido de que su potencia de hecho empeora conforme el experimento se ejecuta durante más tiempo.
¿La ventana parcial estropea el cálculo de muestra?
Lo estropea, por el lado de la tasa base. En nuestro modelo, la base medida de lunes a viernes es 5,20 por ciento y la de la semana entera es 4,88 por ciento. Llevando cada una a la calculadora con un MDE del 10 por ciento relativo, la primera pide 29.966 visitantes por variante y la segunda pide 32.045: un plan 6,5 por ciento optimista, hecho con un número que parecía correcto.
¿Dos semanas o una?
Dos, cuando se pueda. La recomendación de Kohavi y coautores para el efecto novedad es ejecutar experimentos durante dos semanas y mirar ese tipo de efecto, y la de estacionalidad es empezar con una o dos semanas y seguir en múltiplos de siete días. Una semana ya resuelve la composición de días; la segunda es la que permite comparar la semana 1 con la semana 2 y ver si el efecto es estable o si se está muriendo.