Estadística

Serie Temporal Interrumpida: el efecto de un lanzamiento

Serie temporal interrumpida: la regresión segmentada separa escalón, tendencia y estacionalidad de lo que ya crecía antes del lanzamiento.

Ilustración plana de una línea ascendente sobre una cuadrícula, cortada por un marcador vertical discontinuo, con una línea punteada pálida siguiendo la inclinación antigua por debajo de ella

Cuando el lanzamiento alcanza a todos al mismo tiempo, el único control disponible es el pasado de la propia métrica. En la simulación de esta guía, el efecto real incorporado era de más 0,10 punto porcentual: comparar el promedio de después con el promedio de antes devolvió más 0,96 punto, la regresión segmentada sin control estacional devolvió más 0,31 punto, y la regresión segmentada con estacionalidad devolvió más 0,166 punto con intervalo del 95 por ciento entre más 0,029 y más 0,302 después de corregir la autocorrelación. Esta guía muestra cómo armar la cuenta de la serie temporal interrumpida, las tres trampas que la hacen mentir y la prueba placebo que atrapa la mentira antes de que publiques el número. Forma parte de nuestra guía completa de test A/B y complementa diferencias en diferencias y control sintético.

El problema: existe un cambio que no deja a nadie fuera

No todo cambio admite un grupo de control paralelo, ni siquiera por plaza:

En esos casos no existe ni grupo aleatorizado (el camino del test A/B) ni grupo de control paralelo (el camino de diferencias en diferencias). Queda una sola cosa: la serie histórica de la métrica antes del cambio. La serie temporal interrumpida es el diseño que convierte ese pasado en un contrafactual explícito.

Vale registrar que la alternativa preferida sigue siendo aleatorizar. Cuando el cambio quepa en un sorteo de usuario, aleatoriza, porque ningún modelado de serie sustituye a un grupo de control simultáneo.

La lectura ingenua, y la calculadora que la confirma con entusiasmo

Simulamos 78 semanas de tasa de conversión de un sitio: 52 semanas antes de un rediseño y 26 después. La serie tiene tendencia al alza (el negocio estaba creciendo), estacionalidad anual y semestral, y ruido correlacionado en el tiempo. El efecto real del rediseño, incorporado en la simulación, es un escalón de más 0,10 punto porcentual.

La lectura ingenua agrega todo y compara dos promedios:

período visitantes conversiones tasa
52 semanas antes 260.000 7.509 2,8881%
26 semanas después 130.000 5.001 3,8469%

Pega esos números en la calculadora de abajo y mira el veredicto.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

La calculadora devuelve 2,89 por ciento contra 3,85 por ciento, más 33,2 por ciento en términos relativos y valor-p por debajo de lo que logra exhibir, con intervalo de confianza del 95 por ciento entre más 0,8 y más 1,1 punto. La diferencia bruta entre las dos tasas es de 0,9588 punto porcentual. Un resultado aplastante para un efecto real de 0,10 punto: casi diez veces la verdad, con precisión aparente altísima.

La calculadora no se equivocó. Respondió exactamente la pregunta que recibió, que era “¿las dos proporciones son diferentes?”. Las dos sí son diferentes. Lo que ella no puede saber es que la diferencia ya venía en camino antes de que el rediseño existiera.

La cuenta correcta de la serie temporal interrumpida: escalón, tendencia y estacionalidad

La regresión segmentada estima tres cosas de una vez, sobre la serie semanal (no sobre el agregado). En la formulación del tutorial de Lopez Bernal, Cummins y Gasparrini, el modelo tiene un término de tiempo, un indicador de período posintervención y la interacción entre los dos:

Serie semanal de conversión con corte en la semana 53Línea de tasa de conversión semanal subiendo a lo largo de 78 semanas, cortada por una línea vertical discontinua en la semana 53. Una recta de tendencia atraviesa la serie entera y una segunda recta paralela, desplazada hacia arriba, acompaña el período posterior.2,42,83,23,64,0tasa (%)rediseñosemana 53contrafactual: la tendencia previaproyectada hacia adelantes1s27s53s78El efecto es la distancia entre la línea llena oscura y la discontinua gris, no la diferencia entre los dos promedios.
La comparación de promedios mide la distancia entre dos niveles. La serie interrumpida mide la distancia entre lo observado y la proyección de lo que ya venía ocurriendo.

Corriendo los cuatro modelos sobre la misma serie de 78 semanas:

lectura escalón estimado intervalo del 95% estadístico t
promedios de antes y después más 0,960 pp 0,864 a 1,056 19,66
indicador de período, sin término de tendencia más 0,960 pp 0,851 a 1,069 17,23
segmentada con tendencia, sin estacionalidad más 0,313 pp 0,249 a 0,377 9,56
segmentada con tendencia y estacionalidad más 0,166 pp 0,069 a 0,263 3,34
efecto real incorporado en la simulación más 0,100 pp

El segundo modelo merece atención: incluir un indicador de “después” sin incluir el término de tiempo no arregla nada. Devuelve exactamente la diferencia de promedios, porque es matemáticamente lo mismo. Lo que corrige la lectura es el término de tendencia, y él solo ya derriba la estimación de 0,96 a 0,31 punto. La estacionalidad la baja de 0,31 a 0,166.

Las tres trampas

1. La tendencia previa, que es la trampa principal

Fue lo que acabamos de ver: una serie que ya sube 0,017 punto por semana acumula casi 0,9 punto a lo largo de 52 semanas. Si comparas el promedio de las 26 semanas siguientes con el promedio de las 52 anteriores, atribuyes al lanzamiento prácticamente toda esa acumulación. Ningún ajuste posterior salva una lectura que no modeló la tendencia.

2. La estacionalidad, que se disfraza de efecto

Si el período de después cae en una parte del año mejor que el promedio, el escalón captura la estación. Lopez Bernal, Cummins y Gasparrini alertan exactamente sobre eso: una distribución desigual de meses antes y después de la intervención puede sesgar el resultado. En su ejemplo trabajado, sobre la ley antitabaco italiana de enero de 2005 y las internaciones por eventos coronarios agudos, la estimación no ajustada fue de una reducción del 11 por ciento (razón de riesgo de 0,894, con intervalo del 95 por ciento entre 0,864 y 0,925 y valor-p por debajo de 0,001), y el ajuste estacional llevó la razón de riesgo a 0,885 con intervalo entre 0,839 y 0,933.

En nuestra simulación, el efecto es mayor porque el período de después cubre medio año de estacionalidad favorable: sin control, el escalón viene 0,31; con dos pares de términos armónicos, 0,166.

3. La autocorrelación, que aprieta el intervalo de confianza sin derecho

Las semanas vecinas se parecen. Si esta semana estuvo por encima de la tendencia, la próxima también tiende a estarlo. La regresión común presume independencia entre observaciones y, cuando esa premisa se rompe, el error estándar sale demasiado pequeño y el intervalo sale demasiado estrecho.

En nuestra serie, la autocorrelación de rezago 1 de los residuos era 0,589 en el modelo sin estacionalidad y cayó a 0,328 con estacionalidad (el estadístico de Durbin-Watson pasó de 0,80 a 1,34). Una corrección simple por el factor de inflación lleva el intervalo del escalón de más 0,069 a más 0,263 a más 0,029 a más 0,302 punto. El efecto real de 0,10 está dentro de los dos, pero el segundo es honesto sobre cuánto todavía no se sabe.

Los autores del tutorial recomiendan siempre evaluar la autocorrelación por el gráfico de los residuos y por pruebas formales, y en su ejemplo el ajuste por sobredispersión amplió el intervalo de 0,839 a 0,933 hacia 0,839 a 0,953, cambiando el valor-p de por debajo de 0,001 a 0,001. El signo siguió siendo el mismo. La confianza disminuyó.

Estimación del escalón por modeloBarras horizontales que muestran el escalón estimado por cuatro modelos, decreciendo de 0,96 punto en la comparación de promedios a 0,166 punto en la regresión segmentada con estacionalidad, con una línea vertical que marca el efecto real de 0,10 punto.escalón estimado, en puntos porcentualespromedios antes y después0,960indicador sin tendencia0,960con tendencia0,313con tendencia y estacionalidad0,166efecto real: 0,100barra del último modelo con el intervalo corregido
Cada término que entra en el modelo quita una capa de explicación alternativa. El orden importa: tendencia primero, estacionalidad después, incertidumbre corregida al final.

4. La forma del efecto, que rara vez es un escalón limpio

El modelo estándar pregunta “¿hubo un salto en la semana del cambio?”. Pero buena parte de los cambios de producto no produce ningún salto en la primera semana. Cuatro formatos aparecen con frecuencia, y cada uno exige un término diferente:

formato del efecto cómo aparece en la serie qué necesita el modelo riesgo si usas solo escalón
escalón limpio salto inmediato y nivel nuevo indicador de posintervención ninguno, es el caso feliz
efecto que se acumula pendiente mayor después de la fecha término de interacción entre tiempo y pos subestima, porque el promedio del inicio del pos sigue bajo
efecto con retraso nada por algunas semanas, después salto período de transición excluido de la cuenta subestima, porque las semanas muertas bajan el promedio
pico que se disipa salto grande que decae ventana de lectura larga e inspección visual sobreestima, porque lee solo la fase del pico

El tercer caso es el más común en producto: un cambio de onboarding solo afecta la conversión de quien entró después de él, y lleva semanas para que la base lo refleje. La práctica usual es declarar un período de transición, típicamente las primeras semanas después de la fecha, y removerlo del modelo en vez de forzarlo a caber en un escalón.

El cuarto es el más peligroso, porque parece la mejor noticia del trimestre. Un rediseño que genera curiosidad produce un pico que decae, el mismo mecanismo del efecto novedad. Leer dos semanas después del corte y publicar el escalón es la receta para revertir la decisión dos meses después.

En todos los casos, mirar el gráfico antes de correr el modelo es obligatorio. La regresión devuelve un número incluso cuando el formato del efecto no cabe en el modelo, y no avisa.

5. La composición del tráfico, que cambia sin que nadie la toque

Existe una última fuente de error que ningún término temporal captura: la mezcla de quien llega al sitio cambia a lo largo del período, y la tasa de conversión agregada cambia junto con ella sin que nada en el producto haya cambiado. Si la proporción de tráfico pago subió en el semestre del lanzamiento, y el tráfico pago convierte menos, el escalón viene hacia abajo por un motivo que no es el rediseño.

La verificación es la misma que se usa en paradoja de Simpson: corre el modelo por segmento, no solo en el total. Si el escalón aparece igual en todos los canales, la lectura es robusta. Si existe solo en el agregado y desaparece en cada canal por separado, lo que mediste fue el cambio de mezcla.

La prueba placebo que atrapa la lectura equivocada antes de la publicación

Existe una verificación barata que debería ser obligatoria: elige una fecha dentro del período previo, donde no hubo ningún cambio, y corre el mismo modelo como si ahí hubiera habido una intervención. Si el modelo encuentra un escalón, está capturando estructura de la serie, no el efecto de tu cambio.

Corrimos eso en nuestra serie, con corte falso en la semana 27 y usando solo las 52 semanas anteriores al rediseño de verdad:

modelo placebo escalón en el corte falso estadístico t veredicto
segmentada sin estacionalidad menos 0,168 pp menos 4,35 falso positivo
segmentada con estacionalidad más 0,031 pp 0,56 correctamente nulo

Fíjate en lo que entregó esa prueba: la versión sin control estacional acusó un efecto estadísticamente significativo donde no existía ninguna intervención. Si hubieras corrido solo el modelo simple y visto el escalón de 0,31 en el corte de verdad, no habrías tenido cómo saber que estaba contaminado. El placebo lo dice.

Esa es la misma lógica que Imbens y Xu ponen entre las cinco lecciones de la literatura de métodos no experimentales: usar un desenlace o un período que el tratamiento no podía haber afectado y verificar si el análisis devuelve cero. Un efecto no nulo en el placebo indica confusión no observada.

Cuando existe control, usa control

La serie interrumpida usa el pasado como contrafactual porque no hay alternativa. Cuando existe una serie de control, aunque sea observacional, la lectura queda mucho mejor.

Brodersen, Gallusser, Koehler, Remy y Scott mostraron eso con una campaña de anuncios de seis semanas dirigida a 95 de 190 áreas de mercado, lo que daba un patrón aleatorizado de verdad. La lectura con modelo de serie temporal estructural bayesiano, usando las regiones no tratadas como controles, devolvió 88.400 clics incrementales, un aumento del 22 por ciento con intervalo de credibilidad del 95 por ciento entre 13 y 30 por ciento. La comparación experimental convencional sobre los mismos datos devolvió 84.700 clics, con intervalo entre 19 y 22 por ciento.

Lo más interesante vino después. Rehicieron la cuenta descartando las regiones de control y usando solamente búsquedas públicas por palabras clave del sector como covariables. Resultado: 85.900 clics, 21 por ciento, intervalo entre 12 y 30 por ciento, todavía más cerca del patrón de 84.700 que la primera versión. Y, como prueba de falseamiento, corrieron el mismo análisis sobre las regiones que no recibieron la campaña: efecto del 2 por ciento, con intervalo entre menos 6 y más 10 por ciento, es decir, correctamente nulo.

La lección práctica es doble. Primero, las series de control que solo correlacionan con tu métrica, sin ser afectadas por tu cambio, valen mucho. Segundo, la prueba de falseamiento en quien no fue tratado es tan importante como la estimación principal.

Cuánto tráfico costaría testear esto bien

El último argumento es el más incómodo. Después de todo el modelado, el efecto honesto quedó en 0,166 punto sobre una base cercana al 3,33 por ciento. Pon esos números en la calculadora de abajo, con significancia del 95 por ciento y poder del 80 por ciento, usando el modo de diferencia absoluta.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La respuesta es 187.791 visitantes por variación. Con 35 mil visitantes por semana en total, eso son 76 días de test. Ya el efecto de 0,96 punto que la lectura ingenua alegó exigiría apenas 6.242 por variación, o 3 días.

Es decir: la comparación de promedios “confirmó” en una tarde de consulta un efecto que, si fuera real, sería detectable en tres días de experimento. El efecto verdadero exige once semanas. Cada vez que la lectura observacional parece demasiado barata, la explicación más probable es que está midiendo otra cosa.

Guion de serie temporal interrumpida en ocho pasos

  1. Junta puntos suficientes antes y después. El tutorial de referencia usó 59 meses de datos. Pocos puntos, o un efecto esperado pequeño, piden cautela explícita y simulación previa de poder.
  2. Elige la granularidad que preserva la estructura. La semana suele ser el punto correcto para conversión: agrega ruido diario sin borrar la estacionalidad.
  3. Fija la fecha de corte antes de mirar el gráfico. Un corte elegido después de ver el dato es el mismo problema de espiar en un test secuencial.
  4. Modela tendencia, escalón y cambio de pendiente. Y di cuál de los tres esperas, antes de correr.
  5. Agrega estacionalidad. Términos armónicos o indicadores de mes. Sin eso, el escalón captura la estación.
  6. Verifica la autocorrelación de los residuos y corrige el intervalo. Reporta el estadístico que usaste.
  7. Corre el placebo. Corte falso en el período previo. Un escalón significativo ahí derriba la lectura.
  8. Lista todo lo que cambió en la misma fecha. Si hubo más de una cosa, la lectura mide la suma, y el reporte necesita decirlo.

Errores comunes

Hazlo automático en Donnu

La serie temporal interrumpida depende de algo que casi nadie tiene: la métrica guardada por período con la misma definición antes y después del cambio. Basta con que el equipo haya ajustado el evento de conversión junto con el rediseño para que el escalón mida el cambio de medición, no el cambio de producto. Ningún término del modelo separa las dos cosas.

Donnu guarda el resultado por día con la definición de métrica marcada, lo que convierte la lectura de serie interrumpida en una consulta en vez de una reconstrucción, y deja la prueba placebo a un clic de distancia. Y, más importante, existe para el caso en que sí se puede aleatorizar: cuando el cambio quepa en un sorteo, ese es el camino, porque prescinde del modelado de tendencia, del de estacionalidad y de la corrección de autocorrelación de una sola vez. Para saber si tu tráfico soporta ese test, la calculadora de tamaño de muestra responde en segundos, y la calculadora de significancia cierra la lectura al final.

Referencias

Lee también: Diferencias en diferencias · Control sintético · Puntaje de propensión · Regresión discontinua · Ciclo semanal en tests A/B · Calculadora de tamaño de muestra · Leer en portugués

Preguntas frecuentes

¿Qué es una serie temporal interrumpida?
Es una lectura que usa la propia serie histórica de la métrica como grupo de control. Modelas la tendencia previa al cambio, proyectas esa tendencia hacia adelante como contrafactual y mides cuánto se apartó de ella la serie observada. Sirve cuando no existe un grupo de control paralelo, porque el cambio alcanzó a todos al mismo tiempo.
¿Por qué comparar el promedio de antes con el de después se equivoca?
Porque atribuye al cambio todo lo que la serie ya venía haciendo sola. En la simulación de esta guía el efecto real incorporado era de más 0,10 punto porcentual, y la comparación de promedios devolvió más 0,96 punto, con estadístico t de 19,66. El error no es de ruido, es de diseño: casi toda la diferencia era tendencia previa más crecimiento normal.
¿Qué estima la regresión segmentada?
Tres cosas por separado: la tendencia antes del cambio, el escalón inmediato en el momento del cambio y la variación de pendiente después de él. Es la distinción entre un efecto que aparece de una vez y un efecto que se acumula. El modelo estándar descrito por Lopez Bernal, Cummins y Gasparrini es una regresión con término de tiempo, indicador de posintervención e interacción entre los dos.
¿Necesito controlar la estacionalidad?
Casi siempre. En la simulación de esta guía, la regresión segmentada sin control estacional devolvió un escalón de más 0,31 punto para un efecto real de 0,10, y el mismo modelo con dos pares de términos armónicos devolvió más 0,166 punto. Más importante: la prueba placebo con un corte falso en medio del período previo acusó un efecto falso de menos 0,17 punto sin control estacional, y cayó a más 0,03 punto, sin significancia, con el control.
¿Por qué el intervalo de confianza estándar engaña aquí?
Porque puntos vecinos de una serie están correlacionados entre sí, y la regresión común presume que son independientes. En nuestra simulación, la autocorrelación de rezago 1 de los residuos era 0,328 incluso después del control estacional, lo que infla el error estándar por un factor de cerca de 1,41. El intervalo del 95 por ciento pasó de más 0,069 a más 0,263 punto a más 0,029 a más 0,302 punto.
¿Cuándo no sirve este método?
Cuando otra cosa ocurrió en la misma fecha. Una campaña que subió al mismo tiempo, un cambio de medición, un feriado. La serie no distingue dos cambios simultáneos, y ningún término del modelo arregla eso. En esos casos, o encuentras un grupo de control y usas diferencias en diferencias, o aceptas que la lectura quedó inconclusa.