Test Secuencial e Inferencia Siempre Válida, Explicado
Test secuencial en A/B: cómo la inferencia siempre válida permite espiar el resultado sin inflar el falso positivo, y cuándo vale la pena.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El test secuencial (o inferencia siempre válida) es una familia de métodos estadísticos, como el mSPRT (mixture Sequential Probability Ratio Test), que permite mirar el resultado de un test A/B tantas veces como quieras, en cualquier momento, y aun así mantener la tasa real de falso positivo en el nivel combinado, generalmente 5%. Es la respuesta estadística real al problema del peeking: en vez de prohibirte mirar el panel antes del final (la solución del test de muestra fija), el test secuencial rediseña la propia matemática de la decisión para que mirar repetidamente deje de ser un error.
Esta guía explica qué promete realmente el test secuencial, cómo llega ahí el mSPRT sin reinventar la estadística desde cero, qué cuesta a cambio de esa libertad, y cuándo vale más la pena adoptar un método así que simplemente calcular la muestra fija de este blog y tener la disciplina de no espiar.
El problema que resuelve el test secuencial
Todo test A/B clásico carga una promesa implícita: un valor p por debajo de 0,05 significa 5% de probabilidad de que estés celebrando un resultado que es solo ruido. Esa promesa solo vale bajo una condición muy específica, que casi nadie verbaliza: decidiste el tamaño de muestra con antelación y miraste el resultado exactamente una vez, al final. Cada mirada extra antes de ese punto, combinada con la tentación de detenerte en cuanto el número parece bueno, es una nueva oportunidad para que el puro azar cruce la línea de significancia por un instante.
Nuestra guía sobre el problema del peeking muestra la matemática detrás de esto en detalle, citando el análisis de Evan Miller: un test diseñado para 5% de falso positivo, monitoreado continuamente y detenido en la primera victoria aparente, puede entregar una tasa real de error cercana al 26% (Miller, 2010). El gráfico de abajo reproduce esa curva de inflación, y coloca al lado el comportamiento de un test secuencial de verdad, que se mantiene bajo control todo el tiempo, no porque resistas la tentación de mirar, sino porque el método fue diseñado matemáticamente para eso:
Cómo funciona realmente el test secuencial
La idea central no es “revisar con más cuidado”, es cambiar la pregunta que responde la estadística. Un test de horizonte fijo pregunta: “en esa N específica, decidida con antelación, ¿la diferencia observada es demasiado grande para ser azar?”. Un método secuencial pregunta algo más ambicioso: “en cualquier punto en el tiempo en que yo pueda querer detenerme, ¿la diferencia observada hasta ahí es demasiado grande para ser azar, considerando que podría estar mirando de nuevo dentro de una hora?”. Responder esta segunda pregunta de forma matemáticamente honesta exige una estadística distinta al valor p de una sola mirada.
El método más usado en la industria para esto es el mSPRT (mixture Sequential Probability Ratio Test), la base de lo que Optimizely llama Stats Engine y de lo que Statsig y GrowthBook ofrecen como “sequential testing”. La mecánica, en tres piezas:
- Una razón de verosimilitud mezclada. En vez de testear contra un único efecto hipotético, el método calcula la razón de verosimilitud de los datos observados hasta ahora, mezclada (un promedio ponderado) sobre una distribución entera de efectos posibles. Esa mezcla es lo que le da nombre al método y lo que garantiza que funcione bien independientemente de cuál sea el efecto real, que no conoces de antemano.
- Un proceso que nunca crece más allá de lo esperado bajo la hipótesis nula. Si A y B son de hecho iguales, ese proceso de verosimilitud mezclada tiene, en expectativa, un techo matemático que no se sobrepasa, sin importar por cuánto tiempo lo dejes corriendo. Es esta propiedad (formalizada por la desigualdad de Ville) la que sustenta el “siempre válido”: la probabilidad de que ese proceso cruce un límite en cualquier momento, a lo largo de toda la vida del test, ya viene controlada en 5% desde el inicio, en vez de 5% por mirada.
- Un valor p (o intervalo de confianza) recalculado con cada nuevo dato, siempre interpretable. A diferencia del valor p clásico, que solo es válido en la N planeada, el valor p secuencial se puede leer en cualquier punto del test. Tiende a ser más conservador al principio (más difícil declarar significancia al inicio) precisamente porque ya reserva parte del riesgo de error para los looks futuros que todavía van a ocurrir.
Un efecto colateral importante de esta mecánica: los intervalos de confianza y los “valores p siempre válidos” de un método secuencial suelen ser más anchos y más conservadores que un valor p de horizonte fijo calculado sobre la misma N, sobre todo al principio del test. Esto no es un defecto, es el precio explícito de que la lectura siga siendo válida en cualquier punto futuro. Statsig documenta este intercambio con números reales de un test propio corrido durante 28 días con múltiples revisiones: el mSPRT mantuvo el falso positivo en cerca de 1,1% (por debajo del techo nominal de 5%), contra 5,0% de un horizonte fijo con una sola mirada disciplinada y 17,3% de un z-test clásico revisado repetidamente sin ninguna corrección, al costo de un poder estadístico general en torno al 84% del poder del test de horizonte fijo equivalente (Statsig, 2025).
“Detente cuando quieras”: qué cubre esa promesa, y qué no cubre
Vale la pena deshacer un malentendido común antes de seguir adelante: el test secuencial no es “mira siempre que quieras y ya no tienes que pensar en la muestra”. Cambia una regla rígida (nunca mires antes de la N) por una regla más flexible, pero aun así una regla: la lectura en cada punto del tiempo es honesta, solo que refleja todo lo que todavía puede pasar después. La tabla de abajo resume los tres escenarios que ya aparecieron en los gráficos anteriores, uno al lado del otro:
| Enfoque | Cuándo puedes detenerte | Tasa real de falso positivo | Qué exige de ti |
|---|---|---|---|
| Horizonte fijo | Solo en la N calculada con antelación, nunca antes | 5% (la promesa se cumple), siempre que no espíes y decidas | Disciplina: calcular la muestra antes y no tocar la decisión hasta llegar ahí |
| Peeking ingenuo | Siempre que “parezca bueno” | Sube de 5% a ~14% (5 miradas) a ~26% (continuo) | Nada, y por eso mismo es peligroso: parece gratis |
| Secuencial (mSPRT) | En cualquier momento, con lectura válida | Limitado al nivel nominal por construcción; ~1,1% medido en la práctica (Statsig, 2025) | Una herramienta hecha para eso; poder un poco menor, IC más ancho al principio del test |
El horizonte fijo y el secuencial llegan ambos a una tasa de error honesta. La diferencia es el precio que cobra cada uno: el horizonte fijo cobra paciencia (no puedes actuar antes de la N, punto final); el secuencial cobra un poco de poder estadístico y muestra extra, a cambio de libertad real para actuar temprano cuando el efecto es lo bastante grande como para ya haber cruzado el límite más riguroso que el método impone al principio del test.
El contrapunto: el test de muestra fija tradicional
Para ver el intercambio con números reales, vale la pena correr el escenario canónico de este blog por el motor de muestra tradicional. Con una tasa base de 5%, efecto mínimo detectable de 10% relativo, 95% de confianza y 80% de poder, el cálculo de horizonte fijo devuelve 31.234 visitantes por variación, lo que da cerca de 44 días corriendo con un tráfico de 10 mil visitantes por semana. Ajusta los números para tu caso:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Ese es el acuerdo del test de muestra fija: calculas esa N una vez, antes de lanzar, y te comprometes a no decidir nada hasta llegar a ella. Ninguna calculadora de significancia, ningún recálculo, ningún “solo una miradita” en el camino cuenta como decisión.
Ahora imagina que, en el día 15 de ese test de 44 días (cerca de un tercio del camino, con 10.411 visitantes por variación ya recolectados), abres el panel solo por curiosidad y ves el control (A) con 521 conversiones y la variación (B) con 614. Pega esos números en la calculadora de abajo:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Al correr esos números en el mismo motor de este blog: tasa de A en 5,00%, tasa de B en 5,90%, valor p de aproximadamente 0,0045, visiblemente por debajo de 0,05. Un observador que solo mirara una vez, en el día 44, confiaría en ese tipo de lectura sin pestañear. Pero esa lectura apareció en el día 15, un tercio del camino, y un test de horizonte fijo no te da permiso para decidir con ella, porque el valor p de 0,0045 fue calculado como si hubieras mirado solo esa vez, cuando en realidad esa es una entre varias miradas posibles a lo largo del test. Es exactamente este tipo de lectura precoz, tentadora y aparentemente sólida, la que alimenta la curva de inflación del primer gráfico de esta guía: una fracción relevante de esas “señales” a mitad de camino no sobrevive hasta la N completa.
Un método secuencial de verdad trataría ese mismo dato del día 15 de otra manera: compararía la razón de verosimilitud mezclada acumulada hasta ahí contra un límite deliberadamente más riguroso que 0,05 en ese punto específico, porque parte del presupuesto de error de 5% ya está reservada para los looks que todavía vendrán entre el día 15 y el día 44. Si la lectura pasa ese límite más alto, la decisión es válida ahí mismo, sin esperar el resto. Si no pasa, el método simplemente continúa, sin que eso cuente en tu contra, y sin que tengas que fingir que no miraste.
Cuándo vale la pena usar un test secuencial (y cuándo el horizonte fijo ya resuelve)
La pregunta correcta no es “qué método es más moderno”, es “qué necesita realmente tu operación”. Las dos columnas de abajo resumen los casos más comunes:
| Escenario | Prefiere test secuencial | Prefiere horizonte fijo + calculadora de este blog |
|---|---|---|
| Costo de esperar hasta la N completa | Alto: cada día extra corriendo una variación mala cuesta ingresos reales ahora | Bajo: el producto puede esperar el plazo calculado sin problema |
| Equipo de stakeholders pidiendo estado | Frecuente, con presión real para actuar temprano si la señal es fuerte | Raro, o la cultura ya acepta “todavía está corriendo” como respuesta |
| Herramienta disponible | Una plataforma que ya implementa mSPRT o equivalente (Optimizely, Statsig, GrowthBook) | Cualquier herramienta, incluida una calculadora simple de significancia |
| Disciplina de no espiar el panel | Difícil de garantizar en la práctica (el panel se actualiza solo, todos lo ven) | Alta: el equipo logra de hecho tratar la N calculada como intocable |
| Efecto esperado | Grande y probable de aparecer bien antes de la N completa | Pequeño o incierto, exigiendo la muestra entera de todos modos |
En la práctica, la mayoría de los equipos con tráfico medio y una cultura de “calculamos la muestra y esperamos” no necesita mSPRT: la calculadora de tamaño de muestra de este blog, seguida de disciplina real, ya entrega el mismo 5% honesto, gratis, sin exigir una plataforma nueva. Vale la pena invertir en test secuencial cuando el costo de esperar es lo bastante alto, o cuando la tentación de espiar es lo bastante fuerte, para que la libertad de decidir temprano con validez pague el precio en poder estadístico que cobra.
Hazlo automático en Donnu
El miedo detrás de esta guía es real: espías el panel de tu test, el número parece bueno, y la duda se convierte en “¿esto es de verdad, o voy a invalidar el resultado si actúo ahora?”. Un mSPRT completo resolvería esa duda formalmente en cualquier momento; Donnu resuelve el mismo miedo por el camino que ya está disponible hoy, sin exigir una plataforma de investigación estadística aparte: calcula tu tamaño de muestra y tu duración con antelación, mantiene esa decisión fija hasta alcanzar la N, y usa un motor bayesiano nativo para una lectura honesta en cuanto llegas ahí, sin el teatro del valor p y sin la tentación silenciosa de “solo una miradita más”.
Empieza una prueba gratis de 14 días y corre tu próximo test sabiendo exactamente cuándo (y por qué) puedes confiar en el número que estás viendo. Para el panorama completo del problema que resuelve el test secuencial, mira nuestra guía sobre el problema del peeking, para la base de la significancia estadística que sustenta el test de horizonte fijo, mira qué es la significancia estadística en tests A/B, y para otra técnica bayesiana que también reduce la espera de un test, mira nuestra guía sobre CUPED y reducción de varianza.
Referencias
- Johari, R., Pekelis, L. & Walsh, D.J. Always Valid Inference: Bringing Sequential Analysis to A/B Testing. arXiv:1512.04922. arxiv.org/abs/1512.04922.
- Johari, R., Koomen, P., Pekelis, L. & Walsh, D. Peeking at A/B Tests: Why It Matters, and What to Do About It. KDD 2017. doi.org/10.1145/3097983.3097992.
- Statsig. Sequential Testing on Statsig (mSPRT, datos empíricos de falso positivo y poder). 2025. statsig.com/blog/sequential-testing-on-statsig.
- Optimizely. Fixed horizon, Bayesian, or sequential: Choosing a stats engine. optimizely.com/insights/blog/how-to-choose-the-right-stats-engine.
- Miller, E. Simple Sequential A/B Testing. 2015. evanmiller.org/sequential-ab-testing.html.
Preguntas frecuentes
- ¿Qué es el test secuencial (inferencia siempre válida) en un test A/B?
- Es una familia de métodos estadísticos, como el mSPRT (mixture Sequential Probability Ratio Test), diseñada para que puedas mirar el resultado de un test A/B en cualquier momento y tomar una decisión, sin que eso infle la tasa real de falso positivo por encima del nivel combinado (generalmente 5%). En vez de calcular un único valor p pensado para una sola mirada al final, el método calcula, con cada nuevo dato, un valor "siempre válido" que ya reserva el riesgo de error para todos los puntos futuros en los que podrías detenerte.
- ¿El test secuencial es lo mismo que el test bayesiano?
- No. Son ejes distintos. Frecuentista vs. bayesiano es sobre cómo expresas e interpretas la evidencia (valor p e intervalo de confianza de un lado, probabilidad de que B sea mejor que A del otro). Horizonte fijo vs. secuencial es sobre cuándo puedes detenerte válidamente. Se puede tener un test bayesiano de horizonte fijo (decide la muestra antes, solo mira al final) y un test secuencial frecuentista (mSPRT), que es justamente el caso más común en la industria hoy.
- ¿Un test secuencial elimina la necesidad de calcular el tamaño de muestra antes de empezar?
- Reduce la dependencia, pero no la elimina por completo. Sigues beneficiándote de estimar un rango de efecto plausible y un tráfico esperado para saber si el test es viable en tu volumen. Lo que cambia es la rigidez: en vez de una N fija que tienes prohibido revisar antes de alcanzar, el método ya incorpora una regla de parada válida en cada nuevo lote de datos, así que revisar temprano deja de ser un error.
- ¿Necesito una herramienta especial para correr un test secuencial, o se puede hacer con la calculadora de este blog?
- Necesitas una herramienta hecha para eso. La calculadora de significancia de este blog usa el two-proportion z-test clásico, que asume una sola mirada decidida con antelación, exactamente el escenario de horizonte fijo. Es excelente para leer un test que decidiste no espiar, pero usarla varias veces a lo largo del mismo test y detenerte en la primera lectura favorable recrea el problema del peeking, no es lo mismo que un mSPRT de verdad.
- ¿Un test secuencial cuesta más muestra que un test de horizonte fijo?
- En general sí, un poco. Según datos de Statsig, en un test real de 28 días monitoreado repetidamente, el mSPRT secuencial mantuvo el falso positivo en cerca de 1,1% (por debajo del techo nominal de 5%) con un poder estadístico cercano al 84% del poder de un test de horizonte fijo equivalente, y llegó a detectar significancia en el 58% de los casos que terminarían siendo significativos ya a la mitad de la duración planeada, contra el 33% de la versión anterior del propio método secuencial de Statsig en el mismo punto. El intercambio es: un poco menos de poder e intervalos de confianza un poco más anchos, a cambio de poder decidir en cualquier momento con validez real.