Análisis Interino en Test A/B: fronteras de parada
Análisis interino en test A/B: cómo planificar 2 o 3 miradas con gasto de alfa, el coste en muestra y por qué 3 miradas al 5% dan 10,73% de falso positivo.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Mirar el resultado tres veces usando el corte del 5 por ciento en cada mirada lleva el falso positivo real al 10,73 por ciento, más del doble de lo acordado. La salida no es dejar de mirar: es planificar cada análisis interino antes de empezar y dar a cada uno un corte propio, de forma que la suma cierre en 5 por ciento. En el plan de este artículo, tres miradas con frontera tipo O Brien-Fleming costaron un 2,21 por ciento más de muestra máxima y devolvieron, cuando el efecto existía, un test que terminó un 14,9 por ciento antes. Esta guía muestra de dónde viene la inflación, cómo una función de gasto de alfa reparte el riesgo, cuánto cobra cada familia de frontera, y trae un ejemplo trabajado con las tres miradas para pegar en la calculadora. Forma parte de nuestra guía completa de test A/B y es el contrapunto planificado del problema del peeking.
De dónde viene la inflación: 5 por ciento por mirada no es 5 por ciento en total
Un test de horizonte fijo promete una sola cosa: si miras una vez, en la N acordada, y declaras ganador cuando el valor p queda por debajo de 0,05, la probabilidad de gritar victoria sin efecto alguno es del 5 por ciento. Cada lectura extra es una oportunidad nueva de cruzar la línea por azar, y las oportunidades se acumulan.
Se puede calcular exactamente cuánto. Los estadísticos z leídos en momentos diferentes del mismo test no son independientes, forman un paseo browniano: el z de la segunda mirada lleva dentro todos los datos de la primera. Integrando esa dependencia numéricamente, con miradas igualmente espaciadas y corte del 5 por ciento en cada una, el falso positivo real queda así:
Esos números no son novedad ni opinión: son el resultado clásico que aparece en cualquier texto de análisis secuencial, y nuestra integración los reproduce. El punto práctico es otro. La respuesta obvia, “entonces no mires”, es imposible de cumplir en un equipo que tiene un panel abierto. Johari, Pekelis y Walsh, en el artículo que describe la inferencia siempre válida de una plataforma comercial de tests, abren exactamente con ese diagnóstico: los valores p e intervalos de confianza tradicionales quedan completamente poco confiables cuando el usuario elige el tamaño de la muestra de forma endógena, monitoreando el test continuamente. La ilustración que usan es un test A/A cuya “probabilidad de ganar” cruza el umbral del 95 por ciento solo por ser observada todo el tiempo.
Hay dos caminos honestos a partir de ahí. Uno es la inferencia siempre válida, que ya cubrimos en test secuencial e inferencia siempre válida y que acepta cualquier número de miradas. El otro, más antiguo y más barato en muestra, es el asunto de este artículo: marcar pocas miradas antes de empezar y repartir el alfa entre ellas.
Gasto de alfa: la idea de Lan y DeMets
Piensa en el 5 por ciento como un presupuesto. El diseño de horizonte fijo gasta el presupuesto entero en una sola compra, al final. Un diseño de grupo secuencial gasta un pedazo en cada lectura planificada, y la suma tiene que cerrar en 5 por ciento.
La función de gasto de alfa es la regla que dice cuánto del presupuesto puede haberse gastado ya cuando llegaste a cierta fracción de la información. La orientación de la FDA sobre diseños adaptativos describe el método de Lan y DeMets exactamente así: una función que especifica cómo se gasta la probabilidad de error tipo I a lo largo del estudio, con la flexibilidad de elegir el número y el momento de los análisis interinos. Dos funciones dominan la práctica, y discrepan sobre cuándo gastar.
Traducido al corte que exige cada lectura, con tres miradas igualmente espaciadas:
| Mirada | Fracción de la muestra | Alfa acumulado (OBF) | z crítico (OBF) | valor p exigido (OBF) | Alfa acumulado (Pocock) | z crítico (Pocock) | valor p exigido (Pocock) |
|---|---|---|---|---|---|---|---|
| 1 | 33% | 0,00069 | 3,395 | 0,00069 | 0,02264 | 2,279 | 0,02264 |
| 2 | 67% | 0,01637 | 2,407 | 0,01610 | 0,03817 | 2,295 | 0,02174 |
| 3 | 100% | 0,05000 | 2,015 | 0,04388 | 0,05000 | 2,296 | 0,02168 |
Fíjate en lo que dice la tabla sobre la última fila. Con la frontera tipo O Brien-Fleming, quien llegó hasta el final todavía tiene casi todo el corte tradicional disponible (0,04388 contra 0,05). Con Pocock, el precio de haber podido parar pronto es que la lectura final quedó más dura que la de un test normal: 0,02168 en lugar de 0,05. No existe almuerzo gratis, existe la elección de dónde pagar.
La FDA describe la diferencia entre las dos familias en una frase que vale la pena copiar: el enfoque de O Brien y Fleming tiende a exigir resultados iniciales muy persuasivos para parar el estudio por eficacia, mientras que enfoques alternativos como el de Pocock exigen resultados iniciales menos persuasivos y tienen mayor probabilidad de parada temprana.
Lo que el análisis interino cuesta en muestra
Frontera más dura en el medio significa frontera un poco más laxa al final, y para mantener el mismo 80 por ciento de potencia el diseño necesita una N máxima mayor que la del horizonte fijo. Calculamos el factor exacto para los dos formatos, con tres miradas:
| Diseño | N máxima (factor sobre el fijo) | N esperada cuando el efecto existe | N esperada cuando no existe | Probabilidad de parar en la mirada 1 |
|---|---|---|---|---|
| Horizonte fijo | 1,0000 | 100% | 100% | no aplica |
| 3 miradas, O Brien-Fleming | 1,0221 | 85,1% de la N fija | 101,6% de la N fija | 3,93% |
| 3 miradas, Pocock | 1,1703 | 81,9% de la N fija | 114,7% de la N fija | 29,82% |
La lectura es directa. La frontera tipo O Brien-Fleming es casi gratis: 2,21 por ciento más de muestra máxima, y si el efecto no existe el test cuesta apenas un 1,6 por ciento más que el diseño fijo. A cambio, casi nunca para en la primera mirada (3,93 por ciento de las veces). Pocock es lo opuesto: casi un tercio de los tests con efecto real paran en la primera lectura, pero cuando no hay efecto el test cuesta un 14,7 por ciento más de tráfico. Si tu problema es la cola de experimentos, Pocock devuelve tiempo de calendario; si tu problema es tráfico escaso, la elección es la otra.
El plan concreto: base 5 por ciento, MDE del 10 por ciento, 40 mil por semana
Vamos a aterrizarlo en un test real. La calculadora de tamaño de muestra devuelve, para una tasa base del 5 por ciento, un efecto mínimo detectable del 10 por ciento relativo, 95 por ciento de confianza y 80 por ciento de potencia, 31.234 visitantes por variante, lo que da 11 días con 40 mil visitantes por semana. Ese es el diseño de horizonte fijo, y de él parte el plan secuencial.
| Ítem | Horizonte fijo | 3 miradas, O Brien-Fleming | 3 miradas, Pocock |
|---|---|---|---|
| N máxima por variante | 31.234 | 31.926 | 36.555 |
| Duración máxima | 11 días | 12 días | 13 días |
| Miradas (visitantes por variante) | 31.234 | 10.642 / 21.284 / 31.926 | 12.185 / 24.370 / 36.555 |
| valor p exigido en cada mirada | 0,05000 | 0,00069 / 0,01610 / 0,04388 | 0,02264 / 0,02174 / 0,02168 |
| N esperada si el efecto existe | 31.234 (11 días) | 26.575 (10 días) | 25.592 (9 días) |
| N esperada si no existe | 31.234 (11 días) | 31.744 (12 días) | 35.814 (13 días) |
Ese es el plan entero en una tabla, y cabe en un párrafo del documento de análisis preregistrado. Si todavía no escribes ese documento, el plan de análisis preregistrado es el lugar donde las tres fechas y los tres cortes tienen que vivir.
Un ejemplo trabajado, con la calculadora
Simulamos un test con un efecto real del 10 por ciento relativo (5,0 contra 5,5 por ciento) y lo leímos en las tres miradas del plan O Brien-Fleming. Los números de abajo son visitantes y conversiones acumulados; pega cada fila en la calculadora y verás el mismo valor p.
| Mirada | Control | Variante | valor p | Lift relativo | ¿Por debajo de 0,05? | ¿Cruza la frontera? |
|---|---|---|---|---|---|---|
| 1 (n = 10.642) | 549 de 10.642 (5,1588%) | 593 de 10.642 (5,5723%) | 0,180757 | 8,01% | no | no (z 1,338 contra 3,395) |
| 2 (n = 21.284) | 1.078 de 21.284 (5,0648%) | 1.182 de 21.284 (5,5535%) | 0,024567 | 9,65% | sí | no (z 2,248 contra 2,407) |
| 3 (n = 31.926) | 1.598 de 31.926 (5,0053%) | 1.768 de 31.926 (5,5378%) | 0,002608 | 10,64% | sí | sí (z 3,011 contra 2,015) |
La fila 2 es la razón de ser de este artículo. El valor p de 0,024567 está por debajo de 0,05, y un equipo sin plan habría parado ahí, declarado un 9,65 por ciento de ganancia y pasado al siguiente test. El plan dice que hay que continuar, porque 0,024567 todavía no es el 0,01610 que exigía esa mirada. El test sigue y termina con 10,64 por ciento, más cerca del efecto verdadero del 10 por ciento, y con un valor p un orden de magnitud menor.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Vale la pena comprobar la segunda fila en la calculadora de arriba: 21.284 visitantes y 1.078 conversiones en el control, 21.284 y 1.182 en la variante. El intervalo de confianza devuelto va de 0,0627 a 0,9146 punto porcentual, es decir, roza el cero. Es un resultado que ya es “significativo” por el criterio tradicional y que aun así, mirando el plan, no es evidencia suficiente para cerrar el experimento en ese momento.
Reproduciendo el número de la FDA
La orientación de la FDA afirma que un diseño de grupo secuencial con un único análisis interino y una frontera de eficacia comúnmente usada reduce el tamaño de muestra esperado del estudio en aproximadamente un 15 por ciento respecto a un diseño comparable de muestra fija. La nota al pie especifica el escenario: interino en la mitad de la muestra máxima, frontera tipo O Brien-Fleming, y la hipótesis alternativa en que el diseño tiene 90 por ciento de potencia.
Ejecutamos exactamente ese escenario en nuestro integrador. Las fronteras salieron en z de 2,7718 y 1,9793, la N máxima quedó un 0,79 por ciento por encima del diseño fijo, y la N esperada bajo la alternativa dio 84,72 por ciento de la N fija, es decir, una reducción del 15,28 por ciento. Bajo la nula, el coste es de un 0,51 por ciento más que el diseño fijo. El número de la agencia se reproduce sin ajuste, y ahora sabes de qué escenario exacto vino, lo cual importa porque con tres miradas y 80 por ciento de potencia el ahorro esperado cae al 14,9 por ciento y el coste bajo la nula sube al 1,6 por ciento.
Como validación del propio integrador, calibramos con él las fronteras clásicas conocidas: para tres miradas igualmente espaciadas y alfa bilateral del 5 por ciento, devolvió 3,4711, 2,4544 y 2,0040 para la forma clásica de O Brien-Fleming (literatura: 3,471, 2,454 y 2,004) y 2,2895 para la constante de Pocock (literatura: 2,289).
Cuatro cosas que la frontera no arregla
1. La estimación de un test interrumpido pronto es optimista. La FDA registra que las estimaciones convencionales, como la media muestral, tienden a quedar sesgadas hacia efectos mayores que el verdadero cuando el diseño es secuencial, y que los intervalos de confianza pierden la cobertura nominal. Existe método para corregirlo, y el plan necesita nombrar cuál se usará. Es el mismo fenómeno que describimos en la maldición del ganador, agravado a propósito por un diseño que solo para pronto cuando el resultado vino fuerte.
2. Cambiar el cronograma mirando el resultado lo rompe todo. La flexibilidad del gasto de alfa es sobre el número y el momento de las lecturas, no sobre reaccionar a lo que mostraron. El texto de la FDA da el ejemplo de lo que no hay que hacer: adelantar el próximo análisis interino porque el actual se acercó a la frontera. La recomendación de la agencia es tener un número objetivo de análisis, un calendario aproximado y un criterio escrito de cambio que dependa de información independiente del efecto estimado, como el ritmo de recolección.
3. La parada por futilidad es otra conversación. La frontera de eficacia responde “¿ya se puede decir que funciona?”. La frontera de futilidad responde “¿ya se puede decir que no vale la pena continuar?”. La FDA observa que añadir reglas de futilidad no vinculantes a un diseño de muestra fija o a un diseño con fronteras de eficacia adecuadas no aumenta la probabilidad de error tipo I, y suele ser apropiado. Las reglas vinculantes permiten relajar el umbral de eficacia, pero solo controlan el error si se obedecen de verdad. Tratamos el lado práctico de esto en parada por futilidad.
4. Nada de esto sustituye las verificaciones de sanidad. Un test con una frontera impecable y el reparto de tráfico roto sigue siendo un test equivocado, solo que con apariencia más formal.
¿Grupo secuencial o inferencia siempre válida?
Las dos familias resuelven el mismo problema y cobran en monedas diferentes.
| Criterio | Grupo secuencial (gasto de alfa) | Inferencia siempre válida |
|---|---|---|
| Número de lecturas | finito y marcado antes | cualquier número, incluso continuo |
| ¿Hay que marcar fechas antes? | sí, o al menos el número objetivo y el criterio de cambio | no |
| Coste en muestra máxima | bajo con O Brien-Fleming (2,21% en nuestro plan) | más alto, porque reserva riesgo para infinitas miradas futuras |
| Quien lee el panel todos los días | no está autorizado a decidir fuera de las miradas | puede decidir en cualquier momento |
| Mejor caso de uso | ritual fijo de decisión, pocas lecturas, tráfico escaso | panel abierto para todo el equipo, decisión oportunista |
Si tu operación tiene una reunión semanal de resultados y nadie decide fuera de ella, el grupo secuencial es más barato. Si cualquier persona puede abrir el panel y actuar, la inferencia siempre válida es el diseño honesto, porque describe lo que realmente ocurre en tu empresa.
Hazlo automático en Donnu
El error que describe este artículo raramente es de estadística, es de operación: nadie escribió cuándo se leería el test y con qué corte, así que cada lectura se convierte en una decisión nueva al 5 por ciento. En Donnu el plan de lectura forma parte de la creación del experimento: eliges el número de miradas, el panel muestra el corte que exige cada una y bloquea la decisión de ganador cuando la lectura no cruzó la frontera de ese momento, en lugar de mostrar un valor p suelto que cualquiera interpreta como luz verde. Las lecturas planificadas quedan registradas con fecha, para que nadie pueda adelantar una de ellas después de ver el resultado sin que eso aparezca en el historial.
Preguntas frecuentes
Las respuestas cortas están en la sección de preguntas frecuentes de esta página, montadas a partir de los mismos cálculos presentados aquí.
Referencias
- U.S. Food and Drug Administration. Adaptive Designs for Clinical Trials of Drugs and Biologics: Guidance for Industry, noviembre de 2019. Sección V.A. Fuente de la definición de diseño de grupo secuencial como análisis interinos prospectivamente planificados con criterios de parada preespecificados, de la reducción de aproximadamente 15 por ciento en el tamaño de muestra esperado con un interino a la mitad y frontera tipo O Brien-Fleming al 90 por ciento de potencia, del contraste entre O Brien-Fleming y Pocock en cuanto al grado de persuasión exigido pronto, de la descripción del gasto de alfa de Lan y DeMets, de la advertencia de que adelantar un interino por el resultado actual infla el error tipo I, de la distinción entre futilidad vinculante y no vinculante, y del sesgo de las estimaciones y la pérdida de cobertura de los intervalos en diseños secuenciales.
- Ramesh Johari, Leo Pekelis y David Walsh. Always Valid Inference: Continuous Monitoring of A/B Tests, arXiv 1512.04922v3, 2019. Fuente del diagnóstico de que los valores p e intervalos tradicionales quedan poco confiables cuando el tamaño de la muestra se elige de forma endógena por monitoreo continuo, del ejemplo del test A/A cuya probabilidad de ganar cruza el umbral del 95 por ciento por ser observada continuamente, y del encuadre de la inferencia siempre válida como alternativa que permite decidir en cualquier momento.
- Ron Kohavi, Roger Longbotham, Dan Sommerfield y Randal M. Henne. Controlled experiments on the web: survey and practical guide, Data Mining and Knowledge Discovery, 2009. Fuente del contexto operativo de experimentación online usado aquí, incluyendo la recomendación de determinar el tamaño mínimo de muestra antes de empezar y la advertencia sobre métricas cuya potencia se degrada cuanto más largo es el experimento.
Lee también
Preguntas frecuentes
- ¿Qué es un análisis interino en un test A/B?
- Es una lectura del resultado hecha antes del final del test, en un momento marcado en el plan antes de que el test empiece, con un criterio de parada propio para ese momento. La diferencia entre análisis interino y espiar el panel es la palabra "planificada": el número de lecturas y el valor p que exige cada una se fijan antes de que la primera persona entre en el experimento, y el alfa total del 5 por ciento se reparte entre ellas.
- ¿Cuántas miradas puedo hacer sin inflar el falso positivo?
- Ninguna, si cada mirada usa el corte del 5 por ciento. En nuestra integración numérica, dos miradas al 5 por ciento dan 8,31 por ciento de falso positivo, tres dan 10,73 por ciento, cinco dan 14,17 por ciento y veinte dan 24,79 por ciento. Con fronteras de gasto de alfa, el número de miradas deja de ser el problema: dos, tres o cinco miradas planificadas quedan todas en 5 por ciento en total, porque cada una recibe un corte más duro que compensa la repetición.
- ¿Cuál es la diferencia entre O Brien-Fleming y Pocock?
- Es la forma de la frontera, es decir, cómo se distribuye el alfa en el tiempo. La función de gasto tipo O Brien-Fleming casi no gasta alfa al principio y deja casi todo para el final: con tres miradas, pide un valor p por debajo de 0,00069 en la primera lectura y permite 0,04388 en la última. La de Pocock reparte de forma casi uniforme: 0,02264, 0,02174 y 0,02168. La primera casi no encarece la muestra máxima (2,21 por ciento en nuestro plan) y raramente para pronto; la segunda para pronto con frecuencia, pero cobra un 17,03 por ciento más de muestra máxima.
- ¿Análisis interino es lo mismo que test secuencial?
- No. Grupo secuencial es un número FINITO de lecturas marcadas de antemano, cada una con su corte. La inferencia siempre válida, del tipo que describen Johari, Pekelis y Walsh, permite mirar en cualquier momento, tantas veces como quieras, incluso de forma continua. El grupo secuencial cobra menos muestra cuando solo necesitas dos o tres lecturas; la inferencia siempre válida cobra más, y a cambio te quita de encima la exigencia de marcar las fechas antes.
- ¿Puedo cambiar las fechas de las miradas después de que el test empezó?
- Solo por motivos que no miren el resultado. La orientación de la FDA es explícita en ese punto: adelantar la próxima lectura porque la actual se acercó a la frontera no es apropiado e infla el error tipo I. Cambiar la fecha porque el tráfico vino más despacio de lo previsto es aceptable, siempre que el criterio de cambio se haya escrito antes y dependa de información estadísticamente independiente del efecto estimado, como el ritmo de recolección.
- ¿El efecto medido cuando el test para pronto es confiable?
- La dirección suele serlo, el tamaño no. La FDA registra que las estimaciones convencionales de efecto, como la media muestral, tienden a quedar sesgadas hacia efectos mayores que el verdadero cuando el diseño es de grupo secuencial, y que los intervalos de confianza pierden la cobertura nominal. Por eso el plan necesita decir, desde el principio, qué método de estimación corregida se va a usar para reportar el resultado de un test interrumpido pronto.