Estadística

Análisis Interino en Test A/B: fronteras de parada

Análisis interino en test A/B: cómo planificar 2 o 3 miradas con gasto de alfa, el coste en muestra y por qué 3 miradas al 5% dan 10,73% de falso positivo.

Ilustración plana de tres arcos verdes de alturas diferentes uno al lado del otro sobre fondo verde menta, el del medio bastante más alto y los laterales progresivamente más bajos

Mirar el resultado tres veces usando el corte del 5 por ciento en cada mirada lleva el falso positivo real al 10,73 por ciento, más del doble de lo acordado. La salida no es dejar de mirar: es planificar cada análisis interino antes de empezar y dar a cada uno un corte propio, de forma que la suma cierre en 5 por ciento. En el plan de este artículo, tres miradas con frontera tipo O Brien-Fleming costaron un 2,21 por ciento más de muestra máxima y devolvieron, cuando el efecto existía, un test que terminó un 14,9 por ciento antes. Esta guía muestra de dónde viene la inflación, cómo una función de gasto de alfa reparte el riesgo, cuánto cobra cada familia de frontera, y trae un ejemplo trabajado con las tres miradas para pegar en la calculadora. Forma parte de nuestra guía completa de test A/B y es el contrapunto planificado del problema del peeking.

De dónde viene la inflación: 5 por ciento por mirada no es 5 por ciento en total

Un test de horizonte fijo promete una sola cosa: si miras una vez, en la N acordada, y declaras ganador cuando el valor p queda por debajo de 0,05, la probabilidad de gritar victoria sin efecto alguno es del 5 por ciento. Cada lectura extra es una oportunidad nueva de cruzar la línea por azar, y las oportunidades se acumulan.

Se puede calcular exactamente cuánto. Los estadísticos z leídos en momentos diferentes del mismo test no son independientes, forman un paseo browniano: el z de la segunda mirada lleva dentro todos los datos de la primera. Integrando esa dependencia numéricamente, con miradas igualmente espaciadas y corte del 5 por ciento en cada una, el falso positivo real queda así:

Falso positivo real según el número de miradas con corte del 5 por ciento en cada unaGráfico de barras con seis columnas verdes de altura creciente. Con una mirada la tasa es del 5 por ciento, el valor acordado, marcado por una línea discontinua horizontal. Con dos miradas sube al 8,31 por ciento, con tres al 10,73, con cinco al 14,17, con diez al 19,34 y con veinte al 24,79 por ciento. Todas las columnas a partir de la segunda superan claramente la línea discontinua.5%, lo acordado5,00%8,31%10,73%14,17%19,34%24,79%1 mirada2351020Probabilidad de declarar victoria sin efecto algunoMiradas igualmente espaciadas, corte del 5 por ciento bilateral en cada una. Integración numérica del paseo browniano.
Cada lectura extra con el mismo corte es una apuesta más en la misma ronda. Veinte miradas convierten la promesa del 5 por ciento en una probabilidad real de una entre cuatro.

Esos números no son novedad ni opinión: son el resultado clásico que aparece en cualquier texto de análisis secuencial, y nuestra integración los reproduce. El punto práctico es otro. La respuesta obvia, “entonces no mires”, es imposible de cumplir en un equipo que tiene un panel abierto. Johari, Pekelis y Walsh, en el artículo que describe la inferencia siempre válida de una plataforma comercial de tests, abren exactamente con ese diagnóstico: los valores p e intervalos de confianza tradicionales quedan completamente poco confiables cuando el usuario elige el tamaño de la muestra de forma endógena, monitoreando el test continuamente. La ilustración que usan es un test A/A cuya “probabilidad de ganar” cruza el umbral del 95 por ciento solo por ser observada todo el tiempo.

Hay dos caminos honestos a partir de ahí. Uno es la inferencia siempre válida, que ya cubrimos en test secuencial e inferencia siempre válida y que acepta cualquier número de miradas. El otro, más antiguo y más barato en muestra, es el asunto de este artículo: marcar pocas miradas antes de empezar y repartir el alfa entre ellas.

Gasto de alfa: la idea de Lan y DeMets

Piensa en el 5 por ciento como un presupuesto. El diseño de horizonte fijo gasta el presupuesto entero en una sola compra, al final. Un diseño de grupo secuencial gasta un pedazo en cada lectura planificada, y la suma tiene que cerrar en 5 por ciento.

La función de gasto de alfa es la regla que dice cuánto del presupuesto puede haberse gastado ya cuando llegaste a cierta fracción de la información. La orientación de la FDA sobre diseños adaptativos describe el método de Lan y DeMets exactamente así: una función que especifica cómo se gasta la probabilidad de error tipo I a lo largo del estudio, con la flexibilidad de elegir el número y el momento de los análisis interinos. Dos funciones dominan la práctica, y discrepan sobre cuándo gastar.

Dos funciones de gasto de alfa a lo largo de la recolecciónGráfico de líneas con el eje horizontal yendo de cero a cien por ciento de la muestra planificada y el vertical del alfa acumulado gastado, de cero a cinco por ciento. La curva de Pocock sube rápido al principio, pasando de dos por ciento gastado ya en la mitad de la recolección, y después se aplana. La curva tipo O Brien-Fleming queda pegada al cero hasta cerca de la mitad de la recolección y sube de forma acelerada solo en el tercio final. Las dos terminan exactamente en el cinco por ciento al final. Tres marcadores redondos indican las miradas en un tercio, dos tercios y al final.Cuánto del 5% de alfa ya se gastó5% (presupuesto total)Pocock: gasta prontoO Brien-Fleming: guarda para el final033%67%100%fracción de la muestra máxima ya recolectada
Las dos funciones cierran en el mismo presupuesto. Lo que cambia es el ritmo del gasto, y el ritmo del gasto es lo que decide si el test consigue parar pronto.

Traducido al corte que exige cada lectura, con tres miradas igualmente espaciadas:

Mirada Fracción de la muestra Alfa acumulado (OBF) z crítico (OBF) valor p exigido (OBF) Alfa acumulado (Pocock) z crítico (Pocock) valor p exigido (Pocock)
1 33% 0,00069 3,395 0,00069 0,02264 2,279 0,02264
2 67% 0,01637 2,407 0,01610 0,03817 2,295 0,02174
3 100% 0,05000 2,015 0,04388 0,05000 2,296 0,02168

Fíjate en lo que dice la tabla sobre la última fila. Con la frontera tipo O Brien-Fleming, quien llegó hasta el final todavía tiene casi todo el corte tradicional disponible (0,04388 contra 0,05). Con Pocock, el precio de haber podido parar pronto es que la lectura final quedó más dura que la de un test normal: 0,02168 en lugar de 0,05. No existe almuerzo gratis, existe la elección de dónde pagar.

Forma de las fronteras de parada en las tres miradasGráfico de líneas con tres posiciones en el eje horizontal, una para cada mirada. La línea tipo O Brien-Fleming empieza muy alta, en z de 3,395 en la primera mirada, cae a 2,407 en la segunda y a 2,015 en la tercera. La línea de Pocock es prácticamente horizontal, en torno a 2,28 a 2,30 en las tres miradas. Una línea discontinua marca el corte ingenuo de 1,96, por debajo de las dos fronteras en todos los puntos.corte ingenuo z = 1,963,3952,4072,0152,2792,296mirada 1 (33%)mirada 2 (67%)mirada 3 (100%)z exigido en cada lectura planificadaCuanto más alta la frontera, más persuasivo tiene que ser el resultado para parar ahí.
La frontera tipo O Brien-Fleming baja a lo largo del test. La de Pocock es plana. Quien elige la forma está eligiendo en qué momento quiere poder parar.

La FDA describe la diferencia entre las dos familias en una frase que vale la pena copiar: el enfoque de O Brien y Fleming tiende a exigir resultados iniciales muy persuasivos para parar el estudio por eficacia, mientras que enfoques alternativos como el de Pocock exigen resultados iniciales menos persuasivos y tienen mayor probabilidad de parada temprana.

Lo que el análisis interino cuesta en muestra

Frontera más dura en el medio significa frontera un poco más laxa al final, y para mantener el mismo 80 por ciento de potencia el diseño necesita una N máxima mayor que la del horizonte fijo. Calculamos el factor exacto para los dos formatos, con tres miradas:

Diseño N máxima (factor sobre el fijo) N esperada cuando el efecto existe N esperada cuando no existe Probabilidad de parar en la mirada 1
Horizonte fijo 1,0000 100% 100% no aplica
3 miradas, O Brien-Fleming 1,0221 85,1% de la N fija 101,6% de la N fija 3,93%
3 miradas, Pocock 1,1703 81,9% de la N fija 114,7% de la N fija 29,82%

La lectura es directa. La frontera tipo O Brien-Fleming es casi gratis: 2,21 por ciento más de muestra máxima, y si el efecto no existe el test cuesta apenas un 1,6 por ciento más que el diseño fijo. A cambio, casi nunca para en la primera mirada (3,93 por ciento de las veces). Pocock es lo opuesto: casi un tercio de los tests con efecto real paran en la primera lectura, pero cuando no hay efecto el test cuesta un 14,7 por ciento más de tráfico. Si tu problema es la cola de experimentos, Pocock devuelve tiempo de calendario; si tu problema es tráfico escaso, la elección es la otra.

El plan concreto: base 5 por ciento, MDE del 10 por ciento, 40 mil por semana

Vamos a aterrizarlo en un test real. La calculadora de tamaño de muestra devuelve, para una tasa base del 5 por ciento, un efecto mínimo detectable del 10 por ciento relativo, 95 por ciento de confianza y 80 por ciento de potencia, 31.234 visitantes por variante, lo que da 11 días con 40 mil visitantes por semana. Ese es el diseño de horizonte fijo, y de él parte el plan secuencial.

Ítem Horizonte fijo 3 miradas, O Brien-Fleming 3 miradas, Pocock
N máxima por variante 31.234 31.926 36.555
Duración máxima 11 días 12 días 13 días
Miradas (visitantes por variante) 31.234 10.642 / 21.284 / 31.926 12.185 / 24.370 / 36.555
valor p exigido en cada mirada 0,05000 0,00069 / 0,01610 / 0,04388 0,02264 / 0,02174 / 0,02168
N esperada si el efecto existe 31.234 (11 días) 26.575 (10 días) 25.592 (9 días)
N esperada si no existe 31.234 (11 días) 31.744 (12 días) 35.814 (13 días)

Ese es el plan entero en una tabla, y cabe en un párrafo del documento de análisis preregistrado. Si todavía no escribes ese documento, el plan de análisis preregistrado es el lugar donde las tres fechas y los tres cortes tienen que vivir.

Un ejemplo trabajado, con la calculadora

Simulamos un test con un efecto real del 10 por ciento relativo (5,0 contra 5,5 por ciento) y lo leímos en las tres miradas del plan O Brien-Fleming. Los números de abajo son visitantes y conversiones acumulados; pega cada fila en la calculadora y verás el mismo valor p.

Mirada Control Variante valor p Lift relativo ¿Por debajo de 0,05? ¿Cruza la frontera?
1 (n = 10.642) 549 de 10.642 (5,1588%) 593 de 10.642 (5,5723%) 0,180757 8,01% no no (z 1,338 contra 3,395)
2 (n = 21.284) 1.078 de 21.284 (5,0648%) 1.182 de 21.284 (5,5535%) 0,024567 9,65% sí no (z 2,248 contra 2,407)
3 (n = 31.926) 1.598 de 31.926 (5,0053%) 1.768 de 31.926 (5,5378%) 0,002608 10,64% sí sí (z 3,011 contra 2,015)

La fila 2 es la razón de ser de este artículo. El valor p de 0,024567 está por debajo de 0,05, y un equipo sin plan habría parado ahí, declarado un 9,65 por ciento de ganancia y pasado al siguiente test. El plan dice que hay que continuar, porque 0,024567 todavía no es el 0,01610 que exigía esa mirada. El test sigue y termina con 10,64 por ciento, más cerca del efecto verdadero del 10 por ciento, y con un valor p un orden de magnitud menor.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Vale la pena comprobar la segunda fila en la calculadora de arriba: 21.284 visitantes y 1.078 conversiones en el control, 21.284 y 1.182 en la variante. El intervalo de confianza devuelto va de 0,0627 a 0,9146 punto porcentual, es decir, roza el cero. Es un resultado que ya es “significativo” por el criterio tradicional y que aun así, mirando el plan, no es evidencia suficiente para cerrar el experimento en ese momento.

Reproduciendo el número de la FDA

La orientación de la FDA afirma que un diseño de grupo secuencial con un único análisis interino y una frontera de eficacia comúnmente usada reduce el tamaño de muestra esperado del estudio en aproximadamente un 15 por ciento respecto a un diseño comparable de muestra fija. La nota al pie especifica el escenario: interino en la mitad de la muestra máxima, frontera tipo O Brien-Fleming, y la hipótesis alternativa en que el diseño tiene 90 por ciento de potencia.

Ejecutamos exactamente ese escenario en nuestro integrador. Las fronteras salieron en z de 2,7718 y 1,9793, la N máxima quedó un 0,79 por ciento por encima del diseño fijo, y la N esperada bajo la alternativa dio 84,72 por ciento de la N fija, es decir, una reducción del 15,28 por ciento. Bajo la nula, el coste es de un 0,51 por ciento más que el diseño fijo. El número de la agencia se reproduce sin ajuste, y ahora sabes de qué escenario exacto vino, lo cual importa porque con tres miradas y 80 por ciento de potencia el ahorro esperado cae al 14,9 por ciento y el coste bajo la nula sube al 1,6 por ciento.

Como validación del propio integrador, calibramos con él las fronteras clásicas conocidas: para tres miradas igualmente espaciadas y alfa bilateral del 5 por ciento, devolvió 3,4711, 2,4544 y 2,0040 para la forma clásica de O Brien-Fleming (literatura: 3,471, 2,454 y 2,004) y 2,2895 para la constante de Pocock (literatura: 2,289).

Cuatro cosas que la frontera no arregla

1. La estimación de un test interrumpido pronto es optimista. La FDA registra que las estimaciones convencionales, como la media muestral, tienden a quedar sesgadas hacia efectos mayores que el verdadero cuando el diseño es secuencial, y que los intervalos de confianza pierden la cobertura nominal. Existe método para corregirlo, y el plan necesita nombrar cuál se usará. Es el mismo fenómeno que describimos en la maldición del ganador, agravado a propósito por un diseño que solo para pronto cuando el resultado vino fuerte.

2. Cambiar el cronograma mirando el resultado lo rompe todo. La flexibilidad del gasto de alfa es sobre el número y el momento de las lecturas, no sobre reaccionar a lo que mostraron. El texto de la FDA da el ejemplo de lo que no hay que hacer: adelantar el próximo análisis interino porque el actual se acercó a la frontera. La recomendación de la agencia es tener un número objetivo de análisis, un calendario aproximado y un criterio escrito de cambio que dependa de información independiente del efecto estimado, como el ritmo de recolección.

3. La parada por futilidad es otra conversación. La frontera de eficacia responde “¿ya se puede decir que funciona?”. La frontera de futilidad responde “¿ya se puede decir que no vale la pena continuar?”. La FDA observa que añadir reglas de futilidad no vinculantes a un diseño de muestra fija o a un diseño con fronteras de eficacia adecuadas no aumenta la probabilidad de error tipo I, y suele ser apropiado. Las reglas vinculantes permiten relajar el umbral de eficacia, pero solo controlan el error si se obedecen de verdad. Tratamos el lado práctico de esto en parada por futilidad.

4. Nada de esto sustituye las verificaciones de sanidad. Un test con una frontera impecable y el reparto de tráfico roto sigue siendo un test equivocado, solo que con apariencia más formal.

¿Grupo secuencial o inferencia siempre válida?

Las dos familias resuelven el mismo problema y cobran en monedas diferentes.

Criterio Grupo secuencial (gasto de alfa) Inferencia siempre válida
Número de lecturas finito y marcado antes cualquier número, incluso continuo
¿Hay que marcar fechas antes? sí, o al menos el número objetivo y el criterio de cambio no
Coste en muestra máxima bajo con O Brien-Fleming (2,21% en nuestro plan) más alto, porque reserva riesgo para infinitas miradas futuras
Quien lee el panel todos los días no está autorizado a decidir fuera de las miradas puede decidir en cualquier momento
Mejor caso de uso ritual fijo de decisión, pocas lecturas, tráfico escaso panel abierto para todo el equipo, decisión oportunista

Si tu operación tiene una reunión semanal de resultados y nadie decide fuera de ella, el grupo secuencial es más barato. Si cualquier persona puede abrir el panel y actuar, la inferencia siempre válida es el diseño honesto, porque describe lo que realmente ocurre en tu empresa.

Hazlo automático en Donnu

El error que describe este artículo raramente es de estadística, es de operación: nadie escribió cuándo se leería el test y con qué corte, así que cada lectura se convierte en una decisión nueva al 5 por ciento. En Donnu el plan de lectura forma parte de la creación del experimento: eliges el número de miradas, el panel muestra el corte que exige cada una y bloquea la decisión de ganador cuando la lectura no cruzó la frontera de ese momento, en lugar de mostrar un valor p suelto que cualquiera interpreta como luz verde. Las lecturas planificadas quedan registradas con fecha, para que nadie pueda adelantar una de ellas después de ver el resultado sin que eso aparezca en el historial.

Preguntas frecuentes

Las respuestas cortas están en la sección de preguntas frecuentes de esta página, montadas a partir de los mismos cálculos presentados aquí.

Referencias

Lee también

Read in English · Leia em português

Preguntas frecuentes

¿Qué es un análisis interino en un test A/B?
Es una lectura del resultado hecha antes del final del test, en un momento marcado en el plan antes de que el test empiece, con un criterio de parada propio para ese momento. La diferencia entre análisis interino y espiar el panel es la palabra "planificada": el número de lecturas y el valor p que exige cada una se fijan antes de que la primera persona entre en el experimento, y el alfa total del 5 por ciento se reparte entre ellas.
¿Cuántas miradas puedo hacer sin inflar el falso positivo?
Ninguna, si cada mirada usa el corte del 5 por ciento. En nuestra integración numérica, dos miradas al 5 por ciento dan 8,31 por ciento de falso positivo, tres dan 10,73 por ciento, cinco dan 14,17 por ciento y veinte dan 24,79 por ciento. Con fronteras de gasto de alfa, el número de miradas deja de ser el problema: dos, tres o cinco miradas planificadas quedan todas en 5 por ciento en total, porque cada una recibe un corte más duro que compensa la repetición.
¿Cuál es la diferencia entre O Brien-Fleming y Pocock?
Es la forma de la frontera, es decir, cómo se distribuye el alfa en el tiempo. La función de gasto tipo O Brien-Fleming casi no gasta alfa al principio y deja casi todo para el final: con tres miradas, pide un valor p por debajo de 0,00069 en la primera lectura y permite 0,04388 en la última. La de Pocock reparte de forma casi uniforme: 0,02264, 0,02174 y 0,02168. La primera casi no encarece la muestra máxima (2,21 por ciento en nuestro plan) y raramente para pronto; la segunda para pronto con frecuencia, pero cobra un 17,03 por ciento más de muestra máxima.
¿Análisis interino es lo mismo que test secuencial?
No. Grupo secuencial es un número FINITO de lecturas marcadas de antemano, cada una con su corte. La inferencia siempre válida, del tipo que describen Johari, Pekelis y Walsh, permite mirar en cualquier momento, tantas veces como quieras, incluso de forma continua. El grupo secuencial cobra menos muestra cuando solo necesitas dos o tres lecturas; la inferencia siempre válida cobra más, y a cambio te quita de encima la exigencia de marcar las fechas antes.
¿Puedo cambiar las fechas de las miradas después de que el test empezó?
Solo por motivos que no miren el resultado. La orientación de la FDA es explícita en ese punto: adelantar la próxima lectura porque la actual se acercó a la frontera no es apropiado e infla el error tipo I. Cambiar la fecha porque el tráfico vino más despacio de lo previsto es aceptable, siempre que el criterio de cambio se haya escrito antes y dependa de información estadísticamente independiente del efecto estimado, como el ritmo de recolección.
¿El efecto medido cuando el test para pronto es confiable?
La dirección suele serlo, el tamaño no. La FDA registra que las estimaciones convencionales de efecto, como la media muestral, tienden a quedar sesgadas hacia efectos mayores que el verdadero cuando el diseño es de grupo secuencial, y que los intervalos de confianza pierden la cobertura nominal. Por eso el plan necesita decir, desde el principio, qué método de estimación corregida se va a usar para reportar el resultado de un test interrumpido pronto.