Test A/B/n: varias variantes sin falso positivo
Cómo testear varias variantes infla el falso positivo, cuánto cuestan Bonferroni y Sidak en tráfico y cuándo un test de cuatro ramas vale la pena.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Cada variante que añades a un test es una oportunidad más de equivocarte, y la aritmética no es amable: con tres variantes contra un control en el umbral habitual del 5%, la probabilidad de coronar al menos una ganadora falsa cuando nada funciona de verdad es del 14,26%. La mayoría de los equipos que corren un test A/B/n nunca aplican ninguna corrección, leen el menor valor p de la tabla y suben eso. Esta guía cubre exactamente cuánto se infla la tasa de falso positivo, cuánto cuestan Bonferroni y Sidak en tráfico y calendario, un ejemplo trabajado en el que un resultado que parece significativo no lo es, y cómo decidir si un test de varias ramas vale la pena. Forma parte de nuestra guía completa de test A/B y se apoya en significancia estadística en test A/B.
Por qué las ramas extra cuestan más que tráfico
Un umbral del 5% en el valor p es una promesa sobre una comparación: si no existe diferencia de verdad, aun así vas a llamarla ganadora cerca del 5% de las veces. Haz la misma promesa tres veces y las promesas no se suman como sugiere la intuición. La probabilidad de que al menos una de ellas falle es 1 menos la probabilidad de que todas se sostengan, lo que da 1 menos 0,95 elevado al número de comparaciones.
| Variantes contra el control | Probabilidad de al menos una ganadora falsa | Umbral Bonferroni | Umbral Sidak |
|---|---|---|---|
| 1 | 5,00% | 0,05000 | 0,05000 |
| 2 | 9,75% | 0,02500 | 0,02532 |
| 3 | 14,26% | 0,01667 | 0,01695 |
| 4 | 18,55% | 0,01250 | 0,01274 |
| 5 | 22,62% | 0,01000 | 0,01021 |
| 6 | 26,49% | 0,00833 | 0,00851 |
| 8 | 33,66% | 0,00625 | 0,00639 |
La columna del medio es lo que los estadísticos llaman tasa de error por familia. Las dos últimas son las dos formas estándar de tirar eso de vuelta al 5%.
Johari, Pekelis y Walsh enuncian las dos definiciones de error con claridad en su trabajo sobre inferencia siempre válida: la tasa de error por familia es la probabilidad, en el peor caso, de incurrir en cualquier falso positivo, mientras que la tasa de falso descubrimiento es la proporción media, en el peor caso, de falsos positivos entre las hipótesis que rechazaste. También nombran los procedimientos estándar: Bonferroni para la tasa por familia, Benjamini-Hochberg para la tasa de falso descubrimiento. Cuál de los dos quieres depende de la decisión. Si una sola ganadora falsa saldría cara de subir, controla la tasa por familia. Si estás barriendo muchas métricas y quieres buen desempeño en el conjunto, controlar la tasa de falso descubrimiento es el objetivo más sensato.
Bonferroni y Sidak, en una línea cada uno
Bonferroni divide tu umbral por el número de comparaciones. Tres variantes, objetivo del 5%, cada comparación necesita batir 0,01667. No asume nada sobre cómo se relacionan las comparaciones, y por eso es levemente conservadora y es un buen estándar.
Sidak asume que las comparaciones son independientes y resuelve para el umbral que devuelve exactamente 5% en total: 1 menos 0,95 elevado a uno sobre el número de comparaciones. Para tres comparaciones, eso da 0,01695.
La diferencia entre las dos es de 0,0003. En la práctica, la elección entre ellas casi nunca cambia una decisión, así que elige una, regístrala en tu documento de experimento y deja de discutir. Lo que cambia una decisión es corregir o no corregir.
Ejemplo trabajado: la ganadora que la corrección derriba
Un equipo de SaaS testea tres layouts nuevos de página de precios contra el actual. El tráfico se reparte en cuatro, 18.000 visitantes por rama, y la métrica es inicio de trial.
| Variación | Visitantes | Conversiones | Tasa | Mejora | valor-p bruto | valor-p ajustado | Veredicto | Quitar variación |
|---|---|---|---|---|---|---|---|---|
| - | - | - | - | - | ||||
| - | - | - | - | - | ||||
| - | - | - | - | - |
Probar varias variaciones contra el mismo control multiplica la chance de un falso positivo. La corrección baja el umbral por comparación para sostener el error de toda la familia. Compara el valor-p bruto (lo que mostraría una calculadora de dos variaciones) con el ajustado: es común que una variación pase sola y caiga tras la corrección.
Este es el marcador.
| Rama | Visitantes | Trials iniciados | Tasa | Ganancia relativa | Valor p bruto | Valor p ajustado |
|---|---|---|---|---|---|---|
| Control | 18.000 | 720 | 4,000% | referencia | referencia | referencia |
| B | 18.000 | 803 | 4,461% | +11,53% | 0,0298 | 0,0893 |
| C | 18.000 | 742 | 4,122% | +3,06% | 0,5569 | 1,0000 |
| D | 18.000 | 707 | 3,928% | -1,81% | 0,7255 | 1,0000 |
Bonferroni con tres comparaciones; el valor p ajustado es el bruto multiplicado por tres y limitado a 1.
La variante B es la hora de la verdad. El valor p bruto de 0,0298 está cómodamente por debajo de 0,05, la ganancia es de +11,53% y el intervalo de confianza sobre la diferencia va de +0,045 a +0,877 puntos porcentuales, sin incluir el cero. Todo instinto en la sala manda subirla.
El umbral corregido es 0,01667, y 0,0298 no pasa de ahí. Dicho de otro modo, el valor p ajustado es 0,0893. Sidak da esencialmente la misma respuesta, 0,0866. La lectura correcta es que B es la más prometedora de las tres y el test no lo confirma.
Para contraste, un efecto genuinamente grande sobrevive sin discusión. Si B hubiera llegado a 855 trials (4,750%, una ganancia de +18,75%), el valor p bruto sería 0,0005 y el ajustado 0,0015, claramente significativo bajo cualquiera de esas correcciones. Y la frontera no está lejos: B necesitaría 812 trials, tasa de 4,511% y ganancia de +12,78%, para que el valor p bruto llegara a 0,0163 y pasara la barra corregida. Nueve conversiones más en 18.000 visitantes separan “prometedora” de “confirmada” aquí, lo que es un buen recordatorio de lo fina que es la evidencia en el borde de cualquier umbral.
Cuánto cuesta la corrección en tráfico y calendario
La corrección no sube la barra solo a la hora del análisis. Si planificas el test bien, eleva la muestra necesaria antes del lanzamiento, porque un umbral más rígido exige más evidencia para el mismo efecto detectable. Y estás pagando por más ramas al mismo tiempo.
| Variantes | Umbral corregido | Visitantes por rama | Visitantes en total | Días a 25.000 por semana |
|---|---|---|---|---|
| 1 (A/B simple) | 0,05000 | 17.943 | 35.886 | 11 |
| 2 | 0,02500 | 21.729 | 65.187 | 19 |
| 3 | 0,01667 | 23.933 | 95.732 | 27 |
| 5 | 0,01000 | 26.699 | 160.194 | 45 |
Dimensionamiento con base del 4%, efecto mínimo detectable del 15% relativo, potencia del 80%, bilateral, con el umbral corregido por Bonferroni.
Dos cosas saltan. El coste por rama de la corrección es modesto: ir de una comparación a tres eleva la muestra por rama solo cerca de un 33%, porque el tamaño de muestra responde al umbral por el cuadrado de un valor crítico y no linealmente. La parte cara son las ramas en sí. Tres variantes convierten 35.886 visitantes en 95.732, es decir 2,7 veces el tráfico, y once días en veintisiete.
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Esa razón es la decisión de verdad. Un test de cuatro ramas no es “un test que responde tres preguntas”, es casi tres tests corridos en paralelo con un control compartido, y debería justificarse del mismo modo. El efecto mínimo detectable que puedes costear en un diseño de cuatro ramas es bastante peor que en uno de dos, con el mismo tamaño de calendario, y fingir lo contrario es como los programas acaban con un cajón lleno de tests multi-rama inconclusos.
La multiplicidad que no te diste cuenta de que tenías
Las variantes son la fuente visible de comparaciones múltiples. Hay otras tres igualmente reales y mucho más fáciles de no notar.
Métricas. Leer cinco métricas al 5% es aritméticamente idéntico a cinco variantes: cerca del 22,62% de probabilidad de que una cruce la línea por azar. La corrección normalmente no es una fórmula, es declarar una métrica primaria antes del lanzamiento y dejar que ella cargue la decisión.
Segmentos. Trocear un resultado neutro por dispositivo, canal, país y nuevo contra recurrente genera una docena de comparaciones en pocos clics, y al menos una va a parecer significativa. El análisis de segmento es valioso para generar la siguiente hipótesis y es casi inútil como confirmación, a menos que el segmento haya sido nombrado antes del lanzamiento.
Tiempo. Mirar el resultado todos los días durante dos semanas son catorce miradas, y eso infla la tasa de falso positivo del mismo modo. Es el problema del peeking, y se suma a todo lo anterior en vez de sustituirlo.
Rondas secuenciales. Correr las mismas cuatro ideas como cuatro tests A/B separados y subir la mejor no escapa de la multiplicidad. Las comparaciones siguieron ocurriendo; solo fueron esparcidas por el calendario. La regla honesta es que la corrección acompaña al número de comparaciones que alimentaron la decisión, no al número de líneas de tu registro de tests.
En Bing, el sistema de detección de interacción necesitaba correr cientos de miles de pruebas de hipótesis, y Kohavi y colegas reportan usar un algoritmo bayesiano empírico de control de la tasa de falso descubrimiento para mantener el conteo de falsos positivos manejable. La lección para un programa menor no es copiar el algoritmo, es notar que quien testea a escala acaba necesitando una política explícita sobre multiplicidad, y que esa política necesita estar escrita en vez de improvisada en cada test.
Cuándo el test multi-rama es la elección correcta
| Situación | Diseño mejor |
|---|---|
| Cuatro propuestas de valor genuinamente diferentes, tráfico alto | A/B/n con corrección, dimensionado para el umbral corregido |
| Cuatro variantes pequeñas de la misma idea | Elige la mejor y corre un test de dos ramas; los efectos son demasiado pequeños para pagar la cuenta corregida |
| Una idea, varias métricas que importan | Test de dos ramas con una métrica primaria declarada y el resto como contexto |
| Poco tráfico y varias ideas | Tests secuenciales de dos ramas, uno cada vez, la mayor apuesta primero |
| Muchas ramas y quieres el tráfico fluyendo hacia lo que funciona | Un bandit, que optimiza conversión total en vez de producir un veredicto limpio por rama |
La última fila merece una salvedad, porque suele venderse de más. Un bandit multi-brazo es un objetivo diferente, no un A/B/n más barato: maximiza conversiones durante el test en vez de entregar una estimación limpia del efecto de cada rama. Si necesitas un número defendible para una decisión que sobrevive al test, quien produce eso es un experimento controlado con corrección. Los detalles están en bandits contra test A/B.
Errores comunes en test A/B/n
| Error | Qué produce |
|---|---|
| Reportar el menor valor p sin corrección | Una ganadora falsa más o menos una vez cada siete, con tres variantes |
| Corregir en el análisis pero dimensionar sin corrección | Un test subdimensionado que casi nunca pasa la barra corregida |
| Añadir una cuarta variante “ya que estamos testeando” | Toda rama pierde potencia y el calendario crece semanas |
| Quitar ramas perdedoras a mitad y releer | Multiplicidad más peeking, sin ninguna tasa de error válida sobrando |
| Tratar una no ganadora corregida como idea muerta | La variante B de arriba es buena candidata, no es una idea enterrada |
| Leer segmentos después del hecho como confirmación | Una docena de comparaciones extra silenciosas y una historia que no se va a repetir |
Hazlo automático en Donnu
Una corrección solo protege el programa cuando se aplica por defecto, y no por acordarse. Donnu A/B cuenta las comparaciones del test, aplica la corrección al umbral antes de mostrar cualquier veredicto y reporta el valor p ajustado junto al bruto, para que nadie tenga que reconstruir qué barra pasó realmente el resultado. El tamaño de muestra que recomienda en el diseño ya tiene en cuenta el número de ramas, así que un test de cuatro vías no se planifica como si fuera de dos.
Empieza una prueba gratis de 14 días y dimensiona tu próximo test multi-rama contra tu propia base.
Referencias
- Johari, R., Pekelis, L. y Walsh, D.J. Always Valid Inference: Continuous Monitoring of A/B Tests. arXiv:1512.04922. Fuente de las definiciones de tasa de error por familia y tasa de falso descubrimiento usadas aquí, y de la descripción de Bonferroni y Benjamini-Hochberg como los procedimientos estándar de horizonte fijo. arxiv.org/abs/1512.04922.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fuente del relato de control bayesiano empírico de la tasa de falso descubrimiento en cientos de miles de pruebas de hipótesis en Bing. exp-platform.com.
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Sobre efectos sostenidos y la disciplina de decidir qué cuenta como resultado antes de correr. exp-platform.com.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Material complementario en experimentguide.com.
Lee también: Qué es un test A/B · Significancia estadística en test A/B · Test A/B, multivariado y split URL · El problema del peeking · Calculadora de significancia A/B/n gratis · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es un test A/B/n?
- Un test A/B/n compara un control contra más de una variante al mismo tiempo, repartiendo el tráfico entre todas las ramas. La mecánica es idéntica a la de un test A/B, pero la estadística no: cada variante de más es otra comparación contra el control, y cada comparación carga su propia probabilidad de falso positivo. Con tres variantes testeadas al 5%, la probabilidad de que al menos una produzca una ganadora falsa cuando nada funciona es de cerca del 14,26%, no del 5%. Ese es el motivo entero de que el A/B/n necesite corrección y muestra mayor.
- ¿Cuánto inflan el falso positivo varias variantes?
- La tasa de error por familia, es decir la probabilidad de al menos un falso positivo en el test entero, es 1 menos 0,95 elevado al número de comparaciones. Una comparación da 5%, dos dan 9,75%, tres dan 14,26%, cinco dan 22,62% y ocho dan 33,66%. Con ocho variantes tienes una probabilidad entre tres de coronar a una ganadora que no existe, incluso si toda variante es idéntica al control. Ningún valor p individual está mal; el problema es leer muchos de ellos y reportar solo el menor.
- ¿Qué es la corrección de Bonferroni y cuándo usarla?
- Bonferroni divide tu umbral de significancia por el número de comparaciones. Con tres variantes y objetivo del 5%, cada comparación necesita batir 0,0167 en vez de 0,05. Es la corrección más simple, es conservadora y es el estándar correcto cuando una ganadora falsa saldría cara de subir. La corrección de Sidak es una alternativa levemente menos rígida que asume independencia: para tres comparaciones da 0,01695 en vez de 0,01667, una diferencia demasiado pequeña para cambiar la mayoría de las decisiones.
- ¿Cuánto tráfico extra exige un test A/B/n?
- Dos multiplicadores se suman. Primero, el umbral corregido eleva la muestra por rama: con base del 4% y efecto mínimo detectable del 15% relativo, una comparación exige 17.943 visitantes por rama y tres comparaciones exigen 23.933. Segundo, ahora tienes cuatro ramas en vez de dos. El tráfico total pasa de 35.886 visitantes a 95.732, cerca de 2,7 veces el coste. A 25.000 visitantes por semana, eso son 27 días en vez de 11.
- ¿No es mejor correr tests A/B separados?
- Correr las mismas comparaciones en secuencia no elimina la multiplicidad, solo la esconde, porque sigues eligiendo el mejor de varios resultados. Lo que los tests secuenciales compran de verdad es la oportunidad de aprender entre rondas y de descartar una idea mala barato. La regla honesta es que la corrección acompaña al número de comparaciones que hiciste hasta la decisión, no al número de tests en el calendario. Si de verdad quieres el camino más rápido con varias ideas, un A/B/n con corrección suele ser más limpio que cuatro tests secuenciales leídos sin ninguna.
- ¿Necesito corregir también para varias métricas?
- Sí, y esa es la versión que los equipos olvidan. Leer cinco métricas al 5% da cerca del 22,62% de probabilidad de que al menos una cruce la línea por azar, exactamente la misma aritmética que cinco variantes. La corrección estándar es declarar una métrica primaria antes del lanzamiento, que carga la decisión, y tratar el resto como contexto y no como evidencia. Cuando de verdad necesitas decidir por varias métricas a la vez, aplica una corrección a esas comparaciones del mismo modo.
- ¿Cuándo testear más de dos variantes es de verdad buena idea?
- Cuando las variantes son apuestas genuinamente diferentes, y no pequeños ajustes unas de otras; cuando tu tráfico paga la cuenta de la muestra corregida; y cuando perder también enseña. Cuatro propuestas de valor distintas en una página de precios es un buen A/B/n. Cuatro tonos del mismo botón no lo es, porque los efectos son pequeños, la muestra corregida es enorme y la respuesta no cambia nada de lo que vas a hacer después. Si tu tráfico no sostiene el diseño corregido, testear dos ideas bien le gana a testear cuatro mal.