Calculadora de significancia para test A/B/n (múltiples variantes)
Corre B, C, D o más contra el mismo control y descubre cuál gana de verdad, con la corrección de comparaciones múltiples que bloquea el falso positivo. Gratis, sin registro, con la cuenta explicada.
Esta herramienta es para tests con más de una variación (A/B/n). Si solo comparas una variación B contra el control A, usa la calculadora de significancia estadística, que es más directa. Aquí el problema es otro: cada variación extra aumenta la chance de que un resultado parezca ganador solo por suerte, y eso es justo lo que la corrección de Bonferroni o Šidák resuelve.
| Variación | Visitantes | Conversiones | Tasa | Mejora | valor-p bruto | valor-p ajustado | Veredicto | Quitar variación |
|---|---|---|---|---|---|---|---|---|
| - | - | - | - | - | ||||
| - | - | - | - | - | ||||
| - | - | - | - | - |
Probar varias variaciones contra el mismo control multiplica la chance de un falso positivo. La corrección baja el umbral por comparación para sostener el error de toda la familia. Compara el valor-p bruto (lo que mostraría una calculadora de dos variaciones) con el ajustado: es común que una variación pase sola y caiga tras la corrección.
Cómo usarla
- Completa el control (A): visitantes y conversiones de la versión original.
- Completa cada variación (B, C, D...) con sus visitantes y conversiones. Usa el botón para agregar las que quieras.
- Elige la corrección (Bonferroni es el estándar seguro) y la confianza (95% es la convención).
- Lee el veredicto arriba y el cuadro por variación: tasa, mejora, valor-p bruto, valor-p ajustado y si cada una gana.
- Compara el valor-p bruto con el ajustado: ahí es donde la corrección muestra su trabajo.
Cómo funciona: la fórmula
Cada variación se compara contra el control con el mismo test z de dos proporciones de la calculadora de significancia común. Lo que cambia es el umbral. Llama m al número de variaciones (comparaciones). La corrección baja el alfa aceptado por comparación:
Una variación gana cuando su valor-p bruto queda por debajo de ese umbral corregido. De forma equivalente, la herramienta también muestra el valor-p ajustado (Bonferroni: p × m; Šidák: 1 − (1 − p)m), que comparas directo con el alfa original del 5%. Las dos lecturas dan el mismo veredicto.
Ejemplo trabajado (reproduce el resultado por defecto)
Con los valores que ya vienen cargados, control A = 8.000 visitantes / 400 conversiones (5,00%) y tres variaciones, Bonferroni al 95%, entonces m = 3 y el umbral por comparación pasa a ser αadj = 0,05 / 3 = 1,667%:
- B (8.000 / 520 = 6,50%, +30,0%): valor-p bruto < 0,0001, ajustado 0,0001. Por debajo de 1,667%, así que gana con significancia.
- C (8.000 / 462 = 5,78%, +15,5%): valor-p bruto 0,0299, ajustado 0,0898. El bruto pasaría solo al 95% (0,0299 < 0,05), pero está por encima del umbral corregido (0,0299 > 0,0167), así que no gana. Es el falso positivo que la corrección sostiene.
- D (8.000 / 416 = 5,20%, +4,0%): valor-p bruto 0,5653, ajustado 1,0000. Lejos de cualquier umbral, sin significancia.
Resultado: la ganadora es B. Sin la corrección, mirarías la C, verías 0,0299 y declararías dos ganadoras; una de ellas sería suerte. Es exactamente lo que la herramienta muestra arriba cuando abres la página.
Cómo interpretarla y dónde engaña
El veredicto por variación responde una sola pregunta: esta variación le gana al control de una forma que sobrevive al número de apuestas que hiciste. Una variación marcada como sin significancia no es necesariamente igual al control, casi siempre quiere decir que falta muestra para ese efecto, más aún después de que la corrección aprieta el umbral.
Límites a tener en cuenta: la cuenta asume tráfico estable y una métrica binaria (convirtió o no), y las correcciones de un paso (Bonferroni, Šidák) son conservadoras por naturaleza, cambian falso positivo por poder. Si tu objetivo es maximizar la detección con muchas variaciones, el camino definitivo es planear la muestra con ese umbral menor en mente, usando la calculadora de tamaño de muestra, y no aflojar la corrección. Antes de confiar en el veredicto, confirma también que la división de tráfico no esté rota con el verificador de SRM.
Buenas prácticas con tests A/B/n
- Prueba menos variaciones por vez. Cada una de más roba poder y muestra al conjunto entero.
- Define la métrica principal y el número de variaciones antes de encender el test, nunca agregues una variación a mitad de camino.
- Usa Bonferroni por defecto. Solo cambia a Šidák si las comparaciones son realmente independientes y quieres un hilo más de poder.
- Corre ciclos semanales completos y no pares en el primer pico. La corrección resuelve el problema de las múltiples variaciones, no el del peeking.
Preguntas frecuentes
- ¿Qué cambia cuando pruebo tres o más variaciones a la vez?
- Cada comparación extra contra el control agrega una chance de falso positivo. Con una variación al 95% de confianza el riesgo de error es 5%. Con cinco variaciones, la chance de al menos un falso positivo por suerte sube a cerca del 23%. Por eso un test A/B/n tiene que corregir el umbral de significancia: no basta con correr varios tests de dos proporciones y mirar el menor valor-p.
- ¿Cuál es la diferencia entre Bonferroni y Šidák?
- Las dos sostienen el error de la familia repartiendo la confianza entre las comparaciones. Bonferroni usa alfa dividido por el número de comparaciones (0,05 / 3 = 0,0167 para tres variaciones): es la más simple y la más conservadora. Šidák usa 1 menos (1 menos alfa) elevado a 1 sobre el número de comparaciones: es un poco menos estricta y asume que las comparaciones son independientes. En la práctica dan resultados muy cercanos; Bonferroni es la opción segura por defecto.
- ¿Por qué una variación pasa sola y reprueba tras la corrección?
- Porque el umbral se movió. Un valor-p de 0,03 rechaza la hipótesis nula al 95% si miraras esa variación aislada. Pero en un test con tres variaciones al 95%, el umbral por comparación baja a 0,0167 (Bonferroni), así que 0,03 ya no pasa. No es que la variación empeorara: la cuenta ahora cobra el precio de haber probado varias apuestas al mismo tiempo.
- ¿Es lo mismo que la calculadora de significancia de dos variaciones?
- No. La calculadora de significancia común compara una variación B contra el control A y responde si ese duelo es real. Esta es para cuando tienes B, C, D o más contra el mismo control: corre cada duelo y corrige el umbral para el conjunto entero. Si tu test tiene una sola variación, usa la calculadora de significancia estadística, que es más directa.
- ¿La corrección puede esconder una ganancia verdadera?
- Puede. Ser más estricto con el falso positivo cuesta poder estadístico: efectos reales pero pequeños se vuelven más difíciles de detectar. El remedio no es abandonar la corrección, es planear. Prueba menos variaciones por vez, o dimensiona la muestra sabiendo que el umbral será menor. Correr cinco variaciones en un tráfico que apenas banca dos es el camino más corto a un resultado no concluyente.
Continúa
Para un duelo de dos variaciones, la calculadora de significancia estadística es más directa. Si quieres entender el valor-p en sí, mira la calculadora de valor-p. Y antes de correr, dimensiona con la calculadora de tamaño de muestra para saber si tu tráfico banca todas esas variaciones.