Estadística

Test Unilateral vs Bilateral en Test A/B: cuál usar

Test unilateral o bilateral en test A/B: qué cambia en la z crítica, cuánta muestra ahorra, el riesgo de elegir la cola después y cuándo es legítimo.

Ilustración plana de dos curvas en forma de campana verde oscuro una al lado de la otra sobre fondo verde menta, con una pequeña área superpuesta más clara entre ellas y una línea vertical discontinua a la izquierda

El test unilateral es el test de hipótesis que busca diferencia en una única dirección, elegida antes de recoger los datos, y por eso coloca todo el riesgo de falso positivo en una sola cola; el test bilateral busca diferencia en las dos direcciones y reparte ese riesgo por la mitad. Al 95 por ciento de confianza, el unilateral declara victoria a partir de una z igual a 1,645 y el bilateral solo a partir de 1,96. En la práctica, el unilateral pide cerca de un 21 por ciento menos de visitantes y, cuando el efecto va en la dirección prevista, devuelve un valor p que es exactamente la mitad del bilateral. El precio es quedar ciego ante la variación que empeora y, si la cola se elige después de ver el dato, duplicar el error que crees estar controlando. Este texto forma parte de nuestra guía de significancia estadística en test A/B, que recomienda el bilateral como estándar en un párrafo; aquí está la cuenta entera detrás de esa recomendación, con simulación, fuentes de los dos lados, herramientas y un ejemplo trabajado de comercio electrónico y SaaS, y las excepciones en las que no vale.

Qué es un test unilateral y qué es un test bilateral

Todo test A/B frecuentista tiene una hipótesis nula, la que intentas derribar, y una alternativa, la que quieres mostrar. La diferencia entre unilateral y bilateral está entera en cómo se escribe la alternativa.

La calculadora de muestra de este blog usa “bilateral” y “unilateral”; en inglés, two-tailed y one-tailed, o two-sided y one-sided. Es lo mismo.

bilateral unilateral (dirección: B mejor)
hipótesis nula B igual a A B menor o igual que A
hipótesis alternativa B diferente de A B mayor que A
dónde queda el alfa del 5% 2,5% en cada cola 5% en la cola de arriba
z crítica al 95% 1,96 en módulo 1,645
¿puede declarar que B empeoró? sí no
pregunta que responde ¿B es diferente de A? ¿B es mejor que A?

Nada cambia en la fórmula del estadístico z, que sigue siendo la diferencia entre las tasas dividida por el error estándar. Cambia solo la regla contra la que se compara esa z.

Qué cambia en la región crítica: 1,645 frente a 1,96

La región crítica es el conjunto de valores de z que llevan a rechazar la nula. En el bilateral al 95 por ciento, son los valores por encima de 1,96 o por debajo de menos 1,96: cada franja tiene un 2,5 por ciento de probabilidad bajo la nula. En el unilateral al 95 por ciento, son los valores por encima de 1,645, una sola franja, con un 5 por ciento.

Región crítica del test bilateral y del test unilateral al 95 por ciento de confianzaDos gráficos de curva normal uno al lado del otro. A la izquierda, el test bilateral: las dos colas extremas están pintadas, por debajo de menos 1,96 y por encima de 1,96, cada una con el 2,5 por ciento del área. A la derecha, el test unilateral: solo la cola de arriba está pintada, a partir de 1,645, con el 5 por ciento del área. Una nota indica que una z entre 1,645 y 1,96 es significativa en el unilateral y no en el bilateral.bilateral: alfa dividido en dos colasunilateral: alfa entero en una cola-1,9601,962,5%2,5%01,6455%una z entre 1,645 y 1,96 es significativa en el unilateral y no en el bilateral: bajo la nula, eso pasa en el 2,5% de los tests.curvas de la distribución del estadístico z bajo la hipótesis nula; las áreas pintadas son las regiones de rechazo
El test es el mismo estadístico z. Lo que cambia es dónde está la línea de corte, y si existe línea de corte del lado del empeoramiento.

La franja entre 1,645 y 1,96 es la zona de discrepancia: significativa para quien registró unilateral, no significativa para quien registró bilateral. Bajo la nula, tiene un 2,5 por ciento de probabilidad, la porción que reaparece en el coste de elegir la cola después. Los valores críticos, calculados con zCritical(alpha, sided) del motor estadístico del blog:

confianza alfa z crítica unilateral z crítica bilateral
90% 0,10 1,2816 1,6449
95% 0,05 1,6449 1,9600
99% 0,01 2,3263 2,5758

Fíjate en la diagonal: el unilateral al 95 por ciento usa el mismo número que el bilateral al 90 por ciento. Guarda eso, porque explica de dónde viene el ahorro de muestra.

El valor p unilateral es la mitad del bilateral, cuando el efecto va en la dirección prevista

El valor p bilateral suma el área de las dos colas más allá de la z observada, en módulo. El unilateral suma solo el área de la cola elegida. Como la curva normal es simétrica, la relación es exacta:

p unilateral = p bilateral ÷ 2, si el efecto va en la dirección registrada · p unilateral = 1 − p bilateral ÷ 2, si va en la dirección opuesta

GraphPad registra las dos mitades en su página de preguntas frecuentes: en la dirección prevista, el valor p unilateral es la mitad del bilateral; en la opuesta, la diferencia, por grande que sea, tendría que atribuirse al azar y llamarse no significativa.

Por qué el valor p unilateral es la mitad del bilateralCurva normal con el estadístico z observado de 1,79 marcado a la derecha. El área a la derecha de 1,79 está pintada en verde y vale 0,0368, el valor p unilateral. El área reflejada a la izquierda de menos 1,79 está pintada en naranja claro; sumada a la de la derecha da 0,0735, el valor p bilateral. Marcas finas indican las líneas de corte 1,645 y 1,96: la z de 1,79 queda entre ellas.el mismo z observado, dos áreas diferentes01,6451,96-1,79z observada = 1,79cola de arribap unilateral 0,0368cola reflejadaentra solo en el bilateralp bilateral = 0,0368 + 0,0368 = 0,0735. Si la z fuera -1,79, el p unilateral (dirección B mejor) sería 0,9632.
Valores del ejemplo de comercio electrónico de esta guía. La suma exacta sale 0,073505 y la mitad, 0,036752; en la figura aparecen redondeados.

Es esa relación la que permite leer un unilateral registrado con la calculadora de significancia de esta guía, que es siempre bilateral: si la variación va por delante, en la dirección declarada, divide por 2 el valor p de la pantalla. Si va por detrás, el valor p unilateral es 1 menos la mitad, y para ese test el empeoramiento no existe como conclusión.

Cuánta muestra ahorra el test unilateral

La fórmula de muestra de dos proporciones eleva al cuadrado la suma de la z crítica con la z de la potencia. Cambiar 1,96 por 1,645 encoge esa suma: con un 80 por ciento de potencia (z de 0,8416), la razón queda cerca de (1,645 + 0,8416)² ÷ (1,96 + 0,8416)², cerca de 0,79. Calculado con sampleSizePerVariant, al 95 por ciento de confianza y 80 por ciento de potencia:

contexto típico tasa base efecto mínimo (relativo) bilateral, por variación unilateral, por variación ahorro
comercio electrónico, visitante a compra 2% 10% 80.682 63.553 21,2%
comercio electrónico, visitante a compra 2% 20% 21.109 16.627 21,2%
comercio electrónico, página de producto 3% 10% 53.211 41.914 21,2%
comercio electrónico, página de producto 3% 20% 13.914 10.960 21,2%
SaaS, visitante a trial 5% 10% 31.234 24.603 21,2%
SaaS, visitante a trial 5% 20% 8.158 6.426 21,2%
SaaS, trial a pago 10% 10% 14.751 11.620 21,2%
SaaS, trial a pago 10% 5% 57.763 45.500 21,2%

Tres lecturas. El ahorro es casi constante: cerca de un 21 por ciento al 80 por ciento de potencia, en cualquier base y efecto; al 90 por ciento de potencia, cerca del 18,5 por ciento (71.233 frente a 58.057 en la fila de 3 y 10 por ciento). No es un descuento: cada número de la columna unilateral es idéntico a la muestra del bilateral al 90 por ciento de confianza, y la guía de CRO para sitios de bajo tráfico usa el mismo par, 13.914 en el bilateral frente a 10.960 en el unilateral. Es el mismo presupuesto de error gastado en una sola cola. Es una palanca pequeña: cambiar el efecto mínimo del 10 al 20 por ciento recorta cerca del 74 por ciento de la muestra (de 53.211 a 13.914), porque la muestra cae con el cuadrado del efecto, como detalla la guía de efecto mínimo detectable; cambiar la cola recorta un 21.

Georgiev, que defiende el unilateral en el blog de Analytics-Toolkit, escribe que el bilateral al 95 por ciento necesita entre un 20 y un 60 por ciento más de muestra que el unilateral para detectar el mismo efecto. Es compatible con la tabla: 53.211 es un 27 por ciento más que 41.914, y él dice que la franja varía con el umbral de significancia exigido.

El ahorro que desaparece en el calendario

Existe un detalle operativo que cambia la cuenta: un test A/B debe ejecutarse en semanas enteras, para cubrir el ciclo de comportamiento de los días laborables y del fin de semana, como detalla la guía de ciclo semanal en test A/B. Redondeado a semanas completas, el ahorro puede convertirse en una semana entera o puede convertirse en cero.

Duración del test en días y en semanas enteras, bilateral y unilateralBarras horizontales de duración sobre una escala de 0 a 21 días, con líneas verticales cada 7 días. Comercio electrónico con 42.000 visitantes por semana: el bilateral necesita 18 días y redondea a 21; el unilateral necesita 14 días y se queda en 14. SaaS con 6.000 visitantes por semana: el bilateral necesita 20 días y el unilateral 16; los dos redondean a 21 días.días calculados (barra llena) y semanas enteras (contorno)07 días14 días21 díascomercio electrónico, bilateral53.211 por variación18 díascomercio electrónico, unilateral41.914 por variación14 días1 semana menosSaaS, bilateral8.568 por variación20 díasSaaS, unilateral6.749 por variación16 díascomercio electrónico: base 3%, efecto del 10%. SaaS: base 8%, efecto del 15%. Ambos al 95% de confianza y 80% de potencia.
En el comercio electrónico, el unilateral cabe en dos semanas y el bilateral pide tres. En el SaaS, los dos terminan en la tercera semana: la cola no ahorró un día de calendario.
escenario tráfico semanal bilateral unilateral semanas enteras, bilateral semanas enteras, unilateral
comercio electrónico, base 3%, efecto 10% 42.000 53.211 por variación, 18 días 41.914 por variación, 14 días 3 2
SaaS, base 8%, efecto 15% 6.000 8.568 por variación, 20 días 6.749 por variación, 16 días 3 3

La otra cara de la misma moneda es la potencia. Si mantienes la muestra del bilateral y analizas como unilateral, la potencia sube: en la base del 3 por ciento con efecto del 10 por ciento, 53.211 visitantes por variación dan un 80 por ciento de potencia en el bilateral y un 87,63 por ciento en el unilateral, según el powerForSample del motor. Es el mismo intercambio visto desde otro ángulo, y la calculadora de poder estadístico hace la cuenta para tu caso.

El coste 1: quedar ciego ante la variación que empeora

El ahorro del unilateral se paga con una conclusión menos. El test registrado como “B es mejor que A” solo tiene dos resultados: evidencia de que B es mejor, o ausencia de esa evidencia. La variación que hunde la conversión cae en el segundo cubo, junto con la neutra.

Con números: la tienda del ejemplo trabajado ejecuta otra variación durante dos semanas, 42.000 visitantes por brazo. El control convierte 1.260 (3,00 por ciento); la variación, 1.150 (2,74 por ciento), una caída del 8,7 por ciento relativo.

En la calculadora de significancia más abajo, esos números aparecen como 3,00% y 2,74%, mejora relativa de -8,7%, valor p de 0,0230, intervalo de -0,5% … -0,0% (pp) y Ganadora con significancia · A gana.

Lo que cada test consigue decir en cada realidadMatriz con tres columnas de realidad, B mejor, B igual y B peor, y dos filas de test. En la fila del bilateral, las tres columnas tienen conclusiones distintas: gana B, sin significancia y gana A. En la fila del unilateral con dirección B mejor, solo la primera columna tiene conclusión propia, gana B; las columnas B igual y B peor muestran la misma conclusión, sin significancia, destacada en naranja.lo que el informe consigue decirB es mejorB es igualB es peorbilateralB diferente de Agana Bsin significanciagana AunilateralB mayor que Agana Bsin significanciaempate y empeoramiento reciben la misma etiquetaen el ejemplo: 1.260 frente a 1.150 conversiones en 42.000 visitantes por brazo.bilateral: p de 0,0230, gana A. unilateral (B mejor): p de 0,9885, sin significancia.
Cada conclusión verde es una decisión posible. El unilateral tiene una menos, y es justamente la que avisaría de que la idea hizo daño.

Cuánto importa eso depende de qué cambiaría el empeoramiento en la decisión. Si “B empeoró” y “B empató” llevan al mismo sitio, no lanzar, la ceguera cuesta poco para esa decisión. Pero cuesta en el aprendizaje (la hipótesis que hizo daño vuelve al backlog en seis meses) y en la validación de cambios que ya salieron al aire sin test. Con la muestra planificada para el unilateral (41.914 por variación), un bilateral tendría un 74,22 por ciento de potencia para detectar una caída del 10 por ciento relativo; el unilateral no tiene esa conclusión en el diseño.

El coste 2: elegir la cola después de ver el dato

El test unilateral controla el error en el 5 por ciento si la dirección se eligió antes. Si el equipo mira el resultado y solo entonces decide hacia qué lado testear, la dirección se convierte en un reflejo del propio dato.

La cuenta es corta. Bajo la nula, la z queda por encima de 1,645 en el 5 por ciento de los tests y por debajo de menos 1,645 en otro 5. Quien testea unilateralmente “hacia el lado al que fue la variación” rechaza en los dos casos: 10 por ciento. Quien ejecuta bilateral y, cuando no sale, cambia a unilateral solo si la variación va por delante, rechaza por encima de 1,645 (5 por ciento) o por debajo de menos 1,96 (2,5 por ciento): 7,5 por ciento.

Para no depender solo del álgebra, ejecutamos una simulación con semilla fija: 20.000 tests A/A, 5.000 visitantes por brazo, conversión real del 5 por ciento en los dos (ninguna diferencia verdadera), generador pseudoaleatorio mulberry32 con semilla 20260915, cada test analizado con la misma función significance de las calculadoras.

regla de análisis tasa de “diferencia significativa” falsa victoria de la variación falsa victoria del control teoría
bilateral registrado antes 5,00% (999) 2,57% (513) 2,43% (486) 5%
unilateral registrado antes, B mejor 5,12% (1.023) 5,12% (1.023) no existe 5%
unilateral en la dirección que mostró el dato 9,89% (1.978) 5,12% (1.023) 4,78% (955) 10%
rescate: bilateral, y si falla con B por delante, unilateral 7,54% (1.509) 5,12% (1.023) 2,43% (486) 7,5%
Falsos positivos en 20.000 tests A/A por regla de análisisBarras horizontales apiladas en una escala de 0 a 10 por ciento. Bilateral registrado antes: 2,57 por ciento de falsa victoria de la variación y 2,43 del control, total 5,00. Unilateral registrado antes: 5,12 por ciento, solo del lado de la variación. Unilateral en la dirección del dato: 5,12 más 4,78, total 9,89. Rescate: 5,12 más 2,43, total 7,54. Una línea discontinua marca el 5 por ciento prometido.20.000 tests A/A, ninguna diferencia real, semilla 202609155% prometido0%10%bilateral registrado5,00%unilateral registrado5,12%cola elegida después9,89%rescate del bilateral7,54%falsa victoria de la variaciónfalsa victoria del control5.000 visitantes por brazo, conversión real del 5% en los dos, generador mulberry32
El rescate es el caso más común en la vida real y el más traicionero: la tasa total parece solo un poco por encima del 5%, pero la falsa victoria de la variación, que es la que se convierte en lanzamiento, se duplicó.

Aquí las fuentes serias discrepan, y vale la pena leer las dos.

Quien defiende el unilateral. Georgi Georgiev, autor de Analytics-Toolkit y del sitio onesided.org, sostiene que los valores p y los límites de confianza unilaterales ofrecen las mismas probabilidades de error que los bilaterales, cada uno bajo su propia nula, y llega a afirmar que una afirmación direccional puede apoyarse en el test unilateral correspondiente sin predicción previa. La simulación coincide con la parte técnica: “B es mejor que A” afirmado con unilateral al 5 por ciento se equivoca, bajo la nula, en cerca del 5 por ciento de las veces (5,12 en la tabla), prevista o no.

Quien pide la dirección antes. La simulación también muestra que el equipo que se permite las dos afirmaciones, “B es mejor” o “A es mejor”, según el dato, hace alguna afirmación falsa en casi el 10 por ciento de los A/A. La UCLA es tajante: elegir unilateral solo para obtener significancia, o después de un bilateral que no rechazó la nula, no es apropiado, por cerca que haya quedado el bilateral. GraphPad recomienda usar solo valores p bilaterales, entre otros motivos para evitar la tentación de cambiar el análisis después del resultado.

Las posiciones se concilian cuando se pregunta qué error importa para tu decisión:

El defecto no es la cola. Es que la confianza anunciada no coincida con el procedimiento usado, el mismo mecanismo del problema del peeking y de los caminos que se bifurcan del plan de análisis preregistrado.

Cuándo es legítimo el test unilateral

El test unilateral es legítimo cuando se cumplen tres condiciones a la vez.

  1. La dirección está escrita antes del test. En el plan de análisis o en la configuración de la herramienta, no en la diapositiva del resultado.
  2. Un resultado en la dirección opuesta llevaría a la misma decisión que un empate. La UCLA formula el criterio por las consecuencias: el unilateral encaja cuando el coste de perder un efecto en la dirección no testeada es despreciable, y en absoluto irresponsable. En test de conversión eso es casi verdad (no lanzar), pero no del todo (el aprendizaje se pierde).
  3. La confianza reportada es la del procedimiento. El informe dice “unilateral al 95 por ciento”, y no “95 por ciento de confianza”, que cualquier lector entiende como bilateral.

Hay contextos en los que el unilateral no es un atajo, es la pregunta correcta:

La misma ICH E9 trae la posición más conservadora. Reconoce que el tema es controvertido, pide justificación prospectiva para el test unilateral y dice que, en entorno regulatorio, es preferible fijar el error tipo I unilateral en la mitad del bilateral, un 2,5 por ciento. Con esa regla, el unilateral no ahorra muestra: z crítica de 1,96 de las dos formas. Un test de conversión no necesita el rigor de un ensayo de medicamento, pero el razonamiento sirve: si el ahorro de muestra es el único motivo, estás aflojando la regla, no refinando la pregunta.

Qué dicen las fuentes serias y las herramientas

La tabla resume la posición de cada fuente leída para esta guía. La documentación de las herramientas cambia; las filas de herramienta se consultaron el 15/09/2026.

fuente posición qué sustenta
Georgiev, Analytics-Toolkit (2017, actualizado en 2018) y onesided.org a favor del unilateral en la mayoría de los tests A/B unilateral cuando la acción depende de una diferencia en una dirección; no permite más error tipo I que el bilateral; el bilateral pide entre un 20 y un 60% más de muestra
GraphPad, FAQ 1318 recomienda solo valores p bilaterales el p unilateral es la mitad del bilateral en la dirección prevista; la dirección debe preverse antes de los datos
UCLA, Statistical Consulting unilateral solo con justificación de consecuencias no es apropiado elegir unilateral para obtener significancia o después de un bilateral que falló
ICH E9 (directriz de ensayos clínicos) el unilateral exige justificación prospectiva; alfa de la mitad del bilateral en entorno regulatorio intervalo unilateral en no inferioridad
Optimizely, Statistical significance usa bilateral el bilateral es exigido por el control de tasa de falsos descubrimientos del Stats Engine
Statsig, One-Sided Test estándar bilateral; unilateral configurable por métrica el unilateral no detecta movimiento en la dirección no especificada; usos en guardrail
Convert, Next Generation of Convert Experiences ofrece unilateral y bilateral en el modo frecuentista elección de cola a la izquierda o a la derecha en el unilateral

Sobre las herramientas, solo lo que afirman las páginas leídas. Statsig permite cambiar la cola por métrica en la configuración del experimento, muestra un intervalo unilateral que se extiende al infinito del lado no testeado y avisa de que ejecutar dos tests unilaterales da un test menos potente, con intervalos que parecen más estrechos de lo que deberían. Convert, en un texto actualizado el 27 de agosto de 2026, permite elegir también la cola a la izquierda o a la derecha. El artículo de Georgiev listaba varios proveedores como bilaterales, con base en un relevamiento de ConversionXL de julio de 2015; con más de diez años y motores cambiados desde entonces, la lista no entra aquí como retrato actual. Las calculadoras de este blog: la de significancia hace un test z bilateral; la de muestra tiene selector bilateral y unilateral.

Ejemplo trabajado: comercio electrónico y SaaS con las calculadoras

Comercio electrónico: planificar con la calculadora de muestra

Escenario. Una tienda con conversión del 3,00 por ciento en la página de producto y 42.000 visitantes por semana (6.000 por día) quiere probar un bloque de prueba social por encima del botón de compra. La decisión es binaria: lanzar el bloque si aumenta la conversión; no lanzarlo si no la aumenta. Un resultado peor llevaría a la misma decisión que un empate, y el equipo registra en el plan, antes de empezar, test unilateral, dirección variación mejor, 95 por ciento de confianza, 80 por ciento de potencia, efecto mínimo del 10 por ciento relativo.

En la calculadora de abajo, escribe: Tasa de conversión actual 3; Efecto mínimo detectable 10, con la opción relativo (%); Confianza 95; Potencia 80; Visitantes por semana (total) 42000; Test bilateral.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La pantalla muestra 53.211 visitantes por variación, 106.422 en total y 18 en la duración estimada, en días. Ahora cambia solo el campo Test a unilateral: la pantalla pasa a mostrar 41.914 por variación, 83.828 en total y 14 días. Redondeado a semanas completas, es la diferencia entre tres semanas y dos. Para el escenario de SaaS de abajo, los mismos pasos con tasa 8, efecto 15 y 6000 visitantes por semana muestran 8.568, 17.136 y 20 días en el bilateral, y 6.749, 13.498 y 16 días en el unilateral.

Comercio electrónico: el resultado y la calculadora de significancia

Después de 14 días, con 42.000 visitantes por brazo (por encima de los 41.914 planificados):

brazo visitantes conversiones tasa
A, control 42.000 1.260 3,00%
B, con prueba social 42.000 1.350 3,21%

Pega en la calculadora: Control (A) con 42000 visitantes y 1260 conversiones; Variación (B) con 42000 visitantes y 1350 conversiones; Confianza 95%.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

La pantalla muestra una tasa del 3,00% en el control y del 3,21% en la variación, mejora relativa del +7,1%, valor p de 0,0735, intervalo del 95 por ciento de la diferencia de -0,0% … +0,4% (pp) y el veredicto Todavía sin significancia. Ese veredicto es el del test bilateral, porque es el único que hace la calculadora.

La cuenta detrás, en precisión completa:

Ahora la lectura unilateral registrada. El efecto fue hacia el lado previsto (B por delante), así que el valor p unilateral es el bilateral dividido por 2: 0,073505 ÷ 2 = 0,036752, por debajo de 0,05. Según el plan registrado, gana B. El límite inferior unilateral del 95 por ciento de la diferencia, que es el límite inferior del intervalo bilateral del 90 por ciento, queda en más 0,0173 puntos porcentuales: por encima de cero, por poco.

Hay un atajo en la propia calculadora. Cambia Confianza al 90%: el valor p sigue siendo 0,0735, el intervalo pasa a +0,0% … +0,4% (pp) y el veredicto se convierte en Ganadora con significancia · B gana. Eso ocurre porque el bilateral al 90 por ciento usa la misma línea de corte que el unilateral al 95 por ciento, 1,645, y hacia el lado de la variación las dos decisiones coinciden. Dos salvedades: el intervalo mostrado es el bilateral del 90 por ciento (la etiqueta del campo sigue diciendo “IC 95% de la diferencia”, pero los límites ya son los del 90), y al 90 por ciento la calculadora también declararía gana A si la z quedara por debajo de menos 1,645, una conclusión que el unilateral registrado no tiene.

SaaS: cuando la cola no ahorra calendario y cambia el veredicto

Escenario. Un SaaS B2B con 6.000 visitantes por semana en la página de precios, de los cuales un 8,00 por ciento inicia trial, prueba una tabla de planes con el plan intermedio destacado. Efecto mínimo del 15 por ciento relativo. Como mostró la figura de semanas, el bilateral pide 20 días y el unilateral 16, y los dos redondean a tres semanas. El equipo ejecuta 21 días y llega a 9.000 visitantes por brazo.

brazo visitantes trials tasa
A, tabla actual 9.000 720 8,00%
B, plan intermedio destacado 9.000 785 8,72%

En la misma calculadora de significancia, con 9000 y 720 en el control, 9000 y 785 en la variación y confianza del 95%, la pantalla muestra 8,00% y 8,72%, mejora relativa del +9,0%, valor p de 0,0801, intervalo de -0,1% … +1,5% (pp) y Todavía sin significancia. En precisión completa: diferencia de más 0,7222 puntos porcentuales, z de 1,7503, valor p bilateral de 0,080072 e intervalo de menos 0,0865 a más 1,5309 puntos porcentuales.

Si el equipo hubiera registrado unilateral antes, el valor p sería 0,080072 ÷ 2 = 0,040036 y B ganaría, con un límite inferior unilateral de más 0,0436 puntos porcentuales. Si el equipo había registrado bilateral, el resultado es “sin significancia”, y cambiar ahora a unilateral es exactamente el rescate de la simulación: la falsa victoria de la variación pasa de cerca del 2,5 a cerca del 5 por ciento, sin que nadie lo escriba en el informe.

La cola no ahorró un día de test; solo cambió el veredicto de un resultado que cayó entre 1,645 y 1,96. Así es como el unilateral suele aparecer en la vida real: después del resultado, no en la planificación. Si el plan era bilateral, la lectura honesta es inconcluyente con señal positiva: el intervalo va de una pequeña pérdida a una ganancia de 1,5 puntos, y la decisión es extender hasta la muestra del efecto que interesa o repetir con la dirección registrada, sin caer en la trampa del poder observado.

Checklist: ¿test unilateral o bilateral?

Responde antes de configurar el experimento, y guarda las respuestas junto con el plan.

pregunta si la respuesta es sí si la respuesta es no
¿La dirección de interés está escrita antes de cualquier dato? el unilateral es posible bilateral
¿Un resultado peor llevaría a la misma decisión que un empate? el unilateral es posible bilateral
¿El aprendizaje “la idea empeoró” vale algo para el equipo? prefiere bilateral el unilateral es posible
¿Las dos versiones son nuevas y cualquiera puede salir al aire? bilateral sigue la lista
¿La métrica es de protección (guardrail) o de no inferioridad? unilateral en la dirección del empeoramiento sigue la lista
¿El informe va a decir “unilateral” junto a la confianza? el unilateral es posible bilateral
¿El ahorro de muestra cambia el número de semanas del test? el ahorro es real la cola no compra calendario
¿El único motivo para el unilateral es que el test termine antes? reconsidéralo: es aflojar la regla sigue la lista

Si todas las filas apuntan a “el unilateral es posible”, registra la dirección y sigue. Si alguna apunta a bilateral, usa bilateral. En la duda, bilateral: se equivoca del lado conservador, y el coste es cerca de un 21 por ciento más de muestra, no una conclusión equivocada.

Errores comunes

Hazlo automático en Donnu

El dolor específico de esta guía no es la estadística del unilateral, que cabe en una línea. Es la elección hecha después de mirar el dato, sin que nadie se dé cuenta, por un equipo que quería ver ganar a la variación.

El informe de Donnu A/B es bayesiano: en vez de valor p y selector de cola, muestra día a día la probabilidad de que la variación sea mejor que el control, con una franja del 95 por ciento en el gráfico y la orientación de que la decisión solo maduró cuando la línea cruza la franja y se queda allí. Una probabilidad baja aparece en el mismo gráfico que una probabilidad alta, así que el empeoramiento no desaparece. No hay configuración de cola que cambiar después del resultado, y el informe exige un mínimo de visitantes por variación y de días antes de declarar ganadora. Eso no sustituye al plan: la métrica primaria y el efecto que interesa siguen siendo decisiones tuyas, tomadas antes.

Si ejecutas tests frecuentistas en otra herramienta, las calculadoras gratuitas hacen las cuentas de esta guía: tamaño de muestra con selector bilateral y unilateral, significancia bilateral, valor p y el simulador de peeking. Para un informe que no te pide elegir la cola, empieza una prueba gratis de 14 días.

Referencias

Lee también: Significancia estadística en test A/B · El problema del peeking · Efecto mínimo detectable · Test de equivalencia · Plan de análisis preregistrado · Cuántos visitantes necesita un test A/B · Calculadora de poder estadístico · Leia em português · Read in English

Preguntas frecuentes

¿Cuál es la diferencia entre test unilateral y bilateral?
El test bilateral busca diferencia en las dos direcciones y reparte el riesgo de falso positivo entre las dos colas: al 95 por ciento de confianza, un 2,5 por ciento de cada lado, con z crítica de 1,96. El test unilateral busca diferencia en una sola dirección, elegida antes del test, y pone el 5 por ciento entero en ella, con z crítica de 1,645. Exige menos evidencia para declarar mejora y no tiene forma de declarar empeoramiento.
¿El valor p unilateral es siempre la mitad del bilateral?
Solo cuando el efecto observado va en la dirección prevista. En ese caso el valor p unilateral es exactamente la mitad del bilateral: en el ejemplo de esta guía, 0,0735 se convierte en 0,0368. Si el efecto va al lado opuesto, el valor p unilateral es 1 menos la mitad del bilateral, 0,9632 en el mismo ejemplo, y el resultado no es significativo por fuerte que sea el empeoramiento.
¿Cuánta muestra ahorra el test unilateral?
Con un 95 por ciento de confianza y un 80 por ciento de potencia, cerca de un 21 por ciento de los visitantes, en cualquier tasa base: 41.914 frente a 53.211 por variación para detectar un 10 por ciento relativo sobre un 3 por ciento de conversión. Con un 90 por ciento de potencia el ahorro baja a cerca del 18,5 por ciento. Cuando el test tiene que ejecutarse en semanas enteras, parte de ese ahorro desaparece en el redondeo.
¿Elegir la cola después de ver el resultado es hacer trampa?
Es el uso que infla el error. En la simulación de esta guía, con 20.000 tests A/A y semilla fija, testear unilateralmente en la dirección que mostraron los datos declaró diferencia significativa en el 9,89 por ciento de los casos, frente al 5,00 por ciento del bilateral. Y el equipo que ejecuta bilateral y cambia a unilateral solo cuando la variación va por delante duplica la tasa de falsa victoria de la variación, del 2,57 al 5,12 por ciento.
¿Cuándo es legítimo el test unilateral en test A/B?
Cuando la dirección se registró antes del test y un resultado peor llevaría a la misma decisión que un empate, por ejemplo no lanzar la variación. También es la forma natural de los guardrails y de los tests de no inferioridad, en los que solo importa el empeoramiento. Fuera de eso, el bilateral es el estándar más seguro, y es lo que usa Optimizely y lo que Statsig trae como configuración inicial.
¿La calculadora de significancia de esta guía hace test unilateral?
No. Hace un test z bilateral de dos proporciones. Para obtener el valor p unilateral, divide por 2 el valor mostrado cuando la variación va por delante, en la dirección que registraste antes. Elegir un 90 por ciento de confianza reproduce la decisión de un unilateral al 95 por ciento para el lado de la variación, pero el intervalo mostrado pasa a ser el bilateral del 90 por ciento, aunque la etiqueta del campo siga diciendo 95 por ciento.