Test Unilateral vs Bilateral en Test A/B: cuál usar
Test unilateral o bilateral en test A/B: qué cambia en la z crítica, cuánta muestra ahorra, el riesgo de elegir la cola después y cuándo es legítimo.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El test unilateral es el test de hipótesis que busca diferencia en una única dirección, elegida antes de recoger los datos, y por eso coloca todo el riesgo de falso positivo en una sola cola; el test bilateral busca diferencia en las dos direcciones y reparte ese riesgo por la mitad. Al 95 por ciento de confianza, el unilateral declara victoria a partir de una z igual a 1,645 y el bilateral solo a partir de 1,96. En la práctica, el unilateral pide cerca de un 21 por ciento menos de visitantes y, cuando el efecto va en la dirección prevista, devuelve un valor p que es exactamente la mitad del bilateral. El precio es quedar ciego ante la variación que empeora y, si la cola se elige después de ver el dato, duplicar el error que crees estar controlando. Este texto forma parte de nuestra guía de significancia estadística en test A/B, que recomienda el bilateral como estándar en un párrafo; aquí está la cuenta entera detrás de esa recomendación, con simulación, fuentes de los dos lados, herramientas y un ejemplo trabajado de comercio electrónico y SaaS, y las excepciones en las que no vale.
Qué es un test unilateral y qué es un test bilateral
Todo test A/B frecuentista tiene una hipótesis nula, la que intentas derribar, y una alternativa, la que quieres mostrar. La diferencia entre unilateral y bilateral está entera en cómo se escribe la alternativa.
- Test bilateral (o de dos colas): la alternativa es “la tasa de B es diferente de la de A”. Un resultado muy por encima o muy por debajo de lo esperado cuenta como evidencia, y el alfa (el riesgo de falso positivo) se reparte entre las dos colas.
- Test unilateral (o de una cola): la alternativa es “la tasa de B es mayor que la de A” (o menor, si la dirección de interés es la caída). Solo cuenta la dirección elegida, y el alfa entero queda en ella.
La calculadora de muestra de este blog usa “bilateral” y “unilateral”; en inglés, two-tailed y one-tailed, o two-sided y one-sided. Es lo mismo.
| bilateral | unilateral (dirección: B mejor) | |
|---|---|---|
| hipótesis nula | B igual a A | B menor o igual que A |
| hipótesis alternativa | B diferente de A | B mayor que A |
| dónde queda el alfa del 5% | 2,5% en cada cola | 5% en la cola de arriba |
| z crítica al 95% | 1,96 en módulo | 1,645 |
| ¿puede declarar que B empeoró? | sí | no |
| pregunta que responde | ¿B es diferente de A? | ¿B es mejor que A? |
Nada cambia en la fórmula del estadístico z, que sigue siendo la diferencia entre las tasas dividida por el error estándar. Cambia solo la regla contra la que se compara esa z.
Qué cambia en la región crítica: 1,645 frente a 1,96
La región crítica es el conjunto de valores de z que llevan a rechazar la nula. En el bilateral al 95 por ciento, son los valores por encima de 1,96 o por debajo de menos 1,96: cada franja tiene un 2,5 por ciento de probabilidad bajo la nula. En el unilateral al 95 por ciento, son los valores por encima de 1,645, una sola franja, con un 5 por ciento.
La franja entre 1,645 y 1,96 es la zona de discrepancia: significativa para quien registró unilateral, no significativa para quien registró bilateral. Bajo la nula, tiene un 2,5 por ciento de probabilidad, la porción que reaparece en el coste de elegir la cola después. Los valores críticos, calculados con zCritical(alpha, sided) del motor estadístico del blog:
| confianza | alfa | z crítica unilateral | z crítica bilateral |
|---|---|---|---|
| 90% | 0,10 | 1,2816 | 1,6449 |
| 95% | 0,05 | 1,6449 | 1,9600 |
| 99% | 0,01 | 2,3263 | 2,5758 |
Fíjate en la diagonal: el unilateral al 95 por ciento usa el mismo número que el bilateral al 90 por ciento. Guarda eso, porque explica de dónde viene el ahorro de muestra.
El valor p unilateral es la mitad del bilateral, cuando el efecto va en la dirección prevista
El valor p bilateral suma el área de las dos colas más allá de la z observada, en módulo. El unilateral suma solo el área de la cola elegida. Como la curva normal es simétrica, la relación es exacta:
GraphPad registra las dos mitades en su página de preguntas frecuentes: en la dirección prevista, el valor p unilateral es la mitad del bilateral; en la opuesta, la diferencia, por grande que sea, tendría que atribuirse al azar y llamarse no significativa.
Es esa relación la que permite leer un unilateral registrado con la calculadora de significancia de esta guía, que es siempre bilateral: si la variación va por delante, en la dirección declarada, divide por 2 el valor p de la pantalla. Si va por detrás, el valor p unilateral es 1 menos la mitad, y para ese test el empeoramiento no existe como conclusión.
Cuánta muestra ahorra el test unilateral
La fórmula de muestra de dos proporciones eleva al cuadrado la suma de la z crítica con la z de la potencia. Cambiar 1,96 por 1,645 encoge esa suma: con un 80 por ciento de potencia (z de 0,8416), la razón queda cerca de (1,645 + 0,8416)² ÷ (1,96 + 0,8416)², cerca de 0,79. Calculado con sampleSizePerVariant, al 95 por ciento de confianza y 80 por ciento de potencia:
| contexto típico | tasa base | efecto mínimo (relativo) | bilateral, por variación | unilateral, por variación | ahorro |
|---|---|---|---|---|---|
| comercio electrónico, visitante a compra | 2% | 10% | 80.682 | 63.553 | 21,2% |
| comercio electrónico, visitante a compra | 2% | 20% | 21.109 | 16.627 | 21,2% |
| comercio electrónico, página de producto | 3% | 10% | 53.211 | 41.914 | 21,2% |
| comercio electrónico, página de producto | 3% | 20% | 13.914 | 10.960 | 21,2% |
| SaaS, visitante a trial | 5% | 10% | 31.234 | 24.603 | 21,2% |
| SaaS, visitante a trial | 5% | 20% | 8.158 | 6.426 | 21,2% |
| SaaS, trial a pago | 10% | 10% | 14.751 | 11.620 | 21,2% |
| SaaS, trial a pago | 10% | 5% | 57.763 | 45.500 | 21,2% |
Tres lecturas. El ahorro es casi constante: cerca de un 21 por ciento al 80 por ciento de potencia, en cualquier base y efecto; al 90 por ciento de potencia, cerca del 18,5 por ciento (71.233 frente a 58.057 en la fila de 3 y 10 por ciento). No es un descuento: cada número de la columna unilateral es idéntico a la muestra del bilateral al 90 por ciento de confianza, y la guía de CRO para sitios de bajo tráfico usa el mismo par, 13.914 en el bilateral frente a 10.960 en el unilateral. Es el mismo presupuesto de error gastado en una sola cola. Es una palanca pequeña: cambiar el efecto mínimo del 10 al 20 por ciento recorta cerca del 74 por ciento de la muestra (de 53.211 a 13.914), porque la muestra cae con el cuadrado del efecto, como detalla la guía de efecto mínimo detectable; cambiar la cola recorta un 21.
Georgiev, que defiende el unilateral en el blog de Analytics-Toolkit, escribe que el bilateral al 95 por ciento necesita entre un 20 y un 60 por ciento más de muestra que el unilateral para detectar el mismo efecto. Es compatible con la tabla: 53.211 es un 27 por ciento más que 41.914, y él dice que la franja varía con el umbral de significancia exigido.
El ahorro que desaparece en el calendario
Existe un detalle operativo que cambia la cuenta: un test A/B debe ejecutarse en semanas enteras, para cubrir el ciclo de comportamiento de los días laborables y del fin de semana, como detalla la guía de ciclo semanal en test A/B. Redondeado a semanas completas, el ahorro puede convertirse en una semana entera o puede convertirse en cero.
| escenario | tráfico semanal | bilateral | unilateral | semanas enteras, bilateral | semanas enteras, unilateral |
|---|---|---|---|---|---|
| comercio electrónico, base 3%, efecto 10% | 42.000 | 53.211 por variación, 18 días | 41.914 por variación, 14 días | 3 | 2 |
| SaaS, base 8%, efecto 15% | 6.000 | 8.568 por variación, 20 días | 6.749 por variación, 16 días | 3 | 3 |
La otra cara de la misma moneda es la potencia. Si mantienes la muestra del bilateral y analizas como unilateral, la potencia sube: en la base del 3 por ciento con efecto del 10 por ciento, 53.211 visitantes por variación dan un 80 por ciento de potencia en el bilateral y un 87,63 por ciento en el unilateral, según el powerForSample del motor. Es el mismo intercambio visto desde otro ángulo, y la calculadora de poder estadístico hace la cuenta para tu caso.
El coste 1: quedar ciego ante la variación que empeora
El ahorro del unilateral se paga con una conclusión menos. El test registrado como “B es mejor que A” solo tiene dos resultados: evidencia de que B es mejor, o ausencia de esa evidencia. La variación que hunde la conversión cae en el segundo cubo, junto con la neutra.
Con números: la tienda del ejemplo trabajado ejecuta otra variación durante dos semanas, 42.000 visitantes por brazo. El control convierte 1.260 (3,00 por ciento); la variación, 1.150 (2,74 por ciento), una caída del 8,7 por ciento relativo.
- Lectura bilateral: z de menos 2,2736, valor p de 0,0230, intervalo del 95 por ciento de la diferencia de menos 0,4877 a menos 0,0361 puntos porcentuales. Significativo: gana A. El equipo sabe que la idea hirió la conversión y registra el aprendizaje.
- Lectura unilateral, dirección B mejor: valor p de 0,9885. No significativo. El informe dice lo mismo que diría ante un empate.
En la calculadora de significancia más abajo, esos números aparecen como 3,00% y 2,74%, mejora relativa de -8,7%, valor p de 0,0230, intervalo de -0,5% … -0,0% (pp) y Ganadora con significancia · A gana.
Cuánto importa eso depende de qué cambiaría el empeoramiento en la decisión. Si “B empeoró” y “B empató” llevan al mismo sitio, no lanzar, la ceguera cuesta poco para esa decisión. Pero cuesta en el aprendizaje (la hipótesis que hizo daño vuelve al backlog en seis meses) y en la validación de cambios que ya salieron al aire sin test. Con la muestra planificada para el unilateral (41.914 por variación), un bilateral tendría un 74,22 por ciento de potencia para detectar una caída del 10 por ciento relativo; el unilateral no tiene esa conclusión en el diseño.
El coste 2: elegir la cola después de ver el dato
El test unilateral controla el error en el 5 por ciento si la dirección se eligió antes. Si el equipo mira el resultado y solo entonces decide hacia qué lado testear, la dirección se convierte en un reflejo del propio dato.
La cuenta es corta. Bajo la nula, la z queda por encima de 1,645 en el 5 por ciento de los tests y por debajo de menos 1,645 en otro 5. Quien testea unilateralmente “hacia el lado al que fue la variación” rechaza en los dos casos: 10 por ciento. Quien ejecuta bilateral y, cuando no sale, cambia a unilateral solo si la variación va por delante, rechaza por encima de 1,645 (5 por ciento) o por debajo de menos 1,96 (2,5 por ciento): 7,5 por ciento.
Para no depender solo del álgebra, ejecutamos una simulación con semilla fija: 20.000 tests A/A, 5.000 visitantes por brazo, conversión real del 5 por ciento en los dos (ninguna diferencia verdadera), generador pseudoaleatorio mulberry32 con semilla 20260915, cada test analizado con la misma función significance de las calculadoras.
| regla de análisis | tasa de “diferencia significativa” | falsa victoria de la variación | falsa victoria del control | teoría |
|---|---|---|---|---|
| bilateral registrado antes | 5,00% (999) | 2,57% (513) | 2,43% (486) | 5% |
| unilateral registrado antes, B mejor | 5,12% (1.023) | 5,12% (1.023) | no existe | 5% |
| unilateral en la dirección que mostró el dato | 9,89% (1.978) | 5,12% (1.023) | 4,78% (955) | 10% |
| rescate: bilateral, y si falla con B por delante, unilateral | 7,54% (1.509) | 5,12% (1.023) | 2,43% (486) | 7,5% |
Aquí las fuentes serias discrepan, y vale la pena leer las dos.
Quien defiende el unilateral. Georgi Georgiev, autor de Analytics-Toolkit y del sitio onesided.org, sostiene que los valores p y los límites de confianza unilaterales ofrecen las mismas probabilidades de error que los bilaterales, cada uno bajo su propia nula, y llega a afirmar que una afirmación direccional puede apoyarse en el test unilateral correspondiente sin predicción previa. La simulación coincide con la parte técnica: “B es mejor que A” afirmado con unilateral al 5 por ciento se equivoca, bajo la nula, en cerca del 5 por ciento de las veces (5,12 en la tabla), prevista o no.
Quien pide la dirección antes. La simulación también muestra que el equipo que se permite las dos afirmaciones, “B es mejor” o “A es mejor”, según el dato, hace alguna afirmación falsa en casi el 10 por ciento de los A/A. La UCLA es tajante: elegir unilateral solo para obtener significancia, o después de un bilateral que no rechazó la nula, no es apropiado, por cerca que haya quedado el bilateral. GraphPad recomienda usar solo valores p bilaterales, entre otros motivos para evitar la tentación de cambiar el análisis después del resultado.
Las posiciones se concilian cuando se pregunta qué error importa para tu decisión:
- Control actual contra variación nueva. Solo la victoria de B se convierte en lanzamiento, así que importa la columna “falsa victoria de la variación”: 2,57 por ciento en el bilateral registrado y 5,12 en el rescate. El rescate no es peor que el unilateral honesto; el problema es que el equipo crea que está en el bilateral del 95 por ciento, con la mitad de ese riesgo, y lo reporte así.
- Dos versiones nuevas sin titular (dos titulares, dos ofertas, cualquiera puede salir al aire). Las dos victorias se convierten en lanzamiento, y “unilateral hacia el lado del dato” lanza una versión por puro azar en el 9,89 por ciento de los casos.
- Base de aprendizajes. Si “el cambio empeoró la conversión” se convierte en conocimiento del equipo, la falsa victoria del control también cuesta, y vale la tasa total.
El defecto no es la cola. Es que la confianza anunciada no coincida con el procedimiento usado, el mismo mecanismo del problema del peeking y de los caminos que se bifurcan del plan de análisis preregistrado.
Cuándo es legítimo el test unilateral
El test unilateral es legítimo cuando se cumplen tres condiciones a la vez.
- La dirección está escrita antes del test. En el plan de análisis o en la configuración de la herramienta, no en la diapositiva del resultado.
- Un resultado en la dirección opuesta llevaría a la misma decisión que un empate. La UCLA formula el criterio por las consecuencias: el unilateral encaja cuando el coste de perder un efecto en la dirección no testeada es despreciable, y en absoluto irresponsable. En test de conversión eso es casi verdad (no lanzar), pero no del todo (el aprendizaje se pierde).
- La confianza reportada es la del procedimiento. El informe dice “unilateral al 95 por ciento”, y no “95 por ciento de confianza”, que cualquier lector entiende como bilateral.
Hay contextos en los que el unilateral no es un atajo, es la pregunta correcta:
- Guardrails. En una métrica de protección, solo importa el empeoramiento. La documentación de Statsig cita detectar regresiones en guardrails como uso típico, con el ejemplo de una funcionalidad en la que puede no importar si la tasa de fallos baja, pero sí importa si sube. Ver métricas de guardrail.
- No inferioridad. Mostrar que un cambio más barato o exigido por normativa no empeora la conversión más allá de un margen es unilateral por naturaleza. La ICH E9 manda usar intervalo unilateral en esos estudios, y la guía de test de equivalencia trabaja el caso con margen declarado.
- Superioridad con margen. Si lanzar solo compensa por encima de una ganancia mínima, la nula puede ser “B no supera a A en al menos X”, lo que pone la dirección y el coste de implementación en la misma hipótesis.
La misma ICH E9 trae la posición más conservadora. Reconoce que el tema es controvertido, pide justificación prospectiva para el test unilateral y dice que, en entorno regulatorio, es preferible fijar el error tipo I unilateral en la mitad del bilateral, un 2,5 por ciento. Con esa regla, el unilateral no ahorra muestra: z crítica de 1,96 de las dos formas. Un test de conversión no necesita el rigor de un ensayo de medicamento, pero el razonamiento sirve: si el ahorro de muestra es el único motivo, estás aflojando la regla, no refinando la pregunta.
Qué dicen las fuentes serias y las herramientas
La tabla resume la posición de cada fuente leída para esta guía. La documentación de las herramientas cambia; las filas de herramienta se consultaron el 15/09/2026.
| fuente | posición | qué sustenta |
|---|---|---|
| Georgiev, Analytics-Toolkit (2017, actualizado en 2018) y onesided.org | a favor del unilateral en la mayoría de los tests A/B | unilateral cuando la acción depende de una diferencia en una dirección; no permite más error tipo I que el bilateral; el bilateral pide entre un 20 y un 60% más de muestra |
| GraphPad, FAQ 1318 | recomienda solo valores p bilaterales | el p unilateral es la mitad del bilateral en la dirección prevista; la dirección debe preverse antes de los datos |
| UCLA, Statistical Consulting | unilateral solo con justificación de consecuencias | no es apropiado elegir unilateral para obtener significancia o después de un bilateral que falló |
| ICH E9 (directriz de ensayos clínicos) | el unilateral exige justificación prospectiva; alfa de la mitad del bilateral en entorno regulatorio | intervalo unilateral en no inferioridad |
| Optimizely, Statistical significance | usa bilateral | el bilateral es exigido por el control de tasa de falsos descubrimientos del Stats Engine |
| Statsig, One-Sided Test | estándar bilateral; unilateral configurable por métrica | el unilateral no detecta movimiento en la dirección no especificada; usos en guardrail |
| Convert, Next Generation of Convert Experiences | ofrece unilateral y bilateral en el modo frecuentista | elección de cola a la izquierda o a la derecha en el unilateral |
Sobre las herramientas, solo lo que afirman las páginas leídas. Statsig permite cambiar la cola por métrica en la configuración del experimento, muestra un intervalo unilateral que se extiende al infinito del lado no testeado y avisa de que ejecutar dos tests unilaterales da un test menos potente, con intervalos que parecen más estrechos de lo que deberían. Convert, en un texto actualizado el 27 de agosto de 2026, permite elegir también la cola a la izquierda o a la derecha. El artículo de Georgiev listaba varios proveedores como bilaterales, con base en un relevamiento de ConversionXL de julio de 2015; con más de diez años y motores cambiados desde entonces, la lista no entra aquí como retrato actual. Las calculadoras de este blog: la de significancia hace un test z bilateral; la de muestra tiene selector bilateral y unilateral.
Ejemplo trabajado: comercio electrónico y SaaS con las calculadoras
Comercio electrónico: planificar con la calculadora de muestra
Escenario. Una tienda con conversión del 3,00 por ciento en la página de producto y 42.000 visitantes por semana (6.000 por día) quiere probar un bloque de prueba social por encima del botón de compra. La decisión es binaria: lanzar el bloque si aumenta la conversión; no lanzarlo si no la aumenta. Un resultado peor llevaría a la misma decisión que un empate, y el equipo registra en el plan, antes de empezar, test unilateral, dirección variación mejor, 95 por ciento de confianza, 80 por ciento de potencia, efecto mínimo del 10 por ciento relativo.
En la calculadora de abajo, escribe: Tasa de conversión actual 3; Efecto mínimo detectable 10, con la opción relativo (%); Confianza 95; Potencia 80; Visitantes por semana (total) 42000; Test bilateral.
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
La pantalla muestra 53.211 visitantes por variación, 106.422 en total y 18 en la duración estimada, en días. Ahora cambia solo el campo Test a unilateral: la pantalla pasa a mostrar 41.914 por variación, 83.828 en total y 14 días. Redondeado a semanas completas, es la diferencia entre tres semanas y dos. Para el escenario de SaaS de abajo, los mismos pasos con tasa 8, efecto 15 y 6000 visitantes por semana muestran 8.568, 17.136 y 20 días en el bilateral, y 6.749, 13.498 y 16 días en el unilateral.
Comercio electrónico: el resultado y la calculadora de significancia
Después de 14 días, con 42.000 visitantes por brazo (por encima de los 41.914 planificados):
| brazo | visitantes | conversiones | tasa |
|---|---|---|---|
| A, control | 42.000 | 1.260 | 3,00% |
| B, con prueba social | 42.000 | 1.350 | 3,21% |
Pega en la calculadora: Control (A) con 42000 visitantes y 1260 conversiones; Variación (B) con 42000 visitantes y 1350 conversiones; Confianza 95%.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
La pantalla muestra una tasa del 3,00% en el control y del 3,21% en la variación, mejora relativa del +7,1%, valor p de 0,0735, intervalo del 95 por ciento de la diferencia de -0,0% … +0,4% (pp) y el veredicto Todavía sin significancia. Ese veredicto es el del test bilateral, porque es el único que hace la calculadora.
La cuenta detrás, en precisión completa:
- Tasa combinada: (1.260 + 1.350) ÷ 84.000 = 3,1071%.
- Error estándar de la diferencia bajo la nula: √[0,031071 · 0,968929 · (1÷42.000 + 1÷42.000)] ≈ 0,001197.
- Diferencia: 3,2143% − 3,0000% = +0,2143 puntos porcentuales.
- Estadístico z: 0,002143 ÷ 0,001197 ≈ 1,7897.
- Valor p bilateral: 0,073505. El intervalo del 95 por ciento va de menos 0,0204 a más 0,4490 puntos porcentuales; el “-0,0%” de la pantalla es ese menos 0,0204 redondeado a un decimal.
Ahora la lectura unilateral registrada. El efecto fue hacia el lado previsto (B por delante), así que el valor p unilateral es el bilateral dividido por 2: 0,073505 ÷ 2 = 0,036752, por debajo de 0,05. Según el plan registrado, gana B. El límite inferior unilateral del 95 por ciento de la diferencia, que es el límite inferior del intervalo bilateral del 90 por ciento, queda en más 0,0173 puntos porcentuales: por encima de cero, por poco.
Hay un atajo en la propia calculadora. Cambia Confianza al 90%: el valor p sigue siendo 0,0735, el intervalo pasa a +0,0% … +0,4% (pp) y el veredicto se convierte en Ganadora con significancia · B gana. Eso ocurre porque el bilateral al 90 por ciento usa la misma línea de corte que el unilateral al 95 por ciento, 1,645, y hacia el lado de la variación las dos decisiones coinciden. Dos salvedades: el intervalo mostrado es el bilateral del 90 por ciento (la etiqueta del campo sigue diciendo “IC 95% de la diferencia”, pero los límites ya son los del 90), y al 90 por ciento la calculadora también declararía gana A si la z quedara por debajo de menos 1,645, una conclusión que el unilateral registrado no tiene.
SaaS: cuando la cola no ahorra calendario y cambia el veredicto
Escenario. Un SaaS B2B con 6.000 visitantes por semana en la página de precios, de los cuales un 8,00 por ciento inicia trial, prueba una tabla de planes con el plan intermedio destacado. Efecto mínimo del 15 por ciento relativo. Como mostró la figura de semanas, el bilateral pide 20 días y el unilateral 16, y los dos redondean a tres semanas. El equipo ejecuta 21 días y llega a 9.000 visitantes por brazo.
| brazo | visitantes | trials | tasa |
|---|---|---|---|
| A, tabla actual | 9.000 | 720 | 8,00% |
| B, plan intermedio destacado | 9.000 | 785 | 8,72% |
En la misma calculadora de significancia, con 9000 y 720 en el control, 9000 y 785 en la variación y confianza del 95%, la pantalla muestra 8,00% y 8,72%, mejora relativa del +9,0%, valor p de 0,0801, intervalo de -0,1% … +1,5% (pp) y Todavía sin significancia. En precisión completa: diferencia de más 0,7222 puntos porcentuales, z de 1,7503, valor p bilateral de 0,080072 e intervalo de menos 0,0865 a más 1,5309 puntos porcentuales.
Si el equipo hubiera registrado unilateral antes, el valor p sería 0,080072 ÷ 2 = 0,040036 y B ganaría, con un límite inferior unilateral de más 0,0436 puntos porcentuales. Si el equipo había registrado bilateral, el resultado es “sin significancia”, y cambiar ahora a unilateral es exactamente el rescate de la simulación: la falsa victoria de la variación pasa de cerca del 2,5 a cerca del 5 por ciento, sin que nadie lo escriba en el informe.
La cola no ahorró un día de test; solo cambió el veredicto de un resultado que cayó entre 1,645 y 1,96. Así es como el unilateral suele aparecer en la vida real: después del resultado, no en la planificación. Si el plan era bilateral, la lectura honesta es inconcluyente con señal positiva: el intervalo va de una pequeña pérdida a una ganancia de 1,5 puntos, y la decisión es extender hasta la muestra del efecto que interesa o repetir con la dirección registrada, sin caer en la trampa del poder observado.
Checklist: ¿test unilateral o bilateral?
Responde antes de configurar el experimento, y guarda las respuestas junto con el plan.
| pregunta | si la respuesta es sí | si la respuesta es no |
|---|---|---|
| ¿La dirección de interés está escrita antes de cualquier dato? | el unilateral es posible | bilateral |
| ¿Un resultado peor llevaría a la misma decisión que un empate? | el unilateral es posible | bilateral |
| ¿El aprendizaje “la idea empeoró” vale algo para el equipo? | prefiere bilateral | el unilateral es posible |
| ¿Las dos versiones son nuevas y cualquiera puede salir al aire? | bilateral | sigue la lista |
| ¿La métrica es de protección (guardrail) o de no inferioridad? | unilateral en la dirección del empeoramiento | sigue la lista |
| ¿El informe va a decir “unilateral” junto a la confianza? | el unilateral es posible | bilateral |
| ¿El ahorro de muestra cambia el número de semanas del test? | el ahorro es real | la cola no compra calendario |
| ¿El único motivo para el unilateral es que el test termine antes? | reconsidéralo: es aflojar la regla | sigue la lista |
Si todas las filas apuntan a “el unilateral es posible”, registra la dirección y sigue. Si alguna apunta a bilateral, usa bilateral. En la duda, bilateral: se equivoca del lado conservador, y el coste es cerca de un 21 por ciento más de muestra, no una conclusión equivocada.
Errores comunes
- Dividir el valor p por 2 después de ver que no salió. Es el rescate de la simulación. Si el plan era bilateral, el valor p es el bilateral.
- Dividir por 2 cuando la variación va por detrás. El valor p unilateral en ese caso es 1 menos la mitad del bilateral: 0,9632 en el ejemplo de comercio electrónico invertido, y no 0,0368.
- Llamar al unilateral al 95 por ciento “95 por ciento de confianza” sin matizar. El lector entiende bilateral. La misma regla, dicha en bilateral, es del 90 por ciento.
- Usar unilateral para ahorrar muestra en un test de SaaS de tráfico bajo y olvidar las semanas. En el ejemplo, el ahorro fue de cero días de calendario. Para tráfico bajo, la guía de CRO para sitios de bajo tráfico lista palancas mayores.
- Ejecutar unilateral e ignorar la caída. El test no declara empeoramiento, pero los números están ahí. Mira el intervalo de confianza bilateral de todos modos, o mantén un guardrail unilateral en la dirección del empeoramiento.
- Ejecutar dos unilaterales, uno para cada lado, y quedarse con el que salió. Es un bilateral con el doble de alfa, y Statsig alerta de que eso genera intervalos demasiado estrechos.
- Creer que la escuela bayesiana resuelve la cola. La probabilidad de que B sea mejor es direccional por construcción, y parar cuando pasa del 95 por ciento un día cualquiera es el peeking de siempre. La guía de test A/B bayesiano muestra cómo definir la regla antes.
Hazlo automático en Donnu
El dolor específico de esta guía no es la estadística del unilateral, que cabe en una línea. Es la elección hecha después de mirar el dato, sin que nadie se dé cuenta, por un equipo que quería ver ganar a la variación.
El informe de Donnu A/B es bayesiano: en vez de valor p y selector de cola, muestra día a día la probabilidad de que la variación sea mejor que el control, con una franja del 95 por ciento en el gráfico y la orientación de que la decisión solo maduró cuando la línea cruza la franja y se queda allí. Una probabilidad baja aparece en el mismo gráfico que una probabilidad alta, así que el empeoramiento no desaparece. No hay configuración de cola que cambiar después del resultado, y el informe exige un mínimo de visitantes por variación y de días antes de declarar ganadora. Eso no sustituye al plan: la métrica primaria y el efecto que interesa siguen siendo decisiones tuyas, tomadas antes.
Si ejecutas tests frecuentistas en otra herramienta, las calculadoras gratuitas hacen las cuentas de esta guía: tamaño de muestra con selector bilateral y unilateral, significancia bilateral, valor p y el simulador de peeking. Para un informe que no te pide elegir la cola, empieza una prueba gratis de 14 días.
Referencias
- Georgiev, G. One-tailed vs Two-tailed Tests of Significance in A/B Testing. Blog de Analytics-Toolkit.com, publicado en 2017 y actualizado el 8 de agosto de 2018. Fuente de la defensa del unilateral cuando la acción depende de una diferencia significativa en una dirección, de la estimación de que el bilateral al 95 por ciento necesita entre un 20 y un 60 por ciento más de muestra que el unilateral al 95 por ciento, y de la afirmación de que el unilateral no permite más error tipo I. Página leída. blog.analytics-toolkit.com.
- Georgiev, G. 12 myths about one-tailed vs. two-tailed tests of significance. OneSided.org. Fuente de la posición de que los valores p y los límites de confianza unilaterales ofrecen las mismas probabilidades de error que los bilaterales bajo sus respectivas nulas, y de que una afirmación direccional puede apoyarse en un test unilateral sin predicción previa. Página leída. onesided.org.
- ICH. E9: Statistical Principles for Clinical Trials. International Council for Harmonisation, 1998. Fuente de la exigencia de justificar de forma prospectiva el uso de tests unilaterales, del reconocimiento de que el tema es controvertido, de la preferencia regulatoria por un error tipo I unilateral de la mitad del bilateral y del uso de intervalo unilateral en estudios de no inferioridad. PDF leído, con extracción del texto. database.ich.org.
- GraphPad. P values. One-tail or two-tail? (FAQ 1318). Fuente de la relación de mitad entre los valores p en la dirección prevista, de la regla de predecir la dirección antes de recoger datos, de la consecuencia de atribuir al azar una diferencia en la dirección opuesta y de la recomendación de usar solo valores p bilaterales. Página leída. graphpad.com.
- UCLA Statistical Methods and Data Analytics. FAQ: What are the differences between one-tailed and two-tailed tests? Fuente de la división del alfa entre las colas, del criterio de consecuencias para usar unilateral y de la prohibición de elegir unilateral para obtener significancia o después de un bilateral que falló. Página leída. stats.oarc.ucla.edu.
- Optimizely. Statistical significance. Centro de ayuda, consultado el 15/09/2026. Fuente de que Optimizely usa tests bilaterales porque son exigidos por el control de tasa de falsos descubrimientos del Stats Engine, y de las definiciones de test bilateral y unilateral. support.optimizely.com.
- Statsig. One-Sided Test. Documentación, consultada el 15/09/2026. Fuente del estándar bilateral, del uso de unilateral para regresiones en guardrails y cambios con impacto en una sola dirección, de la asignación del alfa entero en la dirección de interés, de los intervalos unilaterales que van al infinito y de las advertencias sobre dirección no especificada y sobre ejecutar dos tests unilaterales. docs.statsig.com.
- Convert. The Next Generation of Convert Experiences. Blog de Convert, actualizado el 27 de agosto de 2026, consultado el 15/09/2026. Fuente de que el modo frecuentista ofrece tests unilateral, bilateral y secuencial, con correcciones de Bonferroni y Sidak, y elección de cola a la izquierda o a la derecha. convert.com.
Lee también: Significancia estadística en test A/B · El problema del peeking · Efecto mínimo detectable · Test de equivalencia · Plan de análisis preregistrado · Cuántos visitantes necesita un test A/B · Calculadora de poder estadístico · Leia em português · Read in English
Preguntas frecuentes
- ¿Cuál es la diferencia entre test unilateral y bilateral?
- El test bilateral busca diferencia en las dos direcciones y reparte el riesgo de falso positivo entre las dos colas: al 95 por ciento de confianza, un 2,5 por ciento de cada lado, con z crítica de 1,96. El test unilateral busca diferencia en una sola dirección, elegida antes del test, y pone el 5 por ciento entero en ella, con z crítica de 1,645. Exige menos evidencia para declarar mejora y no tiene forma de declarar empeoramiento.
- ¿El valor p unilateral es siempre la mitad del bilateral?
- Solo cuando el efecto observado va en la dirección prevista. En ese caso el valor p unilateral es exactamente la mitad del bilateral: en el ejemplo de esta guía, 0,0735 se convierte en 0,0368. Si el efecto va al lado opuesto, el valor p unilateral es 1 menos la mitad del bilateral, 0,9632 en el mismo ejemplo, y el resultado no es significativo por fuerte que sea el empeoramiento.
- ¿Cuánta muestra ahorra el test unilateral?
- Con un 95 por ciento de confianza y un 80 por ciento de potencia, cerca de un 21 por ciento de los visitantes, en cualquier tasa base: 41.914 frente a 53.211 por variación para detectar un 10 por ciento relativo sobre un 3 por ciento de conversión. Con un 90 por ciento de potencia el ahorro baja a cerca del 18,5 por ciento. Cuando el test tiene que ejecutarse en semanas enteras, parte de ese ahorro desaparece en el redondeo.
- ¿Elegir la cola después de ver el resultado es hacer trampa?
- Es el uso que infla el error. En la simulación de esta guía, con 20.000 tests A/A y semilla fija, testear unilateralmente en la dirección que mostraron los datos declaró diferencia significativa en el 9,89 por ciento de los casos, frente al 5,00 por ciento del bilateral. Y el equipo que ejecuta bilateral y cambia a unilateral solo cuando la variación va por delante duplica la tasa de falsa victoria de la variación, del 2,57 al 5,12 por ciento.
- ¿Cuándo es legítimo el test unilateral en test A/B?
- Cuando la dirección se registró antes del test y un resultado peor llevaría a la misma decisión que un empate, por ejemplo no lanzar la variación. También es la forma natural de los guardrails y de los tests de no inferioridad, en los que solo importa el empeoramiento. Fuera de eso, el bilateral es el estándar más seguro, y es lo que usa Optimizely y lo que Statsig trae como configuración inicial.
- ¿La calculadora de significancia de esta guía hace test unilateral?
- No. Hace un test z bilateral de dos proporciones. Para obtener el valor p unilateral, divide por 2 el valor mostrado cuando la variación va por delante, en la dirección que registraste antes. Elegir un 90 por ciento de confianza reproduce la decisión de un unilateral al 95 por ciento para el lado de la variación, pero el intervalo mostrado pasa a ser el bilateral del 90 por ciento, aunque la etiqueta del campo siga diciendo 95 por ciento.