Los errores que invalidan un test A/B (y cómo evitarlos)
Peeking, muestra pequeña, SRM, probar demasiado y correr poco tiempo: los errores que convierten un test A/B en ruido, con su señal y corrección.
📚 Este artículo es parte de la guía ¿Qué es un test A/B? La guía completa (2026).
Un test A/B mal conducido es peor que ningún test: te da confianza en una decisión equivocada. Estos son los errores que más invalidan resultados, y cómo evitar cada uno.
1. Parar antes de tiempo (peeking)
Mirar el resultado todos los días y terminar en cuanto “va ganando” infla el falso positivo de forma brutal: un test diseñado para un 5% de error puede acercarse al 25% si te quedas espiando y parando. Corrección: define antes la duración/muestra y decide solo al final, o usa inferencia secuencial que permite mirar sin penalizar.
2. Muestra pequeña
Sin visitantes suficientes, el ganador es cuestión de suerte. Corrección: calcula el tamaño de muestra antes de empezar y respétalo.
3. División desigual (SRM)
Si A recibió el 60% del tráfico y B el 40% sin motivo, algo se rompió (bug de redireccionamiento, bot, caché) y el resultado no vale. Corrección: monitorea la proporción; si se aleja de lo esperado, investiga antes de confiar en el número.
4. Probar demasiadas cosas a la vez
¿Cambiaste botón, título, imagen y precio juntos? No sabes cuál movió la aguja. Corrección: aísla la variable, o usa un test multivariado diseñado para eso.
5. Correr el test por pocos días
El comportamiento del lunes es distinto al del domingo. Corrección: corre ciclos completos (de una a dos semanas), nunca solo los “días buenos”.
La regla de oro: un ganador honesto necesita muestra suficiente, tiempo suficiente y una diferencia sólida, al mismo tiempo.
Haz esto automático en Donnu
Donnu ya bloquea estos errores por defecto: calcula la muestra, verifica el SRM, y solo declara un ganador con evidencia real. Sin peeking, sin suposiciones.
Preguntas frecuentes
- ¿Qué es el peeking en un test A/B?
- Es mirar el resultado mientras el test corre y cerrarlo apenas la diferencia "da victoria". La práctica infla el falso positivo de forma brutal: un test diseñado para 5% de error puede acercarse al 25% si te quedas espiando y frenando. La corrección es definir duración y muestra antes y decidir solo al final, o usar inferencia secuencial, que permite mirar sin penalización.
- ¿Qué es el SRM y por qué invalida un test?
- El SRM (sample ratio mismatch) es la división de tráfico que se desvía de la esperada, por ejemplo A con 60% y B con 40% en un test diseñado para 50/50. Cuando ocurre sin motivo, algo se rompió (bug de redirección, bots, caché) y el resultado no vale, aunque parezca significativo. Monitorea la proporción e investiga antes de confiar en el número.
- ¿Puedo probar varios cambios al mismo tiempo?
- Puedes, pero entonces no sabrás cuál movió la aguja. Si cambiaste botón, título, imagen y precio juntos, el test responde si el paquete es mejor, no qué pieza funcionó. Aísla la variable cuando quieras aprender, o usa un test multivariado, que está diseñado para separar los efectos.
- ¿Cuánto tiempo tiene que correr un test A/B?
- Por ciclos completos, una o dos semanas como mínimo, nunca solo los días buenos. El comportamiento del lunes es distinto al del domingo, y algunos días pico dan un resultado que no se repite cuando el cambio va para todos.
- ¿Cuál es la señal de que el ganador de mi test es honesto?
- Tres cosas al mismo tiempo: muestra suficiente por variación, tiempo suficiente en ciclos completos y una diferencia estadísticamente sólida. Si falta cualquiera de las tres, el ganador puede ser ruido, por más convincente que se vea el gráfico.