Test A/B

Los errores que invalidan un test A/B (y cómo evitarlos)

Peeking, muestra pequeña, SRM, probar demasiado y correr poco tiempo: los errores que convierten un test A/B en ruido, con su señal y corrección.

Un test A/B mal conducido es peor que ningún test: te da confianza en una decisión equivocada. Estos son los errores que más invalidan resultados, y cómo evitar cada uno.

1. Parar antes de tiempo (peeking)

Mirar el resultado todos los días y terminar en cuanto “va ganando” infla el falso positivo de forma brutal: un test diseñado para un 5% de error puede acercarse al 25% si te quedas espiando y parando. Corrección: define antes la duración/muestra y decide solo al final, o usa inferencia secuencial que permite mirar sin penalizar.

2. Muestra pequeña

Sin visitantes suficientes, el ganador es cuestión de suerte. Corrección: calcula el tamaño de muestra antes de empezar y respétalo.

3. División desigual (SRM)

Si A recibió el 60% del tráfico y B el 40% sin motivo, algo se rompió (bug de redireccionamiento, bot, caché) y el resultado no vale. Corrección: monitorea la proporción; si se aleja de lo esperado, investiga antes de confiar en el número.

4. Probar demasiadas cosas a la vez

¿Cambiaste botón, título, imagen y precio juntos? No sabes cuál movió la aguja. Corrección: aísla la variable, o usa un test multivariado diseñado para eso.

5. Correr el test por pocos días

El comportamiento del lunes es distinto al del domingo. Corrección: corre ciclos completos (de una a dos semanas), nunca solo los “días buenos”.

La regla de oro: un ganador honesto necesita muestra suficiente, tiempo suficiente y una diferencia sólida, al mismo tiempo.

Haz esto automático en Donnu

Donnu ya bloquea estos errores por defecto: calcula la muestra, verifica el SRM, y solo declara un ganador con evidencia real. Sin peeking, sin suposiciones.

Preguntas frecuentes

¿Qué es el peeking en un test A/B?
Es mirar el resultado mientras el test corre y cerrarlo apenas la diferencia "da victoria". La práctica infla el falso positivo de forma brutal: un test diseñado para 5% de error puede acercarse al 25% si te quedas espiando y frenando. La corrección es definir duración y muestra antes y decidir solo al final, o usar inferencia secuencial, que permite mirar sin penalización.
¿Qué es el SRM y por qué invalida un test?
El SRM (sample ratio mismatch) es la división de tráfico que se desvía de la esperada, por ejemplo A con 60% y B con 40% en un test diseñado para 50/50. Cuando ocurre sin motivo, algo se rompió (bug de redirección, bots, caché) y el resultado no vale, aunque parezca significativo. Monitorea la proporción e investiga antes de confiar en el número.
¿Puedo probar varios cambios al mismo tiempo?
Puedes, pero entonces no sabrás cuál movió la aguja. Si cambiaste botón, título, imagen y precio juntos, el test responde si el paquete es mejor, no qué pieza funcionó. Aísla la variable cuando quieras aprender, o usa un test multivariado, que está diseñado para separar los efectos.
¿Cuánto tiempo tiene que correr un test A/B?
Por ciclos completos, una o dos semanas como mínimo, nunca solo los días buenos. El comportamiento del lunes es distinto al del domingo, y algunos días pico dan un resultado que no se repite cuando el cambio va para todos.
¿Cuál es la señal de que el ganador de mi test es honesto?
Tres cosas al mismo tiempo: muestra suficiente por variación, tiempo suficiente en ciclos completos y una diferencia estadísticamente sólida. Si falta cualquiera de las tres, el ganador puede ser ruido, por más convincente que se vea el gráfico.