¿Cuántos visitantes necesita un test A/B? La regla práctica
La respuesta honesta sobre la muestra en un test A/B: los 3 factores que definen el número, la regla general y por qué poca gente decide bien.
📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
“¿Cuántos visitantes necesito?” es la pregunta que decide si tu test A/B vale algo o es ruido. La respuesta corta: depende de tres cosas y casi siempre es más gente de la que imaginas.
Los 3 factores que definen la muestra
- Tasa de conversión actual. Cuanto menor la tasa, mayor la muestra. Detectar una mejora en una página que convierte 1% exige mucha más gente que en una que convierte 10%.
- Efecto mínimo detectable (MDE). ¿Cuál es la menor ganancia que vale la pena descubrir? Detectar +20% es barato, detectar +2% cuesta una muestra enorme.
- Rigor (confianza y poder). El estándar del mercado es 95% de confianza y 80% de poder. Más rigor, más muestra.
La regla general
Para una tasa base de ~5% y una ganancia relativa de ~10%, necesitas miles de visitantes por variación, corriendo durante al menos una a dos semanas completas. Correr con 200 personas y “ver quién ganó” es el camino más corto hacia una decisión equivocada.
Una muestra pequeña no da un resultado “menos preciso”: da un resultado engañoso. El ganador se vuelve suerte.
¿Y si mi tráfico es bajo?
Si no alcanzas el tamaño de muestra en un plazo razonable, prueba cambios más grandes (no microcopy), enfócate en la métrica más frecuente del embudo, o usa enfoques secuenciales/bayesianos que manejan mejor el volumen bajo. Probar lo irrelevante con poca gente solo genera falsa confianza.
Haz esto automático en Donnu
Donnu calcula el tamaño de muestra y la duración por ti, y usa estadística bayesiana que evita la trampa de parar demasiado pronto. Tú te enfocas en la hipótesis, la matemática queda con nosotros.
Preguntas frecuentes
- ¿Cuántos visitantes necesita un test A/B?
- Depende de tres factores: tu tasa de conversión actual, el efecto mínimo detectable (MDE) que quieres ver y el rigor elegido. Con el estándar de mercado de 95% de confianza y 80% de potencia, detectar una mejora relativa del 10% sobre una tasa base del 5% exige cerca de 31 mil visitantes por variación. No existe un número único que sirva para todos los sitios.
- ¿Por qué una tasa de conversión baja exige una muestra mayor?
- Porque cuanto menor es la tasa, menos conversiones genera cada visitante y más tarda el test en separar la señal del ruido. Detectar una mejora en una página que convierte al 1% exige mucha más gente que la misma mejora sobre una página que convierte al 10%.
- ¿Qué es el efecto mínimo detectable (MDE)?
- Es la menor mejora que quieres poder ver con confianza. Entra en la cuenta antes del test, no después: detectar una mejora del 20% es barato en muestra, detectar una del 2% cuesta una muestra enorme. Elegir un MDE realista es la palanca más fuerte para quien tiene poco tráfico.
- ¿Puedo correr un test A/B con 200 visitantes?
- No con un resultado confiable. Una muestra pequeña no entrega un resultado menos preciso, entrega un resultado engañoso: el ganador pasa a ser suerte. Correr con 200 personas y ver quién ganó es el camino más corto a una decisión equivocada.
- ¿Y si mi tráfico no alcanza esa muestra?
- Testea cambios grandes en vez de microcopy, enfócate en la métrica más frecuente del embudo (los clics y los pasos intermedios convierten más que la compra) o usa enfoques secuenciales y bayesianos, que manejan mejor el volumen bajo. Testear lo irrelevante con poca gente solo genera falsa confianza.
- ¿Cuánto tiempo tiene que correr el test, además de la muestra?
- Al menos una o dos semanas completas, aunque la muestra se alcance antes. El comportamiento del lunes es distinto al del domingo, y correr solo los días buenos distorsiona el resultado con estacionalidad.