Simulador de peeking en test A/B
Espiar el resultado de un test A/B y parar la primera vez que "dio significativo" es la forma más común de declarar un ganador que no existe. Este simulador muestra, en vivo, cuánto crece tu falso positivo real con cada espiada. Gratis, sin registro, con la estadística explicada.
Esta herramienta es sobre un error de proceso, no sobre la cuenta de un test. Si quieres el veredicto de un test que ya terminó, usa la calculadora de significancia estadística o la calculadora de valor-p. Aquí la pregunta es otra: si me quedo mirando y paro temprano, ¿cuánto corroe eso mi tasa de error? La respuesta asusta.
Cada test simulado es un A/A: A y B son iguales, así que TODO ganador es falso. La barra roja es la fracción que declara victoria al parar en la primera espiada significativa. La inflación depende de cuántas veces espías, no de tu tráfico.
Cómo usarlo
- Define cuántas veces espías el resultado a lo largo del test (por ejemplo, una mirada por día en un test de diez días = 10).
- Elige el nivel de confianza que usas para declarar victoria (95% es el estándar).
- Indica si el test es bilateral (A o B puede ganar) o unilateral (solo apuestas a que B sube).
- Deja el número de tests A/A simulados en 20.000 (más simulaciones = estimación más estable) y lee el falso positivo real.
- Compara la barra roja (real al espiar) con la azul (lo que crees tener). Haz clic en correr de nuevo para ver la estimación oscilar entre simulaciones.
Cómo funciona: la simulación por detrás
La herramienta corre miles de tests A/A: en cada uno, A y B tienen exactamente la misma tasa, o sea, no hay diferencia real. Todo "ganador" que aparezca es, por definición, falso. En cada test simulado, mira el resultado en las espiadas igualmente espaciadas y cuenta cuántos cruzan el umbral de significancia en ALGUNA mirada, aplicando la regla de parada "paré en el primero significativo".
Para modelar la estadística de forma fiel, usamos el resultado clásico de los tests de grupo secuencial: en el límite de muestra grande, el valor-z observado a lo largo del tiempo se comporta como un movimiento browniano estandarizado. En cada espiada en la fracción de información t, el z vale B(t)/√t, con incrementos independientes normales. Es la misma base matemática de las fronteras de O'Brien-Fleming y de Pocock.
De ese modelo sale una consecuencia contraintuitiva: la inflación depende de cuántas veces espías, no de tu tráfico. Por eso el simulador no pide tasa de conversión ni tamaño de muestra: con 1.000 o 1.000.000 de visitantes, diez espiadas inflan el falso positivo prácticamente igual.
Ejemplo trabajado (reproduce el resultado por defecto)
Con los valores que vienen precargados: 10 espiadas, 95% de confianza, test bilateral y 20.000 tests A/A simulados (semilla fija).
- De los 20.000 tests A/A simulados, cerca de 3.920 cruzan el umbral de significancia en alguna de las diez espiadas.
- Falso positivo real: 3.920 / 20.000 = 19,6%.
- Creías que era 5% (el α nominal del 95% de confianza).
- Inflación: 19,6% / 5% ≈ ×3,9. Es decir, cerca de 1 de cada 5 tests sin efecto real muestra un ganador inexistente.
Es exactamente lo que la herramienta muestra al abrir la página. Y la curva es conocida: la tabla de abajo (con la misma semilla) reproduce el resultado clásico de Armitage para miradas igualmente espaciadas.
| Espiadas | Falso positivo real | Inflación |
|---|---|---|
| 1 (lo correcto) | 5,0% | ×1,0 |
| 2 | 8,1% | ×1,6 |
| 3 | 10,7% | ×2,1 |
| 5 | 14,1% | ×2,8 |
| 10 | 19,6% | ×3,9 |
| 20 | 25,3% | ×5,1 |
Cómo interpretarlo y dónde engaña
El número que importa es la distancia entre la barra roja y la azul: es el tamaño del autoengaño. Un equipo que espía todos los días y para el primer día en verde cree que se equivoca el 5% de las veces, pero se equivoca casi el 20%. Multiplicado por decenas de tests al año, eso es una pila de "victorias" que no se sostienen cuando intentas repetir la ganancia en producción.
Dos límites honestos de esta simulación. Primero, asume espiadas igualmente espaciadas y la regla de parada más ingenua (parar en el primero significativo, sin gastar alpha a propósito); los métodos secuenciales bien hechos controlan el error justamente ajustando el umbral en cada mirada. Segundo, es el escenario de muestra grande (aproximación browniana): con pocas conversiones por espiada, el comportamiento discreto se aleja un poco de la curva, pero la lección no cambia. Espiar y parar temprano sin corrección infla el falso positivo, punto.
Cómo dejar de espiar (sin perder velocidad)
La defensa no es mirar menos por fuerza de voluntad, es sacar la decisión de la mirada.
- Fija la muestra y el plazo antes de empezar, con la calculadora de tamaño de muestra y la calculadora de duración, y lee el veredicto solo al final.
- Si de verdad necesitas mirar a mitad del test (para abortar algo que hace daño), usa un método secuencial que gaste alpha a propósito, no el corte del 95% repetido.
- ¿Quieres más tests por año sin trampas? La palanca es tráfico y tamaño de efecto. Mira cuánto aguanta tu tráfico en la calculadora de velocidad de tests.
- Al leer el final del test, confirma el veredicto con la calculadora de significancia en vez de confiar en el primer día que quedó en verde.
Preguntas frecuentes
- ¿Qué es el peeking en un test A/B?
- Peeking (espiar) es mirar el resultado de un test A/B mientras aún corre y decidir pararlo en cuanto el valor-p cruza el umbral de significancia. El problema es que cada mirada es una nueva chance de que el azar cruce ese umbral. Cuando paras en la primera mirada significativa, tu falso positivo real queda muy por encima del 5% que crees tener. Es la causa número uno de victorias falsas en experimentación.
- ¿Por qué espiar infla el falso positivo?
- Un test al 95% de confianza acepta un 5% de chance de falso positivo en UNA mirada. Si miras diez veces a lo largo del test y paras en la primera significativa, son diez chances de que el ruido cruce la línea, no una. Las miradas están correlacionadas (el dato de mañana incluye el de hoy), así que la inflación no es 10 × 5%, pero crece rápido: diez espiadas llevan el falso positivo real cerca del 20%.
- ¿Cuántas veces puedo espiar sin arruinar el test?
- En un análisis de horizonte fijo, el número honesto de miradas de decisión es una: al final del plazo planificado. Toda mirada extra con regla de parada sube el falso positivo. Si de verdad necesitas mirar a mitad del test (para abortar uno que hace daño, por ejemplo), usa métodos secuenciales que gastan alpha a propósito, como las fronteras de O'Brien-Fleming o de Pocock, en vez de reusar el corte del 95% en cada mirada.
- ¿La inflación depende de mi tráfico o de la tasa de conversión?
- Casi nada. Lo que manda es cuántas veces espías, no el tamaño de muestra ni la tasa base. Por eso este simulador solo pide el número de miradas, el nivel de confianza y el tipo de test: en el límite de muestra grande, la estadística secuencial se vuelve un movimiento browniano estandarizado, y la inflación del falso positivo es prácticamente igual para 1.000 o 1.000.000 de visitantes.
- ¿Cómo dejo de espiar sin perder velocidad?
- Fija la muestra y el plazo antes de empezar (usa la calculadora de tamaño de muestra y la de duración) y lee el veredicto solo al final. Si quieres correr más tests por año sin trampas, la palanca correcta es tráfico y tamaño de efecto, no mirar más temprano. Mira cuántos tests aguanta tu tráfico en la calculadora de velocidad de tests.
- ¿Este simulador es reproducible?
- Sí. Corre una simulación de Monte Carlo con semilla fija, así que abrir la página siempre muestra el mismo número para los mismos parámetros. El botón "correr de nuevo" cambia la semilla para que veas la estimación oscilar un poco entre corridas, que es la variación natural de cualquier simulación. Subir el número de tests simulados deja la estimación más estable.
Continúa
Entendido el costo de espiar, dimensiona el test con la calculadora de tamaño de muestra, planifica el plazo con la calculadora de duración de test A/B y lee el veredicto solo al final con la calculadora de significancia. El contexto completo está en qué es un test A/B. Para profundizar, lee el problema del peeking en tests A/B.