Herramienta

Calculadora de test A/A (chequeo de aleatorización)

Corre un test A/A con dos grupos idénticos y descubre si tu herramienta divide el tráfico de forma justa y mide la conversión sin sesgo. Pega los números de los dos grupos y recibe split, valor-p y veredicto. Gratis, sin registro, con la cuenta explicada.

Esta es la calculadora que valida tu herramienta, no tu test. Un test A/A corre dos copias del mismo control: como nada cambia entre los grupos, lo esperado es split equilibrado y conversión indistinguible. Si acusa un ganador, el problema está en la aleatorización o en el tracking, no en la página. Es distinta de la calculadora de significancia, que existe para encontrar un ganador real en un A/B, y más completa que el verificador de SRM, que solo mira el split: aquí revisamos las dos cosas de una vez, split y conversión.

Calculadora de test A/A
Grupo A1
Grupo A2

Tasa A1-
Tasa A2-
Diferencia-
z-
valor-p (conversión)-
χ² (split)-
valor-p (split)-

Un test A/A corre dos copias del mismo control. Como nada cambia entre ellas, lo esperado es un split equilibrado y una conversión indistinguible. Cualquier alarma aquí apunta a un bug de aleatorización, de tracking o de instrumentación, no a una variación ganadora. Pasa el A/A antes de confiar en tu A/B.

Cómo usarla

  1. Configura en tu herramienta dos variaciones idénticas (el mismo control en ambas), con el split que usas en los tests reales (por lo general 50/50).
  2. Deja correr el test hasta acumular un volumen parecido al de tus A/B, del orden de miles de visitantes por grupo.
  3. Pega los visitantes y las conversiones de cada grupo en los campos de arriba.
  4. Lee el veredicto: pasó (grupos equivalentes) o alarma (conversión distinta, split desbalanceado, o ambos).
  5. Revisa las dos lecturas separadas: la de conversión (valor-p y z) y la de split (χ² y valor-p del sample ratio mismatch).

Cómo funciona: las dos cuentas

El test A/A combina dos chequeos independientes. El primero, de conversión, es un test z de dos proporciones, el mismo de la calculadora de significancia. En un A/A quieres que el valor-p quede ALTO (por encima de 0,05): eso confirma que la diferencia entre los grupos es compatible con el azar.

z = (p̂B − p̂A) / √( p̄·(1−p̄)·(1/nA + 1/nB) )

El segundo, de split, es un chi-cuadrado de bondad de ajuste entre los visitantes que cayeron en cada grupo y la división esperada (50/50). Aquí también quieres el valor-p ALTO (por encima de 0,01): uno bajo es sample ratio mismatch, señal de que el motor de división está roto.

χ² = Σ (Oi − Ei)² / Ei

Donde es la tasa combinada de los dos grupos, Oi es el número observado en cada grupo y Ei es el esperado por el split. El A/A solo pasa cuando las DOS lecturas quedan tranquilas.

Ejemplo trabajado (reproduce el resultado por defecto)

Con los valores ya cargados: A1 con 20.000 visitantes y 1.000 conversiones (5,00%) y A2 con 20.000 visitantes y 1.040 conversiones (5,20%). La tasa combinada es 2.040/40.000 = 5,10%. El error estándar agrupado da √(0,051·0,949·(1/20000 + 1/20000)) ≈ 0,0022, así que:

z = (0,052 − 0,050) / 0,0022 ≈ 0,91, que corresponde a un valor-p de cerca de 0,36. Muy por encima de 0,05, o sea, sin diferencia significativa. En el split, 20.000 contra 20.000 da un esperado de 20.000 por grupo, así que χ² = 0 y valor-p 1: perfectamente equilibrado. Las dos lecturas pasan, y el veredicto es pasó el test A/A. Es exactamente lo que muestra la herramienta al abrir la página.

Cómo interpretarla y dónde puede engañar

El veredicto verde quiere decir que tu herramienta se comportó como debía: dividió el tráfico de forma justa y midió la conversión sin sesgo perceptible. Un veredicto rojo es la alerta valiosa. Si la bandera es de conversión, grupos idénticos convirtieron distinto, lo que apunta a aleatorización injusta o tracking sesgado. Si es de split, el motor de división no entregó el 50/50. Si son las dos, algo está bastante mal en la instrumentación.

El límite más importante: un A/A que pasa NO prueba que la herramienta sea perfecta, solo que no falló en ese volumen. Y recuerda el falso positivo: aun con todo bien, cerca del 5% de los tests A/A acusarán una diferencia de conversión por puro azar, al 95% de confianza. Por eso una sola alarma merece un segundo A/A antes de concluir que hay bug. Después de calibrar la herramienta, ve a la calculadora de significancia a leer tu test A/B de verdad, y entiende el contexto en la guía qué es un test A/B.

Buenas prácticas con el test A/A

El A/A es un examen de rutina de tu herramienta, no algo que corres solo cuando desconfías. Usa estas reglas para sacarle valor.

Preguntas frecuentes

¿Qué es un test A/A?
Es un test en el que las dos variaciones son exactamente iguales: los dos grupos reciben el mismo control, sin ningún cambio. Como nada difiere entre ellos, lo esperado es que la división de tráfico quede equilibrada y que la conversión de ambos sea estadísticamente indistinguible. Sirve para validar que tu herramienta de test divide el tráfico de forma justa y mide la conversión sin sesgo, antes de confiar en cualquier test A/B.
¿Para qué sirve correr un A/A antes del A/B?
Para calibrar la herramienta. Si un test A/A acusa un ganador donde no debería haber ninguno, descubres un bug de aleatorización, de tracking o de instrumentación antes de tomar decisiones con dinero de por medio. Correr un A/A de vez en cuando, o al cambiar de herramienta de test, es la forma más barata de asegurar que tus resultados de A/B son confiables.
Mi test A/A salió significativo. ¿Qué pasó?
En un A/A la diferencia de conversión no debería ser significativa. Si lo es, hay tres sospechosos: la aleatorización no es justa (el motor de división manda perfiles distintos a cada grupo), el tracking está sesgado (una variación dispara el pixel en un momento distinto, o pierde eventos) o es solo el falso positivo, que ocurre en cerca del 5% de los A/A al 95% de confianza. Vuelve a correrlo con más datos: si persiste, es bug, no azar.
¿En qué se diferencia de la calculadora de significancia?
La de significancia existe para encontrar un ganador en un test A/B: quieres que la diferencia sea real. Esta es lo contrario: las dos versiones son iguales y quieres confirmar que NO hay diferencia. Además, el test A/A también revisa el equilibrio del split (sample ratio mismatch), algo que la calculadora de significancia no hace. Piénsala como el chequeo de sanidad de tu herramienta, no el veredicto de tu test.
¿Cuántos visitantes necesito para un test A/A?
Cuantos más, mejor: con poca muestra el test casi nunca acusa nada, así que un A/A pequeño pasa fácil sin probar que la herramienta está bien. Usa un volumen parecido al de tus tests A/B reales, del orden de miles de visitantes por grupo, para tener poder de detectar un problema de verdad. Si no tienes ese tráfico, mira la guía de cuántos visitantes necesita un test.
Incorporar esta herramienta en tu sitio

Pega este código donde quieras mostrar la calculadora. El enlace de crédito debajo del cuadro nos ayuda y es libre de mantener.

Continúa

¿Herramienta calibrada? Lee tu test A/B en la calculadora de significancia estadística y revisa el equilibrio del split de cualquier test con el verificador de SRM. Para dimensionar el próximo test, usa la calculadora de tamaño de muestra.

Herramientas relacionadas

Ver todas las herramientas →