Herramienta

Generador de hipótesis de test A/B

Completa los campos y recibe la hipótesis lista en el formato Si, Entonces, Porque, Medido por, con una nota de calidad que señala exactamente lo que todavía falta. Gratis, en vivo, sin registro.

La mayoría de los tests A/B que no enseñan nada ya estaban muertos en la hipótesis. No porque la estadística fallara, sino porque nadie escribió qué se esperaba aprender. Un test sin hipótesis produce una sola respuesta: subió o bajó. Un test con hipótesis produce conocimiento reutilizable, que sobrevive al resultado y orienta el próximo experimento. Esta herramienta escribe la hipótesis por ti a partir de los campos que importan, y después hace la parte incómoda: puntúa qué tan rigurosa es y te dice dónde está floja.

Generador de hipótesis de test A/B
Nota de calidad-

Tu hipótesis

Versión de una línea (para la tarjeta del backlog)

Qué la sostiene (y qué falta)

  • Público y página específicos-
  • Cambio concreto y único-
  • Efecto esperado en el comportamiento-
  • Evidencia que sostiene la apuesta-
  • Razón explicada, no solo afirmada-
  • Métrica primaria definida-
  • Baseline y efecto esperado en número-
  • Métricas de control declaradas-

Nada de esto sale de tu navegador: los campos no se envían a ningún lado. La nota es una regla de rigor, no un oráculo: verifica que la hipótesis sea específica, falsable y anclada en evidencia, que es lo que separa un experimento de una apuesta cara.

Cómo usarla

  1. Describe el cambio en términos concretos. Escribe qué hace la variación, no el objetivo detrás. "Hacer la página más confiable" no es un cambio; "agregar tres sellos de seguridad debajo del formulario" sí lo es.
  2. Di para quién y dónde. Público y etapa cambian por completo el efecto esperado: el mismo botón se comporta distinto en móvil y en escritorio.
  3. Escribe el efecto esperado en el comportamiento, no el resultado financiero. El comportamiento es lo que la variación puede causar directamente.
  4. Registra la evidencia y elige su origen en la lista. Es el ítem de mayor peso en la nota, y es donde la honestidad se paga sola.
  5. Define una métrica primaria, el baseline actual y la mejora relativa que esperas. Ese par de números es lo que alimenta el cálculo de muestra después.
  6. Declara las métricas de control y copia la hipótesis lista a la tarjeta de tu backlog.

Cómo funciona: la anatomía de la hipótesis y la nota

El texto sale en el formato canónico de la experimentación, con cada cláusula cumpliendo una función específica:

SI [cambio], para [público y página],
ENTONCES [efecto esperado en el comportamiento],
PORQUE [evidencia que sostiene la apuesta].
MEDIDO POR: [métrica], de [baseline] a [objetivo].

El objetivo se calcula como baseline × (1 + mejora relativa / 100), porque el efecto en un test A/B se declara en términos relativos. Una mejora de 20% sobre una tasa de 3,2% llega a 3,84%, no a 23,2%: confundir ambas es el error más común al dimensionar un test, e infla el tamaño de efecto esperado hasta volver el experimento imposible de detectar.

La nota de calidad suma ocho criterios con pesos fijos: público específico (15), cambio concreto (15), efecto esperado (10), origen de la evidencia (hasta 25), razón explicada (10), métrica primaria (10), números de baseline y efecto (10) y métricas de control (5). La evidencia pesa más que cualquier otro ítem aislado porque es lo que distingue un programa de experimentación de una fila de opiniones: el dato cuantitativo vale 25 puntos, la investigación cualitativa 20, la heurística de UX 12, el benchmark de terceros 10 y la corazonada vale cero.

Ejemplo trabajado (reproduce el resultado por defecto)

Los campos vienen completados con un caso real de página de producto. El cambio es cambiar el texto del botón de Enviar a Quiero mi presupuesto gratis, el público son los visitantes de móvil en la página de producto, el efecto esperado es que más visitantes completen el formulario y la razón son las grabaciones de sesión que muestran 62% de usuarios deteniéndose en el botón sin hacer clic. La métrica primaria es la tasa de conversión a lead, hoy en 3,2%, con una mejora relativa esperada de 20%.

El objetivo sale de 3,2 × 1,20 = 3,84%, y ese es el número que aparece en la cláusula Medido por. La nota cierra en 95 de 100: siete de los ocho criterios pagan completo (15 + 15 + 10 + 10 + 10 + 10 + 5 = 75) y la evidencia, marcada como investigación cualitativa, paga 20 de los 25 posibles. Faltan exactamente 5 puntos, y están en un solo lugar: si además tuvieras el dato cuantitativo del embudo confirmando la caída en ese paso, y no solo las grabaciones, el ítem de evidencia llegaría a 25 y la hipótesis alcanzaría 100.

Ahora cambia el origen de la evidencia a corazonada y mira lo que pasa: la nota se desploma a 75 sin que cambie una sola palabra del texto. Es a propósito. La hipótesis sigue bien escrita, específica y falsable; simplemente dejó de tener alguna razón para existir. Ese es el test que quema tres semanas de tráfico para responder algo que nadie sabía por qué estaba preguntando.

Cómo leer la nota y dónde no ayuda

La nota mide rigor de formulación, no probabilidad de ganar. Una hipótesis de 100 puntos puede perder feo, y eso es señal de salud: significa que aprendiste algo que contradecía la evidencia disponible, que es el resultado más valioso que un programa de tests puede producir. Lo que la nota garantiza es que, ganando o perdiendo, vas a saber qué significa el resultado.

Tampoco juzga la calidad de tu evidencia dentro de una categoría. Marcar "dato cuantitativo" con base en una muestra de 30 sesiones da los mismos 25 puntos que un embudo con 200.000 visitantes, y la herramienta no tiene cómo notar la diferencia. Lo mismo con el baseline: acepta el número que escribas sin verificar si vino del analytics o de la memoria. La regla mide estructura, y la estructura es condición necesaria, nunca suficiente.

El límite más importante es este: una buena hipótesis no arregla un test sin potencia. Una vez escrita la tuya, lleva el baseline y la mejora esperada a la calculadora de tamaño de muestra y descubre cuántos visitantes exige el experimento. Si tu tráfico no banca ese efecto, el problema no es la redacción: usa la calculadora de MDE para encontrar el menor efecto que realmente puedes detectar y reescribe la expectativa sobre él.

Cinco errores que la nota marca al instante

Preguntas frecuentes

¿Qué es una hipótesis de test A/B?
Es la afirmación testeable que tu experimento va a intentar derribar. Tiene que decir qué cambia, para quién, qué comportamiento esperas ver, por qué lo crees y qué número resuelve la pregunta. Si ningún resultado pudiera probar que la frase es falsa, no es una hipótesis: es un deseo.
¿Cuál es la diferencia entre hipótesis e idea de test?
Una idea es "probemos el botón verde". Una hipótesis es "si cambiamos el texto del botón de Enviar a Quiero mi presupuesto gratis, para visitantes de móvil en la página de producto, entonces más visitantes completan el formulario, porque las grabaciones muestran gente deteniéndose ahí, medido por la tasa de conversión a lead". La idea dice qué hacer. La hipótesis dice qué aprendes, ganes o pierdas.
¿Por qué el formato Si, Entonces, Porque, Medido por?
Porque cada cláusula cierra un hueco distinto. El Si fija el cambio, para que no modifiques cinco cosas y nunca sepas cuál funcionó. El Entonces fija el comportamiento esperado, que es lo que vuelve falsable la afirmación. El Porque fija la evidencia, que separa un experimento de una corazonada. El Medido por fija la métrica primaria antes de ver los datos, lo que bloquea la elección conveniente de número después del resultado.
¿Cómo se calcula la nota de calidad?
Son ocho criterios con pesos fijos que suman 100: público y página específicos (15), cambio concreto (15), efecto esperado (10), origen de la evidencia (hasta 25), razón explicada (10), métrica primaria (10), baseline y efecto en número (10) y métricas de control (5). La evidencia pesa más que cualquier otro ítem a propósito: una hipótesis bien escrita apoyada en una corazonada sigue siendo una corazonada. Todo corre en tu navegador y nada se envía a ningún lado.
¿De verdad necesito declarar métricas de control?
Sí, y es el campo que más gente salta. Una métrica de control es lo que no puede empeorar mientras persigues la métrica primaria. Un popup agresivo puede subir la captura de email y hundir el ingreso por visitante al mismo tiempo. Sin control declarado de antemano, celebras la victoria parcial y te llevas la pérdida a casa sin notarla.
¿La hipótesis puede cambiar después de que el test empieza?
No. Cambiar la métrica primaria o el público después de ver los datos es el camino más corto a un falso positivo, porque empiezas a elegir el corte que confirma lo que querías. Si la hipótesis estaba equivocada, regístralo y escribe una nueva para el próximo ciclo. Una hipótesis vieja, refutada y documentada, es aprendizaje; una hipótesis reescrita a mitad de camino es ruido.
Incrustar esta herramienta en tu sitio

Pega este código donde quieras mostrar el generador. El enlace de crédito debajo del cuadro nos ayuda y eres libre de mantenerlo.

Continúa

El razonamiento completo detrás de cada cláusula está en la guía cómo escribir una hipótesis de test A/B. Con la hipótesis lista, dimensiona el experimento en la calculadora de tamaño de muestra, descubre cuánto va a durar en la calculadora de duración y, al final, lee el veredicto en la calculadora de significación.

Herramientas relacionadas

Ver todas las herramientas →