CRO

Test A/B de Landing Page B2B SaaS: guía práctica

Test A/B de landing page B2B SaaS: cómo resolver el problema de volumen, qué métrica usar en lugar de formularios enviados y qué testear primero.

Ilustración plana de una página web con un formulario y un botón destacado, con un embudo de siluetas de empresas convergiendo hacia él

El test A/B de landing page B2B SaaS falla por dos motivos que casi nunca son el diseño: volumen insuficiente para el efecto que el equipo quiere detectar, y la métrica primaria equivocada, midiendo formularios enviados cuando lo que paga las cuentas es la oportunidad calificada. Resolver esos dos antes de elegir qué testear cambia el resultado de un programa más que cualquier biblioteca de buenas prácticas. Esta guía, parte del playbook de optimización de página de precios SaaS, cubre la cuenta de viabilidad que decide si vale la pena empezar el test, la métrica correcta y los guardrails de calificación, qué testear en orden de palanca, y un ejemplo trabajado de punta a punta con calculadora en vivo.

Por qué una landing page B2B SaaS es un caso especial

Las diferencias entre testear una página B2B y una página de ecommerce no son estilísticas, son matemáticas y temporales:

Dimensión Ecommerce típico Landing page B2B SaaS
Volumen disponible Alto, la muestra cierra en días Bajo, la muestra cierra en semanas o meses
Tasa base de la métrica primaria 2% a 3% de conversión del sitio 3% a 8% de solicitud de demo, más alta y más volátil
Distancia entre el evento medido y los ingresos Corta: la compra es el evento Larga: demo, calificación, propuesta, cierre
Ciclo hasta saber si el lead servía Inmediato De semanas a meses
Quién decide Una persona Un comité, con distintos influenciadores y aprobadores
Riesgo de falsa victoria Ticket medio cayendo Volumen de leads subiendo y calificación desplomándose

La fila más importante es la última. En ecommerce, una falsa victoria aparece rápido en el cierre del mes. En B2B, puede sobrevivir un trimestre entero dentro de un informe de conversión bonito mientras el equipo comercial se queja bajito de que los leads empeoraron.

La cuenta de viabilidad, antes de elegir qué testear

Esto es lo primero que hay que hacer, y con frecuencia termina la discusión. Sobre una tasa base del 4,2% de solicitud de demo, con 95% de confianza y 80% de poder:

Efecto relativo buscado Tasa objetivo Muestra por variación Días con 3.000 visitas/semana Días con 6.000 visitas/semana
+10% 4,62% 37.513 ≈ 176 ≈ 88
+15% 4,83% 17.050 ≈ 80 ≈ 40
+20% 5,04% 9.803 ≈ 46 ≈ 23
+25% 5,25% 6.409 ≈ 30 ≈ 15
+30% 5,46% 4.544 ≈ 22 ≈ 11
Muestra por variación según el efecto mínimo buscado, sobre una base del 4,2%Sobre una base del 4,2%, detectar 10% relativo exige 37.513 visitas por variación, 15% exige 17.050, 20% exige 9.803, 25% exige 6.409 y 30% exige 4.544. La curva cae muy rápido: pedir un efecto mayor abarata el test de forma no lineal.muestra por variación37.513+10%17.050+15%9.803+20%6.409+25%4.544+30%base 4,2% · 95% de confianza · 80% de poder · efecto relativo buscado
La relación es cuadrática: pedir la mitad del efecto cuesta aproximadamente cuatro veces la muestra. Por eso, en B2B, elegir el efecto mínimo es la decisión más consecuente del test, y se toma antes de cualquier discusión de layout.

Corre tus propios números con la tasa base y el tráfico reales de tu landing page:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La lectura honesta de esa tabla: con 3.000 visitas por semana, perseguir un 10% relativo significa casi seis meses de test, algo inviable en la práctica, porque la página, la campaña y el mercado van a cambiar antes. Hay tres palancas legítimas, y ninguna de ellas es “correr más rápido”:

  1. Testear cambios más grandes. Si solo puedes detectar un 25% relativo, testea cosas capaces de mover un 25%: propuesta de valor, estructura de la página, oferta. El color de un botón no mueve un 25% y no debería consumir tu única ventana del trimestre.
  2. Subir la tasa base moviendo la métrica hacia arriba en el embudo. Testear contra un evento más frecuente (formulario iniciado, clic en el CTA) cierra la muestra más rápido, al costo de medir algo más lejano de los ingresos. Útil como diagnóstico, no como veredicto de negocio.
  3. Concentrar el tráfico. Una sola landing page testeada con todo el tráfico pago cierra su muestra mucho antes que cinco páginas testeadas en paralelo con un quinto del volumen cada una.

La métrica correcta: un formulario enviado no es pipeline

En B2B, la distancia entre el evento medido y los ingresos es la principal fábrica de falsas victorias. Una variación que quita campos del formulario casi siempre aumenta los envíos; si aumenta los envíos un 20% y baja la tasa de calificación un 25%, el pipeline empeoró y el informe de conversión mejoró.

La misma variación leída por dos métricas distintasEn el control, 1.000 visitas producen 42 formularios enviados, 21 leads calificados y 8 oportunidades. En la variación con formulario más corto, las mismas 1.000 visitas producen 50 formularios enviados, una ganancia aparente del 19%, pero solo 20 leads calificados y 8 oportunidades. La métrica de envío sube y el pipeline queda igual.A · formulario actual1.000 visitas42 formularios21 calificados8 oportunidadesB · formulario corto1.000 visitas50 formularios20 calificados8 oportunidadesel informe dice +19% en conversión de formulariola tasa de calificación cayó del 50% al 40% y el pipeline quedó exactamente igualsin el guardrail de calificación, esta variación sería adoptada y celebrada
Números ilustrativos. El punto no es que los formularios cortos sean malos, es que sin un guardrail de calificación no hay manera de saber si la ganancia fue volumen real o dilución.

Los guardrails que un test de landing page B2B tiene que declarar antes de correr:

Guardrail Qué evita Cómo leerlo
Tasa de calificación de leads Ganar volumen y perder encaje con el perfil ideal Si los envíos suben y la calificación cae en proporción, el pipeline no se movió
Volumen absoluto de leads calificados Un argumento porcentual escondiendo el número que importa Compara el conteo absoluto entre brazos, no solo las tasas
Tasa de asistencia a las demos agendadas Agendar tan fácil que produce ausencias Mide sobre la misma cohorte, con la ventana de calendario completa
Tiempo de carga de la página Una variación más rica volviéndose más lenta Cualquier regresión relevante entra en la decisión, incluso con mejor conversión

Una nota sobre plazos: si la métrica primaria es la oportunidad creada y no la demo solicitada, el test tiene que correr al menos un ciclo de venta medio completo después de que entró el último tráfico. Leer antes de eso compara una cohorte madura contra una incompleta, y el sesgo favorece sistemáticamente a quien convierte rápido.

Qué testear, en orden de palanca

En B2B, con pocas ventanas por año, el orden importa más que la lista. Empieza por lo que puede mover el efecto grande que tu volumen es capaz de detectar:

Orden Qué testear Hipótesis Esfuerzo
1 La propuesta de valor del titular, no la redacción del titular Un encuadre distinto del problema habla de otro dolor y cambia la decisión de seguir leyendo Bajo
2 Especificidad de segmento en la página Una página que nombra el sector y el cargo de quien visita convierte mejor que una genérica Medio
3 Oferta del CTA (demo vs prueba gratis vs diagnóstico) El compromiso que se pide puede ser demasiado grande para la etapa del visitante Medio
4 Cantidad y obligatoriedad de los campos del formulario Menos fricción sube los envíos, con riesgo de calificación Bajo
5 Prueba social específica por segmento Logos y casos reconocibles funcionan como prueba; los irrelevantes ocupan espacio Medio
6 Velocidad de carga Una página más rápida elimina un abandono que ningún argumento recupera Medio a alto
7 Estructura de la página (orden de secciones, extensión) Cambiar la secuencia del argumento cambia quién llega al CTA Alto
8 Claridad sobre qué pasa después de enviar La incertidumbre sobre el próximo paso bloquea el clic final Bajo

El punto uno merece precisión, porque es donde la mayoría de los tests B2B desperdicia la ventana. Testear “Aumenta tu productividad” contra “Aumenta la productividad de tu equipo” es testear redacción, y la redacción rara vez mueve el 20% o 25% que tu volumen consigue detectar. Testear un encuadre del problema contra otro (ahorro de costos contra reducción de riesgo contra velocidad de implementación) es testear posicionamiento, y el posicionamiento mueve.

Velocidad: la palanca que el equipo de contenido olvida

La fila seis merece sección propia porque es una de las pocas hipótesis de landing page con un test A/B público documentado. Vodafone corrió un test A/B comparando una versión optimizada de una landing page contra la original y reportó un LCP 31% mejor (5,7 segundos contra 8,3), con 8% más de ventas, una subida del 15% en la tasa de leads por visita y del 11% en la tasa de carrito por visita (web.dev, caso Vodafone). Las optimizaciones fueron técnicas, no de copy: renderizado de widgets movido del cliente al servidor, HTML crítico renderizado en el servidor e imágenes optimizadas.

En un test A/B del mismo tipo, Rakuten 24 comparó una versión optimizada para Core Web Vitals contra la original durante un mes, con división 50/50 y, según el informe, sin ninguna otra diferencia funcional o visual entre las versiones, reportando +53,37% de ingreso por visitante, +33,13% de tasa de conversión, +15,20% de ticket medio y una reducción del 35,12% en la tasa de salida (web.dev, caso Rakuten 24).

Los dos son casos de empresas específicas en contextos específicos, y ninguno es una promesa transferible para tu página. Lo que sostienen es más modesto y más útil: la velocidad es una hipótesis genuinamente testeable, con un efecto potencialmente grande para caber en tu presupuesto de muestra, y con frecuencia es la única palanca de la lista que no exige alinear posicionamiento con marketing y ventas.

Un ejemplo trabajado

Una landing page de SaaS B2B recibe 9.200 visitas por brazo durante la ventana planificada. El test cambia el encuadre del titular, de ganancia de productividad a reducción de riesgo operacional, manteniendo idénticos la oferta y el formulario. La métrica primaria es la solicitud de demo:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Pega 9200/386 en A y 9200/452 en B para comprobar: la mejora absoluta es de 0,72 puntos porcentuales (mejora relativa del +17,10%), el valor z queda alrededor de 2,33 y el valor p bilateral alrededor de 0,0196. El intervalo de confianza del 95% de la diferencia va de 0,11 a 1,32 puntos porcentuales, no cruza el cero, y la variación B gana.

Resultado del ejemplo trabajado de landing page B2BEl control, con encuadre de productividad, convierte el 4,20% de las visitas en solicitudes de demo. La variación, con encuadre de riesgo, convierte el 4,91%. El valor p es de alrededor de 0,0196, un resultado significativo, y el intervalo de confianza del 95% de la diferencia va de 0,11 a 1,32 puntos porcentuales, un intervalo ancho.4,20%A · productividad4,91%B · reducción de riesgointervalo de confianza del 95%de la diferencia, en puntos porcentualescero0,111,32significativo · p ≈ 0,0196el límite inferior casi toca el cero: adopta, no extrapoles
El intervalo va de 0,11 a 1,32 puntos porcentuales. Adoptar B está respaldado; construir la meta del trimestre sobre 0,72 puntos no lo está, porque el efecto real podría ser mucho menor.

Antes de adoptar, una última comprobación que separa al equipo disciplinado del apurado: lee el guardrail de calificación sobre la misma cohorte. Si el encuadre de riesgo trajo un 17% más de demos y la tasa de calificación se mantuvo estable, la victoria es real y el pipeline crece. Si la calificación cayó en proporción parecida, lo que cambió fue la composición de los leads, no el resultado, y la decisión correcta es investigar quién empezó a llenar el formulario antes de cambiar la página entera.

Segmentos y composición del tráfico: el confusor silencioso

Una landing page B2B casi nunca recibe un flujo homogéneo de tráfico. Recibe una campaña paga, un email de nutrición, un enlace de partner y lo que mande la búsqueda orgánica, y cada uno llega con una intención distinta y una tasa base de conversión distinta. Eso está bien mientras la composición se mantenga estable entre los dos brazos. Deja de estar bien en el momento en que el equipo de medios sube el presupuesto de una campaña a mitad del test, o sale una newsletter un martes, porque la mezcla que llega a la variación B ese día no es la mezcla que llegó a la variación A la semana anterior.

Dos prácticas mantienen esto bajo control, y las dos cuestan casi nada:

En la práctica, la protección más barata es una ventana de medios estable: congela presupuestos y creatividades de campaña mientras dure el test siempre que el calendario lo permita, y cuando no lo permita, registra el cambio como confusor declarado en el documento del test para que nadie lea el resultado como limpio seis semanas después.

Los errores más comunes

Error Señal de alerta Arreglo
Testear redacción cuando el volumen solo detecta posicionamiento El test del trimestre fue cambiar dos palabras del titular Elige primero el efecto mínimo; testea algo capaz de moverlo
Medir solo formularios enviados El informe no tiene ninguna métrica de calificación Declara la calificación y el volumen absoluto de calificados como guardrails
Leer la oportunidad antes de que cierre el ciclo de venta El resultado salió dos semanas después de terminar el test Espera al menos un ciclo medio completo después de la última entrada
Correr cinco páginas en paralelo con el mismo tráfico Ningún test cierra nunca su muestra Concentra el tráfico en una página por vez
Cambiar campaña y página en la misma ventana La fuente de tráfico cambió a mitad del test Congela los medios durante la ventana o trátalo como confusor declarado
Comparar a quienes llegaron a la página tras cambiar algo antes de ella “En la variación B de la landing page convirtió más” Mide desde el punto de entrada al test; el recorte que llegó ya es una población seleccionada
Prometer la mejora observada como meta El plan trimestral usa el punto medio del intervalo Usa el límite inferior para planificar, y la estimación puntual para decidir

Haz esto automático en Donnu

Una landing page B2B es el caso donde la estadística deja de ser un detalle técnico y se vuelve una restricción de planificación: con pocas visitas por semana, la diferencia entre un test que enseña algo y un test que produce una opinión nueva está entera en la cuenta hecha antes de correr. Suma la distancia entre el formulario enviado y el pipeline y tienes el ambiente perfecto para adoptar una variación que empeoró el negocio. Donnu se ocupa de las dos puntas: dimensiona la muestra a partir de tu tasa base real, muestra qué efecto mínimo tu tráfico consigue detectar de verdad antes de que inviertas la ventana, retiene el veredicto hasta el plazo acordado y devuelve el intervalo de confianza completo junto con las métricas de guardrail que declaraste.

Empieza una prueba gratis de 14 días y corre tu próximo test de landing page con ese rigor.

Referencias

Lee también:

Preguntas frecuentes

¿Se puede testear A/B una landing page B2B con poco tráfico?
Se puede, siempre que aceptes detectar efectos más grandes. Sobre una tasa base del 4,2% de solicitudes de demo, con 95% de confianza y 80% de poder, detectar una mejora relativa del 15% exige 17.050 visitas por variación, unos 40 días con 6.000 visitas por semana. Detectar el 10% exige 37.513 por variación, lo que duplica la ventana. Las dos palancas honestas son subir el efecto mínimo que buscas o alargar la ventana; acortar el plazo manteniendo el objetivo no acelera nada, solo sustituye la decisión por un lanzamiento de moneda.
¿Qué métrica debe usar un test de landing page B2B?
La métrica primaria debe ser el evento más cercano a los ingresos que todavía tenga volumen para cerrar una muestra, normalmente la solicitud de demo o la reunión confirmada, con la calificación como métrica de guardrail. Los formularios enviados por sí solos engañan en B2B, porque una variación puede subir el volumen de leads y hundir la tasa de calificación, dejando el pipeline igual o peor con un informe de conversión más bonito.
¿Debo reducir la cantidad de campos del formulario en una landing page B2B?
Es una de las hipótesis más testeables y una de las más fáciles de leer mal. Menos campos casi siempre aumentan el volumen de envíos, y el efecto sobre el pipeline depende de cuánto de esa calificación usaba realmente el equipo comercial. Trátalo como un test con guardrails: la métrica primaria es el envío, y los guardrails son la tasa de calificación y el volumen absoluto de leads calificados, medidos sobre la misma cohorte y con tiempo suficiente para el ciclo de venta.
¿La velocidad de la página es una hipótesis válida en B2B?
Lo es, y es una de las pocas hipótesis con un test A/B público documentado. Vodafone corrió un test A/B en una landing page comparando una versión optimizada contra la original y reportó un LCP 31% mejor (5,7 segundos contra 8,3), con 8% más de ventas, una subida del 15% en la tasa de leads por visita y del 11% en la tasa de carrito por visita. Es una empresa en un contexto específico, no una regla universal, pero muestra que la palanca es real y testeable.
¿Cuánto hay que esperar antes de leer el resultado de un test B2B?
El plazo es el mayor entre lo que exige la muestra y lo que exige el ciclo de venta. Si la métrica primaria es la solicitud de demo, la restricción que aprieta suele ser la muestra. Si la métrica primaria es la oportunidad creada, es el ciclo de venta, y leer antes de que se complete el ciclo medio mide una cohorte incompleta, lo que sesga la comparación a favor de quien convierte rápido.
¿El test debe correr en la landing page o en todo el sitio?
Córrelo donde ocurre el cambio y mide desde el punto de entrada al test. Si el cambio está en la landing page, la población del test es quien llega a la landing page, y la métrica se mide sobre esa entrada. El error clásico es cambiar algo antes de la página y después comparar solo a quienes llegaron: esas personas ya son una población seleccionada por el propio cambio, y la comparación se convierte en sesgo de selección.
¿Los logos de clientes ayudan en una landing page B2B?
Es una hipótesis razonable y testeable, con una trampa específica: un logo de cliente solo funciona como prueba cuando el lector reconoce a la empresa y se identifica con ella. Un muro de logos irrelevantes para el segmento que visita ocupa espacio noble sin entregar prueba. Por eso el test más informativo casi nunca es logos o sin logos, sino qué logos, para qué segmento de tráfico.