Test A/B en Shopify: la Guía Completa
Test a/b shopify guía completa: dónde instalar, qué se puede testear fuera del checkout, cómo dimensionar con tráfico real y las trampas del tema.

📚 Este artículo es parte de la guía Optimización de Checkout: el Playbook de Test A/B.
El test A/B en una tienda Shopify funciona muy bien en todo lo que viene antes del checkout, y prácticamente no funciona dentro de él con herramientas genéricas, porque Shopify cerró el checkout a scripts de terceros y lo sustituyó por extensiones que ella misma valida. Este artículo forma parte del playbook completo de optimización de checkout y cubre el proceso de punta a punta: dónde instalar, qué testear en cada superficie de la tienda, cómo dimensionar con el tráfico que realmente tienes y las trampas específicas de tema y carrito que arruinan los tests de Shopify.
Si tu duda es qué herramienta elegir, el artículo dedicado a herramientas de test A/B para Shopify compara las categorías con neutralidad. Aquí el foco es la ejecución.
El mapa de la tienda: dónde llega el test y dónde no
Esto no es tan limitante como parece a primera vista. Las causas líderes de abandono, según el Baymard Institute, son de transparencia de precio, y buena parte de ellas puede tratarse antes del checkout: mostrar el envío estimado en el carrito, dejar explícito el umbral de envío gratis, exhibir el coste total antes de que la persona entre en el flujo de pago. El artículo sobre test A/B de carrito abandonado cubre esas palancas en detalle.
Paso 1: elige la métrica en el panel que ya tienes
Antes de instalar nada, define el número que va a decidir el test, y defínelo dentro de la realidad de volumen de tu tienda. Esa elección determina cuánto va a durar el test más que cualquier otra decisión.
| Métrica | Tasa base típica | Volumen necesario | Cuándo usarla |
|---|---|---|---|
| Sesión a pedido | 1% a 3% | Muy alto | Tiendas con decenas de miles de sesiones por semana |
| Sesión a añadir al carrito | 5% a 12% | Alto | El punto medio más usado; sigue ligado al pedido, pero cierra mucho más rápido |
| Carrito a inicio de checkout | 40% a 70% | Medio | Tests de página de carrito |
| Carrito a pedido | 25% a 40% | Medio | Tests de transparencia de coste en el carrito |
La regla práctica: cuanto menor es la tasa base, más tráfico exige el test. Una tienda con 10.000 sesiones por semana no consigue cerrar un test decidido por sesión a pedido en un plazo razonable, y sí consigue cerrar uno decidido por añadir al carrito. Elegir la métrica es elegir el plazo.
Paso 2: instala el script en el lugar correcto del tema
El punto de instalación decide si el test va a funcionar o va a producir ese parpadeo de la versión original antes de que aparezca la variación, que además de feo contamina el resultado (parte de los visitantes ve las dos versiones).
- En
theme.liquid, lo más arriba posible dentro delhead. El script necesita decidir la variación antes del primer pintado de la pantalla. Ponerlo antes de las hojas de estilo y de otros scripts pesados es lo que evita el parpadeo. - Con carga síncrona o con anti-flicker. Un script asíncrono en el pie prácticamente garantiza el parpadeo. Si la herramienta ofrece un fragmento anti-flicker, úsalo, y configura un tiempo límite corto para que un fallo de red nunca deje la página oculta.
- Testeando primero en un tema duplicado. Shopify permite duplicar el tema y previsualizarlo por una URL de preview. Homologa ahí, confirma que la variación se renderiza y que el evento de conversión se dispara, y solo entonces publica en el tema activo.
- Sin romper las secciones Online Store 2.0. Los temas modernos montan la página por secciones que el comerciante puede reordenar en el editor. Una variación que depende de una posición fija de elemento se rompe cuando alguien reordena las secciones en mitad del test.
Paso 3: qué testear en cada superficie
| Superficie | Tests de mayor apalancamiento | Cuidado específico de Shopify |
|---|---|---|
| Página de producto | Bloque de compra sobre la línea de flotación, orden de las fotos, reseñas cerca del precio, texto del botón | El selector de variante suele ser el punto que más se rompe; testea todas las combinaciones de color y talla |
| Colección | Cantidad de ítems por fila, filtros visibles, orden por defecto, etiqueta de más vendido | La paginación y el scroll infinito cambian el denominador; fija la regla antes de correr |
| Home | Hero principal, orden de los bloques, destaque de categoría | Es la página más editada por el equipo de marketing; congela ediciones durante el test |
| Carrito (drawer o página) | Envío estimado, umbral de envío gratis con progreso, upsell complementario | El drawer se actualiza por AJAX; la variación necesita reaplicarse en cada cambio del DOM |
| Popup de captación | Momento de exhibición, oferta, número de campos | El popup de una app compite con tu test; desactiva los demás durante el experimento |
| Checkout | Fuera del alcance del snippet | Solo vía Checkout UI Extension |
El ítem del carrito merece destaque porque es la causa número uno de test roto en Shopify. Cuando el cliente añade un producto, el drawer se redibuja dinámicamente y la variación inyectada por JavaScript desaparece, salvo que el script observe los cambios del DOM y se reaplique. El síntoma es siempre el mismo: el test “funciona” en la homologación (donde nadie añade producto) y produce un efecto extrañamente pequeño en producción.
Paso 4: dimensiona antes de encender
Ajusta la tasa de conversión actual de la métrica elegida, la mejora mínima que justifica implementar y el volumen semanal real de sesiones:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Un ejemplo trabajado, del test a los ingresos
Una tienda Shopify convierte el 2,2% de las sesiones en pedido y quiere detectar una mejora relativa del 15% (del 2,2% a cerca del 2,53%). Con 95% de confianza y 80% de potencia, la matemática devuelve 33.284 sesiones por variación. Con 10.000 sesiones por semana, eso da 47 días, casi siete semanas, demasiado tiempo para la mayoría de las operaciones.
Existen dos salidas honestas, y ninguna de ellas es “correrlo igual y mirar temprano”:
- Apuntar a un efecto mayor. Al 20% relativo, el requisito baja a 19.147 sesiones por variación, y el mismo volumen cierra en 27 días. Un efecto mayor exige un cambio mayor: reestructurar el bloque de compra, no cambiar un texto.
- Subir la métrica en el embudo. Decidir por añadir al carrito, con una tasa base cerca del 8%, reduce drásticamente la muestra necesaria. El coste es que mides una etapa, no la venta, y necesitas confirmar el efecto en el pedido después.
Supón que el test corrió hasta 29.000 sesiones por variación y terminó con 638 pedidos en el control (2,20%) contra 734 en la variación (2,53%). En el mismo motor de significancia del blog: z = 2,62, valor p ≈ 0,0087, con intervalo de confianza de la diferencia entre +0,08 y +0,58 puntos porcentuales. No cruza cero, así que la variación convierte realmente mejor.
Y los ingresos: con 40.000 sesiones por mes y un ticket medio de R$ 180, pasar del 2,2% al 2,53% representa cerca de R$ 23.760 de ingresos adicionales por mes. Usando el límite inferior del intervalo (2,28%), la ganancia baja a cerca de R$ 6.000 mensuales. Lleva los dos números a la reunión: el optimista muestra el techo, el conservador es el que sostiene una decisión de inversión.
Trampas específicas de Shopify
Apps compitiendo con el test. Una tienda madura acumula apps de popup, de upsell, de envío y de reseñas, y varias de ellas inyectan elementos en la misma página que estás testeando. Si una app muestra un popup al 40% de los visitantes por regla propia, se superpone a tu experimento de forma desigual. Mapea las apps activas en la superficie testeada y desactiva las que interfieren durante el test.
Tema editado en mitad del test. El editor de tema de Shopify es tentador, y el equipo de marketing suele ajustar banners todas las semanas. Cualquier edición publicada en mitad del test cambia la página para las dos variaciones e invalida la comparación de antes y después de ese momento. Congela las ediciones o registra la fecha exacta de cada cambio.
Multimoneda y Shopify Markets. Si la tienda vende en más de una moneda o mercado, el mismo test corre sobre públicos con comportamiento y ticket bastante distintos. Lee el resultado segmentado por mercado antes de aplicar la ganadora a todos.
Tráfico de bot y de app. Parte del tráfico que llega a tu script no es humano. Shopify aplica sus propios filtros en las métricas de su panel; tu herramienta de test aplica los suyos. La divergencia es normal, pero si la división entre variaciones se aleja de lo configurado, eso es SRM y bloquea la lectura hasta que encuentres la causa.
Descuentos automáticos. Una regla de descuento activa durante el test puede aplicarse de forma desigual entre las variaciones, si la variación cambia el valor del carrito y cruza el umbral de la regla. Es una fuente silenciosa de diferencia de ticket medio que no tiene nada que ver con el cambio testeado.
Cuánto tiempo dejarlo corriendo, y cuándo parar
La muestra calculada dice cuántas sesiones necesitas. No dice cuándo parar, y esas son preguntas distintas en una tienda.
La regla mínima son ciclos semanales completos. El comportamiento de compra del lunes no es el del sábado, y cerrar un test un jueves después de empezar un lunes captura una porción sesgada de la semana. Corre en múltiplos de siete días, aunque la muestra haya cerrado antes.
La segunda regla es no mirar para decidir. Abrir el panel todos los días y cerrar en cuanto el número queda bonito es el problema del peeking, que infla la tasa de falso positivo de forma previsible y medible: cuantas más veces miras con intención de parar, mayor es la probabilidad de declarar ganadora una variación que no es mejor en nada. Mirar para comprobar la salud (la división está cuadrando, nada se rompió, ningún error en la consola) es obligatorio y no tiene ese efecto; mirar para decidir es lo que arruina el test. El artículo sobre el problema del peeking cuantifica el daño.
La tercera es evitar la ventana atípica. Black Friday, liquidación de stock, una campaña grande de tráfico pago y las fechas señaladas cambian la intención de compra de toda la base al mismo tiempo. Un resultado obtenido solo en esa ventana vale para esa ventana, no para el resto del año. Si la fecha cae en mitad de un test en marcha, registra el periodo y lee el resultado con y sin él.
Checklist antes de publicar el test
| Ítem | Confirmar |
|---|---|
| Métrica primaria definida | Y que sea compatible con el volumen de la tienda (ver la tabla del paso 1) |
| Muestra y plazo calculados | Con la calculadora de arriba, antes de encender, no después |
Script arriba del head de theme.liquid |
Con anti-flicker y tiempo límite corto |
| Homologado en tema duplicado | La variación se renderiza y el evento de conversión se dispara en la URL de preview |
| Drawer de carrito reaplicando la variación | Probado añadiendo producto, no solo cargando la página |
| Apps competidoras mapeadas | Popups y upsells que actúan en la misma superficie desactivados o documentados |
| Ediciones de tema congeladas | O con registro de fecha para excluirlas del periodo de análisis |
| Segmentos de lectura declarados | Móvil y escritorio, y mercado, si hay más de uno |
| Verificación de SRM configurada | La división observada cuadra con la configurada antes de cualquier lectura |
Haz esto automático con Donnu
La parte difícil del test A/B en una tienda Shopify no es la instalación, es la disciplina: elegir una métrica compatible con tu volumen, dimensionar la muestra antes de encender, no dejar que el snippet retrase el primer pintado de la pantalla y leer el intervalo de confianza en vez del ganador del tercer día.
Donnu A/B fue construida exactamente para eso: snippet ligero que nunca bloquea la tienda, dimensionamiento automático de la muestra y estadística bayesiana honesta, sin prometer una certeza que los datos no sostienen. Empieza una prueba gratis de 14 días y corre el primer test en la superficie donde Shopify te deja trabajar de verdad: todo lo que viene antes del checkout.
Lee también: Herramientas de Test A/B para Shopify · Test A/B de Página de Producto · Optimización de Checkout: el Playbook de Test A/B
Referencias
- Shopify. Documentación técnica sobre el archivo
checkout.liquidy su descontinuación. shopify.dev/docs/storefronts/themes/architecture/layouts/checkout-liquid. - Shopify Changelog. “The checkout.liquid theme file is being deprecated”, con las fechas de las dos fases. changelog.shopify.com/posts/the-checkout-liquid-theme-file-is-being-deprecated.
- Shopify Partners Blog. “Checkout Extensibility Opens New Ways to Customize Checkouts on Shopify.” shopify.com/partners/blog/checkout-extensibility.
- Baymard Institute. Cart Abandonment Rate Statistics. Promedio de 50 estudios sobre abandono de carrito y distribución de los motivos. baymard.com/lists/cart-abandonment-rate.
Preguntas frecuentes
- ¿Se puede hacer un test A/B dentro del checkout de Shopify?
- Con una herramienta genérica de snippet, no. Shopify descontinuó checkout.liquid por fases: las páginas de Información, Envío y Pago el 13 de agosto de 2024, y las páginas de Estado del pedido y Gracias, junto con los scripts adicionales, el 28 de agosto de 2025. Las script tags en esas dos páginas siguieron el mismo plazo en las tiendas Plus y, según la documentación de Shopify, se retiran el 26 de agosto de 2026 en las tiendas fuera de Plus. En su lugar entraron las Checkout UI Extensions, componentes en sandbox que la propia Shopify valida y renderiza. Testear dentro del checkout hoy exige construir y homologar una extensión, no instalar un script. Fuera del checkout (home, colección, página de producto, carrito) el snippet sigue funcionando con normalidad.
- ¿Dónde instalo el script de test A/B en una tienda Shopify?
- Existen dos caminos habituales. El primero es editar el tema y colocar el script en theme.liquid, lo más arriba posible dentro del head, para que decida la variación antes del primer pintado de la pantalla. El segundo es usar un app embed de la Shopify App Store, cuando la herramienta ofrece uno. El camino por el tema da más control sobre la posición exacta del script, que es lo que evita el parpadeo de la versión original antes de que aparezca la variación.
- ¿Cuánto tráfico necesita una tienda Shopify para que un test sea significativo?
- Depende de la tasa de conversión actual y de la mejora mínima que quieras detectar. Una referencia calculada con la matemática de este blog: una tienda que convierte el 2,2% de sesión a pedido y quiere detectar una mejora relativa del 15% necesita cerca de 33.284 sesiones por variación. Apuntando al 20% relativo, el requisito baja a unas 19.147 por variación. Las tiendas con menos volumen que eso deberían testear más arriba en el embudo, donde la tasa base es mayor, como añadir al carrito o inicio de checkout.
- ¿Por qué el número de visitantes de mi herramienta de test no coincide con el del panel de Shopify?
- Porque cuentan cosas distintas. El panel de Shopify cuenta sesiones con su propio criterio de ventana y de filtrado de bots; la herramienta de test cuenta visitantes únicos expuestos a una variación, con su propia regla de identificación y su propia ventana. Una divergencia de algunos puntos porcentuales es normal y esperable. Lo que no es normal es que la división entre las variaciones de tu herramienta se aleje de lo configurado: eso es señal de SRM y exige investigación antes de cualquier lectura del resultado.
- ¿Puedo testear precio en Shopify con una herramienta client-side?
- Técnicamente se puede cambiar el precio mostrado por JavaScript, y es una pésima idea: el precio mostrado pasaría a diferir del precio real cobrado en el carrito y en el checkout, que vienen del backend de Shopify. Además del riesgo de conformidad con el consumidor, el test mediría la reacción a un precio que la tienda no va a cobrar. Un test de precio en Shopify debe hacerse con una app que cambie el precio de verdad en el catálogo, o mediante un descuento automático aplicado por regla, nunca por sobrescritura visual.