Test A/B de Envío Gratis: Encontrando el Umbral Ideal
Test de envío gratis: cómo elegir los umbrales candidatos, qué métrica decide (no es la conversión), cuánto tráfico exige y las guardas de margen.

📚 Este artículo es parte de la guía Optimización de Checkout: el Playbook de Test A/B.
Un test de umbral de envío gratis compara dos valores mínimos de pedido a partir de los cuales la tienda deja de cobrar el envío, para descubrir cuál de ellos entrega más beneficio por visitante. Es uno de los pocos tests de ecommerce en que la métrica obvia (la conversión) casi siempre apunta hacia el lado equivocado, porque el umbral más bajo tiende a convertir mejor y a entregar menos margen. Este artículo forma parte del playbook completo de optimización de checkout y cubre cómo elegir los candidatos, qué métrica decide, cuánto tráfico exige el test y qué guardas impiden una victoria falsa.
Por qué el envío decide tanta compra
El costo extra es el motivo número uno de abandono de checkout entre quienes tenían intención de comprar. Según el Baymard Institute, los costos extras demasiado altos (envío, tasas e impuestos) lideran con 40% de las menciones entre quienes abandonaron por algún motivo más allá de estar solo navegando, por delante de entrega demasiado lenta (20%), desconfianza al pasar la tarjeta (19%), exigencia de crear cuenta (18%) y checkout largo o complicado (17%). El mismo instituto documenta una tasa media de abandono de carrito de 70,22%, calculada a partir de 50 estudios.
Eso posiciona al envío como una palanca de conversión de primer orden, y ahí está la trampa: como el envío pesa mucho en la decisión, es fácil concluir que “cuanto menos envío, mejor” y poner el umbral en cero sin mirar la cuenta del otro lado. La pregunta correcta no es si el envío gratis convierte más, casi siempre convierte, es a partir de qué valor de pedido todavía paga su propia cuenta.
Test de envío gratis: el umbral es un número, y los números se testean
El error conceptual más común es tratar el envío gratis como un botón binario (lo hay o no lo hay). En la práctica, es un valor: por encima de R$ X el cliente no paga envío. Ese X gobierna tres cosas al mismo tiempo:
- La tasa de conversión. Cuanto más bajo el umbral, más gente alcanza el beneficio sin esfuerzo, y mayor la conversión.
- El ticket medio. Cuanto más alto el umbral, más gente añade un artículo extra para alcanzarlo, y mayor el valor medio del pedido.
- El costo de envío que la tienda absorbe. Cuanto más bajo el umbral, más pedidos pequeños llegan con el envío costeado por la tienda, y menor el margen por pedido.
Las tres se mueven en direcciones distintas, y es exactamente por eso que la decisión no puede salir de una sola métrica.
Cómo elegir los umbrales candidatos
No elijas por número redondo. Elige mirando la distribución real de los valores de carrito de tu tienda en los últimos meses. El procedimiento práctico:
- Levanta el histograma de valor de pedido (o de carrito, incluyendo los abandonados) en franjas de R$ 20 o R$ 25.
- Encuentra la franja donde la concentración es mayor. De ahí vendrá la mayor parte del movimiento.
- Coloca el umbral candidato justo por encima de esa franja densa, a la distancia que un artículo medio de tu catálogo consigue cubrir. Si el carrito típico cierra en R$ 130 y el artículo medio cuesta R$ 45, un umbral en R$ 160 es alcanzable con un artículo más; un umbral en R$ 260 no lo es.
- Elige el segundo candidato del otro lado de la franja, para que el test mida una diferencia real de comportamiento y no dos versiones del mismo valor.
| Señal en la distribución de carrito | Umbral candidato | Qué esperar |
|---|---|---|
| Concentración alta justo por debajo del umbral actual | Mantener el umbral y testear su comunicación | Ganancia de conversión sin costo de margen, el test más barato de esta familia |
| Concentración alta bastante por debajo del umbral actual | Testear un umbral más bajo | La conversión sube, el margen por pedido cae, la decisión dependerá del beneficio por visitante |
| Cola relevante por encima del umbral actual | Testear un umbral más alto | El ticket medio sube, la conversión cae, y el riesgo es perder al cliente de compra pequeña recurrente |
| Distribución achatada, sin pico claro | Testear envío gratis sin umbral contra el actual | Hipótesis legítima, pero entra con guarda de margen por pedido desde el primer día |
Fíjate en la primera fila: en muchas tiendas el test con mejor relación entre esfuerzo y retorno no es cambiar el valor, es comunicar el valor que ya existe. Una barra de progreso que muestra “faltan R$ 23 para el envío gratis” en el carrito no cambia la economía del pedido, cambia cuánta gente percibe que está cerca del beneficio. Vale testear eso antes de tocar el número, porque el riesgo de margen es cero.
La métrica que decide no es la conversión
Este es el punto que separa un test de envío gratis bien leído de uno mal leído. La conversión es la métrica que todo panel muestra primero y es la que casi siempre favorece al umbral más bajo. El veredicto honesto viene del beneficio por visitante, que combina tres números:
- la tasa de conversión de la variación,
- el ticket medio (y, dentro de él, el margen bruto de los artículos),
- el costo de envío que la tienda absorbió por pedido.
Una variación puede ganar en conversión, perder en ticket medio y aun así ganar en el agregado, o al revés. La regla práctica: decide por el beneficio por visitante, diagnostica por la conversión y por el ticket medio. Si tu panel no calcula beneficio, la aproximación mínima aceptable son los ingresos por visitante descontado el costo de envío absorbido, que ya captura la mayor parte del trade-off. La calculadora de ingresos por visitante ayuda a montar esa cuenta.
Una advertencia estadística honesta: el test de dos proporciones que usa la calculadora de significancia de este blog sirve para tasas (cuántos de cuántos convirtieron). Ticket medio e ingresos por visitante son promedios de valores continuos, con cola larga, y no deben leerse con el mismo test. Pocos pedidos muy grandes mueven un promedio por sí solos, y es común que una diferencia de ticket que parece expresiva desaparezca cuando se mira la mediana. Trata la diferencia de conversión con el rigor del test de proporción y la diferencia de ticket con la cautela de quien sabe que el promedio está siendo empujado por pocos puntos.
Dimensionando el test
Ajusta la tasa de conversión actual de la tienda, la ganancia mínima que justificaría cambiar el umbral y el tráfico semanal real:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Un ejemplo trabajado con números reales
Una tienda convierte 2,5% de los visitantes en pedido y recibe 30.000 visitas por semana. El equipo quiere testear bajar el umbral de envío gratis de R$ 199 a R$ 149.
Si la ambición es detectar una mejora relativa de 10% en la conversión (de 2,5% a 2,75%), con 95% de confianza y 80% de poder, la matemática pide 64.199 visitantes por variación, lo que con 30.000 visitas semanales lleva 30 días. Apuntando a 15% relativo (de 2,5% a 2,875%), el requisito baja a 29.193 por variación y el test cierra en cerca de 14 días. Como bajar el umbral es un cambio grande en la oferta, apuntar a 15% es una elección defendible; apuntar a 5% sería pedir dos meses y medio de test para un efecto que el propio cambio difícilmente produciría de forma tan sutil.
Supón que el test corrió hasta 30.000 visitantes por variación y terminó con 750 pedidos en el control (2,50%, umbral R$ 199) contra 840 en la variación (2,80%, umbral R$ 149). Corriendo esos cuatro números en el mismo motor de significancia del blog: z = 2,29, valor p ≈ 0,0222, con intervalo de confianza de 95% de la diferencia entre +0,04 y +0,56 punto porcentual, y mejora relativa observada de +12%. El intervalo no cruza el cero, así que la ganancia de conversión es real.
¿La ganancia de conversión paga el envío que la tienda pasó a absorber?
Esa es la segunda mitad de la cuenta, y es donde muchos tests de envío paran demasiado pronto. Sobre las 30.000 visitas semanales, la ganancia de 2,50% a 2,80% en la conversión, con un ticket medio de R$ 210, genera R$ 18.900 de ingresos incrementales por semana (30.000 × 0,003 × 210), por el mismo cálculo de la calculadora de impacto de conversión del blog.
Ahora la columna de costo, que el panel del test no muestra: bajar el umbral de R$ 199 a R$ 149 hace que la tienda costee el envío de toda la franja de pedidos entre esos dos valores, que antes pagaban envío. Si, en el período, 900 pedidos cayeron en esa franja y el costo medio de envío absorbido fue de R$ 24, son R$ 21.600 de costo adicional contra R$ 18.900 de ingresos incrementales, y la variación ganadora en conversión es perdedora en resultado. Cambia el costo medio de envío a R$ 15 y la cuenta se invierte. Ninguno de los dos escenarios aparece en el gráfico de conversión, y por eso el costo de envío absorbido necesita entrar en la lectura desde el diseño del test, no en la reunión siguiente.
Guardas obligatorias
| Guarda | Por qué monitorearla | Señal de alerta |
|---|---|---|
| Margen por pedido | El umbral más bajo transfiere el costo de envío a la tienda | La conversión sube y el margen cae lo suficiente para anular la ganancia |
| Ticket medio y mediana | Un umbral alto empuja el carrito hacia arriba; uno bajo lo suelta hacia abajo | El promedio sube y la mediana se queda igual: pocos pedidos grandes están engañando la lectura |
| Costo de envío absorbido por pedido | Es la columna de costo que el test crea | El costo por pedido crece más rápido que los ingresos incrementales |
| Tasa de devolución | La compra por impulso para alcanzar el umbral vuelve con más frecuencia | La devolución sube en la variación de umbral más alto |
| Mix por región | El costo de envío varía mucho por región, y el mismo umbral tiene economías distintas | La conversión sube en una región y el margen se hunde en otra |
La última fila merece atención especial: un umbral único aplicado a todo el país significa márgenes muy distintos por región, y un test leído solo en el agregado puede aprobar un umbral rentable en una región y destructivo en otra. Declara los segmentos de lectura (región, franja de ticket, nuevo contra recurrente) antes de correr, y trata cualquier corte descubierto después como hipótesis para el próximo test, no como conclusión. Ese es el mismo cuidado que evita la paradoja de Simpson, detallada en los errores que invalidan un test A/B.
Trampas específicas del test de envío gratis
- Cambiar el umbral en medio del test. Parece inofensivo (“solo ajustamos R$ 10”), e invalida todo: los visitantes de las primeras semanas vieron una oferta distinta de los de las últimas, dentro de la misma variación.
- Testear durante una campaña promocional. Black Friday, un cupón agresivo o un envío gratis promocional en paralelo contaminan la comparación, porque el cliente ya está viendo otro ahorro en la pantalla.
- Ignorar a quien ya es recurrente. El cliente recurrente conoce el umbral antiguo y reacciona al cambio de forma distinta a quien llega por primera vez. Si la base recurrente es grande, ese corte necesita estar declarado.
- Leer el resultado solo en la primera semana. El efecto en el ticket medio aparece rápido; el efecto en la recompra y en la devolución aparece semanas después, y es él el que decide si el umbral nuevo se sostiene.
- Confundir comunicación con economía. Testear la barra de progreso del carrito es un test de comunicación, sin costo de margen. Testear el valor del umbral es un test de economía de la oferta. Los dos son válidos, y mezclarlos en la misma variación impide saber cuál de los dos causó el resultado.
Haz esto automático en Donnu
Un test de envío gratis exige tres cosas al mismo tiempo: muestra suficiente para una tasa base baja, lectura por el beneficio por visitante en lugar de por la conversión aislada, y un intervalo de confianza honesto en lugar de un ganador declarado al cuarto día.
Donnu A/B entrega eso en tu sitio: snippet ligero que no retrasa el carrito, dimensionamiento automático de muestra y estadística bayesiana sin inventar certeza. Empieza una prueba gratis de 14 días y descubre tu umbral con datos, en lugar de copiar el número que el competidor eligió por intuición.
Lee también: Optimización de Checkout: el Playbook de Test A/B · Test A/B de Carrito Abandonado · Test A/B de Página de Producto
Referencias
- Baymard Institute. Cart Abandonment Rate Statistics. Promedio de 50 estudios sobre abandono de carrito y distribución de los motivos de abandono, incluyendo el peso de los costos extras. baymard.com/lists/cart-abandonment-rate.
- Baymard Institute. Checkout Usability Research. Base de problemas de usabilidad documentados en investigación de ecommerce a gran escala. baymard.com/research/checkout-usability.
- Kohavi, R., Tang, D. & Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020, sobre métricas de guarda y lectura de métricas con cola larga. Material de apoyo en experimentguide.com.
- Brasil. Código de Defensa del Consumidor (Ley 8.078/1990), artículo 31, sobre la obligación de información clara y correcta sobre precio, lo que incluye las condiciones de la oferta de envío. planalto.gov.br/ccivil_03/leis/l8078compilado.htm.
Preguntas frecuentes
- ¿Cuál es la métrica que decide un test de umbral de envío gratis?
- Beneficio por visitante, y no tasa de conversión. Un umbral más bajo casi siempre convierte mejor y casi siempre entrega menos margen por pedido, porque la tienda pasa a costear el envío de carritos más pequeños. Un umbral más alto suele elevar el ticket medio y hacer caer la conversión. Como las dos métricas van en direcciones opuestas, solo la combinación de ellas con el costo real de envío responde qué valor es mejor para el negocio. Usa conversión y ticket medio como diagnóstico y beneficio por visitante como veredicto.
- ¿Cómo elegir los valores candidatos de umbral para testear?
- Mirando la distribución real de los valores de carrito de tu tienda, no eligiendo números redondos por intuición. Levanta el histograma de valor de pedido de los últimos meses e identifica dónde está la mayor concentración; un umbral colocado justo por encima de una franja densa de carritos es el que tiene más probabilidad de empujar pedidos hacia arriba sin alejar a la mayor parte de la base. Testear 149 contra 199 cuando casi todo carrito cierra por debajo de 120 es quemar semanas de tráfico en una franja donde casi nadie está.
- ¿Cuánto tráfico exige un test de envío gratis?
- Bastante, porque la tasa base de pedido es baja. Con la matemática de este blog, una tienda que convierte 2,5% y quiere detectar una mejora relativa de 10% necesita cerca de 64.199 visitantes por variación. Apuntando a 15% relativo, el requisito baja a cerca de 29.193 por variación, lo que con 30.000 visitas semanales cierra en torno de 14 días. Como el efecto en el ticket medio suele ser mayor y más rápido de detectar que el efecto en la conversión, muchas tiendas leen el ticket antes y aun así necesitan esperar la muestra completa para decidir.
- ¿Envío gratis para todos es una buena idea?
- Depende enteramente del margen y del costo medio de envío, y es justamente por eso que vale testear en lugar de decidir por intuición. El envío gratis sin umbral elimina el principal motivo declarado de abandono y al mismo tiempo elimina el incentivo para que el cliente aumente el carrito, además de hacer que la tienda costee el envío de pedidos pequeños, que suelen ser los de peor margen. Es una hipótesis legítima de test, siempre que entre en el experimento con guarda de margen por pedido, no solo de conversión.
- ¿Puedo usar la calculadora de significancia para comparar ticket medio entre variaciones?
- No directamente. La calculadora de significancia de este blog aplica un test de dos proporciones, hecho para comparar tasas (cuántos de cuántos convirtieron). Ticket medio e ingresos por visitante son promedios de valores continuos, con distribución asimétrica y cola larga, y exigen otro tratamiento estadístico, como un test para promedios o remuestreo. Usa el test de proporción para la conversión y trata la diferencia de ticket con la cautela de quien sabe que pocos pedidos grandes pueden mover el promedio por sí solos.