Multi-Armed Bandits para Asuntos de Email
Multi-armed bandits en asuntos de email: la auto-optimización es un bandit simple, no un test A/B riguroso. Mira la matemática de la muestra.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
La mayoría de los email marketers ya corrieron un multi-armed bandit sin saberlo. Mailchimp, HubSpot, Klaviyo y ActiveCampaign traen todas una función de “auto-optimización” o “selección de ganador” para el asunto: envían dos o tres asuntos a una porción de la lista, esperan unas horas, y luego lanzan el que se ve mejor a todos los demás. Ese es un patrón de bandit real, el más simple de la familia, llamado explore-then-commit. No es el mismo rigor que un test A/B completo, y la brecha importa más exactamente cuando la decisión es cara: una muestra inicial chica, una ventana de evaluación corta y una única métrica ruidosa (la tasa de apertura) se interponen entre “la herramienta declaró un ganador” y “el ganador es real.”
Esta guía explica, con fuentes para cada afirmación específica de proveedor, qué hacen realmente estas funciones de auto-optimización por debajo, por qué el tamaño de muestra que usan suele alcanzar solo para detectar una diferencia enorme en vez de una realista, cuándo ese trade-off es la decisión correcta específicamente para email, y cuándo deberías insistir en un test más largo, basado en clics o en conversión, en su lugar.
Qué hace realmente tu herramienta de email cuando “auto-optimiza” un asunto
Quita el lenguaje de marketing y el mecanismo es el mismo entre proveedores: divide una porción de la lista entre dos o tres asuntos, mide una única métrica durante una ventana fija, y luego envía el que “ganó” al resto de la lista. Las diferencias están en los detalles, y los detalles son exactamente lo que decide si el ganador que eligió es confiable.
- Mailchimp te deja probar hasta tres variaciones de una sola variable (asunto, nombre del remitente, contenido o hora de envío), según su documentación sobre tests A/B. Su guía para crear un test A/B establece que Mailchimp requiere “enviar al menos al 10% de tus destinatarios para cualquier tipo de test A/B, así que el control deslizante no baja de 10%,” recomienda al menos 5.000 destinatarios por combinación “para obtener los datos más útiles,” y sugiere esperar al menos cuatro horas después del envío antes de que salga la combinación ganadora. El ganador puede elegirse automáticamente por tasa de apertura, tasa de clics o ingreso total, o elegirse a mano.
- HubSpot te deja fijar tu propio porcentaje de test y tu propia ventana de espera en horas antes de que el resto de la lista reciba la versión ganadora, según su documentación de cómo correr un test A/B en un email de marketing. HubSpot recomienda enviar un email con test A/B a al menos 1.000 contactos; se permite una división 50/50 con cualquier tamaño de lista, pero otras proporciones de división necesitan ese mínimo de 1.000 contactos, y si la lista de envío final es demasiado chica, HubSpot se salta el test por completo y envía solo la versión única que elegiste a mano a todos. La selección del ganador puede usar tasa de apertura, tasa de clics o tasa de clic a través (click-through rate).
- Klaviyo usa un control deslizante ajustable (su propia guía de test A/B de campaña muestra un ejemplo de 20 por ciento a la variación A y 20 por ciento a la variación B, con el 60 por ciento restante reservado para el ganador) y, notablemente, ofrece una opción automática condicionada a una probabilidad de victoria declarada del 90 por ciento o más, no solo el número crudo más alto, según su documentación de significancia estadística en campañas. Klaviyo recomienda la tasa de apertura específicamente “al testear asunto, texto de vista previa o nombre del remitente,” y la tasa de clics para cambios de contenido.
- ActiveCampaign funciona de la misma manera: asignas un porcentaje a cada variante de asunto, eliges tasa de apertura o tasa de clics como métrica decisiva, y eliges el número de horas antes de que el porcentaje restante reciba el ganador, según su guía de campaña de split test de email.
| ESP | Muestra usada para el test | Métrica que decide el ganador | Espera antes de que el resto de la lista lo reciba |
|---|---|---|---|
| Mailchimp | Control deslizante desde 10 por ciento hacia arriba, entre hasta 3 variaciones; recomienda 5.000+ destinatarios por combinación | Tasa de apertura, tasa de clics o ingreso total (si hay una tienda conectada) | Elegido por el usuario; el proveedor recomienda al menos 4 horas |
| HubSpot | Porcentaje elegido por el usuario; se permite una división 50/50 con cualquier tamaño, otras divisiones necesitan 1.000+ contactos, por debajo de eso HubSpot se salta el test y envía solo la versión elegida a mano | Tasa de apertura, tasa de clics o tasa de clic a través | Número de horas elegido por el usuario |
| Klaviyo | Control deslizante ajustable (ejemplo dado: 20% y 20%, 60% reservado) | Tasa de apertura (recomendada para asunto), tasa de clics o tasa de pedido realizado; el modo automático requiere 90%+ de probabilidad de victoria | Automático una vez que se cumple el umbral, o anulación manual |
| ActiveCampaign | Porcentaje asignado por el usuario por variante | Tasa de apertura o tasa de clics | Número de horas elegido por el usuario |
Cada una de estas es, estadísticamente, alguna variante de explore-then-commit: gastar una fase de exploración corta juntando datos entre todos los brazos, y luego comprometer irrevocablemente todo el tráfico restante al brazo que se vio mejor. Es el miembro más simple de la familia de multi-armed bandits, más simple incluso que epsilon-greedy, y mucho más simple que el muestreo de Thompson, que sigue sorteando de la distribución de creencia de cada brazo y desplaza gradualmente la asignación en vez de accionar un único interruptor cuando se agota un reloj fijo. La condición de probabilidad de victoria de Klaviyo es el único detalle de proveedor aquí que toma prestado directamente de la lógica de bandit bayesiano; el resto elige el número crudo que sea más grande una vez que expira el temporizador, sin ningún chequeo de significancia.
La línea de tiempo que nadie te muestra en la captura de pantalla del producto
La línea de tiempo comprimida no es un accidente ni un atajo que alguien olvidó arreglar, es el punto entero de la función. El email decae rápido: la mayoría de las aperturas ocurren en las primeras horas, y al día siguiente la audiencia ya decidió en su mayor parte si va a interactuar o no. Esperar dos semanas por un veredicto formalmente significativo, como recomienda la guía de bandits versus test A/B de este blog para un test de página web, significaría que el newsletter ya está desactualizado antes de que el “ganador” siquiera llegue a la mayor parte de la lista. La velocidad es una restricción legítima acá de una manera que usualmente no lo es para una landing page. La pregunta no es si el atajo se justifica, claramente se justifica para muchos envíos rutinarios, sino si los marketers entienden qué están sacrificando cuando lo toman.
Por qué la tasa de apertura es una señal más débil de lo que solía ser
Los tests de asunto se juzgan por tasa de apertura casi en todas partes, por una razón sólida: un asunto solo cambia una cosa, si alguien abre el email o no, así que la tasa de apertura es la métrica más cercana a la manipulación real. El problema es que la tasa de apertura en sí se volvió más ruidosa desde que Apple lanzó la Mail Privacy Protection en 2021. Los servidores proxy de Apple precargan el píxel de rastreo en la propia infraestructura de la empresa en el momento en que llega el email, antes de que un humano siquiera lo mire, lo que se registra como una “apertura” haya leído algo el destinatario o no. Mailchimp aborda esto directamente en sus propias preguntas frecuentes sobre la Mail Privacy Protection de Apple, y Litmus, que rastrea la participación de mercado de clientes de email a partir de más de mil millones de aperturas medidas, reporta que la participación de Apple Mail ahora cubre más de la mitad de todas las aperturas a nivel de industria, lo que significa que una fracción grande y creciente de la métrica “ganadora” de cada test de asunto no es en absoluto una señal humana genuina.
Nada de esto vuelve inútil a la tasa de apertura. Para un asunto específicamente, sigue siendo la métrica que aísla la variable que cambiaste. Pero significa que un “ganador” de asunto declarado por tasa de apertura carga una capa extra de ruido encima del ruido de muestreo normal de un grupo de test chico, y es una razón más por la que una diferencia porcentual cruda en un reloj corto merece más escrutinio del que implica el visto verde del dashboard.
Un ejemplo trabajado: cuando la muestra es demasiado chica para saber algo
Acá es donde la teoría se convierte en aritmética, usando el mismo motor estadístico (sampleSizePerVariant y el test z de dos proporciones subyacente en stats.ts) que corre cada calculadora de este blog.
El escenario: una lista de 20.000 suscriptores, un asunto con una tasa de apertura base del 20 por ciento, y una variación B que, en realidad, aunque el marketer no tiene manera de saberlo de antemano, abre al 23 por ciento, una mejora relativa genuina del 15 por ciento. Siguiendo el default típico de un ESP, el test de auto-optimización se envía al 10 por ciento de la lista, 2.000 suscriptores, divididos parejo: 1.000 ven el asunto A, 1.000 ven el asunto B. Los 18.000 restantes recibirán el que se vea mejor.
Aperturas esperadas en el grupo de test: A obtiene aproximadamente 1.000 por 20 por ciento, unas 200 aperturas. B obtiene aproximadamente 1.000 por 23 por ciento, unas 230 aperturas. Corriendo el test z de dos proporciones sobre esos números:
- Tasa combinada (pooled): (200 + 230) dividido entre 2.000 es igual a 21,5 por ciento.
- Error estándar: la raíz cuadrada de 0,215 por 0,785 por (1/1.000 + 1/1.000), aproximadamente 0,0184.
- Z-score: (0,23 menos 0,20) dividido entre 0,0184, aproximadamente 1,63.
- Valor p bilateral: aproximadamente 0,10.
Un valor p de 0,10 está bien por encima del umbral convencional de 0,05. El test no es estadísticamente significativo, aunque la mejora subyacente sea completamente real. La mayoría de los ESP no chequean esto: comparan las dos tasas de apertura crudas cuando se agota el reloj y envían el número que sea más grande, en este caso B, sin nunca calcular si 230 de 1.000 es significativamente distinto de 200 de 1.000. El modo automático de Klaviyo es la excepción, dado que su condición de probabilidad de victoria del 90 por ciento muy probablemente retendría este resultado exacto de un envío automático.
Entonces, ¿qué muestra habría alcanzado realmente? Ingresa los mismos números en la calculadora de abajo (base 20 por ciento, efecto mínimo detectable 15 por ciento relativo, 95 por ciento de confianza, 80 por ciento de poder, el rigor estándar del mercado que la guía de bandits versus test A/B de este blog usa en todos lados) y revisa el tamaño de muestra que devuelve:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
La fórmula devuelve 2.943 suscriptores por variante, 5.886 en total, casi el triple de los 2.000 que el test de auto-optimización realmente usó. Ignora la cantidad de días estimada que también muestra la calculadora, asume tráfico continuo semana tras semana como el de un sitio web, y un envío de email es un envío único en vez de tráfico que se acumula durante días; la cantidad de suscriptores es el número que importa acá.
Se vuelve más revelador desde la otra dirección. Con solo 1.000 suscriptores por variante, la mejora mínima que este test podría detectar de forma confiable con 95 por ciento de confianza y 80 por ciento de poder resulta ser aproximadamente 25 por ciento relativo, cerca de 5 puntos porcentuales sobre una base del 20 por ciento, usando la misma fórmula corrida al revés (mdeForSample en stats.ts). En términos simples: el test rápido del ESP nunca estuvo construido para detectar una mejora realista del 15 por ciento. Solo tenía el poder suficiente para detectar algo cercano a un cambio del 25 por ciento o mayor.
Nada de esto significa que el número del ESP esté mal o sea deshonesto, B genuinamente convirtió mejor en este escenario, y enviarlo al resto de la lista fue, según los números crudos, la mejor apuesta. Lo que significa es que la herramienta no puede decirte, y en su mayoría ni siquiera intenta decirte, si esa mejora del 15 por ciento es algo con lo que puedes contar la próxima vez, versus una moneda al aire que resultó caer del lado que también coincide con la verdad. Esa distinción es invisible desde adentro del dashboard.
Cuándo el atajo es un trade-off razonable, y cuándo insistir en un test real
Ningún enfoque es universalmente correcto. La pregunta es qué necesita un envío específico.
| Situación | La auto-optimización es un trade-off razonable | Insiste en un test A/B completo basado en clics o conversión |
|---|---|---|
| Tamaño de lista | Lista grande (decenas de miles o más), donde incluso un pequeño porcentaje sigue siendo una muestra real | Lista chica, donde incluso una división del 100 por ciento apenas llega a unos pocos cientos de destinatarios por lado |
| Qué está en juego con el envío | Newsletter rutinario, riesgo bajo si el asunto “equivocado” llega a la mayor parte de la lista | Campaña de alto riesgo: un lanzamiento, un empuje de renovación, un cambio de precio, una secuencia de recuperación |
| Métrica que importa | La tasa de apertura genuinamente es el objetivo, recordación de marca o re-interacción | Un clic, un registro o una compra es el objetivo real, y la tasa de apertura es solo un proxy aproximado |
| Qué tan rápido tiene que salir el envío | Contenido sensible al tiempo (noticias de último momento, una oferta flash) donde la velocidad gana a la certeza | Puedes correr el envío durante días y necesitas una respuesta que resista el escrutinio |
| Necesidad de defender la decisión después | Nadie va a pedir jamás el valor p | El resultado se reporta, se repite entre campañas, o se cita para justificar una inversión mayor |
El email es uno de los pocos canales donde “suficientemente bueno, rápido” es frecuentemente el trade-off de ingeniería correcto, porque las aperturas y los clics decaen en horas y un asunto rara vez carga el tipo de riesgo posterior que sí carga un rediseño de checkout. Pero en el momento en que un envío es caro de equivocar, ya sea porque la lista es chica, la métrica es el ingreso en vez de las aperturas, o el resultado se va a citar en una presentación de directorio, la movida honesta es correr el envío como un test A/B real, más largo, basado en clics o en conversión, dimensionado de la forma en que lo dimensiona la calculadora de arriba, no confiar en una muestra del tamaño de una moneda al aire solo porque el dashboard reportó un ganador en seis horas.
Hazlo Automático con Donnu
Las herramientas de auto-optimización de asunto resuelven para velocidad, no para certeza, y ese trade-off es invisible a menos que hagas la aritmética tú mismo, como acaba de hacer el ejemplo trabajado de arriba. Donnu corre sobre un motor bayesiano nativo, construido para la prioridad opuesta: una lectura honesta de si una mejora es real, no solo cuál número crudo resultó ser más grande después de que se agotó un reloj corto. Cuando un asunto, un email, o cualquier variación de página merece defenderse con una respuesta real en vez de una conjetura rápida, dimensiona el test correctamente primero con la calculadora de esta página, y luego córrelo el tiempo suficiente, sobre la métrica que realmente importa, para saber la diferencia entre una muestra con suerte y una mejora genuina.
Lee el panorama completo en Multi-Armed Bandits vs Test A/B y mira la mecánica detrás de la asignación adaptativa en Muestreo de Thompson Explicado. Empieza una prueba gratis de 14 días y dimensiona tu próximo test sobre una estadística que resiste el escrutinio, no solo un número crudo después de unas horas.
Referencias
- Mailchimp. About A/B Tests. mailchimp.com/help/about-ab-tests; Create an A/B Test. mailchimp.com/help/create-ab-tests.
- HubSpot. Run A/B tests for marketing emails. knowledge.hubspot.com.
- Klaviyo. How to A/B test an email campaign. help.klaviyo.com; Understanding statistical significance in Klaviyo campaigns. help.klaviyo.com.
- ActiveCampaign. How to create a Split Test email campaign. help.activecampaign.com.
- Mailchimp. Apple Mail Privacy Protection (MPP) FAQs. mailchimp.com/help/apple-privacy-faq.
- Litmus. Email Client Market Share: Trends and Statistics. litmus.com/email-client-market-share.
Preguntas frecuentes
- ¿La función de "auto-optimización" de asunto de mi herramienta de email es en realidad un multi-armed bandit?
- Funcionalmente, sí, aunque uno simple. La mayoría de los proveedores de servicio de email envían dos o tres asuntos a una porción pequeña de la lista, esperan unas horas y luego lanzan el que se ve mejor por tasa de apertura a todos los demás. Ese es un patrón de dos fases llamado explore-then-commit (explorar y luego comprometerse), el miembro más simple de la familia de bandits. No es lo mismo que un bandit adaptativo como el muestreo de Thompson, que sigue desplazando tráfico gradualmente conforme se acumula evidencia en vez de hacer un único cambio irreversible.
- ¿Una porción de test del 10 por ciento alcanza para confiar en un "ganador" de asunto de email?
- Generalmente no, para una mejora realista y moderada. Como muestra el ejemplo trabajado en esta página, un test con 1.000 destinatarios por variación solo puede detectar de forma confiable un cambio grande en la tasa de apertura, del orden de un 25 por ciento relativo o más, con la confianza del 95 por ciento y el poder del 80 por ciento estándar. Una mejora genuina pero más modesta, como un 15 por ciento, seguido no va a alcanzar significancia estadística en esa muestra, aunque sea real.
- ¿Por qué las herramientas de email usan la tasa de apertura en vez de la tasa de clics para juzgar un test de asunto?
- Porque un asunto solo influye en una decisión: si el destinatario abre el email o no, así que la tasa de apertura es la métrica más cercana a lo que cambió. La contrapartida es que la tasa de apertura se volvió una señal ruidosa desde que Apple introdujo la Mail Privacy Protection, que precarga los píxeles de rastreo en los servidores de la propia empresa e infla las aperturas sin importar si un humano leyó el email. Litmus reporta que más de la mitad de todas las aperturas de email ahora ocurren en un dispositivo cubierto por Apple MPP.
- ¿Cuándo debería saltarme la auto-optimización y correr un test A/B completo basado en clics o conversión en un email en su lugar?
- Insiste en un test real cuando el envío es de alto riesgo (un lanzamiento, un empuje de renovación, un cambio de precio), cuando tu lista es lo bastante chica como para que incluso una división del 100 por ciento apenas llegue a unos pocos cientos de destinatarios por lado, o cuando la métrica que realmente importa es un clic, un registro o una compra en vez de una apertura. La auto-optimización es un trade-off razonable para envíos rutinarios de lista grande donde la velocidad importa más que un veredicto defendible.