AB Tasty: Análisis 2026 (Funciones, Precio y Límites)
Análisis de AB Tasty en 2026: funciones, precio, la métrica bayesiana de probabilidad de ganar, la trampa de leer por segmento y para quién tiene sentido.

📚 Este artículo es parte de la guía Herramientas de CRO Comparadas: Guía Neutral (2026).
AB Tasty es una plataforma que trata la experimentación y la personalización como el mismo producto, y es eso lo que define tanto su mejor caso de uso como su principal trampa de lectura. Cubre test A/B, split URL y multivariado con editor visual, personalización por audiencia, feature flag y un motor estadístico bayesiano cuyo indicador principal es la probabilidad de ganar. Este análisis cubre lo que hace bien, lo que se puede afirmar sobre el precio, dónde están las limitaciones reales y, sobre todo, el cuidado estadístico que exige el énfasis en la segmentación. Para el panorama completo de la categoría, mira la comparación neutral de herramientas de test A/B.
Aviso de transparencia antes de cualquier línea: Donnu es una herramienta de test A/B y, por lo tanto, compite con AB Tasty en parte del alcance. Este texto fue escrito para ser útil incluso para quien va a elegir AB Tasty al final, y la sección sobre dónde es claramente la elección correcta está aquí exactamente por eso.
Qué es AB Tasty, en una frase por módulo
| Módulo | Qué hace | A quién suele importarle |
|---|---|---|
| Experimentación web | Test A/B, split URL y multivariado con editor visual | Marketing, sin depender de un deploy |
| Personalización | Reglas de audiencia y entrega de contenido por segmento | Operación con público segmentado y volumen |
| Feature flag y rollout | Activación controlada de funcionalidad vía SDK | Ingeniería y producto |
| Recomendación y mensajes | Bloques dinámicos y comunicación en el sitio | Ecommerce y medios |
| Motor bayesiano | Probabilidad de ganar e intervalo por variación | Quien lee el resultado y decide el rollout |
La elección entre AB Tasty y una herramienta más pequeña raramente es sobre la calidad del test A/B en sí. Es sobre si la personalización es un frente de trabajo de verdad en tu operación, con alguien responsable de él, o si es solo un ítem en la lista de deseos que nadie va a operar. Quien tiene ese frente activo encuentra en la plataforma un encaje natural, porque experimento y personalización comparten la misma definición de audiencia. Quien no lo tiene está comprando una capacidad que va a pagar todos los meses sin usar.
Un contexto que importa para cualquier evaluación hecha en 2026: el 20 de enero de 2026, AB Tasty y VWO anunciaron la fusión de las dos compañías en una única plataforma de optimización de experiencia digital, con Everstone Capital detrás del negocio, según el anuncio conjunto de las dos empresas. La comunicación oficial habla de una entidad combinada con más de 100 millones de dólares de facturación anual y más de 4.000 clientes. Una consolidación de ese tamaño reorganiza paquete, posicionamiento y roadmap sin aviso.
Precio: lo que se puede afirmar con honestidad
Poca cosa, y ese es el hallazgo. AB Tasty no publica valores en la página oficial de precios: la postura es de propuesta personalizada, mediante contacto comercial. Eso es el estándar de la franja corporativa de la categoría, y no una peculiaridad de la empresa, pero tiene un costo real de tiempo en la fase de evaluación y dificulta la comparación con herramientas de precio público.
Las variables que determinan el valor final, en toda la categoría, son cuatro:
- Volumen de visitantes testeados por mes, la base de casi todo contrato.
- Qué módulos entran, ya que experimentación, personalización y feature flag suelen ser líneas diferentes.
- Número de dominios o proyectos cubiertos.
- Duración del compromiso, con descuento por plazo mayor.
Con la fusión en curso, una quinta variable entra en la cuenta: qué pasa con tu paquete cuando los dos catálogos se reorganicen. No es motivo para no contratar, es motivo para preferir plazos más cortos y para pedir, por escrito, la cláusula de exportación de tus datos de experimento. La guía de precios de herramientas de test A/B detalla cómo montar esa comparación.
Probabilidad de ganar: qué afirma el número bayesiano y qué no afirma
El indicador central de la interfaz es la probabilidad de ganar. Según la documentación oficial de AB Tasty, es un índice estadístico que indica las probabilidades de que haya una ganancia estrictamente positiva de una variación respecto a la versión original, expresada en porcentaje, basada en un test bayesiano. La documentación también orienta que una probabilidad de ganar igual o superior al 95% indica que las estadísticas recolectadas son confiables y que la variación puede implementarse con un riesgo considerado bajo.
Eso es una definición clara y bien construida, y resuelve un problema real: la pregunta que hace el gestor (“¿cuál es la probabilidad de que B sea mejor?”) es literalmente la pregunta que responde el método bayesiano, mientras que el valor p responde otra cosa. El riesgo no está en el número, está en la traducción mental que el equipo hace de él.
Dos lecturas equivocadas aparecen con frecuencia:
- “95% de probabilidad de ganar es lo mismo que 95% de confianza.” No lo es. Son preguntas diferentes, con matemática diferente, y los dos números pueden discrepar sobre exactamente los mismos datos. La comparación entre intervalo de credibilidad e intervalo de confianza trata esa diferencia en detalle.
- “Una probabilidad de ganar alta significa una ganancia grande.” Tampoco. Habla sobre la dirección del efecto, no sobre el tamaño de él. Un efecto mínimo, medido con una muestra enorme, produce una probabilidad de ganar altísima e impacto de negocio irrelevante. Por eso la lectura completa necesita el intervalo por variación al lado, nunca el índice solo.
El cuidado que exige la personalización: leer por segmento infla el falso positivo
Aquí está el punto más importante de este análisis, y vale para cualquier herramienta con fuerte énfasis en segmentación, no solo para AB Tasty. Cuando el producto facilita mucho mirar el resultado por audiencia, el equipo naturalmente mira por audiencia. Y mirar el mismo test en varios segmentos multiplica la probabilidad de encontrar un ganador que no existe.
El ejemplo trabajado: un test plano que “gana” en móvil
Un test de página de producto corre hasta 20.000 visitantes por variación. El resultado general:
| Lectura | Visitantes por variación | Conversiones A | Conversiones B | Puntaje z | Valor p | Veredicto |
|---|---|---|---|---|---|---|
| General | 20.000 | 800 (4,00%) | 816 (4,08%) | 0,41 | 0,685 | Inconcluso, efecto indistinguible de cero |
Comprueba esa línea en la calculadora:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
No pasó nada. Entonces alguien abre el informe por segmento y mira seis recortes: móvil, escritorio, tráfico pago, tráfico orgánico, visitante nuevo y visitante recurrente. En el recorte de móvil, con 3.000 visitantes por variación, aparece esto:
| Lectura | Visitantes por variación | Conversiones A | Conversiones B | Lift relativo | Puntaje z | Valor p |
|---|---|---|---|---|---|---|
| Segmento móvil | 3.000 | 90 (3,00%) | 126 (4,20%) | +40,0% | 2,49 | 0,0126 |
Un valor p de 0,0126, bastante por debajo de 0,05, con un lift relativo del 40%. Parece un hallazgo excelente. No lo es, y la razón es aritmética simple.
Cuando haces seis tests independientes al corte del 5% y no existe ningún efecto real, la probabilidad de que al menos uno de ellos dé significativo por azar es 1 menos 0,95 elevado a 6, es decir, aproximadamente 26,5%. En otras palabras: en cerca de una de cada cuatro análisis por segmento como esa, un segmento “gana” sin que haya pasado nada de verdad.
La corrección más simple y más conservadora, la de Bonferroni, divide el corte por el número de comparaciones: 0,05 dividido por 6 es 0,0083. El valor p del segmento móvil fue 0,0126, que es mayor que 0,0083. Es decir, el hallazgo no sobrevive a la corrección. No es un descubrimiento, es el resultado esperado de mirar seis veces.
Por qué no basta con “correr el test solo en el segmento”
La salida aparentemente obvia es: si móvil parece prometedor, corre un test solo para móvil. Es la salida correcta, pero tiene un costo que necesita estar sobre la mesa antes de prometer un plazo.
Dimensionar un test dedicado al segmento móvil, con tasa base del 3% y ambición de detectar una ganancia relativa del 10%, exige 53.211 visitantes por variación. Corre el cálculo:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Con el flujo entero recibiendo 21.000 visitantes por semana, ese test llevaría 36 días. Pero el segmento móvil es solo una porción de él: con cerca de 3.500 visitantes por semana en el recorte, el mismo test llevaría 213 días, casi siete meses ocupando aquel flujo.
| Dónde correrlo | Tráfico semanal disponible | Muestra por variación | Duración |
|---|---|---|---|
| Flujo entero | 21.000 | 53.211 | 36 días |
| Solo en el segmento móvil | 3.500 | 53.211 | 213 días |
Muestra por aproximación normal de dos proporciones, tasa base 3%, MDE relativo del 10%, 95% de confianza, 80% de potencia, bilateral; duración para 2 variaciones.
Esa es la cuenta que casi nunca aparece en la demostración de una herramienta de personalización. Segmentar no es gratis: cada recorte divide la muestra y multiplica el tiempo. Una plataforma que facilita mucho segmentar necesita venir acompañada de disciplina para no transformar cada recorte en una decisión. La guía de errores comunes en test A/B trata esa familia de problemas con más profundidad.
Análisis de AB Tasty: puntos fuertes reales
- Experimentación y personalización en la misma definición de audiencia. Quien opera los dos frentes de verdad evita mantener dos catálogos de segmento en herramientas diferentes, que es una fuente clásica de divergencia de números.
- Editor visual maduro. Años de iteración en un editor que sobrevive a sitios reales, lo que no es trivial. Marketing consigue montar una variación sin depender de un deploy.
- Estadística explicitada y documentada. La documentación pública define qué significa la probabilidad de ganar y cómo interpretarla, en lugar de esconder la estadística detrás de un sello de ganador.
- Cobertura de casos avanzados. Multivariado, feature flag, recomendación y mensajes en el sitio existen en el portafolio, lo que evita cambiar de herramienta cuando el programa madura.
Limitaciones y puntos de atención
- Precio opaco por diseño. Sin valores publicados, evaluar exige una conversación comercial, lo que es un costo de tiempo real y dificulta la comparación directa.
- La segmentación invita al falso positivo. No es un defecto del producto, es consecuencia de lo que él facilita: sin una regla interna sobre cuántos segmentos pueden mirarse y qué hacer con un hallazgo, el equipo decide sobre ruido con frecuencia.
- Complejidad proporcional a la amplitud. Una plataforma con experimentación y personalización exige a alguien que la domine. Sin dueño claro, la parte de personalización suele quedar parada.
- Contrato en un mercado en consolidación. Con la fusión anunciada en enero de 2026, los plazos largos merecen más atención que lo normal, y mantener los datos de experimento exportables pasa a ser una exigencia práctica.
Cómo evaluar AB Tasty en un piloto, sin perder tiempo
| Chequeo | Cómo hacerlo | Qué revela |
|---|---|---|
| División real de tráfico | Correr un test A/A por algunos días y comprobar la proporción | Si la división es estable y sin desvío de muestra |
| Disciplina de segmento | Definir antes qué segmentos se mirarán y registrarlo por escrito | Si el equipo consigue no decidir sobre ruido |
| Lectura estadística | Comparar la probabilidad de ganar con el cálculo frecuentista de los mismos datos | Si el equipo entiende que los dos responden preguntas diferentes |
| Efecto en el desempeño | Medir la página con y sin el script, mismo dispositivo y red | Cuánto cuesta el test en nota de performance |
| Exportación | Pedir el dato bruto del experimento en formato abierto | Si consigues salir, y con qué en la mano |
La segunda línea es la que más importa en esta herramienta específicamente, y es un chequeo de proceso, no de producto. Escribe antes del test qué segmentos serán analizados y qué pasa si uno de ellos gana aislado. La respuesta honesta casi siempre es “se convierte en hipótesis para un test dedicado”, nunca “se implementa directo”.
El test A/A de la primera línea merece un comentario aparte: las dos variaciones son idénticas, así que cualquier “ganador” que aparezca es ruido por definición. Es la forma más barata de auditar una herramienta nueva, y vale correrlo en cualquier herramienta que estés evaluando, incluida la nuestra.
Para quién tiene sentido AB Tasty
Tiene sentido para una operación de mediano o gran porte en la que la personalización por audiencia es un frente de trabajo real, con dueño definido y tráfico suficiente para segmentar sin perder potencia estadística, y para equipos que quieren experimento y personalización compartiendo la misma base de audiencia.
Tiene menos sentido para una operación pequeña que necesita solo test A/B en páginas web, para quien quiere precio público y autoservicio sin llamada, y para equipos cuyo tráfico por segmento todavía no sostiene una lectura segmentada, escenario en el que vale volver a lo básico de la guía completa de optimización de conversión antes de comprar segmentación.
Si tu caso es el segundo, Donnu es una de las opciones más ligeras de la categoría, con precio previsible y sin llamada para descubrir el valor, enfocada en test A/B en web con estadística honesta. No sustituye a AB Tasty en personalización por audiencia, recomendación, mensajes en el sitio ni feature flag por SDK, y decir lo contrario sería deshonesto: si necesitas esas piezas, la comparación correcta no es con Donnu. Si no las necesitas, empieza una prueba gratis y compara lo que de hecho importa para tu caso.
Lee también: VWO: análisis completo 2026 · Herramientas de test A/B comparadas · Intervalo de credibilidad vs intervalo de confianza · Errores comunes en test A/B · Leia em português
Referencias
- AB Tasty. Statistics for the reporting. Documentación oficial sobre el motor estadístico y los indicadores del informe. docs.abtasty.com.
- AB Tasty. Statistical metrics. Definición oficial del índice de probabilidad de ganar y de la orientación de lectura a partir del 95%. docs.abtasty.com.
- AB Tasty y VWO. VWO and AB Tasty Join Forces to Redefine the Future of Digital Experience Optimization. Anuncio conjunto de la fusión, 20 de enero de 2026. abtasty.com/news/vwo-ab-tasty-join-forces.
- GlobeNewswire. VWO and AB Tasty Join Forces to Redefine the Future of Digital Experience Optimization. Comunicado oficial distribuido el 20 de enero de 2026, con los números de la entidad combinada. globenewswire.com.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Capítulos sobre análisis por segmento y comparaciones múltiples. Material de apoyo en experimentguide.com.
- Gelman, A. et al. Bayesian Data Analysis, 3ª edición. Referencia para el modelo Beta-Binomial y para la lectura de probabilidades posteriores. sites.stat.columbia.edu/gelman/book.
Preguntas frecuentes
- ¿Cuánto cuesta AB Tasty en 2026?
- La empresa no publica una tabla de precios en su página oficial: la postura es de propuesta personalizada mediante cotización, el mismo estándar de la mayor parte de las plataformas de porte corporativo de esta categoría. En la práctica, el valor depende del volumen de visitantes testeados por mes, de qué módulos entran (experimentación, personalización, feature flag), del número de dominios y de la duración del compromiso. Pide la cotización separada por franja de tráfico y por módulo, y pide por escrito qué pasa si el tráfico supera la franja a mitad de contrato.
- ¿Qué es la "probabilidad de ganar" de AB Tasty y cómo se lee ese número?
- Según la documentación oficial de AB Tasty, la probabilidad de ganar es un índice estadístico que indica la probabilidad de que haya una ganancia estrictamente positiva de una variación respecto a la original, expresada en porcentaje, y se basa en un test bayesiano. La propia documentación sugiere que una probabilidad de ganar igual o superior al 95% indica riesgo bajo para implementar la variación. Es un número legítimo y bien definido, pero responde a una pregunta distinta de la que responde un valor p, así que no trates a los dos como sinónimos.
- ¿Una probabilidad de ganar del 95% es lo mismo que un 95% de confianza estadística?
- No. La probabilidad de ganar responde "dado lo que observé, cuál es la probabilidad de que la variación sea mejor que el control". El intervalo de confianza frecuentista responde a una pregunta sobre la frecuencia de acierto del procedimiento en repeticiones hipotéticas del experimento. Los dos números pueden discrepar sobre exactamente los mismos datos, y confundir uno con el otro es el error de lectura más común de quien migra entre herramientas con motores estadísticos diferentes.
- ¿La fusión con VWO cambia algo para quien usa AB Tasty?
- El 20 de enero de 2026, AB Tasty y VWO anunciaron la fusión en una única plataforma de optimización de experiencia digital, con Everstone Capital detrás del negocio, según el anuncio conjunto de las dos empresas. La comunicación oficial habla de una entidad con más de 100 millones de dólares de facturación anual y más de 4.000 clientes. Para quien ya la usa, el efecto inmediato tiende a ser pequeño, pero una consolidación de ese tipo suele reorganizar paquetes, posicionamiento y roadmap con el tiempo, lo que es un argumento a favor de contratos más cortos y de mantener los datos de experimento exportables.
- ¿Se puede confiar en un resultado que solo apareció en un segmento del test?
- Con mucho cuidado, y casi nunca como decisión aislada. Cuando miras el mismo test en seis segmentos, la probabilidad de que al menos uno de ellos cruce el corte del 5% por azar sube a cerca del 26,5%, incluso cuando no existe ninguna diferencia real. La forma honesta de tratar un hallazgo de segmento es registrarlo como una hipótesis nueva y correr un test dedicado, con muestra dimensionada para ese segmento, en lugar de implementarlo directamente.
- ¿Para quién tiene sentido AB Tasty y para quién no?
- Tiene sentido para operaciones de mediano y gran porte en las que la personalización por audiencia es un frente de trabajo de verdad, con equipo dedicado y tráfico suficiente para segmentar sin perder potencia estadística, y para quien quiere experimentación y personalización en la misma plataforma. Tiene menos sentido para una operación pequeña que solo necesita test A/B en páginas web, para quien quiere precio público y autoservicio de principio a fin, y para equipos que todavía no tienen volumen para sostener lecturas por segmento.