Herramientas

AB Tasty: Análisis 2026 (Funciones, Precio y Límites)

Análisis de AB Tasty en 2026: funciones, precio, la métrica bayesiana de probabilidad de ganar, la trampa de leer por segmento y para quién tiene sentido.

Ilustración plana de una lupa sobre una ventana dividida en pequeños bloques de audiencia en cuadrícula, con uno de los bloques destacado

AB Tasty es una plataforma que trata la experimentación y la personalización como el mismo producto, y es eso lo que define tanto su mejor caso de uso como su principal trampa de lectura. Cubre test A/B, split URL y multivariado con editor visual, personalización por audiencia, feature flag y un motor estadístico bayesiano cuyo indicador principal es la probabilidad de ganar. Este análisis cubre lo que hace bien, lo que se puede afirmar sobre el precio, dónde están las limitaciones reales y, sobre todo, el cuidado estadístico que exige el énfasis en la segmentación. Para el panorama completo de la categoría, mira la comparación neutral de herramientas de test A/B.

Aviso de transparencia antes de cualquier línea: Donnu es una herramienta de test A/B y, por lo tanto, compite con AB Tasty en parte del alcance. Este texto fue escrito para ser útil incluso para quien va a elegir AB Tasty al final, y la sección sobre dónde es claramente la elección correcta está aquí exactamente por eso.

Qué es AB Tasty, en una frase por módulo

Módulo Qué hace A quién suele importarle
Experimentación web Test A/B, split URL y multivariado con editor visual Marketing, sin depender de un deploy
Personalización Reglas de audiencia y entrega de contenido por segmento Operación con público segmentado y volumen
Feature flag y rollout Activación controlada de funcionalidad vía SDK Ingeniería y producto
Recomendación y mensajes Bloques dinámicos y comunicación en el sitio Ecommerce y medios
Motor bayesiano Probabilidad de ganar e intervalo por variación Quien lee el resultado y decide el rollout

La elección entre AB Tasty y una herramienta más pequeña raramente es sobre la calidad del test A/B en sí. Es sobre si la personalización es un frente de trabajo de verdad en tu operación, con alguien responsable de él, o si es solo un ítem en la lista de deseos que nadie va a operar. Quien tiene ese frente activo encuentra en la plataforma un encaje natural, porque experimento y personalización comparten la misma definición de audiencia. Quien no lo tiene está comprando una capacidad que va a pagar todos los meses sin usar.

Un contexto que importa para cualquier evaluación hecha en 2026: el 20 de enero de 2026, AB Tasty y VWO anunciaron la fusión de las dos compañías en una única plataforma de optimización de experiencia digital, con Everstone Capital detrás del negocio, según el anuncio conjunto de las dos empresas. La comunicación oficial habla de una entidad combinada con más de 100 millones de dólares de facturación anual y más de 4.000 clientes. Una consolidación de ese tamaño reorganiza paquete, posicionamiento y roadmap sin aviso.

Precio: lo que se puede afirmar con honestidad

Poca cosa, y ese es el hallazgo. AB Tasty no publica valores en la página oficial de precios: la postura es de propuesta personalizada, mediante contacto comercial. Eso es el estándar de la franja corporativa de la categoría, y no una peculiaridad de la empresa, pero tiene un costo real de tiempo en la fase de evaluación y dificulta la comparación con herramientas de precio público.

Las variables que determinan el valor final, en toda la categoría, son cuatro:

Con la fusión en curso, una quinta variable entra en la cuenta: qué pasa con tu paquete cuando los dos catálogos se reorganicen. No es motivo para no contratar, es motivo para preferir plazos más cortos y para pedir, por escrito, la cláusula de exportación de tus datos de experimento. La guía de precios de herramientas de test A/B detalla cómo montar esa comparación.

Probabilidad de ganar: qué afirma el número bayesiano y qué no afirma

El indicador central de la interfaz es la probabilidad de ganar. Según la documentación oficial de AB Tasty, es un índice estadístico que indica las probabilidades de que haya una ganancia estrictamente positiva de una variación respecto a la versión original, expresada en porcentaje, basada en un test bayesiano. La documentación también orienta que una probabilidad de ganar igual o superior al 95% indica que las estadísticas recolectadas son confiables y que la variación puede implementarse con un riesgo considerado bajo.

Eso es una definición clara y bien construida, y resuelve un problema real: la pregunta que hace el gestor (“¿cuál es la probabilidad de que B sea mejor?”) es literalmente la pregunta que responde el método bayesiano, mientras que el valor p responde otra cosa. El riesgo no está en el número, está en la traducción mental que el equipo hace de él.

Dos lecturas equivocadas aparecen con frecuencia:

  1. “95% de probabilidad de ganar es lo mismo que 95% de confianza.” No lo es. Son preguntas diferentes, con matemática diferente, y los dos números pueden discrepar sobre exactamente los mismos datos. La comparación entre intervalo de credibilidad e intervalo de confianza trata esa diferencia en detalle.
  2. “Una probabilidad de ganar alta significa una ganancia grande.” Tampoco. Habla sobre la dirección del efecto, no sobre el tamaño de él. Un efecto mínimo, medido con una muestra enorme, produce una probabilidad de ganar altísima e impacto de negocio irrelevante. Por eso la lectura completa necesita el intervalo por variación al lado, nunca el índice solo.

El cuidado que exige la personalización: leer por segmento infla el falso positivo

Aquí está el punto más importante de este análisis, y vale para cualquier herramienta con fuerte énfasis en segmentación, no solo para AB Tasty. Cuando el producto facilita mucho mirar el resultado por audiencia, el equipo naturalmente mira por audiencia. Y mirar el mismo test en varios segmentos multiplica la probabilidad de encontrar un ganador que no existe.

El ejemplo trabajado: un test plano que “gana” en móvil

Un test de página de producto corre hasta 20.000 visitantes por variación. El resultado general:

Lectura Visitantes por variación Conversiones A Conversiones B Puntaje z Valor p Veredicto
General 20.000 800 (4,00%) 816 (4,08%) 0,41 0,685 Inconcluso, efecto indistinguible de cero

Comprueba esa línea en la calculadora:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

No pasó nada. Entonces alguien abre el informe por segmento y mira seis recortes: móvil, escritorio, tráfico pago, tráfico orgánico, visitante nuevo y visitante recurrente. En el recorte de móvil, con 3.000 visitantes por variación, aparece esto:

Lectura Visitantes por variación Conversiones A Conversiones B Lift relativo Puntaje z Valor p
Segmento móvil 3.000 90 (3,00%) 126 (4,20%) +40,0% 2,49 0,0126

Un valor p de 0,0126, bastante por debajo de 0,05, con un lift relativo del 40%. Parece un hallazgo excelente. No lo es, y la razón es aritmética simple.

Cuando haces seis tests independientes al corte del 5% y no existe ningún efecto real, la probabilidad de que al menos uno de ellos dé significativo por azar es 1 menos 0,95 elevado a 6, es decir, aproximadamente 26,5%. En otras palabras: en cerca de una de cada cuatro análisis por segmento como esa, un segmento “gana” sin que haya pasado nada de verdad.

La corrección más simple y más conservadora, la de Bonferroni, divide el corte por el número de comparaciones: 0,05 dividido por 6 es 0,0083. El valor p del segmento móvil fue 0,0126, que es mayor que 0,0083. Es decir, el hallazgo no sobrevive a la corrección. No es un descubrimiento, es el resultado esperado de mirar seis veces.

Probabilidad de al menos un falso positivo según el número de segmentos analizadosCon un segmento al corte del cinco por ciento, la probabilidad de un falso positivo es del cinco por ciento. Con dos segmentos sube al nueve coma ocho por ciento, con tres al catorce coma tres, con cuatro al dieciocho coma cinco, con cinco al veintidós coma seis y con seis segmentos llega al veintiséis coma cinco por ciento, incluso cuando no existe ninguna diferencia real.probabilidad de al menos un “ganador” falso5,0%19,8%214,3%318,5%422,6%526,5%6Número de segmentos analizados en el mismo test, al corte nominal del 5% en cada unoCuenta: 1 menos 0,95 elevado al número de comparaciones, asumiendo comparaciones independientes y efecto real cero.
El corte del 5% vale para una comparación. Cada segmento adicional es una oportunidad más de sortear un ganador inexistente, y el efecto se acumula rápido.

Por qué no basta con “correr el test solo en el segmento”

La salida aparentemente obvia es: si móvil parece prometedor, corre un test solo para móvil. Es la salida correcta, pero tiene un costo que necesita estar sobre la mesa antes de prometer un plazo.

Dimensionar un test dedicado al segmento móvil, con tasa base del 3% y ambición de detectar una ganancia relativa del 10%, exige 53.211 visitantes por variación. Corre el cálculo:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Con el flujo entero recibiendo 21.000 visitantes por semana, ese test llevaría 36 días. Pero el segmento móvil es solo una porción de él: con cerca de 3.500 visitantes por semana en el recorte, el mismo test llevaría 213 días, casi siete meses ocupando aquel flujo.

Dónde correrlo Tráfico semanal disponible Muestra por variación Duración
Flujo entero 21.000 53.211 36 días
Solo en el segmento móvil 3.500 53.211 213 días

Muestra por aproximación normal de dos proporciones, tasa base 3%, MDE relativo del 10%, 95% de confianza, 80% de potencia, bilateral; duración para 2 variaciones.

Esa es la cuenta que casi nunca aparece en la demostración de una herramienta de personalización. Segmentar no es gratis: cada recorte divide la muestra y multiplica el tiempo. Una plataforma que facilita mucho segmentar necesita venir acompañada de disciplina para no transformar cada recorte en una decisión. La guía de errores comunes en test A/B trata esa familia de problemas con más profundidad.

Análisis de AB Tasty: puntos fuertes reales

Limitaciones y puntos de atención

Cómo evaluar AB Tasty en un piloto, sin perder tiempo

Chequeo Cómo hacerlo Qué revela
División real de tráfico Correr un test A/A por algunos días y comprobar la proporción Si la división es estable y sin desvío de muestra
Disciplina de segmento Definir antes qué segmentos se mirarán y registrarlo por escrito Si el equipo consigue no decidir sobre ruido
Lectura estadística Comparar la probabilidad de ganar con el cálculo frecuentista de los mismos datos Si el equipo entiende que los dos responden preguntas diferentes
Efecto en el desempeño Medir la página con y sin el script, mismo dispositivo y red Cuánto cuesta el test en nota de performance
Exportación Pedir el dato bruto del experimento en formato abierto Si consigues salir, y con qué en la mano

La segunda línea es la que más importa en esta herramienta específicamente, y es un chequeo de proceso, no de producto. Escribe antes del test qué segmentos serán analizados y qué pasa si uno de ellos gana aislado. La respuesta honesta casi siempre es “se convierte en hipótesis para un test dedicado”, nunca “se implementa directo”.

El test A/A de la primera línea merece un comentario aparte: las dos variaciones son idénticas, así que cualquier “ganador” que aparezca es ruido por definición. Es la forma más barata de auditar una herramienta nueva, y vale correrlo en cualquier herramienta que estés evaluando, incluida la nuestra.

Para quién tiene sentido AB Tasty

Tiene sentido para una operación de mediano o gran porte en la que la personalización por audiencia es un frente de trabajo real, con dueño definido y tráfico suficiente para segmentar sin perder potencia estadística, y para equipos que quieren experimento y personalización compartiendo la misma base de audiencia.

Tiene menos sentido para una operación pequeña que necesita solo test A/B en páginas web, para quien quiere precio público y autoservicio sin llamada, y para equipos cuyo tráfico por segmento todavía no sostiene una lectura segmentada, escenario en el que vale volver a lo básico de la guía completa de optimización de conversión antes de comprar segmentación.

Si tu caso es el segundo, Donnu es una de las opciones más ligeras de la categoría, con precio previsible y sin llamada para descubrir el valor, enfocada en test A/B en web con estadística honesta. No sustituye a AB Tasty en personalización por audiencia, recomendación, mensajes en el sitio ni feature flag por SDK, y decir lo contrario sería deshonesto: si necesitas esas piezas, la comparación correcta no es con Donnu. Si no las necesitas, empieza una prueba gratis y compara lo que de hecho importa para tu caso.


Lee también: VWO: análisis completo 2026 · Herramientas de test A/B comparadas · Intervalo de credibilidad vs intervalo de confianza · Errores comunes en test A/B · Leia em português

Referencias

Preguntas frecuentes

¿Cuánto cuesta AB Tasty en 2026?
La empresa no publica una tabla de precios en su página oficial: la postura es de propuesta personalizada mediante cotización, el mismo estándar de la mayor parte de las plataformas de porte corporativo de esta categoría. En la práctica, el valor depende del volumen de visitantes testeados por mes, de qué módulos entran (experimentación, personalización, feature flag), del número de dominios y de la duración del compromiso. Pide la cotización separada por franja de tráfico y por módulo, y pide por escrito qué pasa si el tráfico supera la franja a mitad de contrato.
¿Qué es la "probabilidad de ganar" de AB Tasty y cómo se lee ese número?
Según la documentación oficial de AB Tasty, la probabilidad de ganar es un índice estadístico que indica la probabilidad de que haya una ganancia estrictamente positiva de una variación respecto a la original, expresada en porcentaje, y se basa en un test bayesiano. La propia documentación sugiere que una probabilidad de ganar igual o superior al 95% indica riesgo bajo para implementar la variación. Es un número legítimo y bien definido, pero responde a una pregunta distinta de la que responde un valor p, así que no trates a los dos como sinónimos.
¿Una probabilidad de ganar del 95% es lo mismo que un 95% de confianza estadística?
No. La probabilidad de ganar responde "dado lo que observé, cuál es la probabilidad de que la variación sea mejor que el control". El intervalo de confianza frecuentista responde a una pregunta sobre la frecuencia de acierto del procedimiento en repeticiones hipotéticas del experimento. Los dos números pueden discrepar sobre exactamente los mismos datos, y confundir uno con el otro es el error de lectura más común de quien migra entre herramientas con motores estadísticos diferentes.
¿La fusión con VWO cambia algo para quien usa AB Tasty?
El 20 de enero de 2026, AB Tasty y VWO anunciaron la fusión en una única plataforma de optimización de experiencia digital, con Everstone Capital detrás del negocio, según el anuncio conjunto de las dos empresas. La comunicación oficial habla de una entidad con más de 100 millones de dólares de facturación anual y más de 4.000 clientes. Para quien ya la usa, el efecto inmediato tiende a ser pequeño, pero una consolidación de ese tipo suele reorganizar paquetes, posicionamiento y roadmap con el tiempo, lo que es un argumento a favor de contratos más cortos y de mantener los datos de experimento exportables.
¿Se puede confiar en un resultado que solo apareció en un segmento del test?
Con mucho cuidado, y casi nunca como decisión aislada. Cuando miras el mismo test en seis segmentos, la probabilidad de que al menos uno de ellos cruce el corte del 5% por azar sube a cerca del 26,5%, incluso cuando no existe ninguna diferencia real. La forma honesta de tratar un hallazgo de segmento es registrarlo como una hipótesis nueva y correr un test dedicado, con muestra dimensionada para ese segmento, en lugar de implementarlo directamente.
¿Para quién tiene sentido AB Tasty y para quién no?
Tiene sentido para operaciones de mediano y gran porte en las que la personalización por audiencia es un frente de trabajo de verdad, con equipo dedicado y tráfico suficiente para segmentar sin perder potencia estadística, y para quien quiere experimentación y personalización en la misma plataforma. Tiene menos sentido para una operación pequeña que solo necesita test A/B en páginas web, para quien quiere precio público y autoservicio de principio a fin, y para equipos que todavía no tienen volumen para sostener lecturas por segmento.