Test A/B

Variantes de Test A/B Generadas por IA: ¿funcionan?

Variantes de test A/B generadas por IA: qué muestra la evidencia, el costo estadístico de probar muchas a la vez y cómo usarlas sin romper el rigor.

Ilustración abstracta de un brazo mecánico produciendo un abanico de tarjetas idénticas, con una balanza pesando dos de ellas

Las variantes de test A/B generadas por IA funcionan para lo que la IA hace realmente bien, que es producir muchas alternativas plausibles de texto en poco tiempo, y fallan exactamente donde la mayoría de los equipos las usa: como sustituto del filtro y de la decisión. El motivo es estadístico, no filosófico. Generar veinte variantes y quedarse con la que ganó no es experimentación, es un sorteo con 64% de probabilidad de al menos un falso positivo al 95% de confianza. Esta guía, parte de la guía de personalización con IA y test A/B, cubre qué muestra la evidencia pública sobre la calidad de esas variantes, cuánto cuesta cada variante extra en muestra y en días, un ejemplo trabajado con corrección de comparaciones múltiples, y el diseño de proceso que aprovecha la velocidad de la IA sin romper el rigor del test.

Qué hace bien la IA, y qué no hace

La separación útil no es entre “IA buena” e “IA mala”, es entre las etapas del proceso de experimentación. En algunas acelera de verdad; en otras solo produce volumen, y el volumen es justamente el insumo más caro de un test.

Etapa del test ¿Ayuda la IA? Por qué
Generar muchas alternativas de texto a partir de un briefing Mucho Es literalmente la tarea para la que se entrenó el modelo
Variar registro, longitud y ángulo de un mismo argumento Mucho Produce diversidad rápida donde una persona tardaría horas
Traducir y adaptar una variación ganadora a otro idioma Bastante Reaprovecha un aprendizaje ya validado, sin inventar una hipótesis nueva
Priorizar qué variaciones merecen tráfico Poco Exige contexto de negocio, margen, marca e historial que el modelo no tiene
Definir la métrica primaria y la ventana del test Nada Es una decisión de negocio, tomada antes de ver datos
Elegir al ganador mirando los resultados de todas las variaciones Nada, y es peligroso Es el procedimiento que infla el falso positivo, lo haga un modelo o una persona

La lectura práctica de esa tabla es que la IA mueve el cuello de botella de lugar. Antes, el cuello de botella era producir alternativas; ahora producir alternativas es casi gratis y el cuello de botella pasó a ser el tráfico necesario para juzgarlas. Quien no reconoce ese cambio termina con un backlog de cien variantes y muestra para dos.

Qué muestra la evidencia sobre la calidad de esas variantes

La pregunta “¿la IA escribe mejor que una persona?” tiene menos respuesta pública de lo que el volumen de opinión sugiere, y la evidencia que existe necesita una salvedad antes del número.

El estudio más directo disponible es “LLM-Generated Ads: From Personalization Parity to Persuasion Superiority”, de Meguellati, Civelli, Han, Bernstein, Sadiq y Demartini, presentado en diciembre de 2025. Corre dos experimentos con personas comparando anuncios generados por LLM y escritos por personas (arXiv 2512.03373):

Preferencia declarada entre anuncio generado por LLM y anuncio humanoEn el experimento de personalización con 400 participantes, el anuncio generado por LLM obtuvo el 51,1% de la preferencia y el humano el 48,9%, sin diferencia significativa. En el experimento de persuasión con 800 participantes, el anuncio generado por LLM obtuvo el 59,1% y el humano el 40,9%, con p menor que 0,001. Las dos mediciones son de preferencia declarada en encuesta, no de conversión en producción.Personalización · 400 participantes51,1%48,9%verde: generado por LLM · gris: escrito por personaempate estadístico (p mayor que 0,05)Persuasión · 800 participantes59,1%40,9%mejores resultados: autoridad 63,0% y consenso 62,5%diferencia significativa (p menor que 0,001)la salvedad que lo cambia todoesto es preferencia declarada en encuesta, con participantes eligiendo entre dos piezasno es tasa de conversión medida en tu sitio, con dinero real y contexto real
Fuente: Meguellati y colegas, arXiv 2512.03373, diciembre de 2025. El diseño es de elección entre dos piezas en ambiente de encuesta, así que sirve como indicio sobre la calidad del texto, no como predicción de conversión.

La salvedad no es un detalle académico. La preferencia declarada mide qué pieza le parece mejor a la persona cuando está prestando atención a las dos; la conversión mide lo que hace cuando está apurada, en medio de una tarea, sin comparar nada. Las dos cosas divergen con frecuencia, y por eso la existencia de ese estudio no te exime de tu test, solo aumenta la probabilidad de que valga la pena correrlo.

El costo estadístico de generar muchas variantes

Acá está el punto que la facilidad de generar texto esconde. Cada variación extra en el test es una comparación extra contra el control, y cada comparación extra carga su propia probabilidad de dar significativo por azar.

Con 95% de confianza, la probabilidad de al menos un falso positivo en la familia de comparaciones es 1 menos 0,95 elevado al número de comparaciones:

Probabilidad de al menos un falso positivo según el número de variaciones probadasAl 95% de confianza y sin corrección, la probabilidad de al menos un falso positivo es del 5% con una variación, 9,75% con dos, 14,26% con tres, 18,55% con cuatro, 22,62% con cinco, 26,49% con seis, 33,66% con ocho y 40,13% con diez.probabilidad de al menos un falso positivo5,00%19,75%214,26%318,55%422,62%526,49%633,66%840,13%10número de variaciones comparadas contra el mismo control, sin corrección, al 95% de confianza
Es aritmética simple: 1 menos 0,95 elevado al número de comparaciones. Con diez variantes generadas en un minuto y ninguna corrección, cuatro de cada diez experimentos señalan un ganador que no existe.

La corrección para esto es conocida y barata de aplicar: Bonferroni divide el umbral por comparación entre el número de comparaciones (con cinco variantes, cada una necesita un p por debajo de 0,01 en vez de 0,05), y Šidák hace lo mismo de forma un poco menos conservadora. Lo que no es barato es el efecto colateral: un umbral más duro exige más muestra para mantener el mismo poder.

Cuánto tráfico cuesta cada variante extra

El costo es doble, y ahí es donde el plan bonito de “vamos a probar diez variantes de IA” se encuentra con el calendario. La muestra total del test se multiplica por el número de brazos, y el umbral corregido eleva la muestra necesaria por brazo.

Con tasa base de 3,5%, efecto relativo mínimo de 10%, 80% de poder y 20.000 visitantes por semana:

Diseño Umbral por comparación Muestra por brazo Brazos Días
A/B clásico (1 variación) 0,05 45.362 2 ≈ 32
A/B/n con 5 variaciones, corregido por Bonferroni 0,01 67.498 6 ≈ 142

Ciento cuarenta y dos días contra treinta y dos. El mismo tráfico, la misma tasa base, el mismo efecto buscado. La diferencia entera está en cuántas ideas decidiste juzgar de una vez, y el modelo que generó las cinco variaciones tardó menos de un minuto en producirlas.

Corré tu propia cuenta cambiando la tasa base y el efecto buscado:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

De ahí salen dos lecturas prácticas. La primera es que el filtro humano dejó de ser opcional: alguien tiene que recortar las veinte ideas a dos antes de que el tráfico entre en la cuenta, y ese alguien necesita contexto de negocio, no más capacidad de generación. La segunda es que, para la mayoría de los sitios, una secuencia de tests A/B simples entrega más aprendizaje por trimestre que un A/B/n gigante, porque cada test aislado responde una pregunta explicable.

Un ejemplo trabajado con corrección de comparaciones múltiples

Un SaaS le pide al modelo tres variaciones del titular de la página de precios, cada una con un ángulo distinto, y las corre todas contra el control en la misma ventana. Tasa base de 3,5%, 12.000 visitantes por brazo:

Pegá esos números en la calculadora de abajo, con corrección de Bonferroni y 95% de confianza:

Calculadora de significancia para test A/B/n
Control (A)
Tasa-
VariaciónVisitantesConversionesTasaMejoravalor-p brutovalor-p ajustadoVeredictoQuitar variación
-----
-----
-----

Probar varias variaciones contra el mismo control multiplica la chance de un falso positivo. La corrección baja el umbral por comparación para sostener el error de toda la familia. Compara el valor-p bruto (lo que mostraría una calculadora de dos variaciones) con el ajustado: es común que una variación pase sola y caiga tras la corrección.

El resultado, comparación por comparación. Son tres variaciones, así que el umbral corregido por Bonferroni es 0,0167 por comparación (0,05 dividido entre 3):

Variación Tasa Lift relativo z Valor-p bruto Valor-p ajustado ¿Sobrevive a la corrección?
V1 (prueba social) 3,70% +5,71% 0,83 0,4056 1,0000 No
V2 (reducción de riesgo) 4,10% +17,14% 2,43 0,0151 0,0452 Sí, por poco
V3 (urgencia) 3,40% -2,86% -0,42 0,6713 1,0000 No

V2 gana, con un intervalo de confianza del 95% de la diferencia entre 0,12 y 1,08 puntos porcentuales. Y acá está el detalle para el que existe este ejemplo: el valor-p bruto de V2 es 0,0151 y el umbral corregido es 0,0167. El margen es de menos de 0,002. Si el equipo hubiera pedido cuatro variaciones en vez de tres, el umbral bajaría a 0,0125 y exactamente la misma variación, con exactamente los mismos datos, sería declarada no significativa.

Valor-p bruto de cada variación contra el umbral corregidoCon tres variaciones, el umbral corregido por Bonferroni es 0,0167. El valor-p bruto de V1 es 0,4056 y el de V3 es 0,6713, ambos muy por encima del umbral. El de V2 es 0,0151, justo por debajo del umbral, así que V2 sobrevive a la corrección por poco. Con cuatro variaciones el umbral bajaría a 0,0125 y V2 no sobreviviría.valor-p bruto (escala truncada en 0,10 para lectura)0,4056V1 prueba social0,0151V2 reducción de riesgo0,6713V3 urgenciaumbral con 3 variaciones: 0,0167umbral con 4 variaciones: 0,0125entre las dos líneas punteadas vive la diferencia entre “ganador” e “inconcluso”, con los mismos datos
El veredicto de V2 depende de una decisión tomada antes de que existiera cualquier dato: cuántas variaciones entrarían en el test. Esa es la razón práctica de que el filtro venga antes de la generación, y no después.

Fijate también en lo que la tabla hace con V1. Un lift relativo de +5,71% aparece en el informe como un número positivo, y en muchas reuniones se convertiría en “la prueba social también ayudó un poco”. El valor-p de 0,4056 dice otra cosa: eso es ruido. La capacidad de la IA de producir diez variaciones plausibles multiplica exactamente ese tipo de lectura equivocada, porque casi siempre alguna de ellas va a quedar por encima del control por azar.

Cómo usar IA sin romper el rigor

Práctica Qué resuelve
Usar el modelo para generar hipótesis y redacción, nunca para elegir al ganador Mantiene la decisión donde hay contexto de negocio y evita la selección posterior a los datos
Recortar de veinte ideas a dos ANTES de calcular la muestra Reconoce que el cuello de botella pasó a ser el tráfico, no la producción
Declarar por escrito qué variaciones entran, la métrica primaria y la ventana, antes de correr Impide que una variación “extra” aparezca a mitad del test y cambie el umbral
Aplicar corrección de comparaciones múltiples siempre que haya más de una variación Contiene el error tipo I de la familia, que es el riesgo real de este diseño
Preferir una secuencia de tests A/B a un A/B/n gigante cuando el tráfico es medio Más aprendizaje explicable por trimestre, con la muestra que existe
Revisar cada pieza generada en cuanto a hechos, promesas y tono de marca antes de publicar El modelo no sabe qué puede prometer tu empresa
Nunca servirle al buscador contenido distinto del que ve la persona El cloaking es una violación de política, sin importar quién escribió el texto

Sobre la última línea, vale la precisión: la orientación de Google sobre test A/B pide que el contenido mostrado al Googlebot sea el mismo que se muestra a las personas, sugiere rel="canonical" cuando el test usa URLs distintas, redirección temporal 302 en vez de 301, y que el test corra solo el tiempo necesario (Google Search Central). Y la política de spam define el abuso de contenido a escala como generar muchas páginas con el objetivo principal de manipular el ranking sin ayudar a quien lee, listando el uso de IA generativa para eso como ejemplo; el criterio es la ausencia de valor, no la automatización en sí (Google Search Central, políticas de spam).

Los errores más comunes

Error Señal de alerta Corrección
Probar todas las variaciones que generó el modelo El test tiene ocho brazos porque fue fácil producirlos Filtro humano antes de la muestra; el tráfico es el recurso escaso
No corregir comparaciones múltiples El informe muestra varios “p menor que 0,05” Aplicá Bonferroni o Šidák e informá el valor-p ajustado
Elegir al ganador después de mirar todos los resultados “Nos quedamos con la que rindió mejor” Declará antes qué variaciones entran y cuál es la métrica primaria
Tratar la preferencia en encuesta como predicción de conversión “Un estudio mostró que la IA convierte más” El estudio midió elección entre dos piezas en laboratorio; la conversión es otra medida
Leer un lift relativo positivo sin mirar el valor-p “V1 también subió un poco” Con muchas variaciones, alguna siempre sube por azar
Publicar la pieza generada sin revisión de hechos y de marca Un número inventado o una promesa que la empresa no puede cumplir Revisión humana obligatoria antes de que la variación salga al aire

Hacé esto automático en Donnu

El problema real de las variantes generadas por IA no es la calidad del texto, es la facilidad de producir más opciones de las que tu tráfico puede juzgar. La cuenta que resuelve eso (cuánta muestra cuesta cada brazo extra, cuál es el umbral después de la corrección, cuándo puede cerrar la ventana) es tediosa de hacer a mano y es justamente la que queda afuera cuando el equipo está entusiasmado con la velocidad de generación. Donnu hace esa parte: declarás las variaciones y la métrica primaria, Donnu dimensiona la muestra a partir de tu tasa base real, aplica la corrección de comparaciones múltiples y devuelve el veredicto con el intervalo entero, incluyendo el caso incómodo en el que ninguna variación sobrevivió.

Empezá una prueba gratis de 14 días y corré tu próximo test con IA en la generación y rigor en la decisión.

Referencias

Leé también:

Preguntas frecuentes

¿La IA consigue escribir variantes de test A/B mejores que las de una persona?
La evidencia pública disponible es de preferencia declarada en laboratorio, no de conversión en producción, y es mixta. En el estudio "LLM-Generated Ads: From Personalization Parity to Persuasion Superiority" (Meguellati y colegas, diciembre de 2025), los anuncios generados por LLM empataron con los escritos por personas cuando la tarea era personalizar por rasgo de personalidad (51,1% contra 48,9%, sin diferencia significativa, con 400 participantes) y quedaron por delante cuando la tarea era persuadir por principios psicológicos (59,1% contra 40,9%, p menor que 0,001, con 800 participantes). La preferencia declarada en una encuesta no es lo mismo que la tasa de conversión en tu sitio, y nada de eso sustituye a correr el test.
¿Cuál es el problema de probar muchas variantes generadas por IA a la vez?
El error tipo I se acumula. Con 95% de confianza, la probabilidad de al menos un falso positivo es del 5% con una variación, 14,26% con tres, 22,62% con cinco y 40,13% con diez. Es decir, generar veinte variantes y quedarse con "la que ganó" es, en la práctica, un sorteo caro. La corrección existe (Bonferroni o Šidák bajan el umbral por comparación), pero cuesta muestra, y esa es la cuenta que casi nadie hace antes de pedirle veinte variantes al modelo.
¿Cuánto tráfico cuesta probar una variante más?
Cuesta dos veces: la muestra total se multiplica por el número de brazos y el umbral corregido exige más muestra por brazo. En el ejemplo de esta guía, con tasa base de 3,5% y efecto relativo de 10%, un test A/B común necesita 45.362 por variación (unos 32 días con 20.000 visitantes por semana). Un test con control más cinco variantes de IA, corregido por Bonferroni, necesita 67.498 por brazo en seis brazos, unos 142 días con el mismo tráfico.
¿Usar IA para generar contenido perjudica mi SEO?
La automatización no está prohibida por sí sola. La política de spam de Google define el abuso de contenido a escala como generar muchas páginas con el objetivo principal de manipular el ranking sin ayudar a quien lee, y lista explícitamente el uso de IA generativa para producir muchas páginas sin aportar valor como ejemplo de violación. El problema es la ausencia de valor, no la herramienta. Para los tests, la regla que importa es otra y es bien específica: no mostrarle al Googlebot un contenido distinto del que ve la persona, lo que es cloaking.
¿La IA puede elegir sola al ganador del test?
Puede calcular, y el cálculo es la parte fácil. Lo que no puede hacer sola es decidir qué era hipótesis antes de mirar los datos. Elegir la variación ganadora después de generar muchas opciones y mirar todos los resultados es exactamente el procedimiento que infla el falso positivo, lo haya hecho un modelo o una persona. La disciplina que sostiene esto es declarar antes: qué variaciones entran, cuál es la métrica primaria y cuál es la ventana.
¿Cuál es el uso más seguro de IA en test A/B hoy?
Usar el modelo en la generación de hipótesis y en la redacción, y no en la selección del ganador. La IA es buena produciendo muchas alternativas plausibles a partir de un briefing y variando registro, ángulo y longitud rápido. No tiene acceso al contexto de tu negocio, a tu base de clientes ni al historial de tus tests anteriores, y no sustituye el filtro humano que reduce veinte ideas a dos que valen la muestra disponible.
¿Conviene correr un test A/B/n con corrección o varios tests A/B seguidos?
Depende de qué quieras aprender. Un A/B/n con corrección responde en una ventana cuál entre varias opciones le gana al control, al costo de mucha más muestra. Una secuencia de tests A/B responde una pregunta por vez, exige menos muestra por test y produce un aprendizaje acumulado más explicable, pero lleva más tiempo de calendario. Para la mayoría de los equipos con tráfico medio, la secuencia suele ser la mejor elección, y el filtro humano es lo que la hace viable.