Test A/B de Creatividad Publicitaria: qué medir de verdad
Test A/B de creatividad publicitaria: por qué el creativo elige al público, por qué la tasa de clic engaña y qué métrica sostiene la decisión.

📚 Este artículo es parte de la guía Optimización de Conversión (CRO): La Guía Completa 2026.
Un test A/B de creatividad publicitaria es el experimento en el que la variable cambiada es el anuncio, y no la página. Tiene un problema que ningún test de página tiene: el sorteo no es tuyo. El sistema de entrega de la plataforma lee el contenido del creativo y elige a quién mostrar cada versión, así que los dos brazos no son vistos por las mismas personas. Ali y colegas (CSCW, 2019) midieron una entrega de 91 por ciento de hombres contra 5 por ciento de hombres cambiando solo la imagen, con público objetivo, puja y presupuesto idénticos. La consecuencia práctica es dura: lo que mides no es “el creativo B es mejor”, es “el paquete creativo B más el público que la plataforma eligió para él es mejor”. Esta guía muestra qué se puede aprender aún dentro de esa restricción, por qué la tasa de clic es la métrica más fácil de mover y la más fácil de errar, y un ejemplo trabajado en el que el creativo ganador en el clic pierde en la venta. Esta guía forma parte de nuestra guía completa de test A/B.
Qué cambia cuando la variable vive dentro de la plataforma
En un test A/B de página, controlas las tres cosas que hacen que el resultado sea causal: quién entra en el experimento, cómo se sortean las personas entre los brazos y qué ve cada brazo. En un test de creatividad, controlas solo la tercera.
| elemento del experimento | test A/B de página | test de creatividad en la plataforma |
|---|---|---|
| quién entra | tú lo defines por la regla de público en tu sitio | la plataforma decide dentro de tu público declarado |
| cómo se sortea | tu código, por visitante, con peso fijo | el sistema de entrega, por subasta, por impresión |
| qué ve cada brazo | tú lo defines | tú lo defines |
| por qué una persona vio B y no A | azar puro | azar más predicción de relevancia más precio de la subasta |
| qué mide la diferencia | efecto del tratamiento | efecto del tratamiento sumado al efecto de la entrega |
La última fila es la guía entera en una frase. Cuando el mecanismo de asignación usa el propio tratamiento para decidir quién recibe el tratamiento, la comparación deja de ser limpia. El nombre técnico del problema es asignación endógena; la consecuencia práctica es que la diferencia medida entre dos creativos mezcla dos efectos que no consigues separar desde dentro de la plataforma.
Esto no vuelve inútil el test. Vuelve distinta la pregunta. La pregunta honesta deja de ser “qué creativo es mejor para la misma persona” y pasa a ser “qué paquete de creativo más entrega compra resultado más barato para mí hoy”. Es una pregunta de negocio legítima, y es la que la mayor parte de los equipos de medios realmente quiere responder. El error es declarar la primera cuando has medido la segunda.
La evidencia de que el creativo elige al público
Esta no es una preocupación teórica. Fue medida con anuncios reales.
Ali, Sapiezynski, Bogen, Korolova, Mislove y Rieke publicaron en la CSCW de 2019 un estudio en el que compraron anuncios en Facebook manteniendo constantes las tres cosas que un anunciante controla: el público objetivo declarado, la estrategia de puja y el presupuesto diario. Lo único que cambiaba era el creativo. Los resultados principales:
- Un anuncio sobre musculación fue entregado, en promedio, a más de 75 por ciento de hombres; un anuncio sobre cosméticos, a más de 90 por ciento de mujeres. Mismo público declarado, sin ninguna segmentación por género pedida por los autores.
- Cuando los autores apagaron titular, texto e imagen y dejaron solo el enlace de destino, la entrega quedó cerca del equilibrio: 48 por ciento de hombres para el anuncio de musculación y 40 por ciento para el de cosméticos. Al devolver la imagen, la entrega saltó a 91 por ciento de hombres en un caso y 5 por ciento de hombres en el otro.
- Cambiar la imagen de un anuncio en ejecución, después de seis horas al aire, invirtió la entrega en poco tiempo, sin cambio correspondiente en la tasa de clic de los usuarios. Es decir, quien cambió de comportamiento fue el sistema, no las personas.
- Los autores aplicaron un canal alfa de 98 por ciento a las imágenes, dejándolas visualmente blancas para cualquier persona, y la entrega siguió sesgada en la misma dirección de la imagen original. La conclusión de los autores es que existe una clasificación automática de imagen antes de que cualquier humano vea el anuncio.
De ahí salen dos lecturas prácticas, y las dos cambian cómo diseñas el test.
La primera: la imagen carga el efecto de entrega mucho más que el texto. Si vas a testear creatividad con alguna ambición de aprender, cambia una cosa cada vez, y ten claro que cambiar la imagen es el cambio que más mueve al público entregado.
La segunda: no existe test de creatividad “de público controlado” en una plataforma optimizada. Incluso con el mismo público declarado, cada brazo termina con una muestra distinta. Eso es el pariente cercano de lo que discutimos en sesgo de selección en test A/B: la comparación solo es válida si la asignación es independiente del resultado potencial, y aquí no lo es por construcción.
Las tres métricas de un test de creatividad y qué responde cada una
Casi toda la confusión en test de creatividad viene de mezclar tres métricas que tienen denominadores diferentes.
| métrica | cuenta | qué responde | trampa |
|---|---|---|---|
| tasa de clic | clics / impresiones | qué creativo llama más la atención en el feed | la más barata de mover y la más débil como proxy de venta |
| conversión por clic | pedidos / clics | qué creativo trajo clics que compran más | condicionada al clic: compara poblaciones diferentes, no es causal |
| conversión por impresión | pedidos / impresiones | qué creativo genera más venta por el mismo espacio entregado | la única con denominador común, y la que pide mucha más muestra |
| coste por adquisición | inversión / pedidos | qué creativo compra venta más barata | mezcla efecto del creativo con precio de la subasta en ese público |
La métrica que cierra la decisión de negocio es la conversión por impresión o, equivalentemente, el coste por adquisición bajo presupuesto igual. Es la única en la que el denominador es la misma unidad entregada en los dos brazos, y por eso la única en la que “B es mejor” tiene un significado directo.
La conversión por clic merece un párrafo propio porque es engañosa de un modo específico. Al dividir por clics, condicionas el análisis a un evento que ocurrió después del tratamiento y que fue afectado por el tratamiento. Esa es exactamente la estructura que estudiamos en sesgo de colisionador y condicionar después del tratamiento: el grupo de quienes hicieron clic en A y el grupo de quienes hicieron clic en B no son muestras de la misma población, así que la diferencia entre ellos no es un efecto causal. Es una descripción útil, y vale la pena mirarla, pero no sostiene por sí sola una decisión.
Ejemplo trabajado: el creativo que gana en el clic y pierde en la venta
Una tienda lanza dos creativos para la misma campaña, mismo público declarado, mismo presupuesto, misma página de destino. El creativo A es la foto del producto sobre fondo neutro. El creativo B es la foto de estilo de vida, con una persona usando el producto. Al final del periodo, cada uno recibió 420 mil impresiones.
| creativo | impresiones | clics | tasa de clic | pedidos | conversión por clic | conversión por impresión |
|---|---|---|---|---|---|---|
| A (foto del producto) | 420.000 | 5.040 | 1,2000% | 252 | 5,0000% | 0,0600% |
| B (estilo de vida) | 420.000 | 6.720 | 1,6000% | 269 | 4,0030% | 0,0640% |
Las tres comparaciones, calculadas con el mismo test z de dos proporciones de la calculadora de abajo:
| comparación | denominador | lift relativo | valor-p | IC 95% de la diferencia | lectura |
|---|---|---|---|---|---|
| tasa de clic | impresiones | más 33,33% | por debajo de 0,0001 | de 0,3498 a 0,4502 punto porcentual | B gana con holgura |
| conversión por impresión | impresiones | más 6,75% | 0,4563 | de menos 0,0066 a 0,0147 punto porcentual | no concluye nada |
| conversión por clic | clics | menos 19,94% | 0,0093 | de menos 1,7597 a menos 0,2343 punto porcentual | los clics de B convierten menos |
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pega 420000 y 5040 en el lado A y 420000 y 6720 en el lado B para reproducir la primera fila: valor-p por debajo de 0,0001 y lift relativo de 33,33 por ciento. Cambia a 420000 y 252 contra 420000 y 269 y la calculadora devuelve valor-p de 0,4563, que es la segunda fila. Por último, 5040 y 252 contra 6720 y 269 devuelve valor-p de 0,0093 con signo negativo, que es la tercera.
La lectura honesta de este test. El creativo B llama más la atención: eso está probado. El creativo B vende más: eso no está probado, el intervalo de confianza de la diferencia en compras por impresión va de menos 0,0066 a más 0,0147 punto porcentual y atraviesa el cero con holgura. Y los clics que trajo B convierten menos, lo que es consistente con la hipótesis de que atrae a un público más amplio y menos cualificado, aunque esa tercera comparación sea descriptiva y no causal por el motivo explicado arriba.
La decisión correcta con estos datos no es “cámbialo todo a B”. Es: el test no respondió a la pregunta que importaba, porque no tenía muestra para ella. La siguiente sección muestra cuánta muestra faltaba.
Cuánto tráfico cuesta cada métrica
Esta tabla es la razón por la cual casi todo test de creatividad del mercado se decide en el clic: es la única métrica en la que la cuenta cuadra. Valores por creativo, 95 por ciento de confianza, 80 por ciento de potencia, test bilateral de dos proporciones.
| métrica y tasa base | detectar más 5% relativo | detectar más 10% relativo | detectar más 15% relativo |
|---|---|---|---|
| tasa de clic, base 1,20% | 529.742 impresiones | 135.624 impresiones | 61.693 impresiones |
| conversión por clic, base 5,00% | 122.124 clics | 31.234 clics | 14.193 clics |
| conversión por impresión, base 0,06% | 10.720.205 impresiones | 2.745.377 impresiones | 1.249.200 impresiones |
Lee la última fila despacio. Para detectar una ganancia de 10 por ciento en la métrica que decide la campaña, con una tasa de compra por impresión de 0,06 por ciento, necesitas casi 2,75 millones de impresiones por creativo. El test del ejemplo se ejecutó con 420 mil, es decir, cerca de 15 por ciento de lo necesario. El resultado “no significativo” no dice que los creativos sean iguales; dice que el test nunca tuvo posibilidad.
Prueba con tus números:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Esa incomodidad no es un defecto de tu operación, es una propiedad de la medición de publicidad. Lewis y Rao (Quarterly Journal of Economics, 2015) analizaron 25 experimentos de campo de publicidad digital, con 2,8 millones de dólares en inversión y campañas que alcanzaron, en la mediana, más de 1 millón de personas. El intervalo de confianza mediano sobre el retorno de la inversión quedó por encima de 100 puntos porcentuales de amplitud. En un ejemplo del artículo, una campaña exitosa tenía un efecto de 0,35 dólar por persona contra una desviación estándar de 75 dólares en las ventas individuales, lo que da un R cuadrado de 0,0000054. Con 2 millones de personas divididas entre test y control, el test tenía una potencia de cerca de 95 por ciento; con 200 mil personas, el mismo test fallaba en rechazar la hipótesis nula 74 por ciento de las veces incluso cuando el retorno verdadero era de 25 por ciento.
Tres salidas prácticas, en orden de preferencia:
- Acepta medir en el clic y decláralo. Si la pregunta es “qué creativo llama más la atención”, la tasa de clic responde, el test es barato y la decisión es legítima. Lo que no se puede es escribir “aumentó las ventas”.
- Testea diferencias grandes, no refinamientos. Foto de producto contra vídeo corto, promesa de beneficio contra promesa de precio, formato cuadrado contra vertical. Diferencias de 15 a 30 por ciento caben en el presupuesto; diferencias de 5 por ciento no.
- Para la pregunta de ingresos, usa un diseño de incrementalidad. Un grupo de control que no ve ningún anuncio mide el efecto de la campaña sobre la venta, y es un diseño mucho más potente por euro invertido que comparar dos creativos entre sí. Mira test de incrementalidad de los medios pagados y experimentos geográficos.
Por qué “vamos a subir diez creativos” empeora el problema
La respuesta natural de un equipo de medios ante el test que no concluye es subir más variaciones. Empeora dos cosas al mismo tiempo.
Primero, el presupuesto se divide. Con la misma inversión y diez brazos, cada creativo recibe una décima parte de lo que recibiría en un test A contra B, lo que lleva la muestra por brazo a quedar muy lejos de la tabla de la sección anterior. Segundo, el número de comparaciones crece. Con nueve brazos de tratamiento contra un control, a nueve comparaciones al 5 por ciento cada una, la probabilidad de al menos un falso positivo bajo la hipótesis nula sube a cerca del 37 por ciento si no corriges. El procedimiento correcto está en test A/B/n con varias variantes y en muchas métricas en un solo test.
Existe además un tercer efecto, específico de plataforma: con muchos creativos en la misma campaña, el sistema de entrega concentra el gasto en los que predice que van a rendir mejor antes de que haya dato suficiente, lo que es una forma de cierre anticipado incorporada en el producto. El creativo “ganador” suele ser el que tuvo suerte en los primeros cientos de impresiones. Es el mismo mecanismo de la maldición del ganador, ahora automatizado.
La regla que funciona en la práctica: pocos brazos, hipótesis distantes, una variable cambiada cada vez. Si tienes diez ideas, elige las dos más diferentes entre sí y testea primero la dimensión, no las diez ejecuciones.
Anuncios adaptables: cuando la plataforma ya está testeando por ti
En búsqueda pagada, buena parte del “test de creatividad” ya no es tuyo. En la documentación de Google Ads sobre anuncios adaptables de búsqueda, tú aportas hasta 15 titulares y 4 descripciones, y la plataforma “monta el texto en múltiples combinaciones de anuncio de un modo que evita la redundancia” y, con el tiempo, “testea las combinaciones más prometedoras y aprende cuáles son más relevantes para diferentes consultas”. Puedes fijar titulares y descripciones en posiciones específicas, pero la elección de la combinación mostrada es del sistema.
Esto tiene tres consecuencias para quien quiere aprender algo:
| qué querías | qué entrega el formato adaptable | qué hacer |
|---|---|---|
| tráfico igual entre versiones | asignación adaptativa, concentrada en las combinaciones previstas como buenas | no leas la diferencia entre combinaciones como efecto causal |
| saber qué titular funciona | rendimiento por elemento, agregado sobre combinaciones desiguales | úsalo como pista de generación de hipótesis, no como veredicto |
| un test A contra B limpio | un optimizador multibrazo con regla cerrada | si la pregunta es causal, ejecuta el test al nivel del experimento de campaña |
Google afirma que “los anunciantes que mejoran la eficacia del anuncio de sus anuncios adaptables de búsqueda de baja a excelente obtienen 15 por ciento más clics y conversiones, en promedio”. Ese número es una estimación de la propia plataforma, publicada sin metodología, muestra ni diseño experimental, y debe tratarse como tal: vale como orientación de producto, no como evidencia causal. Es el tipo de afirmación que siempre atribuimos a la fuente en lugar de repetir como hecho.
Si tu pregunta es de verdad causal, el camino es ejecutar el experimento a nivel de campaña, y ahí el asunto cambia de figura por culpa del mecanismo de sorteo de la plataforma. Ese es el tema de test A/B en la plataforma de anuncios.
Fatiga, novedad y la ventana en la que se lee el resultado
Un test de creatividad tiene dos distorsiones temporales que un test de página tiene en menor grado.
La primera es el efecto de novedad: un creativo nuevo atrae atención por la propia novedad en las primeras exposiciones, y la ganancia decae. Leer el resultado en los tres primeros días es leer el pico, no la meseta. El tratamiento correcto de esto está en efecto novedad en test A/B.
La segunda es la fatiga: a medida que la misma persona ve el mismo anuncio varias veces, la tasa de clic cae. Como los dos brazos suelen acumular frecuencia a ritmos diferentes (al fin y al cabo, la plataforma entrega cantidades diferentes a públicos diferentes), la diferencia medida entre ellos cambia de tamaño a lo largo del test, lo que es un problema de composición y no de efecto.
Tres reglas prácticas, todas fáciles de aplicar:
- Ejecuta el test en semanas enteras, por el mismo motivo que vale en cualquier otro test: la composición de público y el comportamiento de compra varían por día de la semana. Mira ciclo semanal y duración.
- Congela el creativo durante el test. Cambiar la imagen a mitad de camino cambia la entrega en horas, como midieron Ali y colegas, y lo que tienes después de eso son dos experimentos empalmados.
- Mira la curva, no solo el total. Si la diferencia entre los brazos se encoge monótonamente a lo largo de los días, probablemente mediste novedad. Si crece, probablemente mediste aprendizaje del sistema de entrega.
Cómo leer el resultado de un test de creatividad sin engañarte
- ¿Cuál era la métrica primaria declarada antes de ejecutar? Si no había ninguna, el informe es una elección entre las tres de la tabla, y siempre va a existir una que favorezca la conclusión deseada.
- ¿La comparación tiene denominador común? La conversión por clic no lo tiene. Es informativa, no decisiva.
- ¿La muestra alcanzó lo que la calculadora pide para la métrica primaria? Si no, escribe “no concluyente”, no “empate”.
- ¿Los dos brazos recibieron una entrega parecida? Diferencias grandes de impresiones, alcance o frecuencia entre los brazos indican que la plataforma decidió por ti, y el resultado mezcla tratamiento y entrega.
- ¿El público entregado fue parecido? Compara el corte por dispositivo, emplazamiento y franja de edad entre los brazos. Si divergen mucho, estás comparando campañas diferentes.
- ¿Cambiaste una variable o un paquete? Imagen, titular y texto cambiados juntos responden “el paquete nuevo es mejor”, no “la imagen nueva es mejor”.
- ¿La diferencia sobreviviría a una semana más? La diferencia que se encoge a lo largo de los días suele ser novedad.
- ¿El efecto es material? Una ganancia de 3 por ciento relativo en una campaña de 200 pedidos al mes es ruido operativo, incluso cuando es real.
Checklist antes de encender el test
- Escribe la hipótesis, en el formato “si cambio X por Y, la métrica Z cambia porque W”. El generador de hipótesis fuerza ese formato.
- Declara la métrica primaria y el denominador por escrito, antes de encender.
- Dimensiona con la calculadora para esa métrica, no para la más barata.
- Elige dos ideas distantes, no seis parecidas.
- Cambia una dimensión cada vez: imagen, o promesa, o formato. Nunca las tres.
- Usa la misma página de destino en los dos brazos, si no estarás testeando dos cosas. El test del otro lado del clic es el asunto de correspondencia de mensaje entre anuncio y página.
- Ajusta el periodo en semanas enteras y registra la fecha de inicio y fin antes.
- Registra la entrega, no solo el resultado: impresiones, alcance, frecuencia y corte de público por brazo. Es lo que va a permitir decir si la comparación fue limpia.
- Para la pregunta de ingresos, planifica un diseño de incrementalidad en lugar de esperar que el test de creatividad responda.
Haz esto automático en Donnu
El dolor específico de testear creatividad publicitaria es que el pedazo más fácil de medir, el clic, es el que menos importa, y el pedazo que importa, la venta, ocurre después, en tu sitio, donde la plataforma no ve con precisión.
En Donnu, la meta de conversión puede confirmarse desde tu servidor, con valor del pedido, además de clics, envíos de formulario y visitas a páginas. Eso permite medir el pedido que de hecho fue pagado, y no el evento de navegador que la plataforma registró. El experimento puede restringirse por origen de tráfico, lo que permite ejecutar un test de la página solo para quien llegó de una campaña específica, con el creativo congelado del otro lado. El informe es bayesiano, avisa cuando la división de visitantes se aleja de lo configurado y solo declara ganadora con al menos 200 visitantes por variación y 7 días de test.
Lo que sigue siendo tuyo: elegir hipótesis distantes, declarar la métrica primaria antes y aceptar que la pregunta de ingresos pide diseño de incrementalidad. Para el resto, la calculadora de tamaño de muestra, la calculadora de significancia y la calculadora de coste por adquisición hacen las cuentas de esta guía con tus números, gratis.
Referencias
- Ali, Muhammad; Sapiezynski, Piotr; Bogen, Miranda; Korolova, Aleksandra; Mislove, Alan y Rieke, Aaron. Discrimination through Optimization: How Facebook’s Ad Delivery Can Lead to Biased Outcomes. Proceedings of the ACM on Human-Computer Interaction, v. 3, CSCW, artículo 199, noviembre de 2019. Artículo leído íntegramente a partir del PDF alojado por el Khoury College de la Northeastern University. Fuente de la entrega de más de 75 por ciento de hombres para el anuncio de musculación y más de 90 por ciento de mujeres para el de cosméticos con el mismo público declarado y el mismo presupuesto, de los 48 y 40 por ciento en la versión solo con el enlace, de los 91 contra 5 por ciento al devolver la imagen, de la inversión rápida de entrega al cambiar la imagen con el anuncio al aire sin cambio correspondiente en la tasa de clic, y del experimento con canal alfa de 98 por ciento que indica clasificación automática de imagen. Consultado el 22/09/2026. ccs.neu.edu.
- Lewis, Randall A. y Rao, Justin M. The Unfavorable Economics of Measuring the Returns to Advertising. The Quarterly Journal of Economics, v. 130, n. 4, noviembre de 2015, p. 1941-1973. PDF leído en las secciones de resumen, introducción y potencia estadística. Fuente de los 25 experimentos de campo, de los 2,8 millones de dólares en inversión, de la mediana de más de 1 millón de personas alcanzadas por campaña, del intervalo de confianza mediano por encima de 100 puntos porcentuales de amplitud, del R cuadrado de 0,0000054 en el ejemplo de 0,35 dólar contra desviación estándar de 75 dólares, y del fallo en rechazar la nula en 74 por ciento de las veces con 200 mil personas bajo retorno verdadero de 25 por ciento. Consultado el 22/09/2026. gwern.net.
- Google. Acerca de los anuncios adaptables de búsqueda. Centro de Ayuda de Google Ads. Página leída íntegramente. Fuente de los hasta 15 titulares y 4 descripciones, del montaje automático de combinaciones, del test adaptativo de las combinaciones más prometedoras, de la fijación de posiciones y de la estimación de 15 por ciento más clics y conversiones al elevar la eficacia del anuncio de baja a excelente, que es una estimación de la propia plataforma. Consultado el 22/09/2026. support.google.com.
Lee también: Test A/B en la plataforma de anuncios · Correspondencia de mensaje entre anuncio y página · Test de incrementalidad de los medios pagados · Experimentos geográficos · Efecto novedad · Test A/B/n · Maldición del ganador · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es un test A/B de creatividad publicitaria?
- Es el experimento en el que la variable cambiada es el propio anuncio (imagen, vídeo, titular o texto) y el resto de la campaña se mantiene igual: mismo público declarado, mismo presupuesto, misma página de destino. La diferencia frente a un test A/B de página es que el sorteo no es tuyo: quien decide qué persona ve qué anuncio es el sistema de entrega de la plataforma, y ese sistema tiene en cuenta el contenido del creativo para decidirlo.
- ¿Puedo decidir el ganador por la tasa de clic?
- Solo si tu pregunta de negocio trata sobre clics. La tasa de clic es la métrica más barata de mover y la que menos se correlaciona con lo que vendes. En el ejemplo trabajado de esta guía, el creativo B gana en tasa de clic con holgura (más 33,3 por ciento, valor-p por debajo de 0,0001) y aun así no prueba nada en compras por impresión (más 6,75 por ciento, valor-p de 0,4563), mientras que la conversión de los clics que trajo es peor.
- ¿Por qué dos creativos nunca son vistos por las mismas personas?
- Porque el sistema de entrega usa el contenido del creativo para elegir al público. Ali y colegas (CSCW, 2019) lanzaron anuncios con el mismo público objetivo declarado, el mismo presupuesto y la misma estrategia de puja, y midieron una entrega de más de 75 por ciento hombres para un creativo y más de 90 por ciento mujeres para otro. Con solo la imagen cambiada, la entrega fue de 91 por ciento de hombres contra 5 por ciento de hombres. Es decir, comparar dos creativos es comparar dos paquetes de creativo más público al mismo tiempo.
- ¿Cuánto tráfico necesito para testear creatividad?
- Depende brutalmente de la métrica. Con una tasa de clic de 1,2 por ciento, detectar 10 por ciento relativo pide 135.624 impresiones por creativo. Con una compra por impresión de 0,06 por ciento, la misma pregunta pide 2.745.377 impresiones por creativo. Por eso casi todo test de creatividad del mercado se decide por clic: es la única métrica en la que la cuenta cuadra.
- ¿Testear diez creativos de una vez lo resuelve?
- Resuelve el problema de ideas y empeora el de estadística. Con diez brazos contra un control, haces nueve comparaciones, y la probabilidad de al menos un falso positivo al 5 por ciento por comparación sube a cerca del 37 por ciento sin corrección. Además, cada brazo se queda con una décima parte del presupuesto, lo que derrumba la potencia de todos. Pocos brazos con hipótesis explícita rinden más que muchos brazos sin ella.
- ¿Un anuncio adaptable de búsqueda cuenta como test A/B?
- No en sentido estricto. En los anuncios adaptables de búsqueda tú aportas hasta 15 titulares y 4 descripciones, y Google Ads monta y testea las combinaciones que juzga más prometedoras, según la documentación de la propia plataforma. Eso es optimización adaptativa, no sorteo balanceado: las combinaciones no reciben tráfico igual, y el resultado por elemento no es un efecto causal aislado.