Estadística

Test de Incrementalidad: el lift real de los medios pagados

Test de incrementalidad con holdout: cómo medir el lift real de los medios pagados, el iROAS y el costo incremental sin confiar en el ROAS atribuido.

Ilustración plana de dos grupos de personas separados, a la izquierda algunas alrededor de un celular grande y de una tarjeta gris vacía, a la derecha cuatro personas sin ninguna pantalla, con una bolsa de compras verde y una flecha punteada sobre cada grupo, en fondo verde menta

Un test de incrementalidad separa, por sorteo, una parte del público de la campaña en un grupo de control que no recibe el anuncio y mide cuántas conversiones de más generó el grupo de test. Esa diferencia es el lift, y es el único número que responde “¿cuánto causaron estos medios?”. El ROAS que la plataforma atribuye responde otra pregunta, y suele ser bastante mayor: en el ejemplo trabajado de esta guía, la campaña muestra un ROAS atribuido de 8,0 y el holdout mide un iROAS de 1,80, por debajo del punto de equilibrio. Este artículo forma parte de nuestra guía completa de test A/B y cubre las tres formas de montar el control (anuncio de utilidad pública, anuncio fantasma e intención de tratar), las métricas que salen del test, el problema de poder estadístico con tasas bajas, la dilución causada por quien nunca vio el anuncio y cuándo cambiar el holdout por usuario por un experimento geográfico.

Qué es un test de incrementalidad

La pregunta que los medios pagados quieren responder es contrafactual: ¿cuántas de esas ventas no habrían ocurrido sin el anuncio? Como nadie observa a la misma persona con y sin anuncio al mismo tiempo, el experimento crea dos grupos parecidos por sorteo y deja que solo uno de ellos reciba la campaña.

La documentación de Google Ads, verificada el 16/09/2026, describe el Conversion Lift así: el público se separa entre quien ve los anuncios (tratamiento) y quien no los ve (control), y la diferencia de conversiones entre los dos grupos es el lift, el aumento causado por la presencia del anuncio. El centro de ayuda de Meta, verificado en la misma fecha, usa la misma definición y agrega un detalle que cambia la lectura del resultado: el Conversion Lift de Meta adopta el enfoque de intención de tratar. El grupo de test reúne a quien puede ver el anuncio, y dentro de él hay quien lo vio y quien no, por límite de entrega o porque no bajó la pantalla hasta el anuncio.

Tres términos aparecen en todo informe de este tipo:

No lo confundas con tres vecinos. El holdout de largo plazo mantiene un grupo sin un cambio de producto durante meses para medir si el efecto sobrevive. El test A/B de creativo compara dos anuncios entre sí y dice cuál es mejor, no si alguno de los dos vale el dinero. Y atribuyendo ingresos al ganador trata de proyectar el valor de una variación de página que ya ganó. Aquí el foco es otro: sortear quién recibe medios y leer el lift que causan.

Por qué el ROAS atribuido miente

El ROAS atribuido divide el ingreso que el modelo de atribución le acredita a la campaña por el gasto. El problema no es la cuenta, es el crédito. Tres mecanismos inflan el número, y los tres están documentados en experimentos grandes.

1. La plataforma elige a quien tiene más chance de comprar. Gordon, Zettelmeyer, Bhargava y Chapsky analizaron 15 experimentos de anuncio en Estados Unidos, en Facebook, sumando 500 millones de observaciones del tipo usuario-experimento y 1,6 mil millones de impresiones. Describen que el sistema de entrega le da más peso a usuarios con mayor predicción de conversión, y que por eso comparar expuestos con no expuestos sobreestima el efecto del anuncio. Describen también el “sesgo de actividad”: para ser expuesto, el usuario necesita haber entrado a la plataforma durante la campaña, y quien está más activo en línea también tiende a convertir más en línea, con o sin anuncio.

2. La búsqueda pagada por la propia marca captura a quien ya venía en camino. Blake, Nosko y Tadelis reportan que, cuando eBay apagó los anuncios de búsqueda para términos de su propia marca en Yahoo! y MSN, el 99,5 por ciento de los clics perdidos fue recuperado por el resultado orgánico. Para las palabras no relacionadas con la marca, en un experimento por regiones, las estimaciones no experimentales de retorno pasaban del 4.100 por ciento sin controles de tiempo y región, y del 1.400 por ciento con ellos; el experimento midió un retorno de menos 63 por ciento, con intervalo de 95 por ciento de menos 124 a menos 3 por ciento.

3. El remarketing le habla a quien ya estaba decidido. Johnson, Lewis y Nubbemeyer recuerdan que la eficacia del remarketing es controvertida justamente por eso: quien recibe el anuncio es un grupo muy seleccionado, que tal vez compraría de todas formas. En el caso que ellos midieron, el efecto existía (más sobre eso adelante), pero solo el experimento logró mostrar el tamaño.

La tabla de abajo reproduce parte de la tabla 6 de la versión de los autores de Gordon y coautores, con la métrica de checkout. La columna “expuestos contra no expuestos” es lo que un panel de atribución ingenuo tiende a mostrar; la columna del experimento es el lift causal.

estudio lift estimado comparando expuestos con no expuestos lift medido por el experimento
11 392% 8,6%
3 198% 8,8%
2 377% 1,3%
4 316% 73%
9 4.074% 2,4%
13 61% -15%

No es que la comparación ingenua se equivoque siempre hacia el mismo lado o por el mismo factor. Los autores reportan que, en la mitad de los estudios, la estimación porcentual de aumento en compras se equivoca por un factor de tres en todos los métodos observacionales que testearon, y que en algunos casos el error es hacia abajo. El punto es que no sabes de antemano el tamaño ni la dirección del error, y por eso necesitas el control sorteado.

ROAS atribuido contra iROAS en el ejemplo de ecommerceDos barras horizontales. Compras atribuidas por la plataforma: 4.800, ROAS atribuido de 8,0. Compras incrementales medidas por el holdout: 1.080, iROAS de 1,80. Una línea vertical punteada marca el iROAS de equilibrio de 2,5 para un margen de 40 por ciento.la misma campaña, dos cuentas: lo que la atribución acredita y lo que el anuncio causócompras atribuidasventana de la plataforma4.800 compras, ROAS 8,0compras incrementalestest menos control escalado1.080 compras, iROAS 1,80la barra de abajo tiene 22,5 por ciento del largo de la de arribacon margen de 40 por ciento, el equilibrio exige iROAS de 2,5: cada real invertido devuelve 0,72 de margenescenario ilustrativo calculado con el motor de las calculadoras del blog
Mirando solo la barra de arriba, la campaña parece una máquina de ganancias. La de abajo dice que pierde dinero en el margen. Ninguna de las dos está “equivocada” en su propia cuenta; solo la de abajo responde a la pregunta causal.

Las métricas que salen de un test de lift

Un test de incrementalidad produce pocas métricas, y todas derivan de la misma diferencia. Google lista, para el estudio por usuarios, conversiones incrementales (lift absoluto), lift relativo, valor de conversión incremental, costo por acción incremental (iCPA, el gasto dividido por las conversiones incrementales) y retorno incremental sobre la inversión (iROAS, el valor incremental dividido por el gasto). Meta explica un paso que mucha gente se salta: antes de comparar, escala el grupo de control al mismo tamaño del grupo de test.

métrica cómo se calcula qué responde cuidado
Tasa de conversión por grupo conversiones del grupo divididas por las personas del grupo cuál fue el comportamiento de cada lado las dos tasas incluyen a quien no vio el anuncio
Lift relativo tasa del test menos tasa del control, dividido por la tasa del control cuánto aumentó la campaña la conversión, en proporción diluido por el alcance, como muestra la sección de dilución
Conversiones incrementales conversiones del test menos conversiones del control escaladas al tamaño del test cuántas conversiones existen por causa de los medios viene con intervalo, nunca es un número exacto
iCPA gasto dividido por las conversiones incrementales cuánto costó cada conversión causada el intervalo es asimétrico y se vuelve enorme cuando el lift es pequeño
iROAS ingreso incremental dividido por el gasto cuánto ingreso causó cada real de medios compáralo con el iROAS de equilibrio, que depende de tu margen
Razón atribuido sobre incremental conversiones atribuidas divididas por las incrementales cuánto exagera la atribución en esta campaña vale solo para esta campaña, en esta ventana

La última fila es la más útil en el día a día. Una vez medida, sirve como factor de corrección aproximado para leer el panel de atribución entre un test y otro, con la salvedad de que cambia cuando cambia el público, la puja o el creativo.

El iROAS de equilibrio sale del margen de contribución: con margen de 40 por ciento, cada real de ingreso incremental deja 40 centavos, así que el anuncio se paga a partir de un iROAS de 2,5 (1 dividido por 0,4). Por debajo de eso, la campaña puede incluso vender, pero destruye margen. La calculadora de ROAS y la calculadora de CPA hacen esas cuentas con tus números; lo que cambia aquí es usar el numerador incremental.

Tres formas de montar el grupo de control

El grupo de control tiene que responder “qué habría pasado con esas mismas personas sin el anuncio”. Johnson, Lewis y Nubbemeyer describen los dos diseños tradicionales, proponen un tercero y señalan los problemas de cada uno.

Anuncio de utilidad pública (PSA). El control ve un anuncio neutro, de una causa benéfica, por ejemplo, en lugar del anuncio de la marca. La ventaja es saber quién, en el control, habría sido expuesto. Los autores señalan dos problemas: es caro y sujeto a error, porque exige coordinar anunciante, medio y terceros, y deja de ser válido cuando la entrega está optimizada por algoritmo. Si la plataforma optimiza cada anuncio para su propio resultado, entrega el anuncio de la marca a un tipo de persona y el PSA a otro, y los dos grupos expuestos dejan de ser comparables.

Intención de tratar (ITT). Se sortea el público elegible, el control simplemente no recibe el anuncio, y se comparan los grupos enteros. Es válido y fácil de implementar, y es lo que Meta informa usar. El costo es precisión: quien fue sorteado al test y nunca vio el anuncio entra en la cuenta solo como ruido. Los autores notan que, cuando todas las impresiones son elegibles, la fracción de usuarios efectivamente tratados puede ser muy pequeña, 3 por ciento o menos. El razonamiento general de analizar por el sorteo está en la guía de intención de tratar en test A/B.

Anuncio fantasma (ghost ads). La plataforma registra, en el control, cada ocasión en que habría entregado el anuncio de la marca, pero entrega lo que entregaría si la marca no estuviera anunciando. El control ve la mezcla normal de anuncios competidores, y el experimentador sabe quién habría sido expuesto. Como la exposición prevista existe en los dos grupos, se puede comparar solo a quien habría visto el anuncio, sin el ruido del resto.

Tres diseños de grupo de control en un test de anuncioTres columnas. Anuncio de utilidad pública: el control ve un anuncio neutro, y la comparación es entre expuestos de los dos lados, pero la optimización de la entrega rompe la simetría. Intención de tratar: el control no recibe nada, y la comparación es entre los grupos enteros, incluyendo a quien nunca vería el anuncio. Anuncio fantasma: el control ve los anuncios que vería de todas formas, y la plataforma marca quién habría visto el anuncio de la marca, permitiendo comparar solo a esas personas.quién entra en la comparación cambia la precisión y la validez del testutilidad públicatest: anuncio de la marcacontrol: anuncio neutrocompara expuestoscon expuestos al neutroproblemacaro de coordinarla entrega optimizada eligepersonas distintas paracada anunciointención de tratartest: elegible al anunciocontrol: no recibe nadacompara los gruposenteros, como se sortearonproblemaquien nunca vio el anuncioentra como ruido y diluyeel efecto: pide mucha másmuestraanuncio fantasmatest: anuncio de la marcacontrol: lo que vería sin élcompara a quien vio conquien habría vistolímitesolo la plataforma lograregistrar la exposiciónprevista; no lo montaspor fuera
Los tres diseños son experimentos; la diferencia es cuánto ruido entra en la comparación y si la optimización de la entrega preserva la simetría entre los grupos.

En el caso que Johnson, Lewis y Nubbemeyer midieron, una campaña de remarketing de un minorista de artículos deportivos en la red de display de Google, la versión de trabajo del artículo (2015) reporta, contando a partir de la primera exposición prevista, un aumento de 17,2 por ciento en las visitas al sitio, 12,0 por ciento en las transacciones y 10,8 por ciento en las ventas. La razón entre las varianzas de las estimaciones por intención de tratar y por anuncio fantasma quedó entre 5,9 y 16,4, y los autores concluyen que un experimento solo con intención de tratar necesitaría ser cerca de un orden de magnitud mayor para llegar a la misma confianza.

diseño quién queda en el control precisión ¿funciona con entrega optimizada? quién puede correrlo
Utilidad pública expuestos a un anuncio neutro alta, si la entrega es simétrica no, según Johnson y coautores anunciante con medio aliado, con costo de medios en el control
Intención de tratar todo el público sorteado hacia afuera baja cuando el alcance es bajo sí la propia plataforma, o tú, con listas sorteadas
Anuncio fantasma quien habría sido expuesto alta sí solo la plataforma que entrega el anuncio
Experimento geográfico regiones enteras sin la campaña baja por persona, la unidad es la región sí tú, con cualquier canal segmentable por región

Cómo diseñar un test de incrementalidad con holdout

Antes de pedir el estudio en la plataforma, cinco decisiones definen si el resultado va a servir para algo.

  1. La decisión que el test va a informar. “¿Duplicar la inversión de remarketing?”, “¿mantener la búsqueda de marca?”. Sin decisión, el lift se vuelve curiosidad.
  2. La conversión que decide. Compra, cuenta pagada, venta confirmada. Google recomienda medir también acciones de medio de embudo como secundarias, porque muestran un lift mayor y ayudan cuando la conversión final tiene poco volumen; la decisión, sin embargo, queda con la conversión que paga las cuentas.
  3. El tamaño del holdout. Un control mayor da precisión y cuesta conversiones que dejas de causar. Google acepta de 1 a 50 por ciento en el estudio por usuarios y dice que los holdouts menores exigen estudios más largos.
  4. La duración. Google permite estudios de 7 días, recomienda más de 14 y reporta haber encontrado hasta 17 por ciento de caída en el lift absoluto en estudios con retraso de conversión largo que corrieron menos de 14 días. Las semanas completas también evitan que el día de la semana se mezcle con el efecto.
  5. El congelamiento. Durante el estudio, los cambios de creativo y de público dificultan la lectura, según la propia ayuda de Google, que recomienda limitar las alteraciones a lo rutinario, como pujas e inversión.

Las dos plataformas también tienen requisitos de entrada. Meta indica, como referencia, una campaña iniciada en el último año con un gasto de al menos 5 mil dólares y 500 conversiones, con exigencias de calidad de señal (Conversions API con puntuación de correspondencia por encima de 5, o fuente compatible de evento de fondo de embudo). Google no deja guardar el estudio por usuarios con un presupuesto por debajo de 5 mil dólares, libera resultados direccionales con presupuesto por encima de 5 mil dólares y mil conversiones, e informa que el recurso no está disponible para todas las cuentas. Todo eso fue verificado el 16/09/2026 y cambia con frecuencia.

El precio del control pequeño

El control pequeño es tentador porque pierde menos ventas, pero la precisión depende del grupo menor. Para la misma precisión, una división con fracción q en el control pide el total de la división 50/50 multiplicado por 1 dividido por 4 por q por (1 menos q). Con 10 por ciento en el control, el factor es 2,78.

La tabla usa el escenario de ecommerce del ejemplo de abajo: tasa base de 0,6 por ciento, efecto de 10 por ciento relativo, 95 por ciento de confianza y 80 por ciento de poder. La última columna muestra las compras incrementales que el control deja de generar en un público de 2 millones, si el efecto es de verdad de 10 por ciento.

fracción en el control personas necesarias en total de las cuales en el control poder con 2 millones de personas compras incrementales que el control deja de generar
5% 2.873.464 143.673 cerca de 63% 60
10% 1.516.550 151.655 cerca de 89% 120
20% 853.060 170.612 cerca de 99% 240
30% 649.950 194.985 por encima de 99% 360
50% 545.958 272.979 prácticamente 100% 600

Los totales parten del número por grupo de la calculadora de muestra (272.979) y de la fórmula de arriba; los poderes vienen de la misma aproximación normal de la calculadora, adaptada para grupos desiguales. La lectura: bajar de 10 a 5 por ciento ahorra 60 compras y derrumba el poder de 89 a cerca de 63 por ciento. Es el tipo de ahorro que hace que el test entero se vuelva desperdicio.

Poder estadístico con tasas bajas

Los medios pagados mueven poco la conversión de cada persona, y la conversión por persona es rara. Esa combinación es el tema de Lewis y Rao, que analizaron 25 experimentos de campo con grandes minoristas y corredoras en Estados Unidos, sumando 2,8 millones de dólares en medios digitales. Lo que encontraron:

El título del artículo lo resume: la economía de medir el retorno de la publicidad es desfavorable. No quiere decir que el experimento sea inútil, quiere decir que el experimento pequeño es inútil y que necesitas dimensionar antes. Para una métrica binaria, como compra sí o no, la calculadora de tamaño de muestra hace la cuenta; para ingreso por persona, la varianza pesa aún más, y el razonamiento de efecto mínimo detectable vale igual. La calculadora de poder estadístico muestra lo que un test ya corrido lograba ver.

Dilución: quien nunca vio el anuncio

En un test por intención de tratar, el grupo de test incluye a quien fue sorteado y nunca recibió el anuncio. Esas personas no tienen cómo ser afectadas, así que el efecto medio del grupo entero es el efecto sobre los expuestos multiplicado por la fracción expuesta. Gordon y coautores escriben esa relación de forma explícita: el efecto sobre los tratados es el efecto por intención de tratar dividido por la fracción del grupo de test que recibió el tratamiento, cuando nadie del control es expuesto.

Eso tiene dos consecuencias prácticas.

La tabla y el gráfico de abajo usan el escenario SaaS del ejemplo: tasa base de 2 por ciento en el grupo entero, efecto fijo de 0,75 punto porcentual entre expuestos, 95 por ciento de confianza y 80 por ciento de poder. Es una simplificación (en la vida real, la tasa base de los alcanzables suele ser distinta de la de los demás), pero muestra el orden de magnitud.

alcance en el grupo de test efecto en el grupo entero lift relativo en el grupo entero personas por grupo
20% 0,15 pp 7,5% 141.764
40% 0,30 pp 15,0% 36.693
60% 0,45 pp 22,5% 16.864
80% 0,60 pp 30,0% 9.798
100% 0,75 pp 37,5% 6.470
Personas por grupo necesarias según el alcance de la campañaBarras horizontales para alcance de 20, 40, 60, 80 y 100 por ciento, con efecto fijo de 0,75 punto porcentual entre expuestos y tasa base de 2 por ciento. Personas por grupo: 141.764, 36.693, 16.864, 9.798 y 6.470.la mitad del alcance, cerca de cuatro veces la muestraalcance 20%141.764alcance 40%36.693alcance 60%16.864alcance 80%9.798alcance 100%6.470efecto fijo de 0,75 pp entre expuestos, base de 2%, 95% de confianza, 80% de poder, bilateralpersonas por grupo, calculadas con el motor de las calculadoras del blog
Por eso importa el anuncio fantasma: saca de la comparación a quien nunca habría visto el anuncio. Sin él, cada punto de alcance perdido cuesta muestra en proporción cuadrática.

Una trampa común: intentar “corregir” la dilución comparando solo a los expuestos del test con el control entero. Eso reintroduce el sesgo de selección del comienzo del artículo, porque los expuestos fueron elegidos por la entrega. La corrección honesta es dividir el efecto por intención de tratar por la fracción expuesta (y el intervalo junto), o usar el diseño que marca la exposición prevista en los dos lados.

Ejemplo trabajado 1: prospección y remarketing de un ecommerce

Escenario (ilustrativo). Una tienda de artículos para el hogar invierte R$ 150.000 en cuatro semanas en una campaña de prospección y remarketing en una plataforma social. El ticket medio es de R$ 250 y el margen de contribución es de 40 por ciento. El panel de la plataforma atribuye 4.800 compras a la campaña, lo que da un ROAS atribuido de 8,0 y un CPA atribuido de R$ 31,25. El equipo pide un estudio de lift con 10 por ciento de holdout sobre un público elegible de 2 millones de personas.

Muestra. Antes de correrlo, el equipo dimensiona. La tasa de compra del público en cuatro semanas, sin anuncio, gira en torno al 0,6 por ciento, y el menor efecto que cambiaría la decisión es de 10 por ciento relativo. En la calculadora de abajo, escribe: tasa de conversión actual 0,6; efecto mínimo detectable 10, relativo; confianza 95; poder 80; visitantes por semana 500000; test bilateral.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La pantalla muestra 272.979 por variación, 545.958 en total y 8 días. Esos números valen para una división 50/50, que es lo que la calculadora asume. Con 90/10, el total sube a 1.516.550 por el factor de 2,78 de la sección anterior, y el campo de días deja de aplicar. Con 2 millones de personas y 10 por ciento en el control, el poder para un efecto de 10 por ciento queda en cerca de 89 por ciento.

El resultado.

grupo personas compras tasa
control (sin anuncio) 200.000 1.200 0,60%
test (elegible al anuncio) 1.800.000 11.880 0,66%

Pega en la calculadora de significancia: control con 200000 visitantes y 1200 conversiones; variación con 1800000 visitantes y 11880 conversiones; confianza 95.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

La pantalla muestra 0,60% contra 0,66%, mejora relativa de +10,0%, valor-p de 0,0016, intervalo de +0,0% … +0,1% (pp) y el veredicto Ganadora con significancia · B gana. El intervalo aparece redondeado a un decimal porque las tasas son pequeñas; con más decimales, va de más 0,0241 a más 0,0959 punto porcentual, y el valor-p es 0,00159. La calculadora acepta grupos de tamaños distintos, así que la cuenta vale para el 90/10.

Del lift al dinero. Ahora la parte que el informe de lift hace y la calculadora no:

paso cuenta resultado
control escalado al tamaño del test 1.200 por 9 10.800 compras
compras incrementales 11.880 menos 10.800 1.080
costo por compra incremental (iCPA) R$ 150.000 divididos por 1.080 R$ 138,89
ingreso incremental 1.080 por R$ 250 R$ 270.000
iROAS R$ 270.000 divididos por R$ 150.000 1,80
razón atribuido sobre incremental 4.800 divididos por 1.080 4,44
intervalo de 95% de las compras incrementales intervalo de la diferencia por 1.800.000 de 435 a 1.725
intervalo de 95% del iROAS misma proporción de 0,72 a 2,88
intervalo de 95% del iCPA gasto dividido por los extremos de R$ 86,94 a R$ 345,11
Intervalo de confianza del iROAS contra el punto de equilibrioEje de iROAS de 0 a 4. Estimación de 1,80 con intervalo de 95 por ciento de 0,72 a 2,88. Línea vertical en 2,5, el iROAS de equilibrio para un margen de 40 por ciento. Marca del ROAS atribuido de 8,0 fuera de la escala, a la derecha.el iROAS más probable queda debajo del equilibrio; el atribuido ni cabe en el eje01234equilibrio 2,5iROAS 1,800,722,88ROAS atribuido 8,0intervalo de 95% de la diferencia de tasas convertido en ingreso incremental por real invertidoescenario ilustrativo calculado con el motor de las calculadoras del blog
El lift es significativo, la campaña causa ventas. Lo que el intervalo no sostiene es que se pague: la estimación queda debajo de 2,5 y solo la punta de arriba del intervalo pasa el equilibrio.

Qué dice el resultado. Dos cosas verdaderas al mismo tiempo. La campaña funciona: el valor-p de 0,0016 indica que el lift de 10 por ciento difícilmente sea ruido. Y la campaña probablemente no se paga con ese margen: la estimación de iROAS es 1,80, contra 2,5 de equilibrio. Solo 22,5 por ciento de las compras atribuidas son incrementales. Quien mirara solo el ROAS de 8,0 duplicaría la inversión.

Qué hacer con él. No apagar todo, porque el intervalo llega a 2,88 y un solo test no cierra la cuestión. El camino honesto es separar las partes: un estudio solo de remarketing y otro solo de prospección, porque las dos pueden tener incrementalidad muy distinta, y bajar la inversión de la parte con peor iROAS mientras corre el próximo test. Guarda la razón de 4,44 como factor de lectura del panel hasta el próximo estudio.

Ejemplo trabajado 2: remarketing de un SaaS con lista sorteada

Escenario (ilustrativo). Un SaaS B2B hace remarketing hacia quien inició una prueba y no se suscribió. La lista recibe cerca de 20 mil personas nuevas por semana. Como la plataforma no ofrece estudio de lift para esa cuenta, el equipo sortea su propia lista: la mitad entra en la audiencia de la campaña, la mitad va a una lista de exclusión. Es intención de tratar hecha en casa, lo que Johnson y coautores describen como posible cuando el anunciante tiene una lista previa de elegibles, con la advertencia de que los recursos de expansión de público (como públicos similares) pueden llevar el anuncio a quien está en la lista de control. El equipo apaga la expansión.

La conversión que decide es cuenta pagada en hasta 30 días, con tasa base de 2 por ciento. El valor de una cuenta en el primer año es de R$ 1.800. El gasto del período es de R$ 24.000, y la plataforma atribuye 410 cuentas pagadas: CPA atribuido de R$ 58,54.

Muestra. En la calculadora de muestra de más arriba, cambia los campos: tasa actual 2; efecto mínimo 15, relativo; confianza 95; poder 80; visitantes por semana 20000; bilateral. La pantalla muestra 36.693 por variación, 73.386 en total y 26 días. El equipo corre cuatro semanas completas, 28 días, y cierra con 40.000 personas en cada grupo. Con ese tamaño, el poder para 15 por ciento es de cerca de 83 por ciento, y el menor efecto detectable con 80 por ciento de poder es de cerca de 13,9 por ciento relativo.

El resultado, 30 días después del fin de la entrada en la lista.

grupo personas cuentas pagadas tasa
control (lista de exclusión) 40.000 800 2,00%
test (audiencia de la campaña) 40.000 920 2,30%

En la calculadora de significancia, escribe 40000 y 800 en el control y 40000 y 920 en la variación. La pantalla muestra 2,00% contra 2,30%, mejora de +15,0%, valor-p de 0,0034, intervalo de +0,1% … +0,5% (pp) y Ganadora con significancia · B gana. Con más decimales, el intervalo va de más 0,0990 a más 0,5010 punto porcentual.

métrica atribuida por la plataforma medida por el holdout
cuentas pagadas 410 120 incrementales (intervalo de 40 a 200)
costo por cuenta R$ 58,54 R$ 200,00 (intervalo de R$ 119,76 a R$ 606,10)
retorno sobre el gasto, valor del 1er año 30,75 9,0

La lectura de la dilución. Según el informe de la plataforma, el alcance de la campaña fue de 40 por ciento de la audiencia: 16.000 de las 40.000 personas del test vieron el anuncio al menos una vez. Las 24.000 restantes no tenían cómo cambiar de comportamiento. El aumento de 0,30 punto porcentual en el grupo entero corresponde, por la división por la fracción expuesta, a 0,75 punto porcentual entre los expuestos. Si, como hipótesis ilustrativa, quien la campaña alcanza convirtiera a 3,5 por ciento sin anuncio (y los demás a 1,0 por ciento, lo que mantiene la media de 2 por ciento), el lift entre expuestos es de cerca de 21,4 por ciento relativos, bastante por encima del 15 por ciento del informe.

Esa lectura también muestra lo que ahorraría un diseño con exposición prevista. Comparando solo a los alcanzables, escribe en la calculadora de muestra tasa 3,5 y efecto 0,75 en el modo absoluto (pp): la pantalla muestra 10.394 por variación y 20.788 en total. Como solo el 40 por ciento de la lista es alcanzable, encontrar 20.788 alcanzables exige cerca de 52 mil personas de la lista, lo que a 20 mil por semana da cerca de 19 días, en lugar de los 26 del diseño por intención de tratar (esa conversión a días es de esta guía, no de la calculadora). El ahorro aquí es modesto porque el alcance es de 40 por ciento; con alcance de 3 por ciento, la fracción de tratados que Johnson y coautores dan como ejemplo cuando todas las impresiones son elegibles, sería mucho mayor.

Qué hacer con él. El remarketing se paga con holgura en el valor del primer año, incluso en la punta mala del intervalo (R$ 606,10 por cuenta contra R$ 1.800 de valor). La decisión sensata es mantenerlo y testear el próximo escalón: aumentar la frecuencia o el alcance y medir de nuevo, porque el efecto entre expuestos sugiere que alcanzar a más gente de la lista vale más de lo que parece en el lift medio. Lo que no se hace es presupuestar por el CPA atribuido de R$ 58,54, que es 3,4 veces menor que el incremental.

Cuándo usar experimento geográfico en lugar de holdout por usuario

El holdout por usuario es más preciso, pero depende de que la plataforma logre sortear y mantener personas fuera del anuncio y de que la conversión pueda ligarse a la persona. Cuando una de esas condiciones falla, la unidad de sorteo pasa a ser la región.

Árbol de decisión entre holdout por usuario y experimento geográficoTres preguntas en secuencia. ¿La plataforma logra sortear personas y mantenerlas fuera del anuncio? ¿La conversión puede ligarse a la persona, por píxel, API de conversiones o lista? ¿Quieres medir solo este canal? Si todas las respuestas son sí, usa holdout por usuario. Si cualquiera es no, usa experimento geográfico, con más presupuesto y menos precisión.tres preguntas antes de elegir la unidad de sorteo1. ¿la plataforma sortea personas y las mantiene fuera del anuncio?2. ¿la conversión se liga a la persona (píxel, API, lista)?3. ¿la pregunta es sobre este canal aislado?sísísí en las tres: holdout por usuarionoexperimentogeográficoventa offline, varioscanales, medios sin objetivomás inversión, menos precisión
El experimento geográfico no es un plan B malo; es el diseño correcto cuando la pregunta o la medición no caben en el nivel de la persona. Solo no esperes de él la precisión del holdout por usuario.

La comparación oficial de Google Ads, verificada el 16/09/2026, describe las dos opciones así. El estudio por usuarios devuelve resultados por acción de conversión, categoría, edad, género y país, pero depende principalmente de tráfico con consentimiento y puede verse afectado por brechas de medición; el presupuesto se define en la configuración con base en el historial de conversiones. El estudio por geografía ofrece transparencia, medición entre canales y conversiones en línea y offline, pero la división es más ruidosa, los resultados no vienen por demografía y el presupuesto exigido tiende a ser mayor.

Los casos típicos para ir por región:

El experimento de eBay con palabras no relacionadas con la marca es un ejemplo clásico: los anuncios fueron apagados en 68 áreas de mercado, y el grupo de comparación se armó a partir de las demás. Cómo hacer eso con rigor (cuántas regiones, período previo al test, por qué el valor-p ingenuo engaña) está en la guía de experimento geográfico, y la cuenta del efecto de diseño está en aleatorización por cluster.

Checklist del test de lift

  1. Decisión escrita antes: qué cambia si el iROAS viene por encima o por debajo del equilibrio.
  2. iROAS de equilibrio calculado a partir del margen, antes de ver el resultado.
  3. Conversión primaria al nivel del dinero, con acciones de medio de embudo solo como secundarias.
  4. Muestra dimensionada para la fracción de control elegida, no para 50/50.
  5. Semanas completas y retraso de conversión cubierto, con al menos 14 días.
  6. Congelamiento de creativo y público durante el estudio.
  7. Sin filtración hacia el control: expansión de público apagada en listas sorteadas en casa, y la misma campaña fuera de otros estudios.
  8. Alcance registrado, para leer el efecto entre expuestos y explicar la dilución.
  9. Intervalo en el informe, no solo el punto: conversiones incrementales, iCPA e iROAS con los extremos.
  10. Repetición planificada: Google observa que la mayoría de los anunciantes corre cerca de uno a dos estudios por año, alineados a ciclos de presupuesto; el resultado envejece cuando cambian público y pujas.

Errores comunes

Haz esto automático en Donnu

El dolor específico de este artículo es que el número que muestra la plataforma de medios no es el número que decide la inversión, y la medición incremental exige cuentas de muestra, de dilución y de intervalo que el panel no hace por ti. Donnu no corre estudios de lift dentro de las plataformas de anuncios; testea páginas. Pero dos partes del problema están a su alcance.

La primera es medir la conversión que vale dinero. En Donnu, la meta de conversión puede confirmarse desde tu servidor (server-to-server), como un pedido pagado confirmado por la pasarela, además de clics, formularios, visitas a páginas y eventos personalizados. La segunda es no confundir el efecto de la página con el efecto de los medios: a partir del plan Pro, el informe de un test de landing page puede filtrarse y segmentarse por origen del tráfico (utm_source), lo que ayuda a ver si una variación gana para el tráfico pagado y pierde para el orgánico, en lugar de mezclar los dos. Antes de tocar la página que recibe los medios, vale saber si los medios causan algo; antes de escalar los medios, vale saber si la página convierte a quien llega.

Las cuentas de esta guía están, gratis, en la calculadora de tamaño de muestra, en la calculadora de significancia, en la calculadora de poder estadístico y en la calculadora de ROAS, esta última alimentada con el ingreso incremental en lugar del atribuido.

Referencias

Lee también: Experimento geográfico · Holdout de largo plazo · Análisis por disparo y dilución · Intención de tratar · Atribuyendo ingresos al ganador · Modelado de uplift · Leia em português · Read in English

Preguntas frecuentes

¿Qué es un test de incrementalidad?
Es un experimento en el que parte del público que la campaña podría alcanzar se sortea hacia un grupo de control que no recibe el anuncio. La diferencia de conversiones entre el grupo de test y el de control es el efecto causal de los medios, llamado lift. Google describe el Conversion Lift exactamente así: la diferencia de conversiones entre quien ve y quien no ve los anuncios muestra el aumento causado por la presencia del anuncio. Meta usa la misma lógica e informa que su Conversion Lift adopta el enfoque de intención de tratar.
¿Por qué el ROAS atribuido es mayor que el iROAS?
Porque la atribución le acredita al anuncio compras de personas que habrían comprado de todas formas, y la plataforma entrega el anuncio justamente a quien tiene más chance de comprar. En los 15 experimentos de Facebook analizados por Gordon y coautores, comparar expuestos con no expuestos indicó, en uno de los estudios, 392 por ciento de lift en checkout, contra 8,6 por ciento medidos por el experimento. En el ejemplo de esta guía, la plataforma atribuye 4.800 compras y un ROAS de 8,0, y el holdout mide 1.080 compras incrementales y un iROAS de 1,80.
¿Cómo calcular conversiones incrementales, iCPA e iROAS?
Escala las conversiones del control al tamaño del grupo de test y réstalas del total del test. Con 1.800.000 personas en el test y 11.880 compras, y 200.000 en el control con 1.200 compras, el control escalado es 10.800 y las compras incrementales son 1.080. El costo por conversión incremental es el gasto dividido por ese número: 150 mil reales divididos por 1.080 dan 138,89 reales. El iROAS es el ingreso incremental dividido por el gasto: 1.080 por 250 reales, dividido por 150 mil, da 1,80.
¿Qué tamaño debe tener el grupo de control en un test de incrementalidad?
Es un intercambio entre precisión y costo de oportunidad. Google Ads acepta de 1 a 50 por ciento de holdout en el Conversion Lift por usuarios. En el ejemplo de esta guía, con 0,6 por ciento de conversión y efecto de 10 por ciento, una división 50/50 pide 545.958 personas en total, y una división 90/10 pide 1.516.550, cerca de 2,78 veces más. Con 2 millones de personas, el control de 10 por ciento da cerca de 89 por ciento de poder, y el de 5 por ciento, cerca de 63 por ciento.
¿Qué es la dilución en un test de holdout de anuncios?
Es la pérdida de señal causada por quien fue sorteado al grupo de test y nunca vio el anuncio. La comparación por sorteo incluye a esas personas, así que el efecto medio queda menor que el efecto sobre quien fue expuesto, en proporción al alcance. En el ejemplo SaaS de esta guía, con alcance de 40 por ciento, un efecto de 0,75 punto porcentual entre expuestos aparece como 0,30 punto en el grupo entero, y la muestra necesaria sube a 36.693 por grupo. Con alcance de 20 por ciento, subiría a 141.764.
¿Cuándo usar un experimento geográfico en lugar de holdout por usuario?
Cuando la plataforma no logra sortear personas, cuando la conversión ocurre fuera del alcance de la identificación, como una venta en tienda física, o cuando quieres medir varios canales juntos. Google Ads describe el Conversion Lift por geografía como compatible con conversiones offline y con medición entre canales, pero con una división de grupos más ruidosa y un presupuesto mínimo que tiende a ser mayor que el de los estudios por usuario. Si se puede sortear y medir por persona, el holdout por usuario es más preciso.