Test de Incrementalidad: el lift real de los medios pagados
Test de incrementalidad con holdout: cómo medir el lift real de los medios pagados, el iROAS y el costo incremental sin confiar en el ROAS atribuido.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Un test de incrementalidad separa, por sorteo, una parte del público de la campaña en un grupo de control que no recibe el anuncio y mide cuántas conversiones de más generó el grupo de test. Esa diferencia es el lift, y es el único número que responde “¿cuánto causaron estos medios?”. El ROAS que la plataforma atribuye responde otra pregunta, y suele ser bastante mayor: en el ejemplo trabajado de esta guía, la campaña muestra un ROAS atribuido de 8,0 y el holdout mide un iROAS de 1,80, por debajo del punto de equilibrio. Este artículo forma parte de nuestra guía completa de test A/B y cubre las tres formas de montar el control (anuncio de utilidad pública, anuncio fantasma e intención de tratar), las métricas que salen del test, el problema de poder estadístico con tasas bajas, la dilución causada por quien nunca vio el anuncio y cuándo cambiar el holdout por usuario por un experimento geográfico.
Qué es un test de incrementalidad
La pregunta que los medios pagados quieren responder es contrafactual: ¿cuántas de esas ventas no habrían ocurrido sin el anuncio? Como nadie observa a la misma persona con y sin anuncio al mismo tiempo, el experimento crea dos grupos parecidos por sorteo y deja que solo uno de ellos reciba la campaña.
La documentación de Google Ads, verificada el 16/09/2026, describe el Conversion Lift así: el público se separa entre quien ve los anuncios (tratamiento) y quien no los ve (control), y la diferencia de conversiones entre los dos grupos es el lift, el aumento causado por la presencia del anuncio. El centro de ayuda de Meta, verificado en la misma fecha, usa la misma definición y agrega un detalle que cambia la lectura del resultado: el Conversion Lift de Meta adopta el enfoque de intención de tratar. El grupo de test reúne a quien puede ver el anuncio, y dentro de él hay quien lo vio y quien no, por límite de entrega o porque no bajó la pantalla hasta el anuncio.
Tres términos aparecen en todo informe de este tipo:
- Holdout (o control): la porción del público que queda fuera de la campaña durante el test.
- Lift: la diferencia de conversiones entre test y control, en número absoluto o relativo.
- Incremental: lo que existe solo por causa del anuncio. Conversión incremental, ingreso incremental, costo por conversión incremental.
No lo confundas con tres vecinos. El holdout de largo plazo mantiene un grupo sin un cambio de producto durante meses para medir si el efecto sobrevive. El test A/B de creativo compara dos anuncios entre sí y dice cuál es mejor, no si alguno de los dos vale el dinero. Y atribuyendo ingresos al ganador trata de proyectar el valor de una variación de página que ya ganó. Aquí el foco es otro: sortear quién recibe medios y leer el lift que causan.
Por qué el ROAS atribuido miente
El ROAS atribuido divide el ingreso que el modelo de atribución le acredita a la campaña por el gasto. El problema no es la cuenta, es el crédito. Tres mecanismos inflan el número, y los tres están documentados en experimentos grandes.
1. La plataforma elige a quien tiene más chance de comprar. Gordon, Zettelmeyer, Bhargava y Chapsky analizaron 15 experimentos de anuncio en Estados Unidos, en Facebook, sumando 500 millones de observaciones del tipo usuario-experimento y 1,6 mil millones de impresiones. Describen que el sistema de entrega le da más peso a usuarios con mayor predicción de conversión, y que por eso comparar expuestos con no expuestos sobreestima el efecto del anuncio. Describen también el “sesgo de actividad”: para ser expuesto, el usuario necesita haber entrado a la plataforma durante la campaña, y quien está más activo en línea también tiende a convertir más en línea, con o sin anuncio.
2. La búsqueda pagada por la propia marca captura a quien ya venía en camino. Blake, Nosko y Tadelis reportan que, cuando eBay apagó los anuncios de búsqueda para términos de su propia marca en Yahoo! y MSN, el 99,5 por ciento de los clics perdidos fue recuperado por el resultado orgánico. Para las palabras no relacionadas con la marca, en un experimento por regiones, las estimaciones no experimentales de retorno pasaban del 4.100 por ciento sin controles de tiempo y región, y del 1.400 por ciento con ellos; el experimento midió un retorno de menos 63 por ciento, con intervalo de 95 por ciento de menos 124 a menos 3 por ciento.
3. El remarketing le habla a quien ya estaba decidido. Johnson, Lewis y Nubbemeyer recuerdan que la eficacia del remarketing es controvertida justamente por eso: quien recibe el anuncio es un grupo muy seleccionado, que tal vez compraría de todas formas. En el caso que ellos midieron, el efecto existía (más sobre eso adelante), pero solo el experimento logró mostrar el tamaño.
La tabla de abajo reproduce parte de la tabla 6 de la versión de los autores de Gordon y coautores, con la métrica de checkout. La columna “expuestos contra no expuestos” es lo que un panel de atribución ingenuo tiende a mostrar; la columna del experimento es el lift causal.
| estudio | lift estimado comparando expuestos con no expuestos | lift medido por el experimento |
|---|---|---|
| 11 | 392% | 8,6% |
| 3 | 198% | 8,8% |
| 2 | 377% | 1,3% |
| 4 | 316% | 73% |
| 9 | 4.074% | 2,4% |
| 13 | 61% | -15% |
No es que la comparación ingenua se equivoque siempre hacia el mismo lado o por el mismo factor. Los autores reportan que, en la mitad de los estudios, la estimación porcentual de aumento en compras se equivoca por un factor de tres en todos los métodos observacionales que testearon, y que en algunos casos el error es hacia abajo. El punto es que no sabes de antemano el tamaño ni la dirección del error, y por eso necesitas el control sorteado.
Las métricas que salen de un test de lift
Un test de incrementalidad produce pocas métricas, y todas derivan de la misma diferencia. Google lista, para el estudio por usuarios, conversiones incrementales (lift absoluto), lift relativo, valor de conversión incremental, costo por acción incremental (iCPA, el gasto dividido por las conversiones incrementales) y retorno incremental sobre la inversión (iROAS, el valor incremental dividido por el gasto). Meta explica un paso que mucha gente se salta: antes de comparar, escala el grupo de control al mismo tamaño del grupo de test.
| métrica | cómo se calcula | qué responde | cuidado |
|---|---|---|---|
| Tasa de conversión por grupo | conversiones del grupo divididas por las personas del grupo | cuál fue el comportamiento de cada lado | las dos tasas incluyen a quien no vio el anuncio |
| Lift relativo | tasa del test menos tasa del control, dividido por la tasa del control | cuánto aumentó la campaña la conversión, en proporción | diluido por el alcance, como muestra la sección de dilución |
| Conversiones incrementales | conversiones del test menos conversiones del control escaladas al tamaño del test | cuántas conversiones existen por causa de los medios | viene con intervalo, nunca es un número exacto |
| iCPA | gasto dividido por las conversiones incrementales | cuánto costó cada conversión causada | el intervalo es asimétrico y se vuelve enorme cuando el lift es pequeño |
| iROAS | ingreso incremental dividido por el gasto | cuánto ingreso causó cada real de medios | compáralo con el iROAS de equilibrio, que depende de tu margen |
| Razón atribuido sobre incremental | conversiones atribuidas divididas por las incrementales | cuánto exagera la atribución en esta campaña | vale solo para esta campaña, en esta ventana |
La última fila es la más útil en el día a día. Una vez medida, sirve como factor de corrección aproximado para leer el panel de atribución entre un test y otro, con la salvedad de que cambia cuando cambia el público, la puja o el creativo.
El iROAS de equilibrio sale del margen de contribución: con margen de 40 por ciento, cada real de ingreso incremental deja 40 centavos, así que el anuncio se paga a partir de un iROAS de 2,5 (1 dividido por 0,4). Por debajo de eso, la campaña puede incluso vender, pero destruye margen. La calculadora de ROAS y la calculadora de CPA hacen esas cuentas con tus números; lo que cambia aquí es usar el numerador incremental.
Tres formas de montar el grupo de control
El grupo de control tiene que responder “qué habría pasado con esas mismas personas sin el anuncio”. Johnson, Lewis y Nubbemeyer describen los dos diseños tradicionales, proponen un tercero y señalan los problemas de cada uno.
Anuncio de utilidad pública (PSA). El control ve un anuncio neutro, de una causa benéfica, por ejemplo, en lugar del anuncio de la marca. La ventaja es saber quién, en el control, habría sido expuesto. Los autores señalan dos problemas: es caro y sujeto a error, porque exige coordinar anunciante, medio y terceros, y deja de ser válido cuando la entrega está optimizada por algoritmo. Si la plataforma optimiza cada anuncio para su propio resultado, entrega el anuncio de la marca a un tipo de persona y el PSA a otro, y los dos grupos expuestos dejan de ser comparables.
Intención de tratar (ITT). Se sortea el público elegible, el control simplemente no recibe el anuncio, y se comparan los grupos enteros. Es válido y fácil de implementar, y es lo que Meta informa usar. El costo es precisión: quien fue sorteado al test y nunca vio el anuncio entra en la cuenta solo como ruido. Los autores notan que, cuando todas las impresiones son elegibles, la fracción de usuarios efectivamente tratados puede ser muy pequeña, 3 por ciento o menos. El razonamiento general de analizar por el sorteo está en la guía de intención de tratar en test A/B.
Anuncio fantasma (ghost ads). La plataforma registra, en el control, cada ocasión en que habría entregado el anuncio de la marca, pero entrega lo que entregaría si la marca no estuviera anunciando. El control ve la mezcla normal de anuncios competidores, y el experimentador sabe quién habría sido expuesto. Como la exposición prevista existe en los dos grupos, se puede comparar solo a quien habría visto el anuncio, sin el ruido del resto.
En el caso que Johnson, Lewis y Nubbemeyer midieron, una campaña de remarketing de un minorista de artículos deportivos en la red de display de Google, la versión de trabajo del artículo (2015) reporta, contando a partir de la primera exposición prevista, un aumento de 17,2 por ciento en las visitas al sitio, 12,0 por ciento en las transacciones y 10,8 por ciento en las ventas. La razón entre las varianzas de las estimaciones por intención de tratar y por anuncio fantasma quedó entre 5,9 y 16,4, y los autores concluyen que un experimento solo con intención de tratar necesitaría ser cerca de un orden de magnitud mayor para llegar a la misma confianza.
| diseño | quién queda en el control | precisión | ¿funciona con entrega optimizada? | quién puede correrlo |
|---|---|---|---|---|
| Utilidad pública | expuestos a un anuncio neutro | alta, si la entrega es simétrica | no, según Johnson y coautores | anunciante con medio aliado, con costo de medios en el control |
| Intención de tratar | todo el público sorteado hacia afuera | baja cuando el alcance es bajo | sí | la propia plataforma, o tú, con listas sorteadas |
| Anuncio fantasma | quien habría sido expuesto | alta | sí | solo la plataforma que entrega el anuncio |
| Experimento geográfico | regiones enteras sin la campaña | baja por persona, la unidad es la región | sí | tú, con cualquier canal segmentable por región |
Cómo diseñar un test de incrementalidad con holdout
Antes de pedir el estudio en la plataforma, cinco decisiones definen si el resultado va a servir para algo.
- La decisión que el test va a informar. “¿Duplicar la inversión de remarketing?”, “¿mantener la búsqueda de marca?”. Sin decisión, el lift se vuelve curiosidad.
- La conversión que decide. Compra, cuenta pagada, venta confirmada. Google recomienda medir también acciones de medio de embudo como secundarias, porque muestran un lift mayor y ayudan cuando la conversión final tiene poco volumen; la decisión, sin embargo, queda con la conversión que paga las cuentas.
- El tamaño del holdout. Un control mayor da precisión y cuesta conversiones que dejas de causar. Google acepta de 1 a 50 por ciento en el estudio por usuarios y dice que los holdouts menores exigen estudios más largos.
- La duración. Google permite estudios de 7 días, recomienda más de 14 y reporta haber encontrado hasta 17 por ciento de caída en el lift absoluto en estudios con retraso de conversión largo que corrieron menos de 14 días. Las semanas completas también evitan que el día de la semana se mezcle con el efecto.
- El congelamiento. Durante el estudio, los cambios de creativo y de público dificultan la lectura, según la propia ayuda de Google, que recomienda limitar las alteraciones a lo rutinario, como pujas e inversión.
Las dos plataformas también tienen requisitos de entrada. Meta indica, como referencia, una campaña iniciada en el último año con un gasto de al menos 5 mil dólares y 500 conversiones, con exigencias de calidad de señal (Conversions API con puntuación de correspondencia por encima de 5, o fuente compatible de evento de fondo de embudo). Google no deja guardar el estudio por usuarios con un presupuesto por debajo de 5 mil dólares, libera resultados direccionales con presupuesto por encima de 5 mil dólares y mil conversiones, e informa que el recurso no está disponible para todas las cuentas. Todo eso fue verificado el 16/09/2026 y cambia con frecuencia.
El precio del control pequeño
El control pequeño es tentador porque pierde menos ventas, pero la precisión depende del grupo menor. Para la misma precisión, una división con fracción q en el control pide el total de la división 50/50 multiplicado por 1 dividido por 4 por q por (1 menos q). Con 10 por ciento en el control, el factor es 2,78.
La tabla usa el escenario de ecommerce del ejemplo de abajo: tasa base de 0,6 por ciento, efecto de 10 por ciento relativo, 95 por ciento de confianza y 80 por ciento de poder. La última columna muestra las compras incrementales que el control deja de generar en un público de 2 millones, si el efecto es de verdad de 10 por ciento.
| fracción en el control | personas necesarias en total | de las cuales en el control | poder con 2 millones de personas | compras incrementales que el control deja de generar |
|---|---|---|---|---|
| 5% | 2.873.464 | 143.673 | cerca de 63% | 60 |
| 10% | 1.516.550 | 151.655 | cerca de 89% | 120 |
| 20% | 853.060 | 170.612 | cerca de 99% | 240 |
| 30% | 649.950 | 194.985 | por encima de 99% | 360 |
| 50% | 545.958 | 272.979 | prácticamente 100% | 600 |
Los totales parten del número por grupo de la calculadora de muestra (272.979) y de la fórmula de arriba; los poderes vienen de la misma aproximación normal de la calculadora, adaptada para grupos desiguales. La lectura: bajar de 10 a 5 por ciento ahorra 60 compras y derrumba el poder de 89 a cerca de 63 por ciento. Es el tipo de ahorro que hace que el test entero se vuelva desperdicio.
Poder estadístico con tasas bajas
Los medios pagados mueven poco la conversión de cada persona, y la conversión por persona es rara. Esa combinación es el tema de Lewis y Rao, que analizaron 25 experimentos de campo con grandes minoristas y corredoras en Estados Unidos, sumando 2,8 millones de dólares en medios digitales. Lo que encontraron:
- La desviación estándar de las ventas por persona suele ser 10 veces la media en la ventana típica de evaluación.
- En la campaña mediana, para rendir un retorno de 25 por ciento, el anuncio tenía que aumentar la venta media por persona en 35 centavos de dólar, en una variable con media de 7 y desviación estándar de 75 dólares.
- El error estándar mediano del retorno sobre la inversión fue de 26,1 por ciento en los experimentos minoristas, lo que da un intervalo de confianza con más de 100 puntos porcentuales de ancho.
- Los experimentos informativos pueden exigir más de 10 millones de personas-semana.
El título del artículo lo resume: la economía de medir el retorno de la publicidad es desfavorable. No quiere decir que el experimento sea inútil, quiere decir que el experimento pequeño es inútil y que necesitas dimensionar antes. Para una métrica binaria, como compra sí o no, la calculadora de tamaño de muestra hace la cuenta; para ingreso por persona, la varianza pesa aún más, y el razonamiento de efecto mínimo detectable vale igual. La calculadora de poder estadístico muestra lo que un test ya corrido lograba ver.
Dilución: quien nunca vio el anuncio
En un test por intención de tratar, el grupo de test incluye a quien fue sorteado y nunca recibió el anuncio. Esas personas no tienen cómo ser afectadas, así que el efecto medio del grupo entero es el efecto sobre los expuestos multiplicado por la fracción expuesta. Gordon y coautores escriben esa relación de forma explícita: el efecto sobre los tratados es el efecto por intención de tratar dividido por la fracción del grupo de test que recibió el tratamiento, cuando nadie del control es expuesto.
Eso tiene dos consecuencias prácticas.
- El lift relativo del informe es menor que el lift sobre quien vio. Con tasa base de 2 por ciento, un lift de 15 por ciento en el grupo entero (0,30 punto porcentual), con alcance de 40 por ciento, corresponde a un aumento de 0,75 punto porcentual por expuesto, no de 0,30. La cuenta de la página es la misma de la guía de análisis por disparo y dilución, solo que aquí el “disparo” es la exposición, y solo la plataforma sabe quién la tendría en el control.
- La muestra necesaria crece con el inverso del cuadrado del alcance. Si el efecto por expuesto es fijo, cortar el alcance a la mitad corta el efecto medio a la mitad y, a grandes rasgos, cuadruplica la muestra.
La tabla y el gráfico de abajo usan el escenario SaaS del ejemplo: tasa base de 2 por ciento en el grupo entero, efecto fijo de 0,75 punto porcentual entre expuestos, 95 por ciento de confianza y 80 por ciento de poder. Es una simplificación (en la vida real, la tasa base de los alcanzables suele ser distinta de la de los demás), pero muestra el orden de magnitud.
| alcance en el grupo de test | efecto en el grupo entero | lift relativo en el grupo entero | personas por grupo |
|---|---|---|---|
| 20% | 0,15 pp | 7,5% | 141.764 |
| 40% | 0,30 pp | 15,0% | 36.693 |
| 60% | 0,45 pp | 22,5% | 16.864 |
| 80% | 0,60 pp | 30,0% | 9.798 |
| 100% | 0,75 pp | 37,5% | 6.470 |
Una trampa común: intentar “corregir” la dilución comparando solo a los expuestos del test con el control entero. Eso reintroduce el sesgo de selección del comienzo del artículo, porque los expuestos fueron elegidos por la entrega. La corrección honesta es dividir el efecto por intención de tratar por la fracción expuesta (y el intervalo junto), o usar el diseño que marca la exposición prevista en los dos lados.
Ejemplo trabajado 1: prospección y remarketing de un ecommerce
Escenario (ilustrativo). Una tienda de artículos para el hogar invierte R$ 150.000 en cuatro semanas en una campaña de prospección y remarketing en una plataforma social. El ticket medio es de R$ 250 y el margen de contribución es de 40 por ciento. El panel de la plataforma atribuye 4.800 compras a la campaña, lo que da un ROAS atribuido de 8,0 y un CPA atribuido de R$ 31,25. El equipo pide un estudio de lift con 10 por ciento de holdout sobre un público elegible de 2 millones de personas.
Muestra. Antes de correrlo, el equipo dimensiona. La tasa de compra del público en cuatro semanas, sin anuncio, gira en torno al 0,6 por ciento, y el menor efecto que cambiaría la decisión es de 10 por ciento relativo. En la calculadora de abajo, escribe: tasa de conversión actual 0,6; efecto mínimo detectable 10, relativo; confianza 95; poder 80; visitantes por semana 500000; test bilateral.
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
La pantalla muestra 272.979 por variación, 545.958 en total y 8 días. Esos números valen para una división 50/50, que es lo que la calculadora asume. Con 90/10, el total sube a 1.516.550 por el factor de 2,78 de la sección anterior, y el campo de días deja de aplicar. Con 2 millones de personas y 10 por ciento en el control, el poder para un efecto de 10 por ciento queda en cerca de 89 por ciento.
El resultado.
| grupo | personas | compras | tasa |
|---|---|---|---|
| control (sin anuncio) | 200.000 | 1.200 | 0,60% |
| test (elegible al anuncio) | 1.800.000 | 11.880 | 0,66% |
Pega en la calculadora de significancia: control con 200000 visitantes y 1200 conversiones; variación con 1800000 visitantes y 11880 conversiones; confianza 95.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
La pantalla muestra 0,60% contra 0,66%, mejora relativa de +10,0%, valor-p de 0,0016, intervalo de +0,0% … +0,1% (pp) y el veredicto Ganadora con significancia · B gana. El intervalo aparece redondeado a un decimal porque las tasas son pequeñas; con más decimales, va de más 0,0241 a más 0,0959 punto porcentual, y el valor-p es 0,00159. La calculadora acepta grupos de tamaños distintos, así que la cuenta vale para el 90/10.
Del lift al dinero. Ahora la parte que el informe de lift hace y la calculadora no:
| paso | cuenta | resultado |
|---|---|---|
| control escalado al tamaño del test | 1.200 por 9 | 10.800 compras |
| compras incrementales | 11.880 menos 10.800 | 1.080 |
| costo por compra incremental (iCPA) | R$ 150.000 divididos por 1.080 | R$ 138,89 |
| ingreso incremental | 1.080 por R$ 250 | R$ 270.000 |
| iROAS | R$ 270.000 divididos por R$ 150.000 | 1,80 |
| razón atribuido sobre incremental | 4.800 divididos por 1.080 | 4,44 |
| intervalo de 95% de las compras incrementales | intervalo de la diferencia por 1.800.000 | de 435 a 1.725 |
| intervalo de 95% del iROAS | misma proporción | de 0,72 a 2,88 |
| intervalo de 95% del iCPA | gasto dividido por los extremos | de R$ 86,94 a R$ 345,11 |
Qué dice el resultado. Dos cosas verdaderas al mismo tiempo. La campaña funciona: el valor-p de 0,0016 indica que el lift de 10 por ciento difícilmente sea ruido. Y la campaña probablemente no se paga con ese margen: la estimación de iROAS es 1,80, contra 2,5 de equilibrio. Solo 22,5 por ciento de las compras atribuidas son incrementales. Quien mirara solo el ROAS de 8,0 duplicaría la inversión.
Qué hacer con él. No apagar todo, porque el intervalo llega a 2,88 y un solo test no cierra la cuestión. El camino honesto es separar las partes: un estudio solo de remarketing y otro solo de prospección, porque las dos pueden tener incrementalidad muy distinta, y bajar la inversión de la parte con peor iROAS mientras corre el próximo test. Guarda la razón de 4,44 como factor de lectura del panel hasta el próximo estudio.
Ejemplo trabajado 2: remarketing de un SaaS con lista sorteada
Escenario (ilustrativo). Un SaaS B2B hace remarketing hacia quien inició una prueba y no se suscribió. La lista recibe cerca de 20 mil personas nuevas por semana. Como la plataforma no ofrece estudio de lift para esa cuenta, el equipo sortea su propia lista: la mitad entra en la audiencia de la campaña, la mitad va a una lista de exclusión. Es intención de tratar hecha en casa, lo que Johnson y coautores describen como posible cuando el anunciante tiene una lista previa de elegibles, con la advertencia de que los recursos de expansión de público (como públicos similares) pueden llevar el anuncio a quien está en la lista de control. El equipo apaga la expansión.
La conversión que decide es cuenta pagada en hasta 30 días, con tasa base de 2 por ciento. El valor de una cuenta en el primer año es de R$ 1.800. El gasto del período es de R$ 24.000, y la plataforma atribuye 410 cuentas pagadas: CPA atribuido de R$ 58,54.
Muestra. En la calculadora de muestra de más arriba, cambia los campos: tasa actual 2; efecto mínimo 15, relativo; confianza 95; poder 80; visitantes por semana 20000; bilateral. La pantalla muestra 36.693 por variación, 73.386 en total y 26 días. El equipo corre cuatro semanas completas, 28 días, y cierra con 40.000 personas en cada grupo. Con ese tamaño, el poder para 15 por ciento es de cerca de 83 por ciento, y el menor efecto detectable con 80 por ciento de poder es de cerca de 13,9 por ciento relativo.
El resultado, 30 días después del fin de la entrada en la lista.
| grupo | personas | cuentas pagadas | tasa |
|---|---|---|---|
| control (lista de exclusión) | 40.000 | 800 | 2,00% |
| test (audiencia de la campaña) | 40.000 | 920 | 2,30% |
En la calculadora de significancia, escribe 40000 y 800 en el control y 40000 y 920 en la variación. La pantalla muestra 2,00% contra 2,30%, mejora de +15,0%, valor-p de 0,0034, intervalo de +0,1% … +0,5% (pp) y Ganadora con significancia · B gana. Con más decimales, el intervalo va de más 0,0990 a más 0,5010 punto porcentual.
| métrica | atribuida por la plataforma | medida por el holdout |
|---|---|---|
| cuentas pagadas | 410 | 120 incrementales (intervalo de 40 a 200) |
| costo por cuenta | R$ 58,54 | R$ 200,00 (intervalo de R$ 119,76 a R$ 606,10) |
| retorno sobre el gasto, valor del 1er año | 30,75 | 9,0 |
La lectura de la dilución. Según el informe de la plataforma, el alcance de la campaña fue de 40 por ciento de la audiencia: 16.000 de las 40.000 personas del test vieron el anuncio al menos una vez. Las 24.000 restantes no tenían cómo cambiar de comportamiento. El aumento de 0,30 punto porcentual en el grupo entero corresponde, por la división por la fracción expuesta, a 0,75 punto porcentual entre los expuestos. Si, como hipótesis ilustrativa, quien la campaña alcanza convirtiera a 3,5 por ciento sin anuncio (y los demás a 1,0 por ciento, lo que mantiene la media de 2 por ciento), el lift entre expuestos es de cerca de 21,4 por ciento relativos, bastante por encima del 15 por ciento del informe.
Esa lectura también muestra lo que ahorraría un diseño con exposición prevista. Comparando solo a los alcanzables, escribe en la calculadora de muestra tasa 3,5 y efecto 0,75 en el modo absoluto (pp): la pantalla muestra 10.394 por variación y 20.788 en total. Como solo el 40 por ciento de la lista es alcanzable, encontrar 20.788 alcanzables exige cerca de 52 mil personas de la lista, lo que a 20 mil por semana da cerca de 19 días, en lugar de los 26 del diseño por intención de tratar (esa conversión a días es de esta guía, no de la calculadora). El ahorro aquí es modesto porque el alcance es de 40 por ciento; con alcance de 3 por ciento, la fracción de tratados que Johnson y coautores dan como ejemplo cuando todas las impresiones son elegibles, sería mucho mayor.
Qué hacer con él. El remarketing se paga con holgura en el valor del primer año, incluso en la punta mala del intervalo (R$ 606,10 por cuenta contra R$ 1.800 de valor). La decisión sensata es mantenerlo y testear el próximo escalón: aumentar la frecuencia o el alcance y medir de nuevo, porque el efecto entre expuestos sugiere que alcanzar a más gente de la lista vale más de lo que parece en el lift medio. Lo que no se hace es presupuestar por el CPA atribuido de R$ 58,54, que es 3,4 veces menor que el incremental.
Cuándo usar experimento geográfico en lugar de holdout por usuario
El holdout por usuario es más preciso, pero depende de que la plataforma logre sortear y mantener personas fuera del anuncio y de que la conversión pueda ligarse a la persona. Cuando una de esas condiciones falla, la unidad de sorteo pasa a ser la región.
La comparación oficial de Google Ads, verificada el 16/09/2026, describe las dos opciones así. El estudio por usuarios devuelve resultados por acción de conversión, categoría, edad, género y país, pero depende principalmente de tráfico con consentimiento y puede verse afectado por brechas de medición; el presupuesto se define en la configuración con base en el historial de conversiones. El estudio por geografía ofrece transparencia, medición entre canales y conversiones en línea y offline, pero la división es más ruidosa, los resultados no vienen por demografía y el presupuesto exigido tiende a ser mayor.
Los casos típicos para ir por región:
- Venta en tienda física o por teléfono, sin identificador que ligue exposición y compra.
- Pregunta de portafolio: “¿y si corto 30 por ciento de todos los medios pagados en una plaza?”.
- Canales sin segmentación por persona, como medios exteriores y radio.
- Plataformas o cuentas sin acceso a estudio de lift, cuando la lista sorteada en casa tampoco es viable.
El experimento de eBay con palabras no relacionadas con la marca es un ejemplo clásico: los anuncios fueron apagados en 68 áreas de mercado, y el grupo de comparación se armó a partir de las demás. Cómo hacer eso con rigor (cuántas regiones, período previo al test, por qué el valor-p ingenuo engaña) está en la guía de experimento geográfico, y la cuenta del efecto de diseño está en aleatorización por cluster.
Checklist del test de lift
- Decisión escrita antes: qué cambia si el iROAS viene por encima o por debajo del equilibrio.
- iROAS de equilibrio calculado a partir del margen, antes de ver el resultado.
- Conversión primaria al nivel del dinero, con acciones de medio de embudo solo como secundarias.
- Muestra dimensionada para la fracción de control elegida, no para 50/50.
- Semanas completas y retraso de conversión cubierto, con al menos 14 días.
- Congelamiento de creativo y público durante el estudio.
- Sin filtración hacia el control: expansión de público apagada en listas sorteadas en casa, y la misma campaña fuera de otros estudios.
- Alcance registrado, para leer el efecto entre expuestos y explicar la dilución.
- Intervalo en el informe, no solo el punto: conversiones incrementales, iCPA e iROAS con los extremos.
- Repetición planificada: Google observa que la mayoría de los anunciantes corre cerca de uno a dos estudios por año, alineados a ciclos de presupuesto; el resultado envejece cuando cambian público y pujas.
Errores comunes
- Comparar el informe de lift con el panel de atribución línea a línea. Meta advierte que los dos usan metodologías distintas (fechas de inicio y fin del test contra ventanas de atribución de 1, 7 o 28 días, grupos escalados contra conversiones acreditadas) y no sugiere compararlos. Si usas la razón entre los dos como factor de lectura, trátala como una aproximación de esta campaña, no como una conciliación.
- Llamar al lift “ROAS verdadero” sin intervalo. Con tasas bajas, el intervalo del iROAS es amplio, y un punto solo engaña.
- Control de 1 o 2 por ciento “para no perder ventas”. El test pierde poder, y las ventas que protegiste no pagan un estudio no concluyente.
- Comparar expuestos del test con el control entero. Reintroduce el sesgo de selección que el sorteo había removido.
- Leer el lift medio como efecto sobre quien vio. Con alcance bajo, el efecto entre expuestos es bastante mayor.
- Testear remarketing y prospección juntos y decidir por un solo número. Los dos pueden tener incrementalidad bastante distinta.
- Parar el test en el primer día bonito. El mismo problema del peeking de cualquier test A/B vale aquí.
Haz esto automático en Donnu
El dolor específico de este artículo es que el número que muestra la plataforma de medios no es el número que decide la inversión, y la medición incremental exige cuentas de muestra, de dilución y de intervalo que el panel no hace por ti. Donnu no corre estudios de lift dentro de las plataformas de anuncios; testea páginas. Pero dos partes del problema están a su alcance.
La primera es medir la conversión que vale dinero. En Donnu, la meta de conversión puede confirmarse desde tu servidor (server-to-server), como un pedido pagado confirmado por la pasarela, además de clics, formularios, visitas a páginas y eventos personalizados. La segunda es no confundir el efecto de la página con el efecto de los medios: a partir del plan Pro, el informe de un test de landing page puede filtrarse y segmentarse por origen del tráfico (utm_source), lo que ayuda a ver si una variación gana para el tráfico pagado y pierde para el orgánico, en lugar de mezclar los dos. Antes de tocar la página que recibe los medios, vale saber si los medios causan algo; antes de escalar los medios, vale saber si la página convierte a quien llega.
Las cuentas de esta guía están, gratis, en la calculadora de tamaño de muestra, en la calculadora de significancia, en la calculadora de poder estadístico y en la calculadora de ROAS, esta última alimentada con el ingreso incremental en lugar del atribuido.
Referencias
- Johnson, G. A., Lewis, R. A. y Nubbemeyer, E. I. Ghost Ads: Improving the Economics of Measuring Online Ad Effectiveness. Journal of Marketing Research, 54(6), 2017. Leída la versión de trabajo del Marketing Science Institute (Report 15-122, 2015). Fuente de los tres diseños de control (utilidad pública, intención de tratar, anuncio fantasma), de la ruptura del PSA con entrega optimizada, del 3 por ciento o menos de tratados, de los lifts de 17,2, 12,0 y 10,8 por ciento en el remarketing y de la razón de varianzas de 5,9 a 16,4. PDF leído en su totalidad. thearf-org-unified-admin.s3.amazonaws.com · msi.org.
- Gordon, B. R., Zettelmeyer, F., Bhargava, N. y Chapsky, D. A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook. Marketing Science, 38(2), 2019. Leída la versión de los autores (abril de 2018). Fuente de los 15 experimentos, del sesgo de actividad y de la selección por la entrega, de la relación entre efecto por intención de tratar y efecto sobre los tratados, de la tabla 6 y del error por factor de tres en la mitad de los estudios. PDF leído en su totalidad; la tabla 6 coincide con la versión publicada (Articles in Advance). kellogg.northwestern.edu.
- Lewis, R. A. y Rao, J. M. The Unfavorable Economics of Measuring the Returns to Advertising. Quarterly Journal of Economics, 130(4), 2015. Fuente de los 25 experimentos, de los 2,8 millones de dólares, de la desviación estándar de 10 veces la media, del ejemplo de 35 centavos (meta de retorno de 25 por ciento) contra media de 7 y desviación de 75, del error estándar mediano de 26,1 por ciento y de los más de 10 millones de personas-semana. PDF leído en su totalidad. gwern.net.
- Blake, T., Nosko, C. y Tadelis, S. Consumer Heterogeneity and Paid Search Effectiveness: A Large Scale Field Experiment. Econometrica, 83(1), 2015. Leída la versión de los autores (agosto de 2014). Fuente del 99,5 por ciento de clics de marca recuperados por el orgánico, de los retornos no experimentales por encima de 4.100 y 1.400 por ciento, del retorno experimental de menos 63 por ciento con intervalo de menos 124 a menos 3, y de las 68 áreas de mercado del test. PDF leído en su totalidad. faculty.haas.berkeley.edu.
- Google Ads Help. About Conversion Lift, Set up Conversion Lift based on users y Comparing lift types. Fuente de la definición de lift, de las métricas (conversiones incrementales, lift relativo, iCPA, iROAS), del holdout de 1 a 50 por ciento, del presupuesto mínimo de 5 mil dólares, de la recomendación de más de 14 días y de la caída de hasta 17 por ciento en el lift absoluto, de la frecuencia de uno a dos estudios por año y de la comparación entre estudio por usuarios y por geografía. Verificado el 16/09/2026. support.google.com · support.google.com · support.google.com.
- Centro de Ayuda de Meta para Empresas. About Conversion Lift y Differences between Conversion Lift test results and other reporting tools. Fuente del enfoque de intención de tratar, de los grupos de test con expuestos y no expuestos, de la referencia de 5 mil dólares y 500 conversiones, de los requisitos de señal, del uso de inferencia bayesiana, del escalado del control al tamaño del test y de la recomendación de no comparar con el Administrador de Anuncios. Verificado el 16/09/2026. facebook.com · facebook.com.
Lee también: Experimento geográfico · Holdout de largo plazo · Análisis por disparo y dilución · Intención de tratar · Atribuyendo ingresos al ganador · Modelado de uplift · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es un test de incrementalidad?
- Es un experimento en el que parte del público que la campaña podría alcanzar se sortea hacia un grupo de control que no recibe el anuncio. La diferencia de conversiones entre el grupo de test y el de control es el efecto causal de los medios, llamado lift. Google describe el Conversion Lift exactamente así: la diferencia de conversiones entre quien ve y quien no ve los anuncios muestra el aumento causado por la presencia del anuncio. Meta usa la misma lógica e informa que su Conversion Lift adopta el enfoque de intención de tratar.
- ¿Por qué el ROAS atribuido es mayor que el iROAS?
- Porque la atribución le acredita al anuncio compras de personas que habrían comprado de todas formas, y la plataforma entrega el anuncio justamente a quien tiene más chance de comprar. En los 15 experimentos de Facebook analizados por Gordon y coautores, comparar expuestos con no expuestos indicó, en uno de los estudios, 392 por ciento de lift en checkout, contra 8,6 por ciento medidos por el experimento. En el ejemplo de esta guía, la plataforma atribuye 4.800 compras y un ROAS de 8,0, y el holdout mide 1.080 compras incrementales y un iROAS de 1,80.
- ¿Cómo calcular conversiones incrementales, iCPA e iROAS?
- Escala las conversiones del control al tamaño del grupo de test y réstalas del total del test. Con 1.800.000 personas en el test y 11.880 compras, y 200.000 en el control con 1.200 compras, el control escalado es 10.800 y las compras incrementales son 1.080. El costo por conversión incremental es el gasto dividido por ese número: 150 mil reales divididos por 1.080 dan 138,89 reales. El iROAS es el ingreso incremental dividido por el gasto: 1.080 por 250 reales, dividido por 150 mil, da 1,80.
- ¿Qué tamaño debe tener el grupo de control en un test de incrementalidad?
- Es un intercambio entre precisión y costo de oportunidad. Google Ads acepta de 1 a 50 por ciento de holdout en el Conversion Lift por usuarios. En el ejemplo de esta guía, con 0,6 por ciento de conversión y efecto de 10 por ciento, una división 50/50 pide 545.958 personas en total, y una división 90/10 pide 1.516.550, cerca de 2,78 veces más. Con 2 millones de personas, el control de 10 por ciento da cerca de 89 por ciento de poder, y el de 5 por ciento, cerca de 63 por ciento.
- ¿Qué es la dilución en un test de holdout de anuncios?
- Es la pérdida de señal causada por quien fue sorteado al grupo de test y nunca vio el anuncio. La comparación por sorteo incluye a esas personas, así que el efecto medio queda menor que el efecto sobre quien fue expuesto, en proporción al alcance. En el ejemplo SaaS de esta guía, con alcance de 40 por ciento, un efecto de 0,75 punto porcentual entre expuestos aparece como 0,30 punto en el grupo entero, y la muestra necesaria sube a 36.693 por grupo. Con alcance de 20 por ciento, subiría a 141.764.
- ¿Cuándo usar un experimento geográfico en lugar de holdout por usuario?
- Cuando la plataforma no logra sortear personas, cuando la conversión ocurre fuera del alcance de la identificación, como una venta en tienda física, o cuando quieres medir varios canales juntos. Google Ads describe el Conversion Lift por geografía como compatible con conversiones offline y con medición entre canales, pero con una división de grupos más ruidosa y un presupuesto mínimo que tiende a ser mayor que el de los estudios por usuario. Si se puede sortear y medir por persona, el holdout por usuario es más preciso.