Modelado de Uplift: del efecto medio a la política
El modelado de uplift estima el efecto por usuario y lo convierte en a quién tratar. Meta-aprendices, curva de ganancia y la validación que no existe.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El efecto medio de un test A/B responde una sola pregunta: ¿vale la pena activar esto para todo el mundo? El modelado de uplift responde otra: para quién vale. En el ejemplo de esta guía, una campaña con efecto medio de más 0,9000 punto porcentual esconde cuatro grupos con efectos de más 3,0000, más 1,2000, más 0,2000 y menos 0,8000 punto. Tratar la base entera rinde 450 conversiones incrementales; tratar los tres primeros cuartiles rinde 550, con 25 por ciento menos costo de tratamiento. El cuarto cuartil no es neutro, destruye 100 conversiones. Esta guía muestra cómo se construye el puntaje por usuario, cómo se convierte en política, por qué no puede validarse fila por fila, y las tres trampas que hacen que un modelo de uplift parezca bueno sin serlo. Forma parte de nuestra guía completa de test A/B y es el paso operativo después del efecto heterogéneo por segmento.
El objetivo cambió: del efecto medio al efecto condicional
Un test A/B bien hecho estima el efecto medio del tratamiento en la población sorteada. Es el número que decide si la variación sube. Es robusto, exige pocos supuestos y viene gratis con el sorteo.
Lo que no dice es si ese efecto está distribuido de forma parecida entre las personas. Una media de más 0,9 punto puede ser 0,9 punto en todo el mundo, o puede ser 3 puntos en un cuarto de la base y un poco de daño en el resto. Las dos situaciones llevan a decisiones de producto radicalmente distintas y son indistinguibles en el informe estándar.
El objetivo del modelado de uplift es el efecto medio condicional del tratamiento: la diferencia entre el resultado esperado con tratamiento y el resultado esperado sin tratamiento, para un perfil de características. Gutierrez y Gérardy definen exactamente eso y registran la dificultad central enseguida: nunca se observa al mismo tiempo el resultado con y sin tratamiento para la misma persona. Lo que se quiere predecir es una cantidad que nunca aparece en los datos.
El ejemplo trabajado: cuatro cuartiles, una decisión distinta
Un ecommerce corre un test con 50.000 usuarios por brazo para un nuevo recordatorio de carrito. El modelo de uplift, entrenado con datos de una ronda anterior, ordenó a los usuarios por efecto predicho y los dividió en cuatro cuartiles de 12.500 por brazo. El resultado medido en cada cuartil:
| cuartil (por efecto predicho) | control | con recordatorio | efecto | valor p |
|---|---|---|---|---|
| Q1 (mayor efecto predicho) | 375 de 12.500 = 3,00% | 750 de 12.500 = 6,00% | más 3,0000 puntos | por debajo de 0,0001 |
| Q2 | 500 de 12.500 = 4,00% | 650 de 12.500 = 5,20% | más 1,2000 puntos | por debajo de 0,0001 |
| Q3 | 750 de 12.500 = 6,00% | 775 de 12.500 = 6,20% | más 0,2000 punto | 0,508836 |
| Q4 (menor efecto predicho) | 1.000 de 12.500 = 8,00% | 900 de 12.500 = 7,20% | menos 0,8000 punto | 0,017003 |
| población entera | 2.625 de 50.000 = 5,25% | 3.075 de 50.000 = 6,15% | más 0,9000 punto | por debajo de 0,0001 |
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pegue cualquiera de las cinco filas en la calculadora de arriba. La última es el resultado que iría a la reunión: más 0,9000 punto porcentual, más 17,14 por ciento relativo, intervalo de confianza de 95 por ciento entre más 0,6127 y más 1,1873 punto. Victoria limpia, sin ninguna salvedad aparente.
Las cuatro primeras filas cuentan otra historia. Q1 duplica la tasa de conversión. Q4 tiene efecto negativo y significativo, con intervalo entre menos 1,4569 y menos 0,1431 punto. En ese cuartil, el recordatorio aleja a gente que habría comprado.
Vale la pena notar quién está en Q4: son los usuarios con la mayor tasa de conversión de base, 8,00 por ciento contra 3,00 por ciento de Q1. Es el patrón clásico de las campañas de recordatorio, y es la razón por la que un modelo de propensión a convertir es un pésimo sustituto de un modelo de uplift. Quien más convierte no es quien más responde a la intervención.
Del puntaje a la política: la curva de ganancia
El puntaje por sí solo no vale nada. Lo que vale es la decisión que sale de él: hasta dónde tratar. Recorriendo los cuartiles del mayor puntaje al menor y acumulando las conversiones incrementales:
| política | tratados | conversiones incrementales | ganancia por 1.000 tratados |
|---|---|---|---|
| tratar solo Q1 | 12.500 | 375 | 30,00 |
| tratar Q1 y Q2 | 25.000 | 525 | 21,00 |
| tratar Q1, Q2 y Q3 | 37.500 | 550 | 14,67 |
| tratar a todo el mundo | 50.000 | 450 | 9,00 |
Los números de la última fila y de la penúltima merecen una lectura lenta. Tratar al 75 por ciento de la base rinde 550 conversiones; tratar al 100 por ciento rinde 450. Los últimos 12.500 usuarios tratados no cuestan solo el costo del tratamiento, le restan 100 conversiones al resultado.
Y si el tratamiento tiene costo por unidad, como un envío de email, un descuento o una notificación que gasta la atención del usuario, la comparación relevante es la última columna: tratar solo Q1 entrega 30,00 conversiones incrementales por cada mil tratamientos, más de tres veces la eficiencia de tratar la base entera.
Esa es la familia de métricas que usa la literatura. Gutierrez y Gérardy registran que, como no se observa el efecto por individuo, la mayor parte de la literatura de uplift recurre a medidas agregadas, franjas de uplift o curvas de uplift, con la medida Qini de Radcliffe entre ellas, y describen el enfoque común: predecir el uplift para tratados y controles, calcular la media predicha por decil en los dos grupos y tomar la diferencia de esas medias en cada decil.
Cómo construye el puntaje el modelado de uplift: los meta-aprendices
El puntaje por usuario no sale de un algoritmo mágico. Sale de combinar modelos de regresión comunes de una manera específica. Künzel, Sekhon, Bickel y Yu organizaron esas combinaciones en un marco único y bautizaron las principales:
| meta-aprendiz | cómo funciona | cuándo elegirlo |
|---|---|---|
| S-learner | un solo modelo, entrenado en la base entera, con el indicador de tratamiento entrando como una característica más; el puntaje es la diferencia entre predecir con y sin el indicador activado | cuando el efecto es pequeño y usted quiere que el modelo pueda ignorarlo, con el riesgo de que efectivamente lo ignore |
| T-learner | dos modelos separados, uno entrenado solo con los controles y otro solo con los tratados; el puntaje es la diferencia entre las dos predicciones | el estándar intuitivo, y la base del enfoque de dos modelos de la literatura de uplift |
| X-learner | empieza como el T-learner, después imputa el efecto individual cruzando los dos modelos con los resultados observados del otro brazo, y modela ese efecto imputado | diseño desbalanceado, cuando uno de los grupos es mucho mayor que el otro |
| bosque causal | árboles que particionan el espacio buscando diferencia de efecto, con estimación honesta por división de muestra | cuando existen muchas covariables irrelevantes y usted quiere un intervalo de confianza puntual |
El X-learner merece la explicación de por qué existe. Künzel y coautores lo proponen exactamente para aprovechar el diseño desbalanceado y la estructura conocida del efecto condicional, y la mecánica es elegante: en la segunda etapa, se resta la predicción del modelo de control de los resultados observados de los tratados, y se restan los resultados observados de los controles de la predicción del modelo de tratamiento, obteniendo efectos de tratamiento imputados que ahí sí pueden modelarse directamente.
Y vale la pena registrar su conclusión honesta: en simulaciones extensas, el X-learner tiene un desempeño favorable, aunque ninguno de los meta-aprendices es uniformemente el mejor. No existe una elección estándar que exima de probar.
Del lado de los bosques causales, Wager y Athey muestran que son puntualmente consistentes para el efecto verdadero y tienen una distribución muestral asintóticamente gaussiana y centrada, lo que permite construir un intervalo de confianza alrededor de la estimación. En sus experimentos, los bosques causales fueron sustancialmente más potentes que los métodos clásicos de emparejamiento por vecino más cercano, especialmente en presencia de covariables irrelevantes. El precio de eso es una condición que llaman honestidad: el árbol no puede usar la misma observación para elegir dónde dividir y para estimar el efecto dentro de la hoja.
La validación que no existe, y la que existe
Aquí está la diferencia más importante entre un modelo de uplift y cualquier modelo predictivo común. Un clasificador de churn tiene etiqueta verdadera: la persona canceló o no. Un modelo de uplift no tiene etiqueta alguna, porque el efecto individual nunca se observa.
Eso tiene tres consecuencias prácticas que suelen aprenderse por la vía cara:
- No existe exactitud, AUC ni error medio por observación para uplift. Cualquier métrica de ese tipo que aparezca en un informe está midiendo otra cosa, normalmente la predicción del resultado, no la del efecto.
- La evaluación es siempre agregada y siempre necesita un grupo de control en la base de validación. Sin control en la validación, no hay forma de saber el efecto real dentro de cada franja del puntaje.
- La base de validación tiene que separarse de la de entrenamiento por sorteo, y de preferencia venir de una ronda distinta del experimento, porque evaluar en la misma muestra en la que se ajustó el modelo devuelve una curva de ganancia optimista por construcción.
El corte, y el test que tiene que venir después
Encontrar el pico de la curva de ganancia no cierra el asunto, por dos motivos.
El primero es que el pico se estima con ruido. En el ejemplo, la diferencia entre tratar hasta Q3 (550) y tratar hasta Q2 (525) es de 25 conversiones, y el efecto de Q3 solo tiene valor p 0,508836, es decir, es indistinguible de cero. Tratar Q3 puede estar sumando casi nada y pagando costo por ello. Un efecto de cuartil sin significancia no sostiene una decisión de incluir ese cuartil en la política.
El segundo es más fundamental: la política elegida se armó mirando los datos. Tiene que validarse en su propio experimento, con el corte ya congelado.
| lectura | efecto | valor p | lo que sostiene |
|---|---|---|---|
| mitad de arriba (Q1 y Q2) | 3,50% contra 5,60%, más 2,1000 puntos | por debajo de 0,0001 | tratar la mitad de arriba funciona |
| mitad de abajo (Q3 y Q4) | 7,00% contra 6,70%, menos 0,3000 punto | 0,184237 | no hay evidencia de que tratar la mitad de abajo ayude |
La lectura de la segunda fila es la más útil y la más incómoda: el efecto de la mitad de abajo no es significativamente negativo cuando se suman los dos cuartiles. Es decir, el daño concentrado en Q4 solo no sobrevive a la dilución con Q3. Una política construida sobre “Q4 hace daño” está apoyada en un efecto de 0,8 punto en un cuarto de la base, con intervalo entre menos 1,4569 y menos 0,1431, lo que es evidencia real pero frágil.
El camino correcto es el mismo de cualquier hallazgo encontrado en los datos: congelar la regla y correr un experimento confirmatorio en el que el propio corte es la variación testeada. El brazo A trata a todo el mundo, el brazo B trata solo a quien el modelo indica. El resultado compara las dos políticas, no los dos tratamientos, y es esa comparación la que autoriza subir la segmentación. El razonamiento general está en la ley de Twyman y la ronda de confirmación.
Errores comunes en el modelado de uplift
- Usar un modelo de propensión a convertir como si fuera de uplift. En el ejemplo, el cuartil de mayor conversión de base es justamente el de efecto negativo. Son preguntas distintas y ordenamientos distintos.
- Evaluar el modelo con AUC o exactitud. Esas métricas miden la predicción del resultado, no del efecto, y un modelo puede tener un AUC excelente y una curva de ganancia plana.
- Construir el puntaje con variables medidas después del sorteo. Vale la misma regla de cualquier segmentación: una característica afectada por el tratamiento rompe la comparabilidad, y el problema completo está en análisis de mediación.
- Evaluar en la misma muestra del entrenamiento. La curva de ganancia queda optimista por construcción y no sobrevive en producción.
- Tratar hasta el final de la curva porque el efecto medio es positivo. Es exactamente el error que cuesta 100 conversiones en el ejemplo.
- Decidir el corte mirando los datos y subir sin confirmación. La política elegida hereda todo el optimismo de haber sido elegida, el mismo mecanismo descrito en maldición del ganador.
- Confundir uplift con personalización por regla de negocio. Una regla escrita por un humano es hipótesis; un puntaje de uplift es estimación. Las dos cosas conviven, y la comparación entre ellas está en personalización vs test A/B.
Hágalo automático con Donnu
El modelado de uplift depende de tres cosas que se deciden antes de que exista cualquier modelo: el experimento tiene que haber mantenido un grupo de control, las características tienen que quedar selladas en el instante del sorteo, y el resultado tiene que quedar guardado con la asignación original para convertirse en dato de entrenamiento de la ronda siguiente.
El primer punto es el que más se pierde en la práctica. Cuando una campaña se activa para todo el mundo porque el efecto medio fue positivo, el control desaparece y con él la posibilidad de estimar cualquier efecto condicional de ahí en adelante. Mantener un porcentaje pequeño de holdout permanente es lo que mantiene la puerta abierta.
Donnu sella el estado del usuario en la asignación y preserva el historial de brazo por usuario, lo que deja la base de entrenamiento lista sin reconstrucción manual y sin riesgo de usar una característica postratamiento. Para la lectura de cada franja del puntaje, la calculadora de significancia cierra exactamente las cinco filas de la tabla del ejemplo.
Referencias
- Künzel, S. R., Sekhon, J. S., Bickel, P. J. y Yu, B. Metalearners for Estimating Heterogeneous Treatment Effects using Machine Learning. PNAS, volumen 116, número 10, 2019. Fuente del marco unificado de los meta-aprendices; de la definición del T-learner como dos modelos de respuesta estimados por separado en los controles y en los tratados, con el efecto como la diferencia de las predicciones; de la definición del S-learner como un modelo único en el que el indicador de tratamiento entra como característica sin papel especial; de la propuesta del X-learner, demostrablemente eficiente cuando el número de unidades en un grupo es mucho mayor que en el otro, con la segunda etapa imputando efectos de tratamiento a partir del cruce entre modelos y resultados observados; y de la conclusión de que el X-learner tiene un desempeño favorable en simulaciones extensas aunque ningún meta-aprendiz es uniformemente el mejor. arxiv.org.
- Wager, S. y Athey, S. Estimation and Inference of Heterogeneous Treatment Effects using Random Forests. Journal of the American Statistical Association, volumen 113, número 523, 2018. Fuente de la demostración de que los bosques causales son puntualmente consistentes para el efecto verdadero y tienen una distribución muestral asintóticamente gaussiana y centrada, lo que permite intervalos de confianza alrededor de la estimación; de la condición de honestidad, según la cual la misma observación no puede usarse para elegir la división y para estimar el efecto dentro de la hoja, obtenida por división de muestra; y del resultado empírico de que los bosques causales fueron sustancialmente más potentes que los métodos clásicos de emparejamiento por vecino más cercano, especialmente con covariables irrelevantes presentes. arxiv.org.
- Gutierrez, P. y Gérardy, J. Y. Causal Inference and Uplift Modeling: A Review of the Literature. JMLR Workshop and Conference Proceedings, volumen 67, 2016, páginas 1 a 13. Fuente de la definición del efecto medio condicional del tratamiento y del registro de que los dos resultados potenciales nunca se observan juntos para la misma persona; de la división de la literatura en enfoque de dos modelos, transformación de clase y modelado directo del uplift; y del relevamiento de las métricas agregadas de evaluación, franjas de uplift, curvas de uplift y la medida Qini de Radcliffe, con la descripción del procedimiento de predecir el uplift para tratados y controles, sacar la media por decil en cada grupo y comparar la diferencia entre ellas. proceedings.mlr.press.
Lee también: Efecto heterogéneo por segmento · Personalización vs test A/B · Maldición del ganador · La ley de Twyman · Calculadora de significancia · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es el modelado de uplift?
- Es estimar, para cada usuario, el efecto que el tratamiento tendría en él, y usar ese número para decidir a quién tratar. El objetivo formal es el efecto medio condicional del tratamiento, es decir, la diferencia entre el resultado esperado con tratamiento y sin tratamiento para un perfil de características. Es distinto del efecto medio, que responde si vale la pena tratar a todo el mundo, y distinto de segmentar después del resultado, porque el puntaje se construye para convertirse en política.
- ¿Cuál es la diferencia entre uplift y efecto heterogéneo por segmento?
- Leer el efecto por segmento es descriptivo: usted mira tres o cuatro cortes definidos por humanos y compara. El uplift es predictivo y operativo: un modelo devuelve un puntaje por usuario y la decisión de tratar sale de un corte en ese puntaje. En la práctica, uno sustituye al otro cuando el número de cortes posibles es demasiado grande para que un humano los enumere, y ambos exigen que el corte se haya definido antes del sorteo o por características pretratamiento.
- ¿Se puede validar un modelo de uplift usuario por usuario?
- No. Nunca se observa al mismo tiempo el resultado con tratamiento y sin tratamiento para la misma persona, así que no existe etiqueta verdadera por observación ni ninguna métrica de error por fila. La evaluación es siempre agregada: se divide la base de validación en franjas del puntaje predicho y se compara el efecto real medido dentro de cada franja, que es lo que hacen las curvas de uplift y la medida Qini.
- ¿Un modelo de uplift puede empeorar el resultado?
- Puede, de dos formas. La primera es que el modelo esté equivocado y usted trate a quien no responde, dejando de tratar a quien respondería. La segunda es más sutil: cuando existe un grupo con efecto negativo, tratar a todo el mundo destruye valor incluso con efecto medio positivo. En el ejemplo de esta guía, el cuartil de abajo pierde 0,8000 punto porcentual, y por eso tratar los tres primeros cuartiles rinde 550 conversiones incrementales contra 450 de tratar la base entera.
- ¿Necesito un experimento aleatorizado para entrenar un modelo de uplift?
- Necesita datos en los que tratamiento y control se hayan asignado de forma comparable, y un experimento aleatorizado es la única fuente que lo garantiza por construcción. Entrenar uplift con datos observacionales es posible, pero entonces la estimación carga con todos los supuestos de la inferencia causal sin sorteo, y el puntaje aprende tanto quién responde como quién fue elegido para recibir.
- ¿Qué meta-aprendiz debo usar?
- Künzel, Sekhon, Bickel y Yu comparan los principales en una simulación extensa y son explícitos: el X-learner tiene un desempeño favorable, aunque ningún meta-aprendiz es uniformemente el mejor. El X-learner se propuso exactamente para el caso de diseño desbalanceado, cuando uno de los grupos es mucho mayor que el otro, que es el caso común de una campaña en la que pocos fueron tratados.