Estadística

Modelado de Uplift: del efecto medio a la política

El modelado de uplift estima el efecto por usuario y lo convierte en a quién tratar. Meta-aprendices, curva de ganancia y la validación que no existe.

Ilustración plana de cuatro bandejas apiladas, las dos de arriba llenas y brillantes, la tercera apagada y la cuarta vacía

El efecto medio de un test A/B responde una sola pregunta: ¿vale la pena activar esto para todo el mundo? El modelado de uplift responde otra: para quién vale. En el ejemplo de esta guía, una campaña con efecto medio de más 0,9000 punto porcentual esconde cuatro grupos con efectos de más 3,0000, más 1,2000, más 0,2000 y menos 0,8000 punto. Tratar la base entera rinde 450 conversiones incrementales; tratar los tres primeros cuartiles rinde 550, con 25 por ciento menos costo de tratamiento. El cuarto cuartil no es neutro, destruye 100 conversiones. Esta guía muestra cómo se construye el puntaje por usuario, cómo se convierte en política, por qué no puede validarse fila por fila, y las tres trampas que hacen que un modelo de uplift parezca bueno sin serlo. Forma parte de nuestra guía completa de test A/B y es el paso operativo después del efecto heterogéneo por segmento.

El objetivo cambió: del efecto medio al efecto condicional

Un test A/B bien hecho estima el efecto medio del tratamiento en la población sorteada. Es el número que decide si la variación sube. Es robusto, exige pocos supuestos y viene gratis con el sorteo.

Lo que no dice es si ese efecto está distribuido de forma parecida entre las personas. Una media de más 0,9 punto puede ser 0,9 punto en todo el mundo, o puede ser 3 puntos en un cuarto de la base y un poco de daño en el resto. Las dos situaciones llevan a decisiones de producto radicalmente distintas y son indistinguibles en el informe estándar.

El objetivo del modelado de uplift es el efecto medio condicional del tratamiento: la diferencia entre el resultado esperado con tratamiento y el resultado esperado sin tratamiento, para un perfil de características. Gutierrez y Gérardy definen exactamente eso y registran la dificultad central enseguida: nunca se observa al mismo tiempo el resultado con y sin tratamiento para la misma persona. Lo que se quiere predecir es una cantidad que nunca aparece en los datos.

Efecto medio contra efecto condicional por perfilDel lado izquierdo, una única barra representa el efecto medio de 0,9 punto porcentual, el número que entrega el informe estándar. Del lado derecho, la misma población dividida en cuatro franjas con efectos de más 3,0, más 1,2, más 0,2 y menos 0,8 punto. La media de las cuatro es la misma barra de la izquierda.lo que muestra el informelo que hay debajomedia+0,90 pp+3,00Q1+1,20Q2+0,20Q3menos 0,80Q4las dos figuras vienen del MISMO experimento.
La barra de la izquierda es honesta y es la que decide si la variación sube. Simplemente no contiene la información que decide para quién activarla.

El ejemplo trabajado: cuatro cuartiles, una decisión distinta

Un ecommerce corre un test con 50.000 usuarios por brazo para un nuevo recordatorio de carrito. El modelo de uplift, entrenado con datos de una ronda anterior, ordenó a los usuarios por efecto predicho y los dividió en cuatro cuartiles de 12.500 por brazo. El resultado medido en cada cuartil:

cuartil (por efecto predicho) control con recordatorio efecto valor p
Q1 (mayor efecto predicho) 375 de 12.500 = 3,00% 750 de 12.500 = 6,00% más 3,0000 puntos por debajo de 0,0001
Q2 500 de 12.500 = 4,00% 650 de 12.500 = 5,20% más 1,2000 puntos por debajo de 0,0001
Q3 750 de 12.500 = 6,00% 775 de 12.500 = 6,20% más 0,2000 punto 0,508836
Q4 (menor efecto predicho) 1.000 de 12.500 = 8,00% 900 de 12.500 = 7,20% menos 0,8000 punto 0,017003
población entera 2.625 de 50.000 = 5,25% 3.075 de 50.000 = 6,15% más 0,9000 punto por debajo de 0,0001
Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Pegue cualquiera de las cinco filas en la calculadora de arriba. La última es el resultado que iría a la reunión: más 0,9000 punto porcentual, más 17,14 por ciento relativo, intervalo de confianza de 95 por ciento entre más 0,6127 y más 1,1873 punto. Victoria limpia, sin ninguna salvedad aparente.

Las cuatro primeras filas cuentan otra historia. Q1 duplica la tasa de conversión. Q4 tiene efecto negativo y significativo, con intervalo entre menos 1,4569 y menos 0,1431 punto. En ese cuartil, el recordatorio aleja a gente que habría comprado.

Vale la pena notar quién está en Q4: son los usuarios con la mayor tasa de conversión de base, 8,00 por ciento contra 3,00 por ciento de Q1. Es el patrón clásico de las campañas de recordatorio, y es la razón por la que un modelo de propensión a convertir es un pésimo sustituto de un modelo de uplift. Quien más convierte no es quien más responde a la intervención.

Del puntaje a la política: la curva de ganancia

El puntaje por sí solo no vale nada. Lo que vale es la decisión que sale de él: hasta dónde tratar. Recorriendo los cuartiles del mayor puntaje al menor y acumulando las conversiones incrementales:

política tratados conversiones incrementales ganancia por 1.000 tratados
tratar solo Q1 12.500 375 30,00
tratar Q1 y Q2 25.000 525 21,00
tratar Q1, Q2 y Q3 37.500 550 14,67
tratar a todo el mundo 50.000 450 9,00

Los números de la última fila y de la penúltima merecen una lectura lenta. Tratar al 75 por ciento de la base rinde 550 conversiones; tratar al 100 por ciento rinde 450. Los últimos 12.500 usuarios tratados no cuestan solo el costo del tratamiento, le restan 100 conversiones al resultado.

Y si el tratamiento tiene costo por unidad, como un envío de email, un descuento o una notificación que gasta la atención del usuario, la comparación relevante es la última columna: tratar solo Q1 entrega 30,00 conversiones incrementales por cada mil tratamientos, más de tres veces la eficiencia de tratar la base entera.

Curva de ganancia acumulada según la fracción de la base tratadaUna curva muestra las conversiones incrementales acumuladas a medida que se trata del mayor puntaje de uplift al menor. Sube rápido hasta 375 en el primer cuartil, llega a 525 en el segundo, alcanza el pico de 550 en el tercero y cae a 450 cuando se trata a todo el mundo. Una recta diagonal representa el resultado de tratar en orden aleatorio, que llega a los mismos 450 al final.conversiones incrementales acumuladas025%50%75%100%Q1Q2Q3Q4tratar en orden aleatorio375525550 es el pico450la distancia entre la curva llena y la recta punteada es lo que vale el modelo de uplift.El tramo final descendente es el costo de tratar a quien no debía.
Radcliffe propuso la medida Qini justamente para resumir el área entre esas dos líneas. El pico de la curva, y no su punto final, es la política óptima.

Esa es la familia de métricas que usa la literatura. Gutierrez y Gérardy registran que, como no se observa el efecto por individuo, la mayor parte de la literatura de uplift recurre a medidas agregadas, franjas de uplift o curvas de uplift, con la medida Qini de Radcliffe entre ellas, y describen el enfoque común: predecir el uplift para tratados y controles, calcular la media predicha por decil en los dos grupos y tomar la diferencia de esas medias en cada decil.

Cómo construye el puntaje el modelado de uplift: los meta-aprendices

El puntaje por usuario no sale de un algoritmo mágico. Sale de combinar modelos de regresión comunes de una manera específica. Künzel, Sekhon, Bickel y Yu organizaron esas combinaciones en un marco único y bautizaron las principales:

meta-aprendiz cómo funciona cuándo elegirlo
S-learner un solo modelo, entrenado en la base entera, con el indicador de tratamiento entrando como una característica más; el puntaje es la diferencia entre predecir con y sin el indicador activado cuando el efecto es pequeño y usted quiere que el modelo pueda ignorarlo, con el riesgo de que efectivamente lo ignore
T-learner dos modelos separados, uno entrenado solo con los controles y otro solo con los tratados; el puntaje es la diferencia entre las dos predicciones el estándar intuitivo, y la base del enfoque de dos modelos de la literatura de uplift
X-learner empieza como el T-learner, después imputa el efecto individual cruzando los dos modelos con los resultados observados del otro brazo, y modela ese efecto imputado diseño desbalanceado, cuando uno de los grupos es mucho mayor que el otro
bosque causal árboles que particionan el espacio buscando diferencia de efecto, con estimación honesta por división de muestra cuando existen muchas covariables irrelevantes y usted quiere un intervalo de confianza puntual

El X-learner merece la explicación de por qué existe. Künzel y coautores lo proponen exactamente para aprovechar el diseño desbalanceado y la estructura conocida del efecto condicional, y la mecánica es elegante: en la segunda etapa, se resta la predicción del modelo de control de los resultados observados de los tratados, y se restan los resultados observados de los controles de la predicción del modelo de tratamiento, obteniendo efectos de tratamiento imputados que ahí sí pueden modelarse directamente.

Y vale la pena registrar su conclusión honesta: en simulaciones extensas, el X-learner tiene un desempeño favorable, aunque ninguno de los meta-aprendices es uniformemente el mejor. No existe una elección estándar que exima de probar.

Del lado de los bosques causales, Wager y Athey muestran que son puntualmente consistentes para el efecto verdadero y tienen una distribución muestral asintóticamente gaussiana y centrada, lo que permite construir un intervalo de confianza alrededor de la estimación. En sus experimentos, los bosques causales fueron sustancialmente más potentes que los métodos clásicos de emparejamiento por vecino más cercano, especialmente en presencia de covariables irrelevantes. El precio de eso es una condición que llaman honestidad: el árbol no puede usar la misma observación para elegir dónde dividir y para estimar el efecto dentro de la hoja.

La validación que no existe, y la que existe

Aquí está la diferencia más importante entre un modelo de uplift y cualquier modelo predictivo común. Un clasificador de churn tiene etiqueta verdadera: la persona canceló o no. Un modelo de uplift no tiene etiqueta alguna, porque el efecto individual nunca se observa.

Eso tiene tres consecuencias prácticas que suelen aprenderse por la vía cara:

  1. No existe exactitud, AUC ni error medio por observación para uplift. Cualquier métrica de ese tipo que aparezca en un informe está midiendo otra cosa, normalmente la predicción del resultado, no la del efecto.
  2. La evaluación es siempre agregada y siempre necesita un grupo de control en la base de validación. Sin control en la validación, no hay forma de saber el efecto real dentro de cada franja del puntaje.
  3. La base de validación tiene que separarse de la de entrenamiento por sorteo, y de preferencia venir de una ronda distinta del experimento, porque evaluar en la misma muestra en la que se ajustó el modelo devuelve una curva de ganancia optimista por construcción.
Por qué no existe etiqueta verdadera por usuarioPara cada usuario existen dos resultados potenciales, con tratamiento y sin tratamiento, y el efecto individual sería la diferencia entre ellos. El sorteo revela solo uno de los dos, marcado como observado, mientras el otro queda permanentemente desconocido. Por lo tanto la diferencia nunca es calculable para ninguna persona.un usuario sorteado para el tratamientoresultado CON tratamientoobservado: convirtióresultado SIN tratamientonunca observadoefecto individual = la diferenciano disponible para nadie, nuncapor eso la evaluación de un modelo de uplift se hace por franja del puntaje,comparando tratados y controles dentro de cada franja, y nunca por una métrica de error calculada fila por fila.
La ausencia de etiqueta no es una limitación de datos, es una propiedad del problema. Ningún volumen de tráfico la resuelve.

El corte, y el test que tiene que venir después

Encontrar el pico de la curva de ganancia no cierra el asunto, por dos motivos.

El primero es que el pico se estima con ruido. En el ejemplo, la diferencia entre tratar hasta Q3 (550) y tratar hasta Q2 (525) es de 25 conversiones, y el efecto de Q3 solo tiene valor p 0,508836, es decir, es indistinguible de cero. Tratar Q3 puede estar sumando casi nada y pagando costo por ello. Un efecto de cuartil sin significancia no sostiene una decisión de incluir ese cuartil en la política.

El segundo es más fundamental: la política elegida se armó mirando los datos. Tiene que validarse en su propio experimento, con el corte ya congelado.

lectura efecto valor p lo que sostiene
mitad de arriba (Q1 y Q2) 3,50% contra 5,60%, más 2,1000 puntos por debajo de 0,0001 tratar la mitad de arriba funciona
mitad de abajo (Q3 y Q4) 7,00% contra 6,70%, menos 0,3000 punto 0,184237 no hay evidencia de que tratar la mitad de abajo ayude

La lectura de la segunda fila es la más útil y la más incómoda: el efecto de la mitad de abajo no es significativamente negativo cuando se suman los dos cuartiles. Es decir, el daño concentrado en Q4 solo no sobrevive a la dilución con Q3. Una política construida sobre “Q4 hace daño” está apoyada en un efecto de 0,8 punto en un cuarto de la base, con intervalo entre menos 1,4569 y menos 0,1431, lo que es evidencia real pero frágil.

El camino correcto es el mismo de cualquier hallazgo encontrado en los datos: congelar la regla y correr un experimento confirmatorio en el que el propio corte es la variación testeada. El brazo A trata a todo el mundo, el brazo B trata solo a quien el modelo indica. El resultado compara las dos políticas, no los dos tratamientos, y es esa comparación la que autoriza subir la segmentación. El razonamiento general está en la ley de Twyman y la ronda de confirmación.

Errores comunes en el modelado de uplift

Hágalo automático con Donnu

El modelado de uplift depende de tres cosas que se deciden antes de que exista cualquier modelo: el experimento tiene que haber mantenido un grupo de control, las características tienen que quedar selladas en el instante del sorteo, y el resultado tiene que quedar guardado con la asignación original para convertirse en dato de entrenamiento de la ronda siguiente.

El primer punto es el que más se pierde en la práctica. Cuando una campaña se activa para todo el mundo porque el efecto medio fue positivo, el control desaparece y con él la posibilidad de estimar cualquier efecto condicional de ahí en adelante. Mantener un porcentaje pequeño de holdout permanente es lo que mantiene la puerta abierta.

Donnu sella el estado del usuario en la asignación y preserva el historial de brazo por usuario, lo que deja la base de entrenamiento lista sin reconstrucción manual y sin riesgo de usar una característica postratamiento. Para la lectura de cada franja del puntaje, la calculadora de significancia cierra exactamente las cinco filas de la tabla del ejemplo.

Referencias

Lee también: Efecto heterogéneo por segmento · Personalización vs test A/B · Maldición del ganador · La ley de Twyman · Calculadora de significancia · Leia em português · Read in English

Preguntas frecuentes

¿Qué es el modelado de uplift?
Es estimar, para cada usuario, el efecto que el tratamiento tendría en él, y usar ese número para decidir a quién tratar. El objetivo formal es el efecto medio condicional del tratamiento, es decir, la diferencia entre el resultado esperado con tratamiento y sin tratamiento para un perfil de características. Es distinto del efecto medio, que responde si vale la pena tratar a todo el mundo, y distinto de segmentar después del resultado, porque el puntaje se construye para convertirse en política.
¿Cuál es la diferencia entre uplift y efecto heterogéneo por segmento?
Leer el efecto por segmento es descriptivo: usted mira tres o cuatro cortes definidos por humanos y compara. El uplift es predictivo y operativo: un modelo devuelve un puntaje por usuario y la decisión de tratar sale de un corte en ese puntaje. En la práctica, uno sustituye al otro cuando el número de cortes posibles es demasiado grande para que un humano los enumere, y ambos exigen que el corte se haya definido antes del sorteo o por características pretratamiento.
¿Se puede validar un modelo de uplift usuario por usuario?
No. Nunca se observa al mismo tiempo el resultado con tratamiento y sin tratamiento para la misma persona, así que no existe etiqueta verdadera por observación ni ninguna métrica de error por fila. La evaluación es siempre agregada: se divide la base de validación en franjas del puntaje predicho y se compara el efecto real medido dentro de cada franja, que es lo que hacen las curvas de uplift y la medida Qini.
¿Un modelo de uplift puede empeorar el resultado?
Puede, de dos formas. La primera es que el modelo esté equivocado y usted trate a quien no responde, dejando de tratar a quien respondería. La segunda es más sutil: cuando existe un grupo con efecto negativo, tratar a todo el mundo destruye valor incluso con efecto medio positivo. En el ejemplo de esta guía, el cuartil de abajo pierde 0,8000 punto porcentual, y por eso tratar los tres primeros cuartiles rinde 550 conversiones incrementales contra 450 de tratar la base entera.
¿Necesito un experimento aleatorizado para entrenar un modelo de uplift?
Necesita datos en los que tratamiento y control se hayan asignado de forma comparable, y un experimento aleatorizado es la única fuente que lo garantiza por construcción. Entrenar uplift con datos observacionales es posible, pero entonces la estimación carga con todos los supuestos de la inferencia causal sin sorteo, y el puntaje aprende tanto quién responde como quién fue elegido para recibir.
¿Qué meta-aprendiz debo usar?
Künzel, Sekhon, Bickel y Yu comparan los principales en una simulación extensa y son explícitos: el X-learner tiene un desempeño favorable, aunque ningún meta-aprendiz es uniformemente el mejor. El X-learner se propuso exactamente para el caso de diseño desbalanceado, cuando uno de los grupos es mucho mayor que el otro, que es el caso común de una campaña en la que pocos fueron tratados.