Estadística

Puntaje de Propensión: armar el par que no hubo sorteo

El puntaje de propensión colapsa decenas de covariables en un solo número para emparejar tratado y control. Qué arregla, qué no y dónde empeora.

Ilustración plana de dos grupos de círculos de tamaños variados, algunos unidos por líneas finas al par de tamaño parecido en el otro grupo y los demás desvanecidos

Comparar a quien usó con quien no usó es la lectura más fácil de producir y la más fácil de errar. En la simulación de esta guía, la comparación cruda entre adoptantes y no adoptantes de un recurso devolvió más 216,67 por ciento, el emparejamiento por puntaje de propensión con covariables ricas lo bajó a más 24,12 por ciento, y el test aleatorizado que corrimos enseguida devolvió más 4,88 por ciento, sin significancia estadística. El puntaje de propensión es una herramienta legítima y muy bien fundamentada, y aun así solo arregla lo que mediste. Esta guía muestra la cuenta, su techo teórico, y las tres verificaciones que separan una lectura defendible de una justificación cara. Forma parte de nuestra guía completa de test A/B y complementa diferencias en diferencias y control sintético.

El problema: quien usó no es igual a quien no usó

La pregunta llega siempre con el mismo formato. Subimos un recurso nuevo, parte de los usuarios lo adoptó, y el equipo quiere saber si adoptarlo aumenta la conversión. El dato está todo en la base. La comparación sale en una consulta.

Solo que la adopción no fue aleatorizada. Quien adoptó eligió adoptar, y esa elección tiene causas:

Ese es el problema clásico de confusión. La diferencia observada entre los dos grupos mezcla el efecto del recurso con la diferencia entre las personas. El puntaje de propensión es un intento organizado de separar las dos cosas usando lo que mediste.

Vale registrar de entrada que el camino preferido sigue siendo aleatorizar. Cuando se puede aleatorizar la exposición, aleatoriza, y usa la calculadora de tamaño de muestra para saber cuánto tiempo lleva eso. El puntaje de propensión es lo que se hace cuando la aleatorización no está disponible, no una alternativa equivalente a ella.

Las cuatro lecturas del mismo dato, y la calculadora que reproduce cada una

Simulamos una base de producto con un recurso nuevo. Cuatro lecturas del mismo fenómeno, de la más cruda a la más cuidadosa, y al final el experimento aleatorizado que sirve de patrón.

lectura control tratado efecto relativo valor-p
cruda (todos los no adoptantes) 630 de 21.000 = 3,000% 456 de 4.800 = 9,500% más 216,67% por debajo de 0,0001
emparejada por plan y antigüedad 288 de 4.800 = 6,000% 456 de 4.800 = 9,500% más 58,33% por debajo de 0,0001
emparejada por propensión rica 311 de 4.200 = 7,405% 386 de 4.200 = 9,190% más 24,12% 0,0030
experimento aleatorizado 1.517 de 18.500 = 8,200% 1.591 de 18.500 = 8,600% más 4,88% 0,1655

Pega cualquiera de las cuatro filas en la calculadora de abajo y verifica. Los números son los mismos, el veredicto cambia en cada fila.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Tres cosas para notar en esa tabla.

La tasa del tratado casi no se mueve. Va de 9,500 a 9,190 por ciento entre la lectura cruda y la emparejada rica, y el cambio viene solo de perder algunos tratados sin par disponible. Lo que cambia de verdad es la tasa del control: 3,000, después 6,000, después 7,405 por ciento. El emparejamiento no toca el tratamiento, cambia con quién lo comparas.

El valor-p sigue bonito mientras el efecto se encoge. En la tercera fila, el efecto ya cayó a menos de un noveno del original y el valor-p todavía es 0,0030, con intervalo de confianza del 95 por ciento entre más 0,607 y más 2,965 puntos porcentuales. La significancia estadística no mide sesgo. Mide ruido muestral, y sobra poco ruido cuando la muestra es grande.

La cuarta fila es la única que responde la pregunta hecha. Más 0,400 punto, más 4,88 por ciento, con intervalo entre menos 0,165 y más 0,965 punto y valor-p de 0,1655. Es decir: ni siquiera se puede afirmar que hubo efecto. Las tres lecturas observacionales lo afirmaron, con confianza creciente en la apariencia y decreciente en la realidad.

Qué es, exactamente, el puntaje de propensión

El puntaje de propensión de una persona es la probabilidad estimada de que haya recibido el tratamiento, dado todo lo que mediste sobre ella antes. Si un usuario tiene puntaje 0,65, el modelo dice que personas con ese perfil adoptaron el recurso en cerca del 65 por ciento de las veces.

El resultado que fundó el campo vino de Rosenbaum y Rubin, en Biometrika en 1983. El resumen del artículo es directo: la teoría en muestras grandes y pequeñas muestra que ajustar por el puntaje de propensión escalar es suficiente para remover el sesgo debido a todas las covariables observadas. Fíjate en las dos palabras que cargan el método entero: covariables observadas.

Eso es lo que hace tan útil a la técnica. Tienes 40 variables y no logras emparejar en todas al mismo tiempo, porque el número de celdas crece de forma explosiva. El puntaje colapsa las 40 en un único número, y emparejar en ese número entrega, en promedio, grupos equilibrados en las 40. Es una reducción de dimensión con garantía teórica.

Del vector de covariables al puntaje escalar y al parA la izquierda, una pila de barras representa muchas covariables medidas de una persona. En el medio, un embudo las reduce a un único número entre cero y uno. A la derecha, ese número se usa para encontrar a la persona más parecida del grupo opuesto.1. lo que medisteplan, antigüedad, tamaño,sesiones, canal de origen, país,y otras 34 variablesmodelo deexposición2. un solo número0,65probabilidad estimada dehaber sido expuesto3. el par0,65expuesto0,64no expuestoexpuestos sin parsalen de la cuenta
El puntaje no es una medida de calidad de la persona. Es la probabilidad de que haya sido expuesta, y sirve solo para hallar con quién compararla.

En la práctica conviven tres familias de uso, y difieren principalmente en cuánto dato tiran:

familia qué hace ¿descarta dato? cuándo elegirla
emparejamiento para cada tratado, toma el control de puntaje más cercano sí, y bastante cuando quieres el efecto sobre los tratados y prefieres transparencia a eficiencia
estratificación corta la muestra en franjas de puntaje y compara dentro de cada franja poco, solo franjas sin los dos grupos cuando la superposición es razonable y quieres ver el efecto por franja
ponderación por el inverso de la propensión mantiene a todos y pesa a cada persona por el inverso de la probabilidad de estar en el grupo en que está no, pero los puntajes extremos se vuelven pesos gigantes cuando la superposición es buena y no quieres perder muestra

Fíjate en el riesgo escondido de la tercera fila: un control con puntaje 0,99, que casi seguramente habría sido expuesto y no lo fue, recibe un peso enorme. Una sola persona pasa a mandar en la estimación. Por eso recortar puntajes extremos es rutina, no excepción.

La escalera de corrección, medida contra el patrón

La mejor prueba pública de esa escalera vino de Gordon, Zettelmeyer, Bhargava y Chapsky, que usaron 12 estudios de medición de anuncios de Facebook en Estados Unidos, con 435 millones de observaciones de usuario por estudio y 1,4 mil millones de impresiones. En cada estudio existía un experimento aleatorizado de verdad como patrón, y ellos rehicieron la misma medición con los métodos observacionales que usa la industria.

En el estudio 4, la escalera fue así:

método efecto estimado
expuesto contra no expuesto, sin ajuste más 416%
emparejamiento exacto en edad y género más 221%
propensión con variables comunes de la plataforma más 147%
propensión más cerca de 40 variables de censo más 154%
propensión más métrica compuesta de miles de señales de comportamiento más 102%
experimento aleatorizado (patrón) más 77%

El patrón es el mismo de nuestra simulación: cada capa de sofisticación acorta la distancia, y ninguna capa llega al final. Ir de emparejamiento exacto a propensión rica llevó el efecto de 221 a 102 por ciento, lo que es una mejora enorme, y aun así quedó una diferencia de 25 puntos sobre un patrón de 77.

Mirando el conjunto de los estudios, los autores contaron cuántas veces cada método produjo una estimación estadísticamente distinta de la experimental. Para los desenlaces de checkout, el emparejamiento exacto divergió del patrón en 10 de los 11 estudios evaluados, con desviación absoluta media de 661 puntos porcentuales contra un efecto experimental promedio de 57 por ciento. Las especificaciones de propensión mejoraron ese cuadro sin resolverlo: 9 de 11 en la primera, 8 de 10 en la segunda, 5 de 10 en la más rica, esta última con desviación absoluta media de 184 puntos. La regresión ajustada con ponderación por el inverso de la propensión y el conjunto más detallado de variables fue el mejor método del estudio, y aun así divergió en 3 de 10 casos, con desviación media de 173 puntos.

Ese es el resultado central para quien trabaja con producto: el puntaje de propensión mejora mucho la lectura y no la vuelve confiable. Reduce el error en un orden de magnitud y deja un error que sigue siendo mayor que el efecto que quieres medir.

La paradoja: podar más puede empeorar

Existe un segundo problema, más sutil y menos conocido, señalado por Gary King y Richard Nielsen en Political Analysis en 2019, en un artículo con el título directo de “Why Propensity Scores Should Not Be Used for Matching”.

El argumento es sobre qué experimento intenta imitar el método. Piensa en dos diseños experimentales. En el experimento completamente aleatorizado, sorteas quién entra en cada brazo y listo: los grupos quedan iguales en promedio, con variación muestral. En el experimento en bloques, primero agrupas personas idénticas en las covariables y solo entonces sorteas dentro de cada bloque: los grupos quedan iguales en promedio y también en cada bloque, lo que es más eficiente.

El emparejamiento por puntaje de propensión persigue el primer objetivo. Busca un subconjunto de los datos en que la exposición sea como si fuera completamente aleatoria. Los métodos que emparejan directamente en las covariables, como la distancia de Mahalanobis o el emparejamiento exacto grueso, persiguen el segundo. De ahí viene la consecuencia que los autores llaman paradoja: después de que el emparejamiento por propensión alcanza su propio objetivo, los puntajes dentro de cada estrato ya son aproximadamente constantes, y seguir podando el par de mayor distancia de puntaje se vuelve poda aleatoria con respecto a las covariables.

Y la poda aleatoria aumenta el desbalance. Su argumento más simple cabe en una línea: con un hombre y una mujer en el tratamiento y un hombre y una mujer en el control, dato perfectamente balanceado, soltar dos de las cuatro observaciones al azar deja un par hombre con hombre o mujer con mujer la mitad de las veces, y un par cruzado, completamente desbalanceado, en la otra mitad. En promedio, el desbalance aumentó.

Desbalance contra observaciones podadasDos curvas que comparan métodos. La curva del emparejamiento por propensión baja un poco y después sube continuamente conforme se podan más observaciones. La curva del emparejamiento directo en las covariables baja de forma monótona en todo el rango.ninguna observación podadacasi todo podadomásdesbal.menosdato originalpropensiónemparejamiento en las covariablespoda aleatoriapunto en que la propensiónya alcanzó su propio objetivo
Después de que la propensión alcanza su objetivo, apretar más el criterio equivale a tirar los dados. La curva roja reproduce la forma reportada por King y Nielsen en las dos replicaciones publicadas.

Los autores rehicieron dos investigaciones publicadas con datos reales y vieron la paradoja aparecer de inmediato y continuar hasta que no quedó dato: cuanto más estricto el criterio de propensión, peor el balance. La práctica consagrada de fijar el límite de aproximación en un cuarto de la desviación estándar del puntaje dejó el balance peor que la solución básica en uno de los casos y no trajo ninguna mejora en el otro. Las curvas de los métodos que emparejan directo en las covariables bajaron en todo el rango, sin ninguna señal de reversión.

La lección operativa es corta: si usas propensión, mide el balance en las covariables, no en el puntaje, y dibuja la curva de desbalance contra observaciones podadas antes de elegir el punto de corte. Si la curva sube, estás apretando un tornillo en la dirección equivocada.

Superposición y prueba placebo: las dos verificaciones que valen más que el método

Imbens y Xu revisitaron, cuatro décadas después, el experimento que fundó esa discusión: el programa de capacitación evaluado por LaLonde en 1986, cuyos datos públicos se volvieron el campo de pruebas estándar del área. Enumeran cinco lecciones de la literatura desde entonces, y dos de ellas resuelven la mayor parte de los problemas del día a día.

Superposición. Las distribuciones de covariables de los dos grupos necesitan tener soporte común: para cada tratado, tiene que existir un control comparable. Sin eso, el modelo no está comparando, está extrapolando. Su conclusión es fuerte y práctica: cuando la superposición es mala, recortar la muestra para garantizarla importa más que la elección del estimador. En la muestra clásica en que la referencia experimental era 1.794 dólares, el corte para garantizar superposición hizo que las estimaciones de los distintos métodos convergieran en torno a la referencia, al costo de intervalos ligeramente más anchos. En la muestra peor comportada, las estimaciones del dato completo variaron de 4 a 2.420 dólares según el método.

Superposición buena y superposición malaDos paneles con distribuciones de puntaje de propensión. En el panel de la izquierda las curvas de expuestos y no expuestos se cubren en casi todo el rango. En el panel de la derecha apenas se tocan, y la región común es una franja estrecha en el medio.superposición buena: se puede comparar0,01,0puntaje de propensiónexpuestosno expuestossuperposición mala: extrapolación0,01,0región común: casi nadie
Sin región común, el emparejamiento no compara, proyecta. Ninguna sofisticación del modelo crea dato donde no existe dato.

Prueba placebo. Corre el mismo análisis sobre un desenlace que el tratamiento no podía haber afectado, típicamente la métrica en un período anterior al tratamiento. Si el análisis encuentra efecto donde no puede haberlo, está capturando selección, no causa. Esa es la prueba más barata y más informativa del repertorio, y es la que cierra la discusión en los datos de LaLonde: incluso donde los métodos modernos reproducen la referencia experimental, la prueba placebo no sostiene la premisa de ausencia de confusión. Traducido al día a día: cuando la prueba placebo falla, el número correcto que apareció fue coincidencia, y no habrías tenido cómo saberlo sin el patrón.

En tu producto, el placebo es fácil de armar. Toma la conversión de los usuarios en los 30 días antes de la existencia del recurso y corre el análisis emparejado como si el tratamiento fuera la adopción futura. Si los adoptantes futuros ya convertían más antes de que el recurso existiera, la diferencia que atribuiste al recurso ya estaba ahí.

Guion en ocho pasos

  1. Escribe la pregunta causal antes de abrir la base. Qué habría pasado con quien adoptó, en caso de no haber adoptado. Sin esa frase, el resto es descripción.
  2. Lista las covariables previas al tratamiento. Solo lo que existía ANTES de la exposición. Una variable medida después puede ser consecuencia del tratamiento, y controlar por ella borra el efecto que quieres medir.
  3. Estima el puntaje. La regresión logística sirve para empezar. Un modelo más flexible ayuda en el ajuste, no en la premisa.
  4. Mira la superposición antes de cualquier estimación. Grafica las dos distribuciones de puntaje. Si apenas se tocan, detente: el dato no responde la pregunta.
  5. Recorta para garantizar superposición. Descartar a quien no tiene par es honesto y cambia lo que estás estimando; di en el reporte qué población quedó.
  6. Mide el balance en las covariables, una a una. Y dibuja la curva de desbalance contra poda para no caer en la paradoja.
  7. Corre la prueba placebo. Desenlace previo al tratamiento, mismo análisis. Un efecto grande ahí derriba la lectura.
  8. Publica cuánta confusión no medida derribaría el resultado. Es el análisis de sensibilidad que cierra la pieza, tratado en confundidor no medido.

Errores comunes

Hazlo automático en Donnu

El motivo más común de que un análisis emparejado no logre siquiera empezar no es estadístico, es de dato: las covariables previas al tratamiento no fueron guardadas como estaban antes de la exposición. Cuando la base solo tiene el estado actual del usuario, todo lo que queda son variables contaminadas por el propio tratamiento, y el emparejamiento pasa a controlar por consecuencia.

Donnu marca el estado del usuario en el momento de la asignación y guarda el resultado con la definición de métrica congelada, lo que convierte la superposición y la prueba placebo en consultas de minutos en vez de reconstrucciones de semanas. Y, más importante, existe para el caso en que sí se puede aleatorizar: siempre que la exposición quepa en un sorteo, ese es el camino, porque prescinde de la premisa de ausencia de confusión entera. Para saber si tu tráfico soporta el test aleatorizado antes de partir hacia el emparejamiento, la calculadora de tamaño de muestra responde en segundos, y la calculadora de significancia cierra la lectura al final.

Referencias

Lee también: Diferencias en diferencias · Control sintético · Regresión discontinua · Confundidor no medido · Intención de tratar · Calculadora de significancia · Leer en portugués

Preguntas frecuentes

¿Qué es el puntaje de propensión?
Es la probabilidad estimada de que una persona reciba el tratamiento, dado todo lo que mediste sobre ella antes del tratamiento. Rosenbaum y Rubin mostraron en 1983 que ajustar por ese único número escalar ya basta para remover el sesgo causado por todas las covariables observadas, lo que convierte un problema de emparejar decenas de variables en un problema de emparejar una sola.
¿El puntaje de propensión reemplaza a un test A/B?
No. Remueve el sesgo de las variables que mediste, y solo de ellas. Nada en el método toca lo que no mediste. En la comparación de Gordon, Zettelmeyer, Bhargava y Chapsky con 12 estudios de anuncios de Facebook, la mejor especificación de emparejamiento por propensión todavía divergió del resultado aleatorizado en la mitad de los casos de checkout, con desviación absoluta media de 184 puntos porcentuales contra un promedio de efecto real de 57 por ciento.
¿Cuánto corrige el emparejamiento por propensión, en la práctica?
Acorta la distancia, pero en general no la cierra. En la simulación de esta guía, la comparación ingenua de adoptantes contra no adoptantes devolvió más 216,67 por ciento, el emparejamiento con dos covariables devolvió más 58,33 por ciento, el emparejamiento con propensión rica devolvió más 24,12 por ciento, y el experimento aleatorizado que corrimos después devolvió más 4,88 por ciento sin significancia estadística. Cada paso corrige una parte y ningún paso llega al final.
¿Podar más observaciones mejora el balance?
No siempre, y ese es el hallazgo contraintuitivo de King y Nielsen. El emparejamiento por propensión persigue un experimento completamente aleatorizado, no un experimento en bloques. Después de alcanzar ese objetivo, seguir podando el peor par se vuelve poda aleatoria, y la poda aleatoria aumenta el desbalance en vez de reducirlo. En las dos replicaciones publicadas que rehicieron, el efecto apareció desde el inicio y siguió hasta que no quedó dato.
¿Qué verificar antes de creer en un emparejamiento?
Tres cosas, en orden. Superposición: existe un control comparable para cada tratado, o estás extrapolando. Balance en las covariables, no en el puntaje. Y prueba placebo: corre el mismo análisis en un desenlace que el tratamiento no podía haber afectado, típicamente un período anterior al tratamiento. Imbens y Xu muestran que, en los datos clásicos de LaLonde, los métodos modernos hasta reproducen la referencia experimental, pero la prueba placebo no sostiene la premisa que le daría significado causal.
¿Cuál es la premisa que exige el método?
Ausencia de confusión, también llamada ignorabilidad: condicionado a las covariables medidas, recibir el tratamiento es como si hubiera sido aleatorizado. No es comprobable con los datos, y es exactamente ella la que se rompe cuando existe un motivo no medido que empuja a la persona tanto hacia el tratamiento como hacia la conversión. El tamaño de ese motivo se mide por análisis de sensibilidad, no por más covariables.