Puntaje de Propensión: armar el par que no hubo sorteo
El puntaje de propensión colapsa decenas de covariables en un solo número para emparejar tratado y control. Qué arregla, qué no y dónde empeora.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Comparar a quien usó con quien no usó es la lectura más fácil de producir y la más fácil de errar. En la simulación de esta guía, la comparación cruda entre adoptantes y no adoptantes de un recurso devolvió más 216,67 por ciento, el emparejamiento por puntaje de propensión con covariables ricas lo bajó a más 24,12 por ciento, y el test aleatorizado que corrimos enseguida devolvió más 4,88 por ciento, sin significancia estadística. El puntaje de propensión es una herramienta legítima y muy bien fundamentada, y aun así solo arregla lo que mediste. Esta guía muestra la cuenta, su techo teórico, y las tres verificaciones que separan una lectura defendible de una justificación cara. Forma parte de nuestra guía completa de test A/B y complementa diferencias en diferencias y control sintético.
El problema: quien usó no es igual a quien no usó
La pregunta llega siempre con el mismo formato. Subimos un recurso nuevo, parte de los usuarios lo adoptó, y el equipo quiere saber si adoptarlo aumenta la conversión. El dato está todo en la base. La comparación sale en una consulta.
Solo que la adopción no fue aleatorizada. Quien adoptó eligió adoptar, y esa elección tiene causas:
- quien ya iba a convertir adopta más. El usuario comprometido explora el producto, encuentra el recurso y lo usa. Habría convertido de todos modos.
- el producto empujó hacia quien parecía prometedor. Si el recurso se liberó primero para un plan, un rango de tamaño de empresa o una cohorte, la adopción arrastra esa selección entera.
- la exposición fue decidida por un modelo. Recomendación, segmentación de campaña, disparador de correo. En ese caso la exposición fue literalmente optimizada para acertar a quien tenía más probabilidad de convertir.
- la antigüedad contamina todo. Un usuario antiguo tuvo más oportunidades de adoptar y más oportunidades de convertir, y las dos cosas crecen juntas sin que una cause la otra.
Ese es el problema clásico de confusión. La diferencia observada entre los dos grupos mezcla el efecto del recurso con la diferencia entre las personas. El puntaje de propensión es un intento organizado de separar las dos cosas usando lo que mediste.
Vale registrar de entrada que el camino preferido sigue siendo aleatorizar. Cuando se puede aleatorizar la exposición, aleatoriza, y usa la calculadora de tamaño de muestra para saber cuánto tiempo lleva eso. El puntaje de propensión es lo que se hace cuando la aleatorización no está disponible, no una alternativa equivalente a ella.
Las cuatro lecturas del mismo dato, y la calculadora que reproduce cada una
Simulamos una base de producto con un recurso nuevo. Cuatro lecturas del mismo fenómeno, de la más cruda a la más cuidadosa, y al final el experimento aleatorizado que sirve de patrón.
| lectura | control | tratado | efecto relativo | valor-p |
|---|---|---|---|---|
| cruda (todos los no adoptantes) | 630 de 21.000 = 3,000% | 456 de 4.800 = 9,500% | más 216,67% | por debajo de 0,0001 |
| emparejada por plan y antigüedad | 288 de 4.800 = 6,000% | 456 de 4.800 = 9,500% | más 58,33% | por debajo de 0,0001 |
| emparejada por propensión rica | 311 de 4.200 = 7,405% | 386 de 4.200 = 9,190% | más 24,12% | 0,0030 |
| experimento aleatorizado | 1.517 de 18.500 = 8,200% | 1.591 de 18.500 = 8,600% | más 4,88% | 0,1655 |
Pega cualquiera de las cuatro filas en la calculadora de abajo y verifica. Los números son los mismos, el veredicto cambia en cada fila.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Tres cosas para notar en esa tabla.
La tasa del tratado casi no se mueve. Va de 9,500 a 9,190 por ciento entre la lectura cruda y la emparejada rica, y el cambio viene solo de perder algunos tratados sin par disponible. Lo que cambia de verdad es la tasa del control: 3,000, después 6,000, después 7,405 por ciento. El emparejamiento no toca el tratamiento, cambia con quién lo comparas.
El valor-p sigue bonito mientras el efecto se encoge. En la tercera fila, el efecto ya cayó a menos de un noveno del original y el valor-p todavía es 0,0030, con intervalo de confianza del 95 por ciento entre más 0,607 y más 2,965 puntos porcentuales. La significancia estadística no mide sesgo. Mide ruido muestral, y sobra poco ruido cuando la muestra es grande.
La cuarta fila es la única que responde la pregunta hecha. Más 0,400 punto, más 4,88 por ciento, con intervalo entre menos 0,165 y más 0,965 punto y valor-p de 0,1655. Es decir: ni siquiera se puede afirmar que hubo efecto. Las tres lecturas observacionales lo afirmaron, con confianza creciente en la apariencia y decreciente en la realidad.
Qué es, exactamente, el puntaje de propensión
El puntaje de propensión de una persona es la probabilidad estimada de que haya recibido el tratamiento, dado todo lo que mediste sobre ella antes. Si un usuario tiene puntaje 0,65, el modelo dice que personas con ese perfil adoptaron el recurso en cerca del 65 por ciento de las veces.
El resultado que fundó el campo vino de Rosenbaum y Rubin, en Biometrika en 1983. El resumen del artículo es directo: la teoría en muestras grandes y pequeñas muestra que ajustar por el puntaje de propensión escalar es suficiente para remover el sesgo debido a todas las covariables observadas. Fíjate en las dos palabras que cargan el método entero: covariables observadas.
Eso es lo que hace tan útil a la técnica. Tienes 40 variables y no logras emparejar en todas al mismo tiempo, porque el número de celdas crece de forma explosiva. El puntaje colapsa las 40 en un único número, y emparejar en ese número entrega, en promedio, grupos equilibrados en las 40. Es una reducción de dimensión con garantía teórica.
En la práctica conviven tres familias de uso, y difieren principalmente en cuánto dato tiran:
| familia | qué hace | ¿descarta dato? | cuándo elegirla |
|---|---|---|---|
| emparejamiento | para cada tratado, toma el control de puntaje más cercano | sí, y bastante | cuando quieres el efecto sobre los tratados y prefieres transparencia a eficiencia |
| estratificación | corta la muestra en franjas de puntaje y compara dentro de cada franja | poco, solo franjas sin los dos grupos | cuando la superposición es razonable y quieres ver el efecto por franja |
| ponderación por el inverso de la propensión | mantiene a todos y pesa a cada persona por el inverso de la probabilidad de estar en el grupo en que está | no, pero los puntajes extremos se vuelven pesos gigantes | cuando la superposición es buena y no quieres perder muestra |
Fíjate en el riesgo escondido de la tercera fila: un control con puntaje 0,99, que casi seguramente habría sido expuesto y no lo fue, recibe un peso enorme. Una sola persona pasa a mandar en la estimación. Por eso recortar puntajes extremos es rutina, no excepción.
La escalera de corrección, medida contra el patrón
La mejor prueba pública de esa escalera vino de Gordon, Zettelmeyer, Bhargava y Chapsky, que usaron 12 estudios de medición de anuncios de Facebook en Estados Unidos, con 435 millones de observaciones de usuario por estudio y 1,4 mil millones de impresiones. En cada estudio existía un experimento aleatorizado de verdad como patrón, y ellos rehicieron la misma medición con los métodos observacionales que usa la industria.
En el estudio 4, la escalera fue así:
| método | efecto estimado |
|---|---|
| expuesto contra no expuesto, sin ajuste | más 416% |
| emparejamiento exacto en edad y género | más 221% |
| propensión con variables comunes de la plataforma | más 147% |
| propensión más cerca de 40 variables de censo | más 154% |
| propensión más métrica compuesta de miles de señales de comportamiento | más 102% |
| experimento aleatorizado (patrón) | más 77% |
El patrón es el mismo de nuestra simulación: cada capa de sofisticación acorta la distancia, y ninguna capa llega al final. Ir de emparejamiento exacto a propensión rica llevó el efecto de 221 a 102 por ciento, lo que es una mejora enorme, y aun así quedó una diferencia de 25 puntos sobre un patrón de 77.
Mirando el conjunto de los estudios, los autores contaron cuántas veces cada método produjo una estimación estadísticamente distinta de la experimental. Para los desenlaces de checkout, el emparejamiento exacto divergió del patrón en 10 de los 11 estudios evaluados, con desviación absoluta media de 661 puntos porcentuales contra un efecto experimental promedio de 57 por ciento. Las especificaciones de propensión mejoraron ese cuadro sin resolverlo: 9 de 11 en la primera, 8 de 10 en la segunda, 5 de 10 en la más rica, esta última con desviación absoluta media de 184 puntos. La regresión ajustada con ponderación por el inverso de la propensión y el conjunto más detallado de variables fue el mejor método del estudio, y aun así divergió en 3 de 10 casos, con desviación media de 173 puntos.
Ese es el resultado central para quien trabaja con producto: el puntaje de propensión mejora mucho la lectura y no la vuelve confiable. Reduce el error en un orden de magnitud y deja un error que sigue siendo mayor que el efecto que quieres medir.
La paradoja: podar más puede empeorar
Existe un segundo problema, más sutil y menos conocido, señalado por Gary King y Richard Nielsen en Political Analysis en 2019, en un artículo con el título directo de “Why Propensity Scores Should Not Be Used for Matching”.
El argumento es sobre qué experimento intenta imitar el método. Piensa en dos diseños experimentales. En el experimento completamente aleatorizado, sorteas quién entra en cada brazo y listo: los grupos quedan iguales en promedio, con variación muestral. En el experimento en bloques, primero agrupas personas idénticas en las covariables y solo entonces sorteas dentro de cada bloque: los grupos quedan iguales en promedio y también en cada bloque, lo que es más eficiente.
El emparejamiento por puntaje de propensión persigue el primer objetivo. Busca un subconjunto de los datos en que la exposición sea como si fuera completamente aleatoria. Los métodos que emparejan directamente en las covariables, como la distancia de Mahalanobis o el emparejamiento exacto grueso, persiguen el segundo. De ahí viene la consecuencia que los autores llaman paradoja: después de que el emparejamiento por propensión alcanza su propio objetivo, los puntajes dentro de cada estrato ya son aproximadamente constantes, y seguir podando el par de mayor distancia de puntaje se vuelve poda aleatoria con respecto a las covariables.
Y la poda aleatoria aumenta el desbalance. Su argumento más simple cabe en una línea: con un hombre y una mujer en el tratamiento y un hombre y una mujer en el control, dato perfectamente balanceado, soltar dos de las cuatro observaciones al azar deja un par hombre con hombre o mujer con mujer la mitad de las veces, y un par cruzado, completamente desbalanceado, en la otra mitad. En promedio, el desbalance aumentó.
Los autores rehicieron dos investigaciones publicadas con datos reales y vieron la paradoja aparecer de inmediato y continuar hasta que no quedó dato: cuanto más estricto el criterio de propensión, peor el balance. La práctica consagrada de fijar el límite de aproximación en un cuarto de la desviación estándar del puntaje dejó el balance peor que la solución básica en uno de los casos y no trajo ninguna mejora en el otro. Las curvas de los métodos que emparejan directo en las covariables bajaron en todo el rango, sin ninguna señal de reversión.
La lección operativa es corta: si usas propensión, mide el balance en las covariables, no en el puntaje, y dibuja la curva de desbalance contra observaciones podadas antes de elegir el punto de corte. Si la curva sube, estás apretando un tornillo en la dirección equivocada.
Superposición y prueba placebo: las dos verificaciones que valen más que el método
Imbens y Xu revisitaron, cuatro décadas después, el experimento que fundó esa discusión: el programa de capacitación evaluado por LaLonde en 1986, cuyos datos públicos se volvieron el campo de pruebas estándar del área. Enumeran cinco lecciones de la literatura desde entonces, y dos de ellas resuelven la mayor parte de los problemas del día a día.
Superposición. Las distribuciones de covariables de los dos grupos necesitan tener soporte común: para cada tratado, tiene que existir un control comparable. Sin eso, el modelo no está comparando, está extrapolando. Su conclusión es fuerte y práctica: cuando la superposición es mala, recortar la muestra para garantizarla importa más que la elección del estimador. En la muestra clásica en que la referencia experimental era 1.794 dólares, el corte para garantizar superposición hizo que las estimaciones de los distintos métodos convergieran en torno a la referencia, al costo de intervalos ligeramente más anchos. En la muestra peor comportada, las estimaciones del dato completo variaron de 4 a 2.420 dólares según el método.
Prueba placebo. Corre el mismo análisis sobre un desenlace que el tratamiento no podía haber afectado, típicamente la métrica en un período anterior al tratamiento. Si el análisis encuentra efecto donde no puede haberlo, está capturando selección, no causa. Esa es la prueba más barata y más informativa del repertorio, y es la que cierra la discusión en los datos de LaLonde: incluso donde los métodos modernos reproducen la referencia experimental, la prueba placebo no sostiene la premisa de ausencia de confusión. Traducido al día a día: cuando la prueba placebo falla, el número correcto que apareció fue coincidencia, y no habrías tenido cómo saberlo sin el patrón.
En tu producto, el placebo es fácil de armar. Toma la conversión de los usuarios en los 30 días antes de la existencia del recurso y corre el análisis emparejado como si el tratamiento fuera la adopción futura. Si los adoptantes futuros ya convertían más antes de que el recurso existiera, la diferencia que atribuiste al recurso ya estaba ahí.
Guion en ocho pasos
- Escribe la pregunta causal antes de abrir la base. Qué habría pasado con quien adoptó, en caso de no haber adoptado. Sin esa frase, el resto es descripción.
- Lista las covariables previas al tratamiento. Solo lo que existía ANTES de la exposición. Una variable medida después puede ser consecuencia del tratamiento, y controlar por ella borra el efecto que quieres medir.
- Estima el puntaje. La regresión logística sirve para empezar. Un modelo más flexible ayuda en el ajuste, no en la premisa.
- Mira la superposición antes de cualquier estimación. Grafica las dos distribuciones de puntaje. Si apenas se tocan, detente: el dato no responde la pregunta.
- Recorta para garantizar superposición. Descartar a quien no tiene par es honesto y cambia lo que estás estimando; di en el reporte qué población quedó.
- Mide el balance en las covariables, una a una. Y dibuja la curva de desbalance contra poda para no caer en la paradoja.
- Corre la prueba placebo. Desenlace previo al tratamiento, mismo análisis. Un efecto grande ahí derriba la lectura.
- Publica cuánta confusión no medida derribaría el resultado. Es el análisis de sensibilidad que cierra la pieza, tratado en confundidor no medido.
Errores comunes
- Tratar la significancia estadística como evidencia de ausencia de sesgo. En nuestra tercera fila, el valor-p era 0,0030 y el efecto estaba cinco veces por encima de la verdad. Una muestra grande estrecha el intervalo alrededor del número equivocado.
- Incluir covariables posteriores al tratamiento. Sesiones durante el período de exposición, clics en el propio recurso, correos abiertos después. Eso es consecuencia, no confundidor, y controlar por ellas destruye la estimación.
- Medir el balance en el puntaje en vez de en las covariables. Puntajes parecidos con perfiles diferentes es exactamente el caso que describe la paradoja de King y Nielsen.
- Apretar el límite de aproximación hasta que “mejore”. Sin la curva de desbalance, apretar es indistinguible de podar al azar.
- Confundir superposición con tamaño de muestra. Tener 15 mil controles no ayuda si ninguno de ellos se parece a los tratados. Es mejor tener 300 comparables.
- Creer que más covariables cierran la cuenta. En los datos de Facebook, miles de variables de comportamiento redujeron el error y no lo eliminaron. Lo que falta no está en la base.
- Usar el resultado como si fuera de un test aleatorizado. Si la decisión es cara, el emparejamiento sirve para priorizar el experimento, no para reemplazarlo.
- Ignorar que la exposición fue optimizada por un modelo. Si un algoritmo eligió quién vería, usó señales que probablemente no tienes en la base, y es justamente ese el confundidor que queda.
- Olvidar el sesgo de instrumentación. Si la medición de la conversión difiere entre adoptantes y no adoptantes, ningún emparejamiento arregla eso.
Hazlo automático en Donnu
El motivo más común de que un análisis emparejado no logre siquiera empezar no es estadístico, es de dato: las covariables previas al tratamiento no fueron guardadas como estaban antes de la exposición. Cuando la base solo tiene el estado actual del usuario, todo lo que queda son variables contaminadas por el propio tratamiento, y el emparejamiento pasa a controlar por consecuencia.
Donnu marca el estado del usuario en el momento de la asignación y guarda el resultado con la definición de métrica congelada, lo que convierte la superposición y la prueba placebo en consultas de minutos en vez de reconstrucciones de semanas. Y, más importante, existe para el caso en que sí se puede aleatorizar: siempre que la exposición quepa en un sorteo, ese es el camino, porque prescinde de la premisa de ausencia de confusión entera. Para saber si tu tráfico soporta el test aleatorizado antes de partir hacia el emparejamiento, la calculadora de tamaño de muestra responde en segundos, y la calculadora de significancia cierra la lectura al final.
Referencias
- Rosenbaum, P. R. y Rubin, D. B. The Central Role of the Propensity Score in Observational Studies for Causal Effects. Biometrika, volumen 70, número 1, abril de 1983, páginas 41 a 55. Fuente de la definición del puntaje de propensión como probabilidad condicional de asignación al tratamiento dado un vector de covariables observadas, y del resultado de que la teoría en muestras grandes y pequeñas muestra que ajustar por el puntaje escalar es suficiente para remover el sesgo debido a todas las covariables observadas, con las tres aplicaciones enumeradas en el artículo: emparejamiento univariado en el puntaje, ajuste multivariado por subclasificación y representación visual del ajuste de covarianza. academic.oup.com.
- Gordon, B., Zettelmeyer, F., Bhargava, N. y Chapsky, D. A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook. Versión larga en documento de trabajo, julio de 2016, publicado en Marketing Science en 2019. Fuente de los 12 estudios de medición en Estados Unidos con 435 millones de observaciones de usuario por estudio y 1,4 mil millones de impresiones; de la escalera del estudio 4 (más 416 por ciento sin ajuste, más 221 por ciento con emparejamiento exacto, más 147, 154 y 102 por ciento en las tres especificaciones de propensión, contra más 77 por ciento en el experimento aleatorizado); y de la Tabla 7, con 10 de 11 estudios de checkout divergiendo del patrón en el emparejamiento exacto y desviación absoluta media de 661 puntos porcentuales contra un efecto experimental promedio de 57 por ciento, contra 9 de 11 y 296 puntos, 8 de 10 y 202 puntos, 5 de 10 y 184 puntos en las tres especificaciones de propensión, y 3 de 10 y 173 puntos en la regresión ajustada con ponderación más detallada. kellogg.northwestern.edu.
- King, G. y Nielsen, R. Why Propensity Scores Should Not Be Used for Matching. Political Analysis, 2019. Fuente de que el emparejamiento por propensión aproxima un experimento completamente aleatorizado en vez de un experimento en bloques; de que, alcanzado ese objetivo, seguir podando equivale a poda aleatoria, que aumenta el desbalance (con el ejemplo de cuatro observaciones en que la mitad de los sorteos devuelve un par cruzado); de las dos replicaciones publicadas en que la paradoja aparece de inmediato y sigue hasta que no queda dato; y de que el límite de aproximación de un cuarto de la desviación estándar del puntaje dejó el balance peor que la solución básica en un caso y sin mejora en el otro, mientras las curvas de emparejamiento en las covariables bajaron en todo el rango. gking.harvard.edu.
- Imbens, G. W. y Xu, Y. Comparing Experimental and Nonexperimental Methods: What Lessons Have We Learned Four Decades After LaLonde (1986)? Journal of Economic Perspectives, versión de mayo de 2025. Fuente de las cinco lecciones de la literatura desde LaLonde, entre ellas la centralidad de la ausencia de confusión, la necesidad de inspeccionar la superposición y la importancia de las pruebas placebo; de la referencia experimental de 1.794 dólares en la muestra con controles de encuesta domiciliaria y de 1.911 dólares en la versión recortada, con estimaciones convergiendo en torno a ella tras el corte; del rango de 4 a 2.420 dólares entre métodos en la muestra peor comportada; y de la conclusión de que, incluso donde los métodos modernos reproducen la referencia experimental, las pruebas placebo no sostienen la premisa de ausencia de confusión. arxiv.org.
Lee también: Diferencias en diferencias · Control sintético · Regresión discontinua · Confundidor no medido · Intención de tratar · Calculadora de significancia · Leer en portugués
Preguntas frecuentes
- ¿Qué es el puntaje de propensión?
- Es la probabilidad estimada de que una persona reciba el tratamiento, dado todo lo que mediste sobre ella antes del tratamiento. Rosenbaum y Rubin mostraron en 1983 que ajustar por ese único número escalar ya basta para remover el sesgo causado por todas las covariables observadas, lo que convierte un problema de emparejar decenas de variables en un problema de emparejar una sola.
- ¿El puntaje de propensión reemplaza a un test A/B?
- No. Remueve el sesgo de las variables que mediste, y solo de ellas. Nada en el método toca lo que no mediste. En la comparación de Gordon, Zettelmeyer, Bhargava y Chapsky con 12 estudios de anuncios de Facebook, la mejor especificación de emparejamiento por propensión todavía divergió del resultado aleatorizado en la mitad de los casos de checkout, con desviación absoluta media de 184 puntos porcentuales contra un promedio de efecto real de 57 por ciento.
- ¿Cuánto corrige el emparejamiento por propensión, en la práctica?
- Acorta la distancia, pero en general no la cierra. En la simulación de esta guía, la comparación ingenua de adoptantes contra no adoptantes devolvió más 216,67 por ciento, el emparejamiento con dos covariables devolvió más 58,33 por ciento, el emparejamiento con propensión rica devolvió más 24,12 por ciento, y el experimento aleatorizado que corrimos después devolvió más 4,88 por ciento sin significancia estadística. Cada paso corrige una parte y ningún paso llega al final.
- ¿Podar más observaciones mejora el balance?
- No siempre, y ese es el hallazgo contraintuitivo de King y Nielsen. El emparejamiento por propensión persigue un experimento completamente aleatorizado, no un experimento en bloques. Después de alcanzar ese objetivo, seguir podando el peor par se vuelve poda aleatoria, y la poda aleatoria aumenta el desbalance en vez de reducirlo. En las dos replicaciones publicadas que rehicieron, el efecto apareció desde el inicio y siguió hasta que no quedó dato.
- ¿Qué verificar antes de creer en un emparejamiento?
- Tres cosas, en orden. Superposición: existe un control comparable para cada tratado, o estás extrapolando. Balance en las covariables, no en el puntaje. Y prueba placebo: corre el mismo análisis en un desenlace que el tratamiento no podía haber afectado, típicamente un período anterior al tratamiento. Imbens y Xu muestran que, en los datos clásicos de LaLonde, los métodos modernos hasta reproducen la referencia experimental, pero la prueba placebo no sostiene la premisa que le daría significado causal.
- ¿Cuál es la premisa que exige el método?
- Ausencia de confusión, también llamada ignorabilidad: condicionado a las covariables medidas, recibir el tratamiento es como si hubiera sido aleatorizado. No es comprobable con los datos, y es exactamente ella la que se rompe cuando existe un motivo no medido que empuja a la persona tanto hacia el tratamiento como hacia la conversión. El tamaño de ese motivo se mide por análisis de sensibilidad, no por más covariables.