Estimador Doblemente Robusto: dos chances de acertar
El estimador doblemente robusto acierta si el modelo de propensión O el de resultado es correcto. La cuenta, el ejemplo en cuatro escenarios y el límite.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Cuando el tratamiento no fue sorteado, existen dos caminos para estimar el efecto: modelar quién recibió el tratamiento, o modelar el resultado. Cada uno funciona si su modelo es correcto, y cada uno se equivoca solo si está equivocado. El estimador doblemente robusto usa los dos y acierta si AL MENOS UNO de ellos es correcto. En el ejemplo de esta guía, el efecto verdadero es más 3,0000 puntos porcentuales y la diferencia bruta entre tratados y no tratados devuelve más 5,9091 puntos. Con la propensión correcta y el resultado equivocado, la ponderación acierta y la regresión se equivoca; con la propensión equivocada y el resultado correcto, ocurre lo inverso; el doblemente robusto devuelve 3,0000 en los dos casos. Esta guía muestra la cuenta en cuatro escenarios, el caso en que también falla, y por qué en un experimento aleatorizado de verdad esa robustez viene gratis. Forma parte de nuestra guía completa de test A/B y es la red de protección del puntaje de propensión.
Dos formas de corregir la misma distorsión
Un producto libera una función nueva por adhesión espontánea. Quien quiso, la activó. Meses después llega la pregunta: ¿la función aumentó la conversión?
La comparación directa entre quien la activó y quien no la activó no responde eso, porque quien la activó ya era diferente antes de activarla. Existen dos familias de corrección, y atacan el problema por lados opuestos:
| familia | qué modela | cómo corrige | falla cuando |
|---|---|---|---|
| ponderación por el inverso de la propensión | la probabilidad de cada persona de recibir el tratamiento, dadas sus características | reponderar a los observados para reconstruir la población entera | el modelo de quién fue tratado está equivocado, o devuelve propensiones muy pequeñas |
| regresión del resultado | el resultado esperado con y sin tratamiento, dadas las características | predecir los dos resultados para todos y sacar la diferencia media | el modelo del resultado está equivocado |
| doblemente robusto | los dos al mismo tiempo | usa la regresión como base y corrige su residuo con pesos de propensión | los DOS están equivocados |
La tercera fila es la promesa, y Kang y Schafer la formulan con precisión: los procedimientos doblemente robustos aplican los dos tipos de modelo simultáneamente y producen una estimación consistente del parámetro si cualquiera de los dos ha sido especificado correctamente.
El ejemplo trabajado: cuatro escenarios, una tabla
Una base de 100.000 usuarios, dos tipos de dispositivo, adhesión espontánea a una función nueva. Los números verdaderos, que en la vida real nadie observa:
| estrato | personas | adhesión real | conversión sin la función | conversión con la función | efecto |
|---|---|---|---|---|---|
| escritorio | 60.000 | 75% | 10,0% | 13,0% | más 3,0 puntos |
| móvil | 40.000 | 25% | 4,0% | 7,0% | más 3,0 puntos |
| total | 100.000 | 55% | más 3,0000 puntos |
Nótese que el efecto es el mismo en los dos estratos. Aquí no hay heterogeneidad ninguna. El problema es enteramente de composición: escritorio adhiere mucho más y convierte mucho más, así que el grupo de los adherentes está dominado por escritorio y el grupo de los no adherentes está dominado por móvil.
Lo que se observa en la tabla de la base de datos:
| grupo | personas | conversiones | tasa |
|---|---|---|---|
| adhirieron | 55.000 | 6.550 | 11,9091% |
| no adhirieron | 45.000 | 2.700 | 6,0000% |
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pegue esas dos filas en la calculadora de arriba: más 5,9091 puntos porcentuales, más 98,48 por ciento relativo, valor p por debajo de lo que se puede mostrar. Un resultado espectacular, altamente significativo, y casi el doble del efecto verdadero. La significancia no protege contra el sesgo de composición; solo dice que la diferencia observada no es azar, y en efecto no lo es. Es confusión.
Ahora, los cuatro escenarios. En cada uno, “correcto” significa que el modelo reproduce la realidad de los estratos y “equivocado” significa que ignora el dispositivo y usa un número único para toda la base.
| escenario | ponderación por propensión | regresión del resultado | doblemente robusto |
|---|---|---|---|
| propensión CORRECTA, resultado EQUIVOCADO | 3,0000 puntos | 5,9091 puntos | 3,0000 puntos |
| propensión EQUIVOCADA, resultado CORRECTO | 5,9091 puntos | 3,0000 puntos | 3,0000 puntos |
| los dos correctos | 3,0000 puntos | 3,0000 puntos | 3,0000 puntos |
| los dos equivocados | 5,9091 puntos | 5,9091 puntos | 5,9091 puntos |
Las dos primeras filas son la doble robustez entera, en números. En ellas, uno de los dos métodos simples entrega el valor verdadero y el otro entrega el sesgo completo, y quien lee el informe no tiene forma de saber cuál es cuál, porque ambos modelos son plausibles y ninguna prueba distingue “mi modelo de propensión es correcto” de “mi modelo de resultado es correcto”. El estimador doblemente robusto evita esa elección: entrega 3,0000 puntos en las dos.
Cómo funciona por dentro el estimador doblemente robusto
La mecánica es más simple de lo que sugiere el nombre. El estimador doblemente robusto parte de la predicción del modelo de resultado para todo el mundo y después suma una corrección construida a partir del error que ese modelo cometió donde puede ser verificado, es decir, en los individuos cuyo resultado sí fue observado, con cada error reponderado por el inverso de la propensión.
Las dos propiedades salen de ahí:
- Si el modelo de resultado es correcto, los errores son cero en promedio y la corrección no hace nada. La estimación es la de la regresión, que es correcta, y la propensión puede estar completamente equivocada sin consecuencia, porque solo multiplica ceros.
- Si el modelo de propensión es correcto, la corrección reponderada compensa exactamente cuánto se equivocó la predicción en cada grupo, y el resultado converge al mismo valor que entregaría la ponderación pura.
En un experimento aleatorizado, la segunda propiedad es gratuita: la propensión se conoce por diseño, normalmente 0,5, y por definición no puede estar equivocada. Corriendo el mismo ejemplo con sorteo mitad y mitad en vez de adhesión espontánea, la diferencia simple de medias devuelve exactamente 3,0000 puntos y el estimador doblemente robusto con un modelo de resultado totalmente equivocado devuelve esos mismos 3,0000 puntos.
Ese es el puente entre este tema y el test A/B del día a día. En un experimento, el término de corrección no arregla sesgo, porque no hay sesgo: reduce varianza, y lo que queda es exactamente el ajuste por regresión. Un método, dos lecturas según exista o no el sorteo.
El límite: dos modelos equivocados no son mejores que uno
Kang y Schafer construyeron un estudio de simulación en el que los dos modelos están equivocados, pero ninguno de ellos groseramente mal especificado, que es la situación realista de cualquier análisis observacional. Sus conclusiones son incómodas y hay que decirlas por entero:
- los métodos que usan el inverso de la probabilidad como peso, sean doblemente robustos o no, son sensibles a la mala especificación del modelo de propensión cuando algunas propensiones estimadas son pequeñas;
- muchos métodos doblemente robustos tuvieron mejor desempeño que la ponderación simple por el inverso de la probabilidad;
- ninguno de los métodos doblemente robustos que probaron superó la simple predicción del resultado por regresión;
- y la frase que lo resume todo: en al menos algunos contextos, dos modelos equivocados no son mejores que uno.
La cuarta fila de la tabla de escenarios es la versión aritmética de eso. Con los dos modelos equivocados, el doblemente robusto devuelve los mismos 5,9091 puntos sesgados, sin ninguna señal de alarma.
Qué hacer con el estimador doblemente robusto en la práctica
La lectura combinada de todo lo anterior lleva a un protocolo, no a una receta de estimador único:
- Corra los tres estimadores y publique los tres. Ponderación, regresión y doblemente robusto. La divergencia entre ellos es la información más útil del informe.
- Si los tres coinciden, usted está en la tercera fila de la tabla de escenarios, y la estimación está bien sostenida.
- Si dos divergen y el doblemente robusto acompaña a uno de ellos, usted está en una de las dos primeras filas, y el doblemente robusto es la lectura a reportar.
- Si el doblemente robusto no acompaña a ninguno de los dos de forma estable, desconfíe de propensiones extremas antes que de cualquier otra cosa.
- Mire siempre la distribución de las propensiones estimadas. El corte o recorte de valores extremos es una decisión a tomar antes de ver el resultado, y el rango cortado tiene que constar en el informe.
- Si usa aprendizaje automático en los modelos auxiliares, use ajuste cruzado. Chernozhukov y coautores muestran que meter estimaciones de aprendizaje automático directamente en las ecuaciones de estimación genera un sesgo pesado en el parámetro de interés, y que la corrección necesita dos ingredientes: puntajes ortogonales de Neyman, con sensibilidad reducida a los parámetros auxiliares, y ajuste cruzado.
- Nunca olvide a qué pregunta responde esto. Es la segunda mejor respuesta. La primera es sortear, y cuando el tratamiento no puede sortearse directamente, el diseño de estímulo suele ser más barato de lo que parece.
Errores comunes
- Presentar la estimación doblemente robusta como si fuera inmune al sesgo. Es inmune a un modelo equivocado, no a dos.
- No mirar la distribución de las propensiones. Es la fragilidad principal, y un único estrato raro puede dominar el error entero.
- Elegir entre los tres estimadores después de ver los tres resultados. La regla de cuál reportar tiene que estar en el plan de análisis preregistrado, como cualquier otra decisión de lectura.
- Usar aprendizaje automático sin ajuste cruzado. El sesgo de regularización no es pequeño y no desaparece con más datos.
- Incluir en el modelo de propensión variables medidas después del tratamiento. No son características de quién fue tratado, son consecuencias del tratamiento, y su inclusión destruye la estimación.
- Creer que la doble robustez sustituye a un experimento. Reduce la dependencia de una premisa y no elimina la premisa de que todos los confusores relevantes fueron medidos. La cuantificación de esa duda residual está en confusor no medido.
- Reportar el valor p de una estimación observacional como si fuera de un experimento. En el ejemplo, el resultado sesgado de 5,9091 puntos es altamente significativo. La significancia mide azar, no confusión.
Hágalo automático con Donnu
El estimador doblemente robusto vive o muere por la calidad de las características usadas en los dos modelos, y esas características tienen que existir en el estado en que estaban antes de que ocurriera el tratamiento. En una liberación por adhesión, eso significa guardar el perfil del usuario en el momento en que activó la función, y no en el momento en que se genera el informe.
Reconstruirlo después es el error que más se comete: el perfil actual de quien adoptó ya fue cambiado por la adopción, y un modelo de propensión entrenado sobre él aprende consecuencia, no causa. Donnu sella el estado del usuario en el instante de la asignación y mantiene el historial de exposición por usuario, lo que deja a los dos modelos con el insumo correcto sin reconstrucción manual.
Y vale la recomendación de alcance, que es la más importante de este artículo: cuando existe cualquier forma de sortear, sortee. La doble robustez es una buena segunda opción, y sigue siendo una segunda opción. La calculadora de significancia cierra la lectura bruta del ejemplo y sirve como demostración de por qué el valor p solo no distingue efecto de composición.
Referencias
- Kang, J. D. Y. y Schafer, J. L. Demystifying Double Robustness: A Comparison of Alternative Strategies for Estimating a Population Mean from Incomplete Data. Statistical Science, volumen 22, número 4, 2007, páginas 523 a 539. Fuente de la definición de que los procedimientos doblemente robustos aplican los dos tipos de modelo simultáneamente y producen una estimación consistente del parámetro si cualquiera de los dos ha sido correctamente especificado; del diseño de simulación en que los dos modelos están equivocados pero ninguno groseramente mal especificado; del resultado de que los métodos que usan el inverso de la probabilidad como peso, doblemente robustos o no, son sensibles a la mala especificación del modelo de propensión cuando algunas propensiones estimadas son pequeñas; del registro de que muchos métodos doblemente robustos superaron la ponderación simple pero ninguno superó la simple predicción por regresión; y de la conclusión de que, en al menos algunos contextos, dos modelos equivocados no son mejores que uno. arxiv.org.
- Chernozhukov, V., Chetverikov, D., Demirer, M., Duflo, E., Hansen, C., Newey, W. y Robins, J. Double/Debiased Machine Learning for Treatment and Structural Parameters. The Econometrics Journal, volumen 21, número 1, 2018. Fuente del diagnóstico de que el sesgo de regularización y el sobreajuste en la estimación de los parámetros auxiliares causan un sesgo pesado en los estimadores del parámetro de interés obtenidos por sustitución ingenua de las estimaciones de aprendizaje automático en las ecuaciones de estimación, haciendo que el estimador ingenuo deje de ser consistente a la tasa de raíz de N; y de la corrección en dos ingredientes, puntajes ortogonales de Neyman con sensibilidad reducida a los parámetros auxiliares y ajuste cruzado como forma eficiente de división de los datos, con aplicación explícita al efecto medio de tratamiento bajo no confusión. arxiv.org.
- Lin, W. Agnostic Notes on the Regression Adjustment to Experimental Data: Reexamining Freedman’s Critique. Annals of Applied Statistics, volumen 7, número 1, 2013, páginas 295 a 318. Usado aquí para el caso aleatorizado, en que la propensión se conoce por diseño: fuente de la demostración de que el ajuste por mínimos cuadrados con el conjunto completo de interacciones entre tratamiento y covariables no puede empeorar la precisión asintótica, y de que el error estándar sándwich es consistente o asintóticamente conservador. arxiv.org.
Lea también: Puntaje de propensión · Ajuste por regresión · Confusor no medido · Serie temporal interrumpida · Calculadora de significancia · Leia em português
Preguntas frecuentes
- ¿Qué es un estimador doblemente robusto?
- Es un estimador que combina dos modelos, uno de la probabilidad de recibir el tratamiento y otro del resultado, y produce una estimación consistente del efecto si AL MENOS UNO de los dos está correctamente especificado. Kang y Schafer lo describen exactamente así: los procedimientos doblemente robustos aplican los dos tipos de modelo al mismo tiempo y producen una estimación consistente del parámetro si cualquiera de los dos ha sido especificado correctamente.
- ¿Cuándo necesita esto un test A/B?
- Cuando el sorteo no existió o no se puede confiar en él: adopción espontánea de una función, liberación por región, migración que el usuario eligió aceptar. En un experimento aleatorizado de verdad la probabilidad de tratamiento se conoce por diseño, normalmente 0,5, así que nunca está equivocada y la doble robustez se vuelve automática: el estimador aumentado devuelve la respuesta correcta incluso con el modelo de resultado totalmente equivocado.
- Si los dos modelos están equivocados, ¿el estimador salva la situación?
- No, y ese es el límite más importante. En el ejemplo de esta guía, con los dos modelos equivocados el estimador doblemente robusto devuelve los mismos 5,9091 puntos porcentuales sesgados que devuelven los dos métodos simples, contra el valor verdadero de 3,0000 puntos. Kang y Schafer resumen la conclusión de su estudio en una frase: en al menos algunos escenarios, dos modelos equivocados no son mejores que uno.
- ¿Por qué la ponderación por el inverso de la propensión se vuelve inestable?
- Porque el peso de cada tratado es el inverso de su propensión estimada, así que una propensión pequeña se convierte en un peso enorme. En el ejemplo con un estrato raro de propensión 0,02, cada tratado carga peso 50 y apenas 40 personas representan 2.000. Si el modelo estima 0,01 en vez de 0,02, esas mismas 40 personas pasan a representar 4.000, más gente de la que contiene el estrato entero, y la estimación se mueve de 3,2353 a 3,4120 puntos.
- ¿Cuál es la diferencia entre esto y el puntaje de propensión solo?
- El puntaje de propensión solo depende por completo de que el modelo de quién fue tratado sea correcto. Si está equivocado, no hay red de protección. El estimador doblemente robusto agrega un modelo de resultado como segunda cuerda: en el escenario en que la propensión está equivocada y el resultado está correcto, el método por ponderación devuelve 5,9091 puntos y el doblemente robusto devuelve 3,0000, el valor verdadero.
- ¿Necesito aprendizaje automático para esto?
- No hace falta, pero es donde encaja bien. Chernozhukov y coautores muestran que meter estimaciones de aprendizado automático directamente en las ecuaciones de estimación genera un sesgo pesado, porque el sesgo de regularización y el sobreajuste contaminan el parámetro de interés. Su corrección tiene dos ingredientes: puntajes ortogonales de Neyman, menos sensibles a los modelos auxiliares, y ajuste cruzado, una forma eficiente de división de los datos.