Estadística

Estimador Doblemente Robusto: dos chances de acertar

El estimador doblemente robusto acierta si el modelo de propensión O el de resultado es correcto. La cuenta, el ejemplo en cuatro escenarios y el límite.

Ilustración plana de una plataforma nivelada sostenida por dos cuerdas, la de la izquierda rota y suelta y la de la derecha tensa

Cuando el tratamiento no fue sorteado, existen dos caminos para estimar el efecto: modelar quién recibió el tratamiento, o modelar el resultado. Cada uno funciona si su modelo es correcto, y cada uno se equivoca solo si está equivocado. El estimador doblemente robusto usa los dos y acierta si AL MENOS UNO de ellos es correcto. En el ejemplo de esta guía, el efecto verdadero es más 3,0000 puntos porcentuales y la diferencia bruta entre tratados y no tratados devuelve más 5,9091 puntos. Con la propensión correcta y el resultado equivocado, la ponderación acierta y la regresión se equivoca; con la propensión equivocada y el resultado correcto, ocurre lo inverso; el doblemente robusto devuelve 3,0000 en los dos casos. Esta guía muestra la cuenta en cuatro escenarios, el caso en que también falla, y por qué en un experimento aleatorizado de verdad esa robustez viene gratis. Forma parte de nuestra guía completa de test A/B y es la red de protección del puntaje de propensión.

Dos formas de corregir la misma distorsión

Un producto libera una función nueva por adhesión espontánea. Quien quiso, la activó. Meses después llega la pregunta: ¿la función aumentó la conversión?

La comparación directa entre quien la activó y quien no la activó no responde eso, porque quien la activó ya era diferente antes de activarla. Existen dos familias de corrección, y atacan el problema por lados opuestos:

familia qué modela cómo corrige falla cuando
ponderación por el inverso de la propensión la probabilidad de cada persona de recibir el tratamiento, dadas sus características reponderar a los observados para reconstruir la población entera el modelo de quién fue tratado está equivocado, o devuelve propensiones muy pequeñas
regresión del resultado el resultado esperado con y sin tratamiento, dadas las características predecir los dos resultados para todos y sacar la diferencia media el modelo del resultado está equivocado
doblemente robusto los dos al mismo tiempo usa la regresión como base y corrige su residuo con pesos de propensión los DOS están equivocados

La tercera fila es la promesa, y Kang y Schafer la formulan con precisión: los procedimientos doblemente robustos aplican los dos tipos de modelo simultáneamente y producen una estimación consistente del parámetro si cualquiera de los dos ha sido especificado correctamente.

Las dos cuerdas que sostienen la estimación doblemente robustaUna plataforma que representa la estimación del efecto está sostenida por dos cuerdas. La de la izquierda es el modelo de propensión y la de la derecha es el modelo de resultado. Cuando cualquiera de las dos está intacta la plataforma sigue nivelada. Cuando las dos se rompen al mismo tiempo la plataforma cae, y la estimación queda sesgada.el efecto causal verdaderomodelo de propensiónrotomodelo de resultadointactoestimación doblemente robusta: más 3,0000 puntosbasta una de las dos cuerdas para que la estimación siga nivelada en el valor verdadero.si las dos se rompen, cae igual que cualquier otro método, y ninguna matemática avisa que eso ocurrió.
Robustez doble es redundancia, no magia. Compra una segunda chance, y es exactamente eso lo que compra.

El ejemplo trabajado: cuatro escenarios, una tabla

Una base de 100.000 usuarios, dos tipos de dispositivo, adhesión espontánea a una función nueva. Los números verdaderos, que en la vida real nadie observa:

estrato personas adhesión real conversión sin la función conversión con la función efecto
escritorio 60.000 75% 10,0% 13,0% más 3,0 puntos
móvil 40.000 25% 4,0% 7,0% más 3,0 puntos
total 100.000 55% más 3,0000 puntos

Nótese que el efecto es el mismo en los dos estratos. Aquí no hay heterogeneidad ninguna. El problema es enteramente de composición: escritorio adhiere mucho más y convierte mucho más, así que el grupo de los adherentes está dominado por escritorio y el grupo de los no adherentes está dominado por móvil.

Lo que se observa en la tabla de la base de datos:

grupo personas conversiones tasa
adhirieron 55.000 6.550 11,9091%
no adhirieron 45.000 2.700 6,0000%
Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Pegue esas dos filas en la calculadora de arriba: más 5,9091 puntos porcentuales, más 98,48 por ciento relativo, valor p por debajo de lo que se puede mostrar. Un resultado espectacular, altamente significativo, y casi el doble del efecto verdadero. La significancia no protege contra el sesgo de composición; solo dice que la diferencia observada no es azar, y en efecto no lo es. Es confusión.

Ahora, los cuatro escenarios. En cada uno, “correcto” significa que el modelo reproduce la realidad de los estratos y “equivocado” significa que ignora el dispositivo y usa un número único para toda la base.

escenario ponderación por propensión regresión del resultado doblemente robusto
propensión CORRECTA, resultado EQUIVOCADO 3,0000 puntos 5,9091 puntos 3,0000 puntos
propensión EQUIVOCADA, resultado CORRECTO 5,9091 puntos 3,0000 puntos 3,0000 puntos
los dos correctos 3,0000 puntos 3,0000 puntos 3,0000 puntos
los dos equivocados 5,9091 puntos 5,9091 puntos 5,9091 puntos

Las dos primeras filas son la doble robustez entera, en números. En ellas, uno de los dos métodos simples entrega el valor verdadero y el otro entrega el sesgo completo, y quien lee el informe no tiene forma de saber cuál es cuál, porque ambos modelos son plausibles y ninguna prueba distingue “mi modelo de propensión es correcto” de “mi modelo de resultado es correcto”. El estimador doblemente robusto evita esa elección: entrega 3,0000 puntos en las dos.

Estimación de cada método en los cuatro escenarios de especificaciónCuatro bloques comparan la estimación por ponderación, por regresión y doblemente robusta contra el valor verdadero de 3 puntos porcentuales. En los dos primeros escenarios un método simple acierta y el otro se equivoca, y el doblemente robusto acierta en los dos. En el tercero, con los dos modelos correctos, todos aciertan. En el cuarto, con los dos equivocados, todos devuelven 5,9091 puntos.verdadero: 3,0000propensión correctaresultado equivocadoponderaciónregresión: 5,9091doblemente robustopropensión equivocadaresultado correctoponderación: 5,9091regresióndoblemente robustolos dos correctoslos tres coinciden en 3,0000los dos equivocadoslos tres en 5,9091la línea verde es el objetivo. Cuanto más a la derecha, más sesgado. La cuarta franja es el límite honesto del método.
En las dos primeras franjas, el punto negro está sobre la línea verde en los dos casos, y eso es lo que entrega la doble robustez. En la cuarta franja no existe punto negro sobre la línea.

Cómo funciona por dentro el estimador doblemente robusto

La mecánica es más simple de lo que sugiere el nombre. El estimador doblemente robusto parte de la predicción del modelo de resultado para todo el mundo y después suma una corrección construida a partir del error que ese modelo cometió donde puede ser verificado, es decir, en los individuos cuyo resultado sí fue observado, con cada error reponderado por el inverso de la propensión.

Las dos propiedades salen de ahí:

En un experimento aleatorizado, la segunda propiedad es gratuita: la propensión se conoce por diseño, normalmente 0,5, y por definición no puede estar equivocada. Corriendo el mismo ejemplo con sorteo mitad y mitad en vez de adhesión espontánea, la diferencia simple de medias devuelve exactamente 3,0000 puntos y el estimador doblemente robusto con un modelo de resultado totalmente equivocado devuelve esos mismos 3,0000 puntos.

Ese es el puente entre este tema y el test A/B del día a día. En un experimento, el término de corrección no arregla sesgo, porque no hay sesgo: reduce varianza, y lo que queda es exactamente el ajuste por regresión. Un método, dos lecturas según exista o no el sorteo.

El límite: dos modelos equivocados no son mejores que uno

Kang y Schafer construyeron un estudio de simulación en el que los dos modelos están equivocados, pero ninguno de ellos groseramente mal especificado, que es la situación realista de cualquier análisis observacional. Sus conclusiones son incómodas y hay que decirlas por entero:

La cuarta fila de la tabla de escenarios es la versión aritmética de eso. Con los dos modelos equivocados, el doblemente robusto devuelve los mismos 5,9091 puntos sesgados, sin ninguna señal de alarma.

Cómo una propensión pequeña estimada mal desestabiliza la ponderaciónEn un estrato raro de 2.000 personas con propensión verdadera de 0,02, apenas 40 fueron tratadas y cada una carga peso 50, representando exactamente las 2.000 personas del estrato. Si el modelo estima la propensión en 0,01, el peso pasa a 100 y esas mismas 40 personas pasan a representar 4.000, el doble de lo que contiene el estrato. La estimación por ponderación pasa de 3,2353 a 3,4120 puntos, mientras que la doblemente robusta con modelo de resultado correcto permanece en 3,2353.estrato raro: 2.000 personas, 40 tratadaspropensión estimada 0,02peso 50, representa 2.000estimación 3,2353propensión estimada 0,01peso 100, representa 4.000, más gente de la que tiene el estratoestimación por ponderación: 3,4120doblemente robusto, con modelo de resultado correctovuelve a 3,2353un error de estimación en 40 personas movió la lectura de toda la base en 0,18 punto porcentual.la segunda cuerda existe exactamente para ese tipo de accidente.
El estrato raro cuesta 2 por ciento de la base y domina el error. Es el mecanismo que Kang y Schafer identifican como la fragilidad central de la ponderación.

Qué hacer con el estimador doblemente robusto en la práctica

La lectura combinada de todo lo anterior lleva a un protocolo, no a una receta de estimador único:

  1. Corra los tres estimadores y publique los tres. Ponderación, regresión y doblemente robusto. La divergencia entre ellos es la información más útil del informe.
  2. Si los tres coinciden, usted está en la tercera fila de la tabla de escenarios, y la estimación está bien sostenida.
  3. Si dos divergen y el doblemente robusto acompaña a uno de ellos, usted está en una de las dos primeras filas, y el doblemente robusto es la lectura a reportar.
  4. Si el doblemente robusto no acompaña a ninguno de los dos de forma estable, desconfíe de propensiones extremas antes que de cualquier otra cosa.
  5. Mire siempre la distribución de las propensiones estimadas. El corte o recorte de valores extremos es una decisión a tomar antes de ver el resultado, y el rango cortado tiene que constar en el informe.
  6. Si usa aprendizaje automático en los modelos auxiliares, use ajuste cruzado. Chernozhukov y coautores muestran que meter estimaciones de aprendizaje automático directamente en las ecuaciones de estimación genera un sesgo pesado en el parámetro de interés, y que la corrección necesita dos ingredientes: puntajes ortogonales de Neyman, con sensibilidad reducida a los parámetros auxiliares, y ajuste cruzado.
  7. Nunca olvide a qué pregunta responde esto. Es la segunda mejor respuesta. La primera es sortear, y cuando el tratamiento no puede sortearse directamente, el diseño de estímulo suele ser más barato de lo que parece.

Errores comunes

Hágalo automático con Donnu

El estimador doblemente robusto vive o muere por la calidad de las características usadas en los dos modelos, y esas características tienen que existir en el estado en que estaban antes de que ocurriera el tratamiento. En una liberación por adhesión, eso significa guardar el perfil del usuario en el momento en que activó la función, y no en el momento en que se genera el informe.

Reconstruirlo después es el error que más se comete: el perfil actual de quien adoptó ya fue cambiado por la adopción, y un modelo de propensión entrenado sobre él aprende consecuencia, no causa. Donnu sella el estado del usuario en el instante de la asignación y mantiene el historial de exposición por usuario, lo que deja a los dos modelos con el insumo correcto sin reconstrucción manual.

Y vale la recomendación de alcance, que es la más importante de este artículo: cuando existe cualquier forma de sortear, sortee. La doble robustez es una buena segunda opción, y sigue siendo una segunda opción. La calculadora de significancia cierra la lectura bruta del ejemplo y sirve como demostración de por qué el valor p solo no distingue efecto de composición.

Referencias

Lea también: Puntaje de propensión · Ajuste por regresión · Confusor no medido · Serie temporal interrumpida · Calculadora de significancia · Leia em português

Preguntas frecuentes

¿Qué es un estimador doblemente robusto?
Es un estimador que combina dos modelos, uno de la probabilidad de recibir el tratamiento y otro del resultado, y produce una estimación consistente del efecto si AL MENOS UNO de los dos está correctamente especificado. Kang y Schafer lo describen exactamente así: los procedimientos doblemente robustos aplican los dos tipos de modelo al mismo tiempo y producen una estimación consistente del parámetro si cualquiera de los dos ha sido especificado correctamente.
¿Cuándo necesita esto un test A/B?
Cuando el sorteo no existió o no se puede confiar en él: adopción espontánea de una función, liberación por región, migración que el usuario eligió aceptar. En un experimento aleatorizado de verdad la probabilidad de tratamiento se conoce por diseño, normalmente 0,5, así que nunca está equivocada y la doble robustez se vuelve automática: el estimador aumentado devuelve la respuesta correcta incluso con el modelo de resultado totalmente equivocado.
Si los dos modelos están equivocados, ¿el estimador salva la situación?
No, y ese es el límite más importante. En el ejemplo de esta guía, con los dos modelos equivocados el estimador doblemente robusto devuelve los mismos 5,9091 puntos porcentuales sesgados que devuelven los dos métodos simples, contra el valor verdadero de 3,0000 puntos. Kang y Schafer resumen la conclusión de su estudio en una frase: en al menos algunos escenarios, dos modelos equivocados no son mejores que uno.
¿Por qué la ponderación por el inverso de la propensión se vuelve inestable?
Porque el peso de cada tratado es el inverso de su propensión estimada, así que una propensión pequeña se convierte en un peso enorme. En el ejemplo con un estrato raro de propensión 0,02, cada tratado carga peso 50 y apenas 40 personas representan 2.000. Si el modelo estima 0,01 en vez de 0,02, esas mismas 40 personas pasan a representar 4.000, más gente de la que contiene el estrato entero, y la estimación se mueve de 3,2353 a 3,4120 puntos.
¿Cuál es la diferencia entre esto y el puntaje de propensión solo?
El puntaje de propensión solo depende por completo de que el modelo de quién fue tratado sea correcto. Si está equivocado, no hay red de protección. El estimador doblemente robusto agrega un modelo de resultado como segunda cuerda: en el escenario en que la propensión está equivocada y el resultado está correcto, el método por ponderación devuelve 5,9091 puntos y el doblemente robusto devuelve 3,0000, el valor verdadero.
¿Necesito aprendizaje automático para esto?
No hace falta, pero es donde encaja bien. Chernozhukov y coautores muestran que meter estimaciones de aprendizado automático directamente en las ecuaciones de estimación genera un sesgo pesado, porque el sesgo de regularización y el sobreajuste contaminan el parámetro de interés. Su corrección tiene dos ingredientes: puntajes ortogonales de Neyman, menos sensibles a los modelos auxiliares, y ajuste cruzado, una forma eficiente de división de los datos.