Estadística

Confundidor No Medido: qué tan fuerte tendría que ser

Toda lectura observacional depende de lo que no mediste. El análisis de sensibilidad responde qué tan fuerte tendría que ser un confundidor no medido.

Ilustración plana de dos círculos oscuros unidos por una barra horizontal con una pequeña balanza en el medio, y encima de ellos un círculo punteado translúcido unido a los dos por líneas finas

Toda lectura observacional termina en la misma duda sin forma: “¿y si existe algo que no medí?”. El análisis de sensibilidad transforma esa duda sobre el confundidor no medido en un número. En la simulación de esta guía, un efecto observacional con razón de riesgo de 1,2412 e intervalo del 95 por ciento entre 1,0757 y 1,4321 tiene valor E de 1,79 en el punto y 1,36 en el límite inferior: un factor no medido que duplicara tanto la probabilidad de adoptar como la de convertir derribaría el resultado entero hasta 0,93, es decir, lo invertiría. Esta guía muestra cómo calcular ese número, cómo interpretarlo sin exagerar y cómo usarlo para decidir cuándo la lectura observacional basta y cuándo solo sirve para justificar el experimento. Forma parte de nuestra guía completa de test A/B y cierra el arco de puntaje de propensión y serie temporal interrumpida.

El problema: la premisa que ningún dato pone a prueba

Todo método cuasiexperimental depende de una premisa que los datos no pueden confirmar. Tiene nombres distintos en cada tradición, y el contenido es el mismo:

En los cuatro casos, la premisa es sobre lo que no observaste, y por eso ninguna prueba estadística la verifica. El sorteo de un test A/B resuelve todo eso de una vez, porque equilibra en promedio incluso lo que nadie midió.

La respuesta mala a este impasse es el silencio: publicar la estimación y mencionar “limitaciones del diseño” en una nota al pie. La respuesta buena es una pregunta cuantificable: ¿qué tan fuerte tendría que ser un confundidor no medido para explicar todo esto?

El punto de partida: una estimación observacional y lo que vale

Retomamos el ejemplo de la guía de puntaje de propensión. Después de emparejar adoptantes y no adoptantes de una funcionalidad mediante un modelo de propensión rico, quedó esto:

grupo usuarios conversiones tasa
no adoptantes emparejados 4.200 311 7,405%
adoptantes 4.200 386 9,190%

Pégalo en la calculadora de abajo: devuelve más 24,12 por ciento en términos relativos y valor p de 0,0030, sobre una diferencia bruta de 1,786 punto porcentual entre las dos tasas.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

En la escala de razón de riesgo, que es la escala en la que trabaja el análisis de sensibilidad, eso es 9,190 dividido por 7,405, es decir, razón de riesgo de 1,2412, con intervalo de confianza del 95 por ciento entre 1,0757 y 1,4321.

El intervalo no incluye 1. Por la lectura convencional, el resultado es positivo y significativo. Y aun así no responde la pregunta que importa, porque el intervalo mide ruido muestral, no sesgo. Si existe un motivo no medido que empuja a las mismas personas a adoptar y a convertir, la estimación entera está desplazada, y una muestra mayor solo estrecha el intervalo alrededor del lugar equivocado.

El límite que vale sin premisa alguna

Ding y VanderWeele demostraron en 2016 un límite que resuelve esto de forma sorprendentemente escueta. Llama RR observado a la razón que mediste, ajustada por lo que fue medido. Llama RR entre exposición y confundidor a la mayor razón de riesgo que relaciona el tratamiento con el factor no medido, y RR entre confundidor y desenlace a la mayor razón que relaciona ese factor con el desenlace. Su resultado dice que la razón de riesgo verdadera es al menos:

RR observado dividido por el factor de limitación, donde el factor de limitación es el producto de las dos asociaciones del confundidor dividido por la suma de ellas menos uno.

La parte notable es lo que la demostración no exige: nada sobre la distribución del confundidor, ni que sea binario, ni que los efectos sean homogéneos, ni que no haya interacción. Es un límite universal.

El triángulo de la confusión y las dos asociaciones que importanDiagrama con tres nodos. El tratamiento a la izquierda apunta al desenlace a la derecha. Encima de ellos, un nodo punteado que representa el confundidor no medido apunta a los dos, con las dos flechas rotuladas como las asociaciones que entran en el factor de limitación.confundidorno medidotratamiento(adopción)desenlace(conversión)lo que quieres medirrazón observada 1,2412asociación conel tratamientoasociación conel desenlaceEl confundidor solo estorba cuando existen las DOS flechas rojas. Una sola no genera sesgo.
Un factor no medido que solo se asocia al tratamiento, o solo al desenlace, no es confundidor. Es la combinación de las dos asociaciones lo que desplaza la estimación.

Ese detalle del diagrama resuelve la mitad de las discusiones de reunión. “¿Y el país del usuario?” solo es problema si el país predice tanto la adopción como la conversión. Si predice solo una de las dos, no desplaza nada.

Del límite al valor E: un número en vez de dos incógnitas

El límite de arriba tiene dos incógnitas, y nadie sabe estimar las dos para un factor que, por definición, no fue medido. VanderWeele y Ding resolvieron esto en 2017 con una elección simple: iguala las dos asociaciones y pregunta qué valor común sería necesario para que el efecto desapareciera por completo. Ese valor es el valor E.

La cuenta sale directo del límite. Si las dos asociaciones valen el mismo número, y exiges que el efecto corregido llegue exactamente a 1 (ningún efecto), la ecuación tiene una solución cerrada:

valor E = razón de riesgo + raíz cuadrada de (razón de riesgo por (razón de riesgo menos 1))

Para nuestra estimación de 1,2412: 1,2412 más la raíz de 1,2412 por 0,2412, que es 1,2412 más 0,5450, es decir, 1,79.

La lectura es literal: un confundidor no medido tendría que estar asociado tanto a la adopción como a la conversión por razones de riesgo de al menos 1,79 cada una, además de todo lo que ya fue ajustado, para explicar completamente el efecto del 24 por ciento que medimos. Si ambas asociaciones fueran menores que 1,79, quedaría efecto.

Aplicándolo al límite inferior del intervalo, 1,0757, el valor E es 1,36. Ese es, en la práctica, el número más útil de los dos: dice lo que basta para empujar el intervalo hasta el nulo, no lo que basta para anular el punto.

razón de riesgo observada valor E del punto
1,05 1,28
1,10 1,43
1,20 1,69
1,24 1,79
1,30 1,92
1,50 2,37
2,00 3,41
3,00 5,45
4,00 7,46

La tabla deja visible la asimetría que suele sorprender: los efectos pequeños tienen valores E bajos, y los efectos pequeños son exactamente lo que produce la mayor parte de las optimizaciones de producto. Un resultado observacional de más 10 por ciento cae con un confundidor de 1,43, que es una asociación corriente en cualquier base de usuarios.

La prueba de realidad: ¿existe el confundidor de 1,79?

El valor E por sí solo no decide nada. Se vuelve decisión cuando se compara con asociaciones que conoces.

En nuestra base ficticia, tres candidatos obvios a confundidor no medido:

candidato asociación plausible con la adopción asociación plausible con la conversión ¿supera 1,79 en las dos?
engagement previo (sesiones en los 30 días anteriores) alta, algo como 2,5 alta, algo como 2,0 sí, holgadamente
intención declarada en el onboarding moderada, algo como 1,6 moderada, algo como 1,5 no
huso horario baja baja no

Basta el primero. Un usuario más comprometido explora más el producto (por lo tanto adopta más) y está más cerca de comprar (por lo tanto convierte más), y ninguna de esas dos cosas fue medida si la base solo tiene plan, antigüedad y tamaño de empresa. Con las dos asociaciones en 2,0, el factor de limitación vale 1,333, y la razón observada de 1,2412 dividida por él da 0,931: el efecto no solo desaparece sino que cambia de signo.

Compara con el escenario opuesto, que da la intuición de cuándo el valor E protege de verdad. Ding y VanderWeele aplicaron el límite al estudio clásico de Hammond y Horn sobre cigarrillo y cáncer de pulmón, cuya razón de riesgo observada era cerca de 10,73, con intervalo del 95 por ciento entre 8,02 y 14,36. Con las dos asociaciones del confundidor en 10,73, el factor de limitación vale 5,63, y la estimación corregida cae a cerca de 1,91, con intervalo entre 1,42 y 2,55. Es decir: incluso un confundidor tan fuerte como la propia asociación medida no derribaría el límite inferior. Traducido a valor E: 20,95 en el punto y 15,52 en el límite inferior. Ningún factor conocido se acerca.

La diferencia entre los dos casos es el tamaño del efecto. Una asociación enorme es robusta a la confusión; una asociación modesta no lo es. Y casi todo lo que se mide en producto es modesto.

Valor E en función de la razón de riesgo observadaCurva creciente que muestra el valor E necesario a medida que aumenta la razón de riesgo observada, con una franja sombreada que marca la región de efectos típicos de producto, donde el valor E queda por debajo de dos.valor E86421nuestro caso: 1,24 devuelve 1,791,01,52,03,04,0razón de riesgo observadafranja típica deefecto en producto
La curva sube despacio cerca de 1. Por eso casi todo resultado observacional de producto exige un confundidor pequeño para caer, y los confundidores pequeños son abundantes.

La escalera de la guía anterior, ahora con valor E en cada escalón

Una forma útil de sentir la medida es aplicarla a las tres lecturas observacionales de la guía de puntaje de propensión, del bruto al emparejado, sabiendo que el experimento sorteado devolvió razón de riesgo de cerca de 1,05 sin significancia:

lectura razón de riesgo valor E del punto valor E del límite inferior ¿existe el confundidor necesario?
cruda, todos los no adoptantes 3,1667 5,79 5,08 improbable en esa magnitud
emparejada por plan y antigüedad 1,5833 2,54 2,09 plausible
emparejada por propensión rica 1,2412 1,79 1,36 plausible y probable

Fíjate en la paradoja práctica: cuanto más arreglas la estimación, más frágil queda ante la sensibilidad. La lectura cruda tiene valor E de 5,79, lo que suena robusto, y aun así es la lectura más equivocada de las tres. El valor E no mide la calidad del diseño; mide el tamaño del efecto restante. Una estimación grande y sesgada tiene valor E alto, y eso no es ninguna defensa.

Por eso importa el orden: primero el diseño (superposición, balanceo, placebo), después la sensibilidad. Calcular valor E sobre una comparación cruda es darle apariencia de rigor a una cuenta que ya estaba perdida.

Cuando el sesgo tira hacia el lado equivocado

Existe un caso simétrico que suele quedar fuera de la conversación: el confundidor puede estar escondiendo un efecto, no creándolo. Si la funcionalidad se liberó primero para las cuentas con peor conversión, con la esperanza de ayudarlas, la selección empuja la estimación hacia abajo. Un resultado observacional nulo, en ese caso, es compatible con un efecto positivo real.

La cuenta es la misma, aplicada al inverso. Para una razón observada por debajo de 1, calcula el valor E sobre su inverso: una razón de 0,80 se convierte en 1,25, cuyo valor E es 1,81. Y para un resultado nulo, con intervalo cruzando 1, el valor E del punto es 1 por definición, lo que significa apenas “cualquier confundidor mínimo bastaría para mover esto”. Es decir: una lectura observacional nula es todavía menos informativa que una lectura observacional positiva, y nunca debe publicarse como evidencia de que algo no funciona.

En la práctica del día a día, esa es la asimetría que más dinero cuesta. Los equipos aceptan un resultado observacional negativo como motivo para archivar una funcionalidad, cuando la lectura ni siquiera tiene fuerza para eso. El camino correcto es el mismo que en los casos positivos: tratarlo como hipótesis y, si la decisión es cara, poner a prueba.

Lo que el valor E no hace

Vale ser explícito, porque la medida es fácil de usar mal:

Cuánta confusión no medida sobra después de todo el ajuste

Una pregunta natural es si, con suficientes covariables, la confusión restante queda lo bastante pequeña. El mejor dato público sobre esto viene del trabajo de Gordon, Zettelmeyer, Bhargava y Chapsky, que compararon métodos observacionales con experimentos sorteados en 12 estudios de medición de anuncios de Facebook, con 435 millones de observaciones de usuario por estudio.

El resultado desarma la esperanza. Incluso la especificación que usaba una métrica compuesta que resumía miles de variables de comportamiento, la más rica del estudio, todavía produjo una estimación estadísticamente distinta de la experimental en 5 de los 10 estudios de checkout evaluados, con desviación absoluta media de 184 puntos porcentuales contra un efecto experimental medio del 57 por ciento. El mejor método del artículo, regresión ajustada con ponderación por el inverso de la propensión y el conjunto más detallado de variables, divergió en 3 de 10, con desviación de 173 puntos.

Es decir: en una de las bases más ricas en covariables que existen en el mundo, con miles de señales de comportamiento por persona, la confusión residual siguió siendo lo bastante grande para invertir decisiones. La cantidad de covariables no es el cuello de botella. El cuello de botella es que el motivo por el cual la persona fue expuesta rara vez está en la base de quien analiza.

Cómo escribir esto en un informe

El bloque de tres frases que cierra una lectura observacional:

  1. La estimación y la escala. “El efecto estimado es una razón de riesgo de 1,24, con intervalo del 95 por ciento entre 1,08 y 1,43.”
  2. El valor E en el punto y en el límite. “Un confundidor no medido necesitaría asociaciones de al menos 1,79 con la adopción y con la conversión para explicar todo el efecto, y de 1,36 para llevar el intervalo hasta el nulo.”
  3. El juicio explícito. “El engagement previo, que no tenemos medido, plausiblemente supera 1,79 en las dos puntas. Por lo tanto tratamos este resultado como hipótesis a poner a prueba, no como efecto medido.”

La tercera frase es la que cambia la decisión. Transforma “creemos que funciona” en “vale gastar 76 días de tráfico para averiguarlo”, que es una frase accionable.

Guion de confundidor no medido en siete pasos

  1. Haz bien el diseño cuasiexperimental primero. La sensibilidad no arregla una superposición mala ni un placebo reprobado.
  2. Convierte la estimación a razón de riesgo. Es la escala en la que funciona el límite.
  3. Calcula el valor E del punto. Razón más la raíz de la razón por la razón menos uno.
  4. Calcula el valor E del límite del intervalo más cercano al nulo. Es el número que decide.
  5. Lista candidatos concretos a confundidor no medido, con las dos asociaciones plausibles de cada uno.
  6. Compara, y di en voz alta si algún candidato pasa. Si pasa, la lectura es hipótesis, no conclusión.
  7. Si la decisión es cara, corre el experimento. La calculadora de tamaño de muestra dice en segundos cuánto cuesta la certeza.

Errores comunes

Hazlo automático en Donnu

El análisis de sensibilidad es el paso que cierra una lectura observacional, y existe justamente porque la lectura observacional es la segunda mejor opción. La manera de no necesitarlo nunca es la misma desde el comienzo: cuando la exposición quepa en un sorteo, sortea, porque el sorteo equilibra en promedio incluso lo que nadie midió, y es lo único de esta lista que hace eso.

Donnu existe para ese caso. Sortea, sella la asignación, guarda el resultado con la definición de métrica congelada y devuelve la lectura sin la premisa de ausencia de confusión en el medio. Cuando el sorteo no esté disponible, usa los diseños de este arco y cierra siempre con el valor E declarado en el informe. Para saber si tu tráfico soporta el test sorteado, la calculadora de tamaño de muestra responde en segundos, y la calculadora de significancia cierra la lectura al final.

Referencias

Lee también: Puntaje de propensión · Serie temporal interrumpida · Diferencias en diferencias · Control sintético · Atrición diferencial · Calculadora de significancia · Leer en portugués

Preguntas frecuentes

¿Qué es el análisis de sensibilidad a confundidor no medido?
Es la cuenta que responde "qué tan fuerte tendría que ser un factor que no medí para derribar este resultado". No descubre el confundidor ni prueba que no existe. Transforma una duda sin forma en una magnitud comparable con lo que conoces de tu negocio, y por eso es la única manera honesta de cerrar una lectura observacional.
¿Qué es el valor E?
Es el menor grado de asociación, en la escala de razón de riesgo, que un confundidor no medido necesitaría tener al mismo tiempo con el tratamiento y con el desenlace para explicar todo el efecto observado. Se calcula directo de la estimación: el valor E es la razón de riesgo sumada a la raíz cuadrada de la razón por ella menos uno. Para una razón de 1,24, el valor E es 1,79.
¿Un valor E alto prueba que no hay confusión?
No. Dice que un confundidor pequeño no basta. Si el valor E es 1,79 y sabes que el engagement previo duplica tanto la probabilidad de adopción como la de conversión, entonces el confundidor necesario existe y cabe holgado. El número solo cobra sentido comparado con asociaciones reales de tu dominio.
¿Cómo aplicar esto al límite del intervalo de confianza?
Calcula el valor E también en el límite del intervalo más cercano al nulo. En la simulación de esta guía, la razón observada era 1,2412 con intervalo del 95 por ciento entre 1,0757 y 1,4321. El valor E del punto es 1,79 y el del límite inferior es 1,36. El segundo número es el que importa: un confundidor con asociaciones de 1,4 ya empuja el intervalo hasta el nulo.
¿De dónde viene la fórmula del valor E?
Del límite de sesgo demostrado por Ding y VanderWeele en 2016, que vale sin premisa alguna sobre la distribución del confundidor. El límite dice que el efecto verdadero es al menos el observado dividido por un factor que depende de las dos asociaciones del confundidor. Igualar las dos asociaciones y exigir que el límite llegue a uno devuelve exactamente la fórmula del valor E.
¿Cuándo el valor E deja de ayudar?
Cuando el problema no es confusión, sino selección, atrición o error de medición. El valor E responde solo a la pregunta del confundidor común. Pérdida diferencial de datos entre los grupos, evento de conversión medido de formas distintas o población de análisis elegida después del tratamiento exigen otras cuentas.