Confundidor No Medido: qué tan fuerte tendría que ser
Toda lectura observacional depende de lo que no mediste. El análisis de sensibilidad responde qué tan fuerte tendría que ser un confundidor no medido.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Toda lectura observacional termina en la misma duda sin forma: “¿y si existe algo que no medí?”. El análisis de sensibilidad transforma esa duda sobre el confundidor no medido en un número. En la simulación de esta guía, un efecto observacional con razón de riesgo de 1,2412 e intervalo del 95 por ciento entre 1,0757 y 1,4321 tiene valor E de 1,79 en el punto y 1,36 en el límite inferior: un factor no medido que duplicara tanto la probabilidad de adoptar como la de convertir derribaría el resultado entero hasta 0,93, es decir, lo invertiría. Esta guía muestra cómo calcular ese número, cómo interpretarlo sin exagerar y cómo usarlo para decidir cuándo la lectura observacional basta y cuándo solo sirve para justificar el experimento. Forma parte de nuestra guía completa de test A/B y cierra el arco de puntaje de propensión y serie temporal interrumpida.
El problema: la premisa que ningún dato pone a prueba
Todo método cuasiexperimental depende de una premisa que los datos no pueden confirmar. Tiene nombres distintos en cada tradición, y el contenido es el mismo:
- en emparejamiento por propensión, se llama ausencia de confusión: condicionado a lo que mediste, recibir el tratamiento es como si hubiera sido sorteado.
- en diferencias en diferencias, se llama tendencia común: sin el cambio, los dos grupos habrían variado igual.
- en serie temporal interrumpida, es la premisa de que nada más cambió en la misma fecha.
- en control sintético, es la premisa de que la combinación de donantes seguiría acompañando al tratado.
En los cuatro casos, la premisa es sobre lo que no observaste, y por eso ninguna prueba estadística la verifica. El sorteo de un test A/B resuelve todo eso de una vez, porque equilibra en promedio incluso lo que nadie midió.
La respuesta mala a este impasse es el silencio: publicar la estimación y mencionar “limitaciones del diseño” en una nota al pie. La respuesta buena es una pregunta cuantificable: ¿qué tan fuerte tendría que ser un confundidor no medido para explicar todo esto?
El punto de partida: una estimación observacional y lo que vale
Retomamos el ejemplo de la guía de puntaje de propensión. Después de emparejar adoptantes y no adoptantes de una funcionalidad mediante un modelo de propensión rico, quedó esto:
| grupo | usuarios | conversiones | tasa |
|---|---|---|---|
| no adoptantes emparejados | 4.200 | 311 | 7,405% |
| adoptantes | 4.200 | 386 | 9,190% |
Pégalo en la calculadora de abajo: devuelve más 24,12 por ciento en términos relativos y valor p de 0,0030, sobre una diferencia bruta de 1,786 punto porcentual entre las dos tasas.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
En la escala de razón de riesgo, que es la escala en la que trabaja el análisis de sensibilidad, eso es 9,190 dividido por 7,405, es decir, razón de riesgo de 1,2412, con intervalo de confianza del 95 por ciento entre 1,0757 y 1,4321.
El intervalo no incluye 1. Por la lectura convencional, el resultado es positivo y significativo. Y aun así no responde la pregunta que importa, porque el intervalo mide ruido muestral, no sesgo. Si existe un motivo no medido que empuja a las mismas personas a adoptar y a convertir, la estimación entera está desplazada, y una muestra mayor solo estrecha el intervalo alrededor del lugar equivocado.
El límite que vale sin premisa alguna
Ding y VanderWeele demostraron en 2016 un límite que resuelve esto de forma sorprendentemente escueta. Llama RR observado a la razón que mediste, ajustada por lo que fue medido. Llama RR entre exposición y confundidor a la mayor razón de riesgo que relaciona el tratamiento con el factor no medido, y RR entre confundidor y desenlace a la mayor razón que relaciona ese factor con el desenlace. Su resultado dice que la razón de riesgo verdadera es al menos:
RR observado dividido por el factor de limitación, donde el factor de limitación es el producto de las dos asociaciones del confundidor dividido por la suma de ellas menos uno.
La parte notable es lo que la demostración no exige: nada sobre la distribución del confundidor, ni que sea binario, ni que los efectos sean homogéneos, ni que no haya interacción. Es un límite universal.
Ese detalle del diagrama resuelve la mitad de las discusiones de reunión. “¿Y el país del usuario?” solo es problema si el país predice tanto la adopción como la conversión. Si predice solo una de las dos, no desplaza nada.
Del límite al valor E: un número en vez de dos incógnitas
El límite de arriba tiene dos incógnitas, y nadie sabe estimar las dos para un factor que, por definición, no fue medido. VanderWeele y Ding resolvieron esto en 2017 con una elección simple: iguala las dos asociaciones y pregunta qué valor común sería necesario para que el efecto desapareciera por completo. Ese valor es el valor E.
La cuenta sale directo del límite. Si las dos asociaciones valen el mismo número, y exiges que el efecto corregido llegue exactamente a 1 (ningún efecto), la ecuación tiene una solución cerrada:
valor E = razón de riesgo + raíz cuadrada de (razón de riesgo por (razón de riesgo menos 1))
Para nuestra estimación de 1,2412: 1,2412 más la raíz de 1,2412 por 0,2412, que es 1,2412 más 0,5450, es decir, 1,79.
La lectura es literal: un confundidor no medido tendría que estar asociado tanto a la adopción como a la conversión por razones de riesgo de al menos 1,79 cada una, además de todo lo que ya fue ajustado, para explicar completamente el efecto del 24 por ciento que medimos. Si ambas asociaciones fueran menores que 1,79, quedaría efecto.
Aplicándolo al límite inferior del intervalo, 1,0757, el valor E es 1,36. Ese es, en la práctica, el número más útil de los dos: dice lo que basta para empujar el intervalo hasta el nulo, no lo que basta para anular el punto.
| razón de riesgo observada | valor E del punto |
|---|---|
| 1,05 | 1,28 |
| 1,10 | 1,43 |
| 1,20 | 1,69 |
| 1,24 | 1,79 |
| 1,30 | 1,92 |
| 1,50 | 2,37 |
| 2,00 | 3,41 |
| 3,00 | 5,45 |
| 4,00 | 7,46 |
La tabla deja visible la asimetría que suele sorprender: los efectos pequeños tienen valores E bajos, y los efectos pequeños son exactamente lo que produce la mayor parte de las optimizaciones de producto. Un resultado observacional de más 10 por ciento cae con un confundidor de 1,43, que es una asociación corriente en cualquier base de usuarios.
La prueba de realidad: ¿existe el confundidor de 1,79?
El valor E por sí solo no decide nada. Se vuelve decisión cuando se compara con asociaciones que conoces.
En nuestra base ficticia, tres candidatos obvios a confundidor no medido:
| candidato | asociación plausible con la adopción | asociación plausible con la conversión | ¿supera 1,79 en las dos? |
|---|---|---|---|
| engagement previo (sesiones en los 30 días anteriores) | alta, algo como 2,5 | alta, algo como 2,0 | sí, holgadamente |
| intención declarada en el onboarding | moderada, algo como 1,6 | moderada, algo como 1,5 | no |
| huso horario | baja | baja | no |
Basta el primero. Un usuario más comprometido explora más el producto (por lo tanto adopta más) y está más cerca de comprar (por lo tanto convierte más), y ninguna de esas dos cosas fue medida si la base solo tiene plan, antigüedad y tamaño de empresa. Con las dos asociaciones en 2,0, el factor de limitación vale 1,333, y la razón observada de 1,2412 dividida por él da 0,931: el efecto no solo desaparece sino que cambia de signo.
Compara con el escenario opuesto, que da la intuición de cuándo el valor E protege de verdad. Ding y VanderWeele aplicaron el límite al estudio clásico de Hammond y Horn sobre cigarrillo y cáncer de pulmón, cuya razón de riesgo observada era cerca de 10,73, con intervalo del 95 por ciento entre 8,02 y 14,36. Con las dos asociaciones del confundidor en 10,73, el factor de limitación vale 5,63, y la estimación corregida cae a cerca de 1,91, con intervalo entre 1,42 y 2,55. Es decir: incluso un confundidor tan fuerte como la propia asociación medida no derribaría el límite inferior. Traducido a valor E: 20,95 en el punto y 15,52 en el límite inferior. Ningún factor conocido se acerca.
La diferencia entre los dos casos es el tamaño del efecto. Una asociación enorme es robusta a la confusión; una asociación modesta no lo es. Y casi todo lo que se mide en producto es modesto.
La escalera de la guía anterior, ahora con valor E en cada escalón
Una forma útil de sentir la medida es aplicarla a las tres lecturas observacionales de la guía de puntaje de propensión, del bruto al emparejado, sabiendo que el experimento sorteado devolvió razón de riesgo de cerca de 1,05 sin significancia:
| lectura | razón de riesgo | valor E del punto | valor E del límite inferior | ¿existe el confundidor necesario? |
|---|---|---|---|---|
| cruda, todos los no adoptantes | 3,1667 | 5,79 | 5,08 | improbable en esa magnitud |
| emparejada por plan y antigüedad | 1,5833 | 2,54 | 2,09 | plausible |
| emparejada por propensión rica | 1,2412 | 1,79 | 1,36 | plausible y probable |
Fíjate en la paradoja práctica: cuanto más arreglas la estimación, más frágil queda ante la sensibilidad. La lectura cruda tiene valor E de 5,79, lo que suena robusto, y aun así es la lectura más equivocada de las tres. El valor E no mide la calidad del diseño; mide el tamaño del efecto restante. Una estimación grande y sesgada tiene valor E alto, y eso no es ninguna defensa.
Por eso importa el orden: primero el diseño (superposición, balanceo, placebo), después la sensibilidad. Calcular valor E sobre una comparación cruda es darle apariencia de rigor a una cuenta que ya estaba perdida.
Cuando el sesgo tira hacia el lado equivocado
Existe un caso simétrico que suele quedar fuera de la conversación: el confundidor puede estar escondiendo un efecto, no creándolo. Si la funcionalidad se liberó primero para las cuentas con peor conversión, con la esperanza de ayudarlas, la selección empuja la estimación hacia abajo. Un resultado observacional nulo, en ese caso, es compatible con un efecto positivo real.
La cuenta es la misma, aplicada al inverso. Para una razón observada por debajo de 1, calcula el valor E sobre su inverso: una razón de 0,80 se convierte en 1,25, cuyo valor E es 1,81. Y para un resultado nulo, con intervalo cruzando 1, el valor E del punto es 1 por definición, lo que significa apenas “cualquier confundidor mínimo bastaría para mover esto”. Es decir: una lectura observacional nula es todavía menos informativa que una lectura observacional positiva, y nunca debe publicarse como evidencia de que algo no funciona.
En la práctica del día a día, esa es la asimetría que más dinero cuesta. Los equipos aceptan un resultado observacional negativo como motivo para archivar una funcionalidad, cuando la lectura ni siquiera tiene fuerza para eso. El camino correcto es el mismo que en los casos positivos: tratarlo como hipótesis y, si la decisión es cara, poner a prueba.
Lo que el valor E no hace
Vale ser explícito, porque la medida es fácil de usar mal:
- No descubre el confundidor. Devuelve el tamaño necesario, no el nombre.
- No prueba ausencia de sesgo. Un valor E alto significa “un confundidor pequeño no basta”, nunca “no hay confundidor”.
- No sustituye las verificaciones del diseño. Superposición, balanceo y prueba placebo siguen siendo obligatorios, y un placebo que falla derriba la lectura antes de cualquier análisis de sensibilidad.
- No cubre otros sesgos. Selección, atrición y error de medición necesitan cuentas propias, tratadas en atrición diferencial y sesgo de instrumentación.
- No se convierte en decisión por sí solo. Solo cobra sentido comparado con asociaciones reales del dominio, y esa comparación es juicio, no cálculo.
Cuánta confusión no medida sobra después de todo el ajuste
Una pregunta natural es si, con suficientes covariables, la confusión restante queda lo bastante pequeña. El mejor dato público sobre esto viene del trabajo de Gordon, Zettelmeyer, Bhargava y Chapsky, que compararon métodos observacionales con experimentos sorteados en 12 estudios de medición de anuncios de Facebook, con 435 millones de observaciones de usuario por estudio.
El resultado desarma la esperanza. Incluso la especificación que usaba una métrica compuesta que resumía miles de variables de comportamiento, la más rica del estudio, todavía produjo una estimación estadísticamente distinta de la experimental en 5 de los 10 estudios de checkout evaluados, con desviación absoluta media de 184 puntos porcentuales contra un efecto experimental medio del 57 por ciento. El mejor método del artículo, regresión ajustada con ponderación por el inverso de la propensión y el conjunto más detallado de variables, divergió en 3 de 10, con desviación de 173 puntos.
Es decir: en una de las bases más ricas en covariables que existen en el mundo, con miles de señales de comportamiento por persona, la confusión residual siguió siendo lo bastante grande para invertir decisiones. La cantidad de covariables no es el cuello de botella. El cuello de botella es que el motivo por el cual la persona fue expuesta rara vez está en la base de quien analiza.
Cómo escribir esto en un informe
El bloque de tres frases que cierra una lectura observacional:
- La estimación y la escala. “El efecto estimado es una razón de riesgo de 1,24, con intervalo del 95 por ciento entre 1,08 y 1,43.”
- El valor E en el punto y en el límite. “Un confundidor no medido necesitaría asociaciones de al menos 1,79 con la adopción y con la conversión para explicar todo el efecto, y de 1,36 para llevar el intervalo hasta el nulo.”
- El juicio explícito. “El engagement previo, que no tenemos medido, plausiblemente supera 1,79 en las dos puntas. Por lo tanto tratamos este resultado como hipótesis a poner a prueba, no como efecto medido.”
La tercera frase es la que cambia la decisión. Transforma “creemos que funciona” en “vale gastar 76 días de tráfico para averiguarlo”, que es una frase accionable.
Guion de confundidor no medido en siete pasos
- Haz bien el diseño cuasiexperimental primero. La sensibilidad no arregla una superposición mala ni un placebo reprobado.
- Convierte la estimación a razón de riesgo. Es la escala en la que funciona el límite.
- Calcula el valor E del punto. Razón más la raíz de la razón por la razón menos uno.
- Calcula el valor E del límite del intervalo más cercano al nulo. Es el número que decide.
- Lista candidatos concretos a confundidor no medido, con las dos asociaciones plausibles de cada uno.
- Compara, y di en voz alta si algún candidato pasa. Si pasa, la lectura es hipótesis, no conclusión.
- Si la decisión es cara, corre el experimento. La calculadora de tamaño de muestra dice en segundos cuánto cuesta la certeza.
Errores comunes
- Publicar la estimación con “limitaciones del diseño” en una nota al pie. Es lo mismo que no decir nada, y el lector va a usar el número igual.
- Calcular el valor E solo en el punto. El límite del intervalo es el que decide, porque es el que separa “efecto positivo” de “nada demostrado”.
- Tratar un valor E alto como prueba de ausencia de confusión. Mide el tamaño necesario, no la existencia.
- Comparar el valor E con nada. Sin candidatos concretos y asociaciones plausibles, el número es decoración.
- Olvidar que el ajuste ya hecho cuenta. Las asociaciones del valor E son condicionales a lo que ya fue medido, así que compara con lo que sobra, no con la asociación bruta.
- Aplicar a la confusión lo que es problema de otra naturaleza. La pérdida de datos entre grupos es atrición diferencial, no confusión.
- Usar el valor E para justificar una decisión que cabría en un test. Si se puede sortear, sortear es más barato que discutir sensibilidad.
- Ignorar que un efecto pequeño tiene valor E pequeño. Es la asimetría de la tabla, y alcanza a casi toda optimización de producto.
Hazlo automático en Donnu
El análisis de sensibilidad es el paso que cierra una lectura observacional, y existe justamente porque la lectura observacional es la segunda mejor opción. La manera de no necesitarlo nunca es la misma desde el comienzo: cuando la exposición quepa en un sorteo, sortea, porque el sorteo equilibra en promedio incluso lo que nadie midió, y es lo único de esta lista que hace eso.
Donnu existe para ese caso. Sortea, sella la asignación, guarda el resultado con la definición de métrica congelada y devuelve la lectura sin la premisa de ausencia de confusión en el medio. Cuando el sorteo no esté disponible, usa los diseños de este arco y cierra siempre con el valor E declarado en el informe. Para saber si tu tráfico soporta el test sorteado, la calculadora de tamaño de muestra responde en segundos, y la calculadora de significancia cierra la lectura al final.
Referencias
- Ding, P. y VanderWeele, T. J. Sensitivity Analysis Without Assumptions. Epidemiology, volumen 27, número 3, abril de 2016, páginas 368 a 377. Fuente del límite de sesgo que sostiene toda la cuenta de esta guía: la razón de riesgo verdadera es al menos la razón observada multiplicada por la suma de las dos asociaciones del confundidor menos uno y dividida por el producto de esas asociaciones, sin premisa sobre la distribución del confundidor; y del ejemplo trabajado con los datos de Hammond y Horn sobre cigarrillo y cáncer de pulmón, con razón de riesgo observada de cerca de 10,73 e intervalo del 95 por ciento entre 8,02 y 14,36, en el que asumir las dos asociaciones iguales a 10,73 da factor de limitación de 5,63, estimación corregida de aproximadamente 1,91 e intervalo corregido entre 1,42 y 2,55, de modo que el confundidor no derribaría el límite inferior. pmc.ncbi.nlm.nih.gov.
- VanderWeele, T. J. y Ding, P. Sensitivity Analysis in Observational Research: Introducing the E-Value. Annals of Internal Medicine, volumen 167, número 4, 2017, páginas 268 a 274. Artículo en el que la medida recibió el nombre de valor E, definida como el menor grado de asociación, en la escala de razón de riesgo, que un confundidor no medido necesitaría tener tanto con el tratamiento como con el desenlace, condicionado a las covariables medidas, para explicar completamente la asociación observada. La fórmula usada en esta guía es la solución cerrada del límite de Ding y VanderWeele cuando las dos asociaciones se igualan y el efecto corregido se lleva a uno. acpjournals.org.
- Gordon, B., Zettelmeyer, F., Bhargava, N. y Chapsky, D. A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook. Versión larga en documento de trabajo, julio de 2016, publicado en Marketing Science en 2019. Fuente de los 12 estudios con experimento sorteado sirviendo de referencia, 435 millones de observaciones de usuario por estudio y 1,4 mil millones de impresiones; y de la Tabla 7, en la que la especificación de propensión más rica todavía divergió de la referencia en 5 de los 10 estudios de checkout evaluados, con desviación absoluta media de 184 puntos porcentuales contra efecto experimental medio del 57 por ciento, y la regresión ajustada con ponderación más detallada divergió en 3 de 10, con desviación media de 173 puntos. kellogg.northwestern.edu.
- Imbens, G. W. y Xu, Y. Comparing Experimental and Nonexperimental Methods: What Lessons Have We Learned Four Decades After LaLonde (1986)? Journal of Economic Perspectives, versión de mayo de 2025. Fuente de que la literatura desarrolló dos estrategias complementarias para evaluar la plausibilidad de la premisa de ausencia de confusión, análisis placebo y análisis de sensibilidad, y de que la premisa en sí es fundamentalmente no verificable a partir de los datos. arxiv.org.
Lee también: Puntaje de propensión · Serie temporal interrumpida · Diferencias en diferencias · Control sintético · Atrición diferencial · Calculadora de significancia · Leer en portugués
Preguntas frecuentes
- ¿Qué es el análisis de sensibilidad a confundidor no medido?
- Es la cuenta que responde "qué tan fuerte tendría que ser un factor que no medí para derribar este resultado". No descubre el confundidor ni prueba que no existe. Transforma una duda sin forma en una magnitud comparable con lo que conoces de tu negocio, y por eso es la única manera honesta de cerrar una lectura observacional.
- ¿Qué es el valor E?
- Es el menor grado de asociación, en la escala de razón de riesgo, que un confundidor no medido necesitaría tener al mismo tiempo con el tratamiento y con el desenlace para explicar todo el efecto observado. Se calcula directo de la estimación: el valor E es la razón de riesgo sumada a la raíz cuadrada de la razón por ella menos uno. Para una razón de 1,24, el valor E es 1,79.
- ¿Un valor E alto prueba que no hay confusión?
- No. Dice que un confundidor pequeño no basta. Si el valor E es 1,79 y sabes que el engagement previo duplica tanto la probabilidad de adopción como la de conversión, entonces el confundidor necesario existe y cabe holgado. El número solo cobra sentido comparado con asociaciones reales de tu dominio.
- ¿Cómo aplicar esto al límite del intervalo de confianza?
- Calcula el valor E también en el límite del intervalo más cercano al nulo. En la simulación de esta guía, la razón observada era 1,2412 con intervalo del 95 por ciento entre 1,0757 y 1,4321. El valor E del punto es 1,79 y el del límite inferior es 1,36. El segundo número es el que importa: un confundidor con asociaciones de 1,4 ya empuja el intervalo hasta el nulo.
- ¿De dónde viene la fórmula del valor E?
- Del límite de sesgo demostrado por Ding y VanderWeele en 2016, que vale sin premisa alguna sobre la distribución del confundidor. El límite dice que el efecto verdadero es al menos el observado dividido por un factor que depende de las dos asociaciones del confundidor. Igualar las dos asociaciones y exigir que el límite llegue a uno devuelve exactamente la fórmula del valor E.
- ¿Cuándo el valor E deja de ayudar?
- Cuando el problema no es confusión, sino selección, atrición o error de medición. El valor E responde solo a la pregunta del confundidor común. Pérdida diferencial de datos entre los grupos, evento de conversión medido de formas distintas o población de análisis elegida después del tratamiento exigen otras cuentas.