Análisis de Mediación: por dónde pasó el efecto del test A/B
El análisis de mediación separa el efecto directo del indirecto. La cuenta, la trampa de segmentar tras el sorteo y la premisa que nadie pone a prueba.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Saber que la variación funcionó es distinto de saber por dónde funcionó. En el ejemplo de esta guía, un checklist de onboarding subió la retención de 30 días de 23,00 a 26,16 por ciento, un efecto total de 3,16 puntos con valor p del orden de 2,2 por 10 elevado a menos 16; la descomposición atribuye 2,46 puntos al camino que pasa por la creación del primer proyecto y 0,70 punto a todo el resto. Y la lectura ingenua del mismo dato, comparando los dos brazos dentro de quienes crearon proyecto y dentro de quienes no crearon, devuelve dos resultados sin significancia, valores p 0,1163 y 0,2558. El efecto total está garantizado por el sorteo. La división entre directo e indirecto, que es lo que entrega el análisis de mediación, no lo está, y esta guía muestra exactamente cuánto depende de una premisa que ningún dato pone a prueba. Forma parte de nuestra guía completa de test A/B y complementa métrica sustituta, que responde una pregunta parecida por otro criterio.
La pregunta que viene después del resultado
El test ganó. La siguiente pregunta en la sala es siempre la misma, y es legítima: ¿por qué? No por curiosidad, sino porque la respuesta cambia lo que se construye a continuación.
- si el checklist funcionó porque empujó a la gente a crear el primer proyecto, entonces vale invertir en cualquier camino que lleve a esa creación, y el checklist es solo uno de ellos.
- si el checklist funcionó por otro motivo, por ejemplo por haber hecho que el producto pareciera más organizado, entonces optimizar la creación del primer proyecto es invertir en lo equivocado.
El análisis de mediación es el intento formal de responder eso. Y es el lugar de la experimentación donde más gente resbala, porque la cuenta es fácil, el gráfico es bonito, y la premisa que lo sostiene todo es invisible.
El diseño del análisis de mediación: un mediador entre la variación y el desenlace
VanderWeele organiza las premisas en cuatro. Hay que controlar la confusión entre exposición y desenlace, entre mediador y desenlace, entre exposición y mediador, y hace falta que ningún confundidor de la relación mediador-desenlace sea él mismo afectado por la exposición. La frase que le importa a quien corre tests A/B es esta:
la suposición de control de la confusión entre mediador y desenlace no es necesaria para el análisis de efectos totales en un ensayo aleatorizado, pero sí lo es para el análisis de efectos directo e indirecto. Es necesaria incluso en el contexto del ensayo aleatorizado porque, en un ensayo, aunque la exposición haya sido aleatorizada, el mediador típicamente no lo fue.
El sorteo compra el efecto total y no compra la descomposición. Imai, Keele y Tingley llaman ignorabilidad secuencial a la premisa correspondiente y son igualmente directos: es la suposición clave y aun así no verificable, y enfatizan que la segunda etapa es una suposición fuerte, que hay que hacer con cuidado, porque siempre es posible que existan variables no observadas que confundan la relación entre desenlace y mediador incluso después de condicionar en el tratamiento y en las covariables observadas.
Ejemplo trabajado: el checklist de onboarding
Un producto prueba un checklist de primeros pasos con 25.000 usuarios por brazo. El mediador elegido es haber creado el primer proyecto en la primera semana. El desenlace es retención en el día 30.
| medida | control | checklist |
|---|---|---|
| creó el primer proyecto | 10.000 de 25.000 = 40,0% | 13.000 de 25.000 = 52,0% |
| retenidos entre quienes crearon | 3.500 de 10.000 = 35,0% | 4.680 de 13.000 = 36,0% |
| retenidos entre quienes no crearon | 2.250 de 15.000 = 15,0% | 1.860 de 12.000 = 15,5% |
| retenidos en el total | 5.750 de 25.000 = 23,00% | 6.540 de 25.000 = 26,16% |
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pega la última línea en la calculadora: 25.000 y 5.750 contra 25.000 y 6.540. El efecto total es más 3,1600 puntos, más 13,74 por ciento relativo, con intervalo de confianza del 95 por ciento entre más 2,4057 y más 3,9143 puntos y valor p del orden de 2,2 por 10 elevado a menos 16, que la calculadora muestra como menor que 0,0001. Pega también la primera línea, el efecto sobre el mediador: más 12,0000 puntos, más 30,00 por ciento. El z de las dos lecturas no aparece en la pantalla, porque es el paso intermedio del test: vale 8,2056 en el efecto total y 26,9191 en el mediador.
Dos cosas son incuestionables aquí, porque las dos vienen directo del sorteo: la variación aumentó la retención y la variación aumentó la creación de proyecto. Todo lo que viene a continuación es interpretación.
La trampa: segmentar por un paso postratamiento
La lectura que casi todo el mundo hace primero es comparar los brazos dentro de cada grupo del mediador. Parece inocente y es el error más caro del área.
| recorte | control | checklist | efecto | valor p |
|---|---|---|---|---|
| solo quienes crearon proyecto | 3.500 de 10.000 = 35,00% | 4.680 de 13.000 = 36,00% | más 1,0000 punto | 0,1163 |
| solo quienes no crearon | 2.250 de 15.000 = 15,00% | 1.860 de 12.000 = 15,50% | más 0,5000 punto | 0,2558 |
| población entera | 5.750 de 25.000 = 23,00% | 6.540 de 25.000 = 26,16% | más 3,1600 puntos | menor que 0,0001 |
Pega las tres en la calculadora de arriba y comprueba. El resultado es desconcertante: el efecto es altamente significativo en el todo y desaparece en las dos mitades. Ninguno de los dos recortes cruza la línea del 5 por ciento.
La explicación es aritmética, no estadística. El tratamiento movió gente entre los dos grupos: 3.000 personas que estarían en el grupo sin proyecto pasaron al grupo con proyecto. Como el grupo con proyecto retiene mucho más, el total sube sin que la tasa dentro de ninguno de los dos grupos necesite subir casi nada. Los recortes no son comparables porque no contienen a las mismas personas.
Dmitriev, Gupta, Kim y Vaz registran el caso espejo, en un experimento de ranking de Bing: los dos grupos definidos por haber visto o no un deeplink mostraron aumento estadísticamente significativo en sesiones por usuario, y la combinación de los dos no mostró cambio. La causa fue la misma: la fracción de usuarios en el primer grupo cayó en el tratamiento, y quienes salieron eran menos activos que la media de aquel grupo y más activos que la media del otro. La lección que sacan es la regla que cierra esta sección: asegura que la condición usada para definir el segmento no sea impactada por el tratamiento.
Es decir, la descomposición correcta no puede hacerse comparando dentro de los grupos del mediador. Necesita otra cuenta.
La cuenta correcta: fijar la distribución del mediador
La descomposición en efectos naturales responde una pregunta contrafactual: ¿cuánto del efecto quedaría si la variación siguiera activa pero el mediador se comportara como en el control?
Basta aplicar las tasas de retención del brazo tratado sobre la distribución de mediador del brazo de control:
retención del tratado con la mezcla del control = 0,40 por 36,00 más 0,60 por 15,50 = 14,40 más 9,30 = 23,70 por ciento.
Con ese número, la descomposición sale entera:
| componente | cuenta | valor |
|---|---|---|
| efecto total | 26,16 menos 23,00 | más 3,1600 puntos |
| efecto directo natural | 23,70 menos 23,00 | más 0,7000 punto |
| efecto indirecto natural | 26,16 menos 23,70 | más 2,4600 puntos |
| suma de los dos | 0,70 más 2,46 | más 3,1600 puntos |
| proporción mediada | 2,46 dividido por 3,16 | 77,85% |
El indirecto también sale por un camino más corto y vale comprobarlo: la variación movió el mediador en 12 puntos, y la distancia de retención entre quienes crearon y quienes no crearon, dentro del brazo tratado, es 36,00 menos 15,50, es decir, 20,5 puntos. El producto 0,12 por 20,5 da exactamente 2,46 puntos. Es ese producto el que carga la premisa entera, porque trata los 20,5 puntos como si fueran un efecto causal de crear el proyecto, y no la diferencia entre dos poblaciones de personas distintas.
Cuánto aguanta esto: el barrido que debería acompañar todo número
La descomposición entera depende de que los 20,5 puntos sean causa y no selección. Y por supuesto parte de ellos es selección: quien crea proyecto en la primera semana está, en promedio, más motivado, y habría retenido más de cualquier forma.
Imai, Keele y Tingley resuelven esto con un parámetro de sensibilidad, la correlación entre los errores del modelo del mediador y del modelo del desenlace, que vale cero bajo ignorabilidad secuencial y cuyos valores distintos de cero representan desviaciones de ella. La versión de servilleta de esa idea, que cualquier analista corre en una planilla, es asumir que una fracción del contraste entre quienes pasaron y quienes no pasaron por el mediador es confusión:
| fracción del contraste que es confusión | efecto indirecto | efecto directo | proporción mediada |
|---|---|---|---|
| 0% (ignorabilidad secuencial perfecta) | 2,460 puntos | 0,700 punto | 77,8% |
| 25% | 1,845 punto | 1,315 punto | 58,4% |
| 50% | 1,230 punto | 1,930 punto | 38,9% |
| 75% | 0,615 punto | 2,545 puntos | 19,5% |
| 100% (nada del contraste es causal) | 0,000 punto | 3,160 puntos | 0,0% |
Fíjate en la columna que no se mueve: el efecto total es 3,160 puntos en todas las líneas, porque viene del sorteo y ninguna premisa sobre el mediador lo toca. Lo que se mueve es la historia entera sobre el mecanismo, de “casi todo pasó por el primer proyecto” a “el primer proyecto no tuvo nada que ver con esto”.
Esa tabla es el resultado honesto de un análisis de mediación. Un número único de proporción mediada, sin ella, es una opinión con decimales.
Mediador no es métrica sustituta
Las dos ideas se parecen y sirven para cosas distintas:
| mediador | métrica sustituta | |
|---|---|---|
| pregunta | por dónde pasó el efecto | puedo decidir antes de que llegue el desenlace |
| criterio | causal, y no verificable | predictivo, y comprobable en histórico |
| cuándo es útil | después del test, para orientar el roadmap | durante el test, para acortar la espera |
| falla típica | confusión entre mediador y desenlace | el sustituto capta solo parte del efecto |
Una métrica puede ser excelente sustituta y pésima mediadora, y viceversa. El tratamiento completo del lado predictivo está en métrica sustituta en test A/B; aquí el asunto es solo el lado causal.
Qué hacer cuando la descomposición no convence
Si el barrido de sensibilidad muestra que la historia cambia de figura a mitad de la franja, y casi siempre lo muestra, existen tres salidas, en orden de costo:
- Reportar total y mecanismo por separado. El total decide si la variación se queda. El mecanismo entra como hipótesis, con la franja de sensibilidad al lado. Es honesto y no cuesta nada.
- Medir más covariables pretratamiento. Cuanto más del perfil de motivación de la persona hayas medido antes del sorteo, menos queda para el confundidor no medido. Eso encoge la franja, no la elimina.
- Aleatorizar el mediador. Si la decisión de producto realmente depende de saber si crear el primer proyecto causa retención, el camino es un segundo experimento cuyo objetivo sea esa creación. Cuando el paso no puede imponerse, el diseño de estímulo es exactamente la herramienta para eso, y trae su propio conjunto de premisas, más débiles que las de la mediación.
El punto tres es el que cierra el asunto de verdad, y vale registrar que casi nunca es la primera opción propuesta en la reunión, porque parece cara. Comparada con un año de roadmap construido sobre una descomposición frágil, es barata.
Elegir el mediador antes de ver el dato
El mediador debe declararse en el plan de análisis, junto con la métrica primaria, y no elegirse después entre los candidatos que sobraron. Tres criterios ayudan a decidir qué paso merece esa plaza:
| criterio | pregunta | por qué importa |
|---|---|---|
| orden temporal limpio | ¿el mediador ocurre después de la exposición y antes del desenlace, sin ventana superpuesta? | un mediador medido junto con el desenlace no permite separar causa de consecuencia |
| plausibilidad de mecanismo | ¿existe una historia de producto que explique por qué ese paso llevaría al desenlace? | sin mecanismo declarado, la descomposición se vuelve ajuste de curva |
| accionabilidad | si el camino fuera real, ¿hay algo que el equipo haría distinto? | un mediador que no cambia ninguna decisión no vale el análisis |
El tercer criterio elimina a la mayoría de los candidatos, y eso es bueno. Crear el primer proyecto pasa los tres: ocurre en la primera semana, tiene mecanismo obvio (quien ya invirtió trabajo en el producto vuelve) y es accionable de varias formas distintas del checklist probado.
Vale un último cuidado de alcance: el mediador debe ser un evento único y bien definido, no una métrica compuesta. Un índice de engagement que suma clics, sesiones y tiempo de pantalla no tiene orden temporal claro respecto al desenlace, y la descomposición sobre él no significa nada.
Un guion de seis pasos
- Declara el mediador en el plan de análisis, antes de correr, junto con la métrica primaria. El plan preregistrado es el lugar de esa declaración.
- Lee primero el efecto total. Si no existe, no hay qué descomponer, y buscar mecanismo en un resultado nulo es la forma más rápida de encontrar un falso positivo.
- Lee el efecto de la variación sobre el mediador. Si la variación no movió el mediador, el efecto indirecto es cero por construcción y la respuesta es que el camino no es ese.
- Arma la barra del medio. Aplica las tasas del brazo tratado sobre la distribución de mediador del brazo de control. Es una línea de planilla y es la única cuenta que la descomposición exige.
- Corre el barrido de sensibilidad con al menos las cinco líneas de la tabla de arriba. Publica la franja, no solo el punto.
- Nunca segmentes por mediador para comparar brazos. Si alguien pide ese recorte en la reunión, muestra la tabla de la tercera sección, con el efecto significativo en el todo y nulo en las dos mitades.
Errores comunes
- Segmentar por comportamiento postratamiento y llamarlo análisis de mediación. Es la trampa de la tercera sección, y produce el patrón en el que el efecto desaparece de las dos mitades.
- Reportar proporción mediada sin franja de sensibilidad. El número existe, pero es el menos estable del informe.
- Elegir el mediador después de ver los datos. Probar diez candidatos y reportar el que dio la mayor proporción mediada es el mismo problema de múltiples métricas, agravado por la ausencia de corrección.
- Usar un mediador medido después del desenlace. El orden temporal debe ser variación, después mediador, después desenlace, sin superposición de ventana.
- Sumar proporciones mediadas de varios mediadores. VanderWeele registra que ese enfoque informal falla si los mediadores se afectan entre sí, y sigue fallando si hay interacción entre sus efectos sobre el desenlace, aunque uno no afecte al otro.
- Confundir efecto directo pequeño con efecto directo ausente. Los 0,70 punto de este ejemplo siguen siendo casi un cuarto del efecto total.
Hazlo automático en Donnu
Nada de mediación es posible sin una cosa decidida antes del test: el mediador debe ser un evento registrado con sello de tiempo propio, separado del desenlace, y las covariables pretratamiento deben haberse guardado en el estado en que estaban en el instante del sorteo. Reconstruir eso después, a partir del estado actual del usuario, contamina justamente las variables que servirían para encoger la franja de sensibilidad.
Donnu sella el estado del usuario en la asignación y mantiene cada evento intermedio como evento propio, lo que deja la tabla de cuatro líneas del ejemplo de arriba disponible sin reconstrucción manual. Y vale la regla general: cuando el paso intermedio pueda aleatorizarse, aleatorízalo, porque eso cambia una premisa no verificable por un segundo experimento. La calculadora de significancia cierra las lecturas de efecto total y de primera etapa con los mismos números que pegarías a mano.
Referencias
- VanderWeele, T. J. Mediation Analysis: A Practitioner’s Guide. Annual Review of Public Health, volumen 37, 2016, páginas 17 a 32. Fuente de las cuatro suposiciones de confusión numeradas en el artículo (exposición y desenlace, mediador y desenlace, exposición y mediador, y la exigencia de que ningún confundidor de la relación mediador-desenlace sea afectado por la exposición); de la afirmación de que la suposición sobre confusión entre mediador y desenlace no es necesaria para el análisis de efectos totales en un ensayo aleatorizado pero sí lo es para efectos directo e indirecto, y es necesaria incluso en el ensayo aleatorizado porque el mediador típicamente no fue aleatorizado; y del registro de que sumar la proporción mediada de varios mediadores uno a uno falla cuando los mediadores se afectan entre sí y también cuando hay interacción entre sus efectos sobre el desenlace. annualreviews.org.
- Imai, K., Keele, L. y Tingley, D. A General Approach to Causal Mediation Analysis. Psychological Methods, volumen 15, número 4, 2010, páginas 309 a 334. Fuente de la definición de ignorabilidad secuencial en dos partes (el tratamiento es independiente de los desenlaces y mediadores potenciales dadas las covariables pretratamiento, y el mediador observado es independiente de los desenlaces potenciales dado el tratamiento observado y las covariables pretratamiento); del registro de que esa es la suposición clave y no verificable para la identificación; de la advertencia de que la segunda etapa es una suposición fuerte y siempre puede ser violada por variables no observadas que confunden la relación entre mediador y desenlace; y de la propuesta de análisis de sensibilidad mediante la correlación entre los errores del modelo del mediador y del modelo del desenlace, que vale cero bajo ignorabilidad secuencial. imai.fas.harvard.edu.
- Dmitriev, P., Gupta, S., Kim, D. W. y Vaz, G. A Dirty Dozen: Twelve Common Metric Interpretation Pitfalls in Online Controlled Experiments. KDD 2017. Fuente del caso de Bing en el que los dos grupos definidos por haber visto o no un deeplink mostraron aumento estadísticamente significativo en sesiones por usuario mientras la combinación de los dos no mostró cambio, con la explicación de que la fracción de usuarios en el primer grupo cayó en el tratamiento y quienes salieron eran menos activos que la media de aquel grupo y más activos que la media del otro; y de la lección de asegurar que la condición usada para definir el segmento no sea impactada por el tratamiento, verificable mediante una prueba de proporción de muestra en cada grupo del segmento. exp-platform.com.
Lee también: Métrica sustituta · Diseño de estímulo · Efecto heterogéneo por segmento · Paradoja de Simpson · Confundidor no medido · Calculadora de significancia · Leer en portugués
Preguntas frecuentes
- ¿Qué es el análisis de mediación en un test A/B?
- Es la descomposición del efecto total de la variación en dos partes: el efecto indirecto, que pasa por un paso intermedio que la variación movió, y el efecto directo, que es todo lo demás. En el ejemplo de esta guía, un checklist de onboarding subió la retención de 30 días en 3,16 puntos porcentuales, y la descomposición atribuye 2,46 puntos al camino que pasa por la creación del primer proyecto y 0,70 punto a todo el resto, es decir, 77,85 por ciento del efecto mediado.
- ¿Aleatorizar el test ya basta para calcular efecto directo e indirecto?
- No. VanderWeele es explícito: la suposición de control de la confusión entre mediador y desenlace no es necesaria para el análisis del efecto total, pero sí lo es para el análisis de los efectos directo e indirecto, y es necesaria incluso cuando la exposición fue aleatorizada, porque en un experimento el mediador típicamente no fue aleatorizado. El sorteo garantiza el total, no la descomposición.
- ¿Por qué no puedo simplemente comparar a quienes pasaron por el paso intermedio en los dos brazos?
- Porque ese recorte está definido por un comportamiento que el propio tratamiento alteró, y comparar dentro de él rompe el sorteo. En el ejemplo, el efecto total es altamente significativo, con valor p del orden de 2,2 por 10 elevado a menos 16, y aun así los dos recortes postratamiento salen sin significancia, con valores p 0,1163 y 0,2558. El efecto desaparece de las dos mitades y sigue existiendo en el todo.
- ¿Cuánto depende la descomposición de la premisa no verificable?
- Mucho. El efecto total queda fijo por el sorteo, pero la división entre directo e indirecto se mueve entera. Si la mitad del contraste entre quienes pasaron y quienes no pasaron por el mediador fuera confusión y no causa, la proporción mediada cae de 77,8 a 38,9 por ciento. En el límite en que todo sea confusión, cae a cero y el mismo efecto total pasa a ser enteramente directo.
- ¿Mediador y métrica sustituta son lo mismo?
- No. La métrica sustituta existe para que puedas leer el resultado antes de que llegue el desenlace final, y el criterio de aceptación es predictivo. El mediador existe para explicar por dónde pasó el efecto, y el criterio es causal. Una métrica puede ser un buen sustituto sin ser mediadora, y un mediador puede ser pésimo sustituto por llegar demasiado tarde.
- ¿Qué hacer cuando la descomposición no se sostiene?
- Reportar el efecto total, que es sólido, y presentar la descomposición como hipótesis de mecanismo con su franja de sensibilidad, nunca como número único. Si la decisión de producto depende de saber si el camino es real, el paso siguiente no es más estadística, es un segundo experimento que aleatorice el propio mediador o un diseño que estimule el paso intermedio directamente.