Intención de Tratar en Test A/B: analiza por asignación
La intención de tratar mide a quien fue asignado, no a quien usó. Por qué el análisis por protocolo exageró 2,4 veces y cómo recuperar el efecto real.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Intención de tratar significa analizar a cada usuario en el brazo en el que fue asignado, incluso si nunca abrió la funcionalidad que lanzaste. Es la única comparación que sigue siendo aleatoria después de que el test empieza, y por eso es la única que mide causa. Filtrar por quien usó parece más justo y es el error más caro del género: en el ejemplo trabajado de esta guía, ese filtrado devolvió más 9,5723 puntos porcentuales cuando el efecto verdadero era de 4 puntos. Esta guía muestra por qué el filtrado rompe la aleatorización, cómo recuperar el efecto en quien de hecho usó dividiendo por el tamaño de la adhesión, y cuánto cuesta la adhesión parcial en tamaño de muestra. Forma parte de nuestra guía completa de test A/B y conversa directo con análisis por disparo y dilución y unidad de aleatorización.
Qué garantiza la aleatorización, y qué deja de garantizar
La aleatorización garantiza una sola cosa, y es enorme: en el instante en el que los usuarios se distribuyen entre control y tratamiento, los dos grupos son estadísticamente iguales en todo, incluso en lo que no mediste y en lo que ni sabes que existe. Esa igualdad es lo que permite atribuir cualquier diferencia posterior al cambio que hiciste.
La garantía vale para los grupos tal como fueron asignados, y no sobrevive a ningún filtro aplicado después. Apenas seleccionas usuarios por algo que ocurrió después de la asignación, dejas de comparar dos grupos aleatorios y pasas a comparar dos grupos elegidos por comportamiento. El nombre de eso es sesgo de selección, y no desaparece con más tráfico: es un error de diseño, no de precisión.
El caso más común en producto es la adhesión parcial. Lanzas un checklist de onboarding, un asistente nuevo, una ruta de configuración guiada. La funcionalidad queda disponible para todo el mundo en el brazo de tratamiento, y una parte de los usuarios simplemente no interactúa con ella. Ahí viene la pregunta que parece razonable: “¿por qué comparar contra quien ni vio la funcionalidad? Miremos solo a quien la usó”.
Esa frase destruye el experimento. Quien usa no es una muestra aleatoria de quien fue asignado: es la parte más comprometida, más motivada, con más probabilidad de convertir incluso sin ningún tratamiento. Comparas a los mejores del tratamiento contra la media del control y llamas resultado a la diferencia.
Los cuatro tipos de usuario ante la asignación
La literatura de inferencia causal organiza el problema clasificando a cada usuario por lo que haría en cada uno de los dos escenarios posibles. Imbens resume la clasificación en la revisión de 2014, atribuyendo la formulación a Imbens y Angrist (1994) y a Angrist, Imbens y Rubin (1996). Son cuatro tipos:
El punto incómodo de esa tabla es que nunca sabes de qué tipo es un usuario específico. Un usuario del tratamiento que no abrió el checklist puede ser un nunca adhiere o un contrario. Un usuario del control que convirtió puede ser adherente o nunca adhiere. Como plantea Imbens, los datos no contienen ninguna información sobre lo que el usuario habría hecho en el otro brazo.
Lo que se recupera son las proporciones agregadas, y de eso vive el análisis correcto.
Tres cuentas sobre los mismos datos, tres respuestas distintas
El ejemplo canónico de la literatura es un experimento de vacunación contra la gripe conducido por McDonald, Hiu y Tierney en 1992, con 2.861 pacientes, reanalizado por Imbens en 2014. Los investigadores no aleatorizaron la vacuna: aleatorizaron cartas enviadas a los médicos, recordándoles la temporada de gripe e incentivando la vacunación de sus pacientes. La aleatorización es de la carta, la adhesión es la vacuna, el desenlace es la hospitalización por causa relacionada con la gripe.
Es exactamente la estructura de un test de producto: aleatorizas la exposición a la funcionalidad, no el uso de ella.
| cuenta | qué compara | resultado |
|---|---|---|
| intención de tratar | 1.472 asignados a carta (7,8125% hospitalizados) contra 1.389 sin carta (9,2873%) | menos 1,4748 pp |
| como tratado | 716 vacunados (8,5196%) contra 2.145 no vacunados (8,5315%) | menos 0,0119 pp |
| por protocolo | 453 vacunados del brazo de la carta (6,8433%) contra 1.126 no vacunados del brazo sin carta (8,7922%) | menos 1,9489 pp |
| efecto en los adherentes | intención de tratar dividida por la adhesión | menos 12,4557 pp |
Cuatro números para el mismo experimento, variando de prácticamente cero a menos 12,5 puntos porcentuales. Solo el primero y el cuarto significan algo, y por motivos distintos.
La cuenta “como tratado” dice que la vacuna no hace nada. Eso es casi con certeza falso, y el motivo es visible: los pacientes vacunados sin ninguna carta tienden a ser pacientes de mayor riesgo, que el médico vacunaría de todos modos. Comparar vacunados contra no vacunados compara enfermos contra sanos.
La cuenta por protocolo tiene el mismo defecto, atenuado. Y el número de la intención de tratar, el único que preserva la aleatorización, es honesto y modesto: menos 1,4748 puntos porcentuales. Pegando los cuatro números del experimento en la calculadora de significancia, la diferencia sale con z de menos 1,4115, valor p de 0,158091 e intervalo del 95 por ciento yendo de menos 3,5265 a más 0,5770 puntos porcentuales. No es significativo. Un resultado inconcluso obtenido correctamente vale más que un resultado fuerte obtenido con la cuenta equivocada.
La cuarta fila es el asunto de la próxima sección.
Ejemplo trabajado: un checklist de onboarding con 35 por ciento de adhesión
Simulamos un caso de producto para poder comparar cada cuenta contra la verdad, que en un experimento real nunca conoces. El escenario: un SaaS lanza un checklist de onboarding para la mitad de los registros nuevos. La funcionalidad no existe en el control, así que no hay siempre adhiere ni contrario.
Los parámetros del mundo simulado, que el analista no ve:
- 35 por ciento de los usuarios son adherentes, es decir, abrirían el checklist si tuvieran acceso.
- Un adherente convierte al 14 por ciento sin ningún tratamiento. Un nunca adhiere convierte al 6 por ciento. Esa diferencia es la fuente entera del sesgo.
- El checklist aumenta la conversión del adherente en 4 puntos porcentuales, de 14 a 18 por ciento. Ese es el efecto verdadero que queremos recuperar.
- La conversión media de la población es 8,80 por ciento, y el efecto visible en el brazo entero es 35 por ciento de 4 puntos, es decir, 1,40 puntos porcentuales.
Corrimos el experimento con 20.000 usuarios por brazo, semilla fija. Los números observados:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pegando en la calculadora de arriba el control con 20.000 visitantes y 1.692 conversiones (8,4600 por ciento) contra el tratamiento con 20.000 visitantes y 2.035 conversiones (10,1750 por ciento), el resultado es z de 5,9000, valor p de 3,647 veces 10 elevado a menos 9, diferencia de 1,7150 puntos porcentuales, ganancia relativa de 20,2719 por ciento e intervalo del 95 por ciento de 1,1455 a 2,2845 puntos porcentuales. Es el efecto de intención de tratar, medido en el denominador de la aleatorización.
En el brazo de tratamiento, 7.054 de los 20.000 usuarios abrieron el checklist, es decir, 35,2700 por ciento de adhesión. Ahora las cuentas equivocadas, sobre los mismos datos:
| cuenta | numerador y denominador | resultado | contra el verdadero (4 pp) |
|---|---|---|---|
| intención de tratar | 2.035/20.000 contra 1.692/20.000 | más 1,7150 pp | mide el efecto diluido, correcto |
| por protocolo | 1.272/7.054 (18,0323%) contra 1.692/20.000 (8,4600%) | más 9,5723 pp | exageración de 2,393 veces |
| como tratado | 1.272/7.054 contra 763/12.946 (5,8937%) | más 12,1386 pp | exageración de 3,03 veces |
| efecto en los adherentes | 1,7150 dividido por 0,352700 | más 4,8625 pp | el intervalo contiene el verdadero |
El análisis por protocolo devuelve un valor p que la calculadora redondea a cero y una ganancia relativa de 113,15 por ciento. Es el tipo de número que cierra una reunión. Y está equivocado por un factor de más de dos, porque 7,4 puntos de los 9,6 medidos ya existían antes del experimento: en el brazo de control de la misma simulación, los usuarios que serían adherentes convirtieron al 13,2710 por ciento y los demás al 5,8950 por ciento.
La cuenta que recupera el efecto de quien usó
Existe una forma correcta de responder “cuánto hizo la funcionalidad por quien la usó”, y no pasa por filtrar a nadie. Pasa por una división.
El efecto de intención de tratar es el efecto en los adherentes multiplicado por la fracción de adherentes. Quien nunca adhiere tiene efecto cero por construcción, así que no contribuye en nada a la diferencia entre los brazos, solo diluye. Invirtiendo la relación:
efecto en los adherentes = efecto de intención de tratar dividido por la diferencia de adhesión entre los brazos
Esa razón es el estimador de Wald. Imbens y Angrist (1994) y Angrist, Imbens y Rubin (1996) mostraron que, bajo dos suposiciones que la próxima sección detalla, identifica el efecto medio local, también llamado efecto causal medio en los adherentes.
En nuestro ejemplo, 1,7150 dividido por 0,352700 devuelve 4,8625 puntos porcentuales. El error estándar del efecto de intención de tratar es 0,2906 puntos porcentuales, y el error estándar de la razón sale aproximadamente dividiendo por el mismo denominador, es decir, 0,8238 puntos. El intervalo del 95 por ciento va de 3,2479 a 6,4771 puntos, y contiene el valor verdadero de 4,00 puntos.
Fíjate en el precio incorporado: el intervalo del efecto en los adherentes es casi tres veces más ancho que el de la intención de tratar, exactamente porque fue dividido por 0,35. Recuperar el efecto de quien usó no es gratis, es una amplificación de la incertidumbre junto con la amplificación de la señal.
Para confirmar que no fue suerte de la semilla, corrimos 4.000 réplicas del mismo diseño:
| verificación | resultado | esperado |
|---|---|---|
| efecto en los adherentes, promedio de las 4.000 réplicas | 3,9780 pp | 4,00 pp |
| cobertura del intervalo del 95 por ciento | 95,03% | 95% |
| efecto por protocolo, promedio de las réplicas | 9,1834 pp | 4,00 pp |
| sesgo del análisis por protocolo | más 5,1834 pp | cero |
| poder del test de intención de tratar (N de 20.000) | 99,72% | alto por diseño |
La razón de Wald es prácticamente insesgada y el intervalo cubre lo que promete. El análisis por protocolo yerra por más 5,18 puntos porcentuales en promedio, y ese error no disminuye con más tráfico.
El precio en muestra: la adhesión entra casi al cuadrado
La parte que rompe cronogramas es el dimensionamiento. Si el efecto en los adherentes es de 4 puntos porcentuales y solo el 35 por ciento adhiere, el efecto visible en el brazo entero es de 1,4 puntos. Y como el tamaño de muestra necesario crece con el inverso del cuadrado del efecto, dividir el efecto por tres multiplica la muestra por cerca de nueve.
Con base de 8,80 por ciento, 95 por ciento de confianza y 80 por ciento de poder:
| adhesión | efecto visible en el brazo | N por variación | días a 40 mil/semana | N contra adhesión total |
|---|---|---|---|---|
| 5% | 0,200 pp | 318.189 | 112 | 337,1x |
| 10% | 0,400 pp | 80.352 | 29 | 85,1x |
| 20% | 0,800 pp | 20.489 | 8 | 21,7x |
| 35% | 1,400 pp | 6.885 | 3 | 7,3x |
| 50% | 2,000 pp | 3.468 | 2 | 3,7x |
| 75% | 3,000 pp | 1.611 | 1 | 1,7x |
| 100% | 4,000 pp | 944 | 1 | 1,0x |
La razón entre la fila de 35 por ciento y la de adhesión total es 7,3 veces, un poco por debajo del cuadrado puro de 8,2 veces, porque la varianza de la proporción también cambia conforme el efecto crece. En la fila de 5 por ciento la distancia se agranda: 337 veces contra las 400 veces que el cuadrado puro preveía. La regla práctica es que la muestra crece aproximadamente con el inverso del cuadrado de la adhesión, y la aproximación vale mejor cuanto menor sea el efecto.
El error que esa tabla expone es frecuente y silencioso. El equipo dimensiona el test para el efecto que espera en quien usa la funcionalidad, corre con la muestra de esa cuenta y lee el resultado en el brazo entero. Dimensionando 944 usuarios por variación, el poder real queda así:
| adhesión real | poder efectivo | muestra que daría 80% |
|---|---|---|
| 20% | 8,71% | 20.489 |
| 35% | 17,80% | 6.885 |
| 50% | 30,90% | 3.468 |
Un test con 17,8 por ciento de poder falla en detectar un efecto real en más de 4 de cada 5 intentos. El equipo concluye que el checklist “no funcionó” y mata una funcionalidad que funciona. Es el mismo mecanismo descrito en nuestra guía sobre poder observado: el test nunca tuvo oportunidad.
Cuándo no vale la división
El estimador de Wald no es mágico. Exige dos suposiciones además de la aleatorización.
Restricción de exclusión. La asignación solo puede afectar el resultado pasando por la adhesión. Imbens describe esa suposición como la más crítica y típicamente más controvertida de este tipo de método. En producto, suele valer cuando el usuario que no adhiere literalmente no percibe ninguna diferencia. Y falla en casos concretos y comunes:
- La funcionalidad se anuncia con un banner o correo que alcanza a todo el brazo, incluso a quien nunca hace clic. El anuncio por sí solo puede cambiar el comportamiento.
- La entrada de la funcionalidad ocupa espacio en la interfaz y empuja otro elemento hacia abajo, cambiando la experiencia de quien nunca la usa.
- El tratamiento cambia el rendimiento de la página para todo el mundo, adherente o no.
En esos casos la intención de tratar sigue siendo válida como efecto del cambio entero, que es lo que el negocio siente de verdad, pero la división deja de aislar el efecto de la funcionalidad.
Monotonicidad. No puede existir un usuario que use la funcionalidad cuando no es asignado a ella y deje de usarla cuando sí lo es. En un lanzamiento de producto eso es automático, porque la funcionalidad no existe en el control. En un test de mensaje, cupón o incentivo, existen contrarios de verdad: gente que reacciona al empujón haciendo lo opuesto.
Un detalle que ayuda: cuando el control no tiene ningún acceso a la funcionalidad, la diferencia de adhesión entre los brazos es simplemente la tasa de uso en el tratamiento, y la fracción de adherentes es directamente observable. Fue nuestro caso. En el experimento de la vacuna, no: 18,9345 por ciento de los pacientes se vacunaron incluso sin carta, así que la fracción de adherentes es la diferencia, 11,84 por ciento, y no la tasa bruta de 30,7745 por ciento.
Intención de tratar no es análisis por disparo
Esa confusión es frecuente porque las dos cosas se parecen en el código: las dos restringen quién entra en la cuenta. La diferencia es cuándo se decide el criterio.
| análisis por disparo | filtro por adhesión | |
|---|---|---|
| criterio | llegó al punto del flujo en el que los brazos difieren | usó la funcionalidad |
| determinado por | estado anterior a la acción del tratamiento | elección del usuario después de la asignación |
| afectado por el tratamiento | no, cuando está bien montado | sí, por definición |
| preserva la aleatorización | sí | no |
| verificación barata | conteo de disparados igual en los dos brazos | no existe arreglo por filtro |
El análisis por disparo es legítimo y aumenta el poder del test, porque quita del denominador a gente cuyo efecto es cero por construcción sin mirar el comportamiento post tratamiento. El filtro por adhesión hace lo opuesto: selecciona por el comportamiento que el tratamiento causó. La verificación que separa una cosa de la otra es comparar el conteo de usuarios disparados en los dos brazos, exactamente como se hace en una verificación de reparto desigual de tráfico. Si el número de “disparados” es distinto entre control y tratamiento, tu disparo se volvió un filtro de adhesión disfrazado.
Cómo montar esto en la práctica
- Registra la asignación en el momento de la asignación, no en el momento del uso. Si tu log solo graba usuarios que interactuaron con la funcionalidad, perdiste el denominador y no hay forma de hacer la cuenta correcta después.
- Reporta siempre la intención de tratar como número principal. Es el efecto que el negocio va a sentir, porque el lanzamiento también tendrá adhesión parcial.
- Reporta la adhesión como métrica de primera clase. Es la mitad de la explicación de cualquier resultado tibio y es accionable: un efecto real con adhesión baja es un problema de descubrimiento, no de producto.
- Solo entonces calcula la razón, y declara que vale para los adherentes, no para la base entera.
- Dimensiona por el efecto diluido, usando la adhesión esperada, con la calculadora de tamaño de muestra. Si no tienes estimación de adhesión, corre una semana solo para medirla antes de dimensionar.
- Antes de dividir, verifica si la asignación toca el resultado por fuera de la adhesión. Banner de anuncio, cambio de layout e impacto de rendimiento son los tres sospechosos de siempre.
- Nunca reportes la comparación por protocolo como si fuera causal. Si la piden, presenta junto a ella la diferencia de base entre adherentes y no adherentes medida en el control, que es el tamaño del sesgo.
Errores comunes
- Filtrar el control por el mismo comportamiento para “equilibrar”. Comparar a quien usó el checklist en el tratamiento contra quien “lo habría usado” en el control exige conocer el tipo de cada usuario, y no lo conoces. Cuando se puede aproximar el tipo con un comportamiento anterior a la asignación, eso se convierte en una segmentación legítima, y ahí es efecto heterogéneo por segmento, no intención de tratar.
- Tratar la adhesión baja como falla de medición. Una adhesión del 8 por ciento no es ruido: es el resultado. Dice que la funcionalidad no está siendo encontrada, y ninguna cuenta estadística arregla eso.
- Dividir por una adhesión medida con error grande. Con adhesión muy baja, el denominador de Wald es pequeño e inestable, y el intervalo del efecto en los adherentes queda tan ancho que no decide nada.
- Aplicar la división sobre un efecto de intención de tratar no significativo. Dividir un número que puede ser cero por 0,3 devuelve otro número que puede ser cero, con un intervalo tres veces mayor. La razón no crea evidencia.
- Olvidar que el lanzamiento también tendrá adhesión parcial. El efecto en los adherentes es útil para entender el mecanismo. Lo que va a aparecer en los ingresos después del lanzamiento es el número diluido, exactamente como ocurre en la dilución por disparo.
Hazlo automático en Donnu
La causa raíz del error por protocolo casi nunca es estadística, es de instrumentación: la herramienta registra al usuario en el experimento cuando interactúa con la funcionalidad, porque es ahí donde el evento se dispara. En ese modelo de datos, el brazo de tratamiento pasa a contener solo adherentes, y la comparación por protocolo deja de ser una elección del analista y se vuelve la única cuenta posible.
Donnu graba la asignación en el instante de la aleatorización, separada del evento de uso, lo que mantiene los dos denominadores disponibles: el de la aleatorización, para la intención de tratar, y el de la adhesión, para la razón. Si tu herramienta actual solo registra a quien interactuó, el paso inmediato es agregar un evento de exposición en el momento de la asignación y, mientras tanto, tratar todo resultado por protocolo como estimación de techo, nunca como efecto. Para verificar si tu efecto diluido tiene muestra suficiente, la calculadora de poder estadístico responde en un minuto.
Referencias
- Imbens, G. W. Instrumental Variables: An Econometrician’s Perspective. Statistical Science, 2014 (arXiv 1410.0163). Fuente de la clasificación en cuatro tipos de adhesión (nunca adhiere, adherente, contrario y siempre adhiere) atribuida a Imbens y Angrist (1994) y a Angrist, Imbens y Rubin (1996); del registro de que los datos no informan el tipo de ninguna unidad individual; de la identificación de las proporciones de los tipos bajo monotonicidad; de la definición del efecto medio local como la razón entre el efecto de intención de tratar en el desenlace y el efecto de intención de tratar en la recepción del tratamiento; de los datos de gripe de McDonald, Hiu y Tierney (1992) con 2.861 pacientes y la tabla completa de las ocho celdas; de las estimaciones publicadas de 0,189 para siempre adhiere, 0,692 para nunca adhiere y 0,119 para adherente, del efecto de intención de tratar de menos 0,015 con error estándar 0,011, del efecto en la recepción de 0,119 con error estándar 0,016 y del efecto medio local de menos 0,125 con error estándar 0,090; de la descripción de la restricción de exclusión como la suposición más crítica y típicamente más controvertida; de la observación de que la monotonicidad implica ausencia de contrarios; y del registro de que el efecto de intención de tratar se apoya en menos suposiciones que las alternativas. arxiv.org.
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Fuente de la regla de diluir métricas por el tamaño del segmento afectado, con el ejemplo de una mejora de 10 por ciento en un segmento de 1 por ciento resultando en un impacto total de aproximadamente 0,1 por ciento, y del registro de que en un sitio como Bing los experimentos exitosos mueven métricas clave entre 0,1 y 1,0 por ciento una vez diluidos. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Referencia sobre la exigencia de confiabilidad de los datos de asignación en plataformas de experimentación a escala y sobre la separación entre el registro de la asignación y el registro del uso. exp-platform.com.
- Dmitriev, P., Gupta, S., Kim, D. W. y Vaz, G. A Dirty Dozen: Twelve Common Metric Interpretation Pitfalls in Online Controlled Experiments. KDD 2017. Fuente de la lección de que la condición usada para definir un segmento no puede ser afectada por el tratamiento, y del ejemplo de Bing en el que dos segmentos definidos por un comportamiento post tratamiento subieron mientras la población combinada no se movió. exp-platform.com.
Lee también: Análisis por disparo y dilución · Unidad de aleatorización · Poder observado · SRM: reparto desigual de tráfico · Métrica primaria y OEC · Calculadora de tamaño de muestra · Leia em português
Preguntas frecuentes
- ¿Qué es el análisis por intención de tratar en un test A/B?
- Es analizar a cada usuario en el brazo en el que fue asignado, incluso si nunca usó la funcionalidad que lanzaste. El denominador es la población asignada entera, no la población que adhirió. Es la única comparación que sigue siendo aleatoria después de que el experimento empieza, y por eso es la única que responde a una pregunta causal sin suposición adicional. Como registra Imbens en la revisión de 2014, el efecto de intención de tratar se apoya en menos suposiciones que cualquier alternativa.
- ¿Cuál es la diferencia entre intención de tratar y análisis por protocolo?
- La intención de tratar compara los brazos enteros tal como fueron asignados. El análisis por protocolo compara solo a quien adhirió al tratamiento contra el control, y esa comparación deja de ser aleatoria porque quien adhiere es distinto de quien no adhiere. En el ejemplo trabajado de esta guía, el análisis por protocolo devolvió más 9,5723 puntos porcentuales cuando el efecto verdadero era de 4 puntos, una exageración de 2,393 veces, porque los usuarios que adhirieron ya convertían más que la media antes de cualquier tratamiento.
- ¿Cómo recuperar el efecto en quien realmente usó la funcionalidad?
- Dividiendo el efecto de intención de tratar por la diferencia de adhesión entre los brazos. Esa razón es el estimador de Wald, e Imbens y Angrist mostraron en 1994, junto con Angrist, Imbens y Rubin en 1996, que identifica el efecto medio en los usuarios que adhieren por causa de la asignación. En el ejemplo de esta guía, 1,7150 puntos porcentuales divididos por 35,27 por ciento de adhesión devolvieron 4,8625 puntos, con intervalo de 3,2479 a 6,4771, conteniendo el valor verdadero de 4 puntos.
- ¿Cuánto cuesta la adhesión parcial en tamaño de muestra?
- Mucho, porque el efecto visible se encoge proporcionalmente a la adhesión y el tamaño de muestra crece aproximadamente con el cuadrado de esa reducción. En la tabla de esta guía, detectar un efecto de 4 puntos porcentuales exige 944 usuarios por variación con adhesión total, 6.885 con adhesión de 35 por ciento y 318.189 con adhesión de 5 por ciento. Dimensionar por el efecto en quien usa, y no por el efecto diluido en el brazo entero, es la forma más común de correr un test sin ningún poder.
- ¿Cuándo no vale el estimador de Wald?
- Cuando la asignación afecta el resultado por algún camino que no pasa por la adhesión, lo que se llama restricción de exclusión, o cuando existen usuarios que hacen lo contrario de lo que fueron designados. Imbens describe la restricción de exclusión como la suposición más crítica y típicamente más controvertida detrás de este tipo de método. En test A/B de producto suele valer para quien nunca ve la funcionalidad, y suele fallar cuando el propio anuncio de la novedad cambia el comportamiento de quien no la usa.
- ¿Intención de tratar es lo mismo que análisis por disparo?
- No. El análisis por disparo restringe el denominador a quien llegó al punto del flujo en el que las variaciones pasan a diferir, un criterio que no depende del tratamiento y por eso preserva la aleatorización. La adhesión es una elección del usuario tomada después de la asignación y afectada por el tratamiento, así que filtrar por ella rompe la comparación. Las dos cosas parecen iguales en el código y son opuestas en la estadística.