Diseño de Estímulo: sortear la invitación, medir el uso
Cuando la funcionalidad no puede apagarse, se sortea la invitación. Qué mide el diseño de estímulo, cuánto cuesta en muestra y dónde se rompe.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Cuando la funcionalidad no puede apagarse, lo que queda es sortear la invitación. En el ejemplo de esta guía, un banner sorteado movió la adopción de 8 a 20 por ciento y la conversión de 6,000 a 6,300 por ciento, con valor p 0,0306. Esos 0,30 punto divididos por los 12 puntos de adhesión adicional devuelven más 2,50 puntos en los cumplidores, y el precio de esa cuenta es correr el test con casi 60 veces más gente que si la funcionalidad hubiera podido sortearse directo. El diseño de estímulo es la salida legítima cuando el tratamiento está fuera de tu control, y cobra caro en muestra y en premisas. Esta guía muestra la cuenta completa, el costo, y el punto exacto en el que el diseño se rompe. Forma parte de nuestra guía completa de test A/B y es el lado del diseño del análisis que describimos en intención de tratar.
El problema: la funcionalidad no puede apagarse
El test A/B común sortea justo la cosa que quieres medir. La mitad ve el botón nuevo, la mitad ve el viejo, y la diferencia es el efecto del botón. Existe una clase entera de preguntas en las que eso simplemente no está disponible:
- la funcionalidad ya está publicada para todo el mundo. Quitarla de la mitad de la base es una remoción de valor, y a veces un incumplimiento de contrato. Nadie lo autoriza.
- el uso depende de un paso del usuario. Conectar una integración, importar contactos, crear el primer proyecto. Puedes ofrecer, no puedes obligar.
- el canal no es tuyo. Instalar la app, aceptar la llamada del equipo de ventas, responder un correo. Controlas el envío, no la acción.
- el tratamiento es un hábito. Usar el informe semanal, revisar el panel, abrir el resumen. La frecuencia es elección de la persona.
En esos casos, la comparación obvia es entre quien usó y quien no usó, y está sesgada por los mismos motivos que describimos en puntaje de propensión: quien adopta es distinto de quien no adopta, y la diferencia entre las personas entra entera en el resultado.
El diseño de estímulo resuelve eso cambiando el objeto del sorteo. No sorteas el uso. Sorteas la invitación a usar, que es algo que controlas por completo. El sorteo vuelve a existir, y con él vuelve la garantía de que los dos grupos son iguales al comienzo.
El diseño de estímulo: sortea la invitación, mide el uso
La estructura tiene tres variables, y confundir las tres es el error más común del área:
| variable | qué es | quién la controla | ¿se sortea? |
|---|---|---|---|
| la invitación | banner, correo, descuento, llamada, notificación | tú | sí, ese es el experimento |
| el uso | la persona de hecho usó la funcionalidad | la persona | no, es consecuencia |
| el desenlace | conversión, retención, ingresos | la persona | no, es lo que quieres explicar |
Lo que mides directamente son dos efectos de intención de tratar, uno en el uso y otro en el desenlace, y los dos son honestos porque la invitación fue sorteada. Lo que quieres es el efecto del uso sobre el desenlace, y ese no se mide, se deduce.
Ejemplo trabajado: el banner que movió la adopción en 12 puntos
Un producto tiene una funcionalidad de informe automático que ya está publicada. Nadie autoriza apagarla. La pregunta es si usar el informe aumenta la conversión al plan pago. El equipo sortea 120.000 usuarios en dos brazos y muestra un banner de invitación a la mitad.
| medida | sin banner | con banner | diferencia | valor p |
|---|---|---|---|---|
| usaron el informe (primera etapa) | 4.800 de 60.000 = 8,000% | 12.000 de 60.000 = 20,000% | más 12,000 puntos | menor que 0,0001 |
| convirtieron (intención de tratar) | 3.600 de 60.000 = 6,000% | 3.780 de 60.000 = 6,300% | más 0,300 punto | 0,0306 |
Pega las dos líneas en la calculadora de abajo y comprueba las tasas, la mejora relativa, el valor p y el intervalo. La primera línea sale con valor p menor que 0,0001 e intervalo de confianza del 95 por ciento entre más 11,6133 y más 12,3867 puntos. La segunda sale con valor p 0,0306 e intervalo entre más 0,0281 y más 0,5719 punto. La calculadora redondea el intervalo a un decimal y no muestra el z, que es el paso intermedio del test: vale 59,9002 en la primera línea y 2,1629 en la segunda.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Ahora la cuenta que importa. La invitación convenció al 12 por ciento de la población de usar el informe: 20 menos 8. Todo el efecto de 0,30 punto en el desenlace tiene que haber venido de esas personas, porque el otro 88 por ciento hizo exactamente lo mismo en los dos brazos. Por lo tanto:
efecto en los cumplidores = 0,300 punto ÷ 0,12 = más 2,500 puntos porcentuales.
Sobre una base del 6 por ciento, eso es un efecto relativo grande. Y fíjate en lo que pasó con la lectura: el resultado que apareció en la pantalla del panel fue un mísero más 5 por ciento relativo, al borde de la significancia. El efecto real, en quienes de hecho usaron, es ocho veces mayor. La dilución es la regla número 2 de Kohavi, Deng, Longbotham y Xu, que registran que mejorar en 10 por ciento un segmento del 1 por ciento resulta en un impacto total de aproximadamente 0,1 por ciento.
| lectura | número | qué responde |
|---|---|---|
| intención de tratar | más 0,300 punto | cuánto vale mostrar el banner a todo el mundo |
| primera etapa | más 12,000 puntos | cuánto convence el banner |
| efecto en los cumplidores | más 2,500 puntos | cuánto vale usar la funcionalidad, para quien el banner convenció |
Las tres están bien y responden preguntas distintas. La primera es la que decide si el banner se queda publicado. La tercera es la que decide si vale la pena invertir en la funcionalidad.
Las cinco condiciones, y por qué solo una de ellas es gratis
Angrist, Imbens y Rubin organizaron la identificación en cinco suposiciones en el Journal of the American Statistical Association de 1996. Vale leer la lista pensando cuál de ellas ya garantiza tu sorteo:
| condición | qué exige | ¿lo garantiza el sorteo? |
|---|---|---|
| estabilidad de las unidades | la invitación de una persona no cambia el desenlace de otra | no, depende del producto |
| sorteo de la invitación | la invitación es independiente de los desenlaces potenciales | sí, es lo que compraste con el sorteo |
| restricción de exclusión | la invitación solo afecta el desenlace a través del uso | no, y no es verificable |
| primera etapa no nula | la invitación cambia la adhesión en promedio | sí, y es medible |
| monotonicidad | nadie deja de usar por haber sido invitado | no, y rara vez se verifica |
El artículo es explícito sobre la fragilidad: la restricción de exclusión relaciona cantidades que nunca pueden observarse juntas, y por eso no es directamente verificable a partir de los datos en mano. Y la advertencia que más importa a quien diseña el estímulo: en general el estimador es más sensible a violaciones de la restricción de exclusión y de la monotonicidad cuando hay pocos cumplidores.
Guarda esa frase. Es la guía de proyecto del diseño entero.
Dónde muere el estímulo: la fuga de la propia invitación
Un banner no es un objeto neutro. Ocupa espacio, explica, crea urgencia, a veces estorba. Cualquier efecto suyo sobre la conversión que no pase por el uso del informe es fuga, y la proposición 2 del artículo de 1996 da el tamaño exacto del estrago: el sesgo del estimador respecto al efecto en los cumplidores es el efecto directo medio de la invitación sobre los no cumplidores multiplicado por la razón de probabilidades de no adherir.
Con adhesión adicional de 12 puntos, la razón de probabilidades de no adherir es 0,88 dividido por 0,12, es decir, 7,33. Cada centésimo de punto que el banner mueve por fuera de la funcionalidad se multiplica por 7,33. Fijando un efecto real de 2,500 puntos en los cumplidores, la tabla queda así:
| efecto directo de la invitación | adhesión 40 puntos | adhesión 20 puntos | adhesión 12 puntos | adhesión 6 puntos |
|---|---|---|---|---|
| 0,02 punto | 0,030 (1,2% del efecto) | 0,080 (3,2%) | 0,147 (5,9%) | 0,313 (12,5%) |
| 0,05 punto | 0,075 (3,0%) | 0,200 (8,0%) | 0,367 (14,7%) | 0,783 (31,3%) |
| 0,10 punto | 0,150 (6,0%) | 0,400 (16,0%) | 0,733 (29,3%) | 1,567 (62,7%) |
| 0,20 punto | 0,300 (12,0%) | 0,800 (32,0%) | 1,467 (58,7%) | 3,133 (125,3%) |
La conclusión de proyecto sale sola: una invitación débil es doblemente mala. Produce una primera etapa pequeña, lo que amplifica cualquier fuga, y además obliga a correr el test con mucha más gente, como muestra la próxima sección. Vale más diseñar un estímulo fuerte y quirúrgico, que empuje bastante hacia el uso y haga lo mínimo posible de cualquier otra cosa.
El precio en muestra del diseño de estímulo
El efecto que necesitas detectar en la pantalla no es el efecto real. Es el efecto real diluido por la fracción de gente que la invitación convence. Con base del 6 por ciento y efecto real de 2,5 puntos en los cumplidores, esta es la cuenta, hecha en la fórmula de dos proporciones con 95 por ciento de confianza y 80 por ciento de poder:
| adhesión adicional | efecto visible en pantalla | muestra por variación | contra el sorteo directo |
|---|---|---|---|
| 40 puntos | 1,000 punto | 9.540 | 5,7 veces |
| 30 puntos | 0,750 punto | 16.656 | 9,9 veces |
| 20 puntos | 0,500 punto | 36.791 | 21,8 veces |
| 12 puntos | 0,300 punto | 100.670 | 59,6 veces |
| 6 puntos | 0,150 punto | 398.091 | 235,8 veces |
Sortear la funcionalidad directo, si fuera posible, pediría 1.688 personas por variación. Corre cualquiera de esas líneas en la calculadora de abajo con base del 6 por ciento y efecto mínimo absoluto igual a la columna del medio.
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
La regla práctica es dividir la muestra por el cuadrado de la adhesión adicional: con 12 puntos, eso da 1 dividido por 0,12 al cuadrado, es decir, 69,4 veces. La calculadora devuelve 59,6 veces porque la fórmula exacta tiene en cuenta que la varianza también cambia cuando cambia la tasa objetivo. La regla práctica se equivoca hacia arriba, que es la dirección segura para planificar. Si quieres ver ese mismo efecto en el calendario, la calculadora de duración convierte la muestra en días con tu tráfico semanal.
La invitación elige la población, y la población elige la respuesta
El número que sale del diseño no es el efecto de la funcionalidad en tu base. Es el efecto de la funcionalidad en quienes esa invitación específica logró convencer. Cambia la invitación y cambias a las personas.
En la práctica eso se convierte en una elección de proyecto bien concreta:
- descuento como invitación convence a quien es sensible al precio. El efecto medido es el efecto de la funcionalidad en esa gente, que suele convertir distinto del resto.
- correo educativo convence a quien no sabía que la funcionalidad existía. Población más parecida al promedio, efecto generalmente más transportable.
- llamada del equipo de ventas convence a cuentas grandes y comprometidas. Es la punta de la base, y el número que sale no describe la cola.
- acceso anticipado por lista de espera convence a quien ya quería y estaba esperando. La población más motivada posible, y la estimación más optimista posible.
Elige el estímulo que se parezca a la palanca que pretendes accionar después de la decisión. Si la decisión será mandar un correo a la base entera, estimula por correo. Medir con descuento y después actuar con correo es cambiar de población a mitad de camino.
Cómo verificar antes de creer
Ninguna de las premisas es verificable, pero todas tienen síntomas. Tres verificaciones que caben en el mismo día de análisis:
- Primera etapa, con intervalo. Si el intervalo de confianza de la adhesión adicional cruza cero o se acerca, detente aquí. La división por un número pequeño e incierto produce estimaciones inestables, el problema clásico de instrumento débil que Imbens (2014) describe como la preocupación central de la literatura econométrica sobre el tema.
- Efecto directo donde no debería existir. Separa a quienes ya usaban la funcionalidad antes del experimento, o a quienes no tenían acceso técnico a ella. En esas personas, el uso no pudo haber cambiado. Si su conversión se mueve con la invitación, encontraste la fuga.
- Desistimiento. Compara el uso de la funcionalidad entre quienes fueron invitados y quienes no dentro de segmentos que ya usaban bastante. Si la invitación derrumba el uso en algún lugar, la monotonicidad está rota y el cálculo pierde la interpretación.
Vale agregar una cuarta, que es de higiene y no de premisa: corre la prueba de proporción de muestra en los dos brazos antes de cualquier lectura. Un diseño de estímulo con reparto desigual esconde el problema mejor que un test común, porque la atención queda toda en la adhesión.
Un guion de siete pasos
- Escribe la pregunta en la forma correcta. “¿Usar el informe aumenta la conversión?” es la pregunta causal. “¿Quien usa el informe convierte más?” es una correlación y no necesita experimento alguno para responderse, ni sirve para decidir nada.
- Confirma que el sorteo directo está descartado. Escribe el motivo: contrato, remoción de valor, dependencia de una acción del usuario. Si el motivo es solo “da trabajo”, vuelve y sortea, porque el diseño indirecto cuesta decenas de veces más gente.
- Elige la invitación por la palanca, no por la conveniencia. El estímulo define la población medida. Prefiere la invitación más parecida a la acción que la empresa tomará después de la decisión.
- Estima la primera etapa antes de correr. Un piloto pequeño, o el histórico de campañas parecidas, ya da el orden de magnitud. Con ese número y el efecto que valdría la pena detectar, la tabla de muestra de arriba dice si el test cabe en tu tráfico.
- Instrumenta tres eventos separados. Asignación al brazo, exposición a la invitación y uso de la funcionalidad, cada uno con sello de tiempo propio. Sin esa separación, el análisis es imposible después.
- Lee en este orden: proporción de muestra, primera etapa, intención de tratar, efecto en los cumplidores. Si cualquiera de los tres primeros falla, el cuarto ni debe calcularse.
- Reporta los tres números juntos. El efecto de intención de tratar decide el destino de la invitación. La primera etapa explica el tamaño del efecto. El efecto en los cumplidores decide el destino de la funcionalidad. Publicar solo el tercero es la forma más rápida de que la dirección se decepcione después con un lanzamiento que no movió la línea del negocio.
Errores comunes
- Reportar el efecto en los cumplidores como si fuera el efecto en la base. Son cosas distintas por construcción, y la segunda es lo que el negocio siente. Reporta las dos, siempre lado a lado.
- Comparar invitados que usaron contra no invitados que no usaron. Eso destruye el sorteo: acabas de volver a la comparación observacional que el diseño existía para evitar.
- Aceptar una primera etapa pequeña porque el valor p del desenlace salió bonito. El orden es inverso: la primera etapa decide si la cuenta puede hacerse.
- Cambiar la invitación a mitad del test. Cada invitación define su propia población de cumplidores. Cambiar el estímulo es empezar otro experimento.
- Olvidar que la invitación sigue publicada después. Si el banner se quedó, el efecto que la empresa va a cosechar es el de intención de tratar, no el de los cumplidores.
- Usar el estímulo cuando se podía sortear. Es el error más caro de esta lista, y el más común. Antes de irte al diseño indirecto, comprueba con la calculadora de tamaño de muestra si el sorteo directo cabía en tu tráfico.
Hazlo automático en Donnu
El diseño de estímulo exige guardar tres eventos separados, con sello de tiempo, sin mezclarlos: la asignación al brazo, la exposición a la invitación y el uso de la funcionalidad. Cuando la base solo tiene una columna que dice que la persona usó, no hay manera de reconstruir la primera etapa, y el análisis entero queda imposible después del hecho.
Donnu separa la asignación del evento de exposición y del evento de uso por defecto, lo que deja las tres lecturas de la tabla de arriba disponibles en la misma pantalla, sin consulta manual. Y existe primero para el caso simple: siempre que la funcionalidad pueda sortearse, sortea, porque eso hace innecesarias la restricción de exclusión y la monotonicidad enteras. La calculadora de significancia cierra la lectura de la primera etapa y del desenlace con los mismos números que pegarías a mano.
Referencias
- Angrist, J. D., Imbens, G. W. y Rubin, D. B. Identification of Causal Effects Using Instrumental Variables. Journal of the American Statistical Association, volumen 91, número 434, junio de 1996, páginas 444 a 455. Fuente de las cinco suposiciones numeradas en el artículo (estabilidad de las unidades, sorteo del instrumento, restricción de exclusión, efecto causal medio no nulo del instrumento sobre el tratamiento y monotonicidad); del registro de que la restricción de exclusión relaciona cantidades que nunca pueden observarse conjuntamente y por eso no es directamente verificable a partir de los datos en mano; de la afirmación de que el efecto medio local no es el efecto medio ni para la población entera ni para ninguna subpoblación identificable a partir de los valores observados; de la proposición 2, según la cual el sesgo del estimador respecto al efecto medio local es el efecto directo medio del instrumento sobre los no cumplidores multiplicado por la razón de probabilidades de no adherir; y de la observación de que el estimador es más sensible a violaciones de la restricción de exclusión y de la monotonicidad cuando hay pocos cumplidores. uio.no.
- Imbens, G. W. Instrumental Variables: An Econometrician’s Perspective. Statistical Science, 2014 (arXiv 1410.0163). Fuente de la atribución del origen de los diseños de estímulo a los trabajos de Zelen de 1979 y 1990, fuera de la tradición econométrica de variables instrumentales; y de la descripción del problema de instrumento débil, en el que la correlación entre instrumento y tratamiento necesita ser sustancial para permitir inferencia precisa, con referencia a Staiger y Stock (1997) y Andrews y Stock (2007). arxiv.org.
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Fuente de la regla de que las métricas deben diluirse por el tamaño del segmento afectado, con el ejemplo de una mejora del 10 por ciento en un segmento del 1 por ciento resultando en un impacto total de aproximadamente 0,1 por ciento, y del registro de que en sitios como Bing los experimentos exitosos mueven métricas clave entre 0,1 y 1,0 por ciento después de diluidos. exp-platform.com.
Lee también: Intención de tratar · Puntaje de propensión · Análisis por disparo y dilución · Unidad de aleatorización · Calculadora de tamaño de muestra · Leer en portugués
Preguntas frecuentes
- ¿Qué es un diseño de estímulo?
- Es un experimento en el que sorteas la invitación a usar algo, y no el uso en sí. Sirve para el caso en que la funcionalidad no puede apagarse para la mitad de las personas, sea por contrato, por regla de producto o porque ya está publicada. El sorteo recae sobre el banner, el correo, el descuento o la llamada del equipo de ventas, y el uso se vuelve consecuencia de la persona, no del experimento. Imbens (2014) atribuye el origen del diseño a los trabajos de Zelen, de 1979 y 1990.
- ¿Qué mide exactamente un diseño de estímulo?
- Mide dos cosas. La primera es el efecto de la invitación sobre todos los sorteados, que es la intención de tratar, y esa medida es honesta por construcción. La segunda es el efecto del uso sobre quienes solo usaron porque fueron invitados, los llamados cumplidores, y sale de dividir el efecto de intención de tratar en el desenlace por el efecto de intención de tratar en la adhesión. En el ejemplo de esta guía, más 0,30 punto porcentual dividido por 12 puntos de adhesión adicional devuelve más 2,50 puntos en los cumplidores.
- ¿Cuánto cuesta en muestra correr un estímulo en vez de sortear la funcionalidad?
- Mucho. El efecto real queda diluido por la fracción de gente que la invitación convence. Con base del 6 por ciento y un efecto real de 2,5 puntos en los cumplidores, sortear la funcionalidad directo pide 1.688 personas por variación; estimular con una invitación que mueve la adopción en 12 puntos pide 100.670 por variación, casi 60 veces más. La regla práctica es dividir por el cuadrado de la adhesión adicional.
- ¿Cuál es la premisa más frágil de este diseño?
- La restricción de exclusión: la invitación no puede afectar el desenlace por ningún camino que no sea el uso. Un banner que además enseña, apura o irrita viola eso. Angrist, Imbens y Rubin (1996) muestran que el sesgo resultante es el efecto directo medio de la invitación sobre quienes no adhirieron multiplicado por la razón de probabilidades de no adherir, es decir, una fuga minúscula se vuelve un error enorme cuando poca gente adhiere.
- ¿Dos estímulos distintos pueden dar respuestas distintas y ambas estar bien?
- Sí, y eso no es contradicción. Cada invitación define su propio grupo de cumplidores. Un descuento convence a quien es sensible al precio, un correo educativo convence a quien no sabía que la funcionalidad existía, y el efecto del uso en esas dos poblaciones no tiene ninguna obligación de ser igual. El número que sale es siempre local al estímulo que elegiste, y por eso el estímulo debe parecerse a la palanca que pretendes accionar después.
- ¿Cómo poner a prueba las premisas antes de creer en el número?
- Tres verificaciones. Primero, comprueba la primera etapa: si la invitación no mueve la adhesión de forma clara, detente, porque la división queda inestable. Segundo, busca efecto directo de la invitación en quienes no podían haber adherido, por ejemplo en quienes ya usaban la funcionalidad antes o en quienes no tenían acceso a ella. Tercero, mira si alguien desiste a causa de la invitación, lo que rompe la monotonicidad. Ninguna de las tres prueba la premisa, pero las tres encuentran violaciones grandes.