Estadística

Diseño de Estímulo: sortear la invitación, medir el uso

Cuando la funcionalidad no puede apagarse, se sortea la invitación. Qué mide el diseño de estímulo, cuánto cuesta en muestra y dónde se rompe.

Ilustración plana de una puerta abierta con un cartel al lado y una fila de figuras caminando, algunas entrando por la puerta y otras siguiendo de largo

Cuando la funcionalidad no puede apagarse, lo que queda es sortear la invitación. En el ejemplo de esta guía, un banner sorteado movió la adopción de 8 a 20 por ciento y la conversión de 6,000 a 6,300 por ciento, con valor p 0,0306. Esos 0,30 punto divididos por los 12 puntos de adhesión adicional devuelven más 2,50 puntos en los cumplidores, y el precio de esa cuenta es correr el test con casi 60 veces más gente que si la funcionalidad hubiera podido sortearse directo. El diseño de estímulo es la salida legítima cuando el tratamiento está fuera de tu control, y cobra caro en muestra y en premisas. Esta guía muestra la cuenta completa, el costo, y el punto exacto en el que el diseño se rompe. Forma parte de nuestra guía completa de test A/B y es el lado del diseño del análisis que describimos en intención de tratar.

El problema: la funcionalidad no puede apagarse

El test A/B común sortea justo la cosa que quieres medir. La mitad ve el botón nuevo, la mitad ve el viejo, y la diferencia es el efecto del botón. Existe una clase entera de preguntas en las que eso simplemente no está disponible:

En esos casos, la comparación obvia es entre quien usó y quien no usó, y está sesgada por los mismos motivos que describimos en puntaje de propensión: quien adopta es distinto de quien no adopta, y la diferencia entre las personas entra entera en el resultado.

El diseño de estímulo resuelve eso cambiando el objeto del sorteo. No sorteas el uso. Sorteas la invitación a usar, que es algo que controlas por completo. El sorteo vuelve a existir, y con él vuelve la garantía de que los dos grupos son iguales al comienzo.

El diseño de estímulo: sortea la invitación, mide el uso

La estructura tiene tres variables, y confundir las tres es el error más común del área:

variable qué es quién la controla ¿se sortea?
la invitación banner, correo, descuento, llamada, notificación tú sí, ese es el experimento
el uso la persona de hecho usó la funcionalidad la persona no, es consecuencia
el desenlace conversión, retención, ingresos la persona no, es lo que quieres explicar
El camino permitido y el camino prohibido en el diseño de estímuloDe izquierda a derecha: la invitación sorteada apunta al uso, y el uso apunta al desenlace. Una flecha punteada va directo de la invitación al desenlace y está marcada como prohibida, porque es la que rompe la restricción de exclusión.invitaciónsorteada por tiusoelección de la personadesenlacelo que importaprimera etapalo que quiereseste camino no puede existirsi la invitación mueve el desenlace sin pasar por el uso,la cuenta entera deja de valer
El diseño entero depende de que la flecha punteada sea cero. No es observable, y por eso la elección de la invitación es una decisión estadística, no de diseño gráfico.

Lo que mides directamente son dos efectos de intención de tratar, uno en el uso y otro en el desenlace, y los dos son honestos porque la invitación fue sorteada. Lo que quieres es el efecto del uso sobre el desenlace, y ese no se mide, se deduce.

Ejemplo trabajado: el banner que movió la adopción en 12 puntos

Un producto tiene una funcionalidad de informe automático que ya está publicada. Nadie autoriza apagarla. La pregunta es si usar el informe aumenta la conversión al plan pago. El equipo sortea 120.000 usuarios en dos brazos y muestra un banner de invitación a la mitad.

medida sin banner con banner diferencia valor p
usaron el informe (primera etapa) 4.800 de 60.000 = 8,000% 12.000 de 60.000 = 20,000% más 12,000 puntos menor que 0,0001
convirtieron (intención de tratar) 3.600 de 60.000 = 6,000% 3.780 de 60.000 = 6,300% más 0,300 punto 0,0306

Pega las dos líneas en la calculadora de abajo y comprueba las tasas, la mejora relativa, el valor p y el intervalo. La primera línea sale con valor p menor que 0,0001 e intervalo de confianza del 95 por ciento entre más 11,6133 y más 12,3867 puntos. La segunda sale con valor p 0,0306 e intervalo entre más 0,0281 y más 0,5719 punto. La calculadora redondea el intervalo a un decimal y no muestra el z, que es el paso intermedio del test: vale 59,9002 en la primera línea y 2,1629 en la segunda.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Ahora la cuenta que importa. La invitación convenció al 12 por ciento de la población de usar el informe: 20 menos 8. Todo el efecto de 0,30 punto en el desenlace tiene que haber venido de esas personas, porque el otro 88 por ciento hizo exactamente lo mismo en los dos brazos. Por lo tanto:

efecto en los cumplidores = 0,300 punto ÷ 0,12 = más 2,500 puntos porcentuales.

Sobre una base del 6 por ciento, eso es un efecto relativo grande. Y fíjate en lo que pasó con la lectura: el resultado que apareció en la pantalla del panel fue un mísero más 5 por ciento relativo, al borde de la significancia. El efecto real, en quienes de hecho usaron, es ocho veces mayor. La dilución es la regla número 2 de Kohavi, Deng, Longbotham y Xu, que registran que mejorar en 10 por ciento un segmento del 1 por ciento resulta en un impacto total de aproximadamente 0,1 por ciento.

lectura número qué responde
intención de tratar más 0,300 punto cuánto vale mostrar el banner a todo el mundo
primera etapa más 12,000 puntos cuánto convence el banner
efecto en los cumplidores más 2,500 puntos cuánto vale usar la funcionalidad, para quien el banner convenció

Las tres están bien y responden preguntas distintas. La primera es la que decide si el banner se queda publicado. La tercera es la que decide si vale la pena invertir en la funcionalidad.

Las cinco condiciones, y por qué solo una de ellas es gratis

Angrist, Imbens y Rubin organizaron la identificación en cinco suposiciones en el Journal of the American Statistical Association de 1996. Vale leer la lista pensando cuál de ellas ya garantiza tu sorteo:

condición qué exige ¿lo garantiza el sorteo?
estabilidad de las unidades la invitación de una persona no cambia el desenlace de otra no, depende del producto
sorteo de la invitación la invitación es independiente de los desenlaces potenciales sí, es lo que compraste con el sorteo
restricción de exclusión la invitación solo afecta el desenlace a través del uso no, y no es verificable
primera etapa no nula la invitación cambia la adhesión en promedio sí, y es medible
monotonicidad nadie deja de usar por haber sido invitado no, y rara vez se verifica

El artículo es explícito sobre la fragilidad: la restricción de exclusión relaciona cantidades que nunca pueden observarse juntas, y por eso no es directamente verificable a partir de los datos en mano. Y la advertencia que más importa a quien diseña el estímulo: en general el estimador es más sensible a violaciones de la restricción de exclusión y de la monotonicidad cuando hay pocos cumplidores.

Guarda esa frase. Es la guía de proyecto del diseño entero.

Dónde muere el estímulo: la fuga de la propia invitación

Un banner no es un objeto neutro. Ocupa espacio, explica, crea urgencia, a veces estorba. Cualquier efecto suyo sobre la conversión que no pase por el uso del informe es fuga, y la proposición 2 del artículo de 1996 da el tamaño exacto del estrago: el sesgo del estimador respecto al efecto en los cumplidores es el efecto directo medio de la invitación sobre los no cumplidores multiplicado por la razón de probabilidades de no adherir.

Con adhesión adicional de 12 puntos, la razón de probabilidades de no adherir es 0,88 dividido por 0,12, es decir, 7,33. Cada centésimo de punto que el banner mueve por fuera de la funcionalidad se multiplica por 7,33. Fijando un efecto real de 2,500 puntos en los cumplidores, la tabla queda así:

efecto directo de la invitación adhesión 40 puntos adhesión 20 puntos adhesión 12 puntos adhesión 6 puntos
0,02 punto 0,030 (1,2% del efecto) 0,080 (3,2%) 0,147 (5,9%) 0,313 (12,5%)
0,05 punto 0,075 (3,0%) 0,200 (8,0%) 0,367 (14,7%) 0,783 (31,3%)
0,10 punto 0,150 (6,0%) 0,400 (16,0%) 0,733 (29,3%) 1,567 (62,7%)
0,20 punto 0,300 (12,0%) 0,800 (32,0%) 1,467 (58,7%) 3,133 (125,3%)
Sesgo en puntos porcentuales a medida que cae la adhesión adicionalCuatro curvas muestran el sesgo del estimador para efectos directos de la invitación de 0,02, 0,05, 0,10 y 0,20 punto. Todas suben despacio mientras la adhesión es alta y se disparan cuando la adhesión cae por debajo de diez puntos. Una línea horizontal punteada marca el efecto real de 2,5 puntos.3,0 pp2,0 pp1,0 pp040 pp20 pp12 pp6 ppadhesión adicional que produce la invitaciónefecto real: 2,5 pp0,020,050,100,20efecto directo de la invitación, en puntos
La misma fuga minúscula es inofensiva con adhesión alta y destruye la estimación con adhesión baja. Una invitación débil no solo es cara, es frágil.

La conclusión de proyecto sale sola: una invitación débil es doblemente mala. Produce una primera etapa pequeña, lo que amplifica cualquier fuga, y además obliga a correr el test con mucha más gente, como muestra la próxima sección. Vale más diseñar un estímulo fuerte y quirúrgico, que empuje bastante hacia el uso y haga lo mínimo posible de cualquier otra cosa.

El precio en muestra del diseño de estímulo

El efecto que necesitas detectar en la pantalla no es el efecto real. Es el efecto real diluido por la fracción de gente que la invitación convence. Con base del 6 por ciento y efecto real de 2,5 puntos en los cumplidores, esta es la cuenta, hecha en la fórmula de dos proporciones con 95 por ciento de confianza y 80 por ciento de poder:

adhesión adicional efecto visible en pantalla muestra por variación contra el sorteo directo
40 puntos 1,000 punto 9.540 5,7 veces
30 puntos 0,750 punto 16.656 9,9 veces
20 puntos 0,500 punto 36.791 21,8 veces
12 puntos 0,300 punto 100.670 59,6 veces
6 puntos 0,150 punto 398.091 235,8 veces

Sortear la funcionalidad directo, si fuera posible, pediría 1.688 personas por variación. Corre cualquiera de esas líneas en la calculadora de abajo con base del 6 por ciento y efecto mínimo absoluto igual a la columna del medio.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La regla práctica es dividir la muestra por el cuadrado de la adhesión adicional: con 12 puntos, eso da 1 dividido por 0,12 al cuadrado, es decir, 69,4 veces. La calculadora devuelve 59,6 veces porque la fórmula exacta tiene en cuenta que la varianza también cambia cuando cambia la tasa objetivo. La regla práctica se equivoca hacia arriba, que es la dirección segura para planificar. Si quieres ver ese mismo efecto en el calendario, la calculadora de duración convierte la muestra en días con tu tráfico semanal.

La invitación elige la población, y la población elige la respuesta

El número que sale del diseño no es el efecto de la funcionalidad en tu base. Es el efecto de la funcionalidad en quienes esa invitación específica logró convencer. Cambia la invitación y cambias a las personas.

Cuatro tipos de usuario frente a una invitaciónUna barra horizontal dividida en cuatro franjas de tamaños distintos: quien siempre usa, quien nunca usa, quien solo usa si lo invitan y quien desiste al ser invitado. Solo la tercera franja participa del cálculo, y la cuarta tiene que estar vacía.100% de la base sorteadasiempre usanunca usacumplidor12%usaría con o sin la invitación:la invitación no le cambia nadano usa de ninguna manera:tampoco contribuyesolo usó porque fue invitado:es la única franja medidacuarta franja: quien dejaría de usar por haber sido invitadola monotonicidad exige que esté vacía. Un banner intrusivo y un descuento que señala baja calidad son las causas más comunes de que no lo esté.
Ninguna de esas franjas es observable a nivel individual: no sabes de quién es cada fila de la base. Solo el tamaño de la tercera es identificable, y es exactamente la primera etapa.

En la práctica eso se convierte en una elección de proyecto bien concreta:

Elige el estímulo que se parezca a la palanca que pretendes accionar después de la decisión. Si la decisión será mandar un correo a la base entera, estimula por correo. Medir con descuento y después actuar con correo es cambiar de población a mitad de camino.

Cómo verificar antes de creer

Ninguna de las premisas es verificable, pero todas tienen síntomas. Tres verificaciones que caben en el mismo día de análisis:

  1. Primera etapa, con intervalo. Si el intervalo de confianza de la adhesión adicional cruza cero o se acerca, detente aquí. La división por un número pequeño e incierto produce estimaciones inestables, el problema clásico de instrumento débil que Imbens (2014) describe como la preocupación central de la literatura econométrica sobre el tema.
  2. Efecto directo donde no debería existir. Separa a quienes ya usaban la funcionalidad antes del experimento, o a quienes no tenían acceso técnico a ella. En esas personas, el uso no pudo haber cambiado. Si su conversión se mueve con la invitación, encontraste la fuga.
  3. Desistimiento. Compara el uso de la funcionalidad entre quienes fueron invitados y quienes no dentro de segmentos que ya usaban bastante. Si la invitación derrumba el uso en algún lugar, la monotonicidad está rota y el cálculo pierde la interpretación.

Vale agregar una cuarta, que es de higiene y no de premisa: corre la prueba de proporción de muestra en los dos brazos antes de cualquier lectura. Un diseño de estímulo con reparto desigual esconde el problema mejor que un test común, porque la atención queda toda en la adhesión.

Un guion de siete pasos

  1. Escribe la pregunta en la forma correcta. “¿Usar el informe aumenta la conversión?” es la pregunta causal. “¿Quien usa el informe convierte más?” es una correlación y no necesita experimento alguno para responderse, ni sirve para decidir nada.
  2. Confirma que el sorteo directo está descartado. Escribe el motivo: contrato, remoción de valor, dependencia de una acción del usuario. Si el motivo es solo “da trabajo”, vuelve y sortea, porque el diseño indirecto cuesta decenas de veces más gente.
  3. Elige la invitación por la palanca, no por la conveniencia. El estímulo define la población medida. Prefiere la invitación más parecida a la acción que la empresa tomará después de la decisión.
  4. Estima la primera etapa antes de correr. Un piloto pequeño, o el histórico de campañas parecidas, ya da el orden de magnitud. Con ese número y el efecto que valdría la pena detectar, la tabla de muestra de arriba dice si el test cabe en tu tráfico.
  5. Instrumenta tres eventos separados. Asignación al brazo, exposición a la invitación y uso de la funcionalidad, cada uno con sello de tiempo propio. Sin esa separación, el análisis es imposible después.
  6. Lee en este orden: proporción de muestra, primera etapa, intención de tratar, efecto en los cumplidores. Si cualquiera de los tres primeros falla, el cuarto ni debe calcularse.
  7. Reporta los tres números juntos. El efecto de intención de tratar decide el destino de la invitación. La primera etapa explica el tamaño del efecto. El efecto en los cumplidores decide el destino de la funcionalidad. Publicar solo el tercero es la forma más rápida de que la dirección se decepcione después con un lanzamiento que no movió la línea del negocio.

Errores comunes

Hazlo automático en Donnu

El diseño de estímulo exige guardar tres eventos separados, con sello de tiempo, sin mezclarlos: la asignación al brazo, la exposición a la invitación y el uso de la funcionalidad. Cuando la base solo tiene una columna que dice que la persona usó, no hay manera de reconstruir la primera etapa, y el análisis entero queda imposible después del hecho.

Donnu separa la asignación del evento de exposición y del evento de uso por defecto, lo que deja las tres lecturas de la tabla de arriba disponibles en la misma pantalla, sin consulta manual. Y existe primero para el caso simple: siempre que la funcionalidad pueda sortearse, sortea, porque eso hace innecesarias la restricción de exclusión y la monotonicidad enteras. La calculadora de significancia cierra la lectura de la primera etapa y del desenlace con los mismos números que pegarías a mano.

Referencias

Lee también: Intención de tratar · Puntaje de propensión · Análisis por disparo y dilución · Unidad de aleatorización · Calculadora de tamaño de muestra · Leer en portugués

Preguntas frecuentes

¿Qué es un diseño de estímulo?
Es un experimento en el que sorteas la invitación a usar algo, y no el uso en sí. Sirve para el caso en que la funcionalidad no puede apagarse para la mitad de las personas, sea por contrato, por regla de producto o porque ya está publicada. El sorteo recae sobre el banner, el correo, el descuento o la llamada del equipo de ventas, y el uso se vuelve consecuencia de la persona, no del experimento. Imbens (2014) atribuye el origen del diseño a los trabajos de Zelen, de 1979 y 1990.
¿Qué mide exactamente un diseño de estímulo?
Mide dos cosas. La primera es el efecto de la invitación sobre todos los sorteados, que es la intención de tratar, y esa medida es honesta por construcción. La segunda es el efecto del uso sobre quienes solo usaron porque fueron invitados, los llamados cumplidores, y sale de dividir el efecto de intención de tratar en el desenlace por el efecto de intención de tratar en la adhesión. En el ejemplo de esta guía, más 0,30 punto porcentual dividido por 12 puntos de adhesión adicional devuelve más 2,50 puntos en los cumplidores.
¿Cuánto cuesta en muestra correr un estímulo en vez de sortear la funcionalidad?
Mucho. El efecto real queda diluido por la fracción de gente que la invitación convence. Con base del 6 por ciento y un efecto real de 2,5 puntos en los cumplidores, sortear la funcionalidad directo pide 1.688 personas por variación; estimular con una invitación que mueve la adopción en 12 puntos pide 100.670 por variación, casi 60 veces más. La regla práctica es dividir por el cuadrado de la adhesión adicional.
¿Cuál es la premisa más frágil de este diseño?
La restricción de exclusión: la invitación no puede afectar el desenlace por ningún camino que no sea el uso. Un banner que además enseña, apura o irrita viola eso. Angrist, Imbens y Rubin (1996) muestran que el sesgo resultante es el efecto directo medio de la invitación sobre quienes no adhirieron multiplicado por la razón de probabilidades de no adherir, es decir, una fuga minúscula se vuelve un error enorme cuando poca gente adhiere.
¿Dos estímulos distintos pueden dar respuestas distintas y ambas estar bien?
Sí, y eso no es contradicción. Cada invitación define su propio grupo de cumplidores. Un descuento convence a quien es sensible al precio, un correo educativo convence a quien no sabía que la funcionalidad existía, y el efecto del uso en esas dos poblaciones no tiene ninguna obligación de ser igual. El número que sale es siempre local al estímulo que elegiste, y por eso el estímulo debe parecerse a la palanca que pretendes accionar después.
¿Cómo poner a prueba las premisas antes de creer en el número?
Tres verificaciones. Primero, comprueba la primera etapa: si la invitación no mueve la adhesión de forma clara, detente, porque la división queda inestable. Segundo, busca efecto directo de la invitación en quienes no podían haber adherido, por ejemplo en quienes ya usaban la funcionalidad antes o en quienes no tenían acceso a ella. Tercero, mira si alguien desiste a causa de la invitación, lo que rompe la monotonicidad. Ninguna de las tres prueba la premisa, pero las tres encuentran violaciones grandes.