Estadística

Efecto Heterogéneo por Segmento en Test A/B

Efecto heterogéneo por segmento: significativo en móvil y nulo en escritorio no prueba que el efecto difiera. El test de interacción y el cálculo correcto.

Ilustración plana de una barra ancha que se abre en cuatro barras finas de longitudes diferentes repartidas en ángulos distintos, con una línea discontinua en medio del abanico, en verde profundo y verde menta

Un efecto significativo en móvil y nulo en escritorio no prueba que el efecto difiera por dispositivo. Para afirmarlo hay que testear la diferencia entre los dos efectos directamente, y ese test siempre es más ruidoso que cualquiera de los dos: en el ejemplo trabajado de este artículo, el efecto en móvil tiene valor p de 0,006 y la diferencia entre móvil y escritorio tiene valor p de 0,219. Esta guía cubre cómo afirmar un efecto heterogéneo con rigor: el cálculo correcto de la diferencia de diferencias, por qué exige aproximadamente 5 veces más muestra en el caso trabajado, el techo teórico de 16 veces de Gelman, y cómo buscar segmentos en los datos sin invalidar el intervalo de confianza. Forma parte de nuestra guía completa de test A/B y es el complemento operativo del plan de análisis preregistrado.

La media es una decisión, no una descripción

Todo test A/B reporta un número por métrica, y ese número es el efecto medio de tratamiento sobre la población que entró en el experimento. Es una estadística legítima y es la que sustenta la decisión de lanzar. Lo que no es: una descripción de lo que le pasó a cada usuario.

El mismo efecto medio de medio punto porcentual puede venir de tres mundos completamente diferentes:

La decisión de lanzar puede ser la misma en los tres casos (el agregado es positivo), pero la decisión sobre qué hacer a continuación es radicalmente diferente. Y ahí es donde entra el panel de segmentos, casi siempre por la puerta equivocada.

Tres distribuciones de efecto con la misma mediaTres paneles uno al lado del otro, cada uno mostrando barras de efecto por subgrupo con la misma media destacada por una línea discontinua. En el primer panel, todas las barras tienen la misma altura, el efecto es homogéneo. En el segundo, la mitad de las barras tiene el doble de la altura media y la mitad tiene altura cero. En el tercero, un tercio de las barras es bastante alto y dos tercios apuntan hacia abajo, por debajo del eje. La línea discontinua de la media está a la misma altura en los tres paneles.La misma media, tres realidades. El informe por defecto muestra solo la línea discontinua.efecto homogéneoLanzar y seguir. Nada que segmentar.la mitad respondeLanzar, e investigar quién no respondió.efectos opuestosLanzar perjudica a la mayoríapara beneficiar a una minoría.La línea discontinua naranja es idéntica en los tres. Es la que el test A/B reporta por defecto.Descubrir en cuál de los tres estás es una pregunta aparte, con exigencia de muestra propia.
El tercer panel es el caso que duele: el test gana, el lanzamiento ocurre, y la mayoría de los usuarios empeora. Solo aparece si alguien va a buscarlo, y buscar tiene costo estadístico.

Ejemplo trabajado: el test gana y alguien quiere lanzar solo en móvil

Una tienda ejecuta un test con 60.000 usuarios por brazo repartidos en cuatro dispositivos. Pega cualquier fila en la calculadora para reproducir los números.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

segmento A (conv./visitantes) B (conv./visitantes) tasa A tasa B efecto z valor p
Móvil 1.500 / 30.000 1.650 / 30.000 5,00% 5,50% +0,500pp 2,7457 0,006039
Escritorio 1.260 / 18.000 1.278 / 18.000 7,00% 7,10% +0,100pp 0,3706 0,710938
Tablet 300 / 6.000 306 / 6.000 5,00% 5,10% +0,100pp 0,2501 0,802486
App 420 / 6.000 414 / 6.000 7,00% 6,90% -0,100pp -0,2154 0,829469
Total 3.480 / 60.000 3.648 / 60.000 5,80% 6,08% +0,280pp 2,0517 0,040195

(Los cuatro segmentos suman exactamente 60.000 visitantes y 3.480 contra 3.648 conversiones, así que el total es aritméticamente consistente con las partes.)

El total es significativo: el test ganó. Y entonces llega la conclusión que parece obvia y no lo es: “la ganancia es toda de móvil, escritorio no reaccionó, así que lanzamos solo en móvil y nos ahorramos el trabajo en escritorio”.

Esa conclusión no está sustentada por los datos de arriba, y la razón es precisa.

La diferencia entre significativo y no significativo no es significativa

Gelman y Stern trataron exactamente esto en un artículo cuyo título es la propia tesis: la diferencia entre “significativo” y “no significativo” no es, ella misma, estadísticamente significativa. Dejan claro que no están haciendo la observación corriente de que cualquier umbral es arbitrario; la tesis es más fuerte: cambios grandes en el nivel de significancia pueden corresponder a cambios pequeños y no significativos en las cantidades subyacentes.

Su ejemplo teórico es de tres líneas. Dos estudios independientes con estimaciones y errores estándar de 25 más o menos 10 y 10 más o menos 10. El primero es significativo al nivel del 1 por ciento; el segundo no es nada significativo, quedando a apenas un error estándar de cero. Sería tentador concluir que hay una gran diferencia entre los dos. Solo que la diferencia estimada es 15, con error estándar igual a la raíz de 10 al cuadrado más 10 al cuadrado, es decir, la raíz de 200, que los autores redondean a cerca de 14. Eso da z de 1,0607 y valor p de 0,2888. No se acerca ni de lejos.

Los autores añaden un segundo caso que cierra el argumento por el otro lado: si un tercer estudio, con muestra mucho mayor, estima 2,5 con error estándar 1,0, alcanza el mismo nivel de significancia que el primero, y aun así la diferencia entre los dos es significativa. Comparar etiquetas de significancia no informa sobre las magnitudes.

El cálculo correcto: diferencia de diferencias

La pregunta “¿el efecto difiere entre móvil y escritorio?” tiene una estadística propia, y es la diferencia de diferencias.

Paso a paso, con los números del ejemplo:

  1. Efecto en móvil: 5,50% menos 5,00% igual a +0,500pp. Error estándar de la diferencia: raíz de 0,05 por 0,95 sobre 30.000, más 0,055 por 0,945 sobre 30.000, que da 0,18209pp.
  2. Efecto en escritorio: 7,10% menos 7,00% igual a +0,100pp. Error estándar: raíz de 0,07 por 0,93 sobre 18.000, más 0,071 por 0,929 sobre 18.000, que da 0,26983pp.
  3. Diferencia de diferencias: 0,500 menos 0,100 igual a +0,400pp.
  4. Error estándar de la diferencia de diferencias: raíz de 0,18209 al cuadrado más 0,26983 al cuadrado, que da 0,32553pp.
  5. Estadística de interacción: 0,400 dividido por 0,32553 igual a z de 1,2288, con valor p bilateral de 0,219158.
  6. Intervalo de confianza del 95 por ciento de la diferencia de diferencias: de -0,238pp a +1,038pp.

El intervalo contiene el cero con holgura, e incluso contiene valores negativos: los datos son compatibles con que el efecto sea mayor en escritorio que en móvil. La afirmación “el efecto es de móvil” no sobrevive a la propia aritmética que la sustentaría.

Efecto por segmento e intervalo de la diferencia entre segmentosGráfico de intervalos horizontales. Las dos primeras líneas muestran el efecto estimado en móvil, de más 0,5 punto porcentual con intervalo de 0,143 a 0,857, y en escritorio, de más 0,1 punto porcentual con intervalo de menos 0,429 a 0,629. Una línea vertical marca el cero. La tercera línea, destacada, muestra la diferencia entre los dos efectos, de más 0,4 punto porcentual con intervalo de menos 0,238 a más 1,038, que atraviesa el cero. Una nota indica que el intervalo de la diferencia es más ancho que el de cualquiera de los dos efectos aislados.El intervalo de la DIFERENCIA es más ancho que el de cualquier efecto aislado0-0,5pp+0,5pp+1,0ppmóvilp 0,006escritoriop 0,711diferenciaentre los dosp 0,219El intervalo de la diferencia atraviesa el cero y llega a valores negativos: el dato es compatible con un efecto mayor en escritorio.
Los dos primeros intervalos son los que aparecen en el panel de segmentos. El tercero es el único que responde a la pregunta que el equipo está haciendo, y es el que casi nunca se calcula.

Por qué la interacción cuesta tanta muestra

La raíz del problema está en la aritmética de los errores estándar, y es implacable.

El error estándar de la diferencia de diferencias combina la incertidumbre de los dos segmentos: en el ejemplo, 0,32553 contra 0,18209 del efecto de móvil solo, es decir, 1,7877 vez más ancho. Como la muestra necesaria escala con el cuadrado de la razón entre error estándar y efecto, eso solo ya multiplica la muestra por 3,20.

Y el efecto de interacción suele ser menor que el efecto principal. En el ejemplo, la diferencia de diferencias (0,400pp) vale 0,8 del efecto de móvil (0,500pp). Juntando los dos factores:

La muestra necesaria para la interacción, dividida por la muestra necesaria para el efecto principal, es igual al cuadrado de (1,7877 dividido por 0,8), que da 4,99.

Verificando por los números absolutos: para detectar el efecto de móvil (base 5,00% subiendo a 5,50%, es decir, +10% relativo) al 80 por ciento de poder hacen falta 31.234 usuarios por variación (es el resultado de la calculadora de tamaño de muestra con base 5%, MDE 10% relativo, 95% de confianza bilateral). Para detectar la diferencia de diferencias observada con el mismo poder harían falta cerca de 156 mil por celda, es decir, prácticamente 5 veces más. El test tenía 30.000 por celda en móvil: alcanzaba para leer el efecto, no alcanzaba para leer la diferencia.

Muestra por celda exigida por el efecto principal y por la interacciónComparación de dos barras horizontales. La barra del efecto principal representa cerca de 31 mil usuarios por variación, necesarios para detectar el efecto observado en móvil al 80 por ciento de poder. La barra de la interacción representa cerca de 156 mil por celda, necesarios para detectar la diferencia de diferencias observada con el mismo poder, aproximadamente cinco veces mayor. Debajo, dos factores explican la razón: el error estándar de la interacción es 1,79 vez mayor y el efecto de interacción vale 0,8 del efecto principal.La misma lectura, dos presupuestos de muestra completamente diferentesefecto principal (móvil)31.234 por variacióninteracción (móvil x escritorio)cerca de 156 mil por celda (4,99 veces más)de dónde viene el factor 4,99:error estándar 1,7877 vez mayorcombina la incertidumbre de los dos segmentos/efecto 0,8 vez el principal0,400pp de diferencia contra 0,500pp de efectoEl cociente entre los dos, elevado al cuadrado, es el multiplicador de muestra: (1,7877 dividido por 0,8) al cuadrado igual a 4,99.
El factor es 4,99 en este caso específico porque la interacción observada es grande en relación con el efecto principal. En escenarios más típicos es bastante mayor, como muestra la sección siguiente.

El factor 16 de Gelman y cuándo vale

El número de referencia de esta discusión viene de Gelman: bajo las suposiciones estándar sobre efectos principales e interacciones, hacen falta 16 veces la muestra para estimar una interacción en comparación con estimar un efecto principal.

Vale leer la suposición exacta, porque es donde vive todo el número. Con los predictores codificados como menos medio y más medio, el error estándar del efecto principal es 2 sigma sobre la raíz de N, y el del término de interacción es 4 sigma sobre la raíz de N, es decir, el doble. Si además la interacción vale la mitad del efecto principal, la razón entre efecto y error estándar cae por un factor de 4, y la muestra necesaria sube por 4 al cuadrado, es decir, 16.

Y el propio autor aclara qué significa “la mitad” ahí, en un punto que suele citarse mal: si el efecto principal del tratamiento es 0,6 y la interacción con el sexo es 0,3, entonces el efecto es 0,45 para un grupo y 0,75 para el otro. Si en cambio tenías en mente un efecto principal de 0,6 que es 0,3 en un grupo y 0,9 en el otro, entonces el factor necesario baja a 4 veces, no 16.

El ejemplo de este artículo está en ese segundo régimen, y por eso dio 4,99 y no 16: la diferencia de 0,400pp es grande en relación con el efecto medio. En un caso más típico, en el que la heterogeneidad es sutil, el factor sube rápido.

relación entre interacción y efecto principal factor de muestra (con error estándar 2 veces mayor)
la interacción vale lo mismo que el efecto principal 4 veces
la interacción vale 0,8 del efecto principal 6,25 veces
la interacción vale la mitad del efecto principal 16 veces
la interacción vale un tercio del efecto principal 36 veces
la interacción vale un cuarto del efecto principal 64 veces

Fíjate en que la tabla asume el error estándar exactamente 2 veces mayor, que es la suposición de Gelman. El caso trabajado de este artículo dio 4,99 y no 6,25 porque allí el error estándar de la interacción quedó 1,7877 vez mayor que el del efecto de móvil, y no 2 veces: los cuatro segmentos no tienen el mismo tamaño, así que la división no es la de cuatro celdas iguales que supone la fórmula de Gelman. Usa la tabla para orden de magnitud y el cálculo de la sección anterior para tu propio caso.

La advertencia práctica que Gelman deriva de esto es lo más importante de su texto: el plan habitual de diseñar el estudio enfocado en el efecto principal, quizás incluso preregistrando, y después ir a ver qué aparece en las interacciones es un problema serio. Y el peor caso es diseñar el estudio, no encontrar el efecto principal esperado, y usar las interacciones para salvarse. El problema no es solo que ese análisis sea exploratorio: es que esos datos son mucho más ruidosos de lo que uno percibe, así que lo que parece un hallazgo exploratorio interesante puede ser solo ruido.

Cómo buscar segmentos sin invalidar el intervalo

Si el test no fue dimensionado para interacción (casi nunca lo es) y aun así necesitas investigar heterogeneidad, existen tres caminos legítimos, en orden creciente de costo.

1. Predeclarar pocos segmentos, con corrección

Elige dos o tres cortes que la hipótesis del test realmente prevea que respondan diferente, escribe cuáles son en el plan de análisis antes de ejecutar, y aplica corrección de multiplicidad sobre ellos. Cuatro segmentos leídos al nivel del 5 por ciento ya dan 18,55 por ciento de probabilidad de al menos un falso positivo, y eso es lo que muchas métricas en un test trata en detalle.

Kohavi y coautores relatan que en la operación de Bing, para el análisis en rebanadas, educan a los experimentadores sobre falsos positivos y los incentivan a ajustar el umbral de probabilidad, enfocándose en señales fuertes y valores p menores, del orden de 0,0001. Es una regla mucho más dura que 0,05, y existe porque el eje de los segmentos es el que más crece sin control.

2. Estimación honesta: descubrir en una muestra, estimar en otra

Athey e Imbens proponen un método formal para el caso en el que quieres que el dato descubra los subgrupos, sin que eso invalide la inferencia. La idea central es la estimación honesta: una muestra se usa para construir la partición y otra, independiente, para estimar los efectos de tratamiento dentro de cada parte.

Describen el método como un complemento a los planes de análisis preregistrados, en los que el investigador tiene que comprometerse de antemano con los subgrupos que serán analizados: su enfoque permite que el dato descubra subgrupos relevantes sin caer en las preocupaciones de test múltiple que invalidarían los valores p.

El resultado empírico es lo que importa aquí. En un estudio de simulación, muestran que los métodos adaptativos (que usan los mismos datos para elegir el modelo y para estimar) tienen tasas de cobertura de intervalo de confianza sustancialmente por debajo de la nominal, mientras que los métodos honestos alcanzan la cobertura nominal en todos los diseños testeados. Son explícitos sobre el precio: la estimación honesta sacrifica algo de ajuste (la mitad de la muestra usada para descubrir no entra en la estimación) a cambio de intervalos de confianza válidos.

La traducción para un test A/B: si te sobra tráfico, separa la mitad de los usuarios para explorar cortes y la otra mitad para estimar el efecto en los cortes que encontró la primera mitad. Es la versión práctica y barata del mismo principio.

3. Ejecutar un test diseñado para la interacción

La alternativa más cara y más definitiva: ejecutarlo de nuevo, dimensionado para la diferencia que quieres detectar. Eso significa multiplicar la muestra por el factor de la tabla de arriba, o restringir el experimento al segmento de interés, lo que reduce el costo pero responde a una pregunta menor (“funciona en móvil”, no “funciona más en móvil”).

Efecto heterogéneo no es lo mismo que personalización

Confundir los dos es común y caro. Heterogeneidad es una afirmación estadística sobre el experimento: el efecto varió entre subgrupos, con incertidumbre declarada. Personalización es una decisión de producto: entregar experiencias diferentes a grupos diferentes.

Ir de una a la otra exige que tres cosas sean verdaderas al mismo tiempo, y la primera casi nunca se verifica:

  1. La heterogeneidad es real, es decir, el test de interacción sustenta la afirmación, no solo la comparación de etiquetas de significancia.
  2. El segmento es accionable en el momento de la decisión, es decir, sabes a qué grupo pertenece el usuario antes de servir la página, y no solo después.
  3. La ganancia de personalizar compensa el costo permanente de mantener dos caminos de producto, dos conjuntos de tests futuros y dos superficies de bugs.

La discusión completa de ese trade-off está en personalización versus test A/B. Y el caso patológico en el que la agregación por segmento invierte el signo del resultado está en la paradoja de Simpson en test A/B.

Checklist antes de afirmar que el efecto difiere

  1. ¿Calculaste la diferencia de diferencias, o solo comparaste dos valores p? Comparar etiquetas no es un test.
  2. ¿El intervalo de la diferencia excluye el cero? Si lo incluye, la afirmación es “no sé”, no “no difieren” ni “difieren”.
  3. ¿Los segmentos fueron declarados antes? Si no, el resultado es exploratorio y sale etiquetado como tal.
  4. ¿Cuántos cortes se testearon en total? El cálculo de multiplicidad usa el número de cortes intentados, no el número reportado.
  5. ¿El segmento se conoce antes de servir la variación? Si no, no sustenta una decisión de personalización.
  6. ¿La muestra por celda coincide con el factor de la tabla? Si el test tenía poder para el efecto principal, casi con certeza no lo tenía para la interacción.
  7. ¿Hay una ronda de confirmación prevista? La heterogeneidad hallada en los datos es una hipótesis, y una hipótesis se vuelve resultado en una segunda ronda.

Errores comunes

Hazlo automático en Donnu

El error caro aquí no es mirar segmentos, es que el panel de segmentos parezca una respuesta cuando es una pregunta. Cuatro filas, cuatro valores p, uno verde y tres grises, y nadie en la sala calcula la única estadística que sustentaría la decisión que se está tomando.

En Donnu, los cortes de segmento se declaran junto con la hipótesis, y cuando se comparan dos segmentos el informe muestra la diferencia de diferencias con su propio intervalo de confianza, no solo los dos efectos uno al lado del otro. Los segmentos no declarados aparecen en una pestaña separada, marcada como exploratoria, con el número de cortes ya testeados visible en pantalla. Si quieres rehacer cualquier fila a mano, la calculadora de significancia acepta los conteos brutos y la calculadora de tamaño de muestra muestra lo que exigiría cada celda.

Referencias

Lee también: Muchas métricas en un test A/B · Plan de análisis preregistrado · La paradoja de Simpson en test A/B · Personalización versus test A/B · La maldición del ganador · Calculadora de significancia · Leia em português

Preguntas frecuentes

¿Qué es un efecto heterogéneo de tratamiento?
Es cuando el efecto de un cambio no es el mismo para todos los usuarios: sube en un grupo, es neutro en otro y hasta puede caer en un tercero. El número que un test A/B reporta por defecto es el efecto medio sobre toda la población testeada, y esa media puede esconder efectos opuestos que se cancelan. Detectar heterogeneidad real es distinto de observar números diferentes entre segmentos, porque números diferentes aparecen por azar incluso cuando el efecto es idéntico en todos ellos.
Si el efecto es significativo en móvil y no en escritorio, ¿eso prueba que el efecto difiere?
No. Gelman y Stern muestran que la diferencia entre significativo y no significativo no es, ella misma, estadísticamente significativa. Su ejemplo canónico: un estudio con estimación 25 y error estándar 10 es significativo al 1 por ciento, otro con estimación 10 y error estándar 10 no es significativo; pero la diferencia entre los dos es 15 con error estándar igual a la raíz de 10 al cuadrado más 10 al cuadrado, es decir, 14, lo que no se acerca ni de lejos a ser significativo. Para afirmar que los segmentos difieren hay que testear la diferencia entre ellos directamente.
¿Cómo se testea la diferencia de efecto entre dos segmentos?
Por la diferencia de diferencias. Calcula el efecto absoluto del tratamiento en cada segmento, resta uno del otro, y calcula el error estándar de esa diferencia como la raíz de la suma de los cuadrados de los errores estándar de los dos efectos. El z del test de interacción es la diferencia de diferencias dividida por ese error estándar. Esa es la estadística que responde a la pregunta "el efecto es diferente entre los segmentos", y siempre es más ruidosa que cualquiera de los dos efectos aislados.
¿Por qué el test de interacción exige tanta muestra?
Por dos motivos que se suman. El efecto de interacción suele ser menor que el efecto principal, y su error estándar es mayor porque combina la incertidumbre de los dos segmentos. Gelman muestra que, bajo la suposición de que la interacción vale la mitad del efecto principal y el error estándar se duplica, hacen falta 16 veces la muestra para estimar la interacción con la misma precisión que el efecto principal. Si la interacción es del mismo tamaño que el efecto principal en vez de la mitad, el factor baja a 4.
¿Puedo buscar segmentos en los datos después de terminado el test?
Puedes, siempre que el resultado se etiquete como exploratorio y lleve a una ronda de confirmación. Cortar los datos de muchas maneras hasta que algo salga significativo es multiplicidad no declarada. Athey e Imbens proponen un camino formal para esto, la estimación honesta: una muestra se usa para descubrir la partición y otra, independiente, para estimar los efectos dentro de cada parte. Muestran que los métodos adaptativos, que usan los mismos datos para elegir y estimar, tienen cobertura de intervalo de confianza bastante por debajo de la nominal, mientras que el método honesto alcanza la cobertura nominal.
¿Cuál es la diferencia entre efecto heterogéneo y personalización?
La heterogeneidad es una afirmación estadística sobre el experimento que ejecutaste: el efecto varía entre subgrupos, y mediste esa variación con incertidumbre declarada. La personalización es una decisión de producto: entregar experiencias diferentes a grupos diferentes. Una no implica la otra. Heterogeneidad débil o no confirmada no justifica personalizar, porque el costo de mantener dos caminos de producto es real y permanente mientras la ganancia medida puede ser ruido.