Efecto Heterogéneo por Segmento en Test A/B
Efecto heterogéneo por segmento: significativo en móvil y nulo en escritorio no prueba que el efecto difiera. El test de interacción y el cálculo correcto.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Un efecto significativo en móvil y nulo en escritorio no prueba que el efecto difiera por dispositivo. Para afirmarlo hay que testear la diferencia entre los dos efectos directamente, y ese test siempre es más ruidoso que cualquiera de los dos: en el ejemplo trabajado de este artículo, el efecto en móvil tiene valor p de 0,006 y la diferencia entre móvil y escritorio tiene valor p de 0,219. Esta guía cubre cómo afirmar un efecto heterogéneo con rigor: el cálculo correcto de la diferencia de diferencias, por qué exige aproximadamente 5 veces más muestra en el caso trabajado, el techo teórico de 16 veces de Gelman, y cómo buscar segmentos en los datos sin invalidar el intervalo de confianza. Forma parte de nuestra guía completa de test A/B y es el complemento operativo del plan de análisis preregistrado.
La media es una decisión, no una descripción
Todo test A/B reporta un número por métrica, y ese número es el efecto medio de tratamiento sobre la población que entró en el experimento. Es una estadística legítima y es la que sustenta la decisión de lanzar. Lo que no es: una descripción de lo que le pasó a cada usuario.
El mismo efecto medio de medio punto porcentual puede venir de tres mundos completamente diferentes:
- Todo el mundo subió medio punto.
- La mitad subió un punto y la mitad se quedó igual.
- Un tercio subió dos puntos y dos tercios cayeron medio punto.
La decisión de lanzar puede ser la misma en los tres casos (el agregado es positivo), pero la decisión sobre qué hacer a continuación es radicalmente diferente. Y ahí es donde entra el panel de segmentos, casi siempre por la puerta equivocada.
Ejemplo trabajado: el test gana y alguien quiere lanzar solo en móvil
Una tienda ejecuta un test con 60.000 usuarios por brazo repartidos en cuatro dispositivos. Pega cualquier fila en la calculadora para reproducir los números.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
| segmento | A (conv./visitantes) | B (conv./visitantes) | tasa A | tasa B | efecto | z | valor p |
|---|---|---|---|---|---|---|---|
| Móvil | 1.500 / 30.000 | 1.650 / 30.000 | 5,00% | 5,50% | +0,500pp | 2,7457 | 0,006039 |
| Escritorio | 1.260 / 18.000 | 1.278 / 18.000 | 7,00% | 7,10% | +0,100pp | 0,3706 | 0,710938 |
| Tablet | 300 / 6.000 | 306 / 6.000 | 5,00% | 5,10% | +0,100pp | 0,2501 | 0,802486 |
| App | 420 / 6.000 | 414 / 6.000 | 7,00% | 6,90% | -0,100pp | -0,2154 | 0,829469 |
| Total | 3.480 / 60.000 | 3.648 / 60.000 | 5,80% | 6,08% | +0,280pp | 2,0517 | 0,040195 |
(Los cuatro segmentos suman exactamente 60.000 visitantes y 3.480 contra 3.648 conversiones, así que el total es aritméticamente consistente con las partes.)
El total es significativo: el test ganó. Y entonces llega la conclusión que parece obvia y no lo es: “la ganancia es toda de móvil, escritorio no reaccionó, así que lanzamos solo en móvil y nos ahorramos el trabajo en escritorio”.
Esa conclusión no está sustentada por los datos de arriba, y la razón es precisa.
La diferencia entre significativo y no significativo no es significativa
Gelman y Stern trataron exactamente esto en un artículo cuyo título es la propia tesis: la diferencia entre “significativo” y “no significativo” no es, ella misma, estadísticamente significativa. Dejan claro que no están haciendo la observación corriente de que cualquier umbral es arbitrario; la tesis es más fuerte: cambios grandes en el nivel de significancia pueden corresponder a cambios pequeños y no significativos en las cantidades subyacentes.
Su ejemplo teórico es de tres líneas. Dos estudios independientes con estimaciones y errores estándar de 25 más o menos 10 y 10 más o menos 10. El primero es significativo al nivel del 1 por ciento; el segundo no es nada significativo, quedando a apenas un error estándar de cero. Sería tentador concluir que hay una gran diferencia entre los dos. Solo que la diferencia estimada es 15, con error estándar igual a la raíz de 10 al cuadrado más 10 al cuadrado, es decir, la raíz de 200, que los autores redondean a cerca de 14. Eso da z de 1,0607 y valor p de 0,2888. No se acerca ni de lejos.
Los autores añaden un segundo caso que cierra el argumento por el otro lado: si un tercer estudio, con muestra mucho mayor, estima 2,5 con error estándar 1,0, alcanza el mismo nivel de significancia que el primero, y aun así la diferencia entre los dos es significativa. Comparar etiquetas de significancia no informa sobre las magnitudes.
El cálculo correcto: diferencia de diferencias
La pregunta “¿el efecto difiere entre móvil y escritorio?” tiene una estadística propia, y es la diferencia de diferencias.
Paso a paso, con los números del ejemplo:
- Efecto en móvil: 5,50% menos 5,00% igual a +0,500pp. Error estándar de la diferencia: raíz de 0,05 por 0,95 sobre 30.000, más 0,055 por 0,945 sobre 30.000, que da 0,18209pp.
- Efecto en escritorio: 7,10% menos 7,00% igual a +0,100pp. Error estándar: raíz de 0,07 por 0,93 sobre 18.000, más 0,071 por 0,929 sobre 18.000, que da 0,26983pp.
- Diferencia de diferencias: 0,500 menos 0,100 igual a +0,400pp.
- Error estándar de la diferencia de diferencias: raíz de 0,18209 al cuadrado más 0,26983 al cuadrado, que da 0,32553pp.
- Estadística de interacción: 0,400 dividido por 0,32553 igual a z de 1,2288, con valor p bilateral de 0,219158.
- Intervalo de confianza del 95 por ciento de la diferencia de diferencias: de -0,238pp a +1,038pp.
El intervalo contiene el cero con holgura, e incluso contiene valores negativos: los datos son compatibles con que el efecto sea mayor en escritorio que en móvil. La afirmación “el efecto es de móvil” no sobrevive a la propia aritmética que la sustentaría.
Por qué la interacción cuesta tanta muestra
La raíz del problema está en la aritmética de los errores estándar, y es implacable.
El error estándar de la diferencia de diferencias combina la incertidumbre de los dos segmentos: en el ejemplo, 0,32553 contra 0,18209 del efecto de móvil solo, es decir, 1,7877 vez más ancho. Como la muestra necesaria escala con el cuadrado de la razón entre error estándar y efecto, eso solo ya multiplica la muestra por 3,20.
Y el efecto de interacción suele ser menor que el efecto principal. En el ejemplo, la diferencia de diferencias (0,400pp) vale 0,8 del efecto de móvil (0,500pp). Juntando los dos factores:
La muestra necesaria para la interacción, dividida por la muestra necesaria para el efecto principal, es igual al cuadrado de (1,7877 dividido por 0,8), que da 4,99.
Verificando por los números absolutos: para detectar el efecto de móvil (base 5,00% subiendo a 5,50%, es decir, +10% relativo) al 80 por ciento de poder hacen falta 31.234 usuarios por variación (es el resultado de la calculadora de tamaño de muestra con base 5%, MDE 10% relativo, 95% de confianza bilateral). Para detectar la diferencia de diferencias observada con el mismo poder harían falta cerca de 156 mil por celda, es decir, prácticamente 5 veces más. El test tenía 30.000 por celda en móvil: alcanzaba para leer el efecto, no alcanzaba para leer la diferencia.
El factor 16 de Gelman y cuándo vale
El número de referencia de esta discusión viene de Gelman: bajo las suposiciones estándar sobre efectos principales e interacciones, hacen falta 16 veces la muestra para estimar una interacción en comparación con estimar un efecto principal.
Vale leer la suposición exacta, porque es donde vive todo el número. Con los predictores codificados como menos medio y más medio, el error estándar del efecto principal es 2 sigma sobre la raíz de N, y el del término de interacción es 4 sigma sobre la raíz de N, es decir, el doble. Si además la interacción vale la mitad del efecto principal, la razón entre efecto y error estándar cae por un factor de 4, y la muestra necesaria sube por 4 al cuadrado, es decir, 16.
Y el propio autor aclara qué significa “la mitad” ahí, en un punto que suele citarse mal: si el efecto principal del tratamiento es 0,6 y la interacción con el sexo es 0,3, entonces el efecto es 0,45 para un grupo y 0,75 para el otro. Si en cambio tenías en mente un efecto principal de 0,6 que es 0,3 en un grupo y 0,9 en el otro, entonces el factor necesario baja a 4 veces, no 16.
El ejemplo de este artículo está en ese segundo régimen, y por eso dio 4,99 y no 16: la diferencia de 0,400pp es grande en relación con el efecto medio. En un caso más típico, en el que la heterogeneidad es sutil, el factor sube rápido.
| relación entre interacción y efecto principal | factor de muestra (con error estándar 2 veces mayor) |
|---|---|
| la interacción vale lo mismo que el efecto principal | 4 veces |
| la interacción vale 0,8 del efecto principal | 6,25 veces |
| la interacción vale la mitad del efecto principal | 16 veces |
| la interacción vale un tercio del efecto principal | 36 veces |
| la interacción vale un cuarto del efecto principal | 64 veces |
Fíjate en que la tabla asume el error estándar exactamente 2 veces mayor, que es la suposición de Gelman. El caso trabajado de este artículo dio 4,99 y no 6,25 porque allí el error estándar de la interacción quedó 1,7877 vez mayor que el del efecto de móvil, y no 2 veces: los cuatro segmentos no tienen el mismo tamaño, así que la división no es la de cuatro celdas iguales que supone la fórmula de Gelman. Usa la tabla para orden de magnitud y el cálculo de la sección anterior para tu propio caso.
La advertencia práctica que Gelman deriva de esto es lo más importante de su texto: el plan habitual de diseñar el estudio enfocado en el efecto principal, quizás incluso preregistrando, y después ir a ver qué aparece en las interacciones es un problema serio. Y el peor caso es diseñar el estudio, no encontrar el efecto principal esperado, y usar las interacciones para salvarse. El problema no es solo que ese análisis sea exploratorio: es que esos datos son mucho más ruidosos de lo que uno percibe, así que lo que parece un hallazgo exploratorio interesante puede ser solo ruido.
Cómo buscar segmentos sin invalidar el intervalo
Si el test no fue dimensionado para interacción (casi nunca lo es) y aun así necesitas investigar heterogeneidad, existen tres caminos legítimos, en orden creciente de costo.
1. Predeclarar pocos segmentos, con corrección
Elige dos o tres cortes que la hipótesis del test realmente prevea que respondan diferente, escribe cuáles son en el plan de análisis antes de ejecutar, y aplica corrección de multiplicidad sobre ellos. Cuatro segmentos leídos al nivel del 5 por ciento ya dan 18,55 por ciento de probabilidad de al menos un falso positivo, y eso es lo que muchas métricas en un test trata en detalle.
Kohavi y coautores relatan que en la operación de Bing, para el análisis en rebanadas, educan a los experimentadores sobre falsos positivos y los incentivan a ajustar el umbral de probabilidad, enfocándose en señales fuertes y valores p menores, del orden de 0,0001. Es una regla mucho más dura que 0,05, y existe porque el eje de los segmentos es el que más crece sin control.
2. Estimación honesta: descubrir en una muestra, estimar en otra
Athey e Imbens proponen un método formal para el caso en el que quieres que el dato descubra los subgrupos, sin que eso invalide la inferencia. La idea central es la estimación honesta: una muestra se usa para construir la partición y otra, independiente, para estimar los efectos de tratamiento dentro de cada parte.
Describen el método como un complemento a los planes de análisis preregistrados, en los que el investigador tiene que comprometerse de antemano con los subgrupos que serán analizados: su enfoque permite que el dato descubra subgrupos relevantes sin caer en las preocupaciones de test múltiple que invalidarían los valores p.
El resultado empírico es lo que importa aquí. En un estudio de simulación, muestran que los métodos adaptativos (que usan los mismos datos para elegir el modelo y para estimar) tienen tasas de cobertura de intervalo de confianza sustancialmente por debajo de la nominal, mientras que los métodos honestos alcanzan la cobertura nominal en todos los diseños testeados. Son explícitos sobre el precio: la estimación honesta sacrifica algo de ajuste (la mitad de la muestra usada para descubrir no entra en la estimación) a cambio de intervalos de confianza válidos.
La traducción para un test A/B: si te sobra tráfico, separa la mitad de los usuarios para explorar cortes y la otra mitad para estimar el efecto en los cortes que encontró la primera mitad. Es la versión práctica y barata del mismo principio.
3. Ejecutar un test diseñado para la interacción
La alternativa más cara y más definitiva: ejecutarlo de nuevo, dimensionado para la diferencia que quieres detectar. Eso significa multiplicar la muestra por el factor de la tabla de arriba, o restringir el experimento al segmento de interés, lo que reduce el costo pero responde a una pregunta menor (“funciona en móvil”, no “funciona más en móvil”).
Efecto heterogéneo no es lo mismo que personalización
Confundir los dos es común y caro. Heterogeneidad es una afirmación estadística sobre el experimento: el efecto varió entre subgrupos, con incertidumbre declarada. Personalización es una decisión de producto: entregar experiencias diferentes a grupos diferentes.
Ir de una a la otra exige que tres cosas sean verdaderas al mismo tiempo, y la primera casi nunca se verifica:
- La heterogeneidad es real, es decir, el test de interacción sustenta la afirmación, no solo la comparación de etiquetas de significancia.
- El segmento es accionable en el momento de la decisión, es decir, sabes a qué grupo pertenece el usuario antes de servir la página, y no solo después.
- La ganancia de personalizar compensa el costo permanente de mantener dos caminos de producto, dos conjuntos de tests futuros y dos superficies de bugs.
La discusión completa de ese trade-off está en personalización versus test A/B. Y el caso patológico en el que la agregación por segmento invierte el signo del resultado está en la paradoja de Simpson en test A/B.
Checklist antes de afirmar que el efecto difiere
- ¿Calculaste la diferencia de diferencias, o solo comparaste dos valores p? Comparar etiquetas no es un test.
- ¿El intervalo de la diferencia excluye el cero? Si lo incluye, la afirmación es “no sé”, no “no difieren” ni “difieren”.
- ¿Los segmentos fueron declarados antes? Si no, el resultado es exploratorio y sale etiquetado como tal.
- ¿Cuántos cortes se testearon en total? El cálculo de multiplicidad usa el número de cortes intentados, no el número reportado.
- ¿El segmento se conoce antes de servir la variación? Si no, no sustenta una decisión de personalización.
- ¿La muestra por celda coincide con el factor de la tabla? Si el test tenía poder para el efecto principal, casi con certeza no lo tenía para la interacción.
- ¿Hay una ronda de confirmación prevista? La heterogeneidad hallada en los datos es una hipótesis, y una hipótesis se vuelve resultado en una segunda ronda.
Errores comunes
- Concluir que el efecto difiere porque un segmento salió significativo y otro no. Es exactamente el error que describen Gelman y Stern, y es el más común de todos.
- Cortar hasta encontrar. Testear dispositivo, navegador, país, canal, nuevo contra recurrente y franja de gasto es más de 20 comparaciones no declaradas.
- Usar la misma muestra para descubrir el corte y para estimar el efecto en él. Es el método adaptativo que, en la simulación de Athey e Imbens, produce cobertura bastante por debajo de la nominal.
- Lanzar solo en el segmento ganador sin testear la interacción. La decisión de no lanzar en escritorio es una afirmación sobre escritorio, y necesita evidencia propia.
- Confundir segmento pequeño con efecto nulo. Tablet y app del ejemplo tienen intervalos amplísimos: no dicen que el efecto es cero, dicen que no se sabe.
- Reportar el efecto del mejor segmento como si fuera el efecto del test. El mejor segmento está sesgado hacia arriba por selección, es la maldición del ganador aplicada a cortes.
Hazlo automático en Donnu
El error caro aquí no es mirar segmentos, es que el panel de segmentos parezca una respuesta cuando es una pregunta. Cuatro filas, cuatro valores p, uno verde y tres grises, y nadie en la sala calcula la única estadística que sustentaría la decisión que se está tomando.
En Donnu, los cortes de segmento se declaran junto con la hipótesis, y cuando se comparan dos segmentos el informe muestra la diferencia de diferencias con su propio intervalo de confianza, no solo los dos efectos uno al lado del otro. Los segmentos no declarados aparecen en una pestaña separada, marcada como exploratoria, con el número de cortes ya testeados visible en pantalla. Si quieres rehacer cualquier fila a mano, la calculadora de significancia acepta los conteos brutos y la calculadora de tamaño de muestra muestra lo que exigiría cada celda.
Referencias
- Gelman, A. y Stern, H. The Difference Between “Significant” and “Not Significant” is not Itself Statistically Significant. The American Statistician, volumen 60, número 4, noviembre de 2006. Fuente de la tesis central de que los cambios en el nivel de significancia frecuentemente no son ellos mismos estadísticamente significativos, de la salvedad explícita de que la observación va más allá del hecho corriente de que cualquier umbral es arbitrario, del ejemplo teórico de los dos estudios con estimaciones 25 más o menos 10 y 10 más o menos 10 (el primero significativo al 1 por ciento, el segundo a un error estándar de cero, con diferencia estimada de 15 y error estándar igual a la raíz de 10 al cuadrado más 10 al cuadrado, es decir, 14), y del caso complementario del tercer estudio con estimación 2,5 y error estándar 1,0, que alcanza el mismo nivel de significancia que el primero aunque la diferencia entre los dos sea significativa. stat.columbia.edu.
- Gelman, A. You need 16 times the sample size to estimate an interaction than to estimate a main effect. Statistical Modeling, Causal Inference, and Social Science, 15 de marzo de 2018. Fuente del factor 16 bajo las suposiciones estándar, de la mecánica de los errores estándar con predictores codificados en menos medio y más medio (2 sigma sobre raíz de N para el efecto principal y 4 sigma sobre raíz de N para la interacción), de la aclaración de que “la interacción vale la mitad del efecto principal” significa un efecto principal 0,6 con interacción 0,3, produciendo efectos 0,45 y 0,75, y de que bajo la lectura alternativa (efecto 0,3 en un grupo y 0,9 en el otro) el factor necesario baja a 4, y de la advertencia contra diseñar el estudio enfocado en el efecto principal y después buscar en las interacciones, especialmente cuando el efecto principal no aparece. statmodeling.stat.columbia.edu.
- Athey, S. e Imbens, G. Recursive Partitioning for Heterogeneous Causal Effects. Diciembre de 2015. Fuente de la propuesta de estimación honesta (una muestra para construir la partición y otra para estimar los efectos de tratamiento en cada subpoblación), del encuadre del método como complemento a los planes de análisis preregistrados que exigen compromiso anticipado con los subgrupos, de la explicación de que los métodos adaptativos usan los datos de entrenamiento para la selección del modelo y por eso las correlaciones espurias afectan al modelo seleccionado, y del resultado de simulación en el que los métodos honestos alcanzan cobertura nominal de los intervalos de confianza mientras los adaptativos quedan sustancialmente por debajo, al costo de algo de ajuste. arxiv.org/abs/1504.01132.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fuente del relato de que el análisis en rebanadas por segmento viola la premisa de un único análisis, y de que la respuesta operativa fue educar a los experimentadores sobre falsos positivos e incentivarlos a ajustar el umbral de probabilidad, enfocándose en señales fuertes y valores p menores, del orden de 0,0001. exp-platform.com.
Lee también: Muchas métricas en un test A/B · Plan de análisis preregistrado · La paradoja de Simpson en test A/B · Personalización versus test A/B · La maldición del ganador · Calculadora de significancia · Leia em português
Preguntas frecuentes
- ¿Qué es un efecto heterogéneo de tratamiento?
- Es cuando el efecto de un cambio no es el mismo para todos los usuarios: sube en un grupo, es neutro en otro y hasta puede caer en un tercero. El número que un test A/B reporta por defecto es el efecto medio sobre toda la población testeada, y esa media puede esconder efectos opuestos que se cancelan. Detectar heterogeneidad real es distinto de observar números diferentes entre segmentos, porque números diferentes aparecen por azar incluso cuando el efecto es idéntico en todos ellos.
- Si el efecto es significativo en móvil y no en escritorio, ¿eso prueba que el efecto difiere?
- No. Gelman y Stern muestran que la diferencia entre significativo y no significativo no es, ella misma, estadísticamente significativa. Su ejemplo canónico: un estudio con estimación 25 y error estándar 10 es significativo al 1 por ciento, otro con estimación 10 y error estándar 10 no es significativo; pero la diferencia entre los dos es 15 con error estándar igual a la raíz de 10 al cuadrado más 10 al cuadrado, es decir, 14, lo que no se acerca ni de lejos a ser significativo. Para afirmar que los segmentos difieren hay que testear la diferencia entre ellos directamente.
- ¿Cómo se testea la diferencia de efecto entre dos segmentos?
- Por la diferencia de diferencias. Calcula el efecto absoluto del tratamiento en cada segmento, resta uno del otro, y calcula el error estándar de esa diferencia como la raíz de la suma de los cuadrados de los errores estándar de los dos efectos. El z del test de interacción es la diferencia de diferencias dividida por ese error estándar. Esa es la estadística que responde a la pregunta "el efecto es diferente entre los segmentos", y siempre es más ruidosa que cualquiera de los dos efectos aislados.
- ¿Por qué el test de interacción exige tanta muestra?
- Por dos motivos que se suman. El efecto de interacción suele ser menor que el efecto principal, y su error estándar es mayor porque combina la incertidumbre de los dos segmentos. Gelman muestra que, bajo la suposición de que la interacción vale la mitad del efecto principal y el error estándar se duplica, hacen falta 16 veces la muestra para estimar la interacción con la misma precisión que el efecto principal. Si la interacción es del mismo tamaño que el efecto principal en vez de la mitad, el factor baja a 4.
- ¿Puedo buscar segmentos en los datos después de terminado el test?
- Puedes, siempre que el resultado se etiquete como exploratorio y lleve a una ronda de confirmación. Cortar los datos de muchas maneras hasta que algo salga significativo es multiplicidad no declarada. Athey e Imbens proponen un camino formal para esto, la estimación honesta: una muestra se usa para descubrir la partición y otra, independiente, para estimar los efectos dentro de cada parte. Muestran que los métodos adaptativos, que usan los mismos datos para elegir y estimar, tienen cobertura de intervalo de confianza bastante por debajo de la nominal, mientras que el método honesto alcanza la cobertura nominal.
- ¿Cuál es la diferencia entre efecto heterogéneo y personalización?
- La heterogeneidad es una afirmación estadística sobre el experimento que ejecutaste: el efecto varía entre subgrupos, y mediste esa variación con incertidumbre declarada. La personalización es una decisión de producto: entregar experiencias diferentes a grupos diferentes. Una no implica la otra. Heterogeneidad débil o no confirmada no justifica personalizar, porque el costo de mantener dos caminos de producto es real y permanente mientras la ganancia medida puede ser ruido.