Modelo jerárquico en test A/B: agrupamiento parcial
El modelo jerárquico estima la variación entre segmentos en vez de suponerla. La cuenta en 8 segmentos, el tau mal identificado y el ranking invertido.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Usted corrió un test, dio positivo en el agregado, y ahora tiene ocho lecturas de segmento en pantalla. Una de ellas muestra más 21 por ciento. La pregunta no es si usted le cree, sino cuánto. El modelo jerárquico responde eso con un número: estima cuánta variación REAL existe entre segmentos y usa ese valor para decidir el peso de cada lectura individual. En el ejemplo trabajado de esta guía, la desviación entre segmentos da 0,2420 punto porcentual, el campeón bruto de más 1,219 punto cae a más 0,392, y el podio cambia de dueño: quien asume el liderazgo es un segmento con lectura bruta menor y una muestra 6,8 veces mayor. Esta guía muestra el modelo línea por línea, por qué estimar la desviación entre segmentos es la parte difícil (su intervalo va de 0,0000 a 0,6000 punto con 8 segmentos), dónde la versión simplificada por momentos miente sobre su propia precisión, y la simulación que dice cuándo agrupar parcialmente le gana a agruparlo todo. Forma parte de nuestra guía completa de test A/B y es el paso siguiente al encogimiento bayesiano.
El test que usted ya corrió
El ejemplo es un único test de reordenación de la página de producto, con lectura por dispositivo y canal. Primero el agregado, que es la lectura que va al informe:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Con 60.000 visitantes y 2.873 conversiones en el control y 59.920 visitantes y 3.038 conversiones en la variación, la calculadora devuelve 4,7883 por ciento contra 5,0701 por ciento, una ganancia relativa de 5,884 por ciento, valor p de 0,024218 e intervalo de confianza de más 0,0367 a más 0,5268 punto porcentual. Pasa en 0,05, con poca holgura.
Ahora la tabla por segmento, que es donde el informe se convierte en discusión:
| segmento | visitantes por variación | base | variación | diferencia | relativo | valor p |
|---|---|---|---|---|---|---|
| Desktop / búsqueda orgánica | 14.200 | 5,500% | 6,100% | +0,600 pp | +10,91% | 0,030565 |
| Desktop / búsqueda pagada | 9.600 | 4,896% | 5,449% | +0,553 pp | +11,30% | 0,083781 |
| Desktop / email | 4.300 | 6,907% | 7,710% | +0,803 pp | +11,63% | 0,152864 |
| Desktop / directo | 6.100 | 5,000% | 5,148% | +0,148 pp | +2,96% | 0,709749 |
| Móvil / búsqueda orgánica | 13.800 | 4,000% | 3,897% | −0,103 pp | −2,58% | 0,660388 |
| Móvil / búsqueda pagada | 8.200 | 3,402% | 3,105% | −0,297 pp | −8,74% | 0,283598 |
| Móvil / email | 2.100 | 5,762% | 6,981% | +1,219 pp | +21,16% | 0,105013 |
| Móvil / directo | 1.700 | 4,000% | 4,012% | +0,012 pp | +0,29% | 0,986167 |
La lectura ingenua de esta tabla produce tres conclusiones, y las tres están equivocadas: que el test funciona muy bien en el email móvil, que perjudica la búsqueda pagada móvil, y que desktop y móvil reaccionan de formas opuestas. Nada de eso está establecido por los datos.
Tres formas de responder, y solo una es razonable
Frente a ocho segmentos, existen tres posturas posibles:
No agrupar nada es creer que 2.100 visitantes miden el efecto en el email móvil tan bien como 14.200 lo miden en la búsqueda orgánica desktop. Agruparlo todo es suponer que el efecto es idéntico en los ocho, lo que borra por decreto cualquier diferencia real. La tercera vía no es un punto medio arbitrario: cuánto agrupar es un parámetro que se estima.
El modelo jerárquico, en tres líneas
El modelo jerárquico normal-normal, escrito para segmentos de test A/B, cabe en tres afirmaciones:
- Cada segmento tiene un efecto verdadero propio, llámelo
delta_j. - Esos efectos verdaderos vienen de una distribución común, con media
muy desviacióntau. - La lectura observada
d_jes el efecto verdadero más un error de medición, con desviaciónse_j(el error estándar de la diferencia en ese segmento, que usted ya tiene).
En notación: d_j ~ Normal(delta_j, se_j) y delta_j ~ Normal(mu, tau). Solo existen dos números nuevos en el mundo, mu y tau, y los dos salen de los datos.
mu es el efecto medio entre segmentos. tau es el número que lo decide todo: si tau es cero, los efectos verdaderos son idénticos y el modelo colapsa en agrupamiento total; si tau es gigante, cada segmento se vuelve independiente y el modelo colapsa en no agrupar nada. Por eso la pelea es sobre tau.
Estimar tau de verdad, no con una fórmula cerrada
Existen dos caminos comunes para tau, y no son equivalentes.
El camino por momentos (el estimador de DerSimonian y Laird, usado en meta-análisis y en nuestra pieza sobre encogimiento bayesiano) usa el estadístico de heterogeneidad Q. En los datos de arriba, Q vale 11,2708 con 7 grados de libertad, y la fórmula devuelve tau igual a 0,2780 punto porcentual.
El camino por verosimilitud maximiza la probabilidad de los datos bajo el modelo, variando tau y recalculando mu en cada paso. Aquí devuelve tau igual a 0,2420 punto porcentual y mu igual a 0,2355 punto (error estándar de 0,1569).
Los dos valores están cerca, y ese es el resultado tranquilizador. El resultado inquietante es lo que aparece cuando se mira la curva entera en lugar del punto máximo:
Este es el hecho central sobre los modelos jerárquicos en test A/B: tau está mal identificado porque el número de segmentos es pequeño. Usted tiene 119.920 visitantes en el test, que es bastante, pero solo 8 observaciones para estimar la variación ENTRE segmentos, que es poquísimo. Andrew Gelman trata exactamente este caso en Bayesian Analysis (2006) y recomienda un prior uniforme en la desviación jerárquica, con la familia media-t “cuando el número de grupos es pequeño”.
El factor de encogimiento, segmento por segmento
Con tau estimado, el peso de cada lectura sale de una sola cuenta: el factor de encogimiento B_j = tau² / (tau² + se_j²). Es la fracción de la propia lectura que sobrevive.
| segmento | error estándar | factor B | lectura bruta | después del encogimiento |
|---|---|---|---|---|
| Móvil / búsqueda orgánica | 0,235 pp | 0,516 | −0,103 pp | +0,061 pp |
| Desktop / búsqueda pagada | 0,320 pp | 0,364 | +0,553 pp | +0,351 pp |
| Móvil / búsqueda pagada | 0,277 pp | 0,433 | −0,297 pp | +0,005 pp |
| Desktop / búsqueda orgánica | 0,277 pp | 0,432 | +0,600 pp | +0,393 pp |
| Desktop / directo | 0,398 pp | 0,270 | +0,148 pp | +0,212 pp |
| Desktop / email | 0,562 pp | 0,156 | +0,803 pp | +0,324 pp |
| Móvil / directo | 0,671 pp | 0,115 | +0,012 pp | +0,210 pp |
| Móvil / email | 0,752 pp | 0,094 | +1,219 pp | +0,328 pp |
Lea la última fila con atención. El segmento con la lectura más espectacular del test tiene un factor de encogimiento de 0,094: se toma en serio el 9,4 por ciento de su lectura, y el otro 90,6 por ciento viene del efecto medio del test. No es arbitrariedad, es la consecuencia de tener 2.100 visitantes por variación en un segmento cuyo error estándar (0,752 pp) es tres veces mayor que la desviación real entre segmentos (0,242 pp). La señal simplemente no está ahí.
Observe también Móvil / búsqueda pagada: la lectura bruta es negativa (−0,297 pp, que cualquiera leería como “el test empeora la búsqueda pagada móvil”) y el resultado después del encogimiento es más 0,005 punto, es decir, nada. La conclusión de daño al segmento nunca existió.
Dónde miente la versión simplificada
Hasta aquí la cuenta es la misma que haría un encogimiento por momentos. La diferencia del modelo jerárquico completo aparece en el PASO SIGUIENTE: en lugar de fijar tau en 0,2420 y tratarlo como conocido, integra la incertidumbre sobre tau (aquella curva ancha de arriba) en el resultado final de cada segmento. Corriendo esto con un prior media-normal de escala 0,5 punto porcentual sobre tau, como Gelman recomienda para pocos grupos:
| segmento | plug-in (tau fijo) | error del plug-in | modelo completo | error del modelo | P(efecto positivo) |
|---|---|---|---|---|---|
| Desktop / búsqueda orgánica | +0,393 pp | 0,182 pp | +0,406 pp | 0,236 pp | 95,7% |
| Desktop / búsqueda pagada | +0,351 pp | 0,193 pp | +0,368 pp | 0,247 pp | 93,2% |
| Desktop / email | +0,324 pp | 0,222 pp | +0,369 pp | 0,322 pp | 87,4% |
| Desktop / directo | +0,212 pp | 0,207 pp | +0,205 pp | 0,257 pp | 78,8% |
| Móvil / búsqueda orgánica | +0,061 pp | 0,168 pp | +0,051 pp | 0,202 pp | 59,9% |
| Móvil / búsqueda pagada | +0,005 pp | 0,182 pp | −0,020 pp | 0,242 pp | 46,7% |
| Móvil / email | +0,328 pp | 0,230 pp | +0,392 pp | 0,362 pp | 86,1% |
| Móvil / directo | +0,210 pp | 0,228 pp | +0,199 pp | 0,318 pp | 73,4% |
Las medias casi no se mueven, y por eso el plug-in es popular. Los errores estándar se mueven mucho. En el segmento de email móvil, el error del modelo completo (0,362) es 57,4 por ciento mayor que el del plug-in (0,230). En el de búsqueda orgánica desktop, 29,7 por ciento mayor. El plug-in no se equivoca en la estimación, se equivoca en la confianza en la estimación, siempre hacia el lado optimista, porque finge conocer tau cuando el intervalo de tau cubre de cero a 0,60.
Fíjese además en la última columna de la tabla: un único segmento de los ocho supera el 95 por ciento de probabilidad de efecto positivo. La tabla bruta tenía tres segmentos con valor p por debajo de 0,16 y uno por debajo de 0,05. Después del modelo, existe una lectura defendible y siete indefinidas.
La inversión del ranking
Aquí está el resultado que cambia decisiones. Ordenando los ocho segmentos por la lectura bruta y después por el modelo completo:
Desktop / búsqueda orgánica tenía una lectura bruta MENOR que otros dos segmentos y asume el liderazgo porque tiene 14.200 visitantes por variación contra 2.100 y 4.300. Es la misma lógica de Gelman, Hill y Yajima en “Why we (usually) don’t have to worry about multiple comparisons”: en lugar de mantener quietos los centros de los intervalos y ensancharlos para corregir por comparaciones múltiples, el modelo multinivel desplaza los centros unos hacia los otros.
Ejemplo trabajado: el campeón solo en la calculadora
Vale la pena tomar el segmento campeón y mirarlo de cerca, con la misma calculadora del comienzo. Sus números: 2.100 visitantes y 121 conversiones en el control, 2.120 visitantes y 148 conversiones en la variación.
Eso devuelve 5,762 por ciento contra 6,981 por ciento, ganancia relativa de 21,16 por ciento, valor p de 0,105013 e intervalo de confianza de menos 0,254 a más 2,692 punto porcentual. Su intervalo tiene 2,95 puntos porcentuales de ancho, lo que es diez veces el ancho del intervalo del agregado (0,49 punto). Ese es el campeón: un número enorme dentro de un intervalo que va de “empeora un poco” a “mejora cuatro veces más que el agregado”.
No hace falta ningún modelo jerárquico para desconfiar de él. Basta con leer el intervalo. Lo que el modelo agrega es el SUSTITUTO: en lugar de “no sabemos”, entrega más 0,392 punto porcentual con un error de 0,362, que es una estimación utilizable.
Cuánto tráfico necesitaría un segmento
La pregunta natural del equipo es cuánto faltaría para leer esos segmentos de verdad. La calculadora de muestra responde:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Con una base de 4 por ciento y un efecto real de más 0,30 punto porcentual (que es el orden de magnitud de lo que el modelo estima), el requisito es de 69.379 visitantes por variación, con 95 por ciento de confianza y 80 por ciento de poder. A 30.000 visitantes por semana en todo el sitio, y siendo el segmento una fracción de eso, ese número no se alcanza: 33 días solo para el segmento, si fuera el sitio entero.
El otro lado de la misma cuenta, y el más útil para pegar en el informe:
| segmento | muestra por variación | efecto mínimo detectable |
|---|---|---|
| Desktop / búsqueda orgánica | 14.200 | +13,78% relativo |
| Móvil / email | 2.100 | +34,97% relativo |
| agregado del test | 60.000 | +7,21% relativo |
El segmento de email móvil solo puede detectar efectos por encima de más 34,97 por ciento relativo. Leyó más 21,16 por ciento. Un segmento que no tiene poder para detectar el efecto que reportó está reportando ruido, y su lectura solo existe porque alguien fue a mirar. Es el mismo mecanismo de la maldición del ganador y del error de magnitud que Gelman y Carlin llaman razón de exageración.
Cuánto gana de verdad el agrupamiento parcial
Falta la pregunta honesta: ¿el agrupamiento parcial siempre es mejor? Corrimos una simulación para esta guía, con 20.000 repeticiones, usando exactamente los ocho errores estándar de la tabla de arriba, un efecto medio verdadero de 0,25 punto porcentual y variando la desviación real entre segmentos. La métrica es la raíz del error cuadrático medio contra los efectos verdaderos, en puntos porcentuales (menor es mejor):
| desviación real entre segmentos | sin agrupamiento | agrupamiento total | agrupamiento parcial |
|---|---|---|---|
| 0,00 pp | 0,4734 | 0,1206 | 0,1402 |
| 0,10 pp | 0,4739 | 0,1556 | 0,1698 |
| 0,25 pp | 0,4746 | 0,2705 | 0,2554 |
| 0,60 pp | 0,4748 | 0,5899 | 0,3843 |
| 1,20 pp | 0,4724 | 1,1654 | 0,4461 |
De ahí salen tres lecturas:
- No agrupar nada es malo en todos los escenarios, con el error estancado alrededor de 0,47 siempre. Ninguna condición de heterogeneidad justifica leer el segmento crudo.
- Agruparlo todo es óptimo cuando no hay heterogeneidad y catastrófico cuando la hay. Con
tauigual a 1,20, se equivoca 2,6 veces más que el agrupamiento parcial. - El agrupamiento parcial nunca es el peor de los tres, y su penalización en el mejor escenario del agrupamiento total es pequeña (0,1402 contra 0,1206). Es una póliza de seguro barata contra un escenario que usted no observa directamente.
Esa última línea es el argumento práctico del método: usted no sabe cuál es el tau verdadero (su intervalo cubre de 0 a 0,60 en sus propios datos), así que elegir el estimador que se comporta bien en todo el rango es la decisión defendible.
Cómo correr un modelo jerárquico en la práctica
- Defina los segmentos ANTES del test, en el plan de análisis preregistrado. Ningún modelo salva un segmento elegido después de ver el resultado.
- Exporte la diferencia y el error estándar por segmento, no solo la tasa. El modelo necesita los dos.
- Estime
taupor verosimilitud, no a ojo. Y mire la curva entera, no solo el máximo. - Reporte también el intervalo de
tau. Si cubre el cero, dígalo en el informe: significa que el test no estableció heterogeneidad alguna. - Integre la incertidumbre de
tauen lugar de fijarla, o acepte que sus intervalos por segmento son de 30 a 57 por ciento más estrechos de lo que deberían. - Use un prior media-normal o media-t en la escala de
taucuando haya pocos segmentos, y declare la escala elegida. Con 8 grupos, esa elección aparece en el resultado. - Decida por el ranking del modelo, nunca por el ranking bruto. Solo en la cima cambió el orden, y la cima es lo que se va a convertir en inversión.
Errores comunes
- Confundir “
tauestimado en cero” con “no hay heterogeneidad”. En los datos de esta guía, el máximo es 0,2420, pero el cero está dentro del intervalo. Una estimación en la frontera es información débil, no prueba de homogeneidad. - Recortar segmentos hasta que uno salga significativo. Es un problema de comparaciones múltiples resuelto de la forma equivocada; vea muchas métricas en un test.
- Creer que el encogimiento es conservadurismo. También mueve estimaciones hacia arriba: Móvil / directo pasó de +0,012 a +0,210 punto porcentual.
- Usar el modelo para justificar personalización por segmento. Estimar el efecto por segmento es diferente de armar una política de tratamiento; para eso, vea modelado de uplift.
- Aplicar el modelo a segmentos que se superponen. Si un visitante aparece en dos segmentos, los errores dejan de ser independientes y la cuenta de
tauqueda torcida. - Leer el factor de encogimiento como nota de calidad del segmento. Mide precisión relativa, no importancia del canal.
- Confundir heterogeneidad real con la paradoja de Simpson. Cuando la composición de los grupos difiere, el problema es de mezcla, no de efecto por segmento, y el modelo jerárquico no lo arregla.
Hágalo automático con Donnu
Esta cuenta siempre tropieza en el mismo lugar: para estimar tau hace falta tener la diferencia Y el error estándar de cada segmento declarado antes del test, guardados juntos. Un panel que exporta solo la tasa de conversión por segmento no permite armar el modelo, y reconstruir eso después, a mano, es donde el equipo se rinde.
Donnu registra la configuración del experimento en el momento en que se crea, incluidos los segmentos declarados y la métrica primaria, y mantiene el historial por experimento. Eso deja la lectura por segmento disponible con la muestra y la varianza de cada uno, que es exactamente el insumo del agrupamiento parcial.
Y queda la recomendación más práctica de esta guía: antes de aprobar cualquier decisión basada en un segmento, calcule el efecto mínimo detectable de ese segmento con la muestra que tuvo. Si el efecto reportado es menor que el mínimo detectable, la lectura es ruido y ningún modelo la va a salvar. La calculadora de tamaño de muestra lo resuelve en diez segundos.
Referencias
- Gelman, A. Prior distributions for variance parameters in hierarchical models. Bayesian Analysis, volumen 1, número 3, 2006, páginas 515 a 533. Fuente de la recomendación de usar un prior uniforme en la desviación estándar jerárquica, con la familia media-t “cuando el número de grupos es pequeño y en otros contextos en los que se desea un prior débilmente informativo”; de la demostración de que el modelo uniforme(0, A) genera un posterior propio en el límite siempre que el número de grupos J sea al menos 3, mientras que el modelo gamma-inversa(epsilon, epsilon) no tiene ningún límite propio; y de la presentación de la media-Cauchy como caso particular de la familia media-t con un grado de libertad. sites.stat.columbia.edu.
- Gelman, A., Hill, J. y Yajima, M. Why we (usually) don’t have to worry about multiple comparisons. 2009. Fuente de la tesis de que el problema de las comparaciones múltiples puede desaparecer cuando se mira desde una perspectiva bayesiana jerárquica, y del contraste central usado en esta guía: los modelos multinivel hacen agrupamiento parcial, desplazando las estimaciones unas hacia las otras, mientras que los procedimientos clásicos mantienen quietos los centros de los intervalos y ajustan ensanchando los intervalos; y del registro de que la ganancia de eficiencia es mayor justamente en contextos de baja variación entre grupos, que es donde las comparaciones múltiples más preocupan. arxiv.org.
- Gelman, A. y Carlin, J. Beyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) Errors. Perspectives on Psychological Science, volumen 9, número 6, 2014, páginas 641 a 651. Fuente del encuadre usado aquí para segmentos pequeños: en contextos de muestra pequeña y medición ruidosa, los resultados estadísticamente significativos suelen ser engañosos, y el diagnóstico recomendado es estimar la probabilidad de que la estimación esté en la dirección equivocada (error de signo) y el factor por el cual la magnitud del efecto puede estar sobreestimada (error de magnitud, o razón de exageración). sites.stat.columbia.edu.
Lee también: Encogimiento bayesiano · Efecto heterogéneo por segmento · La maldición del ganador · Meta-análisis de tests A/B · Muchas métricas en un test A/B · Calculadora de significancia · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es un modelo jerárquico en un test A/B?
- Es un modelo que trata los efectos de los segmentos como provenientes de una misma distribución, con un efecto medio y una desviación entre segmentos. En lugar de suponer que todos los segmentos tienen el mismo efecto, o que cada uno tiene su propio efecto independiente, estima cuánta variación real existe entre ellos a partir de los propios datos y usa ese número para decidir cuánto confiar en la lectura de cada segmento.
- ¿Cuál es la diferencia entre el modelo jerárquico y el encogimiento por momentos?
- El encogimiento por momentos estima la desviación entre segmentos con una fórmula cerrada y después trata ese valor como si fuera conocido. El modelo jerárquico completo estima la misma desviación por verosimilitud y después integra la incertidumbre que queda sobre ella. En el ejemplo de esta guía, los dos caminos dan desviaciones parecidas, 0,2420 punto porcentual contra 0,2780, pero el intervalo del plug-in queda entre 23 y 57 por ciento más estrecho que el del modelo completo, es decir, el plug-in parece más preciso de lo que es.
- ¿Por qué la desviación entre segmentos suele estar mal estimada?
- Porque el número de segmentos es pequeño. En el ejemplo de esta guía, con 8 segmentos, la estimación de máxima verosimilitud de la desviación es 0,2420 punto porcentual, pero el intervalo de 95 por ciento por verosimilitud perfilada va de 0,0000 a 0,6000 punto. Es decir, los datos no descartan ni la ausencia de heterogeneidad ni una heterogeneidad grande. Andrew Gelman muestra que, con pocos grupos, la elección del prior para esa desviación deja de ser inocua.
- ¿El modelo jerárquico puede cambiar cuál es el mejor segmento?
- Puede, y lo cambió en el ejemplo de esta guía. El segmento con la mayor lectura bruta es Móvil email, con más 1,219 punto porcentual y más 21,16 por ciento relativo. Después del modelo completo, cae a más 0,392 punto y pierde el liderazgo frente a Desktop búsqueda orgánica, que tenía una lectura bruta menor y una muestra 6,8 veces mayor. El cambio de ranking ocurre porque el modelo descuenta cada lectura según su precisión.
- ¿Cuántos visitantes necesita un segmento para leerse por sí solo?
- Muchos más de lo que sugiere la intuición. En el ejemplo de esta guía, el segmento Móvil email tiene 2.100 visitantes por variación y una base de 5,762 por ciento, lo que da un efecto mínimo detectable de más 34,97 por ciento relativo. Para leer con poder de 80 por ciento un efecto de más 0,30 punto porcentual sobre una base de 4 por ciento, harían falta 69.379 visitantes por variación, o 33 días a 30.000 visitantes por semana.
- ¿El agrupamiento parcial siempre es mejor que el agrupamiento total?
- No en todos los escenarios, y vale la pena decirlo con honestidad. En una simulación de 20.000 repeticiones hecha para esta guía, con desviación real entre segmentos de cero, gana el agrupamiento total, con error cuadrático medio de 0,1206 contra 0,1402 punto porcentual del parcial. Con desviación real de 0,60 punto, el orden se invierte de forma brutal: 0,5899 del total contra 0,3843 del parcial. El agrupamiento parcial nunca es el peor de los tres en ningún escenario probado, y eso es lo que lo recomienda.