Estadística

Modelo jerárquico en test A/B: agrupamiento parcial

El modelo jerárquico estima la variación entre segmentos en vez de suponerla. La cuenta en 8 segmentos, el tau mal identificado y el ranking invertido.

Ilustración plana de ocho barras de alturas diferentes unidas por hilos elásticos curvos, las más altas doblándose hacia abajo y las más bajas hacia arriba

Usted corrió un test, dio positivo en el agregado, y ahora tiene ocho lecturas de segmento en pantalla. Una de ellas muestra más 21 por ciento. La pregunta no es si usted le cree, sino cuánto. El modelo jerárquico responde eso con un número: estima cuánta variación REAL existe entre segmentos y usa ese valor para decidir el peso de cada lectura individual. En el ejemplo trabajado de esta guía, la desviación entre segmentos da 0,2420 punto porcentual, el campeón bruto de más 1,219 punto cae a más 0,392, y el podio cambia de dueño: quien asume el liderazgo es un segmento con lectura bruta menor y una muestra 6,8 veces mayor. Esta guía muestra el modelo línea por línea, por qué estimar la desviación entre segmentos es la parte difícil (su intervalo va de 0,0000 a 0,6000 punto con 8 segmentos), dónde la versión simplificada por momentos miente sobre su propia precisión, y la simulación que dice cuándo agrupar parcialmente le gana a agruparlo todo. Forma parte de nuestra guía completa de test A/B y es el paso siguiente al encogimiento bayesiano.

El test que usted ya corrió

El ejemplo es un único test de reordenación de la página de producto, con lectura por dispositivo y canal. Primero el agregado, que es la lectura que va al informe:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Con 60.000 visitantes y 2.873 conversiones en el control y 59.920 visitantes y 3.038 conversiones en la variación, la calculadora devuelve 4,7883 por ciento contra 5,0701 por ciento, una ganancia relativa de 5,884 por ciento, valor p de 0,024218 e intervalo de confianza de más 0,0367 a más 0,5268 punto porcentual. Pasa en 0,05, con poca holgura.

Ahora la tabla por segmento, que es donde el informe se convierte en discusión:

segmento visitantes por variación base variación diferencia relativo valor p
Desktop / búsqueda orgánica 14.200 5,500% 6,100% +0,600 pp +10,91% 0,030565
Desktop / búsqueda pagada 9.600 4,896% 5,449% +0,553 pp +11,30% 0,083781
Desktop / email 4.300 6,907% 7,710% +0,803 pp +11,63% 0,152864
Desktop / directo 6.100 5,000% 5,148% +0,148 pp +2,96% 0,709749
Móvil / búsqueda orgánica 13.800 4,000% 3,897% −0,103 pp −2,58% 0,660388
Móvil / búsqueda pagada 8.200 3,402% 3,105% −0,297 pp −8,74% 0,283598
Móvil / email 2.100 5,762% 6,981% +1,219 pp +21,16% 0,105013
Móvil / directo 1.700 4,000% 4,012% +0,012 pp +0,29% 0,986167

La lectura ingenua de esta tabla produce tres conclusiones, y las tres están equivocadas: que el test funciona muy bien en el email móvil, que perjudica la búsqueda pagada móvil, y que desktop y móvil reaccionan de formas opuestas. Nada de eso está establecido por los datos.

Tres formas de responder, y solo una es razonable

Frente a ocho segmentos, existen tres posturas posibles:

Sin agrupamiento, agrupamiento total y agrupamiento parcial en las mismas ocho lecturasTres franjas horizontales. En la primera, sin agrupamiento, ocho puntos quedan dispersos de menos cero coma tres a más uno coma dos punto porcentual. En la segunda, agrupamiento total, los ocho puntos colapsan en un único valor central de más cero coma dos punto. En la tercera, agrupamiento parcial, los ocho puntos quedan entre esos dos extremos, más cerca del centro cuanto menor es la muestra del segmento.efecto estimado por segmento, en puntos porcentualessin agrupamientocada segmento por síagrupamiento totalun efecto para todoslos ocho colapsan aquíagrup. parcialpeso por precisión−0,4+0,2+1,3cree en todo, incluso en el ruido del segmento de 1.700 visitantesno cree en nada, borra la diferencia real entre desktop y móvil
Sin agrupamiento y con agrupamiento total son los dos extremos. El agrupamiento parcial es una familia de respuestas entre ellos, y el modelo elige dónde detenerse.

No agrupar nada es creer que 2.100 visitantes miden el efecto en el email móvil tan bien como 14.200 lo miden en la búsqueda orgánica desktop. Agruparlo todo es suponer que el efecto es idéntico en los ocho, lo que borra por decreto cualquier diferencia real. La tercera vía no es un punto medio arbitrario: cuánto agrupar es un parámetro que se estima.

El modelo jerárquico, en tres líneas

El modelo jerárquico normal-normal, escrito para segmentos de test A/B, cabe en tres afirmaciones:

  1. Cada segmento tiene un efecto verdadero propio, llámelo delta_j.
  2. Esos efectos verdaderos vienen de una distribución común, con media mu y desviación tau.
  3. La lectura observada d_j es el efecto verdadero más un error de medición, con desviación se_j (el error estándar de la diferencia en ese segmento, que usted ya tiene).

En notación: d_j ~ Normal(delta_j, se_j) y delta_j ~ Normal(mu, tau). Solo existen dos números nuevos en el mundo, mu y tau, y los dos salen de los datos.

mu es el efecto medio entre segmentos. tau es el número que lo decide todo: si tau es cero, los efectos verdaderos son idénticos y el modelo colapsa en agrupamiento total; si tau es gigante, cada segmento se vuelve independiente y el modelo colapsa en no agrupar nada. Por eso la pelea es sobre tau.

Estimar tau de verdad, no con una fórmula cerrada

Existen dos caminos comunes para tau, y no son equivalentes.

El camino por momentos (el estimador de DerSimonian y Laird, usado en meta-análisis y en nuestra pieza sobre encogimiento bayesiano) usa el estadístico de heterogeneidad Q. En los datos de arriba, Q vale 11,2708 con 7 grados de libertad, y la fórmula devuelve tau igual a 0,2780 punto porcentual.

El camino por verosimilitud maximiza la probabilidad de los datos bajo el modelo, variando tau y recalculando mu en cada paso. Aquí devuelve tau igual a 0,2420 punto porcentual y mu igual a 0,2355 punto (error estándar de 0,1569).

Los dos valores están cerca, y ese es el resultado tranquilizador. El resultado inquietante es lo que aparece cuando se mira la curva entera en lugar del punto máximo:

Verosimilitud perfilada de la desviación entre segmentos, con el intervalo de 95 por cientoCurva que sube desde cero, alcanza el máximo en cero coma veinticuatro punto porcentual y cae lentamente. La franja destacada del intervalo de 95 por ciento va de cero a cero coma sesenta punto porcentual, es decir, cubre incluso el valor cero, lo que significa que los datos no descartan la ausencia total de heterogeneidad.cuánto restringen los datos a tau, con 8 segmentosmáximo: tau = 0,2420 pp0,000,240,601,00tau, desviación entre segmentos, en puntos porcentualesintervalo de 95%: 0,0000 a 0,6000 ppla cola es larga: tau grande no se descartatau igual a cero tampoco se descarta
Con 8 segmentos, el punto máximo es 0,2420, pero el intervalo de 95 por ciento por verosimilitud perfilada cubre de 0,0000 a 0,6000 punto porcentual. El parámetro que lo decide todo es el peor estimado de todos.

Este es el hecho central sobre los modelos jerárquicos en test A/B: tau está mal identificado porque el número de segmentos es pequeño. Usted tiene 119.920 visitantes en el test, que es bastante, pero solo 8 observaciones para estimar la variación ENTRE segmentos, que es poquísimo. Andrew Gelman trata exactamente este caso en Bayesian Analysis (2006) y recomienda un prior uniforme en la desviación jerárquica, con la familia media-t “cuando el número de grupos es pequeño”.

El factor de encogimiento, segmento por segmento

Con tau estimado, el peso de cada lectura sale de una sola cuenta: el factor de encogimiento B_j = tau² / (tau² + se_j²). Es la fracción de la propia lectura que sobrevive.

segmento error estándar factor B lectura bruta después del encogimiento
Móvil / búsqueda orgánica 0,235 pp 0,516 −0,103 pp +0,061 pp
Desktop / búsqueda pagada 0,320 pp 0,364 +0,553 pp +0,351 pp
Móvil / búsqueda pagada 0,277 pp 0,433 −0,297 pp +0,005 pp
Desktop / búsqueda orgánica 0,277 pp 0,432 +0,600 pp +0,393 pp
Desktop / directo 0,398 pp 0,270 +0,148 pp +0,212 pp
Desktop / email 0,562 pp 0,156 +0,803 pp +0,324 pp
Móvil / directo 0,671 pp 0,115 +0,012 pp +0,210 pp
Móvil / email 0,752 pp 0,094 +1,219 pp +0,328 pp

Lea la última fila con atención. El segmento con la lectura más espectacular del test tiene un factor de encogimiento de 0,094: se toma en serio el 9,4 por ciento de su lectura, y el otro 90,6 por ciento viene del efecto medio del test. No es arbitrariedad, es la consecuencia de tener 2.100 visitantes por variación en un segmento cuyo error estándar (0,752 pp) es tres veces mayor que la desviación real entre segmentos (0,242 pp). La señal simplemente no está ahí.

Observe también Móvil / búsqueda pagada: la lectura bruta es negativa (−0,297 pp, que cualquiera leería como “el test empeora la búsqueda pagada móvil”) y el resultado después del encogimiento es más 0,005 punto, es decir, nada. La conclusión de daño al segmento nunca existió.

Dónde miente la versión simplificada

Hasta aquí la cuenta es la misma que haría un encogimiento por momentos. La diferencia del modelo jerárquico completo aparece en el PASO SIGUIENTE: en lugar de fijar tau en 0,2420 y tratarlo como conocido, integra la incertidumbre sobre tau (aquella curva ancha de arriba) en el resultado final de cada segmento. Corriendo esto con un prior media-normal de escala 0,5 punto porcentual sobre tau, como Gelman recomienda para pocos grupos:

segmento plug-in (tau fijo) error del plug-in modelo completo error del modelo P(efecto positivo)
Desktop / búsqueda orgánica +0,393 pp 0,182 pp +0,406 pp 0,236 pp 95,7%
Desktop / búsqueda pagada +0,351 pp 0,193 pp +0,368 pp 0,247 pp 93,2%
Desktop / email +0,324 pp 0,222 pp +0,369 pp 0,322 pp 87,4%
Desktop / directo +0,212 pp 0,207 pp +0,205 pp 0,257 pp 78,8%
Móvil / búsqueda orgánica +0,061 pp 0,168 pp +0,051 pp 0,202 pp 59,9%
Móvil / búsqueda pagada +0,005 pp 0,182 pp −0,020 pp 0,242 pp 46,7%
Móvil / email +0,328 pp 0,230 pp +0,392 pp 0,362 pp 86,1%
Móvil / directo +0,210 pp 0,228 pp +0,199 pp 0,318 pp 73,4%

Las medias casi no se mueven, y por eso el plug-in es popular. Los errores estándar se mueven mucho. En el segmento de email móvil, el error del modelo completo (0,362) es 57,4 por ciento mayor que el del plug-in (0,230). En el de búsqueda orgánica desktop, 29,7 por ciento mayor. El plug-in no se equivoca en la estimación, se equivoca en la confianza en la estimación, siempre hacia el lado optimista, porque finge conocer tau cuando el intervalo de tau cubre de cero a 0,60.

Ancho del intervalo del plug-in contra el modelo completo en tres segmentosTres pares de barras horizontales de incertidumbre. En cada par, la barra del modelo completo es visiblemente más larga que la del plug-in con tau fijo. La diferencia es de veintinueve coma siete por ciento en la búsqueda orgánica desktop, cuarenta y cinco por ciento en el directo móvil y cincuenta y siete coma cuatro por ciento en el email móvil, que es el segmento de menor muestra.error estándar del efecto del segmento: lo que el plug-in escondeDesktop / búsqueda orgánica+29,7%Móvil / directo+39,5%Móvil / email+57,4%plug-in, tau fijo en 0,2420modelo completo, tau integradocuanto menor la muestra del segmento, mayor la diferencia entre los dos
La estimación puntual casi no cambia. El intervalo cambia de 29,7 a 57,4 por ciento, siempre en el sentido de ser más ancho de lo que el plug-in afirma.

Fíjese además en la última columna de la tabla: un único segmento de los ocho supera el 95 por ciento de probabilidad de efecto positivo. La tabla bruta tenía tres segmentos con valor p por debajo de 0,16 y uno por debajo de 0,05. Después del modelo, existe una lectura defendible y siete indefinidas.

La inversión del ranking

Aquí está el resultado que cambia decisiones. Ordenando los ocho segmentos por la lectura bruta y después por el modelo completo:

Ranking de los segmentos por la lectura bruta y por el modelo jerárquico completoDos columnas unidas por líneas. En la columna de la izquierda, ordenada por la lectura bruta, el primer lugar es Móvil email y el tercero es Desktop búsqueda orgánica. En la columna de la derecha, ordenada por el modelo completo, Desktop búsqueda orgánica asume el primer lugar, Móvil email cae al segundo y Desktop email cae del segundo al tercero. Las últimas cinco posiciones no cambian de orden.por la lectura brutapor el modelo completo1. Móvil / email2. Desktop / email3. Desktop / búsq. orgánica4. Desktop / búsq. pagada5. Desktop / directo6. Móvil / directo7. Móvil / búsq. orgánica8. Móvil / búsq. pagada1. Desktop / búsq. orgánica2. Móvil / email3. Desktop / email4. Desktop / búsq. pagada5. Desktop / directo6. Móvil / directo7. Móvil / búsq. orgánica8. Móvil / búsq. pagadasolo cambian las tres primeras posiciones, justo las tres que alguien usaría para decidir dónde invertir.
El cambio ocurre en la cima, donde se toma la decisión. Los segmentos de muestra pequeña suben en el ranking bruto y bajan en el ranking del modelo.

Desktop / búsqueda orgánica tenía una lectura bruta MENOR que otros dos segmentos y asume el liderazgo porque tiene 14.200 visitantes por variación contra 2.100 y 4.300. Es la misma lógica de Gelman, Hill y Yajima en “Why we (usually) don’t have to worry about multiple comparisons”: en lugar de mantener quietos los centros de los intervalos y ensancharlos para corregir por comparaciones múltiples, el modelo multinivel desplaza los centros unos hacia los otros.

Ejemplo trabajado: el campeón solo en la calculadora

Vale la pena tomar el segmento campeón y mirarlo de cerca, con la misma calculadora del comienzo. Sus números: 2.100 visitantes y 121 conversiones en el control, 2.120 visitantes y 148 conversiones en la variación.

Eso devuelve 5,762 por ciento contra 6,981 por ciento, ganancia relativa de 21,16 por ciento, valor p de 0,105013 e intervalo de confianza de menos 0,254 a más 2,692 punto porcentual. Su intervalo tiene 2,95 puntos porcentuales de ancho, lo que es diez veces el ancho del intervalo del agregado (0,49 punto). Ese es el campeón: un número enorme dentro de un intervalo que va de “empeora un poco” a “mejora cuatro veces más que el agregado”.

No hace falta ningún modelo jerárquico para desconfiar de él. Basta con leer el intervalo. Lo que el modelo agrega es el SUSTITUTO: en lugar de “no sabemos”, entrega más 0,392 punto porcentual con un error de 0,362, que es una estimación utilizable.

Cuánto tráfico necesitaría un segmento

La pregunta natural del equipo es cuánto faltaría para leer esos segmentos de verdad. La calculadora de muestra responde:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Con una base de 4 por ciento y un efecto real de más 0,30 punto porcentual (que es el orden de magnitud de lo que el modelo estima), el requisito es de 69.379 visitantes por variación, con 95 por ciento de confianza y 80 por ciento de poder. A 30.000 visitantes por semana en todo el sitio, y siendo el segmento una fracción de eso, ese número no se alcanza: 33 días solo para el segmento, si fuera el sitio entero.

El otro lado de la misma cuenta, y el más útil para pegar en el informe:

segmento muestra por variación efecto mínimo detectable
Desktop / búsqueda orgánica 14.200 +13,78% relativo
Móvil / email 2.100 +34,97% relativo
agregado del test 60.000 +7,21% relativo

El segmento de email móvil solo puede detectar efectos por encima de más 34,97 por ciento relativo. Leyó más 21,16 por ciento. Un segmento que no tiene poder para detectar el efecto que reportó está reportando ruido, y su lectura solo existe porque alguien fue a mirar. Es el mismo mecanismo de la maldición del ganador y del error de magnitud que Gelman y Carlin llaman razón de exageración.

Cuánto gana de verdad el agrupamiento parcial

Falta la pregunta honesta: ¿el agrupamiento parcial siempre es mejor? Corrimos una simulación para esta guía, con 20.000 repeticiones, usando exactamente los ocho errores estándar de la tabla de arriba, un efecto medio verdadero de 0,25 punto porcentual y variando la desviación real entre segmentos. La métrica es la raíz del error cuadrático medio contra los efectos verdaderos, en puntos porcentuales (menor es mejor):

desviación real entre segmentos sin agrupamiento agrupamiento total agrupamiento parcial
0,00 pp 0,4734 0,1206 0,1402
0,10 pp 0,4739 0,1556 0,1698
0,25 pp 0,4746 0,2705 0,2554
0,60 pp 0,4748 0,5899 0,3843
1,20 pp 0,4724 1,1654 0,4461

De ahí salen tres lecturas:

Esa última línea es el argumento práctico del método: usted no sabe cuál es el tau verdadero (su intervalo cubre de 0 a 0,60 en sus propios datos), así que elegir el estimador que se comporta bien en todo el rango es la decisión defendible.

Cómo correr un modelo jerárquico en la práctica

  1. Defina los segmentos ANTES del test, en el plan de análisis preregistrado. Ningún modelo salva un segmento elegido después de ver el resultado.
  2. Exporte la diferencia y el error estándar por segmento, no solo la tasa. El modelo necesita los dos.
  3. Estime tau por verosimilitud, no a ojo. Y mire la curva entera, no solo el máximo.
  4. Reporte también el intervalo de tau. Si cubre el cero, dígalo en el informe: significa que el test no estableció heterogeneidad alguna.
  5. Integre la incertidumbre de tau en lugar de fijarla, o acepte que sus intervalos por segmento son de 30 a 57 por ciento más estrechos de lo que deberían.
  6. Use un prior media-normal o media-t en la escala de tau cuando haya pocos segmentos, y declare la escala elegida. Con 8 grupos, esa elección aparece en el resultado.
  7. Decida por el ranking del modelo, nunca por el ranking bruto. Solo en la cima cambió el orden, y la cima es lo que se va a convertir en inversión.

Errores comunes

Hágalo automático con Donnu

Esta cuenta siempre tropieza en el mismo lugar: para estimar tau hace falta tener la diferencia Y el error estándar de cada segmento declarado antes del test, guardados juntos. Un panel que exporta solo la tasa de conversión por segmento no permite armar el modelo, y reconstruir eso después, a mano, es donde el equipo se rinde.

Donnu registra la configuración del experimento en el momento en que se crea, incluidos los segmentos declarados y la métrica primaria, y mantiene el historial por experimento. Eso deja la lectura por segmento disponible con la muestra y la varianza de cada uno, que es exactamente el insumo del agrupamiento parcial.

Y queda la recomendación más práctica de esta guía: antes de aprobar cualquier decisión basada en un segmento, calcule el efecto mínimo detectable de ese segmento con la muestra que tuvo. Si el efecto reportado es menor que el mínimo detectable, la lectura es ruido y ningún modelo la va a salvar. La calculadora de tamaño de muestra lo resuelve en diez segundos.

Referencias

Lee también: Encogimiento bayesiano · Efecto heterogéneo por segmento · La maldición del ganador · Meta-análisis de tests A/B · Muchas métricas en un test A/B · Calculadora de significancia · Leia em português · Read in English

Preguntas frecuentes

¿Qué es un modelo jerárquico en un test A/B?
Es un modelo que trata los efectos de los segmentos como provenientes de una misma distribución, con un efecto medio y una desviación entre segmentos. En lugar de suponer que todos los segmentos tienen el mismo efecto, o que cada uno tiene su propio efecto independiente, estima cuánta variación real existe entre ellos a partir de los propios datos y usa ese número para decidir cuánto confiar en la lectura de cada segmento.
¿Cuál es la diferencia entre el modelo jerárquico y el encogimiento por momentos?
El encogimiento por momentos estima la desviación entre segmentos con una fórmula cerrada y después trata ese valor como si fuera conocido. El modelo jerárquico completo estima la misma desviación por verosimilitud y después integra la incertidumbre que queda sobre ella. En el ejemplo de esta guía, los dos caminos dan desviaciones parecidas, 0,2420 punto porcentual contra 0,2780, pero el intervalo del plug-in queda entre 23 y 57 por ciento más estrecho que el del modelo completo, es decir, el plug-in parece más preciso de lo que es.
¿Por qué la desviación entre segmentos suele estar mal estimada?
Porque el número de segmentos es pequeño. En el ejemplo de esta guía, con 8 segmentos, la estimación de máxima verosimilitud de la desviación es 0,2420 punto porcentual, pero el intervalo de 95 por ciento por verosimilitud perfilada va de 0,0000 a 0,6000 punto. Es decir, los datos no descartan ni la ausencia de heterogeneidad ni una heterogeneidad grande. Andrew Gelman muestra que, con pocos grupos, la elección del prior para esa desviación deja de ser inocua.
¿El modelo jerárquico puede cambiar cuál es el mejor segmento?
Puede, y lo cambió en el ejemplo de esta guía. El segmento con la mayor lectura bruta es Móvil email, con más 1,219 punto porcentual y más 21,16 por ciento relativo. Después del modelo completo, cae a más 0,392 punto y pierde el liderazgo frente a Desktop búsqueda orgánica, que tenía una lectura bruta menor y una muestra 6,8 veces mayor. El cambio de ranking ocurre porque el modelo descuenta cada lectura según su precisión.
¿Cuántos visitantes necesita un segmento para leerse por sí solo?
Muchos más de lo que sugiere la intuición. En el ejemplo de esta guía, el segmento Móvil email tiene 2.100 visitantes por variación y una base de 5,762 por ciento, lo que da un efecto mínimo detectable de más 34,97 por ciento relativo. Para leer con poder de 80 por ciento un efecto de más 0,30 punto porcentual sobre una base de 4 por ciento, harían falta 69.379 visitantes por variación, o 33 días a 30.000 visitantes por semana.
¿El agrupamiento parcial siempre es mejor que el agrupamiento total?
No en todos los escenarios, y vale la pena decirlo con honestidad. En una simulación de 20.000 repeticiones hecha para esta guía, con desviación real entre segmentos de cero, gana el agrupamiento total, con error cuadrático medio de 0,1206 contra 0,1402 punto porcentual del parcial. Con desviación real de 0,60 punto, el orden se invierte de forma brutal: 0,5899 del total contra 0,3843 del parcial. El agrupamiento parcial nunca es el peor de los tres en ningún escenario probado, y eso es lo que lo recomienda.