Estadística

Encogimiento Bayesiano: por qué el mejor segmento miente

El encogimiento bayesiano empírico lleva cada segmento a la media del test. La cuenta en ocho segmentos, el factor de encogimiento y cuándo hay cima real.

Ilustración plana de decenas de esferas dispersas tiradas por hilos finos hasta alinearse en una única franja central

Todo test A/B con segmentación produce un ranking, y la cima de ese ranking casi siempre pertenece al segmento con menos tráfico. No es coincidencia: una estimación grande es subproducto de un error estándar grande. El encogimiento bayesiano empírico corrige esto tirando de cada segmento hacia la media del test, con una fuerza proporcional al ruido de ese segmento. En el ejemplo trabajado de esta guía, ocho segmentos de un mismo test tienen efecto bruto de más 0,3000 a más 2,2500 puntos porcentuales, y la dispersión observada entre ellos es MENOR de lo que el azar solo produciría: la varianza entre segmentos estimada da cero y los ocho colapsan en el mismo valor, más 0,8723 punto porcentual. Esta guía muestra la cuenta completa, el caso en que la heterogeneidad es real y el encogimiento es solo parcial, lo que Efron y Morris midieron cuando había respuesta conocida, y por qué encoger es diferente de corregir por comparaciones múltiples. Forma parte de nuestra guía completa de test A/B y es la pieza que faltaba al lado de efecto heterogéneo por segmento.

El informe que todo el mundo ya leyó

El test terminó y ganó. Alguien abre el corte por segmento y trae el titular: “funcionó MUY bien en la app iOS, más 2,25 puntos porcentuales, casi el triple de la media”. La pregunta que viene después es siempre la misma: ¿lanzamos primero solo para iOS? ¿Invertimos en iOS?

Vale la pena mirar lo que sostiene ese número antes de responder. Son ocho segmentos con tamaños muy diferentes, desde el email con 1.500 visitantes por brazo hasta la web móvil orgánica con 15.000. Y el efecto de cada uno fue medido con la precisión que su tamaño permite, no con la precisión que sugiere el titular.

segmento control variación efecto bruto error estándar valor p
app iOS 2.000 / 100 = 5,0000% 2.000 / 145 = 7,2500% más 2,2500 pp 0,7574 0,003005
app Android 2.500 / 125 = 5,0000% 2.500 / 150 = 6,0000% más 1,0000 pp 0,6447 0,120948
web móvil orgánica 15.000 / 750 = 5,0000% 15.000 / 888 = 5,9200% más 0,9200 pp 0,2623 0,000454
retorno directo 8.000 / 400 = 5,0000% 8.000 / 469 = 5,8625% más 0,8625 pp 0,3583 0,016087
escritorio orgánico 12.000 / 600 = 5,0000% 12.000 / 703 = 5,8583% más 0,8583 pp 0,2925 0,003344
escritorio búsqueda pagada 3.000 / 150 = 5,0000% 3.000 / 172 = 5,7333% más 0,7333 pp 0,5818 0,207563
email 1.500 / 75 = 5,0000% 1.500 / 84 = 5,6000% más 0,6000 pp 0,8180 0,463285
web móvil social 4.000 / 200 = 5,0000% 4.000 / 212 = 5,3000% más 0,3000 pp 0,4942 0,543827

Sume todo y el test global es 48.000 / 2.400 contra 48.000 / 2.823, es decir, 5,00 por ciento contra 5,88 por ciento. Pegue esos cuatro números en la calculadora de abajo:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

El resultado es más 17,6 por ciento relativo, con un valor p tan pequeño que la pantalla se satura en “menor que 0,0001” y un intervalo de confianza de más 0,6 a más 1,2 punto. Llevando las cuentas a más decimales, la diferencia absoluta es de más 0,8813 punto porcentual, el valor p es 0,0000000018 y el intervalo va de más 0,5943 a más 1,1682 punto. Un test sólido, sin ambigüedad.

Ahora mire de nuevo la tabla por segmento, ordenada por efecto bruto. Los dos primeros lugares son los dos segmentos más pequeños del test. El tercer lugar es el segmento más grande del test. Eso no es un patrón de negocio. Es un patrón de aritmética.

Una estimación grande es subproducto de un error estándar grande

Gelman, Hill y Yajima formulan el mecanismo en una frase que merece la lectura literal: las estimaciones grandes son, en realidad, un subproducto de errores estándar grandes. El argumento es geométrico, no de estadística avanzada.

Dos distribuciones muestrales con el mismo efecto verdadero y precisiones diferentesDos curvas en forma de campana centradas en el mismo valor verdadero. La curva estrecha representa un segmento grande y casi toda su masa queda cerca del centro. La curva ancha representa un segmento pequeño y reparte una masa considerable hacia valores muy por encima del centro. La cima de cualquier ranking de estimaciones crudas tiende a venir de la curva ancha, incluso cuando las dos miden exactamente el mismo efecto.efecto verdadero, igual en los dossegmento grande, error estándar 0,26segmento pequeño, error estándar 0,82solo la curva ancha alcanza esta franjala cima de un ranking de estimaciones crudas es una selección por varianza, no por desempeño.
Las dos curvas miden el mismo efecto. Solo una de ellas consigue producir una lectura de más 2,25 puntos, y no es la precisa.

Si ocho segmentos tienen exactamente el mismo efecto verdadero, ordenarlos por la estimación cruda es ordenarlos por el ruido. El primer lugar es casi siempre el segmento en el que el azar tuvo más espacio para trabajar. Es el mismo mecanismo que hay detrás de la maldición del ganador y de la regresión a la media: cuando usted selecciona por el extremo de una lectura ruidosa, selecciona ruido junto con ella.

La corrección clásica para esto es ensanchar los intervalos, con Bonferroni o con control de la tasa de descubrimientos falsos. El encogimiento hace otra cosa, y Gelman, Hill y Yajima marcan el contraste con precisión: los modelos multinivel hacen agrupamiento parcial, desplazando las estimaciones unas hacia las otras, mientras que los procedimientos clásicos mantienen quietos los centros de los intervalos y ajustan por comparaciones múltiples haciendo los intervalos más anchos. Un enfoque toca la barra de error. El otro toca el número.

La cuenta del encogimiento bayesiano, en tres pasos

El procedimiento es corto y cabe en una hoja de cálculo.

Paso 1: la media del conjunto, ponderada por la precisión. Cada segmento entra con un peso igual al inverso del cuadrado de su error estándar. En los ocho segmentos de arriba, eso da más 0,8723 punto porcentual, con error estándar de 0,1463.

Paso 2: cuánto se dispersan los segmentos más allá del azar. Sume, para cada segmento, el cuadrado de la distancia hasta esa media, dividido por la varianza del segmento. Esa suma es la Q de Cochran. Si los ocho midieran exactamente el mismo efecto, Q quedaría alrededor de 7, que es el número de grados de libertad. Aquí Q vale 4,8926 con 7 grados de libertad. Es decir, los ocho segmentos están MENOS dispersos de lo que el azar solo produciría.

Paso 3: la varianza entre segmentos, y el factor de encogimiento. La estimación por momentos resta los grados de libertad a Q y nunca baja de cero. Con Q por debajo de los grados de libertad, da exactamente cero. Y el factor de encogimiento de cada segmento es la varianza entre segmentos dividida por la suma de ella con la varianza del propio segmento. Con varianza entre segmentos igual a cero, el factor es cero para los ocho.

segmento efecto bruto error estándar factor de encogimiento efecto encogido
app iOS más 2,2500 pp 0,7574 0,0000 más 0,8723 pp
app Android más 1,0000 pp 0,6447 0,0000 más 0,8723 pp
web móvil orgánica más 0,9200 pp 0,2623 0,0000 más 0,8723 pp
retorno directo más 0,8625 pp 0,3583 0,0000 más 0,8723 pp
escritorio orgánico más 0,8583 pp 0,2925 0,0000 más 0,8723 pp
escritorio búsqueda pagada más 0,7333 pp 0,5818 0,0000 más 0,8723 pp
email más 0,6000 pp 0,8180 0,0000 más 0,8723 pp
web móvil social más 0,3000 pp 0,4942 0,0000 más 0,8723 pp

No quedó ranking. La lectura honesta de estos ocho segmentos es que el efecto es el mismo en todos, y la mejor estimación para cada uno es la media del test entero. La variación de más 0,3000 a más 2,2500 punto porcentual es enteramente compatible con un único efecto subyacente medido ocho veces con precisiones diferentes.

Esto no es un artificio del ejemplo: es el comportamiento normal de un agrupamiento parcial cuando no hay ninguna heterogeneidad en los datos. Y es una respuesta mucho más útil que “iOS tuvo un valor p de 0,003005, así que el efecto en iOS es real y es enorme”.

Cuando la heterogeneidad ES real: el encogimiento bayesiano se vuelve parcial

Cambie un único segmento. Suponga que el cambio realmente perjudica al público que llega desde redes sociales, y la web móvil social pasa de 4.000 / 212 a 4.000 / 128, es decir, de 5,3000 a 3,2000 por ciento, un efecto de menos 1,8000 punto porcentual.

Con ese único segmento cambiado, Q sube de 4,8926 a 37,2859 contra los mismos 7 grados de libertad, y la varianza entre segmentos deja de ser cero: la desviación entre segmentos estimada pasa a ser 0,8906 punto porcentual. Ahora el encogimiento tiene de dónde tirar.

segmento efecto bruto error estándar factor de encogimiento efecto encogido error estándar posterior
app iOS más 2,2500 pp 0,7574 0,5802 más 1,5725 pp 0,5802
app Android más 1,0000 pp 0,6447 0,6562 más 0,8748 pp 0,5246
web móvil orgánica más 0,9200 pp 0,2623 0,9202 más 0,8973 pp 0,2519
retorno directo más 0,8625 pp 0,3583 0,8607 más 0,8309 pp 0,3330
escritorio orgánico más 0,8583 pp 0,2925 0,9026 más 0,8367 pp 0,2782
escritorio búsqueda pagada más 0,7333 pp 0,5818 0,7009 más 0,7042 pp 0,4890
email más 0,6000 pp 0,8180 0,5424 más 0,6165 pp 0,6061
web móvil social menos 1,8000 pp 0,4429 0,8017 menos 1,3169 pp 0,3976

Tres lecturas de esta tabla, y las tres importan:

  1. El segmento realmente diferente sobrevive. La web móvil social pasa de menos 1,8000 a menos 1,3169 punto porcentual. Se encogió, sigue negativa, sigue siendo la única negativa y sigue siendo el hallazgo del informe.
  2. El falso primer lugar se encoge mucho más. iOS pierde 0,6775 punto (de 2,2500 a 1,5725) porque su factor es 0,5802: casi la mitad de su estimación es sustituida por la media del conjunto. La web móvil orgánica, con el doble de tamaño, tiene factor 0,9202 y pierde apenas 0,0227 punto.
  3. El ranking cambia de orden. En la lectura cruda, la web móvil orgánica es la tercera. En la encogida, es la segunda, por delante de Android, porque su lectura es la que menos depende de la suerte.
Efecto bruto y efecto encogido de cada segmento en el escenario con heterogeneidad realOcho líneas horizontales, una por segmento. Cada línea une el efecto bruto con el efecto encogido. Los segmentos pequeños, como app iOS y app Android, tienen líneas largas porque fueron llevados con fuerza hacia la media del conjunto. Los segmentos grandes, como web móvil orgánica y escritorio orgánico, tienen líneas casi invisibles. El segmento con efecto negativo real se encoge pero sigue claramente por debajo de cero.ceromedia del conjunto: más 0,6360app iOS2,2500app Android1,0000web móvil orgánica0,9200retorno directo0,8625escritorio orgánico0,8583escritorio búsqueda pagada0,7333email0,6000web móvil socialmenos 1,8000efecto brutoencogidocuanto más larga la línea, menos tenía el segmento para decir por sí mismo.
La longitud de cada línea es la cantidad de información que ese segmento NO tenía. En los dos segmentos más grandes es casi cero.

El factor de encogimiento tiene una lectura directa: es la fracción de la estimación que viene del propio segmento. Un factor de 0,92 quiere decir que 92 por ciento del número es el segmento hablando y 8 por ciento es el resto del test prestando información. Un factor de 0,54 quiere decir que casi la mitad del número no es de ese segmento.

Factor de encogimiento por tamaño del segmentoBarras horizontales muestran el factor de encogimiento de cada segmento en el escenario con heterogeneidad real, ordenadas del segmento más pequeño al más grande. El segmento de email, con mil quinientos visitantes por brazo, queda en cero coma cinco cuatro dos cuatro. El segmento de web móvil orgánica, con quince mil visitantes por brazo, queda en cero coma nueve dos cero dos. La barra crece de forma continua con el tamaño del segmento.cuánto del número es el propio segmento hablandoemail, 1.5000,5424iOS, 2.0000,5802Android, 2.5000,6562búsqueda pagada, 3.0000,7009social, 4.0000,8017directo, 8.0000,8607orgánico, 12.000 y 15.0000,9202ningún segmento llega a 1. Ningún test, por grande que sea, habla solo por sí mismo.
El factor sube con el tamaño y nunca llega a 1. Incluso el segmento más grande del test toma prestada un poco de información de los demás.

Lo que Stein demostró, y lo que Efron y Morris midieron

La idea es de 1961 y suena equivocada la primera vez que se oye: para estimar tres o más medias al mismo tiempo, existe un estimador que se equivoca menos, en el agregado, que usar cada media muestral por su cuenta. Menos, siempre, independientemente de cuáles sean los valores verdaderos.

Efron y Morris lo pusieron a prueba en un caso con respuestas conocidas. Tomaron los promedios de bateo de 18 jugadores de las Grandes Ligas de béisbol en sus primeros 45 turnos oficiales al bate de la temporada de 1970, y usaron solo ese tramo para predecir el desempeño de cada uno en el resto de la temporada. El factor de encogimiento estimado fue tal que cada jugador quedó con 0,209 de su propio promedio y 0,791 del promedio del grupo.

Los números: el error cuadrático total de la media muestral cruda fue 17,56 y el del estimador encogido fue 5,01. La eficiencia, que ellos definen como la razón entre las dos pérdidas, es 3,50. Y el encogido quedó más cerca del valor verdadero en 15 de los 18 jugadores, equivocándose más en apenas 3.

Los 3 en que se equivocó más tienen un nombre que interesa: el primero de ellos es el mejor bateador de la lista, elegido a propósito por los autores para poner a prueba el método con al menos un parámetro extremo. Su promedio crudo en los 45 turnos era 0,400, el encogimiento lo bajó a 0,290 y el valor real en el resto de la temporada fue 0,346.

Ese es todo el intercambio, en un solo caso. El encogimiento acierta más en el conjunto y lo paga equivocándose más con quien es genuinamente excepcional. Si su pregunta es “cuál es la mejor estimación para cada uno de mis ocho segmentos”, el encogimiento es la mejor respuesta. Si su pregunta es “quién es el extremo verdadero”, sale caro.

Encoger no es corregir: las dos cuentas hacen cosas diferentes

Vale la pena separar bien los dos instrumentos, porque con frecuencia se presentan como competidores y resuelven problemas distintos.

corrección por comparaciones múltiples encogimiento bayesiano empírico
qué cambia el ancho del intervalo, o el umbral del valor p la estimación puntual
qué preserva la estimación puntual cruda el orden de magnitud de la incertidumbre
pregunta que responde cuántos descubrimientos falsos tolero en este conjunto cuál es la mejor estimación para cada elemento de este conjunto
depende de número de comparaciones hechas dispersión observada entre los elementos
efecto en el informe más segmentos dejan de ser significativos la cima baja, el fondo sube, el orden cambia

Gelman, Hill y Yajima van más allá y sostienen que el error de tipo I ni siquiera debería ser el foco de la preocupación, porque rara vez se cree que el efecto de un segmento sea exactamente cero. Lo que preocupa de verdad son los errores de signo, que ellos llaman error de tipo S, y los errores de magnitud, el tipo M: decir que el efecto es grande cuando está cerca de cero. Los estudios con poco poder son especialmente vulnerables al tipo M, porque una incertidumbre alta produce estimaciones grandes.

Eso describe con exactitud el segmento de 1.500 visitantes por brazo del informe del comienzo de esta guía.

Y existe un contrapunto honesto, del que el encogimiento no lo exime. La heterogeneidad real ocurre, e ignorarla sale caro. Dmitriev, Gupta, Kim y Vaz relatan un experimento en Bing que parecía exitoso, con un aumento de ingresos de 2,3 por ciento y una reducción del número de anuncios por página de 0,6 por ciento. Al segmentar por tipo de página, el número de anuncios por página cayó drásticamente, 2,3 por ciento, en las páginas recargadas, y en realidad AUMENTÓ 0,3 por ciento en las páginas originales, que eran las que importaban. La conclusión del equipo fue que el experimento no había cumplido su objetivo. La lección que extraen es evitar la trampa de suponer que el efecto es homogéneo entre todos los usuarios y consultas.

Las dos cosas son verdad al mismo tiempo: mirar los segmentos es obligatorio, y creer en el ranking crudo de los segmentos es ingenuo. El encogimiento es justamente lo que permite hacer lo primero sin cometer lo segundo.

Cómo aplicar esto en la práctica

  1. Declare los segmentos en el plan de análisis, antes de correr el test. El encogimiento no arregla un segmento pescado después de ver los datos; solo vuelve honesta la lectura de un conjunto definido de antemano.
  2. Reporte siempre las dos columnas. Bruto y encogido, lado a lado, con el error estándar de cada segmento visible. Esconder el bruto genera desconfianza y esconder el encogido genera decisiones equivocadas.
  3. Publique la Q y los grados de libertad. Es el número que responde “¿hay heterogeneidad aquí?” antes de cualquier discusión sobre qué segmento ganó.
  4. No interprete el factor de encogimiento como una nota del segmento. Mide tamaño de muestra, no calidad del público.
  5. Trate un segmento genuinamente negativo como hallazgo, no como ruido. En el escenario B, menos 1,3169 punto porcentual después de encogido sigue siendo motivo para investigar antes de lanzar.
  6. Si un segmento merece una decisión propia, merece un test propio. Un efecto de 0,9 punto sobre una base de 5 por ciento es un efecto relativo de 18 por ciento, lo que exige cerca de 9.986 visitantes por variación para detectarse con 80 por ciento de poder. El segmento de email, con 3.000 visitantes por semana, tardaría 47 días en llegar ahí por sí solo. Revise su caso en la calculadora de tamaño de muestra.
  7. Cuando la pregunta sea sobre varios tests en lugar de varios segmentos, el instrumento es el mismo con otro nombre: vea meta-análisis de tests A/B.

Errores comunes

Hágalo automático con Donnu

Para encoger un conjunto de segmentos usted necesita dos cosas por segmento: el efecto estimado y su error estándar. Parece trivial y es donde la mayoría de los informes se traba, porque el corte por segmento suele reconstruirse después, en el panel de análisis, a partir de atributos del usuario en su estado ACTUAL y no en el estado en que estaba cuando entró al test.

Cuando el atributo cambió después de la asignación, el segmento deja de ser un recorte previo al experimento y se vuelve consecuencia del experimento, y toda la cuenta de este artículo pierde sentido. Donnu registra el estado del usuario en el instante de la asignación, lo que deja cada corte con la definición congelada en el momento correcto y con el error estándar calculado sobre la muestra correcta.

El resto es aritmética de hoja de cálculo, y esta guía tiene todos los pasos. La calculadora de significancia cierra la lectura bruta de cada segmento, que sigue siendo el insumo del que sale todo lo demás.

Referencias

Lee también: Efecto heterogéneo por segmento · Meta-análisis de tests A/B · La maldición del ganador · Muchas métricas en un test A/B · Modelado de uplift · Calculadora de significancia · Leia em português · Read in English

Preguntas frecuentes

¿Qué es el encogimiento bayesiano empírico en un test A/B?
Es tirar de la estimación de cada segmento hacia la media de todos los segmentos, con una fuerza proporcional al ruido de ese segmento. Un segmento pequeño, con error estándar grande, es llevado casi hasta la media. Un segmento grande, con error estándar pequeño, casi no se mueve. El resultado es un conjunto de estimaciones que se equivoca menos en el agregado que la lectura cruda de cada segmento aislado.
¿Por qué el segmento con el mayor efecto suele ser el más pequeño?
Porque las estimaciones grandes son un subproducto de errores estándar grandes. Gelman, Hill y Yajima describen exactamente ese mecanismo: un estimador con desviación mayor tiene una probabilidad mucho mayor de producir una estimación grande en valor absoluto que un estimador preciso, incluso cuando el efecto verdadero es cero en los dos casos. En el ejemplo de esta guía, el segmento de 2.000 visitantes por brazo encabeza el ranking con más 2,2500 puntos porcentuales, y el encogimiento baja ese número a la media de más 0,8723 punto.
¿Cuál es la diferencia entre encoger y corregir por comparaciones múltiples?
La corrección clásica, como Bonferroni, mantiene quieta la estimación puntual y ensancha el intervalo. El encogimiento mueve la estimación puntual hacia las demás y no necesita ensanchar nada. Gelman, Hill y Yajima lo resumen así: los modelos multinivel hacen agrupamiento parcial desplazando las estimaciones unas hacia las otras, mientras que los procedimientos clásicos mantienen quietos los centros de los intervalos y ajustan por comparaciones múltiples haciendo los intervalos más anchos.
¿El encogimiento no borra un segmento que es realmente diferente?
No, y la cuenta muestra por qué. Cuando existe heterogeneidad real, la varianza entre segmentos estimada sube y el factor de encogimiento cae menos. En el escenario B de esta guía, un segmento con efecto verdadero negativo pasa de menos 1,8000 a menos 1,3169 punto porcentual, sigue siendo el peor del conjunto por amplio margen y sigue con signo negativo. Lo que el encogimiento borra es la diferencia que solo el azar produjo.
¿Cuánto gana realmente el encogimiento?
Efron y Morris lo midieron en un caso con respuesta conocida: 18 jugadores de béisbol, 45 turnos al bate cada uno. El error cuadrático total de la media muestral fue 17,56 y el del estimador de James y Stein fue 5,01, una eficiencia de 3,50. El estimador encogido quedó más cerca del valor verdadero en 15 de los 18 jugadores, y se equivocó más en 3.
¿Cuándo NO debo encoger?
Cuando la distribución de efectos tiene cola pesada y usted busca justamente los extremos. Azevedo, Deng, Montiel Olea, Rao y Weyl estimaron en Bing un coeficiente de cola bastante por debajo de 3 y concluyen que las ideas con estadística pequeña deben encogerse de forma agresiva, mientras que las ideas muy fuera de la curva probablemente son reales. El encogimiento con supuesto normal aplica la misma fuerza a los dos casos, y ahí es donde se equivoca.