Encogimiento Bayesiano: por qué el mejor segmento miente
El encogimiento bayesiano empírico lleva cada segmento a la media del test. La cuenta en ocho segmentos, el factor de encogimiento y cuándo hay cima real.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Todo test A/B con segmentación produce un ranking, y la cima de ese ranking casi siempre pertenece al segmento con menos tráfico. No es coincidencia: una estimación grande es subproducto de un error estándar grande. El encogimiento bayesiano empírico corrige esto tirando de cada segmento hacia la media del test, con una fuerza proporcional al ruido de ese segmento. En el ejemplo trabajado de esta guía, ocho segmentos de un mismo test tienen efecto bruto de más 0,3000 a más 2,2500 puntos porcentuales, y la dispersión observada entre ellos es MENOR de lo que el azar solo produciría: la varianza entre segmentos estimada da cero y los ocho colapsan en el mismo valor, más 0,8723 punto porcentual. Esta guía muestra la cuenta completa, el caso en que la heterogeneidad es real y el encogimiento es solo parcial, lo que Efron y Morris midieron cuando había respuesta conocida, y por qué encoger es diferente de corregir por comparaciones múltiples. Forma parte de nuestra guía completa de test A/B y es la pieza que faltaba al lado de efecto heterogéneo por segmento.
El informe que todo el mundo ya leyó
El test terminó y ganó. Alguien abre el corte por segmento y trae el titular: “funcionó MUY bien en la app iOS, más 2,25 puntos porcentuales, casi el triple de la media”. La pregunta que viene después es siempre la misma: ¿lanzamos primero solo para iOS? ¿Invertimos en iOS?
Vale la pena mirar lo que sostiene ese número antes de responder. Son ocho segmentos con tamaños muy diferentes, desde el email con 1.500 visitantes por brazo hasta la web móvil orgánica con 15.000. Y el efecto de cada uno fue medido con la precisión que su tamaño permite, no con la precisión que sugiere el titular.
| segmento | control | variación | efecto bruto | error estándar | valor p |
|---|---|---|---|---|---|
| app iOS | 2.000 / 100 = 5,0000% | 2.000 / 145 = 7,2500% | más 2,2500 pp | 0,7574 | 0,003005 |
| app Android | 2.500 / 125 = 5,0000% | 2.500 / 150 = 6,0000% | más 1,0000 pp | 0,6447 | 0,120948 |
| web móvil orgánica | 15.000 / 750 = 5,0000% | 15.000 / 888 = 5,9200% | más 0,9200 pp | 0,2623 | 0,000454 |
| retorno directo | 8.000 / 400 = 5,0000% | 8.000 / 469 = 5,8625% | más 0,8625 pp | 0,3583 | 0,016087 |
| escritorio orgánico | 12.000 / 600 = 5,0000% | 12.000 / 703 = 5,8583% | más 0,8583 pp | 0,2925 | 0,003344 |
| escritorio búsqueda pagada | 3.000 / 150 = 5,0000% | 3.000 / 172 = 5,7333% | más 0,7333 pp | 0,5818 | 0,207563 |
| 1.500 / 75 = 5,0000% | 1.500 / 84 = 5,6000% | más 0,6000 pp | 0,8180 | 0,463285 | |
| web móvil social | 4.000 / 200 = 5,0000% | 4.000 / 212 = 5,3000% | más 0,3000 pp | 0,4942 | 0,543827 |
Sume todo y el test global es 48.000 / 2.400 contra 48.000 / 2.823, es decir, 5,00 por ciento contra 5,88 por ciento. Pegue esos cuatro números en la calculadora de abajo:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
El resultado es más 17,6 por ciento relativo, con un valor p tan pequeño que la pantalla se satura en “menor que 0,0001” y un intervalo de confianza de más 0,6 a más 1,2 punto. Llevando las cuentas a más decimales, la diferencia absoluta es de más 0,8813 punto porcentual, el valor p es 0,0000000018 y el intervalo va de más 0,5943 a más 1,1682 punto. Un test sólido, sin ambigüedad.
Ahora mire de nuevo la tabla por segmento, ordenada por efecto bruto. Los dos primeros lugares son los dos segmentos más pequeños del test. El tercer lugar es el segmento más grande del test. Eso no es un patrón de negocio. Es un patrón de aritmética.
Una estimación grande es subproducto de un error estándar grande
Gelman, Hill y Yajima formulan el mecanismo en una frase que merece la lectura literal: las estimaciones grandes son, en realidad, un subproducto de errores estándar grandes. El argumento es geométrico, no de estadística avanzada.
Si ocho segmentos tienen exactamente el mismo efecto verdadero, ordenarlos por la estimación cruda es ordenarlos por el ruido. El primer lugar es casi siempre el segmento en el que el azar tuvo más espacio para trabajar. Es el mismo mecanismo que hay detrás de la maldición del ganador y de la regresión a la media: cuando usted selecciona por el extremo de una lectura ruidosa, selecciona ruido junto con ella.
La corrección clásica para esto es ensanchar los intervalos, con Bonferroni o con control de la tasa de descubrimientos falsos. El encogimiento hace otra cosa, y Gelman, Hill y Yajima marcan el contraste con precisión: los modelos multinivel hacen agrupamiento parcial, desplazando las estimaciones unas hacia las otras, mientras que los procedimientos clásicos mantienen quietos los centros de los intervalos y ajustan por comparaciones múltiples haciendo los intervalos más anchos. Un enfoque toca la barra de error. El otro toca el número.
La cuenta del encogimiento bayesiano, en tres pasos
El procedimiento es corto y cabe en una hoja de cálculo.
Paso 1: la media del conjunto, ponderada por la precisión. Cada segmento entra con un peso igual al inverso del cuadrado de su error estándar. En los ocho segmentos de arriba, eso da más 0,8723 punto porcentual, con error estándar de 0,1463.
Paso 2: cuánto se dispersan los segmentos más allá del azar. Sume, para cada segmento, el cuadrado de la distancia hasta esa media, dividido por la varianza del segmento. Esa suma es la Q de Cochran. Si los ocho midieran exactamente el mismo efecto, Q quedaría alrededor de 7, que es el número de grados de libertad. Aquí Q vale 4,8926 con 7 grados de libertad. Es decir, los ocho segmentos están MENOS dispersos de lo que el azar solo produciría.
Paso 3: la varianza entre segmentos, y el factor de encogimiento. La estimación por momentos resta los grados de libertad a Q y nunca baja de cero. Con Q por debajo de los grados de libertad, da exactamente cero. Y el factor de encogimiento de cada segmento es la varianza entre segmentos dividida por la suma de ella con la varianza del propio segmento. Con varianza entre segmentos igual a cero, el factor es cero para los ocho.
| segmento | efecto bruto | error estándar | factor de encogimiento | efecto encogido |
|---|---|---|---|---|
| app iOS | más 2,2500 pp | 0,7574 | 0,0000 | más 0,8723 pp |
| app Android | más 1,0000 pp | 0,6447 | 0,0000 | más 0,8723 pp |
| web móvil orgánica | más 0,9200 pp | 0,2623 | 0,0000 | más 0,8723 pp |
| retorno directo | más 0,8625 pp | 0,3583 | 0,0000 | más 0,8723 pp |
| escritorio orgánico | más 0,8583 pp | 0,2925 | 0,0000 | más 0,8723 pp |
| escritorio búsqueda pagada | más 0,7333 pp | 0,5818 | 0,0000 | más 0,8723 pp |
| más 0,6000 pp | 0,8180 | 0,0000 | más 0,8723 pp | |
| web móvil social | más 0,3000 pp | 0,4942 | 0,0000 | más 0,8723 pp |
No quedó ranking. La lectura honesta de estos ocho segmentos es que el efecto es el mismo en todos, y la mejor estimación para cada uno es la media del test entero. La variación de más 0,3000 a más 2,2500 punto porcentual es enteramente compatible con un único efecto subyacente medido ocho veces con precisiones diferentes.
Esto no es un artificio del ejemplo: es el comportamiento normal de un agrupamiento parcial cuando no hay ninguna heterogeneidad en los datos. Y es una respuesta mucho más útil que “iOS tuvo un valor p de 0,003005, así que el efecto en iOS es real y es enorme”.
Cuando la heterogeneidad ES real: el encogimiento bayesiano se vuelve parcial
Cambie un único segmento. Suponga que el cambio realmente perjudica al público que llega desde redes sociales, y la web móvil social pasa de 4.000 / 212 a 4.000 / 128, es decir, de 5,3000 a 3,2000 por ciento, un efecto de menos 1,8000 punto porcentual.
Con ese único segmento cambiado, Q sube de 4,8926 a 37,2859 contra los mismos 7 grados de libertad, y la varianza entre segmentos deja de ser cero: la desviación entre segmentos estimada pasa a ser 0,8906 punto porcentual. Ahora el encogimiento tiene de dónde tirar.
| segmento | efecto bruto | error estándar | factor de encogimiento | efecto encogido | error estándar posterior |
|---|---|---|---|---|---|
| app iOS | más 2,2500 pp | 0,7574 | 0,5802 | más 1,5725 pp | 0,5802 |
| app Android | más 1,0000 pp | 0,6447 | 0,6562 | más 0,8748 pp | 0,5246 |
| web móvil orgánica | más 0,9200 pp | 0,2623 | 0,9202 | más 0,8973 pp | 0,2519 |
| retorno directo | más 0,8625 pp | 0,3583 | 0,8607 | más 0,8309 pp | 0,3330 |
| escritorio orgánico | más 0,8583 pp | 0,2925 | 0,9026 | más 0,8367 pp | 0,2782 |
| escritorio búsqueda pagada | más 0,7333 pp | 0,5818 | 0,7009 | más 0,7042 pp | 0,4890 |
| más 0,6000 pp | 0,8180 | 0,5424 | más 0,6165 pp | 0,6061 | |
| web móvil social | menos 1,8000 pp | 0,4429 | 0,8017 | menos 1,3169 pp | 0,3976 |
Tres lecturas de esta tabla, y las tres importan:
- El segmento realmente diferente sobrevive. La web móvil social pasa de menos 1,8000 a menos 1,3169 punto porcentual. Se encogió, sigue negativa, sigue siendo la única negativa y sigue siendo el hallazgo del informe.
- El falso primer lugar se encoge mucho más. iOS pierde 0,6775 punto (de 2,2500 a 1,5725) porque su factor es 0,5802: casi la mitad de su estimación es sustituida por la media del conjunto. La web móvil orgánica, con el doble de tamaño, tiene factor 0,9202 y pierde apenas 0,0227 punto.
- El ranking cambia de orden. En la lectura cruda, la web móvil orgánica es la tercera. En la encogida, es la segunda, por delante de Android, porque su lectura es la que menos depende de la suerte.
El factor de encogimiento tiene una lectura directa: es la fracción de la estimación que viene del propio segmento. Un factor de 0,92 quiere decir que 92 por ciento del número es el segmento hablando y 8 por ciento es el resto del test prestando información. Un factor de 0,54 quiere decir que casi la mitad del número no es de ese segmento.
Lo que Stein demostró, y lo que Efron y Morris midieron
La idea es de 1961 y suena equivocada la primera vez que se oye: para estimar tres o más medias al mismo tiempo, existe un estimador que se equivoca menos, en el agregado, que usar cada media muestral por su cuenta. Menos, siempre, independientemente de cuáles sean los valores verdaderos.
Efron y Morris lo pusieron a prueba en un caso con respuestas conocidas. Tomaron los promedios de bateo de 18 jugadores de las Grandes Ligas de béisbol en sus primeros 45 turnos oficiales al bate de la temporada de 1970, y usaron solo ese tramo para predecir el desempeño de cada uno en el resto de la temporada. El factor de encogimiento estimado fue tal que cada jugador quedó con 0,209 de su propio promedio y 0,791 del promedio del grupo.
Los números: el error cuadrático total de la media muestral cruda fue 17,56 y el del estimador encogido fue 5,01. La eficiencia, que ellos definen como la razón entre las dos pérdidas, es 3,50. Y el encogido quedó más cerca del valor verdadero en 15 de los 18 jugadores, equivocándose más en apenas 3.
Los 3 en que se equivocó más tienen un nombre que interesa: el primero de ellos es el mejor bateador de la lista, elegido a propósito por los autores para poner a prueba el método con al menos un parámetro extremo. Su promedio crudo en los 45 turnos era 0,400, el encogimiento lo bajó a 0,290 y el valor real en el resto de la temporada fue 0,346.
Ese es todo el intercambio, en un solo caso. El encogimiento acierta más en el conjunto y lo paga equivocándose más con quien es genuinamente excepcional. Si su pregunta es “cuál es la mejor estimación para cada uno de mis ocho segmentos”, el encogimiento es la mejor respuesta. Si su pregunta es “quién es el extremo verdadero”, sale caro.
Encoger no es corregir: las dos cuentas hacen cosas diferentes
Vale la pena separar bien los dos instrumentos, porque con frecuencia se presentan como competidores y resuelven problemas distintos.
| corrección por comparaciones múltiples | encogimiento bayesiano empírico | |
|---|---|---|
| qué cambia | el ancho del intervalo, o el umbral del valor p | la estimación puntual |
| qué preserva | la estimación puntual cruda | el orden de magnitud de la incertidumbre |
| pregunta que responde | cuántos descubrimientos falsos tolero en este conjunto | cuál es la mejor estimación para cada elemento de este conjunto |
| depende de | número de comparaciones hechas | dispersión observada entre los elementos |
| efecto en el informe | más segmentos dejan de ser significativos | la cima baja, el fondo sube, el orden cambia |
Gelman, Hill y Yajima van más allá y sostienen que el error de tipo I ni siquiera debería ser el foco de la preocupación, porque rara vez se cree que el efecto de un segmento sea exactamente cero. Lo que preocupa de verdad son los errores de signo, que ellos llaman error de tipo S, y los errores de magnitud, el tipo M: decir que el efecto es grande cuando está cerca de cero. Los estudios con poco poder son especialmente vulnerables al tipo M, porque una incertidumbre alta produce estimaciones grandes.
Eso describe con exactitud el segmento de 1.500 visitantes por brazo del informe del comienzo de esta guía.
Y existe un contrapunto honesto, del que el encogimiento no lo exime. La heterogeneidad real ocurre, e ignorarla sale caro. Dmitriev, Gupta, Kim y Vaz relatan un experimento en Bing que parecía exitoso, con un aumento de ingresos de 2,3 por ciento y una reducción del número de anuncios por página de 0,6 por ciento. Al segmentar por tipo de página, el número de anuncios por página cayó drásticamente, 2,3 por ciento, en las páginas recargadas, y en realidad AUMENTÓ 0,3 por ciento en las páginas originales, que eran las que importaban. La conclusión del equipo fue que el experimento no había cumplido su objetivo. La lección que extraen es evitar la trampa de suponer que el efecto es homogéneo entre todos los usuarios y consultas.
Las dos cosas son verdad al mismo tiempo: mirar los segmentos es obligatorio, y creer en el ranking crudo de los segmentos es ingenuo. El encogimiento es justamente lo que permite hacer lo primero sin cometer lo segundo.
Cómo aplicar esto en la práctica
- Declare los segmentos en el plan de análisis, antes de correr el test. El encogimiento no arregla un segmento pescado después de ver los datos; solo vuelve honesta la lectura de un conjunto definido de antemano.
- Reporte siempre las dos columnas. Bruto y encogido, lado a lado, con el error estándar de cada segmento visible. Esconder el bruto genera desconfianza y esconder el encogido genera decisiones equivocadas.
- Publique la Q y los grados de libertad. Es el número que responde “¿hay heterogeneidad aquí?” antes de cualquier discusión sobre qué segmento ganó.
- No interprete el factor de encogimiento como una nota del segmento. Mide tamaño de muestra, no calidad del público.
- Trate un segmento genuinamente negativo como hallazgo, no como ruido. En el escenario B, menos 1,3169 punto porcentual después de encogido sigue siendo motivo para investigar antes de lanzar.
- Si un segmento merece una decisión propia, merece un test propio. Un efecto de 0,9 punto sobre una base de 5 por ciento es un efecto relativo de 18 por ciento, lo que exige cerca de 9.986 visitantes por variación para detectarse con 80 por ciento de poder. El segmento de email, con 3.000 visitantes por semana, tardaría 47 días en llegar ahí por sí solo. Revise su caso en la calculadora de tamaño de muestra.
- Cuando la pregunta sea sobre varios tests en lugar de varios segmentos, el instrumento es el mismo con otro nombre: vea meta-análisis de tests A/B.
Errores comunes
- Ordenar segmentos por efecto bruto y actuar sobre la cima. Es el error central de este artículo. La cima es una selección por varianza.
- Concluir que hay heterogeneidad sin mirar la Q. En el escenario A, ocho efectos brutos de 0,30 a 2,25 puntos porcentuales conviven con una heterogeneidad estimada en cero.
- Creer que el encogimiento borra hallazgos. En el escenario B, el hallazgo negativo sobrevive con holgura; lo que desapareció fue el falso primer lugar.
- Encoger segmentos que no pertenecen al mismo grupo. Encoger tiene sentido cuando es razonable pensar en los elementos como muestras de una misma distribución. Encoger la métrica de ingresos junto con la de clics no es agrupamiento parcial, es confusión.
- Encoger con supuesto normal cuando la cola es pesada. Azevedo, Deng, Montiel Olea, Rao y Weyl estimaron en Bing un coeficiente de cola bastante por debajo de 3, y la implicación que extraen es doble: las ideas con estadística pequeña deben encogerse de forma agresiva, porque probablemente fueron suerte, y las ideas muy fuera de la curva probablemente son reales. En Bing, el 2 por ciento mejor responde por el 74,8 por ciento de las ganancias históricas.
- Aplicar encogimiento y olvidar que el test todavía necesita ser confiable. Nada de esto protege contra un reparto desigual de tráfico, un sesgo de instrumentación o un período demasiado corto.
- Usar el efecto encogido como si fuera una medición directa en la proyección de ingresos. Es la mejor estimación disponible, con incertidumbre propia, y la columna de error estándar posterior existe para eso.
Hágalo automático con Donnu
Para encoger un conjunto de segmentos usted necesita dos cosas por segmento: el efecto estimado y su error estándar. Parece trivial y es donde la mayoría de los informes se traba, porque el corte por segmento suele reconstruirse después, en el panel de análisis, a partir de atributos del usuario en su estado ACTUAL y no en el estado en que estaba cuando entró al test.
Cuando el atributo cambió después de la asignación, el segmento deja de ser un recorte previo al experimento y se vuelve consecuencia del experimento, y toda la cuenta de este artículo pierde sentido. Donnu registra el estado del usuario en el instante de la asignación, lo que deja cada corte con la definición congelada en el momento correcto y con el error estándar calculado sobre la muestra correcta.
El resto es aritmética de hoja de cálculo, y esta guía tiene todos los pasos. La calculadora de significancia cierra la lectura bruta de cada segmento, que sigue siendo el insumo del que sale todo lo demás.
Referencias
- Efron, B. y Morris, C. Data Analysis Using Stein’s Estimator and Its Generalizations. Journal of the American Statistical Association, volumen 70, número 350, 1975, páginas 311 a 319. Fuente del ejemplo de los promedios de bateo de 18 jugadores en sus primeros 45 turnos oficiales al bate de 1970; del factor estimado que deja a cada jugador con 0,209 de su propio promedio y 0,791 del promedio del grupo; del error cuadrático total de 17,56 para la media muestral contra 5,01 para el estimador encogido, con eficiencia de 3,50; del registro de que el encogido queda más cerca del valor verdadero en 15 de los 18 jugadores; y de la nota de que el mejor bateador fue incluido a propósito para poner a prueba el método con un parámetro extremo. faculty.ucmerced.edu.
- Gelman, A., Hill, J. y Yajima, M. Why We (Usually) Don’t Have to Worry About Multiple Comparisons. Journal of Research on Educational Effectiveness, volumen 5, 2012, páginas 189 a 211. Fuente del contraste entre el agrupamiento parcial, que desplaza las estimaciones unas hacia las otras, y los procedimientos clásicos, que mantienen quietos los centros de los intervalos y ensanchan los intervalos; de la afirmación de que las estimaciones grandes son un subproducto de errores estándar grandes, ilustrada con dos distribuciones muestrales de desviación 1 y 3 bajo efecto nulo; y del desplazamiento del foco del error de tipo I hacia los errores de signo, tipo S, y de magnitud, tipo M. arxiv.org.
- Dmitriev, P., Gupta, S., Kim, D. W. y Vaz, G. A Dirty Dozen: Twelve Common Metric Interpretation Pitfalls in Online Controlled Experiments. KDD 2017, Halifax. Fuente de la trampa de suponer que el efecto es homogéneo entre usuarios y consultas, con el experimento de Bing que subió los ingresos 2,3 por ciento y bajó los anuncios por página 0,6 por ciento en el agregado, mientras que el corte por tipo de página mostraba una caída de 2,3 por ciento en las páginas recargadas y un aumento de 0,3 por ciento en las páginas originales. exp-platform.com.
- Azevedo, E. M., Deng, A., Montiel Olea, J. L., Rao, J. y Weyl, E. G. A/B Testing with Fat Tails. Journal of Political Economy, volumen 128, número 12, 2020. Usado aquí para el límite del encogimiento bajo cola pesada: fuente de la estimación de un coeficiente de cola bastante por debajo de 3 en Bing, de la recomendación de encoger de forma agresiva las ideas con estadística pequeña mientras que las ideas fuera de la curva probablemente son reales, y del registro de que el 2 por ciento mejor responde por el 74,8 por ciento de las ganancias históricas. eduardomazevedo.github.io.
Lee también: Efecto heterogéneo por segmento · Meta-análisis de tests A/B · La maldición del ganador · Muchas métricas en un test A/B · Modelado de uplift · Calculadora de significancia · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es el encogimiento bayesiano empírico en un test A/B?
- Es tirar de la estimación de cada segmento hacia la media de todos los segmentos, con una fuerza proporcional al ruido de ese segmento. Un segmento pequeño, con error estándar grande, es llevado casi hasta la media. Un segmento grande, con error estándar pequeño, casi no se mueve. El resultado es un conjunto de estimaciones que se equivoca menos en el agregado que la lectura cruda de cada segmento aislado.
- ¿Por qué el segmento con el mayor efecto suele ser el más pequeño?
- Porque las estimaciones grandes son un subproducto de errores estándar grandes. Gelman, Hill y Yajima describen exactamente ese mecanismo: un estimador con desviación mayor tiene una probabilidad mucho mayor de producir una estimación grande en valor absoluto que un estimador preciso, incluso cuando el efecto verdadero es cero en los dos casos. En el ejemplo de esta guía, el segmento de 2.000 visitantes por brazo encabeza el ranking con más 2,2500 puntos porcentuales, y el encogimiento baja ese número a la media de más 0,8723 punto.
- ¿Cuál es la diferencia entre encoger y corregir por comparaciones múltiples?
- La corrección clásica, como Bonferroni, mantiene quieta la estimación puntual y ensancha el intervalo. El encogimiento mueve la estimación puntual hacia las demás y no necesita ensanchar nada. Gelman, Hill y Yajima lo resumen así: los modelos multinivel hacen agrupamiento parcial desplazando las estimaciones unas hacia las otras, mientras que los procedimientos clásicos mantienen quietos los centros de los intervalos y ajustan por comparaciones múltiples haciendo los intervalos más anchos.
- ¿El encogimiento no borra un segmento que es realmente diferente?
- No, y la cuenta muestra por qué. Cuando existe heterogeneidad real, la varianza entre segmentos estimada sube y el factor de encogimiento cae menos. En el escenario B de esta guía, un segmento con efecto verdadero negativo pasa de menos 1,8000 a menos 1,3169 punto porcentual, sigue siendo el peor del conjunto por amplio margen y sigue con signo negativo. Lo que el encogimiento borra es la diferencia que solo el azar produjo.
- ¿Cuánto gana realmente el encogimiento?
- Efron y Morris lo midieron en un caso con respuesta conocida: 18 jugadores de béisbol, 45 turnos al bate cada uno. El error cuadrático total de la media muestral fue 17,56 y el del estimador de James y Stein fue 5,01, una eficiencia de 3,50. El estimador encogido quedó más cerca del valor verdadero en 15 de los 18 jugadores, y se equivocó más en 3.
- ¿Cuándo NO debo encoger?
- Cuando la distribución de efectos tiene cola pesada y usted busca justamente los extremos. Azevedo, Deng, Montiel Olea, Rao y Weyl estimaron en Bing un coeficiente de cola bastante por debajo de 3 y concluyen que las ideas con estadística pequeña deben encogerse de forma agresiva, mientras que las ideas muy fuera de la curva probablemente son reales. El encogimiento con supuesto normal aplica la misma fuerza a los dos casos, y ahí es donde se equivoca.