Múltiples Métricas en un Test A/B: controlar el FDR
Leer 20 métricas en un test A/B da 64% de probabilidad de al menos un falso positivo. Cómo Bonferroni y Benjamini-Hochberg corrigen múltiples métricas.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Un test A/B moderno no reporta una métrica, reporta decenas. Y cada métrica leída al nivel del 5 por ciento es un sorteo independiente con 5 por ciento de probabilidad de acusar un efecto que no existe: con 20 métricas sin efecto real e independientes, la probabilidad de al menos un falso positivo es 64,15 por ciento. Esta guía muestra cómo leer múltiples métricas sin engañarse: el cálculo exacto, la diferencia entre controlar el FWER y controlar el FDR, el procedimiento de Benjamini-Hochberg paso a paso sobre un panel real de 20 métricas, y la decisión práctica de qué corrección usar en qué parte del informe. Forma parte de nuestra guía completa de test A/B y es el par, en el eje de las métricas, de lo que testear varias variantes trata en el eje de las variantes.
Múltiples métricas son una familia de tests
La corrección de múltiples comparaciones suele enseñarse con variantes: un test A/B/n con 4 brazos hace 3 comparaciones contra el control, y todo el mundo acepta que eso necesita ajuste. El caso de las métricas es mayor y recibe menos atención, porque el panel crece por conveniencia y no por decisión.
Kohavi, Deng, Frasca, Walker, Xu y Pohlmann describen exactamente eso en la operación de Bing: relatan que reportan resultados no en una métrica, sino en cientos, sobre todo para ayudar en la depuración y el análisis. Su respuesta organizativa al problema de múltiples desenlaces fue estandarizar el criterio de éxito en un conjunto pequeño de métricas, como sesiones por usuario. Es decir: la solución primaria no fue estadística, fue reducir la familia.
El cálculo del techo es simple. Si k métricas son independientes y ninguna tiene efecto real, la probabilidad de que ninguna de ellas salga significativa al nivel alfa es 1 menos alfa, elevado a k. La probabilidad de que al menos una salga es el complemento:
| métricas leídas al nivel del 5% | probabilidad de al menos un falso positivo |
|---|---|
| 5 | 22,62% |
| 10 | 40,13% |
| 20 | 64,15% |
| 50 | 92,31% |
| 100 | 99,41% |
| 200 | 99,996% |
Vale registrar la salvedad honesta: las métricas de un mismo experimento no son independientes. Los clics en el menú y las visitas a la página de producto suben juntos. La correlación reduce la probabilidad real de falso positivo respecto a la curva de arriba. Lo que la correlación no hace es derribarla hasta cerca del 5 por ciento, y la dirección del error es siempre la misma: el panel entero tiene una tasa de error mayor que la nominal de cada fila.
Error por familia y proporción de falsos descubrimientos
Existen dos maneras distintas de decir “controlé el error”, y elegir entre ellas es una decisión de negocio, no de estadística.
FWER (familywise error rate) es la probabilidad de cometer al menos un error Tipo I en la familia entera. Controlar el FWER al 5 por ciento significa: si nada tiene efecto, la probabilidad de que yo anuncie cualquier cosa es 5 por ciento. Es la regla correcta cuando una única afirmación falsa ya estropea la decisión.
FDR (false discovery rate) fue definido por Benjamini y Hochberg en 1995 como la esperanza de la proporción de hipótesis rechazadas erróneamente entre todas las hipótesis rechazadas. Controlar el FDR al 10 por ciento significa: entre todo lo que anuncie, espero que como mucho el 10 por ciento sea ruido. Es la regla correcta cuando estás explorando un panel y algunos falsos descubrimientos en medio de varios verdaderos son un costo aceptable.
Los autores demuestran dos propiedades que conectan ambas reglas, y ellas son todo el argumento a favor del FDR:
- Cuando todas las hipótesis nulas son verdaderas, el FDR y el FWER coinciden. En ese caso el número de rechazos verdaderos es cero, así que la proporción de errores es 0 o 1, y su esperanza se convierte en la probabilidad de al menos un error. Controlar el FDR implica controlar el FWER en sentido débil.
- Cuando algunas hipótesis nulas son falsas, el FDR es menor o igual que el FWER, y ambos pueden ser bastante diferentes. Cualquier procedimiento que controla el FWER también controla el FDR, pero un procedimiento que controla solo el FDR puede ser menos riguroso, y de ahí viene la ganancia de poder. Los autores observan además que cuantas más hipótesis sean falsas, mayor es la diferencia entre ambas tasas, y por tanto mayor el potencial de ganancia.
El procedimiento de Benjamini-Hochberg, paso a paso
El procedimiento cabe en tres líneas. Sean m los valores p ordenados de menor a mayor, y q la tasa de falsos descubrimientos que aceptas:
- Ordena los valores p: P(1) menor o igual que P(2), y así sucesivamente hasta P(m).
- Encuentra el mayor índice i tal que P(i) es menor o igual que i dividido por m, por q.
- Rechaza todas las hipótesis de las posiciones 1 hasta i.
Benjamini y Hochberg prueban, en el Teorema 1 del artículo, que para estadísticas de test independientes y para cualquier configuración de hipótesis nulas falsas, ese procedimiento controla el FDR en q. Registran además, en una observación explícita, que la independencia entre las estadísticas correspondientes a las hipótesis falsas no es necesaria para la prueba.
El paso 3 es la parte que casi todo el mundo aplica mal. El procedimiento es de paso hacia arriba: la decisión sale del mayor índice que satisface la desigualdad, y todas las posiciones por debajo de él se rechazan junto con él, aunque alguna de ellas, aisladamente, no pasara su propio límite. Comparar fila a fila y rechazar solo las que pasan es un procedimiento diferente, más conservador, y no es el de Benjamini-Hochberg. El ejemplo trabajado a continuación cae exactamente en ese caso.
Ejemplo trabajado: 20 métricas, un test
Una tienda ejecuta un test con 60.000 usuarios por brazo y reporta 20 métricas. Todos los valores p de abajo salen del test z de dos proporciones bilateral sobre los conteos brutos, y puedes reproducir cualquier fila pegando los cuatro números en la calculadora.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
| métrica | A (de 60.000) | B (de 60.000) | z | valor p | lift relativo |
|---|---|---|---|---|---|
| Conversión general | 3.000 | 3.126 | 1,6526 | 0,098418 | +4,20% |
| Añadir al carrito | 9.000 | 9.210 | 1,6897 | 0,091091 | +2,33% |
| Inicio de checkout | 6.000 | 6.132 | 1,2640 | 0,206225 | +2,20% |
| Registro de cuenta | 4.200 | 4.116 | -0,9548 | 0,339674 | -2,00% |
| Uso del buscador | 15.000 | 15.390 | 2,5889 | 0,009629 | +2,60% |
| Clic en el menú | 21.000 | 20.790 | -1,2725 | 0,203211 | -1,00% |
| Visita a la página de producto | 30.000 | 30.450 | 2,5981 | 0,009373 | +1,50% |
| Aplicación de cupón | 2.400 | 2.478 | 1,1402 | 0,254199 | +3,25% |
| Lista de deseos | 1.800 | 1.746 | -0,9205 | 0,357296 | -3,00% |
| Clic en reseñas | 5.400 | 5.508 | 1,0845 | 0,278126 | +2,00% |
| Newsletter | 1.200 | 1.266 | 1,3429 | 0,179292 | +5,50% |
| Apertura del chat | 900 | 858 | -1,0091 | 0,312915 | -4,67% |
| Clic en el envío | 7.200 | 7.092 | -0,9625 | 0,335784 | -1,50% |
| Filtro de categoría | 12.000 | 12.180 | 1,2954 | 0,195179 | +1,50% |
| Compartir | 600 | 633 | 0,9447 | 0,344833 | +5,50% |
| Clic en el pie de página | 3.600 | 3.528 | -0,8793 | 0,379229 | -2,00% |
| Login | 10.800 | 10.692 | -0,8131 | 0,416165 | -1,00% |
| Segunda sesión en 7 días | 8.400 | 8.568 | 1,3919 | 0,163962 | +2,00% |
| Devolución solicitada | 780 | 822 | 1,0564 | 0,290777 | +5,38% |
| Contacto con soporte | 1.500 | 1.443 | -1,0638 | 0,287406 | -3,80% |
Leído fila a fila al nivel del 5 por ciento, el panel entrega dos victorias: visita a la página de producto (p igual a 0,009373) y uso del buscador (p igual a 0,009629). Y entrega una derrota silenciosa que nadie pone en la diapositiva: la métrica primaria, la conversión general, no es significativa (p igual a 0,098418).
Aplicando las dos correcciones
Ordenando los 20 valores p y aplicando Bonferroni (límite fijo de 0,05 dividido por 20, es decir, 0,0025) y Benjamini-Hochberg con q igual a 0,10 (límite móvil de i dividido por 20, por 0,10):
| posición | métrica | valor p | límite Bonferroni | límite BH | ¿P(i) por debajo del límite BH? |
|---|---|---|---|---|---|
| 1 | Visita a la página de producto | 0,009373 | 0,00250 | 0,00500 | no |
| 2 | Uso del buscador | 0,009629 | 0,00250 | 0,01000 | sí |
| 3 | Añadir al carrito | 0,091091 | 0,00250 | 0,01500 | no |
| 4 | Conversión general | 0,098418 | 0,00250 | 0,02000 | no |
| 5 | Segunda sesión en 7 días | 0,163962 | 0,00250 | 0,02500 | no |
| 6 | Newsletter | 0,179292 | 0,00250 | 0,03000 | no |
| 7 | Filtro de categoría | 0,195179 | 0,00250 | 0,03500 | no |
| 8 | Clic en el menú | 0,203211 | 0,00250 | 0,04000 | no |
| … | (las otras 12 filas) | por encima de 0,20 | 0,00250 | hasta 0,10000 | no |
El mayor índice que satisface la desigualdad es i igual a 2. Por tanto el procedimiento rechaza las posiciones 1 y 2, es decir, las dos, aunque la posición 1 (0,009373) esté por encima de su propio límite (0,00500). Es el paso hacia arriba en acción: la fila 1 es arrastrada por la fila 2.
| regla aplicada | métricas declaradas significativas |
|---|---|
| valor p bruto por debajo de 0,05 | 2 |
| Bonferroni (alfa dividido por 20) | 0 |
| Benjamini-Hochberg (q igual a 0,10) | 2 |
Tres lecturas del mismo panel, tres respuestas diferentes, y ninguna de ellas es “errónea”: controlan cosas distintas. Bonferroni dice que, si exiges menos del 5 por ciento de probabilidad de hacer cualquier afirmación falsa en este panel, no hay nada que afirmar. Benjamini-Hochberg dice que, si aceptas que hasta el 10 por ciento de las afirmaciones sean ruido, esas dos pasan.
Lo que el ejemplo no cambia
Ninguna de las dos correcciones hace significativa la conversión general, y ninguna de las dos convierte “el uso del buscador subió” en una razón para lanzar. La lectura honesta del panel es: el test no movió la métrica primaria, y dos métricas secundarias mostraron una señal que sobrevive al control de FDR pero no al control de FWER. Eso es una hipótesis para la próxima ronda, no un resultado.
El problema también crece por el tiempo y por las variantes
Las métricas son uno de los tres ejes de multiplicidad, y los tres se multiplican entre sí.
Kohavi y coautores cuantifican el eje de las iteraciones con precisión. Suponiendo que la funcionalidad no hace nada, ejecutar k iteraciones hace que la probabilidad de significancia estadística (movimiento positivo en un test bilateral) crezca del 2,5 por ciento a 1 menos 0,975 elevado a k. Registran que, si un equipo testea cinco tratamientos, la tasa del 2,5 por ciento se convierte en 12 por ciento; y que seis iteraciones de experimentos con cinco tratamientos dan más del 50 por ciento de probabilidad de conseguir un resultado positivo estadísticamente significativo. Reproduciendo el cálculo: 1 menos 0,975 elevado a 5 da 11,89 por ciento, y 1 menos 0,975 elevado a 30 da 53,21 por ciento.
Los dos mecanismos que usan contra esto son explícitos y vale copiarlos: ajuste de umbral (exigir valores p menores en proyectos con muchos tratamientos o muchas iteraciones) y etapa de replicación (después de que el embudo se estrecha, una ronda final, preferentemente con más poder estadístico, que determina el resultado). En el mismo artículo, para el análisis en rebanadas (segmentos), relatan que educan a los experimentadores sobre falsos positivos y los incentivan a ajustar el umbral de probabilidad, enfocándose en señales fuertes y valores p menores, del orden de 0,0001.
Kohavi, Deng, Longbotham y Xu hacen la misma advertencia por el lado del volumen: como ejecutan miles de experimentos al año, una tasa de falso positivo de 0,05 implica cientos de falsos positivos para una métrica dada, y eso empeora cuando se usan varias métricas no correlacionadas.
Qué regla usar en qué parte del informe
La respuesta práctica no es elegir una corrección para todo, es partir el informe en familias con reglas diferentes, y declarar esa partición antes de ejecutar.
| parte del informe | pregunta que responde | regla recomendada |
|---|---|---|
| Métrica primaria (1 métrica) | ¿este test gana? | sin corrección; la familia tiene tamaño 1 por construcción |
| Métricas secundarias de éxito | ¿qué más se movió junto? | Benjamini-Hochberg con q entre 0,05 y 0,20 |
| Métricas de guardrail | ¿esto rompió algo? | alerta sensible, sin corrección que reduzca la sensibilidad |
| Cortes por segmento | ¿para quién funcionó? | predeclarados en el plan, o tratados como exploración |
| Decisión de lanzamiento con varias variantes | ¿qué brazo se lanza? | corrección de FWER (Bonferroni o similar) |
La fila de las métricas de guardrail suele sorprender, y merece el detalle. Una métrica de guardrail existe para detectar daño, no para detectar ganancia. La hipótesis nula útil ahí es “nada empeoró”, y el error caro es el Tipo II: dejar pasar un empeoramiento real. Corregir para múltiples comparaciones hace más difícil rechazar la nula, lo que aumenta exactamente ese error. Aplicar Bonferroni en el panel de guardrails es optimizar contra el objetivo del panel. El tratamiento propio está en métricas de guardrail.
La fila de la métrica primaria también merece una nota. Solo tiene tamaño 1 si declaraste cuál es antes de mirar. Elegir la primaria después de ver los valores p es el caso en el que la familia tiene tamaño 20 y estás fingiendo que tiene tamaño 1. Es la razón de existir del plan de análisis preregistrado.
El contraargumento honesto
Existe una línea respetable que discrepa de todo este encuadre, y omitirla sería deshonesto. Gelman, Hill y Yajima defienden que el problema de múltiples comparaciones puede desaparecer por completo cuando se ve desde una perspectiva bayesiana jerárquica. Su argumento tiene dos partes:
- Cuestionan el propio paradigma del error Tipo I, porque rara vez creen que la hipótesis nula pueda ser estrictamente verdadera.
- Sostienen que el problema no es el testeo múltiple sino la modelización insuficiente de la relación entre los parámetros. Un modelo multinivel hace encogimiento (las estimaciones y los intervalos son tirados unos hacia los otros), mientras que los procedimientos clásicos mantienen los centros quietos y ensanchan los intervalos. Según ellos, las comparaciones hechas con estimaciones multinivel quedan apropiadamente más conservadoras sin sacrificar poder de la forma en que lo sacrifican muchos métodos tradicionales.
Los mismos autores reconocen, sin embargo, que los métodos de control de FDR tienen sentido particular en campos donde se espera un puñado de efectos reales en medio de una cantidad enorme de efectos nulos, y que el FDR lleva a un procedimiento menos conservador respecto al error Tipo I, pero más potente para detectar efectos reales.
La traducción práctica para quien ejecuta tests A/B: si tu motor es bayesiano, el camino de modelar la jerarquía de las métricas es legítimo y probablemente mejor. Lo que no es legítimo es usar ese argumento como licencia para leer 20 valores p crudos y elegir el que gustó. El tratamiento bayesiano de las decisiones de test está en test A/B bayesiano y en pérdida esperada.
Checklist antes de leer el panel
- ¿La familia de tests está declarada por escrito? Cuántas métricas, cuántos brazos, cuántos segmentos, todo antes de la primera mirada.
- ¿La métrica primaria está nombrada aisladamente? Una, no “las tres principales”.
- ¿El panel secundario tiene una regla declarada? Benjamini-Hochberg con q elegido antes, no después.
- ¿Los guardrails están fuera de la corrección? Necesitan sensibilidad, no rigor.
- ¿Los segmentos que se van a leer están listados? Corte no listado es exploración y sale etiquetado como tal.
- ¿Alguien contó cuántas iteraciones ha tenido ya este tema? El cálculo de 1 menos 0,975 elevado a k es acumulativo entre rondas.
- ¿Hay una etapa de replicación prevista? Es el mecanismo más confiable y el más fácil de olvidar.
Errores comunes
- Definir la familia después de ver los resultados. Toda corrección presupone que el denominador fue elegido antes. Elegirlo después anula la garantía.
- Aplicar Benjamini-Hochberg fila a fila. Comparar cada valor p con su propio límite y rechazar solo los que pasan no es el procedimiento. Lo correcto es hallar el mayor índice que pasa y rechazar todo por debajo de él.
- Usar Bonferroni en el panel entero y concluir que nada funciona nunca. Con 100 métricas, el umbral se vuelve 0,0005 y el panel queda permanentemente mudo. Eso es señal de familia mal definida, no de rigor.
- Corregir guardrails. Aumenta la probabilidad de dejar pasar un daño real.
- Contar solo las métricas y olvidar segmentos e iteraciones. Los ejes se multiplican.
- Tratar q y alfa como si fueran lo mismo. Un q de 0,10 en el FDR no es “más flojo que 0,05”: es otra magnitud, con otro numerador y otro denominador.
- Anunciar la métrica secundaria que pasó como si fuera el resultado del test. Sobrevivir al FDR califica a la métrica para una ronda de confirmación, no para la diapositiva de victoria.
Hazlo automático en Donnu
El error caro aquí no es elegir la corrección equivocada, es que el panel no deje claro cuántas preguntas se hicieron. Veinte métricas en una tabla, todas con el mismo intervalo de confianza y el mismo color, esconden que la regla del 5 por ciento fue diseñada para una pregunta y se está usando en veinte.
En Donnu, la métrica primaria se declara en la creación del experimento y queda visualmente separada del panel secundario, que lleva el valor p ajustado por Benjamini-Hochberg al lado del bruto, con el q usado escrito en la tabla. Las métricas de guardrail quedan en un panel propio, con umbral de alerta propio y sin corrección que reduzca su sensibilidad. Si quieres rehacer cualquier fila a mano, la calculadora de significancia acepta los conteos brutos y la calculadora para varias variantes trata el eje de los brazos.
Referencias
- Benjamini, Y. y Hochberg, Y. Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing. Journal of the Royal Statistical Society, Serie B, volumen 57, número 1, páginas 289 a 300, 1995. Fuente de la definición del FDR como la esperanza de la proporción de hipótesis nulas rechazadas que fueron rechazadas erróneamente, de la tabla de errores con las cuatro celdas, de las dos propiedades (FDR igual al FWER cuando todas las nulas son verdaderas, implicando control débil del FWER; y FDR menor o igual que el FWER cuando algunas nulas son falsas, con el potencial de ganancia de poder creciendo con el número de nulas falsas), del procedimiento de paso hacia arriba (el mayor i con P(i) menor o igual que i sobre m por q, rechazando todas las posiciones hasta i), del Teorema 1 de control del FDR en q para estadísticas independientes, y de la observación de que la independencia de las estadísticas correspondientes a las nulas falsas no es necesaria para la prueba. math.tau.ac.il.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fuente del relato de que Bing reporta resultados en cientos de métricas, sobre todo para depuración y análisis, y de que la respuesta al problema de múltiples desenlaces fue estandarizar el criterio de éxito en un conjunto pequeño de métricas como sesiones por usuario; de la fórmula 1 menos 0,975 elevado a k para k iteraciones y de los números derivados de ella (cinco tratamientos elevando el 2,5 por ciento al 12 por ciento, y seis iteraciones de experimentos con cinco tratamientos pasando del 50 por ciento); de los dos mecanismos de protección (ajuste de umbral y etapa de replicación con mayor poder estadístico); de la orientación de usar valores p menores, del orden de 0,0001, en el análisis en rebanadas por segmento; y del uso de un algoritmo bayesiano empírico de control de FDR en la detección de interacciones, en un sistema que a veces ejecuta cientos de miles de tests de hipótesis. exp-platform.com.
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Fuente de la observación de que, ejecutando miles de experimentos al año, una tasa de falso positivo de 0,05 implica cientos de falsos positivos para una métrica dada, situación agravada cuando se usan varias métricas no correlacionadas, y de la distinción entre falsos positivos esperados por la estadística y falsos positivos causados por mal diseño, anomalía de dato o error de instrumentación. exp-platform.com.
- Gelman, A., Hill, J. y Yajima, M. Why We (Usually) Don’t Have to Worry About Multiple Comparisons. 2009. Fuente del contraargumento: el cuestionamiento del paradigma de error Tipo I, la tesis de que el problema es la modelización insuficiente de la relación entre parámetros y no el testeo múltiple, el contraste entre encogimiento (los modelos multinivel tiran de las estimaciones unas hacia las otras) y el ensanchamiento de intervalos con centros quietos de los procedimientos clásicos, y el reconocimiento de que el control de FDR es menos conservador en cuanto al error Tipo I y más potente para detectar efectos reales, teniendo sentido particular cuando se esperan pocos efectos reales en medio de muchos nulos. arxiv.org/abs/0907.2478.
Lee también: Testear varias variantes sin falso positivo · Métricas de guardrail · Plan de análisis preregistrado · Métrica primaria y OEC · El problema del peeking · Calculadora de significancia · Leia em português
Preguntas frecuentes
- ¿Cuál es la probabilidad de un falso positivo cuando leo 20 métricas en un test A/B?
- Si las 20 métricas fueran independientes y ninguna tuviera efecto real, la probabilidad de que al menos una salga con valor p por debajo de 0,05 es 1 menos 0,95 elevado a 20, es decir, 64,15 por ciento. Con 5 métricas son 22,62 por ciento, con 10 son 40,13 por ciento y con 50 son 92,31 por ciento. En la práctica las métricas de un mismo test están correlacionadas y el número real queda por debajo de ese techo, pero el orden de magnitud es ese: leer muchas métricas sin corrección casi garantiza encontrar algo.
- ¿Cuál es la diferencia entre FWER y FDR?
- El FWER es la probabilidad de cometer al menos un error Tipo I en la familia entera de tests. El FDR, definido por Benjamini y Hochberg en 1995, es la esperanza de la proporción de hipótesis rechazadas erróneamente entre todas las rechazadas. Los autores muestran que, cuando todas las hipótesis nulas son verdaderas, ambas cosas coinciden; cuando algunas son falsas, el FDR es menor o igual que el FWER, y por eso los procedimientos que controlan solo el FDR pueden ser menos rigurosos y ganar poder.
- ¿Cómo funciona el procedimiento de Benjamini-Hochberg?
- Ordena los m valores p de menor a mayor. Encuentra el mayor índice i para el cual el valor p en la posición i es menor o igual que i dividido por m, por la tasa objetivo q. Rechaza todas las hipótesis de la posición 1 hasta esa posición i. Es un procedimiento de paso hacia arriba: la decisión la toma el mayor índice que pasa, y todas las posiciones por debajo de él se rechazan juntas, aunque alguna de ellas aisladamente no pasara su propio límite. Benjamini y Hochberg prueban que esto controla el FDR en q para estadísticas de test independientes.
- ¿Bonferroni o Benjamini-Hochberg para métricas de test A/B?
- Depende del costo del error. Bonferroni compara cada valor p con alfa dividido por el número de tests y controla el FWER: úsalo cuando una única afirmación falsa ya compromete la decisión, típicamente en la métrica primaria de una decisión de lanzamiento. Benjamini-Hochberg controla la proporción de falsos descubrimientos y es más apropiado para la lectura exploratoria del panel de métricas secundarias, donde algunos falsos descubrimientos entre muchos verdaderos son tolerables. Ambos enfoques exigen declarar la familia de tests antes de mirar los datos.
- ¿Las métricas de guardrail entran en la corrección de múltiples comparaciones?
- No deben entrar de la misma forma. La pregunta de una métrica de guardrail está invertida: no quieres detectar un efecto, quieres descartar un daño. Corregir para múltiples comparaciones hace más difícil rechazar la nula, lo que aumenta la probabilidad de dejar pasar un empeoramiento real. Los guardrails piden alerta sensible y umbral propio, discutido aparte, no la misma corrección aplicada a las métricas de éxito.
- ¿Hay quien defienda no corregir para múltiples comparaciones?
- Sí, y el argumento es serio. Gelman, Hill y Yajima defienden que, en un modelo multinivel bayesiano, el problema de múltiples comparaciones puede desaparecer: el modelo tira de las estimaciones unas hacia las otras (encogimiento) en vez de mantener los centros quietos y ensanchar los intervalos, lo que según ellos produce estimaciones más eficientes, sobre todo cuando la variación entre los grupos es baja, que es justamente donde más preocupan las múltiples comparaciones. Es una alternativa al paradigma de error Tipo I, no una licencia para leer 20 métricas crudas y elegir la que gustó.