Estadística

Múltiples Métricas en un Test A/B: controlar el FDR

Leer 20 métricas en un test A/B da 64% de probabilidad de al menos un falso positivo. Cómo Bonferroni y Benjamini-Hochberg corrigen múltiples métricas.

Ilustración plana de una escalera de barras horizontales finas de longitud creciente, cruzada por una línea recta, con las dos barras más cortas de arriba en tono oscuro sólido, en verde profundo y verde menta

Un test A/B moderno no reporta una métrica, reporta decenas. Y cada métrica leída al nivel del 5 por ciento es un sorteo independiente con 5 por ciento de probabilidad de acusar un efecto que no existe: con 20 métricas sin efecto real e independientes, la probabilidad de al menos un falso positivo es 64,15 por ciento. Esta guía muestra cómo leer múltiples métricas sin engañarse: el cálculo exacto, la diferencia entre controlar el FWER y controlar el FDR, el procedimiento de Benjamini-Hochberg paso a paso sobre un panel real de 20 métricas, y la decisión práctica de qué corrección usar en qué parte del informe. Forma parte de nuestra guía completa de test A/B y es el par, en el eje de las métricas, de lo que testear varias variantes trata en el eje de las variantes.

Múltiples métricas son una familia de tests

La corrección de múltiples comparaciones suele enseñarse con variantes: un test A/B/n con 4 brazos hace 3 comparaciones contra el control, y todo el mundo acepta que eso necesita ajuste. El caso de las métricas es mayor y recibe menos atención, porque el panel crece por conveniencia y no por decisión.

Kohavi, Deng, Frasca, Walker, Xu y Pohlmann describen exactamente eso en la operación de Bing: relatan que reportan resultados no en una métrica, sino en cientos, sobre todo para ayudar en la depuración y el análisis. Su respuesta organizativa al problema de múltiples desenlaces fue estandarizar el criterio de éxito en un conjunto pequeño de métricas, como sesiones por usuario. Es decir: la solución primaria no fue estadística, fue reducir la familia.

El cálculo del techo es simple. Si k métricas son independientes y ninguna tiene efecto real, la probabilidad de que ninguna de ellas salga significativa al nivel alfa es 1 menos alfa, elevado a k. La probabilidad de que al menos una salga es el complemento:

métricas leídas al nivel del 5% probabilidad de al menos un falso positivo
5 22,62%
10 40,13%
20 64,15%
50 92,31%
100 99,41%
200 99,996%
Probabilidad de al menos un falso positivo en función del número de métricasCurva creciente y saturante que muestra la probabilidad de al menos un falso positivo cuando varias métricas independientes sin efecto real se leen al nivel del 5 por ciento. La curva parte del 5 por ciento con una métrica, pasa por 22,6 por ciento con 5, 40,1 por ciento con 10, 64,2 por ciento con 20, 92,3 por ciento con 50 y 99,4 por ciento con 100, acercándose al techo del 100 por ciento. Una línea discontinua horizontal marca el nivel nominal del 5 por ciento, muy por debajo de casi toda la curva.El nivel del 5 por ciento vale por métrica, nunca por el panel enteronivel nominal del 5 por ciento (el que crees estar usando)22,6%40,1%64,2%92,3%99,4%15102050100200número de métricas independientes leídas en el mismo testprobab.de errorLas métricas correlacionadas quedan por debajo de esta curva, que es el techo del caso independiente.
Las métricas de un mismo producto están correlacionadas entre sí, así que la curva es un techo y no una previsión. Pero el techo es lo bastante alto para que “encontramos una ganancia en una métrica secundaria” sea, por sí sola, una información casi vacía.

Vale registrar la salvedad honesta: las métricas de un mismo experimento no son independientes. Los clics en el menú y las visitas a la página de producto suben juntos. La correlación reduce la probabilidad real de falso positivo respecto a la curva de arriba. Lo que la correlación no hace es derribarla hasta cerca del 5 por ciento, y la dirección del error es siempre la misma: el panel entero tiene una tasa de error mayor que la nominal de cada fila.

Error por familia y proporción de falsos descubrimientos

Existen dos maneras distintas de decir “controlé el error”, y elegir entre ellas es una decisión de negocio, no de estadística.

FWER (familywise error rate) es la probabilidad de cometer al menos un error Tipo I en la familia entera. Controlar el FWER al 5 por ciento significa: si nada tiene efecto, la probabilidad de que yo anuncie cualquier cosa es 5 por ciento. Es la regla correcta cuando una única afirmación falsa ya estropea la decisión.

FDR (false discovery rate) fue definido por Benjamini y Hochberg en 1995 como la esperanza de la proporción de hipótesis rechazadas erróneamente entre todas las hipótesis rechazadas. Controlar el FDR al 10 por ciento significa: entre todo lo que anuncie, espero que como mucho el 10 por ciento sea ruido. Es la regla correcta cuando estás explorando un panel y algunos falsos descubrimientos en medio de varios verdaderos son un costo aceptable.

Los autores demuestran dos propiedades que conectan ambas reglas, y ellas son todo el argumento a favor del FDR:

  1. Cuando todas las hipótesis nulas son verdaderas, el FDR y el FWER coinciden. En ese caso el número de rechazos verdaderos es cero, así que la proporción de errores es 0 o 1, y su esperanza se convierte en la probabilidad de al menos un error. Controlar el FDR implica controlar el FWER en sentido débil.
  2. Cuando algunas hipótesis nulas son falsas, el FDR es menor o igual que el FWER, y ambos pueden ser bastante diferentes. Cualquier procedimiento que controla el FWER también controla el FDR, pero un procedimiento que controla solo el FDR puede ser menos riguroso, y de ahí viene la ganancia de poder. Los autores observan además que cuantas más hipótesis sean falsas, mayor es la diferencia entre ambas tasas, y por tanto mayor el potencial de ganancia.
La tabla de errores de Benjamini y Hochberg y lo que mide cada tasaCuadro de cuatro celdas que cruza el estado real de la hipótesis con la decisión tomada. Las filas son hipótesis nulas verdaderas e hipótesis nulas falsas. Las columnas son declarada no significativa y declarada significativa. La celda de hipótesis verdadera declarada significativa es el número de errores Tipo I. La celda de hipótesis falsa declarada significativa es el número de descubrimientos verdaderos. La suma de la columna significativa es el total de rechazos. Dos llaves a la derecha indican que el FWER mide la probabilidad de que el número de errores Tipo I sea al menos uno, mientras que el FDR mide la esperanza de la razón entre el número de errores Tipo I y el total de rechazos.Las dos tasas leen la misma tabla en direcciones diferentesdeclarada no signif.declarada significativanula VERDADERAaciertonada anunciadoerror Tipo Ifalso descubrimientonula FALSAerror Tipo IIefecto real perdidodescubrimiento verdaderoefecto real halladototal de rechazosFWER: probabilidad de que esta celda sea mayor que ceroFDR: media de la celda naranjadividida por la barra oscuraSi todas las nulas fueran verdaderas, la barra oscura es solo la celda naranja y las dos tasas dan el mismo número.Cuantas más nulas sean falsas, más crece la barra oscura sin que crezca la celda naranja, y más queda el FDR por debajo del FWER.De ahí sale exactamente la ganancia de poder del FDR.
La tabla es la de Benjamini y Hochberg (1995). El punto central es que el FDR y el FWER no son versiones fuerte y débil de lo mismo: son numeradores y denominadores diferentes, y la elección entre ellas es sobre qué cuesta caro en tu contexto.

El procedimiento de Benjamini-Hochberg, paso a paso

El procedimiento cabe en tres líneas. Sean m los valores p ordenados de menor a mayor, y q la tasa de falsos descubrimientos que aceptas:

  1. Ordena los valores p: P(1) menor o igual que P(2), y así sucesivamente hasta P(m).
  2. Encuentra el mayor índice i tal que P(i) es menor o igual que i dividido por m, por q.
  3. Rechaza todas las hipótesis de las posiciones 1 hasta i.

Benjamini y Hochberg prueban, en el Teorema 1 del artículo, que para estadísticas de test independientes y para cualquier configuración de hipótesis nulas falsas, ese procedimiento controla el FDR en q. Registran además, en una observación explícita, que la independencia entre las estadísticas correspondientes a las hipótesis falsas no es necesaria para la prueba.

El paso 3 es la parte que casi todo el mundo aplica mal. El procedimiento es de paso hacia arriba: la decisión sale del mayor índice que satisface la desigualdad, y todas las posiciones por debajo de él se rechazan junto con él, aunque alguna de ellas, aisladamente, no pasara su propio límite. Comparar fila a fila y rechazar solo las que pasan es un procedimiento diferente, más conservador, y no es el de Benjamini-Hochberg. El ejemplo trabajado a continuación cae exactamente en ese caso.

Ejemplo trabajado: 20 métricas, un test

Una tienda ejecuta un test con 60.000 usuarios por brazo y reporta 20 métricas. Todos los valores p de abajo salen del test z de dos proporciones bilateral sobre los conteos brutos, y puedes reproducir cualquier fila pegando los cuatro números en la calculadora.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

métrica A (de 60.000) B (de 60.000) z valor p lift relativo
Conversión general 3.000 3.126 1,6526 0,098418 +4,20%
Añadir al carrito 9.000 9.210 1,6897 0,091091 +2,33%
Inicio de checkout 6.000 6.132 1,2640 0,206225 +2,20%
Registro de cuenta 4.200 4.116 -0,9548 0,339674 -2,00%
Uso del buscador 15.000 15.390 2,5889 0,009629 +2,60%
Clic en el menú 21.000 20.790 -1,2725 0,203211 -1,00%
Visita a la página de producto 30.000 30.450 2,5981 0,009373 +1,50%
Aplicación de cupón 2.400 2.478 1,1402 0,254199 +3,25%
Lista de deseos 1.800 1.746 -0,9205 0,357296 -3,00%
Clic en reseñas 5.400 5.508 1,0845 0,278126 +2,00%
Newsletter 1.200 1.266 1,3429 0,179292 +5,50%
Apertura del chat 900 858 -1,0091 0,312915 -4,67%
Clic en el envío 7.200 7.092 -0,9625 0,335784 -1,50%
Filtro de categoría 12.000 12.180 1,2954 0,195179 +1,50%
Compartir 600 633 0,9447 0,344833 +5,50%
Clic en el pie de página 3.600 3.528 -0,8793 0,379229 -2,00%
Login 10.800 10.692 -0,8131 0,416165 -1,00%
Segunda sesión en 7 días 8.400 8.568 1,3919 0,163962 +2,00%
Devolución solicitada 780 822 1,0564 0,290777 +5,38%
Contacto con soporte 1.500 1.443 -1,0638 0,287406 -3,80%

Leído fila a fila al nivel del 5 por ciento, el panel entrega dos victorias: visita a la página de producto (p igual a 0,009373) y uso del buscador (p igual a 0,009629). Y entrega una derrota silenciosa que nadie pone en la diapositiva: la métrica primaria, la conversión general, no es significativa (p igual a 0,098418).

Aplicando las dos correcciones

Ordenando los 20 valores p y aplicando Bonferroni (límite fijo de 0,05 dividido por 20, es decir, 0,0025) y Benjamini-Hochberg con q igual a 0,10 (límite móvil de i dividido por 20, por 0,10):

posición métrica valor p límite Bonferroni límite BH ¿P(i) por debajo del límite BH?
1 Visita a la página de producto 0,009373 0,00250 0,00500 no
2 Uso del buscador 0,009629 0,00250 0,01000
3 Añadir al carrito 0,091091 0,00250 0,01500 no
4 Conversión general 0,098418 0,00250 0,02000 no
5 Segunda sesión en 7 días 0,163962 0,00250 0,02500 no
6 Newsletter 0,179292 0,00250 0,03000 no
7 Filtro de categoría 0,195179 0,00250 0,03500 no
8 Clic en el menú 0,203211 0,00250 0,04000 no
(las otras 12 filas) por encima de 0,20 0,00250 hasta 0,10000 no

El mayor índice que satisface la desigualdad es i igual a 2. Por tanto el procedimiento rechaza las posiciones 1 y 2, es decir, las dos, aunque la posición 1 (0,009373) esté por encima de su propio límite (0,00500). Es el paso hacia arriba en acción: la fila 1 es arrastrada por la fila 2.

regla aplicada métricas declaradas significativas
valor p bruto por debajo de 0,05 2
Bonferroni (alfa dividido por 20) 0
Benjamini-Hochberg (q igual a 0,10) 2

Tres lecturas del mismo panel, tres respuestas diferentes, y ninguna de ellas es “errónea”: controlan cosas distintas. Bonferroni dice que, si exiges menos del 5 por ciento de probabilidad de hacer cualquier afirmación falsa en este panel, no hay nada que afirmar. Benjamini-Hochberg dice que, si aceptas que hasta el 10 por ciento de las afirmaciones sean ruido, esas dos pasan.

Lo que el ejemplo no cambia

Ninguna de las dos correcciones hace significativa la conversión general, y ninguna de las dos convierte “el uso del buscador subió” en una razón para lanzar. La lectura honesta del panel es: el test no movió la métrica primaria, y dos métricas secundarias mostraron una señal que sobrevive al control de FDR pero no al control de FWER. Eso es una hipótesis para la próxima ronda, no un resultado.

El problema también crece por el tiempo y por las variantes

Las métricas son uno de los tres ejes de multiplicidad, y los tres se multiplican entre sí.

Kohavi y coautores cuantifican el eje de las iteraciones con precisión. Suponiendo que la funcionalidad no hace nada, ejecutar k iteraciones hace que la probabilidad de significancia estadística (movimiento positivo en un test bilateral) crezca del 2,5 por ciento a 1 menos 0,975 elevado a k. Registran que, si un equipo testea cinco tratamientos, la tasa del 2,5 por ciento se convierte en 12 por ciento; y que seis iteraciones de experimentos con cinco tratamientos dan más del 50 por ciento de probabilidad de conseguir un resultado positivo estadísticamente significativo. Reproduciendo el cálculo: 1 menos 0,975 elevado a 5 da 11,89 por ciento, y 1 menos 0,975 elevado a 30 da 53,21 por ciento.

Los dos mecanismos que usan contra esto son explícitos y vale copiarlos: ajuste de umbral (exigir valores p menores en proyectos con muchos tratamientos o muchas iteraciones) y etapa de replicación (después de que el embudo se estrecha, una ronda final, preferentemente con más poder estadístico, que determina el resultado). En el mismo artículo, para el análisis en rebanadas (segmentos), relatan que educan a los experimentadores sobre falsos positivos y los incentivan a ajustar el umbral de probabilidad, enfocándose en señales fuertes y valores p menores, del orden de 0,0001.

Kohavi, Deng, Longbotham y Xu hacen la misma advertencia por el lado del volumen: como ejecutan miles de experimentos al año, una tasa de falso positivo de 0,05 implica cientos de falsos positivos para una métrica dada, y eso empeora cuando se usan varias métricas no correlacionadas.

Los tres ejes de multiplicidad y cómo se multiplicanTres bloques horizontales apilados que representan los ejes que multiplican el número de tests en un programa de experimentación: métricas del panel, variantes del experimento e iteraciones a lo largo del tiempo, más un cuarto eje destacado que son los cortes por segmento. Una línea abajo indica que el número total de comparaciones es el producto de los cuatro, no la suma, y que la familia de tests tiene que declararse antes de mirar el dato.El número de comparaciones es el PRODUCTO de los ejes, no la sumamétricas del panel20 en el ejemploxvariantesA/B/n contra el controlxiteracionesrondas del mismo temaxsegmentoscortes ad hoctotal de comparaciones hechas en el experimentoCinco tratamientos elevan la tasa del 2,5 por ciento al 12 por ciento; seis rondas de esos cinco pasan del 50 por ciento.El eje de los segmentos es el más peligroso porque es el único que crece DESPUÉS de que llega el dato.Regla práctica: la familia de tests tiene que declararse en el plan de análisis, antes de cualquier lectura.
El eje de los segmentos es el único que no tiene tamaño fijo: crece mientras alguien esté dispuesto a cortar el dato de una manera más. Por eso es el que más necesita declararse antes.

Qué regla usar en qué parte del informe

La respuesta práctica no es elegir una corrección para todo, es partir el informe en familias con reglas diferentes, y declarar esa partición antes de ejecutar.

parte del informe pregunta que responde regla recomendada
Métrica primaria (1 métrica) ¿este test gana? sin corrección; la familia tiene tamaño 1 por construcción
Métricas secundarias de éxito ¿qué más se movió junto? Benjamini-Hochberg con q entre 0,05 y 0,20
Métricas de guardrail ¿esto rompió algo? alerta sensible, sin corrección que reduzca la sensibilidad
Cortes por segmento ¿para quién funcionó? predeclarados en el plan, o tratados como exploración
Decisión de lanzamiento con varias variantes ¿qué brazo se lanza? corrección de FWER (Bonferroni o similar)

La fila de las métricas de guardrail suele sorprender, y merece el detalle. Una métrica de guardrail existe para detectar daño, no para detectar ganancia. La hipótesis nula útil ahí es “nada empeoró”, y el error caro es el Tipo II: dejar pasar un empeoramiento real. Corregir para múltiples comparaciones hace más difícil rechazar la nula, lo que aumenta exactamente ese error. Aplicar Bonferroni en el panel de guardrails es optimizar contra el objetivo del panel. El tratamiento propio está en métricas de guardrail.

La fila de la métrica primaria también merece una nota. Solo tiene tamaño 1 si declaraste cuál es antes de mirar. Elegir la primaria después de ver los valores p es el caso en el que la familia tiene tamaño 20 y estás fingiendo que tiene tamaño 1. Es la razón de existir del plan de análisis preregistrado.

El contraargumento honesto

Existe una línea respetable que discrepa de todo este encuadre, y omitirla sería deshonesto. Gelman, Hill y Yajima defienden que el problema de múltiples comparaciones puede desaparecer por completo cuando se ve desde una perspectiva bayesiana jerárquica. Su argumento tiene dos partes:

  1. Cuestionan el propio paradigma del error Tipo I, porque rara vez creen que la hipótesis nula pueda ser estrictamente verdadera.
  2. Sostienen que el problema no es el testeo múltiple sino la modelización insuficiente de la relación entre los parámetros. Un modelo multinivel hace encogimiento (las estimaciones y los intervalos son tirados unos hacia los otros), mientras que los procedimientos clásicos mantienen los centros quietos y ensanchan los intervalos. Según ellos, las comparaciones hechas con estimaciones multinivel quedan apropiadamente más conservadoras sin sacrificar poder de la forma en que lo sacrifican muchos métodos tradicionales.

Los mismos autores reconocen, sin embargo, que los métodos de control de FDR tienen sentido particular en campos donde se espera un puñado de efectos reales en medio de una cantidad enorme de efectos nulos, y que el FDR lleva a un procedimiento menos conservador respecto al error Tipo I, pero más potente para detectar efectos reales.

La traducción práctica para quien ejecuta tests A/B: si tu motor es bayesiano, el camino de modelar la jerarquía de las métricas es legítimo y probablemente mejor. Lo que no es legítimo es usar ese argumento como licencia para leer 20 valores p crudos y elegir el que gustó. El tratamiento bayesiano de las decisiones de test está en test A/B bayesiano y en pérdida esperada.

Checklist antes de leer el panel

  1. ¿La familia de tests está declarada por escrito? Cuántas métricas, cuántos brazos, cuántos segmentos, todo antes de la primera mirada.
  2. ¿La métrica primaria está nombrada aisladamente? Una, no “las tres principales”.
  3. ¿El panel secundario tiene una regla declarada? Benjamini-Hochberg con q elegido antes, no después.
  4. ¿Los guardrails están fuera de la corrección? Necesitan sensibilidad, no rigor.
  5. ¿Los segmentos que se van a leer están listados? Corte no listado es exploración y sale etiquetado como tal.
  6. ¿Alguien contó cuántas iteraciones ha tenido ya este tema? El cálculo de 1 menos 0,975 elevado a k es acumulativo entre rondas.
  7. ¿Hay una etapa de replicación prevista? Es el mecanismo más confiable y el más fácil de olvidar.

Errores comunes

Hazlo automático en Donnu

El error caro aquí no es elegir la corrección equivocada, es que el panel no deje claro cuántas preguntas se hicieron. Veinte métricas en una tabla, todas con el mismo intervalo de confianza y el mismo color, esconden que la regla del 5 por ciento fue diseñada para una pregunta y se está usando en veinte.

En Donnu, la métrica primaria se declara en la creación del experimento y queda visualmente separada del panel secundario, que lleva el valor p ajustado por Benjamini-Hochberg al lado del bruto, con el q usado escrito en la tabla. Las métricas de guardrail quedan en un panel propio, con umbral de alerta propio y sin corrección que reduzca su sensibilidad. Si quieres rehacer cualquier fila a mano, la calculadora de significancia acepta los conteos brutos y la calculadora para varias variantes trata el eje de los brazos.

Referencias

Lee también: Testear varias variantes sin falso positivo · Métricas de guardrail · Plan de análisis preregistrado · Métrica primaria y OEC · El problema del peeking · Calculadora de significancia · Leia em português

Preguntas frecuentes

¿Cuál es la probabilidad de un falso positivo cuando leo 20 métricas en un test A/B?
Si las 20 métricas fueran independientes y ninguna tuviera efecto real, la probabilidad de que al menos una salga con valor p por debajo de 0,05 es 1 menos 0,95 elevado a 20, es decir, 64,15 por ciento. Con 5 métricas son 22,62 por ciento, con 10 son 40,13 por ciento y con 50 son 92,31 por ciento. En la práctica las métricas de un mismo test están correlacionadas y el número real queda por debajo de ese techo, pero el orden de magnitud es ese: leer muchas métricas sin corrección casi garantiza encontrar algo.
¿Cuál es la diferencia entre FWER y FDR?
El FWER es la probabilidad de cometer al menos un error Tipo I en la familia entera de tests. El FDR, definido por Benjamini y Hochberg en 1995, es la esperanza de la proporción de hipótesis rechazadas erróneamente entre todas las rechazadas. Los autores muestran que, cuando todas las hipótesis nulas son verdaderas, ambas cosas coinciden; cuando algunas son falsas, el FDR es menor o igual que el FWER, y por eso los procedimientos que controlan solo el FDR pueden ser menos rigurosos y ganar poder.
¿Cómo funciona el procedimiento de Benjamini-Hochberg?
Ordena los m valores p de menor a mayor. Encuentra el mayor índice i para el cual el valor p en la posición i es menor o igual que i dividido por m, por la tasa objetivo q. Rechaza todas las hipótesis de la posición 1 hasta esa posición i. Es un procedimiento de paso hacia arriba: la decisión la toma el mayor índice que pasa, y todas las posiciones por debajo de él se rechazan juntas, aunque alguna de ellas aisladamente no pasara su propio límite. Benjamini y Hochberg prueban que esto controla el FDR en q para estadísticas de test independientes.
¿Bonferroni o Benjamini-Hochberg para métricas de test A/B?
Depende del costo del error. Bonferroni compara cada valor p con alfa dividido por el número de tests y controla el FWER: úsalo cuando una única afirmación falsa ya compromete la decisión, típicamente en la métrica primaria de una decisión de lanzamiento. Benjamini-Hochberg controla la proporción de falsos descubrimientos y es más apropiado para la lectura exploratoria del panel de métricas secundarias, donde algunos falsos descubrimientos entre muchos verdaderos son tolerables. Ambos enfoques exigen declarar la familia de tests antes de mirar los datos.
¿Las métricas de guardrail entran en la corrección de múltiples comparaciones?
No deben entrar de la misma forma. La pregunta de una métrica de guardrail está invertida: no quieres detectar un efecto, quieres descartar un daño. Corregir para múltiples comparaciones hace más difícil rechazar la nula, lo que aumenta la probabilidad de dejar pasar un empeoramiento real. Los guardrails piden alerta sensible y umbral propio, discutido aparte, no la misma corrección aplicada a las métricas de éxito.
¿Hay quien defienda no corregir para múltiples comparaciones?
Sí, y el argumento es serio. Gelman, Hill y Yajima defienden que, en un modelo multinivel bayesiano, el problema de múltiples comparaciones puede desaparecer: el modelo tira de las estimaciones unas hacia las otras (encogimiento) en vez de mantener los centros quietos y ensanchar los intervalos, lo que según ellos produce estimaciones más eficientes, sobre todo cuando la variación entre los grupos es baja, que es justamente donde más preocupan las múltiples comparaciones. Es una alternativa al paradigma de error Tipo I, no una licencia para leer 20 métricas crudas y elegir la que gustó.