Estadística

Factor de Bayes en Test A/B: el peso de la evidencia

El factor de Bayes mide cuánto movieron los datos la creencia entre dos hipótesis. La cuenta, la paradoja de Lindley en números y el límite del método.

Ilustración plana de una balanza de dos platillos en equilibrio, con un cubo pequeño y denso de un lado y granos esparcidos del otro

El factor de Bayes responde una pregunta que el valor p no responde: cuántas veces los datos observados son más probables bajo la hipótesis de que existe diferencia que bajo la hipótesis de que no existe. Es el multiplicador que transforma sus odds a priori en odds a posteriori, y puede apuntar hacia los dos lados. En el ejemplo trabajado de esta guía, una lectura de 4.200 visitantes con 210 conversiones contra 4.200 con 273 devuelve un valor p de 0,003150, considerado significativo por cualquier criterio usual, y un factor de Bayes de 0,9992 con prior uniforme, es decir, evidencia prácticamente nula en cualquier dirección. Esta guía muestra la cuenta cerrada para dos proporciones, la paradoja de Lindley en cinco filas calculadas, el caso en que el factor crece sin límite, la única situación en la que dice con claridad que no hay efecto, y el precio que cobra en elección de prior. Forma parte de nuestra guía completa de test A/B y complementa la guía de test A/B bayesiano.

La pregunta que el valor p no responde

El valor p mide una sola cosa: la probabilidad de observar datos tan extremos como los suyos SI la hipótesis nula fuera verdadera. No mira la hipótesis alternativa en ningún momento, y por eso no puede leerse como la probabilidad de que la alternativa sea verdadera.

Jeffreys resumió la incomodidad con el método en una frase que Wagenmakers reproduce: lo que implica el uso del valor p es que una hipótesis que puede ser verdadera se rechaza porque no predijo resultados observables que no ocurrieron, lo que parece un procedimiento notable.

Berger da el tamaño concreto del problema. Describe una aplicación que simula una larga serie de tests con datos normales y registra con qué frecuencia la hipótesis nula es verdadera en cada franja de valor p. Si la mitad de las hipótesis nulas de esa serie es verdadera a priori, entre los tests con valor p cerca de 0,05 al menos 22 por ciento y típicamente más de 50 por ciento de las nulas correspondientes serán verdaderas. Añade un segundo escenario: cuando cerca de 90 por ciento de las nulas son verdaderas a priori, como se estimó para la literatura de epidemiología, entre los tests con valor p cerca de 0,05 al menos 72 por ciento y típicamente más de 90 por ciento de las nulas serán verdaderas.

El factor de Bayes es la respuesta directa a ese vacío. La definición operativa cabe en una línea:

odds a posteriori = odds a priori por el factor de Bayes.

Deng, Lu y Chen escriben exactamente esa relación al formalizar el test bayesiano para experimentos online, y es lo que le da al factor de Bayes la interpretación de peso de la evidencia aportada por los datos: es cuánto tiene que moverse su creencia, y la dirección hacia la que tiene que moverse.

Las odds a priori multiplicadas por el factor de Bayes se vuelven odds a posterioriUn diagrama en tres bloques unidos por flechas. El primer bloque son las odds a priori, lo que usted creía antes del test. El segundo bloque es el factor de Bayes, descrito como todo lo que aportan los datos. El tercer bloque son las odds a posteriori. Abajo, una franja muestra que un factor mayor que uno empuja la creencia en la dirección de que exista efecto y un factor menor que uno la empuja en la dirección contraria, mientras que un factor igual a uno deja la creencia exactamente donde estaba.odds a priorilo que usted ya creíaxfactor de Bayestodo lo que aportan los datos=odds a posteriorilo que debe creer ahora1,00bajo 1: evidencia a favor de NO haber diferenciasobre 1: a favor de haberlaexactamente 1: el test no aportó información algunael valor p solo sabe apuntar a un lado de esta recta, y nunca sabe apuntar al centro.
La escala es multiplicativa y simétrica. Un factor de 0,05 es tan informativo como un factor de 20, solo que en la dirección opuesta.

La cuenta, para dos proporciones

Para un test A/B de conversión la cuenta cierra en forma exacta, sin simulación. Las dos hipótesis son:

Bajo cada hipótesis, se calcula la probabilidad de los datos observados en el promedio de todos los valores que los parámetros podrían asumir, ponderados por el prior. El factor de Bayes es la razón entre esos dos promedios. Como los dos brazos son binomiales con los mismos datos, los coeficientes binomiales aparecen en las dos cuentas y se cancelan, y queda solo una razón de funciones beta que cualquier hoja de cálculo calcula.

El punto sutil está en el “en el promedio”. Wagenmakers explica la consecuencia: una de las ventajas de promediar en vez de maximizar es que el promedio incorpora automáticamente una penalización por complejidad del modelo. Un modelo en el que la tasa es libre de asumir cualquier valor en el intervalo de 0 a 1 es más complejo que el modelo que fija una tasa común, y los valores que resultan muy poco plausibles a la luz de los datos observados tiran el promedio hacia abajo.

Es esa penalización la que hace que el factor de Bayes discrepe del valor p. El valor p compara su dato con el mejor caso de la hipótesis nula. El factor de Bayes compara el dato con el promedio de la hipótesis alternativa entera, incluidos todos los efectos gigantescos que ella permite y que su dato no mostró.

El ejemplo trabajado: valor p de 0,0031 y factor de Bayes de 0,9992

El ejemplo de referencia de nuestras calculadoras es una lectura de 4.200 visitantes por brazo, con 210 conversiones en el control y 273 en la variación. Péguelo en la calculadora de abajo:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Devuelve 5,00 por ciento contra 6,50 por ciento, más 30,0 por ciento relativo y valor p de 0,0031. La pantalla redondea a cuatro decimales; la diferencia absoluta es de 1,5000 punto porcentual y el valor p con más decimales es 0,003150. Por el criterio clásico, esto es significativo con holgura: el resultado pasa el 0,05 y pasa el 0,01.

El factor de Bayes de esa misma lectura, con prior uniforme en las dos tasas, es 0,9992. Con odds a priori iguales, la probabilidad a posteriori de que exista diferencia queda en 49,98 por ciento, prácticamente idéntica al 50 por ciento del que partió.

Los dos números están bien y responden preguntas distintas. El valor p dice: si no hubiera diferencia alguna, un resultado así o más extremo aparecería en cerca de 3 de cada 1.000 tests. El factor de Bayes dice: estos datos son igual de probables bajo las dos hipótesis, porque la hipótesis de que existe diferencia tiene que repartir su credibilidad entre un efecto de 1,5 punto y todos los efectos de 10, 20 o 40 puntos que también permite, y que el dato no sostiene.

Un test bayesiano que responde otra pregunta más, la de qué variación es mejor y por cuánto, es el de la calculadora de abajo. No calcula factor de Bayes: calcula la probabilidad de que la variación sea mejor y la pérdida esperada de elegir mal.

Calculadora bayesiana de test A/B
A (control)
B (variación)
-probabilidad de que B le gane a A
Tasa de A (posterior)-
Tasa de B (posterior)-
Probabilidad de que A gane-
Riesgo al elegir B (pérdida esperada)-
Mejora relativa (medias)-

Modelo Beta-Binomial con prior uniforme Beta(1,1) e intervalo de credibilidad del 95%. Cálculo determinístico, recalcula en vivo.

Esas tres lecturas no son sustitutas. Valor p, factor de Bayes y probabilidad de superar responden, respectivamente, a la compatibilidad con la nula, al peso de la evidencia entre dos hipótesis, y a la dirección de la decisión. La herramienta de decisión práctica en un test A/B suele ser la tercera, junto con la pérdida esperada. El factor de Bayes es la herramienta de lectura de la evidencia.

La paradoja de Lindley, en cinco filas calculadas

Aquí está la demostración más incómoda del método. En las cinco lecturas de abajo, el valor p es el mismo, siempre cerca de 0,05. Lo único que cambia es el tamaño del test.

por brazo control variación efecto valor p factor de Bayes evidencia EN CONTRA de que haya efecto
1.000 50 71 más 2,1000 pp 0,048884 0,1849 5,41 veces
5.000 250 294 más 0,8800 pp 0,052381 0,0746 13,41 veces
20.000 1.000 1.087 más 0,4350 pp 0,050452 0,0378 26,49 veces
100.000 5.000 5.193 más 0,1930 pp 0,049728 0,0169 59,16 veces
500.000 25.000 25.429 más 0,0858 pp 0,049944 0,0075 133,42 veces

El valor p se queda quieto y el factor de Bayes se mueve 18 veces, siempre en la misma dirección: en contra de la existencia de efecto. Un resultado “significativo al 5 por ciento” en un test de medio millón por brazo es, en términos de peso de la evidencia, un resultado que favorece la hipótesis de que no hay diferencia por más de 130 a 1.

Valor p constante y factor de Bayes decreciente a medida que crece la muestraDos series dibujadas sobre el mismo eje horizontal de tamaño de muestra por brazo, de mil a quinientos mil. La serie del valor p es una línea prácticamente horizontal en torno a cero coma cinco por ciento por encima del eje, siempre cerca de cero coma cero cinco. La serie del factor de Bayes baja continuamente, de cero coma uno ocho cuatro nueve a cero coma cero cero siete cinco. Las dos cuentan historias opuestas sobre los mismos datos.1.0005.00020.000100.000500.000visitantes por brazo, escala aproximadamente logarítmicavalor p: siempre cerca de 0,050,18490,03780,0075los mismos datos, dos conclusiones que se alejan con el tamaño del testcuanto mayor es la muestra, más la misma significancia se vuelve evidencia contra el efecto.
La línea roja es la que mira la mayoría de los informes. La verde es la que cambia de conclusión.

El resultado es general, no un artefacto del prior elegido. Wagenmakers registra que, para cualquier prior continuo y estrictamente positivo, la probabilidad a posteriori de la hipótesis nula converge a 1 a medida que crece la muestra, siempre que el valor p permanezca constante, y atribuye el resultado a Berger y Sellke y a Lindley. Su conclusión es directa: no existe un prior plausible para el cual la probabilidad a posteriori de la hipótesis nula esté relacionada monótonamente con el valor p a medida que aumenta el número de observaciones.

La lectura práctica para quien corre tests A/B a gran escala: en un test de cientos de miles de visitantes por brazo, un valor p ajustado de 0,04 o 0,05 no es un resultado marginalmente positivo, es un resultado que mide un efecto demasiado pequeño para justificar la hipótesis de que existe. Es la misma alerta que aparece en la región de equivalencia práctica, por otro camino.

Cuando el efecto es real, el factor crece sin límite

La paradoja de arriba no significa que el factor de Bayes sea pesimista por naturaleza. Significa que exige que el efecto no se encoja a medida que crece la muestra. Fije el efecto verdadero en más 1 punto porcentual sobre una base de 5 por ciento y vea lo que pasa:

por brazo control variación valor p factor de Bayes lectura
2.000 100 120 0,165416 0,0472 en contra del efecto, 21 a 1
5.000 250 300 0,028295 0,1265 en contra del efecto, 8 a 1
10.000 500 600 0,001925 0,9941 empate
20.000 1.000 1.200 0,000012 86,81 a favor, 87 a 1
40.000 2.000 2.400 por debajo de lo mostrable 936.314 a favor, aplastante
80.000 4.000 4.800 por debajo de lo mostrable más de 100 billones a favor, absoluto

Dos cosas saltan de esta tabla.

Primera: el valor p declara victoria en 5.000 por brazo y el factor de Bayes recién empata en 10.000. Con 5.000 por brazo el resultado ya es significativo al 5 por ciento, con valor p de 0,028295, y el peso de la evidencia sigue siendo 8 a 1 EN CONTRA de la existencia del efecto. Quien lanza con base en ese test está lanzando con evidencia desfavorable, por más extraño que suene.

Segunda: a partir de 20.000 por brazo la evidencia se da vuelta y no para de crecer. El factor pasa de 86,81 a 936.314 al duplicar la muestra, y a más de 100 billones al duplicarla de nuevo. El crecimiento del factor de Bayes es exponencial en el tamaño de la muestra cuando el efecto es real, y eso es una propiedad y no un defecto.

Vale notar de dónde viene la asimetría de los 5.000: el tamaño de muestra que nuestra calculadora recomienda para detectar un efecto relativo de 20 por ciento sobre una base de 5 por ciento, con 80 por ciento de poder, es 8.158 por variación. O sea, el test de 5.000 por brazo está subdimensionado, y la significancia que produjo es la significancia de un test que todavía no tenía datos suficientes.

Lo que el valor p nunca logra decir

El caso más útil del factor de Bayes es el que el test clásico simplemente no cubre: evidencia a favor de que no hay efecto.

por brazo lectura valor p factor de Bayes evidencia a favor de que NO hay diferencia
2.000 100 contra 100 1,0000 0,0173 57,86 a 1
10.000 500 contra 500 1,0000 0,0077 129,42 a 1
50.000 2.500 contra 2.500 1,0000 0,0035 289,42 a 1
200.000 10.000 contra 10.000 1,0000 0,0017 578,84 a 1

El valor p es 1,0000 en las cuatro filas y no distingue una de otra. El factor de Bayes sí distingue: un empate en 2.000 por brazo es un resultado tibio y un empate en 200.000 por brazo es una afirmación fuerte de que ese cambio no movió nada. Esa distinción es la que el equipo de producto necesita para decidir si archiva la hipótesis o si vuelve a ella con un test más grande.

La evidencia a favor de la ausencia de efecto crece con la muestra en un empate exactoCuatro barras horizontales, una para cada tamaño de muestra en un empate exacto entre control y variación. La barra crece de cincuenta y siete a uno en dos mil por brazo hasta quinientos setenta y ocho a uno en doscientos mil por brazo. Al lado, una línea única marca que el valor p es igual a uno punto cero en los cuatro casos, sin distinguir ninguno de ellos.empate exacto: cuánto favorece el factor de Bayes la ausencia de efecto2.000 por brazo57,86 a 110.000 por brazo129,42 a 150.000 por brazo289,42 a 1200.000 por brazo578,84 a 1valor p1,0000 en los cuatro casos, sin distinción algunaausencia de evidencia y evidencia de ausencia son distintas, y solo una de las dos reglas mide la segunda.
Cuatro empates idénticos a los ojos del valor p, con pesos de evidencia que difieren por un factor de diez.

La parte incómoda: el prior importa, y mucho

Nada de lo de arriba sale gratis. El factor de Bayes depende del prior elegido para la hipótesis alternativa, y la dependencia no es decorativa. Tome una lectura intermedia, 20.000 por brazo con 1.000 conversiones en el control y 1.080 en la variación, que en la calculadora devuelve más 8,0 por ciento relativo y valor p de 0,0716. La diferencia absoluta es de más 0,4000 punto porcentual y el intervalo va de menos 0,0351 a más 0,8351 punto, es decir, cruza el cero por poco.

prior sobre cada tasa lo que afirma factor de Bayes probabilidad a posteriori de que haya efecto
uniforme entre 0 y 1 cualquier tasa es igual de plausible 0,0282 2,74%
media 5%, concentración débil tasas en torno a 5%, con mucha holgura 0,4823 32,54%
media 5%, concentración media tasas en torno a 5%, con holgura moderada 0,9333 48,27%
media 5%, concentración fuerte tasas cercanas a 5%, con poca holgura 1,3559 57,55%

El mismo dato atraviesa el valor 1 cuando cambia el prior. El prior uniforme es el más desfavorable posible para la hipótesis de que existe efecto, porque reparte credibilidad entre tasas de 40, 70 o 95 por ciento, que nadie que trabaje con conversión considera plausibles, y la penalización por complejidad cobra por cada una de ellas.

La conclusión práctica no es abandonar el método, es declarar el prior antes de mirar los datos, exactamente como se declara el nivel de significancia en un test clásico. Y existe un camino objetivo: Deng, Lu y Chen registran que buena parte de la dificultad de elegir un prior puede mitigarse usando datos de tests A/B históricos para aprender el prior empíricamente, cuando es razonable suponer que los tests anteriores vienen de la misma distribución de ideas. Es el mismo razonamiento de los priors bayesianos y de la contracción bayesiana: el historial del programa es información.

Monitoreo continuo: donde el método está más cómodo

Existe una ventaja operativa concreta. En el test clásico, mirar el resultado todos los días y parar cuando se vuelve significativo infla el error tipo I, y por eso el problema del peeking exige corrección secuencial.

Deng, Lu y Chen prueban formalmente la validez del test bayesiano con monitoreo continuo cuando se usan reglas de parada apropiadas, e ilustran el resultado con simulaciones. También señalan las malas prácticas en las que la regla de parada no es apropiada, y comparan el enfoque con las correcciones del test clásico.

Dos salvedades importan. Primera, “regla apropiada” es una condición, no una dispensa: registran explícitamente que la propiedad no vale si el factor de Bayes se calcula sobre un subconjunto seleccionado de los datos. Segunda, esto trata del error de espiar, no del error de decidir demasiado pronto: un factor de Bayes de 3 en un test de dos días sigue siendo un factor de Bayes de 3, con toda la incertidumbre que carga.

Cómo usar el factor de Bayes en la práctica

  1. Declare el prior en el plan de análisis, antes de correr. Sin eso, el factor de Bayes se vuelve un parámetro ajustable hasta que el resultado agrade.
  2. Reporte factor de Bayes Y valor p, sin elegir solo uno. Cuando los dos concuerdan, la lectura es fácil. Cuando discrepan, la discrepancia es la información.
  3. Trate la discrepancia como señal de efecto pequeño. Factor de Bayes bajo con valor p bajo quiere decir, casi siempre, que el efecto medido es pequeño en relación con lo que la hipótesis alternativa permitiría.
  4. Use el factor de Bayes para archivar hipótesis. Es la única de las tres reglas que autoriza a decir “esto no mueve la aguja, deje de intentarlo”.
  5. No convierta el factor de Bayes en una decisión por sí solo. La decisión de lanzar depende de costo, riesgo y valor, y la regla para eso es la pérdida esperada o un análisis de valor de la información.
  6. Dimensione el test antes. Un factor de Bayes calculado sobre un test subdimensionado es honesto e inútil al mismo tiempo: va a decir, correctamente, que los datos no sostienen nada.
  7. Si va a monitorear continuamente, fije la regla de parada antes. Es la condición del resultado, no un detalle.

Errores comunes

Hágalo automático con Donnu

El factor de Bayes necesita dos cosas que la mayoría de los paneles no guarda: los cuatro números crudos del test, sin redondeo, y el registro de qué prior estaba vigente cuando se planificó el análisis. Lo segundo es lo que separa un test bayesiano honesto de un resultado ajustado después.

Donnu guarda los contadores de exposición y conversión por brazo a nivel crudo y mantiene el historial de configuración del experimento, incluido lo que se decidió antes de que empezara el test. Eso deja el cálculo del factor de Bayes reproducible meses después, con el prior que valía en su momento y no con el que parece conveniente hoy.

Y vale la recomendación de alcance: el factor de Bayes es una regla de evidencia, no una regla de decisión. Para la decisión, la calculadora bayesiana entrega probabilidad de superar y pérdida esperada, que es lo que la mayor parte de los equipos realmente necesita mirar antes de lanzar.

Referencias

Lee también: Test A/B bayesiano · Pérdida esperada · Priors bayesianos · Región de equivalencia práctica · Problema del peeking · Calculadora bayesiana · Leia em português · Read in English

Preguntas frecuentes

¿Qué es el factor de Bayes en un test A/B?
Es la razón entre la probabilidad de los datos observados bajo la hipótesis de que existe diferencia y la probabilidad de los mismos datos bajo la hipótesis de que no existe. Es el número por el que usted multiplica sus odds a priori para obtener las odds a posteriori. Un factor de 10 significa que los datos son diez veces más probables si hay diferencia; un factor de 0,1 significa lo contrario, y el valor p no tiene cómo expresar esa segunda situación.
¿Un valor p de 0,003 es siempre evidencia fuerte?
No. En el ejemplo trabajado de esta guía, la lectura de 4.200 visitantes con 210 conversiones contra 4.200 con 273 devuelve un valor p de 0,003150 y un factor de Bayes de 0,9992 con prior uniforme, es decir, los datos son prácticamente igual de probables bajo las dos hipótesis. Berger registra que, en una larga serie de tests en la que la mitad de las hipótesis nulas es verdadera, entre los tests con valor p cerca de 0,05 al menos 22 por ciento y típicamente más de 50 por ciento de las nulas correspondientes serán verdaderas.
¿Qué es la paradoja de Lindley?
Es el hecho de que, manteniendo fijo el valor p, el factor de Bayes se mueve EN CONTRA de la hipótesis de que existe efecto a medida que la muestra crece. En los cinco casos calculados en esta guía, todos con valor p cerca de 0,05, el factor de Bayes cae de 0,1849 con 1.000 por brazo a 0,0075 con 500.000 por brazo. O sea, la misma significancia se vuelve evidencia 5 veces en contra de la hipótesis en un test pequeño y 133 veces en contra en un test enorme.
¿El factor de Bayes puede decir que NO existe efecto?
Sí, y es su diferencia práctica más útil. Un valor p alto solo significa ausencia de evidencia contra la hipótesis nula. En un empate exacto de 200.000 por brazo con la misma tasa, el factor de Bayes calculado aquí es 0,0017, es decir, los datos son 579 veces más probables bajo la hipótesis de que no hay diferencia. El valor p en esa misma lectura es 1,0000 y no distingue este caso de un test con 200 visitantes.
¿El prior cambia mucho el resultado?
Lo cambia, y ese es el costo honesto del método. Con la misma lectura de 20.000 por brazo, 1.000 contra 1.080 conversiones, el factor de Bayes va de 0,0282 con prior uniforme a 1,3559 con un prior Beta de media 5 por ciento y fuerte concentración, atravesando el valor 1. El prior tiene que declararse antes de mirar los datos, exactamente como el nivel de significancia en un test clásico.
¿Puedo mirar el factor de Bayes todos los días sin penalización?
Con una regla de parada apropiada, sí. Deng, Lu y Chen prueban formalmente la validez del test bayesiano bajo monitoreo continuo cuando las reglas de parada son apropiadas, y señalan las malas prácticas en las que la regla no es apropiada. Eso es distinto del test clásico, en el que espiar sin corrección infla el error tipo I.