Factor de Bayes en Test A/B: el peso de la evidencia
El factor de Bayes mide cuánto movieron los datos la creencia entre dos hipótesis. La cuenta, la paradoja de Lindley en números y el límite del método.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El factor de Bayes responde una pregunta que el valor p no responde: cuántas veces los datos observados son más probables bajo la hipótesis de que existe diferencia que bajo la hipótesis de que no existe. Es el multiplicador que transforma sus odds a priori en odds a posteriori, y puede apuntar hacia los dos lados. En el ejemplo trabajado de esta guía, una lectura de 4.200 visitantes con 210 conversiones contra 4.200 con 273 devuelve un valor p de 0,003150, considerado significativo por cualquier criterio usual, y un factor de Bayes de 0,9992 con prior uniforme, es decir, evidencia prácticamente nula en cualquier dirección. Esta guía muestra la cuenta cerrada para dos proporciones, la paradoja de Lindley en cinco filas calculadas, el caso en que el factor crece sin límite, la única situación en la que dice con claridad que no hay efecto, y el precio que cobra en elección de prior. Forma parte de nuestra guía completa de test A/B y complementa la guía de test A/B bayesiano.
La pregunta que el valor p no responde
El valor p mide una sola cosa: la probabilidad de observar datos tan extremos como los suyos SI la hipótesis nula fuera verdadera. No mira la hipótesis alternativa en ningún momento, y por eso no puede leerse como la probabilidad de que la alternativa sea verdadera.
Jeffreys resumió la incomodidad con el método en una frase que Wagenmakers reproduce: lo que implica el uso del valor p es que una hipótesis que puede ser verdadera se rechaza porque no predijo resultados observables que no ocurrieron, lo que parece un procedimiento notable.
Berger da el tamaño concreto del problema. Describe una aplicación que simula una larga serie de tests con datos normales y registra con qué frecuencia la hipótesis nula es verdadera en cada franja de valor p. Si la mitad de las hipótesis nulas de esa serie es verdadera a priori, entre los tests con valor p cerca de 0,05 al menos 22 por ciento y típicamente más de 50 por ciento de las nulas correspondientes serán verdaderas. Añade un segundo escenario: cuando cerca de 90 por ciento de las nulas son verdaderas a priori, como se estimó para la literatura de epidemiología, entre los tests con valor p cerca de 0,05 al menos 72 por ciento y típicamente más de 90 por ciento de las nulas serán verdaderas.
El factor de Bayes es la respuesta directa a ese vacío. La definición operativa cabe en una línea:
odds a posteriori = odds a priori por el factor de Bayes.
Deng, Lu y Chen escriben exactamente esa relación al formalizar el test bayesiano para experimentos online, y es lo que le da al factor de Bayes la interpretación de peso de la evidencia aportada por los datos: es cuánto tiene que moverse su creencia, y la dirección hacia la que tiene que moverse.
La cuenta, para dos proporciones
Para un test A/B de conversión la cuenta cierra en forma exacta, sin simulación. Las dos hipótesis son:
- Sin diferencia: existe una única tasa de conversión común a los dos brazos.
- Con diferencia: cada brazo tiene su propia tasa, y las dos son libres.
Bajo cada hipótesis, se calcula la probabilidad de los datos observados en el promedio de todos los valores que los parámetros podrían asumir, ponderados por el prior. El factor de Bayes es la razón entre esos dos promedios. Como los dos brazos son binomiales con los mismos datos, los coeficientes binomiales aparecen en las dos cuentas y se cancelan, y queda solo una razón de funciones beta que cualquier hoja de cálculo calcula.
El punto sutil está en el “en el promedio”. Wagenmakers explica la consecuencia: una de las ventajas de promediar en vez de maximizar es que el promedio incorpora automáticamente una penalización por complejidad del modelo. Un modelo en el que la tasa es libre de asumir cualquier valor en el intervalo de 0 a 1 es más complejo que el modelo que fija una tasa común, y los valores que resultan muy poco plausibles a la luz de los datos observados tiran el promedio hacia abajo.
Es esa penalización la que hace que el factor de Bayes discrepe del valor p. El valor p compara su dato con el mejor caso de la hipótesis nula. El factor de Bayes compara el dato con el promedio de la hipótesis alternativa entera, incluidos todos los efectos gigantescos que ella permite y que su dato no mostró.
El ejemplo trabajado: valor p de 0,0031 y factor de Bayes de 0,9992
El ejemplo de referencia de nuestras calculadoras es una lectura de 4.200 visitantes por brazo, con 210 conversiones en el control y 273 en la variación. Péguelo en la calculadora de abajo:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Devuelve 5,00 por ciento contra 6,50 por ciento, más 30,0 por ciento relativo y valor p de 0,0031. La pantalla redondea a cuatro decimales; la diferencia absoluta es de 1,5000 punto porcentual y el valor p con más decimales es 0,003150. Por el criterio clásico, esto es significativo con holgura: el resultado pasa el 0,05 y pasa el 0,01.
El factor de Bayes de esa misma lectura, con prior uniforme en las dos tasas, es 0,9992. Con odds a priori iguales, la probabilidad a posteriori de que exista diferencia queda en 49,98 por ciento, prácticamente idéntica al 50 por ciento del que partió.
Los dos números están bien y responden preguntas distintas. El valor p dice: si no hubiera diferencia alguna, un resultado así o más extremo aparecería en cerca de 3 de cada 1.000 tests. El factor de Bayes dice: estos datos son igual de probables bajo las dos hipótesis, porque la hipótesis de que existe diferencia tiene que repartir su credibilidad entre un efecto de 1,5 punto y todos los efectos de 10, 20 o 40 puntos que también permite, y que el dato no sostiene.
Un test bayesiano que responde otra pregunta más, la de qué variación es mejor y por cuánto, es el de la calculadora de abajo. No calcula factor de Bayes: calcula la probabilidad de que la variación sea mejor y la pérdida esperada de elegir mal.
Modelo Beta-Binomial con prior uniforme Beta(1,1) e intervalo de credibilidad del 95%. Cálculo determinístico, recalcula en vivo.
Esas tres lecturas no son sustitutas. Valor p, factor de Bayes y probabilidad de superar responden, respectivamente, a la compatibilidad con la nula, al peso de la evidencia entre dos hipótesis, y a la dirección de la decisión. La herramienta de decisión práctica en un test A/B suele ser la tercera, junto con la pérdida esperada. El factor de Bayes es la herramienta de lectura de la evidencia.
La paradoja de Lindley, en cinco filas calculadas
Aquí está la demostración más incómoda del método. En las cinco lecturas de abajo, el valor p es el mismo, siempre cerca de 0,05. Lo único que cambia es el tamaño del test.
| por brazo | control | variación | efecto | valor p | factor de Bayes | evidencia EN CONTRA de que haya efecto |
|---|---|---|---|---|---|---|
| 1.000 | 50 | 71 | más 2,1000 pp | 0,048884 | 0,1849 | 5,41 veces |
| 5.000 | 250 | 294 | más 0,8800 pp | 0,052381 | 0,0746 | 13,41 veces |
| 20.000 | 1.000 | 1.087 | más 0,4350 pp | 0,050452 | 0,0378 | 26,49 veces |
| 100.000 | 5.000 | 5.193 | más 0,1930 pp | 0,049728 | 0,0169 | 59,16 veces |
| 500.000 | 25.000 | 25.429 | más 0,0858 pp | 0,049944 | 0,0075 | 133,42 veces |
El valor p se queda quieto y el factor de Bayes se mueve 18 veces, siempre en la misma dirección: en contra de la existencia de efecto. Un resultado “significativo al 5 por ciento” en un test de medio millón por brazo es, en términos de peso de la evidencia, un resultado que favorece la hipótesis de que no hay diferencia por más de 130 a 1.
El resultado es general, no un artefacto del prior elegido. Wagenmakers registra que, para cualquier prior continuo y estrictamente positivo, la probabilidad a posteriori de la hipótesis nula converge a 1 a medida que crece la muestra, siempre que el valor p permanezca constante, y atribuye el resultado a Berger y Sellke y a Lindley. Su conclusión es directa: no existe un prior plausible para el cual la probabilidad a posteriori de la hipótesis nula esté relacionada monótonamente con el valor p a medida que aumenta el número de observaciones.
La lectura práctica para quien corre tests A/B a gran escala: en un test de cientos de miles de visitantes por brazo, un valor p ajustado de 0,04 o 0,05 no es un resultado marginalmente positivo, es un resultado que mide un efecto demasiado pequeño para justificar la hipótesis de que existe. Es la misma alerta que aparece en la región de equivalencia práctica, por otro camino.
Cuando el efecto es real, el factor crece sin límite
La paradoja de arriba no significa que el factor de Bayes sea pesimista por naturaleza. Significa que exige que el efecto no se encoja a medida que crece la muestra. Fije el efecto verdadero en más 1 punto porcentual sobre una base de 5 por ciento y vea lo que pasa:
| por brazo | control | variación | valor p | factor de Bayes | lectura |
|---|---|---|---|---|---|
| 2.000 | 100 | 120 | 0,165416 | 0,0472 | en contra del efecto, 21 a 1 |
| 5.000 | 250 | 300 | 0,028295 | 0,1265 | en contra del efecto, 8 a 1 |
| 10.000 | 500 | 600 | 0,001925 | 0,9941 | empate |
| 20.000 | 1.000 | 1.200 | 0,000012 | 86,81 | a favor, 87 a 1 |
| 40.000 | 2.000 | 2.400 | por debajo de lo mostrable | 936.314 | a favor, aplastante |
| 80.000 | 4.000 | 4.800 | por debajo de lo mostrable | más de 100 billones | a favor, absoluto |
Dos cosas saltan de esta tabla.
Primera: el valor p declara victoria en 5.000 por brazo y el factor de Bayes recién empata en 10.000. Con 5.000 por brazo el resultado ya es significativo al 5 por ciento, con valor p de 0,028295, y el peso de la evidencia sigue siendo 8 a 1 EN CONTRA de la existencia del efecto. Quien lanza con base en ese test está lanzando con evidencia desfavorable, por más extraño que suene.
Segunda: a partir de 20.000 por brazo la evidencia se da vuelta y no para de crecer. El factor pasa de 86,81 a 936.314 al duplicar la muestra, y a más de 100 billones al duplicarla de nuevo. El crecimiento del factor de Bayes es exponencial en el tamaño de la muestra cuando el efecto es real, y eso es una propiedad y no un defecto.
Vale notar de dónde viene la asimetría de los 5.000: el tamaño de muestra que nuestra calculadora recomienda para detectar un efecto relativo de 20 por ciento sobre una base de 5 por ciento, con 80 por ciento de poder, es 8.158 por variación. O sea, el test de 5.000 por brazo está subdimensionado, y la significancia que produjo es la significancia de un test que todavía no tenía datos suficientes.
Lo que el valor p nunca logra decir
El caso más útil del factor de Bayes es el que el test clásico simplemente no cubre: evidencia a favor de que no hay efecto.
| por brazo | lectura | valor p | factor de Bayes | evidencia a favor de que NO hay diferencia |
|---|---|---|---|---|
| 2.000 | 100 contra 100 | 1,0000 | 0,0173 | 57,86 a 1 |
| 10.000 | 500 contra 500 | 1,0000 | 0,0077 | 129,42 a 1 |
| 50.000 | 2.500 contra 2.500 | 1,0000 | 0,0035 | 289,42 a 1 |
| 200.000 | 10.000 contra 10.000 | 1,0000 | 0,0017 | 578,84 a 1 |
El valor p es 1,0000 en las cuatro filas y no distingue una de otra. El factor de Bayes sí distingue: un empate en 2.000 por brazo es un resultado tibio y un empate en 200.000 por brazo es una afirmación fuerte de que ese cambio no movió nada. Esa distinción es la que el equipo de producto necesita para decidir si archiva la hipótesis o si vuelve a ella con un test más grande.
La parte incómoda: el prior importa, y mucho
Nada de lo de arriba sale gratis. El factor de Bayes depende del prior elegido para la hipótesis alternativa, y la dependencia no es decorativa. Tome una lectura intermedia, 20.000 por brazo con 1.000 conversiones en el control y 1.080 en la variación, que en la calculadora devuelve más 8,0 por ciento relativo y valor p de 0,0716. La diferencia absoluta es de más 0,4000 punto porcentual y el intervalo va de menos 0,0351 a más 0,8351 punto, es decir, cruza el cero por poco.
| prior sobre cada tasa | lo que afirma | factor de Bayes | probabilidad a posteriori de que haya efecto |
|---|---|---|---|
| uniforme entre 0 y 1 | cualquier tasa es igual de plausible | 0,0282 | 2,74% |
| media 5%, concentración débil | tasas en torno a 5%, con mucha holgura | 0,4823 | 32,54% |
| media 5%, concentración media | tasas en torno a 5%, con holgura moderada | 0,9333 | 48,27% |
| media 5%, concentración fuerte | tasas cercanas a 5%, con poca holgura | 1,3559 | 57,55% |
El mismo dato atraviesa el valor 1 cuando cambia el prior. El prior uniforme es el más desfavorable posible para la hipótesis de que existe efecto, porque reparte credibilidad entre tasas de 40, 70 o 95 por ciento, que nadie que trabaje con conversión considera plausibles, y la penalización por complejidad cobra por cada una de ellas.
La conclusión práctica no es abandonar el método, es declarar el prior antes de mirar los datos, exactamente como se declara el nivel de significancia en un test clásico. Y existe un camino objetivo: Deng, Lu y Chen registran que buena parte de la dificultad de elegir un prior puede mitigarse usando datos de tests A/B históricos para aprender el prior empíricamente, cuando es razonable suponer que los tests anteriores vienen de la misma distribución de ideas. Es el mismo razonamiento de los priors bayesianos y de la contracción bayesiana: el historial del programa es información.
Monitoreo continuo: donde el método está más cómodo
Existe una ventaja operativa concreta. En el test clásico, mirar el resultado todos los días y parar cuando se vuelve significativo infla el error tipo I, y por eso el problema del peeking exige corrección secuencial.
Deng, Lu y Chen prueban formalmente la validez del test bayesiano con monitoreo continuo cuando se usan reglas de parada apropiadas, e ilustran el resultado con simulaciones. También señalan las malas prácticas en las que la regla de parada no es apropiada, y comparan el enfoque con las correcciones del test clásico.
Dos salvedades importan. Primera, “regla apropiada” es una condición, no una dispensa: registran explícitamente que la propiedad no vale si el factor de Bayes se calcula sobre un subconjunto seleccionado de los datos. Segunda, esto trata del error de espiar, no del error de decidir demasiado pronto: un factor de Bayes de 3 en un test de dos días sigue siendo un factor de Bayes de 3, con toda la incertidumbre que carga.
Cómo usar el factor de Bayes en la práctica
- Declare el prior en el plan de análisis, antes de correr. Sin eso, el factor de Bayes se vuelve un parámetro ajustable hasta que el resultado agrade.
- Reporte factor de Bayes Y valor p, sin elegir solo uno. Cuando los dos concuerdan, la lectura es fácil. Cuando discrepan, la discrepancia es la información.
- Trate la discrepancia como señal de efecto pequeño. Factor de Bayes bajo con valor p bajo quiere decir, casi siempre, que el efecto medido es pequeño en relación con lo que la hipótesis alternativa permitiría.
- Use el factor de Bayes para archivar hipótesis. Es la única de las tres reglas que autoriza a decir “esto no mueve la aguja, deje de intentarlo”.
- No convierta el factor de Bayes en una decisión por sí solo. La decisión de lanzar depende de costo, riesgo y valor, y la regla para eso es la pérdida esperada o un análisis de valor de la información.
- Dimensione el test antes. Un factor de Bayes calculado sobre un test subdimensionado es honesto e inútil al mismo tiempo: va a decir, correctamente, que los datos no sostienen nada.
- Si va a monitorear continuamente, fije la regla de parada antes. Es la condición del resultado, no un detalle.
Errores comunes
- Leer el factor de Bayes como probabilidad. Es un multiplicador de odds, no una probabilidad. Solo con odds a priori declaradas se vuelve probabilidad a posteriori.
- Elegir el prior después de ver los datos. Es la versión bayesiana de cambiar el nivel de significancia al final del test.
- Concluir que el valor p está mal. No está mal, responde otra pregunta. El error es interpretarlo como la probabilidad de que la hipótesis nula sea verdadera.
- Usar prior uniforme en tasa de conversión y no avisar. Uniforme entre 0 y 1 es un prior fortísimo, y a favor de la nula, en un contexto en el que nadie cree en una tasa de 60 por ciento.
- Creer que el factor de Bayes exime de dimensionar el test. No exime. Vea cuántos visitantes necesita un test A/B.
- Presentar un factor entre 0,3 y 3 como conclusión. Esa franja es, en cualquier escala de interpretación, el territorio del “los datos no decidieron”.
- Comparar factores de Bayes calculados con priors distintos. No están en la misma escala y la comparación no significa nada.
Hágalo automático con Donnu
El factor de Bayes necesita dos cosas que la mayoría de los paneles no guarda: los cuatro números crudos del test, sin redondeo, y el registro de qué prior estaba vigente cuando se planificó el análisis. Lo segundo es lo que separa un test bayesiano honesto de un resultado ajustado después.
Donnu guarda los contadores de exposición y conversión por brazo a nivel crudo y mantiene el historial de configuración del experimento, incluido lo que se decidió antes de que empezara el test. Eso deja el cálculo del factor de Bayes reproducible meses después, con el prior que valía en su momento y no con el que parece conveniente hoy.
Y vale la recomendación de alcance: el factor de Bayes es una regla de evidencia, no una regla de decisión. Para la decisión, la calculadora bayesiana entrega probabilidad de superar y pérdida esperada, que es lo que la mayor parte de los equipos realmente necesita mirar antes de lanzar.
Referencias
- Wagenmakers, E. J. A Practical Solution to the Pervasive Problems of p Values. Psychonomic Bulletin and Review, volumen 14, número 5, 2007, páginas 779 a 804. Fuente de la relación entre odds a priori, factor de Bayes y odds a posteriori; de la explicación de que promediar la verosimilitud sobre el prior incorpora automáticamente una penalización por complejidad del modelo, porque los valores poco plausibles a la luz de los datos reducen la probabilidad predictiva a priori; de la cita de Jeffreys, página 385 de la Theory of Probability de 1961, según la cual el uso del valor p implica rechazar una hipótesis que puede ser verdadera porque no predijo resultados observables que no ocurrieron; y del registro de que, para cualquier prior continuo y estrictamente positivo, la probabilidad a posteriori de la hipótesis nula converge a 1 a medida que crece la muestra con valor p constante, atribuido a Berger y Sellke y a Lindley. ejwagenmakers.com.
- Berger, J. O. Could Fisher, Jeffreys and Neyman Have Agreed on Testing? Statistical Science, volumen 18, número 1, 2003, páginas 1 a 32. Fuente del resultado de que, en una larga serie de tests en la que la mitad de las hipótesis nulas es verdadera a priori, entre los tests con valor p cerca de 0,05 al menos 22 por ciento y típicamente más de 50 por ciento de las nulas correspondientes serán verdaderas; y del segundo escenario, con cerca de 90 por ciento de nulas verdaderas a priori, en el que al menos 72 por ciento y típicamente más de 90 por ciento de las nulas serán verdaderas en la misma franja de valor p. www2.stat.duke.edu.
- Deng, A., Lu, J. y Chen, S. Continuous Monitoring of A/B Tests without Pain: Optional Stopping in Bayesian Testing. 2016. Fuente de la formulación de que las odds a posteriori son las odds a priori multiplicadas por el factor de Bayes, con el factor definido como la razón de verosimilitudes entre las dos hipótesis; de la prueba formal de la validez del test bayesiano bajo monitoreo continuo cuando se usan reglas de parada apropiadas, con la salvedad de que la propiedad no vale si el factor se calcula sobre un subconjunto seleccionado de los datos; y del registro de que la dificultad de elegir prior puede mitigarse aprendiendo el prior empíricamente a partir de tests A/B históricos. arxiv.org.
Lee también: Test A/B bayesiano · Pérdida esperada · Priors bayesianos · Región de equivalencia práctica · Problema del peeking · Calculadora bayesiana · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es el factor de Bayes en un test A/B?
- Es la razón entre la probabilidad de los datos observados bajo la hipótesis de que existe diferencia y la probabilidad de los mismos datos bajo la hipótesis de que no existe. Es el número por el que usted multiplica sus odds a priori para obtener las odds a posteriori. Un factor de 10 significa que los datos son diez veces más probables si hay diferencia; un factor de 0,1 significa lo contrario, y el valor p no tiene cómo expresar esa segunda situación.
- ¿Un valor p de 0,003 es siempre evidencia fuerte?
- No. En el ejemplo trabajado de esta guía, la lectura de 4.200 visitantes con 210 conversiones contra 4.200 con 273 devuelve un valor p de 0,003150 y un factor de Bayes de 0,9992 con prior uniforme, es decir, los datos son prácticamente igual de probables bajo las dos hipótesis. Berger registra que, en una larga serie de tests en la que la mitad de las hipótesis nulas es verdadera, entre los tests con valor p cerca de 0,05 al menos 22 por ciento y típicamente más de 50 por ciento de las nulas correspondientes serán verdaderas.
- ¿Qué es la paradoja de Lindley?
- Es el hecho de que, manteniendo fijo el valor p, el factor de Bayes se mueve EN CONTRA de la hipótesis de que existe efecto a medida que la muestra crece. En los cinco casos calculados en esta guía, todos con valor p cerca de 0,05, el factor de Bayes cae de 0,1849 con 1.000 por brazo a 0,0075 con 500.000 por brazo. O sea, la misma significancia se vuelve evidencia 5 veces en contra de la hipótesis en un test pequeño y 133 veces en contra en un test enorme.
- ¿El factor de Bayes puede decir que NO existe efecto?
- Sí, y es su diferencia práctica más útil. Un valor p alto solo significa ausencia de evidencia contra la hipótesis nula. En un empate exacto de 200.000 por brazo con la misma tasa, el factor de Bayes calculado aquí es 0,0017, es decir, los datos son 579 veces más probables bajo la hipótesis de que no hay diferencia. El valor p en esa misma lectura es 1,0000 y no distingue este caso de un test con 200 visitantes.
- ¿El prior cambia mucho el resultado?
- Lo cambia, y ese es el costo honesto del método. Con la misma lectura de 20.000 por brazo, 1.000 contra 1.080 conversiones, el factor de Bayes va de 0,0282 con prior uniforme a 1,3559 con un prior Beta de media 5 por ciento y fuerte concentración, atravesando el valor 1. El prior tiene que declararse antes de mirar los datos, exactamente como el nivel de significancia en un test clásico.
- ¿Puedo mirar el factor de Bayes todos los días sin penalización?
- Con una regla de parada apropiada, sí. Deng, Lu y Chen prueban formalmente la validez del test bayesiano bajo monitoreo continuo cuando las reglas de parada son apropiadas, y señalan las malas prácticas en las que la regla no es apropiada. Eso es distinto del test clásico, en el que espiar sin corrección infla el error tipo I.