Estadística

Región de Equivalencia Práctica (ROPE) en Test A/B

La región de equivalencia práctica (ROPE) es la regla bayesiana para declarar que un lift es demasiado pequeño para importar, aunque sea real.

Ilustración abstracta en verde oscuro y turquesa de una recta numérica con una banda de equivalencia sombreada centrada en cero, que representa la región de equivalencia práctica

La región de equivalencia práctica (ROPE) es una regla de decisión bayesiana, propuesta por el psicólogo John Kruschke, que declara un resultado “prácticamente equivalente” a ningún efecto siempre que todo su intervalo creíble caiga dentro de una banda de valores demasiado pequeños como para importar, en vez de preguntar solo si ese intervalo excluye el cero. Responde una pregunta que una comprobación de significancia simple no puede: no “es probable que esta sea una diferencia real”, sino “esta diferencia es lo bastante grande como para justificar actuar sobre ella.” Esta guía explica qué es un ROPE, cómo definir su ancho para un test A/B, y recorre un ejemplo numérico completo, calculado con el propio motor bayesiano de este blog, de un resultado que es estadísticamente real y al mismo tiempo prácticamente inútil.

Esta pieza es la tercera pata de un pequeño clúster sobre cómo leer un test A/B bayesiano con honestidad. Nuestra guía completa de test A/B bayesiano cubre la mecánica de priors y posteriores; nuestra guía de intervalo de credibilidad vs intervalo de confianza cubre qué significa realmente ese intervalo; nuestra guía de pérdida esperada convierte la posterior en un solo número de riesgo. El ROPE se ubica junto a las tres: toma el mismo intervalo creíble y hace una pregunta más que ninguna de las otras hace por su cuenta, si todo el rango plausible está lo bastante cerca de cero como para ignorarlo.

La pregunta que una comprobación de significancia simple no puede responder

Todo método para leer un test A/B, frecuentista o bayesiano, está construido para responder alguna versión de “esta diferencia es real, o podría ser ruido.” Un valor p por debajo de 0.05 la responde. Un intervalo creíble del 95% que excluye el cero la responde. Un P(B le gana a A) alto la responde. Las tres son, en el fondo, una comprobación de dirección: es probable que el efecto sea positivo, es probable que sea negativo, o podría plausiblemente ser cero.

Ninguna de ellas, por sí sola, responde una segunda pregunta completamente distinta: qué tan grande es el efecto, y si ese tamaño vale algo. Un cambio de un visitante en un millón puede ser “real” en el sentido de la dirección y al mismo tiempo invisible en todo lo que le importa a un negocio. Esta es exactamente la brecha que la industria empezó a llamar significancia práctica versus significancia estadística, y VWO lleva la distinción a la propia elección del objetivo del test: su documentación de estimación de duración de campaña describe un modo “Improvement”, en el que se prueba una mejora estricta en la métrica principal, y un modo “Improvement or Equivalence”, en el que se prueba que una variación no es peor que la línea base, con el ROPE funcionando como el rango de diferencias tratadas como básicamente iguales.

Kruschke planteó el mismo punto formalmente en un paper de 2018 para Advances in Methods and Practices in Psychological Science, argumentando que la estimación bayesiana debería dejar de preguntar si un parámetro es exactamente igual a un valor nulo y pasar a preguntar si el parámetro cae dentro de una banda de valores que son, para fines prácticos, equivalentes al nulo. La motivación detrás de ese cambio está documentada en el paquete bayestestR, que implementa el método: en un parámetro continuo, la probabilidad de cualquier valor puntual exacto es cero, así que probar el punto nulo en sí nunca fue la pregunta útil.

Cómo funciona la regla de decisión del ROPE

Un ROPE es simplemente un intervalo que eliges de antemano, normalmente centrado en cero (o en “sin lift”), con el tamaño del margen que a tu negocio realmente no le importa. La regla de decisión de Kruschke y Liddell compara entonces esa banda contra el intervalo de mayor densidad posterior (HDI, highest density interval), el intervalo más corto que contiene una determinada masa creíble, típicamente el 95%:

Para las posteriores aproximadamente simétricas que aparecen en la mayoría de las comparaciones de tasa de conversión de un test A/B, el HDI y el intervalo creíble de colas iguales que reporta la calculadora de este blog quedan lo bastante cerca entre sí como para que, en la práctica, la misma regla aplique a cualquiera de los dos.

Tres intervalos creíbles leídos contra una región de equivalencia prácticaUn ROPE de menos uno por ciento a más uno por ciento de lift relativo está sombreado alrededor de cero. El Test 1 tiene un intervalo creíble de aproximadamente 0.11 a 0.89 por ciento, entero dentro del ROPE, así que se declara prácticamente equivalente. El Test 2 tiene un intervalo creíble de aproximadamente 0.5 a 1.8 por ciento, cruzando el límite del ROPE en 1 por ciento, así que queda indeciso. El Test 3 tiene un intervalo creíble de aproximadamente 3 a 5 por ciento, entero fuera del ROPE, así que se declara un efecto real.0% (sin efecto)-2%-1%0%1%2%3%4%5%ROPETest 1: 0.11% a 0.89%prácticamente equivalenteTest 2: 0.5% a 1.8%indecisoTest 3: 3% a 5%, efecto real
Los tres veredictos posibles bajo la regla de decisión del ROPE (Kruschke y Liddell, 2018): entero dentro de la banda, se declara equivalente; entero fuera, se declara real; a caballo del borde, hay que seguir recolectando datos.

Cómo elegir el ancho del ROPE para un test A/B

El punto de partida genérico del propio Kruschke, pensado para efectos estandarizados en muchos campos de investigación, es de aproximadamente más o menos 0.1 desviaciones estándar, un valor que él vincula al umbral convencional de Cohen para un tamaño de efecto “despreciable”, con un más o menos 0.18 más amplio sugerido para razones de log-odds en modelos de tipo logístico, según la documentación del paquete bayestestR de R que implementa su método. Ese valor por defecto nunca se pensó con tests A/B de tasa de conversión en mente, y no se traduce directamente a una escala de “lift porcentual.”

La industria del test A/B convergió en cambio en una convención más directa: definir el ROPE como una banda de lift relativo. La propia documentación de VWO afirma llanamente que la plataforma usa “un valor de ROPE conservador de más o menos uno por ciento como un buen punto de partida por defecto,” y muestra un ejemplo resuelto: con una tasa base del 40%, una decisión de negocio de que cualquier valor entre 38% y 42% es “lo mismo que la base” se traduce en un ROPE de más o menos 5% relativo. El número no está fijo; es un insumo de negocio genuino, igual que elegir un efecto mínimo detectable antes de calcular un tamaño de muestra.

Algunos anclajes prácticos para definir ese número en tus propios tests:

Situación Un ROPE de partida razonable (lift relativo) Por qué
Página de checkout o de precios de alto tráfico, crítica para el ingreso Aproximadamente más o menos 1% El valor por defecto que la propia VWO documenta; lo bastante pequeño como para que una “victoria” por debajo de él no mueva el ingreso de forma significativa
Cambio costoso de implementar (nuevo flujo de backend, rediseño) Más amplio, aproximadamente más o menos 2 a 3% El costo de ingeniería solo se paga por sí mismo por encima de una victoria mínima mayor
Ajuste de UI barato y reversible (copy, color, espaciado) Más estrecho, aproximadamente más o menos 0.5% Poco costo de lanzar, así que una mejora genuina más pequeña todavía vale la pena tomarla
Efecto estandarizado genérico fuera del contexto de test A/B Aproximadamente más o menos 0.1 desviaciones estándar El valor por defecto del propio Kruschke, vinculado a la convención de efecto despreciable de Cohen, no calibrado a porcentajes de lift

El hilo común: un ROPE debería reflejar el lift más pequeño que realmente cambiaría lo que tu equipo hace a continuación. Si un lift relativo de más 0.3% no justificaría lanzar el cambio, pertenece dentro del ROPE, sin importar lo que el intervalo creíble diga sobre el cero.

Un ejemplo resuelto: real, y aun así no vale la pena lanzarlo

Aquí hay un caso construido con el propio motor Beta-Binomial de este blog (el mismo detrás de la calculadora de abajo), donde una comprobación ingenua de “excluye el cero” y una comprobación de ROPE no coinciden.

Imagina una página de checkout en un minorista de tráfico muy alto, corriendo un test lo bastante largo, y a suficientes visitantes, como para recolectar 2.000.000 de visitantes por variante. El Control A convierte exactamente al 20.00% (400.000 conversiones). La Variación B convierte al 20.10% (402.000 conversiones), un lift relativo del 0.50%.

Alimentar esos dos brazos a una posterior Beta(1,1) (un prior uniforme, el mismo que usa la calculadora de este blog) da una tasa de conversión posterior media de aproximadamente 20.00% para A y 20.10% para B, con una desviación estándar posterior para cada brazo de aproximadamente 0.028 puntos porcentuales, lo bastante ajustada como para que, a dos millones de visitantes por brazo, el prior ya prácticamente no tenga influencia. Combinar la varianza posterior de los dos brazos da un error estándar para la diferencia de aproximadamente 0.040 puntos porcentuales. Eso es lo bastante pequeño, en relación con la brecha de 0.10 puntos porcentuales entre las dos tasas, como para que el intervalo creíble del 95% sobre el lift mismo (usando la aproximación normal estándar a la diferencia de dos posteriores Beta, precisa aquí porque ambas posteriores tienen cientos de miles de pseudo-observaciones detrás) resulte en aproximadamente 0.11% a 0.89% de lift relativo. Excluye el cero por un margen cómodo, correspondiente a aproximadamente una probabilidad posterior del 99.4% de que B efectivamente le gana a A.

Ingresa esos mismos números en la calculadora, 2.000.000 de visitantes y 400.000 conversiones para A, 2.000.000 de visitantes y 402.000 conversiones para B, y puedes verlo en vivo:

Calculadora bayesiana de test A/B
A (control)
B (variación)
-probabilidad de que B le gane a A
Tasa de A (posterior)-
Tasa de B (posterior)-
Probabilidad de que A gane-
Riesgo al elegir B (pérdida esperada)-
Mejora relativa (medias)-

Modelo Beta-Binomial con prior uniforme Beta(1,1) e intervalo de credibilidad del 95%. Cálculo determinístico, recalcula en vivo.

Deberías ver algo cercano a una probabilidad del 99% de que B le gana a A, un lift relativo cercano al 0.5%, y una pérdida esperada al elegir B que se redondea a esencialmente cero, todo consistente con los números de arriba. Una regla ingenua que solo comprueba “el intervalo excluye el cero, y P(B le gana a A) es alto” declararía esto una victoria obvia y confiable, para lanzar de inmediato.

Ahora aplica un ROPE de más o menos 1%, el mismo valor por defecto conservador que documenta VWO. Todo el intervalo creíble, aproximadamente 0.11% a 0.89%, queda dentro de esa banda. Cada valor plausible para el lift real, desde el extremo bajo hasta el extremo alto de lo que soportan los datos, es un cambio que nadie notaría en el negocio. El veredicto honesto no es “lánzalo”, es “esto probablemente es real, y es demasiado pequeño como para actuar sobre él.” Esa es una decisión diferente de la que alcanzó la regla ingenua, a partir exactamente de los mismos datos.

Los mismos datos, dos veredictos diferentesPartiendo del mismo intervalo creíble posterior de aproximadamente 0.11 a 0.89 por ciento de lift relativo, la regla ingenua solo pregunta si el intervalo excluye el cero, responde que sí, y declara a B un ganador que vale la pena lanzar. La regla del ROPE pregunta si el intervalo cae entero dentro de una banda de equivalencia de más o menos uno por ciento, también responde que sí, y declara el resultado prácticamente equivalente, es decir, que no vale la pena lanzarlo solo con esta evidencia.IC posterior0.11% a 0.89% de lift¿Excluye el cero?Veredicto ingenuo: lanzar Btrata el 0.5% como una victoria realIC posterior0.11% a 0.89% de lift¿Dentro del ROPE 1%?Veredicto ROPE: prácticamente equivalenteno vale la pena lanzarlo solo con esto
Misma posterior, dos reglas. La comprobación ingenua de exclusión de cero y la comprobación del ROPE pueden apuntar en direcciones opuestas una vez que la muestra es lo bastante grande como para resolver un efecto genuinamente diminuto.

Esto no es una rareza de un escenario inventado. Es la consecuencia mecánica de correr un test con tráfico suficiente para resolver un efecto mucho más pequeño de lo que a nadie realmente le importa, algo que sucede sobre todo a la escala de minoristas y plataformas muy grandes, exactamente el público para el que VWO escribe su documentación de ROPE. Los sitios más pequeños rara vez alcanzarán un tamaño de muestra donde aparezca esta brecha; cuando sí obtienen un lift relativo “significativo” del 0.5%, normalmente es porque el intervalo todavía es lo bastante ancho como para que el extremo superior prometa algo real, no porque todo el rango esté atrapado tan cerca de cero.

Dónde encaja el ROPE junto a la pérdida esperada y el intervalo creíble

Las tres ideas de este clúster no compiten entre sí, leen la misma posterior con propósitos diferentes:

Herramienta Pregunta que responde Forma de la salida
Intervalo creíble Qué rango de lift real es plausible, dados los datos Un rango, con una probabilidad declarada de contener la verdad
Pérdida esperada Si lanzo la variante equivocada, cuánto costaría eso en promedio Un solo número, en la métrica que importa
ROPE (este artículo) El rango plausible es lo bastante pequeño como para tratarlo como ningún efecto Un veredicto categórico: real, equivalente, o indeciso

Un equipo que solo comprueba P(B le gana a A) puede quedar engañado por un resultado de muestra grande y efecto pequeño exactamente como el de arriba. Un equipo que también comprueba la pérdida esperada obtiene un número de riesgo genuino, pero incluso una pérdida esperada cercana a cero no dice, por sí sola, si el lado ganador de la apuesta valía el costo de lanzamiento en primer lugar. Agregar un ROPE encima de ambos cierra esa brecha: es la única de las tres herramientas construida específicamente para decir “sí, esto probablemente es real, y no, todavía no importa.”

Automatiza esto en Donnu

La parte más difícil de un resultado bayesiano no es calcular la posterior, es decidir, con claridad, cuándo una lectura de “sí, probablemente es una victoria” es en realidad demasiado pequeña como para molestarse en lanzarla. El reporte bayesiano de Donnu ya muestra lado a lado la probabilidad de que una variante gane y la pérdida esperada de elegirla, los mismos dos números de los que partió este artículo, así que nunca te quedas adivinando a partir de un P(B le gana a A) desnudo sin noción del tamaño real del efecto.

Empieza una prueba gratis de 14 días y lee el resultado de tu próximo test con la dirección y el tamaño del efecto a la vista, ambos. Para la mecánica completa detrás de estas posteriores, mira nuestra guía completa de test A/B bayesiano, para lo que el intervalo mismo puede realmente significar, mira intervalo de credibilidad vs intervalo de confianza, y para convertir la misma posterior en un solo número de riesgo, mira pérdida esperada en test A/B bayesiano.

¿Prefieres leer en inglés? Leer en inglés.

Referencias

Preguntas frecuentes

¿Qué es la región de equivalencia práctica (ROPE) en estadística bayesiana?
El ROPE es un rango de valores del parámetro, definido antes de mirar los datos, que se ha decidido que están lo bastante cerca del valor nulo (normalmente cero, o sin lift) como para tratarse como prácticamente iguales para la decisión en cuestión. Propuesto por John Kruschke, convierte la pregunta "el efecto es exactamente cero" en la más honesta "el efecto es lo bastante pequeño como para no importar", comparando esa banda contra el intervalo creíble de tu posterior.
¿En qué se diferencia el ROPE de simplemente comprobar si un intervalo creíble excluye el cero?
Excluir el cero solo te dice que la dirección del efecto probablemente es real, no dice nada sobre su tamaño. Un test con millones de visitantes puede producir un intervalo creíble que excluye el cero por un margen amplio y aun así quedar entero dentro de una banda de más o menos uno por ciento que nadie llevaría a producción. El ROPE agrega la pregunta del tamaño encima de la pregunta de la dirección, y las dos pueden no coincidir.
¿Qué ancho de ROPE debería usar para un test A/B?
No hay un número universal, es una decisión de negocio tomada antes de empezar el test. VWO documenta un valor por defecto de más o menos uno por ciento de lift relativo como, en sus propias palabras, "un valor de ROPE conservador... un buen punto de partida por defecto", mientras que el valor genérico de Kruschke para un efecto estandarizado es de aproximadamente más o menos 0.1 desviaciones estándar. El ancho correcto es cualquier margen lo bastante pequeño como para que implementar el cambio no valga el costo de ingeniería.
¿Puede un resultado ser estadísticamente significativo y aun así caer dentro del ROPE?
Sí, y este es precisamente el caso que el ROPE existe para detectar. Una muestra muy grande puede hacer que un lift diminuto, prácticamente irrelevante, sea estadísticamente distinguible de cero. El intervalo creíble excluye el cero (así que una comprobación ingenua de "es significativo" diría que sí), pero el intervalo entero queda dentro de la banda de equivalencia (así que la comprobación del ROPE dice que el efecto es despreciable). Significancia y tamaño son dos preguntas distintas.
¿Cómo se relaciona el ROPE con la pérdida esperada y el intervalo creíble ya cubiertos en este blog?
Los tres leen la misma distribución posterior pero responden preguntas diferentes. El intervalo creíble establece un rango plausible para el lift real. La pérdida esperada convierte ese rango en un solo número, el costo promedio de equivocarse si igual lo llevas a producción. El ROPE compara todo el rango contra una banda de equivalencia definida por el negocio y devuelve un veredicto categórico: efecto real, prácticamente equivalente, o indeciso. Leídos juntos, cubren dirección, costo y materialidad.