Estadística

Métricas de Guardrail: los frenos contra un empeoramiento

Qué son las métricas de guardrail, cómo definir el umbral de empeoramiento antes del test y por qué un guardrail sin significancia no está liberado.

Ilustración de una pasarela estrecha con barandillas altas a ambos lados y una luminaria en el poste del extremo, en tonos de verde profundo

Las métricas de guardrail son las medidas que un cambio no puede empeorar, incluso cuando la métrica que el test fue hecho para mover sube. Existen porque una métrica primaria ganadora no es lo mismo que un lanzamiento seguro, y la forma más común de equivocarse en esto es leer un guardrail sin significancia como un guardrail liberado. Esta guía cubre qué es un guardrail y cómo difiere de una métrica secundaria, cómo definir el umbral que le da dientes, la aritmética de poder que desarma a la mayoría de los guardrails en silencio, y un conjunto inicial para ecommerce y SaaS. Forma parte de nuestra guía completa de test A/B y conversa directamente con la aritmética de diseño de cuántos visitantes necesita un test A/B.

Qué es una métrica de guardrail, y qué no

Dmitriev y colegas, escribiendo sobre interpretación de métricas en Microsoft en 2017, definen las métricas de guardrail como medidas que no indican claramente el éxito de la funcionalidad probada, pero que el equipo no quiere perjudicar de forma significativa a la hora de decidir lanzar. El tiempo de carga en un sitio como Bing o MSN es su ejemplo canónico: nadie lanza una funcionalidad para hacer la página más lenta, y aun así casi toda funcionalidad añadida a una página aumenta un poco el tiempo de carga. Los empeoramientos pequeños son esperables. Los grandes, no.

Esa definición traza una línea que muchos registros de experimento difuminan. Vale la pena separar cuatro papeles, porque cada uno se lee de una forma distinta.

Los cuatro papeles que una métrica puede tener en un experimentoLas métricas de calidad de datos deciden si el experimento es legible. La métrica primaria decide si el cambio es bueno. Las métricas de guardrail deciden si el cambio es seguro y pueden vetar un lanzamiento. Las métricas de diagnóstico explican por qué se movió la primaria y nunca deciden nada solas.Un experimento, cuatro tipos de métrica, cuatro preguntas diferentesCalidad de datosreparto, pérdida de log,tráfico de robots¿se puede leer?Métrica primariala única declaradaantes de lanzar¿es buena?Guardrailslatencia, reembolso,soporte, churn¿es segura?Diagnósticoembudo paso a paso,clic por elemento¿por qué se movió?falló: se descarta el testganó: candidata a lanzarse pasó: poder de vetono decide solaSolo dos de las cuatro pueden frenar un lanzamiento, y solo una de esas dos frena un lanzamiento que la métrica primaria ganó.Una métrica que gana poder de veto después de que llegan los números no es un guardrail, es una negociación.
Los papeles se deciden antes de lanzar el test. Escribirlo es lo que impide que un test perdedor sea rescatado por un diagnóstico ascendido, y que un test dañino pase por encima de un guardrail degradado.

La distinción que más pesa en la práctica es guardrail contra métrica secundaria. Una métrica secundaria se lee por dirección y explicación. Un guardrail lleva veto: puede frenar un lanzamiento que la métrica primaria ganó. Como eso es poder de verdad, hay que asignarlo antes. Una métrica ascendida a guardrail después de los resultados se está usando para justificar una decisión ya tomada, y una degradada después de los resultados es todavía peor.

Deng y Shi, describiendo el desarrollo de métricas en Bing en 2016, añaden un segundo papel del guardrail que vale la pena conocer: los guardrails también sustituyen a la métrica objetivo cuando ella no aplica. Su ejemplo es una organización de búsqueda cuya métrica objetivo cuenta clics con tiempo largo de permanencia, lo que no tiene ningún sentido para el equipo que construye respuestas instantáneas, cuyo trabajo entero es satisfacer al usuario sin clic. Ese equipo necesita guardrails que capturen la experiencia que la métrica objetivo compartida no ve.

El umbral, no el valor p, es lo que le da dientes al guardrail

Aquí está el error que más caro cuesta, y se esconde dentro de una frase que suena responsable: “los guardrails salieron no significativos, así que lanzamos.”

El test se dimensiona para la métrica primaria. Los guardrails suelen ser eventos más raros, con base mucho más baja, y el tamaño de muestra escala con aproximadamente uno sobre el cuadrado del efecto que quieres ver, así que una base más baja compra mucha menos resolución con el mismo número de visitantes. Toma un test de checkout dimensionado para detectar 10% relativo en una tasa de compra del 4,0%: eso pide 39.475 visitantes por variación, 78.950 en total, cerca de 14 días a 40.000 visitantes elegibles por semana. En esa muestra exacta, esto es lo que cada métrica del panel logra resolver de hecho.

Métrica Base Menor efecto relativo detectable con 39.475 por variación En puntos porcentuales
Añadió al carrito 22,0% cerca de 3,8% 0,83 pp
Inició el checkout 9,0% cerca de 6,4% 0,58 pp
Compra (la métrica primaria) 4,0% 10,0% 0,40 pp
Tasa de reembolso 1,2% cerca de 18,9% 0,23 pp
Contacto con soporte 0,8% cerca de 23,5% 0,19 pp
Baja de la lista de email 0,3% cerca de 39,8% 0,12 pp

Lee las tres últimas filas despacio. En un test perfectamente bien dimensionado para lo que se propone, una tasa de reembolso que vuelve “no significativa” es compatible con cualquier cosa entre una mejora real y un empeoramiento del 19%, y una baja de lista que vuelve callada es compatible con un empeoramiento del 40%. Nada fue liberado. La pregunta nunca se hizo con datos suficientes para tener respuesta.

Dmitriev y colegas documentan exactamente esto en MSN.com. El total de páginas vistas por usuario subió 0,5% en un experimento, con un valor p sin significancia. Para un negocio de ese tamaño, 0,5% en páginas vistas es un impacto comercialmente relevante. El intervalo de confianza terminó quedando en torno a más o menos 5%, y el diseño solo lograba detectar cambios del 7,8% o mayores con 80% de poder. Su conclusión es la frase que merece quedar colgada encima del panel: no podemos asumir que no impactamos la métrica sin poder estadístico.

Pon tus propias bases y mira lo que resuelve tu tráfico:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La corrección no es estadística, es de proceso. Declara un umbral para cada guardrail antes de lanzar el test y después compara el límite superior del intervalo de confianza con ese umbral, en vez de comparar el valor p con 0,05.

Leyendo un guardrail contra el umbral en vez de contra el valor pCuatro intervalos de confianza comparados con un umbral de empeoramiento declarado. Un intervalo enteramente por debajo del umbral libera el guardrail. Un intervalo que cruza el umbral deja la pregunta sin respuesta incluso con valor p por encima de 0,05. Un intervalo enteramente por encima del umbral es un desbordamiento. Un intervalo muy ancho significa que el guardrail nunca fue medido con precisión útil.La misma historia de valor p, cuatro decisiones diferentessin cambioumbral declaradoliberadoAsin respuestaBdesbordamientoCDnunca fue medidoB y D reportan valor p por encima de 0,05. Solo A merece la palabra “liberado”, y solo C es una alarma de verdad.El empeoramiento crece hacia la derecha. El umbral es un número de negocio, escrito antes de que el test empiece.
Cuatro guardrails, un panel, una columna de valor p. La columna que separa a los cuatro es el intervalo de confianza, y por eso el intervalo pertenece al lado de todo guardrail en el registro del experimento.

Ejemplo trabajado: la primaria gana y el guardrail no dice nada

Un rediseño de checkout corre en la muestra de arriba: 39.475 visitantes por variación, base de compra 4,0%, base de reembolso 1,2%. El umbral declarado antes de lanzar es que los reembolsos no pueden subir más del 10% relativo, lo que en esa base da más 0,12 puntos porcentuales. Corre los números tú mismo:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

La métrica primaria. El control termina con 1.579 compras en 39.475 visitantes (4,000%), y la variación con 1.745 (4,421%). Eso da z = 2,94, valor p = 0,0033, mejora relativa de +10,5%, intervalo de confianza de la diferencia de +0,14 a +0,70 puntos porcentuales. Victoria limpia, exactamente del tamaño que el test fue diseñado para encontrar.

El guardrail. Los reembolsos terminan en 474 en el control (1,201%) y 512 en la variación (1,297%). Es un movimiento de +8,0% relativo en la dirección equivocada, con z = 1,22 y valor p de 0,2233. La lectura ingenua es que el guardrail está limpio.

No lo está. El intervalo de confianza de esa diferencia va de -0,059 a +0,251 puntos porcentuales, y el límite superior de +0,251 pp equivale a +20,9% relativo en una base del 1,2%. El umbral declarado era +0,12 pp. El intervalo es casi el doble del número que el negocio dijo tolerar, así que este test simplemente no logra decir si el rediseño quedó dentro del límite. Para liberar de verdad un empeoramiento del 10% relativo, la tasa de reembolso necesitaría cerca de 135.624 visitantes por variación, unos 48 días de tráfico en vez de 14.

Para contrastar, así es como se ve de verdad una alarma de guardrail en la misma muestra: reembolsos de 474 contra 592 dan +24,9% relativo, z = 3,64, valor p = 0,00027, intervalo de +0,138 a +0,460 puntos porcentuales. Enteramente por encima del umbral, y ninguna lectura de ese resultado se lanza sin conversación.

El registro honesto del primer caso tiene tres líneas: la primaria subió 10,5% con significancia; la tasa de reembolso subió 8,0% en la dirección, intervalo de -0,06 a +0,25 pp contra un umbral de +0,12 pp, no liberada en esta muestra; la acción recomendada es lanzar con reembolso monitoreado en despliegue progresivo durante cuatro semanas. Esa es una decisión diferente de “guardrails limpios, lanzando”, y es la decisión que el dato sostiene.

Cuántos guardrails, y la aritmética de la falsa alarma

Un guardrail es barato de añadir y caro de ignorar, y así es como los equipos acaban con una lista de quince y el hábito de espantarlos todos. La aritmética no perdona: cada guardrail independiente leído a un umbral del 5% añade su propia probabilidad de alarmar por suerte.

Guardrails monitoreados Probabilidad de que al menos uno alarme solo por azar
1 5,0%
2 9,8%
3 14,3%
4 18,5%
5 22,6%
6 26,5%
8 33,7%
10 40,1%

Con diez guardrails, dos de cada cinco tests muestran una celda roja que no significa nada. El equipo aprende, correctamente, que una celda roja suele ser ruido, y entonces pierde la que no lo era. De tres a seis guardrails fijos, cada uno con umbral escrito, le gana a quince seguidos por encima. Añade un guardrail específico del test solo cuando el cambio amenace algo que el conjunto fijo no cubre, y trata un desbordamiento como disparador de una ronda de confirmación, no como veredicto, la misma disciplina que vale para una victoria al límite en la métrica primaria. Los métodos de corrección para decidir sobre varias métricas al mismo tiempo están en test A/B/n con varias variantes.

Un conjunto inicial para ecommerce y SaaS

Un guardrail es específico del negocio, pero las categorías se repiten. El conjunto de abajo es un punto de partida, no un estándar, y la columna del umbral es la parte que tu equipo necesita rellenar con números reales.

Categoría Guardrail de ecommerce Guardrail de SaaS Por qué gana poder de veto
Velocidad Tiempo de carga en el percentil 75 Tiempo hasta que la pantalla principal es usable El experimento de lentitud de Bing en 2013 encontró que cada 100 milisegundos de mejora valían cerca de 0,6% de ingresos
Arrepentimiento Tasa de reembolso y devolución Cancelación en los primeros 30 días Una victoria de conversión pagada por compradores que no querían el producto no es una victoria
Costo de la fricción Contactos de soporte por 1.000 pedidos Tickets por 100 cuentas nuevas Transfiere costo del embudo a un equipo que no aparece en el resultado del test
Alcance futuro Baja de la lista de email Desactivación de notificaciones Gasta un activo duradero para comprar una conversión de una vez
Calidad de la victoria Ticket promedio Mix de planes, porción que cae en el plan de entrada Detecta una ganancia construida enteramente sobre descuento o degradación
Confiabilidad Tasa de error en el checkout Sesiones sin crash El modo de falla que nunca aparece en una tasa de conversión

Dos notas sobre esa tabla. Primero, la fila de velocidad no es un guardrail simbólico. El relato de 2013 sobre experimentación en Bing describe un experimento deliberado de lentitud, 10% de los usuarios con 100 milisegundos de más y otro 10% con 250 milisegundos de más, durante dos semanas, y reporta que cada 100 milisegundos de mejora valían cerca de 0,6% en ingresos. Ese resultado es específico de Bing en aquel momento y no debe trasplantarse como número, pero establece que la latencia es una variable comercial de verdad, no una cuestión de higiene.

Segundo, el mismo artículo trae una advertencia que pertenece a este texto. Los autores citan una afirmación publicada por otra empresa de que un retraso de 200 milisegundos no importó, y argumentan que la explicación más probable es que el experimento no tenía poder estadístico para detectar la diferencia, y no que la diferencia no existiera. Eso es la falla del guardrail sin poder apareciendo en público, en un post muy leído, de un equipo competente. No es un error exótico.

La decisión de lanzar cuando los guardrails se leen correctamenteDespués de que la calidad de datos pasa y la métrica primaria gana, cada intervalo de guardrail se compara con el umbral declarado. Un intervalo enteramente dentro del umbral se lanza. Un intervalo que cruza el umbral se registra como no medido y se lanza con monitoreo en despliegue progresivo. Un intervalo enteramente más allá del umbral exige un trade-off escrito de quien es dueño de la métrica.Qué pasa después de que la métrica primaria ganadatos íntegrosreparto, log, robotsla primaria ganadeclarada, solo unapara cada guardrail:intervalo contra umbralintervalo dentro del umbralliberado de verdadse lanzaintervalo cruza el umbralse registra como no medidose lanza con monitoreointervalo más allá del umbraldesbordamiento, decide el dueñotrade-off escritoLa caja del medio es la que la mayoría de los paneles no tiene. Sin ella, todo guardrail no medido se archiva en silencio como liberado.Fíjate en que ninguna caja dice “ignora callado”: un desbordamiento todavía puede lanzarse, pero solo con un nombre en la decisión.
Tres salidas, no dos. La columna del medio es donde de hecho vive el riesgo, y es la columna que desaparece cuando un guardrail se lee como valor p.

Errores comunes con guardrails

Error Qué produce
Leer un guardrail sin significancia como liberado Empeoramientos reales se lanzan, y el programa no distingue lanzamiento seguro de lanzamiento no examinado
Elegir los guardrails después de ver los resultados La lista se convierte en lo que sostiene la decisión ya tomada
Ningún umbral escrito Toda conversación sobre guardrails recomienza de cero y termina donde la persona más insistente quiera
Quince guardrails en el panel Cerca de dos de cada cinco tests muestran una celda roja por azar, y el equipo aprende a ignorar el rojo
Tratar cualquier desbordamiento como bloqueo automático Los guardrails se van quitando en silencio en vez de discutirse, porque un empeoramiento pequeño es normal
Ningún dueño por guardrail Un desbordamiento se convierte en una reunión sin decisión y el lanzamiento ocurre por inercia
Guardrail solo dentro del test, nunca después Los daños raros y lentos, churn y reembolso sobre todo, son exactamente los que un test de dos semanas no ve

Si el problema recurrente es que tus guardrails nunca tienen poder para decir nada, las respuestas estructurales son la reducción de varianza, cubierta en nuestra guía de CUPED, o aceptar el guardrail como monitoreo posterior al lanzamiento en despliegue progresivo en vez de fingir que el experimento respondió.

Hazlo automático en Donnu

Un guardrail solo funciona si el umbral existe antes de que el test empiece y si su intervalo está visible al lado del veredicto, no enterrado a dos clics. Donnu A/B mantiene los guardrails declarados y sus umbrales atados al experimento, reporta el intervalo de confianza al lado de cada guardrail en vez de un sello solitario de significancia, y marca el guardrail como no medido cuando la muestra no resuelve el umbral declarado, en vez de mostrar un tilde verde tranquilizador. Cuando un cambio gana la métrica primaria y deja un guardrail sin respuesta, eso aparece como la pregunta abierta que es.

Empieza una prueba gratis de 14 días y define los umbrales de tus guardrails antes del próximo lanzamiento.

Referencias

Lee también: Significancia estadística en test A/B · SRM: reparto desigual de tráfico · Errores comunes en tests A/B · El problema del peeking · Calculadora de poder estadístico gratis · Leia em português · Read in English

Preguntas frecuentes

¿Qué son las métricas de guardrail en un test A/B?
Las métricas de guardrail son medidas que el cambio no puede empeorar, aunque mejorarlas no sea el objetivo del test. Dmitriev y colegas (KDD 2017) las definen como métricas que no indican claramente el éxito de la funcionalidad probada, pero que el equipo no quiere perjudicar de forma significativa a la hora de decidir lanzar. El tiempo de carga de la página es el ejemplo canónico: nadie lanza una funcionalidad para hacer la página más rápida, pero una funcionalidad que deje la página mucho más lenta no debería lanzarse. La métrica primaria decide si el cambio es bueno; los guardrails deciden si es seguro.
¿Un guardrail con valor p por encima de 0,05 está liberado?
No, y esa es la lectura más cara de todo el tema. Un test dimensionado para una métrica primaria del 4% recoge muestra suficiente para resolver un empeoramiento relativo del 10% ahí, pero una tasa de reembolso con base del 1,2% solo resuelve cerca del 19% relativo con esa misma muestra. Un guardrail sin significancia en ese test es compatible con cualquier cosa entre una mejora real y un empeoramiento del 19%. Dmitriev y colegas (KDD 2017) documentan exactamente ese caso en MSN.com, donde una métrica se movió 0,5% sin significancia mientras el diseño solo lograba detectar 7,8% o más. Lee el intervalo de confianza, no el veredicto.
¿Cómo definir el umbral de un guardrail?
Nombra el mayor empeoramiento que el negocio aceptaría a cambio de la ganancia que el test persigue, escríbelo antes de lanzar el test y después compara el límite superior del intervalo de confianza con ese número, en vez de comparar el valor p con 0,05. Si el límite superior del intervalo queda por debajo del umbral, el guardrail está de hecho liberado en esa muestra. Si queda por encima, el test simplemente no respondió a la pregunta, independientemente del valor p. Definir el umbral después de ver los datos convierte al guardrail en una formalidad.
¿Cuántos guardrails debe tener un test?
Los suficientemente pocos para que cada uno se tome en serio, lo que en la práctica significa de tres a seis para la mayoría de los equipos. Un guardrail multiplica las falsas alarmas: con un umbral del 5%, la probabilidad de que al menos uno entre cinco guardrails independientes cruce la línea por puro azar es de cerca del 22,6%, y con ocho llega a cerca del 33,7%. Una lista larga entrena al equipo para ignorar las alarmas, lo que es peor que no tener ningún guardrail. Mantén el conjunto fijo pequeño y añade un guardrail específico del test solo cuando el cambio amenace algo que el conjunto fijo no cubre.
¿Cuál es la diferencia entre métrica de guardrail y métrica secundaria?
Una métrica secundaria ayuda a explicar el resultado primario y se lee por dirección y diagnóstico. Un guardrail tiene poder de veto: puede frenar un lanzamiento que la métrica primaria ganó. Esa diferencia hay que declararla antes de que el test empiece, porque una métrica ascendida a guardrail después de los resultados se está usando para justificar una decisión ya tomada. Deng y Shi (KDD 2016) describen además un segundo papel del guardrail, el de sustituir a la métrica objetivo en los casos en que ella no aplica al equipo o a la superficie probada.
¿Un guardrail necesita el mismo poder estadístico que la métrica primaria?
Idealmente sí, y en la práctica casi nunca lo tiene, y por eso la lectura por umbral importa tanto. Dmitriev y colegas (KDD 2017) recomiendan análisis de poder a priori al menos para la OEC y para las métricas de guardrail, con un mínimo del 80% de poder para detectar cambios lo bastante pequeños como para importar comercialmente. Cuando no existe el tráfico para dar poder a un guardrail raro, los caminos honestos son aceptarlo como monitoreo direccional con el rango detectable declarado, correr un test de seguridad dedicado y más largo después del lanzamiento, o seguir el guardrail en un despliegue progresivo en vez de dentro del experimento.
¿Toda alarma de guardrail debe frenar el lanzamiento?
No automáticamente, pero siempre debe forzar una decisión explícita de una persona con nombre, nunca un silencio. Los empeoramientos pequeños en guardrails son esperables: Dmitriev y colegas observan que casi toda funcionalidad añadida aumenta un poco el tiempo de carga. La regla útil es que un guardrail dentro del umbral declarado se lanza sin discusión, un guardrail por encima del umbral se lanza solo con un trade-off escrito y aceptado por quien es dueño de esa métrica, y un guardrail cuyo intervalo es demasiado ancho para decir algo entra en el registro como no medido, jamás como aprobado.