Métricas de Guardrail: los frenos contra un empeoramiento
Qué son las métricas de guardrail, cómo definir el umbral de empeoramiento antes del test y por qué un guardrail sin significancia no está liberado.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Las métricas de guardrail son las medidas que un cambio no puede empeorar, incluso cuando la métrica que el test fue hecho para mover sube. Existen porque una métrica primaria ganadora no es lo mismo que un lanzamiento seguro, y la forma más común de equivocarse en esto es leer un guardrail sin significancia como un guardrail liberado. Esta guía cubre qué es un guardrail y cómo difiere de una métrica secundaria, cómo definir el umbral que le da dientes, la aritmética de poder que desarma a la mayoría de los guardrails en silencio, y un conjunto inicial para ecommerce y SaaS. Forma parte de nuestra guía completa de test A/B y conversa directamente con la aritmética de diseño de cuántos visitantes necesita un test A/B.
Qué es una métrica de guardrail, y qué no
Dmitriev y colegas, escribiendo sobre interpretación de métricas en Microsoft en 2017, definen las métricas de guardrail como medidas que no indican claramente el éxito de la funcionalidad probada, pero que el equipo no quiere perjudicar de forma significativa a la hora de decidir lanzar. El tiempo de carga en un sitio como Bing o MSN es su ejemplo canónico: nadie lanza una funcionalidad para hacer la página más lenta, y aun así casi toda funcionalidad añadida a una página aumenta un poco el tiempo de carga. Los empeoramientos pequeños son esperables. Los grandes, no.
Esa definición traza una línea que muchos registros de experimento difuminan. Vale la pena separar cuatro papeles, porque cada uno se lee de una forma distinta.
La distinción que más pesa en la práctica es guardrail contra métrica secundaria. Una métrica secundaria se lee por dirección y explicación. Un guardrail lleva veto: puede frenar un lanzamiento que la métrica primaria ganó. Como eso es poder de verdad, hay que asignarlo antes. Una métrica ascendida a guardrail después de los resultados se está usando para justificar una decisión ya tomada, y una degradada después de los resultados es todavía peor.
Deng y Shi, describiendo el desarrollo de métricas en Bing en 2016, añaden un segundo papel del guardrail que vale la pena conocer: los guardrails también sustituyen a la métrica objetivo cuando ella no aplica. Su ejemplo es una organización de búsqueda cuya métrica objetivo cuenta clics con tiempo largo de permanencia, lo que no tiene ningún sentido para el equipo que construye respuestas instantáneas, cuyo trabajo entero es satisfacer al usuario sin clic. Ese equipo necesita guardrails que capturen la experiencia que la métrica objetivo compartida no ve.
El umbral, no el valor p, es lo que le da dientes al guardrail
Aquí está el error que más caro cuesta, y se esconde dentro de una frase que suena responsable: “los guardrails salieron no significativos, así que lanzamos.”
El test se dimensiona para la métrica primaria. Los guardrails suelen ser eventos más raros, con base mucho más baja, y el tamaño de muestra escala con aproximadamente uno sobre el cuadrado del efecto que quieres ver, así que una base más baja compra mucha menos resolución con el mismo número de visitantes. Toma un test de checkout dimensionado para detectar 10% relativo en una tasa de compra del 4,0%: eso pide 39.475 visitantes por variación, 78.950 en total, cerca de 14 días a 40.000 visitantes elegibles por semana. En esa muestra exacta, esto es lo que cada métrica del panel logra resolver de hecho.
| Métrica | Base | Menor efecto relativo detectable con 39.475 por variación | En puntos porcentuales |
|---|---|---|---|
| Añadió al carrito | 22,0% | cerca de 3,8% | 0,83 pp |
| Inició el checkout | 9,0% | cerca de 6,4% | 0,58 pp |
| Compra (la métrica primaria) | 4,0% | 10,0% | 0,40 pp |
| Tasa de reembolso | 1,2% | cerca de 18,9% | 0,23 pp |
| Contacto con soporte | 0,8% | cerca de 23,5% | 0,19 pp |
| Baja de la lista de email | 0,3% | cerca de 39,8% | 0,12 pp |
Lee las tres últimas filas despacio. En un test perfectamente bien dimensionado para lo que se propone, una tasa de reembolso que vuelve “no significativa” es compatible con cualquier cosa entre una mejora real y un empeoramiento del 19%, y una baja de lista que vuelve callada es compatible con un empeoramiento del 40%. Nada fue liberado. La pregunta nunca se hizo con datos suficientes para tener respuesta.
Dmitriev y colegas documentan exactamente esto en MSN.com. El total de páginas vistas por usuario subió 0,5% en un experimento, con un valor p sin significancia. Para un negocio de ese tamaño, 0,5% en páginas vistas es un impacto comercialmente relevante. El intervalo de confianza terminó quedando en torno a más o menos 5%, y el diseño solo lograba detectar cambios del 7,8% o mayores con 80% de poder. Su conclusión es la frase que merece quedar colgada encima del panel: no podemos asumir que no impactamos la métrica sin poder estadístico.
Pon tus propias bases y mira lo que resuelve tu tráfico:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
La corrección no es estadística, es de proceso. Declara un umbral para cada guardrail antes de lanzar el test y después compara el límite superior del intervalo de confianza con ese umbral, en vez de comparar el valor p con 0,05.
Ejemplo trabajado: la primaria gana y el guardrail no dice nada
Un rediseño de checkout corre en la muestra de arriba: 39.475 visitantes por variación, base de compra 4,0%, base de reembolso 1,2%. El umbral declarado antes de lanzar es que los reembolsos no pueden subir más del 10% relativo, lo que en esa base da más 0,12 puntos porcentuales. Corre los números tú mismo:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
La métrica primaria. El control termina con 1.579 compras en 39.475 visitantes (4,000%), y la variación con 1.745 (4,421%). Eso da z = 2,94, valor p = 0,0033, mejora relativa de +10,5%, intervalo de confianza de la diferencia de +0,14 a +0,70 puntos porcentuales. Victoria limpia, exactamente del tamaño que el test fue diseñado para encontrar.
El guardrail. Los reembolsos terminan en 474 en el control (1,201%) y 512 en la variación (1,297%). Es un movimiento de +8,0% relativo en la dirección equivocada, con z = 1,22 y valor p de 0,2233. La lectura ingenua es que el guardrail está limpio.
No lo está. El intervalo de confianza de esa diferencia va de -0,059 a +0,251 puntos porcentuales, y el límite superior de +0,251 pp equivale a +20,9% relativo en una base del 1,2%. El umbral declarado era +0,12 pp. El intervalo es casi el doble del número que el negocio dijo tolerar, así que este test simplemente no logra decir si el rediseño quedó dentro del límite. Para liberar de verdad un empeoramiento del 10% relativo, la tasa de reembolso necesitaría cerca de 135.624 visitantes por variación, unos 48 días de tráfico en vez de 14.
Para contrastar, así es como se ve de verdad una alarma de guardrail en la misma muestra: reembolsos de 474 contra 592 dan +24,9% relativo, z = 3,64, valor p = 0,00027, intervalo de +0,138 a +0,460 puntos porcentuales. Enteramente por encima del umbral, y ninguna lectura de ese resultado se lanza sin conversación.
El registro honesto del primer caso tiene tres líneas: la primaria subió 10,5% con significancia; la tasa de reembolso subió 8,0% en la dirección, intervalo de -0,06 a +0,25 pp contra un umbral de +0,12 pp, no liberada en esta muestra; la acción recomendada es lanzar con reembolso monitoreado en despliegue progresivo durante cuatro semanas. Esa es una decisión diferente de “guardrails limpios, lanzando”, y es la decisión que el dato sostiene.
Cuántos guardrails, y la aritmética de la falsa alarma
Un guardrail es barato de añadir y caro de ignorar, y así es como los equipos acaban con una lista de quince y el hábito de espantarlos todos. La aritmética no perdona: cada guardrail independiente leído a un umbral del 5% añade su propia probabilidad de alarmar por suerte.
| Guardrails monitoreados | Probabilidad de que al menos uno alarme solo por azar |
|---|---|
| 1 | 5,0% |
| 2 | 9,8% |
| 3 | 14,3% |
| 4 | 18,5% |
| 5 | 22,6% |
| 6 | 26,5% |
| 8 | 33,7% |
| 10 | 40,1% |
Con diez guardrails, dos de cada cinco tests muestran una celda roja que no significa nada. El equipo aprende, correctamente, que una celda roja suele ser ruido, y entonces pierde la que no lo era. De tres a seis guardrails fijos, cada uno con umbral escrito, le gana a quince seguidos por encima. Añade un guardrail específico del test solo cuando el cambio amenace algo que el conjunto fijo no cubre, y trata un desbordamiento como disparador de una ronda de confirmación, no como veredicto, la misma disciplina que vale para una victoria al límite en la métrica primaria. Los métodos de corrección para decidir sobre varias métricas al mismo tiempo están en test A/B/n con varias variantes.
Un conjunto inicial para ecommerce y SaaS
Un guardrail es específico del negocio, pero las categorías se repiten. El conjunto de abajo es un punto de partida, no un estándar, y la columna del umbral es la parte que tu equipo necesita rellenar con números reales.
| Categoría | Guardrail de ecommerce | Guardrail de SaaS | Por qué gana poder de veto |
|---|---|---|---|
| Velocidad | Tiempo de carga en el percentil 75 | Tiempo hasta que la pantalla principal es usable | El experimento de lentitud de Bing en 2013 encontró que cada 100 milisegundos de mejora valían cerca de 0,6% de ingresos |
| Arrepentimiento | Tasa de reembolso y devolución | Cancelación en los primeros 30 días | Una victoria de conversión pagada por compradores que no querían el producto no es una victoria |
| Costo de la fricción | Contactos de soporte por 1.000 pedidos | Tickets por 100 cuentas nuevas | Transfiere costo del embudo a un equipo que no aparece en el resultado del test |
| Alcance futuro | Baja de la lista de email | Desactivación de notificaciones | Gasta un activo duradero para comprar una conversión de una vez |
| Calidad de la victoria | Ticket promedio | Mix de planes, porción que cae en el plan de entrada | Detecta una ganancia construida enteramente sobre descuento o degradación |
| Confiabilidad | Tasa de error en el checkout | Sesiones sin crash | El modo de falla que nunca aparece en una tasa de conversión |
Dos notas sobre esa tabla. Primero, la fila de velocidad no es un guardrail simbólico. El relato de 2013 sobre experimentación en Bing describe un experimento deliberado de lentitud, 10% de los usuarios con 100 milisegundos de más y otro 10% con 250 milisegundos de más, durante dos semanas, y reporta que cada 100 milisegundos de mejora valían cerca de 0,6% en ingresos. Ese resultado es específico de Bing en aquel momento y no debe trasplantarse como número, pero establece que la latencia es una variable comercial de verdad, no una cuestión de higiene.
Segundo, el mismo artículo trae una advertencia que pertenece a este texto. Los autores citan una afirmación publicada por otra empresa de que un retraso de 200 milisegundos no importó, y argumentan que la explicación más probable es que el experimento no tenía poder estadístico para detectar la diferencia, y no que la diferencia no existiera. Eso es la falla del guardrail sin poder apareciendo en público, en un post muy leído, de un equipo competente. No es un error exótico.
Errores comunes con guardrails
| Error | Qué produce |
|---|---|
| Leer un guardrail sin significancia como liberado | Empeoramientos reales se lanzan, y el programa no distingue lanzamiento seguro de lanzamiento no examinado |
| Elegir los guardrails después de ver los resultados | La lista se convierte en lo que sostiene la decisión ya tomada |
| Ningún umbral escrito | Toda conversación sobre guardrails recomienza de cero y termina donde la persona más insistente quiera |
| Quince guardrails en el panel | Cerca de dos de cada cinco tests muestran una celda roja por azar, y el equipo aprende a ignorar el rojo |
| Tratar cualquier desbordamiento como bloqueo automático | Los guardrails se van quitando en silencio en vez de discutirse, porque un empeoramiento pequeño es normal |
| Ningún dueño por guardrail | Un desbordamiento se convierte en una reunión sin decisión y el lanzamiento ocurre por inercia |
| Guardrail solo dentro del test, nunca después | Los daños raros y lentos, churn y reembolso sobre todo, son exactamente los que un test de dos semanas no ve |
Si el problema recurrente es que tus guardrails nunca tienen poder para decir nada, las respuestas estructurales son la reducción de varianza, cubierta en nuestra guía de CUPED, o aceptar el guardrail como monitoreo posterior al lanzamiento en despliegue progresivo en vez de fingir que el experimento respondió.
Hazlo automático en Donnu
Un guardrail solo funciona si el umbral existe antes de que el test empiece y si su intervalo está visible al lado del veredicto, no enterrado a dos clics. Donnu A/B mantiene los guardrails declarados y sus umbrales atados al experimento, reporta el intervalo de confianza al lado de cada guardrail en vez de un sello solitario de significancia, y marca el guardrail como no medido cuando la muestra no resuelve el umbral declarado, en vez de mostrar un tilde verde tranquilizador. Cuando un cambio gana la métrica primaria y deja un guardrail sin respuesta, eso aparece como la pregunta abierta que es.
Empieza una prueba gratis de 14 días y define los umbrales de tus guardrails antes del próximo lanzamiento.
Referencias
- Dmitriev, P., Gupta, S., Kim, D. W. y Vaz, G. A Dirty Dozen: Twelve Common Metric Interpretation Pitfalls in Online Controlled Experiments. KDD 2017. Fuente de la definición de métrica de guardrail, de la taxonomía de métricas usada arriba, del caso de MSN.com con el umbral detectable del 7,8% y de la recomendación de análisis de poder a priori al 80% para OEC y guardrails. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fuente del experimento de lentitud de Bing (retrasos de 100 y 250 milisegundos durante dos semanas, cada 100 milisegundos valiendo cerca de 0,6% de ingresos) y del argumento de que un resultado nulo publicado sobre 200 milisegundos era probablemente falta de poder. exp-platform.com.
- Deng, A. y Shi, X. Data-Driven Metric Development for Online Controlled Experiments: Seven Lessons Learned. KDD 2016. Fuente de los dos papeles del guardrail, sustituir una métrica objetivo inaplicable y cubrir dimensiones que ella no mide, y de la exigencia de que un guardrail tenga interpretación direccional clara. exp-platform.com.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Capítulos sobre métricas, OEC y guardrails organizacionales. Material complementario en experimentguide.com.
Lee también: Significancia estadística en test A/B · SRM: reparto desigual de tráfico · Errores comunes en tests A/B · El problema del peeking · Calculadora de poder estadístico gratis · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué son las métricas de guardrail en un test A/B?
- Las métricas de guardrail son medidas que el cambio no puede empeorar, aunque mejorarlas no sea el objetivo del test. Dmitriev y colegas (KDD 2017) las definen como métricas que no indican claramente el éxito de la funcionalidad probada, pero que el equipo no quiere perjudicar de forma significativa a la hora de decidir lanzar. El tiempo de carga de la página es el ejemplo canónico: nadie lanza una funcionalidad para hacer la página más rápida, pero una funcionalidad que deje la página mucho más lenta no debería lanzarse. La métrica primaria decide si el cambio es bueno; los guardrails deciden si es seguro.
- ¿Un guardrail con valor p por encima de 0,05 está liberado?
- No, y esa es la lectura más cara de todo el tema. Un test dimensionado para una métrica primaria del 4% recoge muestra suficiente para resolver un empeoramiento relativo del 10% ahí, pero una tasa de reembolso con base del 1,2% solo resuelve cerca del 19% relativo con esa misma muestra. Un guardrail sin significancia en ese test es compatible con cualquier cosa entre una mejora real y un empeoramiento del 19%. Dmitriev y colegas (KDD 2017) documentan exactamente ese caso en MSN.com, donde una métrica se movió 0,5% sin significancia mientras el diseño solo lograba detectar 7,8% o más. Lee el intervalo de confianza, no el veredicto.
- ¿Cómo definir el umbral de un guardrail?
- Nombra el mayor empeoramiento que el negocio aceptaría a cambio de la ganancia que el test persigue, escríbelo antes de lanzar el test y después compara el límite superior del intervalo de confianza con ese número, en vez de comparar el valor p con 0,05. Si el límite superior del intervalo queda por debajo del umbral, el guardrail está de hecho liberado en esa muestra. Si queda por encima, el test simplemente no respondió a la pregunta, independientemente del valor p. Definir el umbral después de ver los datos convierte al guardrail en una formalidad.
- ¿Cuántos guardrails debe tener un test?
- Los suficientemente pocos para que cada uno se tome en serio, lo que en la práctica significa de tres a seis para la mayoría de los equipos. Un guardrail multiplica las falsas alarmas: con un umbral del 5%, la probabilidad de que al menos uno entre cinco guardrails independientes cruce la línea por puro azar es de cerca del 22,6%, y con ocho llega a cerca del 33,7%. Una lista larga entrena al equipo para ignorar las alarmas, lo que es peor que no tener ningún guardrail. Mantén el conjunto fijo pequeño y añade un guardrail específico del test solo cuando el cambio amenace algo que el conjunto fijo no cubre.
- ¿Cuál es la diferencia entre métrica de guardrail y métrica secundaria?
- Una métrica secundaria ayuda a explicar el resultado primario y se lee por dirección y diagnóstico. Un guardrail tiene poder de veto: puede frenar un lanzamiento que la métrica primaria ganó. Esa diferencia hay que declararla antes de que el test empiece, porque una métrica ascendida a guardrail después de los resultados se está usando para justificar una decisión ya tomada. Deng y Shi (KDD 2016) describen además un segundo papel del guardrail, el de sustituir a la métrica objetivo en los casos en que ella no aplica al equipo o a la superficie probada.
- ¿Un guardrail necesita el mismo poder estadístico que la métrica primaria?
- Idealmente sí, y en la práctica casi nunca lo tiene, y por eso la lectura por umbral importa tanto. Dmitriev y colegas (KDD 2017) recomiendan análisis de poder a priori al menos para la OEC y para las métricas de guardrail, con un mínimo del 80% de poder para detectar cambios lo bastante pequeños como para importar comercialmente. Cuando no existe el tráfico para dar poder a un guardrail raro, los caminos honestos son aceptarlo como monitoreo direccional con el rango detectable declarado, correr un test de seguridad dedicado y más largo después del lanzamiento, o seguir el guardrail en un despliegue progresivo en vez de dentro del experimento.
- ¿Toda alarma de guardrail debe frenar el lanzamiento?
- No automáticamente, pero siempre debe forzar una decisión explícita de una persona con nombre, nunca un silencio. Los empeoramientos pequeños en guardrails son esperables: Dmitriev y colegas observan que casi toda funcionalidad añadida aumenta un poco el tiempo de carga. La regla útil es que un guardrail dentro del umbral declarado se lanza sin discusión, un guardrail por encima del umbral se lanza solo con un trade-off escrito y aceptado por quien es dueño de esa métrica, y un guardrail cuyo intervalo es demasiado ancho para decir algo entra en el registro como no medido, jamás como aprobado.