Métrica Primaria y OEC: cómo elegir la que decide
Cómo elegir la métrica primaria de un test A/B, qué necesita tener un OEC y por qué la métrica proxy más sensible suele ser la elección equivocada.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
La métrica primaria, o OEC, es la única medida con permiso para declarar ganador a tu experimento. Elegirla es la decisión de mayor palanca del test entero, y tiene que ocurrir antes del lanzamiento, porque una métrica elegida después de que llegan los resultados no es evidencia, es selección. Esta guía cubre qué necesita tener un OEC para ser usable, las dos cualidades que separan una buena métrica primaria de una métrica plausible, la trampa de tamaño de muestra que empuja a los equipos hacia proxies superficiales, y un ejemplo trabajado en el que el proxy gana y la métrica de negocio no dice nada. Forma parte de nuestra guía completa de test A/B y hace pareja con métricas de guardrail, que se ocupa de la otra mitad de la decisión de subir.
Qué es un OEC, y por qué solo puede haber uno
Kohavi y colegas, describiendo la experimentación en Bing en 2013, listan un criterio general de evaluación formalizado como el primer principio que una organización necesita adoptar antes de que los experimentos controlados valgan la pena. Asumen que el OEC ya fue definido y puede medirse en duraciones relativamente cortas, por ejemplo dos semanas, y nombran la parte difícil con precisión: encontrar métricas medibles en el corto plazo que sean predictivas de objetivos de largo plazo.
Ese encuadre mata dos candidatas populares al instante. El artículo dice sin rodeos que el beneficio no es un buen OEC, porque el teatro de corto plazo como subir precios puede elevarlo mientras lo perjudica en el largo plazo. Da el mismo veredicto sobre la cuota de mercado como criterio de corto plazo, observando que empeorar un buscador en realidad fuerza a la gente a hacer más búsquedas para encontrar una respuesta. Las dos métricas son reales, las dos importan para el negocio, y las dos son manipulables en una ventana de dos semanas en direcciones equivocadas. Su preferencia en Bing era sesiones por usuario, o visitas repetidas, como factor del OEC.
La regla de métrica única no es preciosismo estadístico, es lo que hace que un test sea una decisión. Cada métrica adicional leída en busca de significancia trae consigo su propia probabilidad de cruzar la línea por suerte.
| Métricas leídas en busca de significancia | Probabilidad de que al menos una salga significativa solo por azar |
|---|---|
| 1 | 5,0% |
| 2 | 9,8% |
| 3 | 14,3% |
| 5 | 22,6% |
| 8 | 33,7% |
| 12 | 46,0% |
| 20 | 64,2% |
En la práctica el daño rara vez llega como error formal de comparaciones múltiples. Llega como una reunión en la que un test que perdió en compras acaba habiendo ganado en profundidad de scroll, y el informe se convierte discretamente en un informe sobre profundidad de scroll. Nombrar la métrica primaria antes de lanzar es lo que separa un procedimiento de decisión de una búsqueda de oro.
Las dos cualidades que una métrica primaria necesita tener
Deng y Shi, describiendo el desarrollo de métricas en Bing en 2016, reducen la elección a dos cualidades obligatorias, y las dos tienen que valer al mismo tiempo.
Direccionalidad. Una buena métrica primaria sube cuando la experiencia del usuario mejora de verdad y baja cuando empeora, de forma consistente, en el corto y en el largo plazo. Su contraejemplo es búsquedas distintas por usuario en un buscador. Intuitivamente, los usuarios más satisfechos hacen más búsquedas, y los conteos de búsqueda mayores de hecho correlacionan con buscadores ganando cuota. Pero el análisis de comportamiento muestra que justo después de que la relevancia mejora, los usuarios hacen menos búsquedas dentro de una tarea mientras el número de tareas queda prácticamente igual, así que la métrica baja exactamente cuando el producto se puso mejor. Una métrica de dirección ambigua es peor que ninguna métrica, porque puede moverse en la dirección “buena” empeorando el producto.
Sensibilidad. Una buena métrica primaria responde a la mayoría de las mejoras reales dentro de una ventana normal de experimento. El ejemplo aquí es instructivo porque es la misma organización eligiendo entre dos métricas defendibles: sesiones por usuario está bien ligada a cuota de mercado y satisfacción, pero tarda mucho en moverse, mientras que la tasa de éxito de la búsqueda responde rápido y de forma significativa cuando la relevancia cambia. Bing por eso prefirió métricas construidas sobre sesiones exitosas a sesiones por usuario sola.
La tensión entre las dos es donde viven las discusiones reales. Las métricas cerca del dinero tienen óptima direccionalidad y pésima sensibilidad. Las métricas cerca de la interfaz tienen óptima sensibilidad y direccionalidad escurridiza.
La trampa de muestra que empuja a los equipos hacia el proxy
El tirón hacia las métricas superficiales no es pereza, es aritmética. El tamaño de muestra escala con más o menos uno sobre el cuadrado del efecto e inversamente con la tasa base, así que una métrica más arriba en el embudo es dramáticamente más barata de testear. Aquí está el mismo efecto relativo del 10% valorado en cuatro candidatas a métrica primaria del mismo producto:
| Candidata a métrica primaria | Tasa base | Visitantes por variante | Total de visitantes | Días a 30.000 por semana |
|---|---|---|---|---|
| Hizo clic en el CTA | 30,0% | 3.763 | 7.526 | 2 |
| Inició una prueba gratis | 9,0% | 16.583 | 33.166 | 8 |
| Suscripción pagada | 2,5% | 64.199 | 128.398 | 30 |
| Pagó y sigue activo a los 30 días | 1,8% | 89.839 | 179.678 | 42 |
La métrica más cerca del negocio cuesta cerca de diecisiete veces el tráfico de la métrica más cerca de la interfaz, y cerca de veinticuatro veces si insistes en la versión retenida. Dos días contra seis semanas es una diferencia operativa real, y por eso el proxy sigue ganando las discusiones. Valora tus candidatas:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
La trampa no es que los proxies sean inútiles. Es que un proxy es una hipótesis sobre tu embudo, no una medición de tu negocio, y la hipótesis es falsa con frecuencia. La siguiente sección muestra cómo aparece eso cuando sale mal.
Ejemplo trabajado: el proxy gana, la métrica de negocio no dice nada
Un test en la página de precios se dimensiona por la métrica primaria declarada, suscripción pagada a una tasa base del 2,5% con MDE relativo del 12%, lo que exige 44.996 visitantes por variante, cerca de 21 días a 30.000 visitantes elegibles por semana. Inicio de prueba gratis, a una base del 9%, se declara como diagnóstico. Corre las dos lecturas:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
El diagnóstico. Los inicios de prueba gratis cierran en 4.050 en el control (9,001%) y 4.394 en la variante (9,765%). Eso es +8,49% relativo, z = 3,93, valor p 0,000084, intervalo de confianza de +0,38 a +1,15 puntos porcentuales. Un movimiento decisivo y sin ambigüedad.
La métrica primaria. Las suscripciones pagadas cierran en 1.125 en el control (2,500%) y 1.151 en la variante (2,558%). Eso es +2,31% relativo, z = 0,55, valor p 0,5809, intervalo de confianza de -0,15 a +0,26 puntos porcentuales. Nada.
Si el inicio de prueba gratis fuera la métrica primaria, ese test sube como victoria clara, y la diapositiva dice que la nueva página de precios elevó las suscripciones un 8,5%. Lo que de hecho ocurrió es que más gente empezó una prueba gratis y más o menos la misma gente pagó. La lectura más probable es que la página trajo pruebas gratis adicionales de usuarios que nunca iban a convertir, lo que cuesta esfuerzo de onboarding y carga de soporte sin producir ingresos.
Dos salvedades honestas pertenecen al informe, y las dos son calculables.
La métrica primaria no tenía potencia para un efecto del tamaño del proxy. Si las suscripciones pagadas se hubieran movido el mismo +8,5% que las pruebas gratis, el resultado sería 1.221 contra 1.125, dando valor p 0,0446 y un intervalo de confianza de +0,004 a +0,42 puntos porcentuales, apenas cruzando la línea. Con esa muestra el test tenía solo cerca del 51,6% de potencia para detectar un efecto relativo del 8,5% en suscripciones pagadas; llegar al 80% de potencia para ese efecto exigiría cerca de 88.240 visitantes por variante. Así que la frase correcta no es “la página de precios no elevó las suscripciones pagadas”, es “la página de precios elevó las pruebas gratis de forma decisiva y dejó las suscripciones pagadas sin respuesta, con el intervalo descartando cualquier cosa por encima de cerca del +10% relativo”.
La distancia entre las dos métricas es en sí misma el hallazgo. Un cambio que mueve las pruebas gratis un 8,5% y las suscripciones pagadas un 2,3% te contó algo específico sobre tu embudo: el cuello de botella no es la intención de probar, es lo que ocurre después de que la prueba gratis empieza. Ese es un resultado mejor de lo que una victoria de proxy habría sido, y solo existe porque la métrica primaria fue declarada antes del lanzamiento y leída después dijera lo que dijera.
Una checklist para elegir la métrica primaria
| Pregunta | Si la respuesta es no |
|---|---|
| ¿Sube solo cuando el usuario realmente tuvo un desenlace mejor? | Falla la direccionalidad; se puede mejorar empeorando el producto |
| ¿Puede moverse de forma medible en tu ventana normal de test? | Falla la sensibilidad; todo test va a terminar inconcluso a un coste razonable |
| ¿Es difícil de manipular con un cambio que lamentarías haber subido? | Elegiste un incentivo, no una medición |
| ¿Tu tráfico costea un tamaño de efecto relevante en ella? | Decide abiertamente: cambio mayor, reducción de varianza, test más largo o proxy declarado |
| ¿Existe exactamente una, nombrada antes del lanzamiento? | El test es una búsqueda de oro, no una decisión |
| ¿Alguien es dueño de ella y la lee después de cada test? | Deja de ser la primaria en silencio dentro de un trimestre |
Dos salidas estructurales vale la pena conocer cuando la respuesta honesta a la cuarta fila es no. La reducción de varianza baja la muestra necesaria para el mismo efecto en la misma métrica, cubierta en nuestra guía de CUPED. Y si la restricción real es que tu tráfico nunca va a resolver la métrica que importa, esa es una conversación de diseño, no de cambio de métrica: la aritmética está en efecto mínimo detectable.
Errores comunes con la métrica primaria
| Error | Qué produce |
|---|---|
| Ninguna métrica primaria declarada antes del lanzamiento | Lo que parezca mejor se vuelve el titular, y el programa no distingue victoria de coincidencia |
| Varias métricas primarias | Con cinco métricas, cerca del 22,6% de los tests neutros muestran algo significativo |
| Ingresos o beneficio como OEC de corto plazo | Premia la subida de precios y otros teatros de corto plazo que perjudican al negocio después |
| Un proxy elegido por coste y después reportado como el desenlace | Sube cambios que mueven el embudo sin mover el negocio |
| Una métrica de dirección ambigua | Se puede mejorar empeorando el producto, que es lo que acaba pasando |
| Ascender un guardrail o diagnóstico después de la lectura | Convierte el experimento en una búsqueda de algo positivo que decir |
| Nunca revisitar el OEC conforme el producto madura | Deng y Shi notan que la elección del OEC debe evolucionar conforme el servicio crece |
Hazlo automático en Donnu
Una métrica primaria solo cumple su papel si se fija antes de que el primer visitante sea sorteado y se reporta después diga lo que diga. Donnu A/B pide la métrica primaria en el momento de montar el experimento, la mantiene bloqueada y visible en lo alto del resultado en vez de como una línea entre veinte, y reporta todas las demás métricas debajo de ella como contexto, no como veredicto candidato. Cuando la primaria sale inconclusa y una secundaria sale significativa, la lectura dice exactamente eso, que suele ser la frase más útil del test entero.
Empieza una prueba gratis de 14 días y declara la métrica primaria de tu próximo test antes de lanzarlo.
Referencias
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fuente del OEC formalizado como principio precondición, de la exigencia de ser medible en cerca de dos semanas mientras predice objetivos de largo plazo, de los veredictos sobre beneficio y cuota de mercado como criterios de corto plazo, y de sesiones por usuario como factor preferido en Bing. exp-platform.com.
- Deng, A. y Shi, X. Data-Driven Metric Development for Online Controlled Experiments: Seven Lessons Learned. KDD 2016. Fuente de direccionalidad y sensibilidad como las dos cualidades obligatorias, del contraejemplo de búsquedas distintas por usuario, de la preferencia por sesiones exitosas sobre sesiones por usuario, y de la observación de que el OEC debe evolucionar conforme el servicio crece. exp-platform.com.
- Dmitriev, P., Gupta, S., Kim, D. W. y Vaz, G. A Dirty Dozen: Twelve Common Metric Interpretation Pitfalls in Online Controlled Experiments. KDD 2017. Fuente de la taxonomía de métricas que separa OEC, guardrail, diagnóstico y calidad de datos, y del punto de que lo ideal es tener una métrica única, posiblemente compuesta, como OEC de un producto. exp-platform.com.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Capítulos sobre métricas objetivo, métricas conductoras y guardrails, y sobre construir un OEC. Material complementario en experimentguide.com.
Lee también: Métricas de guardrail · Efecto mínimo detectable · Cómo escribir una hipótesis de test A/B · Paradoja de Simpson en test A/B · Calculadora de tamaño de muestra gratis · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es el OEC en un test A/B?
- El OEC (overall evaluation criterion, o criterio general de evaluación) es la métrica única, o la métrica compuesta única, que carga la decisión del experimento. Kohavi y colegas (KDD 2013) tratan tener un OEC formalizado como precondición para que valga la pena correr experimentos, y describen la parte difícil como encontrar una métrica medible en una ventana corta, cerca de dos semanas, que sea predictiva de los objetivos de largo plazo. Todo el resto del panel es guardrail, diagnóstico o calidad de datos, y ninguno de ellos decide nada por sí solo.
- ¿Qué hace buena a una métrica primaria?
- Deng y Shi (KDD 2016) nombran dos cualidades obligatorias: direccionalidad y sensibilidad. La direccionalidad es que la métrica suba cuando la experiencia del usuario mejora de verdad y baje cuando empeora, en el corto y en el largo plazo. La sensibilidad es que responda a la mayoría de las mejoras reales dentro de una ventana normal de experimento, porque si no decidir se vuelve imposible a un coste razonable. Una métrica con solo una de las dos es una trampa: una métrica direccionalmente perfecta pero insensible nunca resuelve, y una métrica sensible pero ambigua es fácil de mover haciendo algo malo.
- ¿Por qué no usar ingresos o beneficio como OEC?
- Porque los ingresos de corto plazo son fáciles de inflar de maneras que destruyen valor a largo plazo. Kohavi y colegas (KDD 2013) afirman directamente que el beneficio no es un buen OEC, ya que el teatro de corto plazo como subir precios puede elevarlo mientras lo perjudica más adelante. Dan el mismo veredicto sobre la cuota de mercado como criterio de corto plazo, notando que empeorar un buscador fuerza a la gente a hacer más búsquedas. Los ingresos entran en la decisión, en general como guardrail, no como la métrica que declara al ganador.
- ¿Puedo tener más de una métrica primaria?
- Puedes tener una métrica compuesta, pero no puedes tener varias independientes y seguir llamando decisión al test. Leer cinco métricas al umbral del 5% da cerca del 22,6% de probabilidad de que al menos una cruce la línea por puro azar, y con doce métricas eso llega a cerca del 46%. En la práctica el fallo rara vez es formal: es que la métrica que por casualidad salió mejor se convierte en el titular después del hecho. Nombrar una métrica antes de lanzar es lo que hace que el resultado sea una decisión en vez de una búsqueda de oro.
- ¿Por qué la métrica proxy más sensible es una trampa?
- Porque la sensibilidad y la proximidad al valor de negocio suelen tirar en direcciones opuestas. Dimensionar un test para un proxy superficial es mucho más barato: al 10% de efecto relativo, una tasa de clic en el CTA del 30% necesita cerca de 3.763 visitantes por variante, mientras que una tasa de suscripción pagada del 2,5% necesita cerca de 64.199, diecisiete veces más. Esa diferencia de coste es exactamente lo que empuja a los equipos hacia el proxy, y es también por lo que una victoria en el proxy nunca debe reportarse como victoria de negocio antes de que el vínculo entre los dos sea demostrado en tus propios datos.
- ¿Y si el test no tiene tráfico para la métrica real?
- Entonces dilo explícitamente en vez de cambiar la métrica en silencio. Las opciones honestas son testear un cambio mayor para que un efecto mayor sea detectable, usar reducción de varianza para que la misma métrica necesite menos tráfico, aceptar un test más largo, o registrar el proxy como métrica de decisión declarando abiertamente que el resultado de negocio sigue sin probarse y agendando una lectura de seguimiento. Lo que rompe un programa no es elegir un proxy, es elegir uno en silencio y después reportarlo como si fuera el desenlace.
- ¿Cuál es la diferencia entre métrica primaria y guardrail?
- La métrica primaria responde si el cambio es bueno, y es la única con permiso para declarar un ganador. El guardrail responde si el cambio es seguro, y tiene poder de veto: puede frenar una subida que la primaria ganó, pero nunca rescatar una que la primaria perdió. Las dos deben declararse antes del lanzamiento. Cuando un test perdido es salvado por una métrica que no era la primaria, el experimento dejó de ser un procedimiento de decisión y se volvió una búsqueda de algo positivo que reportar.