Estadística

Métrica Primaria y OEC: cómo elegir la que decide

Cómo elegir la métrica primaria de un test A/B, qué necesita tener un OEC y por qué la métrica proxy más sensible suele ser la elección equivocada.

Ilustración plana de una barra alta y destacada de pie en medio de una fila larga de barras bajas e iguales, en tonos de verde profundo

La métrica primaria, o OEC, es la única medida con permiso para declarar ganador a tu experimento. Elegirla es la decisión de mayor palanca del test entero, y tiene que ocurrir antes del lanzamiento, porque una métrica elegida después de que llegan los resultados no es evidencia, es selección. Esta guía cubre qué necesita tener un OEC para ser usable, las dos cualidades que separan una buena métrica primaria de una métrica plausible, la trampa de tamaño de muestra que empuja a los equipos hacia proxies superficiales, y un ejemplo trabajado en el que el proxy gana y la métrica de negocio no dice nada. Forma parte de nuestra guía completa de test A/B y hace pareja con métricas de guardrail, que se ocupa de la otra mitad de la decisión de subir.

Qué es un OEC, y por qué solo puede haber uno

Kohavi y colegas, describiendo la experimentación en Bing en 2013, listan un criterio general de evaluación formalizado como el primer principio que una organización necesita adoptar antes de que los experimentos controlados valgan la pena. Asumen que el OEC ya fue definido y puede medirse en duraciones relativamente cortas, por ejemplo dos semanas, y nombran la parte difícil con precisión: encontrar métricas medibles en el corto plazo que sean predictivas de objetivos de largo plazo.

Ese encuadre mata dos candidatas populares al instante. El artículo dice sin rodeos que el beneficio no es un buen OEC, porque el teatro de corto plazo como subir precios puede elevarlo mientras lo perjudica en el largo plazo. Da el mismo veredicto sobre la cuota de mercado como criterio de corto plazo, observando que empeorar un buscador en realidad fuerza a la gente a hacer más búsquedas para encontrar una respuesta. Las dos métricas son reales, las dos importan para el negocio, y las dos son manipulables en una ventana de dos semanas en direcciones equivocadas. Su preferencia en Bing era sesiones por usuario, o visitas repetidas, como factor del OEC.

La regla de métrica única no es preciosismo estadístico, es lo que hace que un test sea una decisión. Cada métrica adicional leída en busca de significancia trae consigo su propia probabilidad de cruzar la línea por suerte.

Métricas leídas en busca de significancia Probabilidad de que al menos una salga significativa solo por azar
1 5,0%
2 9,8%
3 14,3%
5 22,6%
8 33,7%
12 46,0%
20 64,2%

En la práctica el daño rara vez llega como error formal de comparaciones múltiples. Llega como una reunión en la que un test que perdió en compras acaba habiendo ganado en profundidad de scroll, y el informe se convierte discretamente en un informe sobre profundidad de scroll. Nombrar la métrica primaria antes de lanzar es lo que separa un procedimiento de decisión de una búsqueda de oro.

Una métrica decide, las otras informanLa métrica primaria es la única con permiso para declarar un ganador. Las métricas de guardrail pueden vetar una subida pero nunca rescatar una derrota. Las métricas de diagnóstico explican el movimiento y no deciden nada. Las métricas de calidad de datos deciden solo si el experimento es legible.Qué tiene permiso para hacer cada métrica del panelMétrica primaria (el OEC)la única que puede declarar un ganadorGuardrailspueden vetar una subida, nunca salvar una derrotaDiagnósticosexplican el movimiento, no deciden nadaCalidad de datosdeciden solo si se puede leer algoUna métrica que cambia de categoría entre el lanzamiento y la lectura cambió el experimento, no la interpretación.La versión más común de esa maniobra es un diagnóstico ascendido a primaria porque la primaria no colaboró.
Cuatro cajas, y solo una tiene permiso para decir la palabra “ganador”. Escribir en qué caja vive cada métrica es un hábito de cinco minutos que elimina casi toda discusión posterior.

Las dos cualidades que una métrica primaria necesita tener

Deng y Shi, describiendo el desarrollo de métricas en Bing en 2016, reducen la elección a dos cualidades obligatorias, y las dos tienen que valer al mismo tiempo.

Direccionalidad. Una buena métrica primaria sube cuando la experiencia del usuario mejora de verdad y baja cuando empeora, de forma consistente, en el corto y en el largo plazo. Su contraejemplo es búsquedas distintas por usuario en un buscador. Intuitivamente, los usuarios más satisfechos hacen más búsquedas, y los conteos de búsqueda mayores de hecho correlacionan con buscadores ganando cuota. Pero el análisis de comportamiento muestra que justo después de que la relevancia mejora, los usuarios hacen menos búsquedas dentro de una tarea mientras el número de tareas queda prácticamente igual, así que la métrica baja exactamente cuando el producto se puso mejor. Una métrica de dirección ambigua es peor que ninguna métrica, porque puede moverse en la dirección “buena” empeorando el producto.

Sensibilidad. Una buena métrica primaria responde a la mayoría de las mejoras reales dentro de una ventana normal de experimento. El ejemplo aquí es instructivo porque es la misma organización eligiendo entre dos métricas defendibles: sesiones por usuario está bien ligada a cuota de mercado y satisfacción, pero tarda mucho en moverse, mientras que la tasa de éxito de la búsqueda responde rápido y de forma significativa cuando la relevancia cambia. Bing por eso prefirió métricas construidas sobre sesiones exitosas a sesiones por usuario sola.

La tensión entre las dos es donde viven las discusiones reales. Las métricas cerca del dinero tienen óptima direccionalidad y pésima sensibilidad. Las métricas cerca de la interfaz tienen óptima sensibilidad y direccionalidad escurridiza.

Direccionalidad contra sensibilidad, y dónde caen las métricas comunesLas métricas con direccionalidad clara pero baja sensibilidad, como ingresos por usuario y retención de 30 días, son confiables pero lentas de resolver. Las métricas con alta sensibilidad pero direccionalidad ambigua, como clics en un solo elemento y tiempo en la página, resuelven rápido pero pueden moverse empeorando el producto. Solo las métricas con las dos cualidades, como compras completadas o sesiones exitosas, sirven como métrica primaria.La métrica primaria tiene que quedar en la esquina superior derecha, y casi ninguna candidata quedasensibilidad: ¿se mueve dentro de una ventana de dos semanas?direccionalidadconfiable pero lentaingresos por usuario, retención de 30 días,valor de tiempo de vidabuen guardrail, primaria malausable como primariacompras completadas, suscripciones pagadas,sesiones exitosaslas dos cualidades valen juntasinútiles por los dos ladosconteos de vanidad que nadie usa,métricas sin dueñoquítalas del panelrápidas pero ambiguasclics en un elemento, tiempo en la página,búsquedas distintas por usuariobuen diagnóstico, primaria peligrosa
El cuadrante inferior derecho es donde viven los proxies, y es genuinamente tentador, porque esas métricas resuelven en días en vez de meses. El precio es que se pueden mover empeorando el producto.

La trampa de muestra que empuja a los equipos hacia el proxy

El tirón hacia las métricas superficiales no es pereza, es aritmética. El tamaño de muestra escala con más o menos uno sobre el cuadrado del efecto e inversamente con la tasa base, así que una métrica más arriba en el embudo es dramáticamente más barata de testear. Aquí está el mismo efecto relativo del 10% valorado en cuatro candidatas a métrica primaria del mismo producto:

Candidata a métrica primaria Tasa base Visitantes por variante Total de visitantes Días a 30.000 por semana
Hizo clic en el CTA 30,0% 3.763 7.526 2
Inició una prueba gratis 9,0% 16.583 33.166 8
Suscripción pagada 2,5% 64.199 128.398 30
Pagó y sigue activo a los 30 días 1,8% 89.839 179.678 42

La métrica más cerca del negocio cuesta cerca de diecisiete veces el tráfico de la métrica más cerca de la interfaz, y cerca de veinticuatro veces si insistes en la versión retenida. Dos días contra seis semanas es una diferencia operativa real, y por eso el proxy sigue ganando las discusiones. Valora tus candidatas:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La trampa no es que los proxies sean inútiles. Es que un proxy es una hipótesis sobre tu embudo, no una medición de tu negocio, y la hipótesis es falsa con frecuencia. La siguiente sección muestra cómo aparece eso cuando sale mal.

Ejemplo trabajado: el proxy gana, la métrica de negocio no dice nada

Un test en la página de precios se dimensiona por la métrica primaria declarada, suscripción pagada a una tasa base del 2,5% con MDE relativo del 12%, lo que exige 44.996 visitantes por variante, cerca de 21 días a 30.000 visitantes elegibles por semana. Inicio de prueba gratis, a una base del 9%, se declara como diagnóstico. Corre las dos lecturas:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

El diagnóstico. Los inicios de prueba gratis cierran en 4.050 en el control (9,001%) y 4.394 en la variante (9,765%). Eso es +8,49% relativo, z = 3,93, valor p 0,000084, intervalo de confianza de +0,38 a +1,15 puntos porcentuales. Un movimiento decisivo y sin ambigüedad.

La métrica primaria. Las suscripciones pagadas cierran en 1.125 en el control (2,500%) y 1.151 en la variante (2,558%). Eso es +2,31% relativo, z = 0,55, valor p 0,5809, intervalo de confianza de -0,15 a +0,26 puntos porcentuales. Nada.

Si el inicio de prueba gratis fuera la métrica primaria, ese test sube como victoria clara, y la diapositiva dice que la nueva página de precios elevó las suscripciones un 8,5%. Lo que de hecho ocurrió es que más gente empezó una prueba gratis y más o menos la misma gente pagó. La lectura más probable es que la página trajo pruebas gratis adicionales de usuarios que nunca iban a convertir, lo que cuesta esfuerzo de onboarding y carga de soporte sin producir ingresos.

Dos salvedades honestas pertenecen al informe, y las dos son calculables.

La métrica primaria no tenía potencia para un efecto del tamaño del proxy. Si las suscripciones pagadas se hubieran movido el mismo +8,5% que las pruebas gratis, el resultado sería 1.221 contra 1.125, dando valor p 0,0446 y un intervalo de confianza de +0,004 a +0,42 puntos porcentuales, apenas cruzando la línea. Con esa muestra el test tenía solo cerca del 51,6% de potencia para detectar un efecto relativo del 8,5% en suscripciones pagadas; llegar al 80% de potencia para ese efecto exigiría cerca de 88.240 visitantes por variante. Así que la frase correcta no es “la página de precios no elevó las suscripciones pagadas”, es “la página de precios elevó las pruebas gratis de forma decisiva y dejó las suscripciones pagadas sin respuesta, con el intervalo descartando cualquier cosa por encima de cerca del +10% relativo”.

La distancia entre las dos métricas es en sí misma el hallazgo. Un cambio que mueve las pruebas gratis un 8,5% y las suscripciones pagadas un 2,3% te contó algo específico sobre tu embudo: el cuello de botella no es la intención de probar, es lo que ocurre después de que la prueba gratis empieza. Ese es un resultado mejor de lo que una victoria de proxy habría sido, y solo existe porque la métrica primaria fue declarada antes del lanzamiento y leída después dijera lo que dijera.

Una checklist para elegir la métrica primaria

Pregunta Si la respuesta es no
¿Sube solo cuando el usuario realmente tuvo un desenlace mejor? Falla la direccionalidad; se puede mejorar empeorando el producto
¿Puede moverse de forma medible en tu ventana normal de test? Falla la sensibilidad; todo test va a terminar inconcluso a un coste razonable
¿Es difícil de manipular con un cambio que lamentarías haber subido? Elegiste un incentivo, no una medición
¿Tu tráfico costea un tamaño de efecto relevante en ella? Decide abiertamente: cambio mayor, reducción de varianza, test más largo o proxy declarado
¿Existe exactamente una, nombrada antes del lanzamiento? El test es una búsqueda de oro, no una decisión
¿Alguien es dueño de ella y la lee después de cada test? Deja de ser la primaria en silencio dentro de un trimestre

Dos salidas estructurales vale la pena conocer cuando la respuesta honesta a la cuarta fila es no. La reducción de varianza baja la muestra necesaria para el mismo efecto en la misma métrica, cubierta en nuestra guía de CUPED. Y si la restricción real es que tu tráfico nunca va a resolver la métrica que importa, esa es una conversación de diseño, no de cambio de métrica: la aritmética está en efecto mínimo detectable.

Errores comunes con la métrica primaria

Error Qué produce
Ninguna métrica primaria declarada antes del lanzamiento Lo que parezca mejor se vuelve el titular, y el programa no distingue victoria de coincidencia
Varias métricas primarias Con cinco métricas, cerca del 22,6% de los tests neutros muestran algo significativo
Ingresos o beneficio como OEC de corto plazo Premia la subida de precios y otros teatros de corto plazo que perjudican al negocio después
Un proxy elegido por coste y después reportado como el desenlace Sube cambios que mueven el embudo sin mover el negocio
Una métrica de dirección ambigua Se puede mejorar empeorando el producto, que es lo que acaba pasando
Ascender un guardrail o diagnóstico después de la lectura Convierte el experimento en una búsqueda de algo positivo que decir
Nunca revisitar el OEC conforme el producto madura Deng y Shi notan que la elección del OEC debe evolucionar conforme el servicio crece

Hazlo automático en Donnu

Una métrica primaria solo cumple su papel si se fija antes de que el primer visitante sea sorteado y se reporta después diga lo que diga. Donnu A/B pide la métrica primaria en el momento de montar el experimento, la mantiene bloqueada y visible en lo alto del resultado en vez de como una línea entre veinte, y reporta todas las demás métricas debajo de ella como contexto, no como veredicto candidato. Cuando la primaria sale inconclusa y una secundaria sale significativa, la lectura dice exactamente eso, que suele ser la frase más útil del test entero.

Empieza una prueba gratis de 14 días y declara la métrica primaria de tu próximo test antes de lanzarlo.

Referencias

Lee también: Métricas de guardrail · Efecto mínimo detectable · Cómo escribir una hipótesis de test A/B · Paradoja de Simpson en test A/B · Calculadora de tamaño de muestra gratis · Leia em português · Read in English

Preguntas frecuentes

¿Qué es el OEC en un test A/B?
El OEC (overall evaluation criterion, o criterio general de evaluación) es la métrica única, o la métrica compuesta única, que carga la decisión del experimento. Kohavi y colegas (KDD 2013) tratan tener un OEC formalizado como precondición para que valga la pena correr experimentos, y describen la parte difícil como encontrar una métrica medible en una ventana corta, cerca de dos semanas, que sea predictiva de los objetivos de largo plazo. Todo el resto del panel es guardrail, diagnóstico o calidad de datos, y ninguno de ellos decide nada por sí solo.
¿Qué hace buena a una métrica primaria?
Deng y Shi (KDD 2016) nombran dos cualidades obligatorias: direccionalidad y sensibilidad. La direccionalidad es que la métrica suba cuando la experiencia del usuario mejora de verdad y baje cuando empeora, en el corto y en el largo plazo. La sensibilidad es que responda a la mayoría de las mejoras reales dentro de una ventana normal de experimento, porque si no decidir se vuelve imposible a un coste razonable. Una métrica con solo una de las dos es una trampa: una métrica direccionalmente perfecta pero insensible nunca resuelve, y una métrica sensible pero ambigua es fácil de mover haciendo algo malo.
¿Por qué no usar ingresos o beneficio como OEC?
Porque los ingresos de corto plazo son fáciles de inflar de maneras que destruyen valor a largo plazo. Kohavi y colegas (KDD 2013) afirman directamente que el beneficio no es un buen OEC, ya que el teatro de corto plazo como subir precios puede elevarlo mientras lo perjudica más adelante. Dan el mismo veredicto sobre la cuota de mercado como criterio de corto plazo, notando que empeorar un buscador fuerza a la gente a hacer más búsquedas. Los ingresos entran en la decisión, en general como guardrail, no como la métrica que declara al ganador.
¿Puedo tener más de una métrica primaria?
Puedes tener una métrica compuesta, pero no puedes tener varias independientes y seguir llamando decisión al test. Leer cinco métricas al umbral del 5% da cerca del 22,6% de probabilidad de que al menos una cruce la línea por puro azar, y con doce métricas eso llega a cerca del 46%. En la práctica el fallo rara vez es formal: es que la métrica que por casualidad salió mejor se convierte en el titular después del hecho. Nombrar una métrica antes de lanzar es lo que hace que el resultado sea una decisión en vez de una búsqueda de oro.
¿Por qué la métrica proxy más sensible es una trampa?
Porque la sensibilidad y la proximidad al valor de negocio suelen tirar en direcciones opuestas. Dimensionar un test para un proxy superficial es mucho más barato: al 10% de efecto relativo, una tasa de clic en el CTA del 30% necesita cerca de 3.763 visitantes por variante, mientras que una tasa de suscripción pagada del 2,5% necesita cerca de 64.199, diecisiete veces más. Esa diferencia de coste es exactamente lo que empuja a los equipos hacia el proxy, y es también por lo que una victoria en el proxy nunca debe reportarse como victoria de negocio antes de que el vínculo entre los dos sea demostrado en tus propios datos.
¿Y si el test no tiene tráfico para la métrica real?
Entonces dilo explícitamente en vez de cambiar la métrica en silencio. Las opciones honestas son testear un cambio mayor para que un efecto mayor sea detectable, usar reducción de varianza para que la misma métrica necesite menos tráfico, aceptar un test más largo, o registrar el proxy como métrica de decisión declarando abiertamente que el resultado de negocio sigue sin probarse y agendando una lectura de seguimiento. Lo que rompe un programa no es elegir un proxy, es elegir uno en silencio y después reportarlo como si fuera el desenlace.
¿Cuál es la diferencia entre métrica primaria y guardrail?
La métrica primaria responde si el cambio es bueno, y es la única con permiso para declarar un ganador. El guardrail responde si el cambio es seguro, y tiene poder de veto: puede frenar una subida que la primaria ganó, pero nunca rescatar una que la primaria perdió. Las dos deben declararse antes del lanzamiento. Cuando un test perdido es salvado por una métrica que no era la primaria, el experimento dejó de ser un procedimiento de decisión y se volvió una búsqueda de algo positivo que reportar.