Estadística

Outliers en Test A/B: cuándo cortar la cola larga

Outliers de ingresos: un solo cliente puede inventar una victoria del 50 por ciento por usuario. Cómo usar capping sin cambiar un sesgo por otro.

Ilustración plana de una fila de barras bajas y uniformes con una barra mucho más alta en el centro, cortada por una línea horizontal a la altura de las demás

Las métricas de ingresos por usuario son fuertemente asimétricas, y la media es el resumen más frágil que existe para una distribución así. Un solo cliente, un outlier de ingresos, mueve la media de un brazo entero en decenas de por ciento sin que nada haya ocurrido con el producto. Esta guía cubre un ejemplo trabajado en el que un comprador corporativo inventa por sí solo una victoria del 50 por ciento, la regla práctica publicada por el equipo de Bing para saber cuántos usuarios necesita realmente tu métrica, por qué el suelo de potencia y el suelo de normalidad son dos suelos diferentes, cómo elegir un techo sin convertir el capping en manipulación, y lo que el capping definitivamente no arregla. Forma parte de nuestra guía completa de test A/B y dialoga directamente con métricas de ratio.

La media no aguanta tu distribución de ingresos

La tasa de conversión es una métrica bien portada: cada usuario aporta cero o uno, la varianza es limitada y el teorema central del límite llega rápido. Los ingresos por usuario no tienen ninguna de esas propiedades. La mayor parte de los usuarios aporta cero, la mayoría de los compradores aporta poco, y una fracción minúscula aporta valores cientos de veces mayores que la media.

El tamaño de eso no es una impresión. Kohavi, Deng, Longbotham y Xu relatan que, en un sitio de comercio, la asimetría de la métrica de compras por cliente superaba 10 y la de ingresos por cliente superaba 30. En Bing, los ingresos por usuario tenían un coeficiente de asimetría de 17,9. Para comparar, una distribución simétrica tiene asimetría cero, y la regla práctica de los autores solo se activa cuando el módulo de la asimetría supera 1.

Forma típica de una distribución de ingresos por usuarioHistograma en el que la primera barra, correspondiente a usuarios que gastaron cero, es de lejos la más alta, seguida de barras que caen rápidamente y de una cola muy larga y muy baja a la derecha. La media queda a la derecha de la mediana, arrastrada por la cola, y una línea vertical discontinua marca dónde se aplicaría un techo de valor, cortando solo la punta extrema de la cola.medianamediatechodefinido antesgasto por usuario, creciendo hacia la derechaLa barra naranja de la punta es un solo usuario. Él solo mueve la media más que los cientos de barras claras juntas.
La media queda siempre a la derecha de la mediana en una distribución así, y la distancia entre ambas es exactamente la palanca que la cola tiene sobre tu resultado.

Ejemplo trabajado: una compra que inventa un 50 por ciento

Un comercio B2B corre un test con 60.000 usuarios por brazo. El comportamiento real es idéntico en ambos lados: el cambio probado no afectó ninguna compra. Cada brazo acumula 240.000 en ingresos, dando una media honesta de 4,00 por usuario.

Solo que un usuario del brazo B es un comprador corporativo que hizo un pedido único de 120.000. No es fraude, no es robot, no es un bug: es una venta real que habría ocurrido de todas formas.

Brazo Usuarios Ingresos totales Ingresos por usuario
A, control 60.000 240.000 4,0000
B, tratamiento, con el pedido corporativo 60.000 360.000 6,0000
Diferencia medida 120.000 más 2,0000, más 50,00 por ciento

Una victoria del 50 por ciento en ingresos por usuario, producida por 1 usuario entre 120.000. Si el pedido hubiera caído en el brazo A, el mismo experimento habría producido una derrota del 33,3 por ciento. El resultado del test lo decidió un sorteo que nada tiene que ver con el producto.

Ahora el mismo experimento con un techo de 200 por usuario, definido antes y aplicado por igual en los dos brazos:

Brazo Ingresos totales limitados Ingresos por usuario limitados
A, control 240.000 4,0000
B, tratamiento 240.200 4,0033
Diferencia medida más 0,0033, más 0,08 por ciento

Apareció la lectura correcta: no hubo efecto. ¿Y qué pasó con los ingresos reales de la empresa? Nada. Los 120.000 entraron en caja. Lo que el techo hizo fue impedir que una venta que habría ocurrido de todas formas se acreditara al cambio de producto.

El mismo experimento leído con y sin techo de valorDos comparaciones lado a lado. A la izquierda, sin techo: la barra del control marca 4 por usuario y la del tratamiento marca 6, una diferencia del 50 por ciento. A la derecha, con techo de 200 por usuario: las dos barras quedan prácticamente a la misma altura, 4,0000 contra 4,0033, una diferencia del 0,08 por ciento. El comportamiento de los usuarios es idéntico en las dos lecturas.Sin techoCon techo de 200 por usuario4,0000control6,0000tratamientomás 50,00 por ciento4,0000control4,0033tratamientomás 0,08 por ciento
Ningún usuario se comportó de forma diferente entre las dos lecturas. La diferencia del 50 por ciento existía solo en la sensibilidad de la media a un valor extremo.

La regla de Kohavi: 355 por el cuadrado de la asimetría

Si la media tarda en volverse normal, el intervalo de confianza que imprime la calculadora no vale lo que promete. La pregunta práctica es: ¿cuántos usuarios bastan? Kohavi, Deng, Longbotham y Xu publicaron una regla práctica directa en KDD 2014, derivada del trabajo de Boos y Hughes-Oliver: el número mínimo de observaciones independientes e idénticamente distribuidas para que la media tenga distribución aproximadamente normal es de 355 por el cuadrado del coeficiente de asimetría, por variante. Recomiendan aplicar la regla siempre que el módulo de la asimetría supere 1.

La tabla que publicaron con métricas reales de Bing, junto al resultado que la fórmula devuelve al rehacerla a mano:

Métrica de Bing Asimetría (módulo) 355 por el cuadrado Muestra publicada Sensibilidad al 80 por ciento de potencia
Ingresos por usuario 17,9 113.746 114 mil 4,4 por ciento
Ingresos por usuario, limitados 5,2 9.599 9,7 mil 10,5 por ciento
Sesiones por usuario 3,6 4.601 4,70 mil 5,4 por ciento
Tiempo hasta el éxito 2,1 1.566 1,55 mil 12,3 por ciento

La cuenta rehecha reproduce la tabla publicada dentro del redondeo del coeficiente de asimetría, y el salto entre la primera y la segunda fila es el argumento entero del capping en un número: la misma métrica, limitada, necesita doce veces menos usuarios para que la media sea fiable.

Muestra mínima para la normalidad de la media por nivel de asimetríaBarras horizontales que comparan la muestra mínima por variante exigida por la regla de 355 por el cuadrado de la asimetría. Los ingresos por usuario con asimetría 17,9 exigen 113.746 usuarios; la misma métrica limitada, con asimetría 5,2, exige 9.599; las sesiones por usuario con asimetría 3,6 exigen 4.601; el tiempo hasta el éxito con asimetría 2,1 exige 1.566. La escala está dominada por la primera barra, que es justamente el punto.Usuarios por variante exigidos solo para que la media sea aproximadamente normalingresos por usuario113.746ingresos limitados9.599sesiones por usuario4.601tiempo hasta el éxito1.566La regla crece con el CUADRADO de la asimetría, así que duplicar la cola cuadruplica la muestra necesaria.
Valores calculados con la regla publicada por Kohavi, Deng, Longbotham y Xu, usando los coeficientes de asimetría de su tabla.

Dos suelos diferentes, y vale el mayor

Aquí está la confusión que hace que los equipos subestimen la duración de un test. La calculadora de tamaño de muestra responde a una pregunta de potencia: cuántos usuarios para detectar un efecto de tamaño X. La regla de los 355 responde a una pregunta de validez: cuántos usuarios para que la matemática del intervalo de confianza tenga sentido. Son suelos distintos e independientes, y necesitas superar los dos.

Ejecuta el suelo de potencia para tu métrica binaria de conversión:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Con una base del 5 por ciento y un efecto mínimo detectable del 10 por ciento relativo, al 95 por ciento de confianza y 80 por ciento de potencia, salen 31.234 usuarios por variante. Si tu test también sigue los ingresos por usuario con una asimetría cercana a 18, el suelo de normalidad de esa métrica por sí solo es de 113.746 por variante. El test que crees que dura dos semanas dura siete, y quien lo dicta es la métrica de ingresos, no la de conversión.

Suelo A qué responde Ejemplo Valor
Potencia consigo detectar el efecto que me interesa conversión del 5 por ciento, MDE del 10 por ciento relativo 31.234 por variante
Normalidad el intervalo de confianza significa lo que dice ingresos por usuario, asimetría 17,9 113.746 por variante
Decisión vale el mayor de los dos 113.746 por variante

Kohavi y colegas añaden una recomendación barata que ayuda gratis: garantizar que control y tratamiento tengan el mismo tamaño. Con reparto 50 contra 50 y distribuciones parecidas, la distribución de la diferencia queda aproximadamente simétrica, y la asimetría deja de ser el problema que era. Los repartos desiguales cuestan más de lo que parece, y comprobar eso es el asunto de reparto desigual de tráfico.

Cómo elegir un techo sin convertirlo en manipulación

La diferencia entre método y manipulación está entera en el procedimiento, no en el valor del techo.

  1. Elige el techo antes del experimento, a partir de datos históricos, nunca mirando el resultado. Kohavi y colegas relatan haber limitado los ingresos por usuario de Bing en 10 dólares por usuario por semana; la asimetría cayó de cerca de 18 a cerca de 5, y con el mismo tamaño de muestra la métrica limitada pasó a detectar un cambio un 30 por ciento menor que la métrica sin límite.
  2. Aplica exactamente el mismo techo a los dos brazos. Un techo asimétrico no es análisis, es elegir ganador.
  3. Fija una ventana junto al valor. Diez dólares por usuario por semana es diferente de diez dólares por usuario por experimento. Sin ventana declarada, el mismo techo se vuelve más restrictivo en tests largos.
  4. Reporta las dos métricas. La limitada decide, la bruta acompaña. Cuando ambas discrepan de forma grande y persistente, eso es información: significa que el efecto está concentrado en la cola, y la decisión de negocio puede ser distinta de la decisión estadística.
  5. Di a qué pregunta estás respondiendo. La métrica limitada habla del cliente típico. No habla de los ingresos totales de la empresa, y presentarla como si lo hiciera es la única forma real de mentir con capping.

Una alternativa al techo rígido, cuando la cola es el producto y no el ruido: en lugar de limitar, reduce la varianza por otros caminos. CUPED usa datos previos al experimento para quitar variación que no tiene nada que ver con el tratamiento y suele dar ganancia de sensibilidad sin tocar ningún valor observado.

Lo que el capping no arregla

El techo es una herramienta contra valores legítimos y extremos. No es, ni sustituye, la limpieza de datos sucios.

Un robot sigue necesitando tratarse como robot. Crook, Frasca, Kohavi y Longbotham hacen la distinción con cuidado en el artículo de KDD 2009: si el tráfico de robot se distribuye entre las variantes de forma no sesgada, añade ruido y reduce la potencia del experimento, pero no invalida el resultado; un robot que resetea la cookie o corre desde varias máquinas aparece como varios usuarios distintos y tampoco genera sesgo. El caso peligroso es el robot que actúa como un único usuario y genera tráfico de forma consistente hacia una sola variante, porque ahí puede hacer que esa variante sea estadísticamente mejor sin que ningún humano haya preferido nada. Relatan un caso en el portal MSN en el que robots aceptaban cookies y ejecutaban JavaScript, disparando eventos de clic a cerca de 100 por minuto durante 2,5 horas.

Un defecto de medición sigue siendo un defecto. Si la diferencia nace de cuánto del comportamiento se registró, y no del comportamiento, ningún techo lo resuelve. Ese es el asunto de sesgo de instrumentación, y el síntoma clásico es una métrica previa al disparo desbalanceada.

Un efecto concentrado en la cola no desaparece porque se haya cortado. Si tu cambio de producto realmente hace que los clientes grandes compren más, el techo va a esconder exactamente el efecto que interesa. Ahí la respuesta no es quitar el techo a mitad del test, es declarar antes una segunda métrica, por ejemplo ingresos entre grandes cuentas, y dimensionar el test para ella.

Checklist de outliers antes de mirar la media

  1. ¿Cuál es la asimetría de mi métrica principal? Si supera 1, la regla de los 355 se aplica y probablemente cambia tu estimación de duración.
  2. ¿Ya se eliminaron robots, tests internos y tráfico de monitorización? Eso viene antes de cualquier decisión de techo.
  3. ¿El techo se definió antes, con ventana, y vale para los dos brazos?
  4. ¿La métrica bruta y la limitada cuentan la misma historia? Una divergencia grande es información, no una molestia.
  5. ¿El reparto es 50 contra 50? Es la corrección más barata disponible para la asimetría.
  6. ¿Se respetó el mayor de los dos suelos? Potencia y normalidad son exigencias separadas.
  7. ¿Un único usuario puede cambiar la decisión? Si es así, no tienes un resultado, tienes un sorteo. Rehaz la media quitando el mayor valor de cada brazo y comprueba si la conclusión sobrevive.

Errores comunes

Hazlo automático en Donnu

El problema del outlier no es matemático, es de secuencia: casi siempre la decisión de techo se toma después de que alguien vio un número extraño, y en ese punto ya no es una decisión neutral.

En Donnu, la métrica de ingresos llega con la asimetría calculada y con el suelo de normalidad de la regla de 355 mostrado junto al suelo de potencia, para que la estimación de duración ya nazca por el mayor de los dos. El techo es un campo del diseño del experimento, rellenado antes de correr y registrado en el histórico, y el informe muestra siempre la métrica bruta y la limitada lado a lado, con aviso cuando ambas discrepan. Si quieres rehacer la cuenta de duración a mano, la calculadora de tamaño de muestra y la calculadora de duración aceptan tus números.

Referencias

Lee también: Métricas de ratio · Qué es CUPED · Sesgo de instrumentación · Métricas de guardrail · Calculadora de tamaño de muestra · Leia em português · Read in English

Preguntas frecuentes

¿Qué es el capping en un test A/B?
Es limitar el valor máximo que un único usuario puede aportar a una métrica antes de calcular la media. Kohavi, Deng, Longbotham y Xu relatan haber limitado los ingresos por usuario de Bing en 10 dólares por usuario por semana; la asimetría de la métrica cayó de cerca de 18 a cerca de 5 y, con el mismo tamaño de muestra, los ingresos por usuario limitados pasaron a detectar un cambio un 30 por ciento menor que la versión sin límite. El techo tiene que decidirse antes del experimento y aplicarse de forma idéntica a los dos brazos.
¿Cuántos usuarios necesito para una métrica de ingresos?
Más de lo que sugiere la cuenta de potencia. La regla práctica publicada por Kohavi, Deng, Longbotham y Xu en KDD 2014 es de 355 por el cuadrado del coeficiente de asimetría por variante, y recomiendan usarla siempre que el módulo de la asimetría supere 1. Para los ingresos por usuario de Bing, con asimetría de 17,9, eso da cerca de 114 mil usuarios por brazo solo para que la media sea aproximadamente normal, antes de cualquier consideración de potencia estadística.
¿El capping no es manipular el resultado?
Es manipulación cuando el techo se elige después de ver los datos, o se aplica a un solo brazo, o se cambia hasta que el número queda bonito. No es manipulación cuando el techo se define antes del experimento a partir de datos previos, se aplica igualmente a los dos brazos, se documenta y se reporta junto a la métrica sin límite. Lo que cambia de verdad es la pregunta: la métrica limitada responde sobre el cliente típico, no sobre los ingresos totales, y eso tiene que estar dicho.
¿Un robot estropea la media de ingresos del experimento?
Depende de cómo se distribuya. Crook, Frasca, Kohavi y Longbotham son precisos en ese punto: el tráfico de robot repartido entre las variantes de forma no sesgada añade ruido y reduce la potencia del experimento, pero no invalida el resultado; un robot que resetea la cookie o corre desde varias máquinas aparece como varios usuarios y tampoco genera sesgo. El caso peligroso es el robot que actúa como un único usuario y genera tráfico de forma consistente hacia una sola variante, porque ahí puede hacer que esa variante sea significativamente mejor sin que ningún humano haya preferido nada.
¿Cuál es la diferencia entre outlier y cola larga legítima?
Un outlier es el valor que no debería estar en el conjunto: robot, test interno, error de instrumentación, pedido duplicado. La cola larga legítima es el cliente corporativo real que compró 30 mil de verdad. El primero se elimina, y eliminarlo es la decisión correcta. El segundo no se elimina, porque son ingresos reales de la empresa; lo que se hace es limitar su influencia sobre la media, aceptando que la métrica limitada responde a una pregunta ligeramente diferente.