Outliers en Test A/B: cuándo cortar la cola larga
Outliers de ingresos: un solo cliente puede inventar una victoria del 50 por ciento por usuario. Cómo usar capping sin cambiar un sesgo por otro.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Las métricas de ingresos por usuario son fuertemente asimétricas, y la media es el resumen más frágil que existe para una distribución así. Un solo cliente, un outlier de ingresos, mueve la media de un brazo entero en decenas de por ciento sin que nada haya ocurrido con el producto. Esta guía cubre un ejemplo trabajado en el que un comprador corporativo inventa por sí solo una victoria del 50 por ciento, la regla práctica publicada por el equipo de Bing para saber cuántos usuarios necesita realmente tu métrica, por qué el suelo de potencia y el suelo de normalidad son dos suelos diferentes, cómo elegir un techo sin convertir el capping en manipulación, y lo que el capping definitivamente no arregla. Forma parte de nuestra guía completa de test A/B y dialoga directamente con métricas de ratio.
La media no aguanta tu distribución de ingresos
La tasa de conversión es una métrica bien portada: cada usuario aporta cero o uno, la varianza es limitada y el teorema central del límite llega rápido. Los ingresos por usuario no tienen ninguna de esas propiedades. La mayor parte de los usuarios aporta cero, la mayoría de los compradores aporta poco, y una fracción minúscula aporta valores cientos de veces mayores que la media.
El tamaño de eso no es una impresión. Kohavi, Deng, Longbotham y Xu relatan que, en un sitio de comercio, la asimetría de la métrica de compras por cliente superaba 10 y la de ingresos por cliente superaba 30. En Bing, los ingresos por usuario tenían un coeficiente de asimetría de 17,9. Para comparar, una distribución simétrica tiene asimetría cero, y la regla práctica de los autores solo se activa cuando el módulo de la asimetría supera 1.
Ejemplo trabajado: una compra que inventa un 50 por ciento
Un comercio B2B corre un test con 60.000 usuarios por brazo. El comportamiento real es idéntico en ambos lados: el cambio probado no afectó ninguna compra. Cada brazo acumula 240.000 en ingresos, dando una media honesta de 4,00 por usuario.
Solo que un usuario del brazo B es un comprador corporativo que hizo un pedido único de 120.000. No es fraude, no es robot, no es un bug: es una venta real que habría ocurrido de todas formas.
| Brazo | Usuarios | Ingresos totales | Ingresos por usuario |
|---|---|---|---|
| A, control | 60.000 | 240.000 | 4,0000 |
| B, tratamiento, con el pedido corporativo | 60.000 | 360.000 | 6,0000 |
| Diferencia medida | 120.000 | más 2,0000, más 50,00 por ciento |
Una victoria del 50 por ciento en ingresos por usuario, producida por 1 usuario entre 120.000. Si el pedido hubiera caído en el brazo A, el mismo experimento habría producido una derrota del 33,3 por ciento. El resultado del test lo decidió un sorteo que nada tiene que ver con el producto.
Ahora el mismo experimento con un techo de 200 por usuario, definido antes y aplicado por igual en los dos brazos:
| Brazo | Ingresos totales limitados | Ingresos por usuario limitados |
|---|---|---|
| A, control | 240.000 | 4,0000 |
| B, tratamiento | 240.200 | 4,0033 |
| Diferencia medida | más 0,0033, más 0,08 por ciento |
Apareció la lectura correcta: no hubo efecto. ¿Y qué pasó con los ingresos reales de la empresa? Nada. Los 120.000 entraron en caja. Lo que el techo hizo fue impedir que una venta que habría ocurrido de todas formas se acreditara al cambio de producto.
La regla de Kohavi: 355 por el cuadrado de la asimetría
Si la media tarda en volverse normal, el intervalo de confianza que imprime la calculadora no vale lo que promete. La pregunta práctica es: ¿cuántos usuarios bastan? Kohavi, Deng, Longbotham y Xu publicaron una regla práctica directa en KDD 2014, derivada del trabajo de Boos y Hughes-Oliver: el número mínimo de observaciones independientes e idénticamente distribuidas para que la media tenga distribución aproximadamente normal es de 355 por el cuadrado del coeficiente de asimetría, por variante. Recomiendan aplicar la regla siempre que el módulo de la asimetría supere 1.
La tabla que publicaron con métricas reales de Bing, junto al resultado que la fórmula devuelve al rehacerla a mano:
| Métrica de Bing | Asimetría (módulo) | 355 por el cuadrado | Muestra publicada | Sensibilidad al 80 por ciento de potencia |
|---|---|---|---|---|
| Ingresos por usuario | 17,9 | 113.746 | 114 mil | 4,4 por ciento |
| Ingresos por usuario, limitados | 5,2 | 9.599 | 9,7 mil | 10,5 por ciento |
| Sesiones por usuario | 3,6 | 4.601 | 4,70 mil | 5,4 por ciento |
| Tiempo hasta el éxito | 2,1 | 1.566 | 1,55 mil | 12,3 por ciento |
La cuenta rehecha reproduce la tabla publicada dentro del redondeo del coeficiente de asimetría, y el salto entre la primera y la segunda fila es el argumento entero del capping en un número: la misma métrica, limitada, necesita doce veces menos usuarios para que la media sea fiable.
Dos suelos diferentes, y vale el mayor
Aquí está la confusión que hace que los equipos subestimen la duración de un test. La calculadora de tamaño de muestra responde a una pregunta de potencia: cuántos usuarios para detectar un efecto de tamaño X. La regla de los 355 responde a una pregunta de validez: cuántos usuarios para que la matemática del intervalo de confianza tenga sentido. Son suelos distintos e independientes, y necesitas superar los dos.
Ejecuta el suelo de potencia para tu métrica binaria de conversión:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Con una base del 5 por ciento y un efecto mínimo detectable del 10 por ciento relativo, al 95 por ciento de confianza y 80 por ciento de potencia, salen 31.234 usuarios por variante. Si tu test también sigue los ingresos por usuario con una asimetría cercana a 18, el suelo de normalidad de esa métrica por sí solo es de 113.746 por variante. El test que crees que dura dos semanas dura siete, y quien lo dicta es la métrica de ingresos, no la de conversión.
| Suelo | A qué responde | Ejemplo | Valor |
|---|---|---|---|
| Potencia | consigo detectar el efecto que me interesa | conversión del 5 por ciento, MDE del 10 por ciento relativo | 31.234 por variante |
| Normalidad | el intervalo de confianza significa lo que dice | ingresos por usuario, asimetría 17,9 | 113.746 por variante |
| Decisión | vale el mayor de los dos | 113.746 por variante |
Kohavi y colegas añaden una recomendación barata que ayuda gratis: garantizar que control y tratamiento tengan el mismo tamaño. Con reparto 50 contra 50 y distribuciones parecidas, la distribución de la diferencia queda aproximadamente simétrica, y la asimetría deja de ser el problema que era. Los repartos desiguales cuestan más de lo que parece, y comprobar eso es el asunto de reparto desigual de tráfico.
Cómo elegir un techo sin convertirlo en manipulación
La diferencia entre método y manipulación está entera en el procedimiento, no en el valor del techo.
- Elige el techo antes del experimento, a partir de datos históricos, nunca mirando el resultado. Kohavi y colegas relatan haber limitado los ingresos por usuario de Bing en 10 dólares por usuario por semana; la asimetría cayó de cerca de 18 a cerca de 5, y con el mismo tamaño de muestra la métrica limitada pasó a detectar un cambio un 30 por ciento menor que la métrica sin límite.
- Aplica exactamente el mismo techo a los dos brazos. Un techo asimétrico no es análisis, es elegir ganador.
- Fija una ventana junto al valor. Diez dólares por usuario por semana es diferente de diez dólares por usuario por experimento. Sin ventana declarada, el mismo techo se vuelve más restrictivo en tests largos.
- Reporta las dos métricas. La limitada decide, la bruta acompaña. Cuando ambas discrepan de forma grande y persistente, eso es información: significa que el efecto está concentrado en la cola, y la decisión de negocio puede ser distinta de la decisión estadística.
- Di a qué pregunta estás respondiendo. La métrica limitada habla del cliente típico. No habla de los ingresos totales de la empresa, y presentarla como si lo hiciera es la única forma real de mentir con capping.
Una alternativa al techo rígido, cuando la cola es el producto y no el ruido: en lugar de limitar, reduce la varianza por otros caminos. CUPED usa datos previos al experimento para quitar variación que no tiene nada que ver con el tratamiento y suele dar ganancia de sensibilidad sin tocar ningún valor observado.
Lo que el capping no arregla
El techo es una herramienta contra valores legítimos y extremos. No es, ni sustituye, la limpieza de datos sucios.
Un robot sigue necesitando tratarse como robot. Crook, Frasca, Kohavi y Longbotham hacen la distinción con cuidado en el artículo de KDD 2009: si el tráfico de robot se distribuye entre las variantes de forma no sesgada, añade ruido y reduce la potencia del experimento, pero no invalida el resultado; un robot que resetea la cookie o corre desde varias máquinas aparece como varios usuarios distintos y tampoco genera sesgo. El caso peligroso es el robot que actúa como un único usuario y genera tráfico de forma consistente hacia una sola variante, porque ahí puede hacer que esa variante sea estadísticamente mejor sin que ningún humano haya preferido nada. Relatan un caso en el portal MSN en el que robots aceptaban cookies y ejecutaban JavaScript, disparando eventos de clic a cerca de 100 por minuto durante 2,5 horas.
Un defecto de medición sigue siendo un defecto. Si la diferencia nace de cuánto del comportamiento se registró, y no del comportamiento, ningún techo lo resuelve. Ese es el asunto de sesgo de instrumentación, y el síntoma clásico es una métrica previa al disparo desbalanceada.
Un efecto concentrado en la cola no desaparece porque se haya cortado. Si tu cambio de producto realmente hace que los clientes grandes compren más, el techo va a esconder exactamente el efecto que interesa. Ahí la respuesta no es quitar el techo a mitad del test, es declarar antes una segunda métrica, por ejemplo ingresos entre grandes cuentas, y dimensionar el test para ella.
Checklist de outliers antes de mirar la media
- ¿Cuál es la asimetría de mi métrica principal? Si supera 1, la regla de los 355 se aplica y probablemente cambia tu estimación de duración.
- ¿Ya se eliminaron robots, tests internos y tráfico de monitorización? Eso viene antes de cualquier decisión de techo.
- ¿El techo se definió antes, con ventana, y vale para los dos brazos?
- ¿La métrica bruta y la limitada cuentan la misma historia? Una divergencia grande es información, no una molestia.
- ¿El reparto es 50 contra 50? Es la corrección más barata disponible para la asimetría.
- ¿Se respetó el mayor de los dos suelos? Potencia y normalidad son exigencias separadas.
- ¿Un único usuario puede cambiar la decisión? Si es así, no tienes un resultado, tienes un sorteo. Rehaz la media quitando el mayor valor de cada brazo y comprueba si la conclusión sobrevive.
Errores comunes
- Eliminar el outlier después de ver el resultado. Es la forma más común de sesgo de análisis, y sobrevive porque parece higiene.
- Confundir al cliente grande con dato sucio. Es ingreso real. Limitar su influencia sobre una media es legítimo; borrarlo del informe de ingresos no lo es.
- Usar la media sin mirar la mediana y los percentiles altos. Ninguna distribución asimétrica se describe con un solo número.
- Aplicar el techo solo a la métrica que está perdiendo. Eso es elegir el resultado con un paso extra.
- Creer que una muestra grande lo resuelve todo. Lo resuelve, pero la regla de los 355 muestra que la cuenta crece con el cuadrado de la asimetría, y “grande” puede significar diez veces lo que el equipo imaginaba.
Hazlo automático en Donnu
El problema del outlier no es matemático, es de secuencia: casi siempre la decisión de techo se toma después de que alguien vio un número extraño, y en ese punto ya no es una decisión neutral.
En Donnu, la métrica de ingresos llega con la asimetría calculada y con el suelo de normalidad de la regla de 355 mostrado junto al suelo de potencia, para que la estimación de duración ya nazca por el mayor de los dos. El techo es un campo del diseño del experimento, rellenado antes de correr y registrado en el histórico, y el informe muestra siempre la métrica bruta y la limitada lado a lado, con aviso cuando ambas discrepan. Si quieres rehacer la cuenta de duración a mano, la calculadora de tamaño de muestra y la calculadora de duración aceptan tus números.
Referencias
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Fuente de la regla de 355 por el cuadrado del coeficiente de asimetría como número mínimo de observaciones para que la media sea aproximadamente normal, de la recomendación de aplicarla cuando el módulo de la asimetría supera 1, de la tabla con ingresos por usuario de Bing (asimetría 17,9, 114 mil usuarios, sensibilidad del 4,4 por ciento), ingresos limitados (5,2, 9,7 mil, 10,5 por ciento), sesiones por usuario (3,6, 4,70 mil, 5,4 por ciento) y tiempo hasta el éxito (2,1, 1,55 mil, 12,3 por ciento), del relato de que los ingresos por usuario se limitaron en 10 dólares por usuario por semana con caída de la asimetría de cerca de 18 a cerca de 5 y ganancia de sensibilidad equivalente a detectar un cambio un 30 por ciento menor con la misma muestra, de los valores de asimetría por encima de 10 y por encima de 30 en el sitio de comercio, de la derivación a partir de Boos y Hughes-Oliver, y de la recomendación de mantener control y tratamiento del mismo tamaño. exp-platform.com.
- Crook, T., Frasca, B., Kohavi, R. y Longbotham, R. Seven Pitfalls to Avoid when Running Controlled Experiments on the Web. KDD 2009. Fuente de la regla de que un robot distribuido de forma no sesgada añade ruido y reduce la potencia sin invalidar el resultado, de que un robot que resetea la cookie o corre desde varias máquinas no genera sesgo, de que un robot que actúa como usuario único y está consistentemente asignado a una variante crea un sesgo significativo, y del caso en el portal MSN con robots disparando eventos de clic a cerca de 100 por minuto durante 2,5 horas. exp-platform.com.
- Deng, A., Knoblich, U. y Lu, J. Applying the Delta Method in Metric Analytics: A Practical Guide with Novel Ideas. KDD 2018. Referencia sobre la estimación de varianza de métricas cuya unidad de análisis no coincide con la unidad de aleatorización, situación en la que la fragilidad de la media ante valores extremos se suma al problema del ratio. arxiv.org.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Capítulos sobre métricas, varianza y tratamiento de valores extremos en experimentos online. Material complementario en experimentguide.com.
Lee también: Métricas de ratio · Qué es CUPED · Sesgo de instrumentación · Métricas de guardrail · Calculadora de tamaño de muestra · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es el capping en un test A/B?
- Es limitar el valor máximo que un único usuario puede aportar a una métrica antes de calcular la media. Kohavi, Deng, Longbotham y Xu relatan haber limitado los ingresos por usuario de Bing en 10 dólares por usuario por semana; la asimetría de la métrica cayó de cerca de 18 a cerca de 5 y, con el mismo tamaño de muestra, los ingresos por usuario limitados pasaron a detectar un cambio un 30 por ciento menor que la versión sin límite. El techo tiene que decidirse antes del experimento y aplicarse de forma idéntica a los dos brazos.
- ¿Cuántos usuarios necesito para una métrica de ingresos?
- Más de lo que sugiere la cuenta de potencia. La regla práctica publicada por Kohavi, Deng, Longbotham y Xu en KDD 2014 es de 355 por el cuadrado del coeficiente de asimetría por variante, y recomiendan usarla siempre que el módulo de la asimetría supere 1. Para los ingresos por usuario de Bing, con asimetría de 17,9, eso da cerca de 114 mil usuarios por brazo solo para que la media sea aproximadamente normal, antes de cualquier consideración de potencia estadística.
- ¿El capping no es manipular el resultado?
- Es manipulación cuando el techo se elige después de ver los datos, o se aplica a un solo brazo, o se cambia hasta que el número queda bonito. No es manipulación cuando el techo se define antes del experimento a partir de datos previos, se aplica igualmente a los dos brazos, se documenta y se reporta junto a la métrica sin límite. Lo que cambia de verdad es la pregunta: la métrica limitada responde sobre el cliente típico, no sobre los ingresos totales, y eso tiene que estar dicho.
- ¿Un robot estropea la media de ingresos del experimento?
- Depende de cómo se distribuya. Crook, Frasca, Kohavi y Longbotham son precisos en ese punto: el tráfico de robot repartido entre las variantes de forma no sesgada añade ruido y reduce la potencia del experimento, pero no invalida el resultado; un robot que resetea la cookie o corre desde varias máquinas aparece como varios usuarios y tampoco genera sesgo. El caso peligroso es el robot que actúa como un único usuario y genera tráfico de forma consistente hacia una sola variante, porque ahí puede hacer que esa variante sea significativamente mejor sin que ningún humano haya preferido nada.
- ¿Cuál es la diferencia entre outlier y cola larga legítima?
- Un outlier es el valor que no debería estar en el conjunto: robot, test interno, error de instrumentación, pedido duplicado. La cola larga legítima es el cliente corporativo real que compró 30 mil de verdad. El primero se elimina, y eliminarlo es la decisión correcta. El segundo no se elimina, porque son ingresos reales de la empresa; lo que se hace es limitar su influencia sobre la media, aceptando que la métrica limitada responde a una pregunta ligeramente diferente.