Tamaño de Muestra para Métricas Continuas
El tamaño de muestra para métricas continuas sale del coeficiente de variación, no de la tasa de conversión. La fórmula y el error más común.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El tamaño de muestra para una métrica continua, como ingresos por usuario, no sale de la tasa de conversión: sale del coeficiente de variación de la propia métrica, que es la desviación estándar dividida por la media. Poner la tasa de conversión en una calculadora de dos proporciones y usar el resultado para dimensionar un test de ingresos es el error más silencioso del dimensionamiento, porque el número que sale parece razonable y está equivocado por un factor que no ves. Esta guía muestra la fórmula continua, el ejemplo trabajado en el que la misma tienda necesita 487.847 usuarios por variante para leer conversión y 761.217 para leer ingresos por usuario, la descomposición exacta que explica la diferencia, y lo que el capping y CUPED hacen con ese número. Forma parte de nuestra guía completa de test A/B y continúa el razonamiento de cuántos visitantes necesita un test A/B.
Dos familias de métrica, dos cálculos diferentes
Toda métrica de experimento cae en una de dos familias, y la familia decide qué fórmula de muestra vale.
Una métrica binaria da a cada usuario uno de dos valores: convirtió o no convirtió, hizo clic o no hizo clic, volvió o no volvió. La media de esa métrica es una proporción, y su varianza está determinada por la propia proporción: para una tasa p, la varianza por usuario vale p por 1 menos p. No existe grado de libertad aquí. Si conoces la tasa, conoces la varianza.
Una métrica continua da a cada usuario un número que puede tomar muchos valores: ingresos, número de sesiones, minutos de uso, artículos en el carrito, tiempo hasta la primera acción. La media de esa métrica es una media común, y su varianza es un parámetro independiente: dos tiendas con los mismos ingresos medios por usuario pueden tener dispersiones completamente diferentes, y por eso necesitan muestras completamente diferentes.
Esa es la raíz del problema. La calculadora de tamaño de muestra que todo el mundo usa, incluida la nuestra, resuelve el caso binario: informas la tasa base y el efecto mínimo que quieres detectar, y devuelve la N por variante. No puede resolver el caso continuo, porque falta la información esencial, que es la dispersión. Y como devuelve un número sin quejarse, ese número acaba usándose para justificar la duración de un test cuya métrica primaria son los ingresos.
La fórmula continua, en tres formas
El cálculo de muestra para comparar dos medias en una métrica continua, bajo aproximación normal y asignación igual entre los brazos, es el de siempre, solo con la varianza en el lugar correcto:
Forma 1, con la desviación estándar y el efecto absoluto. El número de observaciones por variante vale 2 veces el cuadrado de la suma de los dos valores críticos, multiplicado por la varianza y dividido por el cuadrado del efecto absoluto que quieres detectar. Para 95 por ciento de confianza bilateral y 80 por ciento de poder, los valores críticos son 1,959964 y 0,841621, cuya suma al cuadrado da 7,848880. Multiplicando por 2, la constante de la fórmula es 15,697759.
Forma 2, con el coeficiente de variación y el efecto relativo. Dividiendo arriba y abajo por la media, la fórmula queda mucho más útil en el día a día, porque casi todo el mundo piensa en efecto relativo (“quiero detectar un 3 por ciento más de ingresos”), no en efecto absoluto:
La N por variante es 15,697759 veces el cuadrado del coeficiente de variación, dividido por el cuadrado del efecto relativo. El coeficiente de variación es la desviación estándar dividida por la media. Esa es la única forma de la distribución que entra en el cálculo.
Forma 3, el caso binario como caso particular. Para una métrica binaria de tasa p, la desviación estándar por usuario es la raíz de p por 1 menos p, y la media es p, así que el coeficiente de variación vale la raíz de 1 menos p, dividida por p. Poniendo eso en la forma 2 recuperas exactamente el cálculo de proporciones. No son dos fórmulas, es una sola. Lo que cambia es de dónde viene el coeficiente de variación.
Ejemplo trabajado: la misma tienda, dos métricas
Una tienda tiene tasa de conversión del 3,5 por ciento y ticket medio de R$ 1.200, con desviación estándar del valor del pedido de R$ 900. Los ingresos medios por usuario son 0,035 por 1.200, es decir, R$ 42,00. El equipo quiere detectar una ganancia del 3 por ciento relativo y opera con 120.000 visitantes por semana en el flujo testeado.
Paso 1: la métrica de conversión, en la calculadora
Empieza por el cálculo que la calculadora resuelve. Tasa base 3,5 por ciento, efecto mínimo detectable 3 por ciento relativo, 95 por ciento de confianza, 80 por ciento de poder, bilateral.
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
El resultado es 487.847 usuarios por variante. Ese es el número correcto para la pregunta “este test cambia la tasa de conversión”.
Paso 2: el coeficiente de variación de los ingresos por usuario
Ahora la métrica de ingresos. Los ingresos de un usuario son el producto de dos cosas: si compró (una variable binaria con tasa p) y cuánto gastó cuando compró (una variable con media y desviación estándar propias). De esa descomposición sale una identidad exacta para el coeficiente de variación de los ingresos por usuario:
El cuadrado del coeficiente de variación de los ingresos por usuario es igual a 1 más el cuadrado del coeficiente de variación del valor del pedido, todo dividido por la tasa de conversión, menos 1.
Con los números de la tienda: el coeficiente de variación del valor del pedido es 900 dividido por 1.200, es decir, 0,75. Entonces el cuadrado del coeficiente de variación de los ingresos vale 1 más 0,5625, dividido por 0,035, menos 1, lo que da 43,6429. La raíz es 6,6063.
Vale la pena comprobarlo por otro camino, porque la identidad es fácil de equivocar. Sumando la varianza por el cálculo directo: los ingresos medios por usuario son R$ 42,00 y la varianza es 76.986,0, lo que da desviación estándar de R$ 277,4635 y coeficiente de variación de 277,4635 dividido por 42, es decir, 6,6063. Cuadra.
Paso 3: la muestra de la métrica de ingresos
Aplicando la forma 2 con coeficiente de variación 6,6063 y efecto relativo 0,03:
15,697759 por 43,6429, dividido por 0,0009, da 761.217 observaciones por variante.
| métrica | coeficiente de variación | N por variante | días a 120 mil por semana |
|---|---|---|---|
| tasa de conversión (calculadora) | 5,2509 | 487.847 | 57 |
| ingresos por usuario | 6,6063 | 761.217 | 89 |
| razón entre las dos | 1,2581 | 1,56 veces | +32 días |
Aproximación normal de dos proporciones, división igual entre las variaciones. La fecha usa tu zona horaria y recalcula en vivo.
Pega 761.217 en el campo de muestra por variante, 2 variantes y 120.000 de tráfico semanal para comprobar los 89 días. Después cambia a 487.847 y verás los 57. La diferencia entre planificar el test por la métrica equivocada y por la correcta, en esta tienda, es un mes entero de calendario.
Paso 4: por qué exactamente 1,56 veces
La razón no es arbitraria, y sale de la misma identidad. Para la métrica de conversión, el cuadrado del coeficiente de variación es 1 menos p, dividido por p, lo que aquí da 27,5714 (coeficiente de variación 5,2509). Para los ingresos, da 43,6429. La razón entre las muestras es la razón entre esos dos cuadrados: 43,6429 dividido por 27,5714, es decir, 1,5829.
Fíjate en el caso límite, que es la mejor forma de comprobar si la intuición es correcta: si todo el que compra gastara exactamente el mismo valor (coeficiente de variación del pedido igual a cero), el cuadrado del coeficiente de variación de los ingresos caería a 1 dividido por 0,035, menos 1, es decir, 27,5714, exactamente el valor de la conversión. Tiene sentido: sin dispersión en el valor del pedido, los ingresos por usuario son la conversión multiplicada por una constante, y multiplicar por una constante no cambia ningún coeficiente de variación. Todo el excedente de muestra viene de la dispersión del valor del pedido, y de nada más.
| desviación estándar del valor del pedido | CV del pedido | CV de ingresos/usuario | N por variante | días |
|---|---|---|---|---|
| R$ 0 (todos gastan igual) | 0,000 | 5,2509 | 480.900 | 57 |
| R$ 300 | 0,250 | 5,4182 | 512.046 | 60 |
| R$ 600 | 0,500 | 5,8919 | 605.486 | 71 |
| R$ 900 (el caso de la tienda) | 0,750 | 6,6063 | 761.217 | 89 |
| R$ 1.500 | 1,250 | 8,4979 | 1.259.559 | 147 |
| R$ 2.400 | 2,000 | 11,9104 | 2.474.266 | 289 |
Una nota sobre la diferencia del 1,4 por ciento
La fila de R$ 0 de la tabla anterior da 480.900, y la calculadora dio 487.847 para el mismo escenario. La diferencia del 1,44 por ciento no es un error: la fórmula continua usa la varianza bajo la hipótesis alternativa en los dos brazos, mientras que la calculadora usa la forma agrupada, que estima el error estándar bajo la hipótesis nula con la media de las dos tasas. La forma agrupada es ligeramente más conservadora y es la que adopta la literatura de dos proporciones. La diferencia crece con el efecto: es del 0,96 por ciento con efecto del 2 por ciento y del 4,81 por ciento con efecto del 10 por ciento. En planificación esto no cambia ninguna decisión, pero conviene saber de dónde viene antes de acusar a una de las dos de estar equivocada.
Cuántos usuarios necesita la media solo para comportarse
Existe un segundo límite inferior, independiente del cálculo de poder, y se ignora con frecuencia: la fórmula anterior asume que la media de la métrica es aproximadamente normal. Para una métrica muy asimétrica, eso exige bastantes más usuarios que el “n mayor que 30” de los libros introductorios.
Kohavi, Deng, Longbotham y Xu proponen, en la séptima regla práctica del artículo de KDD 2014, el mínimo de 355 veces el cuadrado del coeficiente de asimetría por variante, recomendado cuando el módulo de la asimetría supera 1. Publican la tabla de métricas reales de Bing, y reproduce la regla punto por punto:
| métrica de Bing | módulo de la asimetría | muestra mínima reportada | 355 por el cuadrado | sensibilidad al 80% de poder |
|---|---|---|---|---|
| Ingresos por usuario | 17,9 | 114 mil | 113.746 | 4,4% |
| Ingresos por usuario (limitado) | 5,2 | 9,7 mil | 9.599 | 10,5% |
| Sesiones por usuario | 3,6 | 4,70 mil | 4.601 | 5,4% |
| Tiempo hasta el éxito | 2,1 | 1,55 mil | 1.566 | 12,3% |
Los autores reportan además que, en un sitio de comercio, la asimetría de compras por cliente superaba 10 y la de ingresos por cliente superaba 30. Y hacen una advertencia honesta que casi nunca se cita junto con la regla: si el control y el tratamiento tienen la misma distribución y el reparto es igual, la distribución de la diferencia queda aproximadamente simétrica (perfectamente simétrica bajo la hipótesis nula), y entonces la regla no da un límite inferior útil, porque fue construida para el módulo de la asimetría por encima de 1. En ese caso, quien manda es el cálculo de poder de las secciones anteriores. La regla de 355 es la alarma para el caso en que lees cada brazo por separado, o en que los brazos no están dimensionados por igual.
Tres formas de bajar el número (y lo que cuesta cada una)
Si el número que salió es demasiado grande para tu tráfico, existen tres palancas legítimas. Todas tocan el coeficiente de variación, porque es él quien manda.
1. Limitar la cola (capping)
Cortar valores por encima de un techo baja la desviación estándar mucho más de lo que baja la media, y es el cociente entre las dos lo que entra en el cálculo. Kohavi, Deng, Longbotham y Xu reportan que limitar ingresos por usuario a 10 dólares por usuario por semana en Bing bajó la asimetría de 18 a 5,3, y que para la misma muestra los ingresos limitados detectan un cambio 30 por ciento menor que los ingresos brutos.
El costo es conceptual, no estadístico: la métrica limitada responde a otra pregunta. Dejas de medir ingresos y pasas a medir ingresos hasta el techo. Si el efecto que estás testeando actúa justamente en la cola (upsell de un artículo caro, por ejemplo), el capping borra exactamente lo que querías ver. El tratamiento completo de esa decisión está en outliers y capping en test A/B.
2. Reducir varianza con dato pre-experimento (CUPED)
Deng, Xu, Kohavi y Walker muestran que usar una covariable medida antes del experimento reduce la varianza por un factor igual a 1 menos el cuadrado de la correlación entre la métrica y la covariable. Reportan una reducción de cerca del 50 por ciento en la varianza en Bing, lo que describen como equivalente a duplicar el tráfico o cortar la duración por la mitad. Reportan también que la mejor covariable aislada es la propia métrica medida en el periodo pre-experimento (más del 45 por ciento de reducción en su caso, contra 9 a 10 por ciento usando solo el día de entrada, y ganancia extra de apenas 2 a 3 por ciento al combinar ambas).
La advertencia más importante de este artículo viene del mismo estudio, y cae justamente sobre la métrica de la que estamos tratando. Los autores reportan que CUPED funcionó bien en clics por usuario y visitas por usuario, y que la excepción notable fue ingresos por usuario, donde la reducción de varianza quedó por debajo del 5 por ciento, porque la correlación de los ingresos por usuario entre el periodo pre-experimento y el periodo del experimento es baja. Tiene sentido: quien gastó mucho el mes pasado no es, en general, quien va a gastar mucho este mes. La tabla siguiente muestra lo que pasaría con la muestra de la tienda en cada nivel de correlación, y sirve para dimensionar la ganancia potencial. No es una previsión: para ingresos por usuario, la correlación observada en el estudio de Bing quedaría en la primera fila de la tabla o por debajo de ella. Mide la correlación en tu propia base antes de contar con cualquiera de estas filas.
Aplicado al ejemplo de la tienda, con la muestra de 761.217:
| correlación con la covariable | factor de varianza | N por variante | días |
|---|---|---|---|
| 0,5 | 0,750 | 570.913 | 67 |
| 0,6 | 0,640 | 487.179 | 57 |
| 0,7 | 0,510 | 388.221 | 46 |
| 0,8 | 0,360 | 274.039 | 32 |
El costo es de ingeniería: exige guardar dato del periodo anterior por usuario y aplicar el ajuste en el análisis. Y exige que el usuario exista antes del experimento, lo que no vale para un visitante nuevo. Detalles en qué es CUPED.
3. Cambiar la métrica primaria
La palanca más barata y la menos usada. Si ingresos por usuario exige 89 días y tasa de conversión exige 57, y si la hipótesis del test es sobre fricción en el checkout (que actúa en la conversión, no en el ticket), la métrica primaria honesta es la conversión, con los ingresos como métrica secundaria monitoreada. Esto no es elegir la métrica que da el resultado que quieres: es elegir la métrica en la que el mecanismo que estás testeando de hecho actúa. La discusión de cómo hacer esa elección sin engañarse está en métrica primaria y OEC.
Las métricas de ratio son un tercer caso
Existe una familia que parece continua y no es ni una cosa ni la otra: métricas en las que el denominador no es el usuario aleatorizado. Clics por página, artículos por sesión, ingresos por pedido. En esas, cada usuario contribuye con varias observaciones correlacionadas, y el error estándar calculado como si fueran independientes sale menor que el verdadero. El cálculo de muestra de este artículo sigue valiendo, pero el coeficiente de variación tiene que ser el de la métrica agregada por unidad aleatorizada, no el de la observación individual. El tratamiento correcto es el método delta, cubierto en métricas de ratio en tests A/B, y la elección de unidad que genera el problema está en unidad de aleatorización en test A/B.
Cómo estimar el coeficiente de variación antes del test
Todo este cálculo depende de un número que necesitas tener antes de empezar: el coeficiente de variación de la métrica en tu propio dato. No es un benchmark de mercado, es una propiedad de tu base. Tres formas de obtenerlo, en orden de preferencia:
- Calcularlo directamente en el histórico. Toma las últimas 4 a 8 semanas, agrega la métrica por usuario en la misma ventana que usará el test, y calcula desviación estándar dividida por media. Es el camino correcto y lleva minutos en cualquier herramienta de datos.
- Reconstruirlo por la descomposición. Si solo tienes tasa de conversión y estadísticas del valor del pedido, usa la identidad del paso 2: 1 más el cuadrado del coeficiente de variación del pedido, dividido por la tasa, menos 1. Necesita la desviación estándar del ticket, no solo la media.
- Ejecutar primero un test A/A. Un test A/A de dos semanas devuelve la dispersión observada gratis, junto con la validación de que la aleatorización es correcta.
Lo que no funciona es adoptar un coeficiente de variación “típico”. La dispersión de ingresos por usuario de una tienda de artículos de R$ 30 y la de una tienda de muebles no tienen ninguna relación, y el número entra en el cálculo al cuadrado.
Checklist antes de definir el tamaño de muestra
- ¿Cuál es la métrica primaria, binaria o continua? Si es continua, la calculadora de proporciones no responde.
- ¿Tienes su desviación estándar en tu propio dato? Sin eso, el número que salga es una conjetura con apariencia de cálculo.
- ¿La ventana de agregación de la estimación es la misma del test? Coeficiente de variación de ingresos a 7 días y a 28 días son números distintos.
- ¿La asimetría supera 1? Si la supera, comprueba la regla de 355 por su cuadrado, recordando la advertencia del reparto igual.
- ¿El denominador de la métrica es la unidad aleatorizada? Si no lo es, es una métrica de ratio y necesita método delta.
- ¿Calculaste los dos números, conversión e ingresos? El test dura el mayor de los dos, y conviene saberlo antes y no después.
- ¿Se consideraron las palancas de reducción en el orden correcto? Cambiar la métrica primaria es más barato que el capping, que es más barato que implementar CUPED.
Errores comunes
- Usar la tasa de conversión para dimensionar un test de ingresos. Es el error central de este artículo. El número sale plausible y no tiene relación con la pregunta.
- Estimar el coeficiente de variación sobre los compradores en vez de sobre todos los usuarios. Los ingresos por usuario incluyen los ceros. Ignorarlos baja artificialmente la dispersión y subdimensiona el test.
- Comparar coeficientes de variación de ventanas distintas. Agregar por 28 días en vez de 7 cambia media y desviación estándar, y no en la misma proporción.
- Aplicar capping después de ver el resultado. Elegir el techo mirando qué valor deja el valor p bonito es pesca de resultado, no reducción de varianza. El techo entra en el plan de análisis, antes.
- Tratar la regla de 355 como si sustituyera el cálculo de poder. Son dos límites distintos y el test tiene que pasar los dos.
- Asumir que CUPED siempre entrega un 50 por ciento. El factor depende de la correlación medida en tu base, y una correlación de 0,5 entrega un 25 por ciento, no un 50. En el estudio original los ingresos por usuario fueron la excepción notable, con menos del 5 por ciento de reducción.
Hazlo automático en Donnu
El error caro aquí no es equivocar la fórmula, es no darse cuenta nunca de que existían dos. Una métrica de ingresos entra en el informe al lado de una métrica de conversión, con la misma cara, el mismo intervalo y el mismo color, y nada en la pantalla dice que una de ellas estaba dimensionada y la otra no.
En Donnu, cada métrica declarada en un experimento lleva su familia, y el cálculo de poder se hace por métrica: una métrica continua exige la dispersión estimada de tu propia base, y el informe muestra el poder efectivo que alcanzó, no el poder que alcanzó la métrica de conversión. Si quieres rehacer cualquier cálculo a mano, la calculadora de tamaño de muestra resuelve el caso binario y la calculadora de duración traduce cualquier N en días de calendario.
Referencias
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Fuente de la séptima regla (“Have Enough Users”), del mínimo de 355 veces el cuadrado del coeficiente de asimetría por variante, de la recomendación de aplicarla cuando el módulo de la asimetría supera 1, de la tabla de métricas de Bing (ingresos por usuario con asimetría 17,9 y 114 mil de muestra al 4,4 por ciento de sensibilidad; ingresos limitados 5,2 y 9,7 mil al 10,5 por ciento; sesiones por usuario 3,6 y 4,70 mil al 5,4 por ciento; tiempo hasta el éxito 2,1 y 1,55 mil al 12,3 por ciento), del reporte de asimetría por encima de 10 para compras por cliente y por encima de 30 para ingresos por cliente en un sitio de comercio, del efecto del límite de 10 dólares por usuario por semana bajando la asimetría de 18 a 5,3 y permitiendo detectar un cambio 30 por ciento menor con la misma muestra, y de la advertencia de que con reparto igual la distribución de la diferencia queda aproximadamente simétrica y la regla deja de dar un límite inferior útil. exp-platform.com.
- Deng, A., Xu, Y., Kohavi, R. y Walker, T. Improving the Sensitivity of Online Controlled Experiments by Utilizing Pre-Experiment Data. WSDM 2013. Fuente del factor de reducción de varianza igual a 1 menos el cuadrado de la correlación, del resultado de cerca del 50 por ciento de reducción de varianza en Bing descrito como equivalente a duplicar el tráfico o cortar la duración por la mitad, y del resultado empírico de que la propia métrica en el periodo pre-experimento es la mejor covariable aislada (más del 45 por ciento de reducción, contra 9 a 10 por ciento con el día de entrada, con ganancia extra de apenas 2 a 3 por ciento al combinar ambas), y de la excepción notable reportada por ellos: en ingresos por usuario la reducción de varianza quedó por debajo del 5 por ciento, a causa de la baja correlación de la métrica entre el periodo pre-experimento y el periodo del experimento. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Fuente de la relación cuadrática entre sensibilidad y tráfico (aumentar la sensibilidad por un factor de 10, del 5 por ciento al 0,5 por ciento, exige 100 veces más usuarios) y de la orientación general de al menos miles de usuarios activos. exp-platform.com.
- Deng, A., Knoblich, U. y Lu, J. Applying the Delta Method in Metric Analytics: A Practical Guide with Novel Ideas. KDD 2018. Referencia sobre métricas cuyo denominador no es la unidad de aleatorización y sobre el tratamiento correcto de la varianza en ese caso. arxiv.org/abs/1803.06336.
Lee también: Cuántos visitantes necesita un test A/B · Outliers y capping en test A/B · Qué es CUPED · Métricas de ratio en tests A/B · Efecto mínimo detectable · Calculadora de tamaño de muestra · Leia em português
Preguntas frecuentes
- ¿Puedo usar la calculadora de tamaño de muestra para medir ingresos por usuario?
- No directamente. La calculadora de tamaño de muestra estándar resuelve la comparación de dos proporciones, es decir, una métrica binaria del tipo "convirtió o no". Ingresos por usuario es una métrica continua, y su varianza no sale de la tasa de conversión: sale del coeficiente de variación de los propios ingresos. Usa la calculadora para dimensionar la métrica de conversión y la fórmula continua de este artículo para dimensionar la métrica de ingresos. Si el test tiene las dos, el tamaño del test es el mayor de los dos números.
- ¿Qué es el coeficiente de variación y por qué decide el tamaño de la muestra?
- El coeficiente de variación es la desviación estándar dividida por la media. Mide la dispersión relativa de la métrica, y es la única característica de la distribución que entra en el cálculo de muestra cuando el efecto se expresa en términos relativos. La fórmula es n por variante igual a 2 veces el cuadrado de la suma de los dos valores críticos, multiplicado por el cuadrado del coeficiente de variación y dividido por el cuadrado del efecto relativo. Duplicar el coeficiente de variación cuadruplica la muestra necesaria.
- ¿Por qué ingresos por usuario exige más muestra que tasa de conversión en el mismo test?
- Porque los ingresos por usuario acumulan dos fuentes de variación: si la persona compró (que es la variación de la conversión) y cuánto gastó cuando compró (que la conversión no tiene). El cuadrado del coeficiente de variación de los ingresos por usuario vale 1 más el cuadrado del coeficiente de variación del valor del pedido, todo dividido por la tasa de conversión, menos 1. Con conversión del 3,5 por ciento y valor del pedido con coeficiente de variación 0,75, eso da 1,583 veces la muestra exigida por la tasa de conversión para el mismo efecto relativo.
- ¿Cuántos usuarios necesito para que la media sea aproximadamente normal?
- Kohavi, Deng, Longbotham y Xu proponen la regla de 355 veces el cuadrado del coeficiente de asimetría por variante, recomendada cuando el módulo de la asimetría supera 1. Reportan que ingresos por usuario en Bing tenía asimetría 17,9 y por lo tanto exigía 114 mil usuarios solo para que la media se comportara como normal. Los propios autores advierten que, con reparto igual entre control y tratamiento, la distribución de la diferencia queda aproximadamente simétrica y esa regla deja de dar un límite inferior útil; en ese caso quien manda es el cálculo de poder.
- ¿Cortar outliers reduce el tamaño de muestra necesario?
- Lo reduce, porque cortar la cola baja la desviación estándar más de lo que baja la media, y es el cociente entre las dos lo que entra en el cálculo. Kohavi, Deng, Longbotham y Xu reportan que, al limitar ingresos por usuario a 10 dólares por usuario por semana en Bing, la asimetría cayó de 18 a 5,3 y la misma muestra pasó a detectar un cambio 30 por ciento menor. El precio es que la métrica limitada responde a otra pregunta: dejas de medir los ingresos totales y pasas a medir los ingresos hasta el techo que elegiste.
- ¿CUPED ayuda en el dimensionamiento de una métrica continua?
- Ayuda, y es donde la ganancia es mayor. Deng, Xu, Kohavi y Walker muestran que la varianza cae por un factor igual a 1 menos el cuadrado de la correlación entre la métrica y la covariable pre-experimento, y reportan una reducción de cerca del 50 por ciento en la varianza en Bing, equivalente a duplicar el tráfico o cortar la duración por la mitad. Como la muestra es proporcional a la varianza, una correlación de 0,7 corta la muestra necesaria en un 51 por ciento. La advertencia importante viene del mismo estudio: su excepción notable fue justamente ingresos por usuario, donde la reducción quedó por debajo del 5 por ciento a causa de la baja correlación de los ingresos entre los dos periodos. Mide la correlación en tu propia base antes de contar con la ganancia.