Estadística

Tamaño de Muestra para Métricas Continuas

El tamaño de muestra para métricas continuas sale del coeficiente de variación, no de la tasa de conversión. La fórmula y el error más común.

Ilustración plana de dos bandejas poco profundas una al lado de la otra, una con muchos círculos pequeños e iguales en hileras regulares y otra con pocos círculos grandes entre muchos diminutos, en verde profundo y verde menta

El tamaño de muestra para una métrica continua, como ingresos por usuario, no sale de la tasa de conversión: sale del coeficiente de variación de la propia métrica, que es la desviación estándar dividida por la media. Poner la tasa de conversión en una calculadora de dos proporciones y usar el resultado para dimensionar un test de ingresos es el error más silencioso del dimensionamiento, porque el número que sale parece razonable y está equivocado por un factor que no ves. Esta guía muestra la fórmula continua, el ejemplo trabajado en el que la misma tienda necesita 487.847 usuarios por variante para leer conversión y 761.217 para leer ingresos por usuario, la descomposición exacta que explica la diferencia, y lo que el capping y CUPED hacen con ese número. Forma parte de nuestra guía completa de test A/B y continúa el razonamiento de cuántos visitantes necesita un test A/B.

Dos familias de métrica, dos cálculos diferentes

Toda métrica de experimento cae en una de dos familias, y la familia decide qué fórmula de muestra vale.

Una métrica binaria da a cada usuario uno de dos valores: convirtió o no convirtió, hizo clic o no hizo clic, volvió o no volvió. La media de esa métrica es una proporción, y su varianza está determinada por la propia proporción: para una tasa p, la varianza por usuario vale p por 1 menos p. No existe grado de libertad aquí. Si conoces la tasa, conoces la varianza.

Una métrica continua da a cada usuario un número que puede tomar muchos valores: ingresos, número de sesiones, minutos de uso, artículos en el carrito, tiempo hasta la primera acción. La media de esa métrica es una media común, y su varianza es un parámetro independiente: dos tiendas con los mismos ingresos medios por usuario pueden tener dispersiones completamente diferentes, y por eso necesitan muestras completamente diferentes.

Esa es la raíz del problema. La calculadora de tamaño de muestra que todo el mundo usa, incluida la nuestra, resuelve el caso binario: informas la tasa base y el efecto mínimo que quieres detectar, y devuelve la N por variante. No puede resolver el caso continuo, porque falta la información esencial, que es la dispersión. Y como devuelve un número sin quejarse, ese número acaba usándose para justificar la duración de un test cuya métrica primaria son los ingresos.

Métrica binaria y métrica continua: dónde nace la varianzaDos columnas comparadas. A la izquierda, la métrica binaria: cada usuario vale cero o uno, y la varianza está determinada por la tasa media, sin parámetro libre. A la derecha, la métrica continua: cada usuario vale un número cualquiera, la mayoría cerca de cero y algunos muy grandes, y la varianza es un parámetro propio que no sale de la media. Debajo de cada columna, la información que la fórmula de muestra exige: solo la tasa en el caso binario, tasa y desviación estándar en el caso continuo.El cálculo de muestra cambia porque la varianza nace en lugares distintosmétrica binariaCada usuario vale 0 o 1. La varianza por usuario es p por 1 menos p.La tasa determina la varianza. No sobra parámetro libre.métrica continuaCada usuario vale un número. La mayoría cerca de cero, algunos muy por encima.La media no determina la varianza. Falta la desviación estándar.la fórmula exigetasa baseefecto mínimo detectablela fórmula exigemedia y desviación estándar (o el cociente entre ambas)efecto mínimo detectable
En el caso binario la tasa lleva la varianza consigo. En el caso continuo la dispersión es información nueva, y es justamente la que nadie tiene a mano a la hora de planificar el test.

La fórmula continua, en tres formas

El cálculo de muestra para comparar dos medias en una métrica continua, bajo aproximación normal y asignación igual entre los brazos, es el de siempre, solo con la varianza en el lugar correcto:

Forma 1, con la desviación estándar y el efecto absoluto. El número de observaciones por variante vale 2 veces el cuadrado de la suma de los dos valores críticos, multiplicado por la varianza y dividido por el cuadrado del efecto absoluto que quieres detectar. Para 95 por ciento de confianza bilateral y 80 por ciento de poder, los valores críticos son 1,959964 y 0,841621, cuya suma al cuadrado da 7,848880. Multiplicando por 2, la constante de la fórmula es 15,697759.

Forma 2, con el coeficiente de variación y el efecto relativo. Dividiendo arriba y abajo por la media, la fórmula queda mucho más útil en el día a día, porque casi todo el mundo piensa en efecto relativo (“quiero detectar un 3 por ciento más de ingresos”), no en efecto absoluto:

La N por variante es 15,697759 veces el cuadrado del coeficiente de variación, dividido por el cuadrado del efecto relativo. El coeficiente de variación es la desviación estándar dividida por la media. Esa es la única forma de la distribución que entra en el cálculo.

Forma 3, el caso binario como caso particular. Para una métrica binaria de tasa p, la desviación estándar por usuario es la raíz de p por 1 menos p, y la media es p, así que el coeficiente de variación vale la raíz de 1 menos p, dividida por p. Poniendo eso en la forma 2 recuperas exactamente el cálculo de proporciones. No son dos fórmulas, es una sola. Lo que cambia es de dónde viene el coeficiente de variación.

Muestra por variante en función del coeficiente de variaciónCurva creciente que muestra cuántas observaciones por variante son necesarias para detectar un efecto relativo del 3 por ciento, en función del coeficiente de variación de la métrica. La curva es cuadrática: parte de cerca de 17 mil observaciones con coeficiente de variación 1, pasa por 70 mil en 2, 157 mil en 3, 279 mil en 4, 436 mil en 5 y 855 mil en 7. Dos marcadores destacan los dos casos del ejemplo trabajado: la tasa de conversión, con coeficiente de variación 5,25 y 481 mil observaciones, y los ingresos por usuario, con coeficiente de variación 6,61 y 761 mil observaciones.Duplicar la dispersión relativa cuadruplica la muestra, siempreEfecto relativo fijo en 3 por ciento, 95 por ciento de confianza bilateral, 80 por ciento de poder.tasa de conversión: CV 5,25 y 481 mil por varianteingresos por usuario: CV 6,61 y 761 mil por varianteCV 1CV 2CV 3CV 4CV 5CV 6CV 717 mil70 mil157 mil279 mil628 milmuestraporvariantecoeficiente de variación de la métrica (desviación estándar dividida por la media)
La curva es cuadrática por construcción: el coeficiente de variación entra elevado al cuadrado. Por eso una métrica de cola larga cuesta un orden de magnitud más de tráfico de lo que sugiere la intuición.

Ejemplo trabajado: la misma tienda, dos métricas

Una tienda tiene tasa de conversión del 3,5 por ciento y ticket medio de R$ 1.200, con desviación estándar del valor del pedido de R$ 900. Los ingresos medios por usuario son 0,035 por 1.200, es decir, R$ 42,00. El equipo quiere detectar una ganancia del 3 por ciento relativo y opera con 120.000 visitantes por semana en el flujo testeado.

Paso 1: la métrica de conversión, en la calculadora

Empieza por el cálculo que la calculadora resuelve. Tasa base 3,5 por ciento, efecto mínimo detectable 3 por ciento relativo, 95 por ciento de confianza, 80 por ciento de poder, bilateral.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

El resultado es 487.847 usuarios por variante. Ese es el número correcto para la pregunta “este test cambia la tasa de conversión”.

Paso 2: el coeficiente de variación de los ingresos por usuario

Ahora la métrica de ingresos. Los ingresos de un usuario son el producto de dos cosas: si compró (una variable binaria con tasa p) y cuánto gastó cuando compró (una variable con media y desviación estándar propias). De esa descomposición sale una identidad exacta para el coeficiente de variación de los ingresos por usuario:

El cuadrado del coeficiente de variación de los ingresos por usuario es igual a 1 más el cuadrado del coeficiente de variación del valor del pedido, todo dividido por la tasa de conversión, menos 1.

Con los números de la tienda: el coeficiente de variación del valor del pedido es 900 dividido por 1.200, es decir, 0,75. Entonces el cuadrado del coeficiente de variación de los ingresos vale 1 más 0,5625, dividido por 0,035, menos 1, lo que da 43,6429. La raíz es 6,6063.

Vale la pena comprobarlo por otro camino, porque la identidad es fácil de equivocar. Sumando la varianza por el cálculo directo: los ingresos medios por usuario son R$ 42,00 y la varianza es 76.986,0, lo que da desviación estándar de R$ 277,4635 y coeficiente de variación de 277,4635 dividido por 42, es decir, 6,6063. Cuadra.

Paso 3: la muestra de la métrica de ingresos

Aplicando la forma 2 con coeficiente de variación 6,6063 y efecto relativo 0,03:

15,697759 por 43,6429, dividido por 0,0009, da 761.217 observaciones por variante.

métrica coeficiente de variación N por variante días a 120 mil por semana
tasa de conversión (calculadora) 5,2509 487.847 57
ingresos por usuario 6,6063 761.217 89
razón entre las dos 1,2581 1,56 veces +32 días
Calculadora de duración de test A/B
-Duración estimada
Visitantes en total-
Término previsto-

Aproximación normal de dos proporciones, división igual entre las variaciones. La fecha usa tu zona horaria y recalcula en vivo.

Pega 761.217 en el campo de muestra por variante, 2 variantes y 120.000 de tráfico semanal para comprobar los 89 días. Después cambia a 487.847 y verás los 57. La diferencia entre planificar el test por la métrica equivocada y por la correcta, en esta tienda, es un mes entero de calendario.

Paso 4: por qué exactamente 1,56 veces

La razón no es arbitraria, y sale de la misma identidad. Para la métrica de conversión, el cuadrado del coeficiente de variación es 1 menos p, dividido por p, lo que aquí da 27,5714 (coeficiente de variación 5,2509). Para los ingresos, da 43,6429. La razón entre las muestras es la razón entre esos dos cuadrados: 43,6429 dividido por 27,5714, es decir, 1,5829.

Fíjate en el caso límite, que es la mejor forma de comprobar si la intuición es correcta: si todo el que compra gastara exactamente el mismo valor (coeficiente de variación del pedido igual a cero), el cuadrado del coeficiente de variación de los ingresos caería a 1 dividido por 0,035, menos 1, es decir, 27,5714, exactamente el valor de la conversión. Tiene sentido: sin dispersión en el valor del pedido, los ingresos por usuario son la conversión multiplicada por una constante, y multiplicar por una constante no cambia ningún coeficiente de variación. Todo el excedente de muestra viene de la dispersión del valor del pedido, y de nada más.

desviación estándar del valor del pedido CV del pedido CV de ingresos/usuario N por variante días
R$ 0 (todos gastan igual) 0,000 5,2509 480.900 57
R$ 300 0,250 5,4182 512.046 60
R$ 600 0,500 5,8919 605.486 71
R$ 900 (el caso de la tienda) 0,750 6,6063 761.217 89
R$ 1.500 1,250 8,4979 1.259.559 147
R$ 2.400 2,000 11,9104 2.474.266 289

Una nota sobre la diferencia del 1,4 por ciento

La fila de R$ 0 de la tabla anterior da 480.900, y la calculadora dio 487.847 para el mismo escenario. La diferencia del 1,44 por ciento no es un error: la fórmula continua usa la varianza bajo la hipótesis alternativa en los dos brazos, mientras que la calculadora usa la forma agrupada, que estima el error estándar bajo la hipótesis nula con la media de las dos tasas. La forma agrupada es ligeramente más conservadora y es la que adopta la literatura de dos proporciones. La diferencia crece con el efecto: es del 0,96 por ciento con efecto del 2 por ciento y del 4,81 por ciento con efecto del 10 por ciento. En planificación esto no cambia ninguna decisión, pero conviene saber de dónde viene antes de acusar a una de las dos de estar equivocada.

Cuántos usuarios necesita la media solo para comportarse

Existe un segundo límite inferior, independiente del cálculo de poder, y se ignora con frecuencia: la fórmula anterior asume que la media de la métrica es aproximadamente normal. Para una métrica muy asimétrica, eso exige bastantes más usuarios que el “n mayor que 30” de los libros introductorios.

Kohavi, Deng, Longbotham y Xu proponen, en la séptima regla práctica del artículo de KDD 2014, el mínimo de 355 veces el cuadrado del coeficiente de asimetría por variante, recomendado cuando el módulo de la asimetría supera 1. Publican la tabla de métricas reales de Bing, y reproduce la regla punto por punto:

métrica de Bing módulo de la asimetría muestra mínima reportada 355 por el cuadrado sensibilidad al 80% de poder
Ingresos por usuario 17,9 114 mil 113.746 4,4%
Ingresos por usuario (limitado) 5,2 9,7 mil 9.599 10,5%
Sesiones por usuario 3,6 4,70 mil 4.601 5,4%
Tiempo hasta el éxito 2,1 1,55 mil 1.566 12,3%

Los autores reportan además que, en un sitio de comercio, la asimetría de compras por cliente superaba 10 y la de ingresos por cliente superaba 30. Y hacen una advertencia honesta que casi nunca se cita junto con la regla: si el control y el tratamiento tienen la misma distribución y el reparto es igual, la distribución de la diferencia queda aproximadamente simétrica (perfectamente simétrica bajo la hipótesis nula), y entonces la regla no da un límite inferior útil, porque fue construida para el módulo de la asimetría por encima de 1. En ese caso, quien manda es el cálculo de poder de las secciones anteriores. La regla de 355 es la alarma para el caso en que lees cada brazo por separado, o en que los brazos no están dimensionados por igual.

Los dos límites inferiores de muestra y cuál muerde primeroDos bloques apilados. El bloque de arriba representa el límite de poder, que crece con el cuadrado del coeficiente de variación y con el inverso del cuadrado del efecto. El bloque de abajo representa el límite de normalidad de la media, que crece con el cuadrado de la asimetría por la regla de 355. Una flecha indica que el tamaño del test es el mayor de los dos números, nunca la media ni el menor.El tamaño del test es el MAYOR de los dos límites, no el más cómodolímite 1: poder estadísticocrece con el cuadrado del coeficiente de variacióncrece con el inverso del cuadrado del efectoresponde: ¿consigo detectar el efecto que quiero?límite 2: normalidad de la mediacrece con el cuadrado de la asimetríaregla de 355 por el cuadrado de la asimetríaresponde: ¿el valor p que leí vale algo?muestra del test = el mayor de los dos
Los dos límites responden preguntas distintas y no se sustituyen. Pasar el de poder y suspender el de normalidad produce un valor p cuya calibración nadie ha comprobado.

Tres formas de bajar el número (y lo que cuesta cada una)

Si el número que salió es demasiado grande para tu tráfico, existen tres palancas legítimas. Todas tocan el coeficiente de variación, porque es él quien manda.

1. Limitar la cola (capping)

Cortar valores por encima de un techo baja la desviación estándar mucho más de lo que baja la media, y es el cociente entre las dos lo que entra en el cálculo. Kohavi, Deng, Longbotham y Xu reportan que limitar ingresos por usuario a 10 dólares por usuario por semana en Bing bajó la asimetría de 18 a 5,3, y que para la misma muestra los ingresos limitados detectan un cambio 30 por ciento menor que los ingresos brutos.

El costo es conceptual, no estadístico: la métrica limitada responde a otra pregunta. Dejas de medir ingresos y pasas a medir ingresos hasta el techo. Si el efecto que estás testeando actúa justamente en la cola (upsell de un artículo caro, por ejemplo), el capping borra exactamente lo que querías ver. El tratamiento completo de esa decisión está en outliers y capping en test A/B.

2. Reducir varianza con dato pre-experimento (CUPED)

Deng, Xu, Kohavi y Walker muestran que usar una covariable medida antes del experimento reduce la varianza por un factor igual a 1 menos el cuadrado de la correlación entre la métrica y la covariable. Reportan una reducción de cerca del 50 por ciento en la varianza en Bing, lo que describen como equivalente a duplicar el tráfico o cortar la duración por la mitad. Reportan también que la mejor covariable aislada es la propia métrica medida en el periodo pre-experimento (más del 45 por ciento de reducción en su caso, contra 9 a 10 por ciento usando solo el día de entrada, y ganancia extra de apenas 2 a 3 por ciento al combinar ambas).

La advertencia más importante de este artículo viene del mismo estudio, y cae justamente sobre la métrica de la que estamos tratando. Los autores reportan que CUPED funcionó bien en clics por usuario y visitas por usuario, y que la excepción notable fue ingresos por usuario, donde la reducción de varianza quedó por debajo del 5 por ciento, porque la correlación de los ingresos por usuario entre el periodo pre-experimento y el periodo del experimento es baja. Tiene sentido: quien gastó mucho el mes pasado no es, en general, quien va a gastar mucho este mes. La tabla siguiente muestra lo que pasaría con la muestra de la tienda en cada nivel de correlación, y sirve para dimensionar la ganancia potencial. No es una previsión: para ingresos por usuario, la correlación observada en el estudio de Bing quedaría en la primera fila de la tabla o por debajo de ella. Mide la correlación en tu propia base antes de contar con cualquiera de estas filas.

Aplicado al ejemplo de la tienda, con la muestra de 761.217:

correlación con la covariable factor de varianza N por variante días
0,5 0,750 570.913 67
0,6 0,640 487.179 57
0,7 0,510 388.221 46
0,8 0,360 274.039 32

El costo es de ingeniería: exige guardar dato del periodo anterior por usuario y aplicar el ajuste en el análisis. Y exige que el usuario exista antes del experimento, lo que no vale para un visitante nuevo. Detalles en qué es CUPED.

3. Cambiar la métrica primaria

La palanca más barata y la menos usada. Si ingresos por usuario exige 89 días y tasa de conversión exige 57, y si la hipótesis del test es sobre fricción en el checkout (que actúa en la conversión, no en el ticket), la métrica primaria honesta es la conversión, con los ingresos como métrica secundaria monitoreada. Esto no es elegir la métrica que da el resultado que quieres: es elegir la métrica en la que el mecanismo que estás testeando de hecho actúa. La discusión de cómo hacer esa elección sin engañarse está en métrica primaria y OEC.

Las métricas de ratio son un tercer caso

Existe una familia que parece continua y no es ni una cosa ni la otra: métricas en las que el denominador no es el usuario aleatorizado. Clics por página, artículos por sesión, ingresos por pedido. En esas, cada usuario contribuye con varias observaciones correlacionadas, y el error estándar calculado como si fueran independientes sale menor que el verdadero. El cálculo de muestra de este artículo sigue valiendo, pero el coeficiente de variación tiene que ser el de la métrica agregada por unidad aleatorizada, no el de la observación individual. El tratamiento correcto es el método delta, cubierto en métricas de ratio en tests A/B, y la elección de unidad que genera el problema está en unidad de aleatorización en test A/B.

Cómo estimar el coeficiente de variación antes del test

Todo este cálculo depende de un número que necesitas tener antes de empezar: el coeficiente de variación de la métrica en tu propio dato. No es un benchmark de mercado, es una propiedad de tu base. Tres formas de obtenerlo, en orden de preferencia:

  1. Calcularlo directamente en el histórico. Toma las últimas 4 a 8 semanas, agrega la métrica por usuario en la misma ventana que usará el test, y calcula desviación estándar dividida por media. Es el camino correcto y lleva minutos en cualquier herramienta de datos.
  2. Reconstruirlo por la descomposición. Si solo tienes tasa de conversión y estadísticas del valor del pedido, usa la identidad del paso 2: 1 más el cuadrado del coeficiente de variación del pedido, dividido por la tasa, menos 1. Necesita la desviación estándar del ticket, no solo la media.
  3. Ejecutar primero un test A/A. Un test A/A de dos semanas devuelve la dispersión observada gratis, junto con la validación de que la aleatorización es correcta.

Lo que no funciona es adoptar un coeficiente de variación “típico”. La dispersión de ingresos por usuario de una tienda de artículos de R$ 30 y la de una tienda de muebles no tienen ninguna relación, y el número entra en el cálculo al cuadrado.

Checklist antes de definir el tamaño de muestra

  1. ¿Cuál es la métrica primaria, binaria o continua? Si es continua, la calculadora de proporciones no responde.
  2. ¿Tienes su desviación estándar en tu propio dato? Sin eso, el número que salga es una conjetura con apariencia de cálculo.
  3. ¿La ventana de agregación de la estimación es la misma del test? Coeficiente de variación de ingresos a 7 días y a 28 días son números distintos.
  4. ¿La asimetría supera 1? Si la supera, comprueba la regla de 355 por su cuadrado, recordando la advertencia del reparto igual.
  5. ¿El denominador de la métrica es la unidad aleatorizada? Si no lo es, es una métrica de ratio y necesita método delta.
  6. ¿Calculaste los dos números, conversión e ingresos? El test dura el mayor de los dos, y conviene saberlo antes y no después.
  7. ¿Se consideraron las palancas de reducción en el orden correcto? Cambiar la métrica primaria es más barato que el capping, que es más barato que implementar CUPED.

Errores comunes

Hazlo automático en Donnu

El error caro aquí no es equivocar la fórmula, es no darse cuenta nunca de que existían dos. Una métrica de ingresos entra en el informe al lado de una métrica de conversión, con la misma cara, el mismo intervalo y el mismo color, y nada en la pantalla dice que una de ellas estaba dimensionada y la otra no.

En Donnu, cada métrica declarada en un experimento lleva su familia, y el cálculo de poder se hace por métrica: una métrica continua exige la dispersión estimada de tu propia base, y el informe muestra el poder efectivo que alcanzó, no el poder que alcanzó la métrica de conversión. Si quieres rehacer cualquier cálculo a mano, la calculadora de tamaño de muestra resuelve el caso binario y la calculadora de duración traduce cualquier N en días de calendario.

Referencias

Lee también: Cuántos visitantes necesita un test A/B · Outliers y capping en test A/B · Qué es CUPED · Métricas de ratio en tests A/B · Efecto mínimo detectable · Calculadora de tamaño de muestra · Leia em português

Preguntas frecuentes

¿Puedo usar la calculadora de tamaño de muestra para medir ingresos por usuario?
No directamente. La calculadora de tamaño de muestra estándar resuelve la comparación de dos proporciones, es decir, una métrica binaria del tipo "convirtió o no". Ingresos por usuario es una métrica continua, y su varianza no sale de la tasa de conversión: sale del coeficiente de variación de los propios ingresos. Usa la calculadora para dimensionar la métrica de conversión y la fórmula continua de este artículo para dimensionar la métrica de ingresos. Si el test tiene las dos, el tamaño del test es el mayor de los dos números.
¿Qué es el coeficiente de variación y por qué decide el tamaño de la muestra?
El coeficiente de variación es la desviación estándar dividida por la media. Mide la dispersión relativa de la métrica, y es la única característica de la distribución que entra en el cálculo de muestra cuando el efecto se expresa en términos relativos. La fórmula es n por variante igual a 2 veces el cuadrado de la suma de los dos valores críticos, multiplicado por el cuadrado del coeficiente de variación y dividido por el cuadrado del efecto relativo. Duplicar el coeficiente de variación cuadruplica la muestra necesaria.
¿Por qué ingresos por usuario exige más muestra que tasa de conversión en el mismo test?
Porque los ingresos por usuario acumulan dos fuentes de variación: si la persona compró (que es la variación de la conversión) y cuánto gastó cuando compró (que la conversión no tiene). El cuadrado del coeficiente de variación de los ingresos por usuario vale 1 más el cuadrado del coeficiente de variación del valor del pedido, todo dividido por la tasa de conversión, menos 1. Con conversión del 3,5 por ciento y valor del pedido con coeficiente de variación 0,75, eso da 1,583 veces la muestra exigida por la tasa de conversión para el mismo efecto relativo.
¿Cuántos usuarios necesito para que la media sea aproximadamente normal?
Kohavi, Deng, Longbotham y Xu proponen la regla de 355 veces el cuadrado del coeficiente de asimetría por variante, recomendada cuando el módulo de la asimetría supera 1. Reportan que ingresos por usuario en Bing tenía asimetría 17,9 y por lo tanto exigía 114 mil usuarios solo para que la media se comportara como normal. Los propios autores advierten que, con reparto igual entre control y tratamiento, la distribución de la diferencia queda aproximadamente simétrica y esa regla deja de dar un límite inferior útil; en ese caso quien manda es el cálculo de poder.
¿Cortar outliers reduce el tamaño de muestra necesario?
Lo reduce, porque cortar la cola baja la desviación estándar más de lo que baja la media, y es el cociente entre las dos lo que entra en el cálculo. Kohavi, Deng, Longbotham y Xu reportan que, al limitar ingresos por usuario a 10 dólares por usuario por semana en Bing, la asimetría cayó de 18 a 5,3 y la misma muestra pasó a detectar un cambio 30 por ciento menor. El precio es que la métrica limitada responde a otra pregunta: dejas de medir los ingresos totales y pasas a medir los ingresos hasta el techo que elegiste.
¿CUPED ayuda en el dimensionamiento de una métrica continua?
Ayuda, y es donde la ganancia es mayor. Deng, Xu, Kohavi y Walker muestran que la varianza cae por un factor igual a 1 menos el cuadrado de la correlación entre la métrica y la covariable pre-experimento, y reportan una reducción de cerca del 50 por ciento en la varianza en Bing, equivalente a duplicar el tráfico o cortar la duración por la mitad. Como la muestra es proporcional a la varianza, una correlación de 0,7 corta la muestra necesaria en un 51 por ciento. La advertencia importante viene del mismo estudio: su excepción notable fue justamente ingresos por usuario, donde la reducción quedó por debajo del 5 por ciento a causa de la baja correlación de los ingresos entre los dos periodos. Mide la correlación en tu propia base antes de contar con la ganancia.