Estadística

Valor de la información: ¿vale la pena correr este test?

El valor de la información pone precio a lo que compra un test A/B. La cuenta del techo, el valor por tamaño de muestra, cuándo la respuesta es no testear.

Ilustración plana de una ladera que sube con fuerza y después se convierte en una meseta larga y plana, con una bandera en el punto donde termina la subida

Todo test A/B tiene un precio en ventana de tráfico y un valor en decisión mejorada, y casi nadie calcula el segundo. El valor de la información es esa cuenta: cuánto mejora la decisión por haber medido, en lugar de haber decidido con lo que ya se sabía. Tiene un techo, y el techo es el valor de saber la verdad con certeza. En el ejemplo trabajado de esta guía, una tienda de 30.000 visitantes por semana vale 3.432.000 reales por punto porcentual de conversión al año, el techo de cualquier test sobre un cambio específico es de 661.285,36 reales, y el primer día de test ya compra el 58,23 por ciento de ese techo. Los 100 días siguientes compran menos del 5 por ciento. Esta guía muestra la cuenta completa, la tabla de valor por tamaño de muestra, los priors en los que la respuesta honesta es no testear, y cómo usar todo eso para elegir qué test ocupa la próxima ventana. Forma parte de nuestra guía completa de test A/B y es la regla que falta junto a cuántos tests A/B hacer por mes.

Primero, cuánto vale acertar

Sin un número de valor, nada de esto funciona. El ancla del ejemplo es una tienda con:

parámetro valor
tráfico 30.000 visitantes por semana, 1.560.000 por año
tasa de conversión actual 5,00%
ticket promedio R$ 220
ingreso anual actual R$ 17.160.000
valor de 1 punto porcentual de conversión R$ 3.432.000 por año
valor de 0,1 punto porcentual R$ 343.200 por año

Ese último número es el que transforma la estadística en decisión. Un punto porcentual sobre una base de 5 por ciento es una ganancia relativa de 20 por ciento en la conversión y, con ticket promedio constante, de 20 por ciento en el ingreso.

La propuesta en análisis es reordenar la página de precios. El equipo cree que ayuda, pero sin convicción. Escrito como número: la expectativa a priori es de más 0,10 punto porcentual, con desviación de 0,60 punto. Eso quiere decir que los efectos entre menos 1,1 y más 1,3 punto son todos plausibles, y que la probabilidad de que el cambio EMPEORE la conversión es de 43,38 por ciento.

Dos lecturas salen de ahí, antes de cualquier test:

Lanzar directo es positivo en expectativa y, aun así, es una apuesta que pierde en casi la mitad de los mundos posibles. Es exactamente esa combinación la que hace que un test valga la pena.

El techo: valor de la información perfecta

Imagine un oráculo que dice la verdad gratis y al instante. Con él, la regla se vuelve trivial: lanzar cuando el efecto verdadero es positivo, no lanzar cuando es negativo, y no equivocarse nunca. El valor esperado de esa política, sobre la distribución de creencias declarada arriba, es de R$ 1.004.485,36 por año.

La ganancia del oráculo sobre la mejor decisión sin ninguna información es el valor de la información perfecta:

R$ 1.004.485,36 menos R$ 343.200,00 = R$ 661.285,36

Valor de lanzar directo, valor con información perfecta y la diferencia entre los dosTres barras horizontales. La primera muestra el valor esperado de lanzar sin test, trescientos cuarenta y tres mil doscientos reales. La segunda muestra el valor esperado con información perfecta, un millón cuatro mil cuatrocientos ochenta y cinco reales. La tercera, destacada, muestra la diferencia entre las dos, seiscientos sesenta y un mil doscientos ochenta y cinco reales, que es el techo de lo que puede valer cualquier test.lo que vale la decisión, por añolanzar directo, sin testR$ 343.200,00con información perfectaR$ 1.004.485,36la diferencia: techo de cualquier testR$ 661.285,36ningún test entrega más que la barra roja, porque es el valor de saber la verdad con certeza.la barra verde no es la ganancia del test. Incluye los R$ 343.200 que ya tendría sin medir nada.testear bien es acercarse a la barra roja gastando poca ventana.
El techo existe y es finito. La pregunta operativa es cuánto de él compra usted, y con cuántos días de tráfico.

Este número es el más útil del artículo, porque limita la discusión. Ningún diseño de test, ninguna sofisticación estadística, ningún aumento de tráfico entrega más de R$ 661.285,36 en esta decisión. Si alguien propone un test de cuatro meses para “estar seguro”, el techo está ahí para decir cuánto puede rendir esa certeza, como máximo.

El valor de la información de un test de tamaño n

Un test real no es el oráculo. Devuelve una lectura con error, y cuanto mayor es la muestra, menor es el error. El valor esperado de la información de muestra es la misma cuenta del techo, con la incertidumbre que queda después de ver el resultado.

Azevedo, Deng, Montiel Olea, Rao y Weyl formalizan exactamente ese objeto y lo llaman función de producción de la información: el valor de invertir los datos de n usuarios en una idea es el valor esperado de la parte positiva de la media a posteriori, menos el valor esperado de la parte positiva de lo que se sabía antes. Es la definición usada en esta tabla.

por variación error estándar de la lectura valor de la información % del techo días a 30 mil/semana valor por día
2.000 0,6892 pp R$ 385.091,05 58,23% 1 R$ 385.091,05
5.000 0,4359 pp R$ 507.080,95 76,68% 3 R$ 169.026,98
8.158 0,3412 pp R$ 555.572,97 84,01% 4 R$ 138.893,24
10.000 0,3082 pp R$ 571.915,07 86,49% 5 R$ 114.383,01
20.000 0,2179 pp R$ 612.647,43 92,64% 10 R$ 61.264,74
31.234 0,1744 pp R$ 629.105,59 95,13% 15 R$ 41.940,37
50.000 0,1378 pp R$ 640.723,97 96,89% 24 R$ 26.696,83
85.199 0,1056 pp R$ 649.025,30 98,15% 40 R$ 16.225,63
150.000 0,0796 pp R$ 654.252,38 98,94% 70 R$ 9.346,46
300.000 0,0563 pp R$ 657.745,66 99,46% 140 R$ 4.698,18

Las tres filas destacadas no son arbitrarias. 8.158, 31.234 y 85.199 por variación son exactamente los tamaños que nuestra calculadora recomienda para detectar efectos relativos de 20, 10 y 6 por ciento sobre una base de 5 por ciento, con 80 por ciento de poder y 5 por ciento de significancia. Compruébelo:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

El resultado más incómodo de la tabla: el test de 1 día ya compra el 58,23 por ciento del techo. El test de 15 días, que es el dimensionamiento clásico para un efecto relativo de 10 por ciento, compra el 95,13 por ciento. Y el test de 140 días compra el 99,46 por ciento.

La ganancia marginal de alargar el test

La misma tabla, leída como diferencias, es todavía más directa:

alargar de a días de más valor de más por día extra
2.000 5.000 2 R$ 121.989,90 R$ 60.994,95
5.000 8.158 1 R$ 48.492,02 R$ 48.492,02
8.158 10.000 1 R$ 16.342,10 R$ 16.342,10
10.000 20.000 5 R$ 40.732,36 R$ 8.146,47
20.000 31.234 5 R$ 16.458,16 R$ 3.291,63
31.234 50.000 9 R$ 11.618,38 R$ 1.290,93
50.000 85.199 16 R$ 8.301,33 R$ 518,83
85.199 150.000 30 R$ 5.227,08 R$ 174,24
150.000 300.000 70 R$ 3.493,28 R$ 49,90

El último día de un test de 140 días vale cerca de R$ 50. El segundo día de un test vale cerca de R$ 61.000. Es una razón de más de mil a uno, dentro de la misma decisión y del mismo negocio.

Fracción del techo comprada en función de la duración del testUna curva sube muy rápido en los primeros días y después se vuelve casi horizontal. Con un día de test ya está en el cincuenta y ocho por ciento del techo. Con quince días, en el noventa y cinco por ciento. Con ciento cuarenta días, en el noventa y nueve por ciento. El eje vertical es la fracción del valor de la información perfecta y el eje horizontal es la duración del test en días.techo: R$ 661.285,361 día: 58,23%4 días: 84,01%15 días: 95,13%40 días: 98,15%140 días: 99,46%1154070140duración del test en días, a 30.000 visitantes por semana divididos en dos brazosfracción del techo
La curva es casi toda vertical al principio y casi toda horizontal en el resto. El dimensionamiento clásico cae en su codo, y no por casualidad.

La explicación merece la lectura literal de Azevedo y coautores: los datos adicionales solo ayudan a resolver casos de frontera, en los que el valor de una innovación es cercano a cero, y equivocarse en esos casos no cuesta caro, porque incluso al equivocarse la pérdida asociada es pequeña. Demuestran que, para muestras muy grandes, el producto marginal de los datos adicionales cae a una tasa de uno sobre n al cuadrado, independientemente de los detalles de la distribución de ideas.

Es la misma matemática que aparece en la sensibilidad: Kohavi y coautores registran que para aumentar la sensibilidad de un experimento por un factor de 10, digamos de un efecto detectable de 5 por ciento a 0,5 por ciento, se necesitan 100 veces más usuarios. La precisión se compra en escala cuadrática, y el valor se entrega en escala decreciente.

Cuándo la respuesta honesta es NO testear

El valor de un test depende enteramente de cuánto usted no sabe. Misma decisión, mismo tamaño de muestra de 31.234 por variación y 15 días, priors distintos:

lo que usted cree expectativa desviación techo valor del test valor por día
moneda al aire, sin idea 0,00 pp 0,60 R$ 821.501,94 R$ 788.853,36 R$ 52.590,22
apuesta grande y muy incierta más 0,10 pp 1,50 R$ 1.886.717,09 R$ 1.873.005,61 R$ 124.867,04
caso base de esta guía más 0,10 pp 0,60 R$ 661.285,36 R$ 629.105,59 R$ 41.940,37
sospecha de empeoramiento, mucha duda menos 0,20 pp 0,60 R$ 523.522,96 R$ 492.709,63 R$ 32.847,31
casi certeza de efecto pequeño más 0,10 pp 0,20 R$ 135.767,56 R$ 78.607,50 R$ 5.240,50
convencido de que perjudica menos 0,40 pp 0,30 R$ 43.649,93 R$ 23.674,04 R$ 1.578,27
convencido de que funciona más 0,90 pp 0,30 R$ 393,25 R$ 58,46 R$ 3,90

La última fila es la más instructiva. Cuando el equipo ya está convencido de que el cambio funciona, y funciona bien, el valor de la información perfecta se desploma a R$ 393,25. No es que el test sea caro: es que no tiene qué comprar. Prácticamente toda la masa de creencia ya está del lado positivo, el oráculo casi nunca cambiaría la decisión y, por lo tanto, casi nunca tendría valor.

Observe también que la segunda fila, con la misma apuesta central del caso base y dos veces y media la incertidumbre, vale casi tres veces más. La incertidumbre es el insumo del valor de la información. Una idea sobre la cual nadie tiene una opinión firme es una idea cara de no testear.

Y existe una excepción importante a la lectura de arriba: esta cuenta supone que la decisión solo es reversible mediante el test, y que el único costo de lanzar mal es el efecto negativo. Cuando lanzar mal tiene costo de reputación, de soporte o de contrato, el valor del test sube, porque pasa a comprar también la evitación de ese costo.

La fila: qué test ocupa la próxima ventana

En un programa con tráfico suficiente, el recurso escaso no es el dinero, es la ventana. Mientras un test corre, otro no corre en el mismo público. Por eso la regla de priorización no es el valor total del test, sino el valor por día de ventana.

test en la fila expectativa desviación valor del test (15 días) valor por día
rehacer el flujo de checkout más 0,30 pp 1,20 R$ 1.162.731,35 R$ 77.515,42
reordenar la página de precios más 0,10 pp 0,60 R$ 629.105,59 R$ 41.940,37
botón nuevo en el carrito más 0,05 pp 0,15 R$ 65.247,05 R$ 4.349,80

Los tres consumen exactamente la misma ventana, y el primero vale 17,8 veces el tercero. Observe qué produce esa diferencia: no es la apuesta central, es la incertidumbre. El botón nuevo tiene una desviación de 0,15 punto, es decir, todo el mundo ya sabe más o menos lo que va a pasar. Rehacer el checkout tiene una desviación de 1,20 punto, y es exactamente esa ignorancia la que hace que medirlo valga la pena.

Esa es la conclusión contraintuitiva del método: usted debe testear prioritariamente aquello sobre lo que menos sabe, y no aquello en lo que más cree. Es la lógica opuesta a la que domina la mayoría de las reuniones de priorización, y conversa directamente con la priorización por PIE e ICE y con la velocidad de experimentación.

Azevedo y coautores llegan empíricamente al mismo lugar. Estiman en Bing un coeficiente de cola muy por debajo de 3, lo que favorece una estrategia ágil de experimentación, con más ideas testeadas y muestras posiblemente menores. En un contrafactual en el que Bing experimenta con un 20 por ciento más de ideas, manteniendo el mismo número de usuarios y suponiendo que las ideas marginales tengan la misma distribución de calidad, encuentran un aumento de productividad de 17,05 por ciento. Y hacen una cuenta de servilleta con la valoración monetaria del propio Bing: moverse en la dirección de la experimentación ágil sería rentable incluso si el costo fijo de correr un experimento fuera del orden de cientos de miles de dólares por año.

El ejemplo trabajado completo: un test sin significancia que decidió

El test de la página de precios corrió los 15 días planeados, 31.234 visitantes por variación. Resultado: 1.562 conversiones en el control y 1.656 en la variación. Péguelo en la calculadora:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Devuelve 5,00 por ciento contra 5,30 por ciento, más 6,0 por ciento relativo y valor p de 0,0889, con el veredicto “Todavía sin significancia” en pantalla. Con más decimales, las tasas son 5,0010 y 5,3020 por ciento, la diferencia absoluta es de más 0,3010 punto porcentual, el valor p es 0,088858 y el intervalo de confianza va de menos 0,0457 a más 0,6476 punto. Por el criterio clásico, no alcanzó: el valor p no pasa el 0,05 y el intervalo cruza el cero.

Ahora la lectura de decisión. Al combinar esa lectura con el prior declarado antes de correr el test, la creencia actualizada sobre el efecto verdadero queda centrada en más 0,2853 punto porcentual, con desviación de 0,1675. De ahí salen tres números:

pregunta respuesta
probabilidad de que el efecto verdadero sea positivo 95,58%
valor esperado de lanzar con esa creencia R$ 979.144,91 por año
valor de la información perfecta que todavía queda R$ 10.419,54

La última fila es la que cierra la decisión. Antes del test, saber la verdad valía R$ 661.285,36. Después del test, saber la verdad vale R$ 10.419,54. El test resolvió el 98,4 por ciento de la duda que existía, y lo que queda de incertidumbre vale menos de lo que costaría en ventana cualquier prolongación razonable del test.

La decisión es lanzar. No porque el valor p haya pasado, no pasó, sino porque la duda que queda no es económicamente relevante. Es el mismo razonamiento de la pérdida esperada y de la región de equivalencia práctica, con la unidad en reales en lugar de puntos porcentuales.

Cómo aplicar esto en la práctica

  1. Escriba el valor de 1 punto porcentual antes de discutir cualquier test. Es un número por producto, no por test, y es el ancla de todo.
  2. Pida el prior en dos preguntas simples. “¿Cuál es su apuesta de efecto?” y “¿qué efecto lo sorprendería, hacia arriba y hacia abajo?”. La segunda pregunta da la desviación.
  3. Calcule el techo antes de dimensionar. Si el techo es pequeño, ningún dimensionamiento salva el test, y la decisión debe tomarse sin él.
  4. Priorice por el valor por día, no por el valor total. Es la única manera de comparar tests que ocupan la misma ventana.
  5. Prefiera más tests cortos a menos tests largos, cuando el techo sea alto y la curva ya esté en la meseta. Es la lectura directa de la tabla marginal.
  6. No confunda esto con un argumento para parar antes de tiempo. Parar antes por el resultado que apareció es peeking. Dimensionar corto por el valor esperado, ANTES de correr, es planificación.
  7. Revise el prior después de cada test del mismo tipo. El historial del programa es el mejor prior disponible, y es lo que conecta esta cuenta con el meta-análisis de tests A/B.

Errores comunes

Hágalo automático en Donnu

El cuello de botella de esta cuenta nunca es la matemática, es tener los dos insumos guardados en el lugar correcto: el valor por punto porcentual de ese flujo y el prior declarado antes de que el test corra. Sin el segundo, todo cálculo de valor de la información hecho después es reconstrucción de memoria, y la memoria después del resultado siempre es optimista.

Donnu registra la configuración del experimento en el momento en que se crea, incluido lo que se declaró como expectativa y como métrica primaria, y mantiene el historial por experimento. Eso deja disponible meses después la comparación entre lo que se esperaba y lo que pasó, que es justamente el insumo para calibrar el prior del próximo test.

Y queda la recomendación más práctica de esta guía: antes de aprobar dos semanas más de test, calcule cuánto compran esas dos semanas. En la tabla de arriba, alargar de 85.199 a 150.000 por variación cuesta 30 días de ventana y compra R$ 174,24 por día. Correr otro test en esa misma ventana suele valer cientos de veces más. La calculadora de tamaño de muestra da el eje horizontal de esa cuenta.

Referencias

Lee también: Cuántos tests A/B hacer por mes · Velocidad de experimentación · Pérdida esperada · Factor de Bayes · Efecto mínimo detectable · Calculadora de tamaño de muestra · Leia em português · Read in English

Preguntas frecuentes

¿Qué es el valor de la información en un test A/B?
Es cuánto dinero mejora la decisión por haber corrido el test, en lugar de decidir solo con lo que ya se sabía. Formalmente, es el valor esperado de la decisión tomada después de ver el resultado menos el valor esperado de la decisión tomada sin él. En el ejemplo de esta guía, la tienda vale 3.432.000 reales por punto porcentual de conversión al año, y un test de 31.234 visitantes por variación vale 629.105,59 reales en mejora de decisión.
¿Existe un techo para lo que puede valer cualquier test?
Existe, y se llama valor de la información perfecta. Es cuánto valdría saber la verdad con certeza absoluta, sin error de medición. En el ejemplo de esta guía ese techo es de 661.285,36 reales. Ningún test, por grande que sea, entrega más que eso, y es con ese techo que se mide si un test está bien dimensionado.
¿Por qué alargar un test rinde cada vez menos?
Porque los datos adicionales solo ayudan a resolver casos de frontera, en los que el valor del cambio es cercano a cero, y equivocarse en esos casos cuesta poco. Azevedo, Deng, Montiel Olea, Rao y Weyl demuestran que, para muestras grandes, el producto marginal de los datos adicionales cae a una tasa de uno sobre n al cuadrado. En el ejemplo de esta guía, el primer día de test compra el 58,23 por ciento del techo y los 70 días siguientes al cuadragésimo compran 0,79 punto porcentual más.
¿Cuándo la respuesta honesta es no testear?
Cuando usted ya está bastante seguro del resultado. Con un prior de más 0,90 punto porcentual y desviación de 0,30, el valor de la información perfecta cae a 393,25 reales y el valor de un test de 15 días a 58,46 reales. Testear ahí es gastar dos semanas de ventana para comprar casi nada. La decisión ya está tomada por lo que se sabe.
¿Cuál es el costo real de correr un test?
En la mayoría de los programas con tráfico suficiente, el costo dominante no es dinero, es la ventana: mientras ese test corre, otro no corre. Por eso la regla útil es el valor de la información POR DÍA de test, y no el valor total. En la fila de ejemplo de esta guía, tres tests de 15 días valen 4.349,80, 41.940,37 y 77.515,42 reales por día, una diferencia de casi 18 veces entre el primero y el último.
¿Un test sin significancia puede decidir?
Puede. En el ejemplo trabajado final, una lectura de 31.234 por brazo devuelve un valor p de 0,088858, que no pasa el 0,05. Combinada con el prior declarado, deja la probabilidad de que el efecto sea positivo en 95,58 por ciento y el valor de la información perfecta que todavía queda en 10.419,54 reales, contra 661.285,36 antes del test. El test resolvió el 98,4 por ciento de la duda que existía, y seguir midiendo cuesta más que la duda que quedó.