Valor de la información: ¿vale la pena correr este test?
El valor de la información pone precio a lo que compra un test A/B. La cuenta del techo, el valor por tamaño de muestra, cuándo la respuesta es no testear.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Todo test A/B tiene un precio en ventana de tráfico y un valor en decisión mejorada, y casi nadie calcula el segundo. El valor de la información es esa cuenta: cuánto mejora la decisión por haber medido, en lugar de haber decidido con lo que ya se sabía. Tiene un techo, y el techo es el valor de saber la verdad con certeza. En el ejemplo trabajado de esta guía, una tienda de 30.000 visitantes por semana vale 3.432.000 reales por punto porcentual de conversión al año, el techo de cualquier test sobre un cambio específico es de 661.285,36 reales, y el primer día de test ya compra el 58,23 por ciento de ese techo. Los 100 días siguientes compran menos del 5 por ciento. Esta guía muestra la cuenta completa, la tabla de valor por tamaño de muestra, los priors en los que la respuesta honesta es no testear, y cómo usar todo eso para elegir qué test ocupa la próxima ventana. Forma parte de nuestra guía completa de test A/B y es la regla que falta junto a cuántos tests A/B hacer por mes.
Primero, cuánto vale acertar
Sin un número de valor, nada de esto funciona. El ancla del ejemplo es una tienda con:
| parámetro | valor |
|---|---|
| tráfico | 30.000 visitantes por semana, 1.560.000 por año |
| tasa de conversión actual | 5,00% |
| ticket promedio | R$ 220 |
| ingreso anual actual | R$ 17.160.000 |
| valor de 1 punto porcentual de conversión | R$ 3.432.000 por año |
| valor de 0,1 punto porcentual | R$ 343.200 por año |
Ese último número es el que transforma la estadística en decisión. Un punto porcentual sobre una base de 5 por ciento es una ganancia relativa de 20 por ciento en la conversión y, con ticket promedio constante, de 20 por ciento en el ingreso.
La propuesta en análisis es reordenar la página de precios. El equipo cree que ayuda, pero sin convicción. Escrito como número: la expectativa a priori es de más 0,10 punto porcentual, con desviación de 0,60 punto. Eso quiere decir que los efectos entre menos 1,1 y más 1,3 punto son todos plausibles, y que la probabilidad de que el cambio EMPEORE la conversión es de 43,38 por ciento.
Dos lecturas salen de ahí, antes de cualquier test:
- Lanzar directo vale, en expectativa, 0,10 por 3.432.000, es decir, R$ 343.200 por año.
- No lanzar vale cero, por definición.
Lanzar directo es positivo en expectativa y, aun así, es una apuesta que pierde en casi la mitad de los mundos posibles. Es exactamente esa combinación la que hace que un test valga la pena.
El techo: valor de la información perfecta
Imagine un oráculo que dice la verdad gratis y al instante. Con él, la regla se vuelve trivial: lanzar cuando el efecto verdadero es positivo, no lanzar cuando es negativo, y no equivocarse nunca. El valor esperado de esa política, sobre la distribución de creencias declarada arriba, es de R$ 1.004.485,36 por año.
La ganancia del oráculo sobre la mejor decisión sin ninguna información es el valor de la información perfecta:
R$ 1.004.485,36 menos R$ 343.200,00 = R$ 661.285,36
Este número es el más útil del artículo, porque limita la discusión. Ningún diseño de test, ninguna sofisticación estadística, ningún aumento de tráfico entrega más de R$ 661.285,36 en esta decisión. Si alguien propone un test de cuatro meses para “estar seguro”, el techo está ahí para decir cuánto puede rendir esa certeza, como máximo.
El valor de la información de un test de tamaño n
Un test real no es el oráculo. Devuelve una lectura con error, y cuanto mayor es la muestra, menor es el error. El valor esperado de la información de muestra es la misma cuenta del techo, con la incertidumbre que queda después de ver el resultado.
Azevedo, Deng, Montiel Olea, Rao y Weyl formalizan exactamente ese objeto y lo llaman función de producción de la información: el valor de invertir los datos de n usuarios en una idea es el valor esperado de la parte positiva de la media a posteriori, menos el valor esperado de la parte positiva de lo que se sabía antes. Es la definición usada en esta tabla.
| por variación | error estándar de la lectura | valor de la información | % del techo | días a 30 mil/semana | valor por día |
|---|---|---|---|---|---|
| 2.000 | 0,6892 pp | R$ 385.091,05 | 58,23% | 1 | R$ 385.091,05 |
| 5.000 | 0,4359 pp | R$ 507.080,95 | 76,68% | 3 | R$ 169.026,98 |
| 8.158 | 0,3412 pp | R$ 555.572,97 | 84,01% | 4 | R$ 138.893,24 |
| 10.000 | 0,3082 pp | R$ 571.915,07 | 86,49% | 5 | R$ 114.383,01 |
| 20.000 | 0,2179 pp | R$ 612.647,43 | 92,64% | 10 | R$ 61.264,74 |
| 31.234 | 0,1744 pp | R$ 629.105,59 | 95,13% | 15 | R$ 41.940,37 |
| 50.000 | 0,1378 pp | R$ 640.723,97 | 96,89% | 24 | R$ 26.696,83 |
| 85.199 | 0,1056 pp | R$ 649.025,30 | 98,15% | 40 | R$ 16.225,63 |
| 150.000 | 0,0796 pp | R$ 654.252,38 | 98,94% | 70 | R$ 9.346,46 |
| 300.000 | 0,0563 pp | R$ 657.745,66 | 99,46% | 140 | R$ 4.698,18 |
Las tres filas destacadas no son arbitrarias. 8.158, 31.234 y 85.199 por variación son exactamente los tamaños que nuestra calculadora recomienda para detectar efectos relativos de 20, 10 y 6 por ciento sobre una base de 5 por ciento, con 80 por ciento de poder y 5 por ciento de significancia. Compruébelo:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
El resultado más incómodo de la tabla: el test de 1 día ya compra el 58,23 por ciento del techo. El test de 15 días, que es el dimensionamiento clásico para un efecto relativo de 10 por ciento, compra el 95,13 por ciento. Y el test de 140 días compra el 99,46 por ciento.
La ganancia marginal de alargar el test
La misma tabla, leída como diferencias, es todavía más directa:
| alargar de | a | días de más | valor de más | por día extra |
|---|---|---|---|---|
| 2.000 | 5.000 | 2 | R$ 121.989,90 | R$ 60.994,95 |
| 5.000 | 8.158 | 1 | R$ 48.492,02 | R$ 48.492,02 |
| 8.158 | 10.000 | 1 | R$ 16.342,10 | R$ 16.342,10 |
| 10.000 | 20.000 | 5 | R$ 40.732,36 | R$ 8.146,47 |
| 20.000 | 31.234 | 5 | R$ 16.458,16 | R$ 3.291,63 |
| 31.234 | 50.000 | 9 | R$ 11.618,38 | R$ 1.290,93 |
| 50.000 | 85.199 | 16 | R$ 8.301,33 | R$ 518,83 |
| 85.199 | 150.000 | 30 | R$ 5.227,08 | R$ 174,24 |
| 150.000 | 300.000 | 70 | R$ 3.493,28 | R$ 49,90 |
El último día de un test de 140 días vale cerca de R$ 50. El segundo día de un test vale cerca de R$ 61.000. Es una razón de más de mil a uno, dentro de la misma decisión y del mismo negocio.
La explicación merece la lectura literal de Azevedo y coautores: los datos adicionales solo ayudan a resolver casos de frontera, en los que el valor de una innovación es cercano a cero, y equivocarse en esos casos no cuesta caro, porque incluso al equivocarse la pérdida asociada es pequeña. Demuestran que, para muestras muy grandes, el producto marginal de los datos adicionales cae a una tasa de uno sobre n al cuadrado, independientemente de los detalles de la distribución de ideas.
Es la misma matemática que aparece en la sensibilidad: Kohavi y coautores registran que para aumentar la sensibilidad de un experimento por un factor de 10, digamos de un efecto detectable de 5 por ciento a 0,5 por ciento, se necesitan 100 veces más usuarios. La precisión se compra en escala cuadrática, y el valor se entrega en escala decreciente.
Cuándo la respuesta honesta es NO testear
El valor de un test depende enteramente de cuánto usted no sabe. Misma decisión, mismo tamaño de muestra de 31.234 por variación y 15 días, priors distintos:
| lo que usted cree | expectativa | desviación | techo | valor del test | valor por día |
|---|---|---|---|---|---|
| moneda al aire, sin idea | 0,00 pp | 0,60 | R$ 821.501,94 | R$ 788.853,36 | R$ 52.590,22 |
| apuesta grande y muy incierta | más 0,10 pp | 1,50 | R$ 1.886.717,09 | R$ 1.873.005,61 | R$ 124.867,04 |
| caso base de esta guía | más 0,10 pp | 0,60 | R$ 661.285,36 | R$ 629.105,59 | R$ 41.940,37 |
| sospecha de empeoramiento, mucha duda | menos 0,20 pp | 0,60 | R$ 523.522,96 | R$ 492.709,63 | R$ 32.847,31 |
| casi certeza de efecto pequeño | más 0,10 pp | 0,20 | R$ 135.767,56 | R$ 78.607,50 | R$ 5.240,50 |
| convencido de que perjudica | menos 0,40 pp | 0,30 | R$ 43.649,93 | R$ 23.674,04 | R$ 1.578,27 |
| convencido de que funciona | más 0,90 pp | 0,30 | R$ 393,25 | R$ 58,46 | R$ 3,90 |
La última fila es la más instructiva. Cuando el equipo ya está convencido de que el cambio funciona, y funciona bien, el valor de la información perfecta se desploma a R$ 393,25. No es que el test sea caro: es que no tiene qué comprar. Prácticamente toda la masa de creencia ya está del lado positivo, el oráculo casi nunca cambiaría la decisión y, por lo tanto, casi nunca tendría valor.
Observe también que la segunda fila, con la misma apuesta central del caso base y dos veces y media la incertidumbre, vale casi tres veces más. La incertidumbre es el insumo del valor de la información. Una idea sobre la cual nadie tiene una opinión firme es una idea cara de no testear.
Y existe una excepción importante a la lectura de arriba: esta cuenta supone que la decisión solo es reversible mediante el test, y que el único costo de lanzar mal es el efecto negativo. Cuando lanzar mal tiene costo de reputación, de soporte o de contrato, el valor del test sube, porque pasa a comprar también la evitación de ese costo.
La fila: qué test ocupa la próxima ventana
En un programa con tráfico suficiente, el recurso escaso no es el dinero, es la ventana. Mientras un test corre, otro no corre en el mismo público. Por eso la regla de priorización no es el valor total del test, sino el valor por día de ventana.
| test en la fila | expectativa | desviación | valor del test (15 días) | valor por día |
|---|---|---|---|---|
| rehacer el flujo de checkout | más 0,30 pp | 1,20 | R$ 1.162.731,35 | R$ 77.515,42 |
| reordenar la página de precios | más 0,10 pp | 0,60 | R$ 629.105,59 | R$ 41.940,37 |
| botón nuevo en el carrito | más 0,05 pp | 0,15 | R$ 65.247,05 | R$ 4.349,80 |
Los tres consumen exactamente la misma ventana, y el primero vale 17,8 veces el tercero. Observe qué produce esa diferencia: no es la apuesta central, es la incertidumbre. El botón nuevo tiene una desviación de 0,15 punto, es decir, todo el mundo ya sabe más o menos lo que va a pasar. Rehacer el checkout tiene una desviación de 1,20 punto, y es exactamente esa ignorancia la que hace que medirlo valga la pena.
Esa es la conclusión contraintuitiva del método: usted debe testear prioritariamente aquello sobre lo que menos sabe, y no aquello en lo que más cree. Es la lógica opuesta a la que domina la mayoría de las reuniones de priorización, y conversa directamente con la priorización por PIE e ICE y con la velocidad de experimentación.
Azevedo y coautores llegan empíricamente al mismo lugar. Estiman en Bing un coeficiente de cola muy por debajo de 3, lo que favorece una estrategia ágil de experimentación, con más ideas testeadas y muestras posiblemente menores. En un contrafactual en el que Bing experimenta con un 20 por ciento más de ideas, manteniendo el mismo número de usuarios y suponiendo que las ideas marginales tengan la misma distribución de calidad, encuentran un aumento de productividad de 17,05 por ciento. Y hacen una cuenta de servilleta con la valoración monetaria del propio Bing: moverse en la dirección de la experimentación ágil sería rentable incluso si el costo fijo de correr un experimento fuera del orden de cientos de miles de dólares por año.
El ejemplo trabajado completo: un test sin significancia que decidió
El test de la página de precios corrió los 15 días planeados, 31.234 visitantes por variación. Resultado: 1.562 conversiones en el control y 1.656 en la variación. Péguelo en la calculadora:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Devuelve 5,00 por ciento contra 5,30 por ciento, más 6,0 por ciento relativo y valor p de 0,0889, con el veredicto “Todavía sin significancia” en pantalla. Con más decimales, las tasas son 5,0010 y 5,3020 por ciento, la diferencia absoluta es de más 0,3010 punto porcentual, el valor p es 0,088858 y el intervalo de confianza va de menos 0,0457 a más 0,6476 punto. Por el criterio clásico, no alcanzó: el valor p no pasa el 0,05 y el intervalo cruza el cero.
Ahora la lectura de decisión. Al combinar esa lectura con el prior declarado antes de correr el test, la creencia actualizada sobre el efecto verdadero queda centrada en más 0,2853 punto porcentual, con desviación de 0,1675. De ahí salen tres números:
| pregunta | respuesta |
|---|---|
| probabilidad de que el efecto verdadero sea positivo | 95,58% |
| valor esperado de lanzar con esa creencia | R$ 979.144,91 por año |
| valor de la información perfecta que todavía queda | R$ 10.419,54 |
La última fila es la que cierra la decisión. Antes del test, saber la verdad valía R$ 661.285,36. Después del test, saber la verdad vale R$ 10.419,54. El test resolvió el 98,4 por ciento de la duda que existía, y lo que queda de incertidumbre vale menos de lo que costaría en ventana cualquier prolongación razonable del test.
La decisión es lanzar. No porque el valor p haya pasado, no pasó, sino porque la duda que queda no es económicamente relevante. Es el mismo razonamiento de la pérdida esperada y de la región de equivalencia práctica, con la unidad en reales en lugar de puntos porcentuales.
Cómo aplicar esto en la práctica
- Escriba el valor de 1 punto porcentual antes de discutir cualquier test. Es un número por producto, no por test, y es el ancla de todo.
- Pida el prior en dos preguntas simples. “¿Cuál es su apuesta de efecto?” y “¿qué efecto lo sorprendería, hacia arriba y hacia abajo?”. La segunda pregunta da la desviación.
- Calcule el techo antes de dimensionar. Si el techo es pequeño, ningún dimensionamiento salva el test, y la decisión debe tomarse sin él.
- Priorice por el valor por día, no por el valor total. Es la única manera de comparar tests que ocupan la misma ventana.
- Prefiera más tests cortos a menos tests largos, cuando el techo sea alto y la curva ya esté en la meseta. Es la lectura directa de la tabla marginal.
- No confunda esto con un argumento para parar antes de tiempo. Parar antes por el resultado que apareció es peeking. Dimensionar corto por el valor esperado, ANTES de correr, es planificación.
- Revise el prior después de cada test del mismo tipo. El historial del programa es el mejor prior disponible, y es lo que conecta esta cuenta con el meta-análisis de tests A/B.
Errores comunes
- Tratar el valor de la información como una estimación del ingreso del test. Mide mejora de decisión, no ganancia de conversión. Las dos cosas no son lo mismo.
- Usar el método para justificar detener un test en curso. El dimensionamiento se decide antes; usar el valor de la información para cerrar cuando el resultado agrada es peeking con otro nombre.
- Elegir el prior después de ver el resultado. Es el mismo pecado del factor de Bayes, con consecuencia financiera directa.
- Ignorar los costos que no son de tráfico. El esfuerzo de ingeniería, el riesgo de soporte y el costo de reversión entran en la cuenta y pueden cambiar el orden de la fila.
- Aplicar un prior normal cuando la distribución de ideas tiene cola pesada. Azevedo y coautores muestran que esa premisa cambia la estrategia óptima, y que con cola pesada gana la estrategia ágil.
- Concluir que los tests largos nunca valen. Valen cuando el efecto relevante es pequeño y el techo es alto. La tabla de esta guía es de una decisión específica, no una ley.
- Calcular todo esto y después decidir por el cargo de quien opinó. Si el proceso termina en la apuesta de quien tiene el salario más alto, la cuenta fue decoración.
Hágalo automático en Donnu
El cuello de botella de esta cuenta nunca es la matemática, es tener los dos insumos guardados en el lugar correcto: el valor por punto porcentual de ese flujo y el prior declarado antes de que el test corra. Sin el segundo, todo cálculo de valor de la información hecho después es reconstrucción de memoria, y la memoria después del resultado siempre es optimista.
Donnu registra la configuración del experimento en el momento en que se crea, incluido lo que se declaró como expectativa y como métrica primaria, y mantiene el historial por experimento. Eso deja disponible meses después la comparación entre lo que se esperaba y lo que pasó, que es justamente el insumo para calibrar el prior del próximo test.
Y queda la recomendación más práctica de esta guía: antes de aprobar dos semanas más de test, calcule cuánto compran esas dos semanas. En la tabla de arriba, alargar de 85.199 a 150.000 por variación cuesta 30 días de ventana y compra R$ 174,24 por día. Correr otro test en esa misma ventana suele valer cientos de veces más. La calculadora de tamaño de muestra da el eje horizontal de esa cuenta.
Referencias
- Azevedo, E. M., Deng, A., Montiel Olea, J. L., Rao, J. y Weyl, E. G. A/B Testing with Fat Tails. Journal of Political Economy, volumen 128, número 12, 2020. Fuente de la definición de la función de producción de la información como el valor esperado de la parte positiva de la media a posteriori menos el valor esperado de la parte positiva de lo que se sabía antes; del teorema según el cual, para muestras grandes, el producto marginal de los datos adicionales cae a una tasa de uno sobre n al cuadrado, independientemente de los detalles de la distribución de ideas; de la intuición de que los datos adicionales solo resuelven casos de frontera, en los que el valor de la innovación es cercano a cero y el costo del error es pequeño; del registro de que incluso los experimentos con decenas de millones de usuarios generan apenas una fracción del valor de la información perfecta; de la estimación de un coeficiente de cola muy por debajo de 3 en Bing y del favorecimiento de la experimentación ágil que implica; y del contrafactual de un 20 por ciento más de ideas con el mismo número de usuarios, que aumentaría la productividad en 17,05 por ciento, con la cuenta de servilleta de que el cambio sería rentable incluso con un costo fijo de cientos de miles de dólares por experimento al año. eduardomazevedo.github.io.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013, Chicago. Fuente de la relación cuadrática entre sensibilidad y muestra, con el ejemplo de que aumentar la sensibilidad por un factor de 10, de un efecto detectable de 5 por ciento a 0,5 por ciento, exige 100 veces más usuarios; y del registro de que solo un tercio de las ideas testeadas en Microsoft mejoró las métricas que estaban diseñadas para mejorar, número presentado junto con estimaciones publicadas por otras empresas. exp-platform.com.
- Deng, A., Lu, J. y Chen, S. Continuous Monitoring of A/B Tests without Pain: Optional Stopping in Bayesian Testing. 2016. Usado aquí para la lectura de decisión del ejemplo trabajado: fuente de la formulación de que las odds a posteriori son las odds a priori multiplicadas por el factor de Bayes, de la prueba de validez del test bayesiano bajo monitoreo continuo cuando se usan reglas de parada apropiadas, y del registro de que el prior puede aprenderse empíricamente a partir de tests A/B históricos. arxiv.org.
Lee también: Cuántos tests A/B hacer por mes · Velocidad de experimentación · Pérdida esperada · Factor de Bayes · Efecto mínimo detectable · Calculadora de tamaño de muestra · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es el valor de la información en un test A/B?
- Es cuánto dinero mejora la decisión por haber corrido el test, en lugar de decidir solo con lo que ya se sabía. Formalmente, es el valor esperado de la decisión tomada después de ver el resultado menos el valor esperado de la decisión tomada sin él. En el ejemplo de esta guía, la tienda vale 3.432.000 reales por punto porcentual de conversión al año, y un test de 31.234 visitantes por variación vale 629.105,59 reales en mejora de decisión.
- ¿Existe un techo para lo que puede valer cualquier test?
- Existe, y se llama valor de la información perfecta. Es cuánto valdría saber la verdad con certeza absoluta, sin error de medición. En el ejemplo de esta guía ese techo es de 661.285,36 reales. Ningún test, por grande que sea, entrega más que eso, y es con ese techo que se mide si un test está bien dimensionado.
- ¿Por qué alargar un test rinde cada vez menos?
- Porque los datos adicionales solo ayudan a resolver casos de frontera, en los que el valor del cambio es cercano a cero, y equivocarse en esos casos cuesta poco. Azevedo, Deng, Montiel Olea, Rao y Weyl demuestran que, para muestras grandes, el producto marginal de los datos adicionales cae a una tasa de uno sobre n al cuadrado. En el ejemplo de esta guía, el primer día de test compra el 58,23 por ciento del techo y los 70 días siguientes al cuadragésimo compran 0,79 punto porcentual más.
- ¿Cuándo la respuesta honesta es no testear?
- Cuando usted ya está bastante seguro del resultado. Con un prior de más 0,90 punto porcentual y desviación de 0,30, el valor de la información perfecta cae a 393,25 reales y el valor de un test de 15 días a 58,46 reales. Testear ahí es gastar dos semanas de ventana para comprar casi nada. La decisión ya está tomada por lo que se sabe.
- ¿Cuál es el costo real de correr un test?
- En la mayoría de los programas con tráfico suficiente, el costo dominante no es dinero, es la ventana: mientras ese test corre, otro no corre. Por eso la regla útil es el valor de la información POR DÍA de test, y no el valor total. En la fila de ejemplo de esta guía, tres tests de 15 días valen 4.349,80, 41.940,37 y 77.515,42 reales por día, una diferencia de casi 18 veces entre el primero y el último.
- ¿Un test sin significancia puede decidir?
- Puede. En el ejemplo trabajado final, una lectura de 31.234 por brazo devuelve un valor p de 0,088858, que no pasa el 0,05. Combinada con el prior declarado, deja la probabilidad de que el efecto sea positivo en 95,58 por ciento y el valor de la información perfecta que todavía queda en 10.419,54 reales, contra 661.285,36 antes del test. El test resolvió el 98,4 por ciento de la duda que existía, y seguir midiendo cuesta más que la duda que quedó.