Estadística

Maldición del Ganador: por qué la victoria encoge al subir

La maldición del ganador infla el efecto del test que ganó por significancia. La aritmética, cuánta inflación esperar y cómo reportar un número honesto.

Ilustración plana de un pico de montaña alto en primer plano con una colina mucho menor que aparece detrás cuando la niebla se disipa, en tonos de verde profundo

La ganancia que mediste en un test A/B ganador es, en promedio, mayor que la ganancia que vas a recibir después de subirlo, y el tamaño de esa distancia lo define casi enteramente el poder estadístico del diseño. Esa es la maldición del ganador: no elegiste la variación al azar, la elegiste porque cruzó un umbral, y cruzar un umbral con muestra pequeña exige ayuda del ruido. Esta guía cubre por qué el sesgo es estructural en lugar de un problema de datos, cuánta inflación esperar en cada nivel de poder, un ejemplo trabajado en el que un aparente más 23 por ciento replica en más 8 por ciento, y las tres formas de reportar un número que sobrevive al contacto con la realidad. Forma parte de nuestra guía completa de test A/B y conversa con efecto mínimo detectable.

La maldición del ganador es selección, no medición

Tu estimación de la ganancia es insesgada. Eso es una propiedad real del test de dos proporciones y no está en disputa. Corre el mismo experimento mil veces contra una ganancia verdadera de más 5 por ciento relativo y el promedio de esas mil estimaciones cae en más 5 por ciento.

Solo que no reportas el promedio de mil rondas. Reportas las rondas que cruzaron p por debajo de 0,05, y descartas el resto como inconclusas. En un diseño con poco poder, la mayoría de las rondas contra un efecto real de más 5 por ciento no cruza. Las que cruzan son aquellas en las que la variación aleatoria empujó la diferencia observada hacia arriba. Condicionar en la significancia selecciona ruido hacia arriba, así que el promedio de las estimaciones sobrevivientes es mayor que la verdad.

Gelman y Carlin le dieron nombre y método a esa cantidad en Perspectives on Psychological Science en 2014. Llaman al factor de sobreestimación razón de exageración, o error tipo M (magnitud) esperado: la esperanza del valor absoluto de la estimación dividido por el tamaño verdadero del efecto, condicional a la significancia estadística. Junto a eso definen la tasa de error tipo S (signo): la probabilidad de que una estimación significativa apunte hacia el lado equivocado. El resumen que hacen de la situación es directo: resultados estadísticamente significativos en un contexto ruidoso tienen alta probabilidad de estar en la dirección equivocada e invariablemente sobreestiman el valor absoluto de cualquier efecto real, muchas veces por un factor sustancial.

Por qué condicionar en la significancia infla la estimaciónLa distribución muestral de la ganancia medida está centrada en el efecto verdadero. En un diseño con poco poder, el umbral de significancia queda a la derecha del efecto verdadero, así que solo la cola superior de la distribución se reporta como victoria. El promedio de esa cola sobreviviente queda bien por encima del efecto verdadero, y la distancia entre las dos es la razón de exageración.Solo la cola sombreada se llama victoria, y su promedio no es la verdadefecto verdaderoumbral de significanciapromedio de lo que es victoriala exageracióntoda ronda que llamaríasinconclusa
Esquemático. La curva es la distribución de estimaciones que obtendrías repitiendo el mismo experimento; nada en ella está sesgado. El sesgo entra cuando guardas solo lo que cae a la derecha de la línea punteada.

Cuánta inflación, en cada nivel de poder

El método es un cálculo directo, no una regla de bolsillo. Toma el efecto verdadero, toma el error estándar de tu diseño, descubre qué fracción de rondas repetidas cruzaría el umbral de significancia, y saca el promedio de la estimación absoluta solo sobre esas rondas. Corrimos ese cálculo en forma cerrada a lo largo del rango de poder, con alfa 0,05 y bilateral:

Poder del diseño contra el efecto verdadero Error tipo S: ganador significativo apunta al lado equivocado Razón de exageración: efecto medido dividido por el verdadero
10 por ciento 4,50 por ciento 3,71 veces
20 por ciento 0,53 por ciento 2,26 veces
30 por ciento 0,11 por ciento 1,81 veces
50 por ciento 0,01 por ciento 1,41 veces
80 por ciento por debajo de 0,01 por ciento 1,12 veces
90 por ciento por debajo de 0,01 por ciento 1,06 veces

Dos verificaciones de que esta tabla está correcta, ambas contra números publicados por Gelman y Carlin. Con un efecto verdadero a 2,8 errores estándar de cero, que es la definición de 80 por ciento de poder, ellos reportan poder 0,80, error tipo S de 1,2 por diez elevado a menos seis, y factor de exageración de 1,12; nuestro cálculo devuelve 0,7996, 1,21 por diez elevado a menos seis y 1,125. Para el ejemplo trabajado de ellos, con efecto verdadero de 2 por ciento y error estándar de 8,1 por ciento, reportan poder 0,06, tipo S 24 por ciento y exageración 9,7 a partir de una simulación de 10.000 rondas; nuestra forma cerrada devuelve 0,057, 24 por ciento y 9,5, con la pequeña diferencia viniendo del ruido de simulación del lado de ellos.

La forma de la tabla es el mensaje entero. Por encima del 80 por ciento de poder prácticamente no hay nada que corregir. Por debajo del 30 por ciento de poder la corrección es mayor que la mejora anual entera de la mayoría de los equipos. Y la mayoría de los tests A/B en sitios pequeños y medianos queda bien por debajo del 30 por ciento de poder contra efectos realistas, que es el punto de CRO para sitios de bajo tráfico.

El mecanismo va más allá de la experimentación. Ioannidis, en el ensayo de 2005 en PLoS Medicine sobre por qué la mayoría de los hallazgos de investigación publicados es falsa, monta la misma estructura en términos de valor predictivo positivo y lista las condiciones que hacen que un hallazgo sea menos probablemente verdadero: estudios menores, tamaños de efecto menores, más relaciones probadas con menos preselección, y más equipos detrás de la significancia estadística. Un programa de experimentación con backlog grande, tráfico pequeño y tasa de éxito baja marca todos los ítems.

Ejemplo trabajado: más 23 por ciento que era más 8

Un equipo con base de 3 por ciento corre un cambio de checkout por dos semanas y junta 12.000 visitantes por variación. Pega los números de abajo en la calculadora:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Ronda 1 Visitantes Conversiones Tasa
A, control 12.000 360 3,000 por ciento
B, variación 12.000 444 3,700 por ciento

La calculadora devuelve más 0,700 punto porcentual, más 23,33 por ciento relativo, z = 3,01, valor p 0,0026, con intervalo del 95 por ciento de más 0,245 a más 1,155 punto porcentual. Significativo, y no por poco.

Ahora mira lo que el diseño lograba ver. Con 12.000 por variación sobre base de 3 por ciento, 95 por ciento de confianza y 80 por ciento de poder, el efecto mínimo detectable es 0,617 punto porcentual, o más 20,57 por ciento relativo. El efecto observado apenas supera el menor efecto que el test fue montado para detectar, que es la firma clásica de un diseño capaz de producir solamente victorias de apariencia grande. Si el efecto verdadero fuera el bastante más plausible más 5 por ciento relativo, ese diseño tendría 9,9 por ciento de poder para detectarlo, lo que la tabla de arriba mapea a una exageración esperada de cerca de 3,7 veces y 4,5 por ciento de posibilidad de que el signo esté simplemente equivocado.

El equipo corre una confirmación, dimensionada para la menor ganancia que de hecho subiría, más 10 por ciento relativo, que exige 53.211 por variación. Redondean a 54.000:

Ronda 2, confirmación Visitantes Conversiones Tasa
A, control 54.000 1.620 3,000 por ciento
B, variación 54.000 1.750 3,241 por ciento

La calculadora devuelve más 0,241 punto porcentual, más 8,02 por ciento relativo, z = 2,28, valor p 0,0229, intervalo de más 0,033 a más 0,448 punto porcentual. El efecto mínimo detectable en este tamaño es más 9,69 por ciento relativo, así que el diseño ahora resuelve el rango que importa.

El cambio es real y vale la pena subirlo. El número es un tercio de lo que dijo la primera ronda. La razón entre las dos estimaciones puntuales es 23,33 dividido por 8,02, cerca de 2,9 veces, cayendo justo dentro del rango que la tabla de exageración prevé para un diseño en ese nivel de poder. Nada salió mal en la ronda uno. Midió exactamente lo que mide un diseño sin poder cuando produce una victoria.

La primera estimación contra la estimación de confirmaciónLa ronda uno con 12.000 usuarios por variación reporta más 23,33 por ciento relativo con intervalo de confianza ancho. La ronda dos con 54.000 usuarios por variación reporta más 8,02 por ciento relativo con intervalo mucho más estrecho, enteramente contenido en el primero. La estimación puntual cayó por un factor de cerca de 2,9 y siguió siendo una victoria genuina.Mismo cambio, dos diseños, dos números muy diferentesganancia relativa, con intervalos de confianza del 95 por ciento convertidos a términos relativos0%+15%+30%+45%ronda 112.000 por brazo+23,33%p 0,0026ronda 254.000 por brazo+8,02%p 0,0229El segundo intervalo cabe dentro del primero, así que las dos rondas nunca se contradijeron. Solo una era precisa lo suficiente para planificar.
Las dos rondas encontraron una mejora real. La primera no lograba distinguir más 8 por ciento de más 23 por ciento, y reportó el número de la punta del rango en la que por casualidad cayó.

Por qué el total del roadmap nunca llega

Toma un programa que subió diez ganadores este trimestre, cada uno medido en más 5 por ciento en su propio paso del embudo. La diapositiva dice más 50 por ciento. Dos multiplicaciones separan esa diapositiva de la realidad.

Inflación. Si esos tests corrieron cerca del 20 por ciento de poder contra los efectos verdaderos, cada más 5 por ciento medido corresponde a un efecto verdadero más cercano a más 2,2 por ciento, por la razón de la tabla de arriba. Diez de esos no es más 50 por ciento, es algo cercano a más 22 por ciento antes de que se aplique cualquier otra cosa.

Dilución. Un efecto medido en el subconjunto de usuarios que llegó a ese paso del embudo necesita ser escalado por la porción de tráfico de ese subconjunto antes de poder sumarse a una métrica de empresa. Kohavi y colegas enuncian la regla directamente en las reglas de bolsillo de KDD 2014: las métricas deben ser diluidas por el tamaño del segmento, y una mejora de 10 por ciento en un segmento de 1 por ciento tiene impacto total de aproximadamente 0,1 por ciento. El mismo artículo reporta que en un sitio como Bing los experimentos que salen bien mueven métricas clave en 0,1 a 1,0 por ciento después de diluidos al impacto total.

Esas dos cosas juntas normalmente bastan para cerrar la distancia entre el roadmap y el panel, sin necesitar ninguna otra explicación. La corrección práctica es dejar de sumar estimaciones puntuales: atribuye ingresos a partir del número confirmado y diluido, como cubrimos en atribuyendo ingresos al ganador del test A/B, y trata el agregado del programa por la tasa de victoria medida, no por una suma de mejores casos.

Tres formas de reportar un número honesto

Enfoque Lo que reportas Costo Cuándo usarlo
Límite inferior del intervalo La punta conservadora del intervalo del 95 por ciento en lugar de la estimación puntual Gratis Siempre, como número de planificación en cualquier proyección
Ronda de confirmación La estimación replicada de una segunda ronda dimensionada por tu umbral real Semanas de tráfico Antes de cualquier decisión que comprometa presupuesto o equipo con el resultado
Estimador de encogimiento La estimación puntual tirada hacia la distribución de efectos que tu programa produce Exige una previa de tu propio histórico Programas con tests concluidos suficientes para conocer su propia distribución de efectos
Dimensionar el test bien desde el comienzo Una estimación que casi no necesita corrección, al 80 por ciento de poder o más Muestra, decidida antes de subir Siempre que el tráfico exista; es la única opción que elimina el problema en lugar de parcharlo

La primera línea es la que nadie hace y todo el mundo podría. En el ejemplo trabajado de arriba, el límite inferior de la ronda uno era más 0,245 punto porcentual, que en términos relativos es cerca de más 8,2 por ciento, y es casi exactamente lo que encontró la confirmación. El número honesto ya estaba en el primer informe. Solo que no era el número que alguien citaba.

Errores comunes

Error Lo que produce
Proyectar ingresos por la estimación puntual de una victoria sin poder Una proyección inflada que otras áreas van a usar para planificar
Dimensionar la confirmación por la estimación de la primera ronda Una nueva ronda demasiado pequeña para resolver el efecto honesto
Leer una replicación menor como “el test falló” Descartar una mejora real porque dejó de ser espectacular
Parar el test cuando la línea cruza La maldición del ganador aplicada repetidamente en lugar de una vez; ve el problema del peeking
Sumar ganancias que subieron a lo largo del roadmap Componer inflación y dilución en el mismo número
Comparar tu ganancia con estudios de caso públicos Aquellos también son ganadores seleccionados, así que cargan el mismo sesgo y normalmente peor
Tratar el sesgo como defecto de herramienta Es propiedad de la regla de selección; toda herramienta que reporta significancia tiene esto
Concluir que un sitio de poco tráfico no debe testear La conclusión correcta es testear cambios mayores, no parar; ve efecto mínimo detectable

Hazlo automático con Donnu

La maldición del ganador no se resuelve con un valor p mejor, se resuelve haciendo que el poder y la incertidumbre sean imposibles de ignorar en el momento de la decisión. Donnu A/B calcula el efecto mínimo detectable para la muestra que realmente tienes y lo muestra al lado del resultado, así que una ganancia que apenas supera ese número queda visiblemente como una ganancia que el diseño solo lograría reportar grande. Reporta el intervalo de confianza como titular al lado de la estimación puntual, y no debajo de ella, para que el número conservador de planificación esté siempre a la vista. Y clonar un experimento con semilla de aleatorización nueva es un clic, que es lo que convierte una ronda de confirmación en un paso normal en lugar de un proyecto.

Empieza una prueba gratis de 14 días y ve el intervalo al lado de todo resultado que estás por subir.

Referencias

Lee también: Efecto mínimo detectable · Cuántos visitantes necesita un test A/B · El problema del peeking · Tasa de victoria en tests A/B · Calculadora de poder estadístico gratis · Leia em português

Preguntas frecuentes

¿Qué es la maldición del ganador en un test A/B?
Es la distancia sistemática entre el efecto que mediste en un test ganador y el efecto que recibes después de subirlo. Ocurre porque no elegiste la variación al azar, la elegiste porque cruzó un umbral de significancia, y entre todas las rondas de un cambio genuinamente positivo las que cruzan ese umbral son justamente aquellas en las que el ruido empujó la estimación hacia arriba. El sesgo es una propiedad de la regla de selección, no de tus datos ni de tu herramienta, y es mayor exactamente donde los equipos se sienten más afortunados: en tests pequeños que cruzaron por poco.
¿Cuánto menor va a ser el efecto real?
Depende casi enteramente del poder del diseño contra el efecto verdadero. Usando el método de análisis de diseño de Gelman y Carlin (2014), al 80 por ciento de poder una estimación significativa queda en promedio en cerca de 1,12 veces el efecto verdadero, es decir casi no hay nada que corregir. Al 30 por ciento de poder, cerca de 1,81 veces. Al 20 por ciento, cerca de 2,26 veces, y al 10 por ciento, cerca de 3,71 veces. La mayoría de los tests A/B en sitios pequeños y medianos corre bien por debajo del 50 por ciento de poder contra efectos realistas, lo que sitúa la inflación típica entre 1,4 y 3 veces.
¿Un ganador significativo puede en realidad ser perdedor?
Puede, y ese riesgo también es función del poder. Gelman y Carlin lo llaman error tipo S, la probabilidad de que una estimación estadísticamente significativa tenga el signo equivocado. Al 80 por ciento de poder es prácticamente cero. Al 20 por ciento de poder es cerca de 0,5 por ciento, y al 10 por ciento de poder cerca de 4,5 por ciento. Es decir, en un test muy mal dimensionado, algo así como un ganador significativo de cada veinte apunta hacia el lado equivocado, antes de contar cualquier otro problema del experimento.
¿La maldición del ganador quiere decir que mi test estaba mal?
No. La dirección puede estar perfectamente bien y la decisión puede estar perfectamente bien. Lo que está mal es el número que escribes en el informe. Subir una mejora real y después proyectar el impacto de negocio a partir de la estimación puntual inflada es donde ocurre el daño, porque la proyección es lo que las demás personas usan para planificar.
¿Cómo corrijo esto?
Tres opciones prácticas, en orden creciente de costo. Reporta el límite inferior del intervalo de confianza como número de planificación en lugar de la estimación puntual, lo cual es gratis y conservador. Corre una confirmación dimensionada para el efecto que aceptarías y reporta la estimación replicada, que es la respuesta honesta y cuesta tráfico. O aplica un estimador de encogimiento, el enfoque bayesiano, que tira de las estimaciones extremas hacia la distribución de efectos que tu programa de hecho produce.
¿Por qué la suma de nuestras victorias nunca aparece en la métrica de la empresa?
En parte por ese sesgo y en parte por dilución. Toda estimación que subió carga la inflación descrita arriba, así que sumarlas compone el error. Además, un efecto medido en un subconjunto disparado necesita ser diluido por la porción de tráfico de ese subconjunto antes de poder sumarse a un número total. Un roadmap que suma estimaciones puntuales de tests sin poder, medidos en segmentos estrechos, va a prometer de más por un múltiplo grande.
¿Correr el test por más tiempo resuelve la maldición del ganador?
Correr más tiempo con una regla de parada precomprometida sí lo resuelve, porque más muestra significa más poder y menos inflación. Correr más tiempo mientras miras, y parar cuando la línea cruza, lo empeora mucho: eso es peeking, y es la maldición del ganador con la selección aplicada repetidamente en lugar de una sola vez.