Efecto Novedad en Test A/B: cómo detectarlo
Qué es el efecto novedad, cómo separar un efecto real que decae de un artefacto estadístico y las tres revisiones que revelan una ganancia duradera.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El efecto novedad es una ganancia pasajera que viene de que el cambio sea nuevo, y no de que sea mejor, y el motivo de que eso importe es que la mayoría de los tests se lee exactamente en la ventana en que es más fuerte. Un rediseño en el que visitantes recurrentes hacen clic porque notaron que algo cambió de lugar produce una primera semana muy convincente. Esta guía cubre cómo separar un efecto que decae de uno duradero, por qué la mayor parte de las sospechas de novedad es en realidad un artefacto estadístico, el desglose entre visitante nuevo y recurrente que resuelve la discusión, y cómo diseñar un test que responde la pregunta en vez de invitar al debate. Forma parte de nuestra guía completa de test A/B y va junto con cuántos visitantes necesita un test A/B.
Qué son de verdad el efecto novedad y la primacía
Dos distorsiones opuestas aparecen cuando un cambio se expone por primera vez a quien ya conoce la versión antigua.
Novedad infla la variación al principio. Los usuarios notan que algo está diferente, investigan, hacen clic, y la métrica se mueve por razones que no tienen relación con que el cambio sea mejor. Kohavi y colegas lo describen como un sesgo que muere rápido si la función no es realmente útil.
Primacía hunde la variación al principio. Usuarios experimentados quedan temporalmente menos eficientes con una navegación o layout que todavía no aprendieron, lo que da una ventaja intrínseca al control hasta que se adaptan.
Los dos son propiedades del visitante recurrente. Quien llega por primera vez no tiene versión anterior que le resulte extraña ni nada que reaprender, y ese es el dato más útil del tema entero y la base del diagnóstico que viene más abajo.
La parte sorprendente: la mayoría de las sospechas de novedad no es real
Es aquí donde la versión honesta del tema se aleja de la versión popular. Kohavi, Deng, Longbotham y Xu relatan que en la práctica los efectos de novedad y primacía son poco comunes, y que los casos que ellos observaron se concentran en sistemas de recomendación, en los que un algoritmo nuevo introduce diversidad momentánea o tira de un inventario finito de ítems, así que la ventaja inicial desaparece naturalmente. Su análisis anterior sobre resultados intrigantes es más directo: la mayoría de los casos de sospecha de primacía y novedad no es real, es un artefacto estadístico.
El artefacto viene de cómo los equipos miran el resultado. Un gráfico de efecto acumulado en los primeros días está dominado por el ruido, porque la muestra es pequeña y el intervalo de confianza es enorme. Una curva que vaga hacia arriba durante cuatro días parece una tendencia, y quien quiere que la función funcione extrapola eso. La mayoría de los experimentos tiene, en realidad, efecto estable con varianza inicial alta, y la tendencia aparente desaparece a medida que crece la muestra.
El mismo trabajo relata algo que debería cerrar una discusión común: no lograron encontrar un solo experimento en el que un resultado estadísticamente significativo en una dirección pasara a ser estadísticamente significativo en la dirección opuesta por causa de esos efectos. Un test claramente negativo después de dos semanas no va a volverse positivo cuando los usuarios se acostumbren. Fallar rápido es la mejor jugada.
Es decir, la novedad es una hipótesis que vale la pena poner a prueba, no una explicación por defecto. Las tres revisiones de abajo son cómo la pones a prueba.
Ejemplo trabajado: la barra fija que se desvaneció
Un equipo de e-commerce lanza una barra fija de agregar al carrito. El tráfico es de 25.000 visitantes por semana, dividido por igual, así que cada brazo recibe 12.500 por semana. La métrica primaria es la tasa de compra, base del 4,00%.
Semana a semana, el control se mantiene en 4,000% mientras la variación hace esto:
| Semana | Tasa de la variación | Ganancia relativa | Valor p | Intervalo del 95% sobre la diferencia |
|---|---|---|---|---|
| 1 | 4,720% | +18,00% | 0,0053 | +0,214 a +1,226 pp |
| 2 | 4,360% | +9,00% | 0,1550 | -0,136 a +0,856 pp |
| 3 | 4,160% | +4,00% | 0,5226 | -0,330 a +0,650 pp |
| 4 | 4,120% | +3,00% | 0,6307 | -0,369 a +0,609 pp |
Cada línea tiene 12.500 visitantes por brazo, con el control en 500 compras por semana.
Ahora la vista acumulada, que es lo que muestra el panel y lo que discute la mayor parte de las reuniones:
| Hasta la semana | Visitantes por brazo | Ganancia acumulada | Valor p | Veredicto al 5% |
|---|---|---|---|---|
| 1 | 12.500 | +18,00% | 0,0053 | significativo |
| 2 | 25.000 | +13,50% | 0,0028 | significativo |
| 3 | 37.500 | +10,33% | 0,0048 | significativo |
| 4 | 50.000 | +8,50% | 0,0072 | significativo |
El test acumulado es significativo en todos los puntos de revisión, y es significativo al final. Un equipo leyendo solo esta tabla lanza la barra y pone una mejora de +8,5% en el plan. Ese número no va a aparecer en el trimestre siguiente.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
He aquí por qué. Junta las semanas tres y cuatro solas, que es lo más cercano al estado estacionario: 25.000 visitantes por brazo, control con 1.000 compras (4,000%), variación con 1.035 (4,140%). Resultado: +3,50% relativo, z = 0,792, valor p = 0,4283, intervalo de -0,206 a +0,486 punto porcentual. Inconcluso, y el intervalo incluye el cero con holgura.
El número acumulado no está mal, está respondiendo otra pregunta. Reporta el efecto promedio a lo largo del test entero, incluyendo la semana en que la barra era novedad. Lo que necesitas para decidir es el efecto que todavía va a estar ahí el mes que viene, y solo la vista semanal lo estima.
El desglose entre nuevo y recurrente que resuelve
El decaimiento semanal es sugestivo. El desglose por segmento es casi decisivo, porque la novedad tiene un mecanismo y el mecanismo tiene una firma.
En la semana uno del mismo experimento, desglosando por tipo de visitante en 60% nuevos y 40% recurrentes:
- Visitantes nuevos: 7.500 por brazo, control con 285 compras (3,800%), variación con 300 (4,000%). Ganancia +5,26%, valor p 0,5270, intervalo de -0,420 a +0,820 punto porcentual. Inconcluso.
- Visitantes recurrentes: 5.000 por brazo, control con 215 compras (4,300%), variación con 290 (5,800%). Ganancia +34,88%, valor p 0,0006, intervalo de +0,642 a +2,358 punto porcentual. Fuertemente significativo.
Esa es la huella digital. El efecto entero de la semana uno vive en el segmento que tenía algo que notar. Quien nunca vio tu sitio no puede sorprenderse de que la barra de agregar al carrito cambiara de lugar, así que, si el cambio fuera genuinamente mejor, los visitantes nuevos también deberían beneficiarse. No se beneficiaron.
Una salvedad para mantener esto honesto: ese desglose necesita ser planificado, no descubierto. Rebanar un resultado por segmento después del hecho genera muchas comparaciones silenciosas y al menos una va a parecer significativa, que es el problema de comparaciones múltiples con otro disfraz. Nuevo contra recurrente se gana una excepción solo porque puedes nombrarlo antes del lanzamiento, como revisión permanente de todo test que toca una interfaz familiar.
Diseñar para que la pregunta ni aparezca
La forma más barata de ganar la discusión sobre la novedad es volverla innecesaria antes de que empiece el test.
Corre semanas enteras, mínimo dos. Kohavi y colegas recomiendan dos semanas justamente para exponer efectos que desaparecen. Las semanas enteras también mantienen equilibrada la mezcla de día hábil y fin de semana, lo que elimina un segundo factor de confusión que suele diagnosticarse mal como novedad.
Dimensiona para el efecto que esperas que sobreviva, no para el que esperas ver. Es la parte que duele. Si tu expectativa de estado estacionario es una mejora del 5% relativo sobre una base del 4%, eso exige 154.304 visitantes por brazo y 87 días a 25.000 por semana. Una expectativa del 8,75% exige 51.266 por brazo y 29 días. El efecto del 18% que viste en la semana uno exige solo 12.626 por brazo y 8 días, que es exactamente el motivo de que un test corto encuentre ese efecto y ningún otro.
Aproximación normal de dos proporciones, división igual entre las variaciones. La fecha usa tu zona horaria y recalcula en vivo.
Declara la ventana de análisis primaria de antemano. Escribir “la decisión usa de la semana dos en adelante” en el documento del experimento antes del lanzamiento transforma una discusión en una regla. Decidir descartar la semana uno después de ver que eso ayuda es peeking vestido de rigor.
Nombra los segmentos antes. Nuevo contra recurrente, en cualquier cambio sobre una superficie familiar. Dos segmentos declarados de antemano cuestan casi nada; doce descubiertos después cuestan el resultado.
| Decisión de diseño | Versión débil | Versión que sobrevive a la revisión |
|---|---|---|
| Duración | Parar cuando dé significativo | Semanas enteras, mínimo de dos, fijadas de antemano |
| Dimensionamiento | Poder calculado para el efecto de la semana uno | Poder calculado para el efecto estacionario esperado |
| Ventana primaria | Test entero, acumulado | Ventana estacionaria declarada, decidida antes del lanzamiento |
| Segmentos | Rebanados después hasta que algo aparezca | Nuevo contra recurrente, nombrado en el plan |
| Regla de decisión | Lanzar si el valor p acumulado queda por debajo de 0,05 | Lanzar si la estimación estacionaria todavía justifica el cambio |
Cuándo un efecto que decae todavía vale la pena lanzarse
Un efecto que decae no es automáticamente un efecto sin valor, y el análisis no debería fingir lo contrario.
Kohavi y colegas describen un experimento en MSN en el que un enlace pasó a abrirse en una pestaña nueva: el cambio tuvo un componente real de novedad, con el 20% de los mensajes de feedback del primer día siendo sobre la función, cayendo al 4% en la segunda semana y al 2% en la tercera y cuarta, y las mejoras en las métricas clave se sostuvieron a lo largo del tiempo. Novedad y valor duradero no son excluyentes.
La regla práctica es decidir por la estimación de estado estacionario y registrar el pico inicial aparte, como lo que es: un efecto único que no se va a repetir. En nuestro ejemplo, si las semanas tres y cuatro hubieran vuelto con +3,5% claro y significativo en vez de inconcluso, lanzar sería lo correcto y el plan debería cargar 3,5%, no 8,5%. El error no es lanzar un cambio con efecto que decae. El error es proyectar el pico.
Existe una situación en la que el patrón es esperado en vez de sospechoso: cambios de recomendación y personalización, en los que un algoritmo nuevo introduce diversidad momentánea o agota un inventario finito de ítems para recomendar. Kohavi y colegas citan el ejemplo de un algoritmo de “personas que quizá conozcas” que fue modificado: el nuevo ordenamiento evalúa mejor al principio y el efecto muere después de que las principales recomendaciones fueron consumidas. Si estás testeando en ese terreno, planifica una ventana más larga desde el inicio.
Hazlo automático en Donnu
La discusión sobre la novedad es cara porque la evidencia normalmente hay que reconstruirla a mano después de que la reunión ya se formó una opinión. Donnu A/B mantiene el efecto semanal visible al lado del acumulado en vez de mostrar solo el total corriente, guarda el desglose entre nuevo y recurrente como segmento permanente y no como rebanada improvisada, y registra la ventana de análisis primaria junto al experimento, para que la regla de decisión esté fijada antes de que llegue el primer número.
Empieza una prueba gratis de 14 días y mira la forma semanal de tu próximo test, no solo su promedio.
Referencias
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Fuente de la afirmación de que los efectos de novedad y primacía son poco comunes en la práctica, de la salvedad sobre sistemas de recomendación y del experimento de la pestaña nueva en MSN, con los porcentajes de feedback y la mejora sostenida en las métricas. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Longbotham, R., Walker, T. y Xu, Y. Trustworthy Online Controlled Experiments: Five Puzzling Outcomes Explained. KDD 2012. Fuente del hallazgo de que la mayoría de las sospechas de primacía y novedad es un artefacto estadístico, y de la observación de que no se encontró ningún experimento en el que un resultado significativo invirtiera de dirección por causa de esos efectos. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013. Sobre duración de experimento, poder estadístico y reclutamiento continuo de usuarios. exp-platform.com.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Material complementario en experimentguide.com.
Lee también: Qué es un test A/B · Cuántos visitantes necesita un test A/B · El problema del peeking · Test secuencial explicado · Calculadora de duración de test gratis · Leia em português
Preguntas frecuentes
- ¿Qué es el efecto novedad en un test A/B?
- El efecto novedad es una respuesta de corta duración a un cambio solo porque es nuevo. Los visitantes recurrentes notan que algo cambió, exploran, hacen clic, y la métrica sube por motivos que no tienen nada que ver con que el cambio sea mejor. Eso desaparece a medida que el cambio deja de ser novedad. La imagen especular es el efecto primacía, en el que usuarios experimentados quedan temporalmente menos eficientes con un layout nuevo y el cambio parece peor al principio de lo que va a ser. Los dos distorsionan la lectura de un test corto, y los dos golpean al visitante recurrente mucho más que al visitante nuevo.
- ¿Cómo sé si mi resultado es novedad y no ganancia real?
- Tres revisiones, en este orden. Primero, desglosa el efecto por semana en vez de leer solo el número acumulado, porque la curva acumulada esconde el decaimiento por construcción. Segundo, compara visitantes nuevos contra recurrentes: el efecto novedad se concentra en los recurrentes y queda cerca de cero en los nuevos, ya que quien llega por primera vez no tiene versión antigua que le resulte extraña. Tercero, mira si las semanas de estado estacionario, por sí solas, todavía sostienen la decisión. Si las semanas tres y cuatro aisladas dan inconcluso, no tienes una ganancia confirmada, tienes una primera semana.
- ¿El efecto novedad es común?
- Menos común de lo que sugiere el folclore. Kohavi, Deng, Longbotham y Xu escriben que, en la práctica, los efectos de novedad y primacía son poco comunes, y que los casos observados por ellos se concentran en sistemas de recomendación, en los que o la diversidad momentánea de las nuevas recomendaciones o un inventario finito de ítems produce un impulso pasajero. Su trabajo anterior va más allá: la mayoría de las sospechas de novedad y primacía termina siendo un artefacto estadístico de leer una curva acumulada demasiado pronto, y no un decaimiento real. Trata la novedad como una hipótesis que pones a prueba, no como explicación por defecto para un resultado que no te gustó.
- ¿Cuánto tiempo debo correr para descartar la novedad?
- Dos semanas es el mínimo de trabajo recomendado exactamente por ese motivo, y deben ser semanas enteras, para equilibrar tráfico de día hábil y de fin de semana. Dos semanas permiten comparar la primera con la segunda, que es la revisión de decaimiento más barata que existe. Si tu cambio apunta específicamente al visitante recurrente, o si tu ciclo de compra es mayor a una semana, planifica una ventana más larga y dimensiona el test para el efecto que esperas que sobre después de que pase la novedad, no para el efecto que viste el primer día.
- ¿Cuál es la diferencia entre efecto novedad y efecto primacía?
- Apuntan en direcciones opuestas. La novedad infla la variación al principio: los usuarios prueban la cosa nueva porque es nueva, y el impulso decae. La primacía hunde la variación al principio: usuarios experimentados quedan más lentos con un layout desconocido hasta que lo aprenden, así que el cambio parece peor de lo que es. Kohavi y colegas relatan que no lograron encontrar un solo experimento en el que un resultado estadísticamente significativo en una dirección pasara a ser estadísticamente significativo en la otra por causa de esos efectos, lo que es un argumento fuerte contra extender un test claramente negativo esperando que los usuarios se adapten.
- ¿Puedo simplemente excluir la primera semana del análisis?
- Puedes, y es una revisión de robustez razonable, pero solo si lo decides antes de mirar el resultado. Elegir descartar la primera semana después de ver que eso ayuda a la conclusión que prefieres es una forma de peeking vestida de rigor. La versión limpia es declarar en el documento del experimento que el análisis primario cubre el período de estado estacionario, definir ese período de antemano y dimensionar el test para que la ventana estacionaria por sí sola tenga muestra suficiente para responder la pregunta.
- ¿El efecto novedad golpea al visitante nuevo?
- Casi nada, y eso es lo que hace del desglose entre nuevo y recurrente un diagnóstico tan afilado. Quien visita por primera vez no tiene memoria de la versión anterior, así que no hay nada que le resulte extraño ni nada que reaprender. Si un efecto grande en la semana uno vive casi entero en los visitantes recurrentes mientras los nuevos muestran una diferencia pequeña e inconclusa, la novedad es la explicación principal. Si los dos segmentos se mueven juntos, el efecto tiene más probabilidad de ser real.