Estadística

Retraso de Conversión en Test A/B: el dato que falta

El retraso de conversión hace que leer pronto premie a quien convierte rápido, no a quien convierte más. Cómo medir la curva de llegada y cuándo leer.

Ilustración plana de un flujo de pequeñas esferas viajando desde un cúmulo a la izquierda hacia un recipiente redondo abierto a la derecha, con varias esferas todavía esparcidas a mitad de camino

Una lectura hecha antes de que cierre la ventana de atribución no mide quién convierte más, mide quién convierte primero. En la simulación de esta guía, dos brazos con exactamente la misma tasa final del 5 por ciento aparecieron el día 3 como un ganador de más 68,62 por ciento con una z de 12,0608, y el día 30 la diferencia se había vuelto ruido, con un valor p de 0,211119. Esta guía muestra por qué el retraso de conversión distorsiona la lectura, cómo medir tu propia curva de llegada, en qué caso la lectura anticipada es segura y en cuál invierte el resultado. Forma parte de nuestra guía completa de test A/B y complementa ciclo semanal y métricas de tiempo hasta el evento.

El problema: la conversión no llega junto con el clic

Casi toda calculadora de test A/B pide dos números por brazo, visitantes y conversiones, y devuelve un veredicto. La cuenta está bien. Lo que asume, sin decirlo, es que los dos números fueron medidos sobre el mismo período de oportunidad.

Eso es cierto cuando la conversión sucede en la sesión. Un clic en un botón, un registro, una compra por impulso: exposición y conversión son casi simultáneas, y una lectura el día 7 cuenta prácticamente todas las conversiones de los usuarios expuestos hasta el día 7.

Deja de ser cierto en cuanto existe deliberación. La persona ve la página de precios el martes, lo piensa, vuelve el viernes, decide el domingo siguiente. En ese mundo, el día 7 del test tienes siete días de exposiciones y bastante menos de siete días de conversiones: las conversiones de los usuarios que entraron en los últimos días todavía están en camino.

Chapelle, en un estudio con registros de tráfico real de Criteo presentado en KDD 2014, puso números a esto. Según el artículo, el 35 por ciento de las conversiones ocurre dentro de la primera hora tras el clic, pero cerca del 50 por ciento ocurre después de 24 horas y el 13 por ciento después de dos semanas. Y en el mismo artículo registra que esos números son bastante distintos de los reportados para la exchange RMX de Yahoo, donde el 95,5 por ciento de las conversiones sucede dentro de la primera hora tras el clic.

Guarda esa contradicción, es el punto de partida: no existe un número universal de retraso. Dos negocios de publicidad digital, mismo sector, y uno tiene la mitad de las conversiones después de un día mientras el otro tiene el 95,5 por ciento en la primera hora.

Cómo el retraso se convierte en sesgo

El retraso de conversión por sí solo no sesga nada. Si los dos brazos tienen exactamente la misma distribución de retraso, una lectura anticipada corta la misma porción de ambos lados, y la comparación relativa sobrevive. El problema aparece cuando la variante toca la velocidad de la decisión.

Y tocar la velocidad es justamente lo que buena parte de los cambios probados hace a propósito:

Ninguno de esos cambios necesita alterar el total final para alterar por completo la foto del día 3.

Curva acumulada de llegada de las conversiones en los dos brazos a lo largo de 30 díasGráfico de líneas con días de cero a treinta en el eje horizontal y el total acumulado de conversiones registradas en el eje vertical. La curva de la variante sube muy rápido, alcanzando el 87,31 por ciento de su total el día 3 y el 99,03 por ciento el día 7, y después queda plana en 1545 conversiones. La curva del control sube despacio, alcanzando el 54,13 por ciento de su total el día 3 y el 82,00 por ciento el día 7, y solo se aproxima al total de 1478 conversiones cerca del día 30. Las dos curvas terminan prácticamente en el mismo nivel, pero quedan muy distantes una de otra en los primeros días. Líneas verticales punteadas marcan las lecturas del día 3, el día 7 y el día 14, y la leyenda registra que la distancia vertical entre las curvas en cada una de esas fechas es el falso lift medido ese día.Mismo destino, velocidades distintas: la distancia vertical es el falso lift160010004000371430días desde la exposición del usuario1349 el día 3800 el día 31545 y 1478 el día 30variante (retraso medio 36h)control (retraso medio 96h)Las dos curvas terminan en el mismo lugar porque la tasa verdadera es 5,00 por ciento en los dos brazos.Todo lo que ve la lectura del día 3 es la diferencia de pendiente, y la lee como si fuera victoria.
Curva de llegada acumulada de los dos brazos. El gráfico que resuelve la duda no es el del total, es el del acumulado a lo largo del tiempo desde la exposición.

Ejemplo trabajado 1: el ganador que no existe

Simulamos un test con 30.000 usuarios por brazo y ventana de atribución de 30 días. La verdad del mundo simulado es dura a propósito: la tasa de conversión final es exactamente 5,00 por ciento en los dos brazos. La única diferencia es el retraso, sorteado de una exponencial con media de 96 horas en el control (los 4 días que Chapelle usa en su simulación) y 36 horas en la variante.

Es decir: la variante no convierte a nadie más. Solo hace que las mismas personas decidan antes.

Puedes comprobar cada fila de la tabla de abajo en la calculadora, pegando los visitantes y las conversiones de cada día:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

lectura control variante lift relativo z valor p IC 95% de la diferencia
día 3 800 / 30.000 (2,6667%) 1.349 / 30.000 (4,4967%) +68,62% 12,0608 por debajo de 1e-30 [1,5330 pp; 2,1270 pp]
día 7 1.212 / 30.000 (4,0400%) 1.530 / 30.000 (5,1000%) +26,24% 6,2166 por debajo de 1e-9 [0,7259 pp; 1,3941 pp]
día 14 1.433 / 30.000 (4,7767%) 1.545 / 30.000 (5,1500%) +7,82% 2,1053 0,035267 [0,0258 pp; 0,7209 pp]
día 30 1.478 / 30.000 (4,9267%) 1.545 / 30.000 (5,1500%) +4,53% 1,2505 0,211119 [-0,1267 pp; 0,5734 pp]

Lee la columna del valor p de arriba abajo. El día 3 el resultado es aplastante. El día 7 sigue siendo aplastante. El día 14 todavía pasa el corte de 0,05, con poco margen. El día 30, cuando la ventana cierra y todas las conversiones han llegado, el test no es significativo, y el intervalo de confianza cruza el cero.

La lectura del día 30 es la correcta, y dice lo que sabemos que es verdad por construcción: los dos brazos convierten igual. El residuo de más 4,53 por ciento es ruido muestral común, exactamente el tipo de diferencia que 30.000 usuarios por brazo no logran separar de cero.

Y fíjate en la asimetría cruel: leer temprano no te da un resultado más débil, te da un resultado más fuerte y equivocado. La z del día 3 es casi diez veces la z del día 30. Ningún control de peeking resuelve esto, porque el problema no es mirar muchas veces, es mirar antes de que el dato exista. Sobre el problema de mirar muchas veces, que es distinto y también real, mira el problema del peeking.

La curva de llegada, que es donde está la respuesta

El número que explica la tabla entera es este:

día de la lectura fracción de las conversiones del control ya registrada fracción de las conversiones de la variante ya registrada
día 1 21,99% 48,22%
día 3 54,13% 87,31%
día 7 82,00% 99,03%
día 14 96,96% 100,00%
día 30 100,00% 100,00%

El día 3, la variante ya mostró el 87,31 por ciento de lo que tenía para mostrar y el control mostró el 54,13 por ciento. La razón entre esas dos fracciones, 87,31 dividido por 54,13, da 1,6130, y el lift observado fue de más 68,62 por ciento, o factor 1,6862. Los dos números no son exactamente iguales por el ruido muestral, pero el origen del falso lift está ahí, entero: es la razón entre las madureces, no una diferencia de comportamiento de compra.

Ejemplo trabajado 2: cuando el retraso es igual en los dos lados

Vale la pena ver el caso opuesto, porque define el límite del problema. Segunda simulación, los mismos 30.000 usuarios por brazo, retraso medio de 96 horas en los dos brazos, y ahora una diferencia real: control con 5,00 por ciento y variante con 5,60 por ciento, es decir, más 12 por ciento relativo de verdad.

lectura control variante lift relativo z valor p
día 3 762 (2,5400%) 895 (2,9833%) +17,45% 3,3134 0,000922
día 7 1.242 (4,1400%) 1.423 (4,7433%) +14,57% 3,5867 0,000335
día 14 1.452 (4,8400%) 1.650 (5,5000%) +13,64% 3,6507 0,000262
día 30 1.504 (5,0133%) 1.697 (5,6567%) +12,83% 3,5061 0,000455

Ahora el lift relativo es razonablemente estable y converge a la verdad de más 12 por ciento. La lectura anticipada no inventó un ganador: acertó la dirección y se acercó a la magnitud desde el día 3.

Dos conclusiones salen de la comparación de los dos ejemplos, y las dos importan:

  1. El retraso de conversión simétrico es un problema de poder, no de sesgo. El lift relativo aguanta; lo que cambia es el número de conversiones disponibles y, por lo tanto, el ancho del intervalo.
  2. El retraso asimétrico es un problema de sesgo, y es grave. Y no sabes cuál de los dos casos estás viviendo antes de mirar las curvas de llegada.

Esa es la razón por la que el consejo es siempre “mide tu curva”. La pregunta “¿puedo leer el día 7?” no tiene respuesta genérica: depende de cuánto de la conversión ya llegó el día 7 en cada brazo.

El retraso no es propiedad del sector, es propiedad de la campaña

La tentación de buscar un benchmark de retraso en internet y adoptarlo es fuerte, y el propio artículo de Criteo es la mejor evidencia de que eso no funciona. Chapelle ajustó distribuciones exponenciales a la distribución empírica de retraso de cuatro campañas distintas dentro de la misma plataforma, y reportó las medias:

campaña analizada retraso medio entre clic y conversión
campaña 1 43 horas
campaña 2 108 horas
campaña 3 189 horas
campaña 4 222 horas

Más de cinco veces de diferencia entre la más rápida y la más lenta, mismo negocio, misma infraestructura, misma ventana de atribución. Si usas el número de la campaña 1 para decidir cuándo leer un test que se comporta como la campaña 4, lees con poco más del 20 por ciento de las conversiones en la mano.

Dos observaciones técnicas del mismo artículo que sirven a quien vaya a modelar esto y no solo a medirlo:

Lo que esperar la ventana cuesta en muestra

Cerrar la cohorte de exposición no es gratis, y conviene tener el número a mano antes de proponer el cambio al equipo.

Fracción de la muestra aprovechable según la duración del test y el tamaño de la ventanaGráfico de barras agrupadas que muestra la fracción de usuarios expuestos que llegan a tener la ventana de conversión completa, para tests de catorce, veintiún, veintiocho y cuarenta y dos días, en dos escenarios de ventana. Con ventana de siete días, las fracciones son cincuenta, sesenta y siete, setenta y cinco y ochenta y tres por ciento. Con ventana de catorce días, las fracciones son cero, treinta y tres, cincuenta y sesenta y siete por ciento. La leyenda registra que la ventana de catorce días hace inviable un test de catorce días, porque ningún usuario expuesto llega a completar la ventana dentro del test.Cuánta muestra queda cuando se cierra la cohorte de exposición100%50%050%0%test de 14 días67%33%test de 21 días75%50%test de 28 días83%67%test de 42 díasventana de 7 díasventana de 14 díasUna ventana igual a la duración del test deja cero por ciento de muestra aprovechable. Es la trampa de la primera barra gris.
La fracción aprovechable es (duración menos ventana) dividido por la duración. Mejora con tests más largos, y se derrumba cuando la ventana se acerca a la duración.

La cuenta es directa: con una entrada de tráfico constante, la fracción de expuestos que llega a completar la ventana es la duración del test menos la ventana, dividida por la duración. En un test de 28 días con ventana de 7, quedan 75 por ciento. En un test de 14 días con ventana de 14, queda cero.

Qué hacer con esa pérdida depende de cuál restricción aprieta más:

Antes de elegir, conviene hacer la cuenta de muestra ya con el descuento: toma la N que devuelve la calculadora de tamaño de muestra y divídela por la fracción aprovechable, porque ese es el número de usuarios que necesitas exponer, no el que necesitas analizar.

Cómo medir tu curva de llegada

El trabajo es una consulta, no un proyecto. Necesitas dos columnas por conversión: el instante de la exposición del usuario al test y el instante de la conversión. La diferencia entre ellas es el retraso.

Flujo de decisión para elegir la fecha de lectura de un test con conversión retrasadaDiagrama de flujo con cuatro etapas en secuencia. La primera caja pregunta si mediste la curva de llegada acumulada de las conversiones por brazo. Si no la mediste, la salida apunta a una caja que dice que hay que medirla antes de cualquier lectura. Si la mediste, sigue hacia la segunda caja, que pregunta si las dos curvas alcanzan el noventa y cinco por ciento del total el mismo día. Si lo alcanzan, la salida apunta a una caja verde que autoriza leer ese día con la cohorte de exposición cerrada. Si no lo alcanzan, la salida apunta a una caja naranja que exige esperar a que cierre la ventana de atribución, porque el retraso es asimétrico entre los brazos y cualquier lectura anticipada carga sesgo.Cuándo se puede leer antes de que cierre la ventana1. ¿Mediste la curva dellegada por brazo?sí2. ¿Las dos curvas llegan al 95%del total el mismo día?sílee ese día,cohorte cerradanomide primero. Sin la curva,toda fecha es adivinanza.noretraso asimétrico: espera a quecierre la ventana. Sin excepción.Cohorte de exposición cerrada quiere decir: solo entran en la cuenta los usuarios expuestos hasta el día D menos la ventana,de modo que todos los del denominador tuvieron la misma oportunidad de convertir.Ninguno de los dos caminos autoriza leer el total corrido del test el día 3 y llamarlo resultado.
El criterio no es “cuántos días corrió el test”, es “cuánto de la conversión ya llegó, en cada brazo”. La segunda pregunta es la que casi nadie hace.

Tres decisiones prácticas:

1. Fija la cohorte de exposición. Este es el arreglo más barato y el más eficaz. En vez de comparar “todas las conversiones hasta hoy” contra “todos los expuestos hasta hoy”, compara solo a los usuarios expuestos hasta hoy menos la ventana, dando a todos ellos la misma oportunidad. En un test de 21 días con ventana de 7 días, eso significa analizar a los expuestos de los días 1 a 14, cada uno con sus 7 días completos. Pierdes un tercio de la muestra y ganas una comparación limpia. Es el mismo razonamiento de madurez de cohorte, aplicado a la conversión en vez de a la retención.

2. Elige la ventana por percentil, no por costumbre. La ventana de 30 días se volvió estándar de mercado por herencia de la publicidad, no por medición. Chapelle registra que la mayoría de los anunciantes usa efectivamente una ventana de 30 días, y que él la fijó en ese valor por simplicidad. Tu ventana debería ser el día en que la curva acumulada pasa de algo como el 95 por ciento, medido en tus datos. Pueden ser 2 días, pueden ser 45.

3. Trata la lectura anticipada como provisional, y dilo en el informe. Nada impide mirar el día 3. Lo que rompe la decisión es que el número del día 3 entre en una presentación sin la marca de provisional y se convierta en la base de una proyección anual.

No se puede simplemente esperar siempre

Vale registrar el contraargumento, porque es legítimo. Chapelle muestra que esperar la ventana entera tiene coste: en su problema, entrenar un modelo solo con datos de 30 días atrás sería probablemente perjudicial porque el entorno cambia, y lo mide, el tráfico proveniente de campañas nuevas llegaba al 11,3 por ciento después de 26 días. En experimentación de producto el análogo es directo: un test que solo puede leerse 30 días después del final retrasa todo el roadmap y crea presión para decidir sin él.

La salida no es leer temprano fingiendo que todo está bien, es diseñar para leer temprano: cohorte de exposición cerrada, ventana calibrada con tus datos, y una métrica secundaria de velocidad reportada explícitamente al lado del total, para que la diferencia de pendiente sea un hallazgo y no una trampa.

Señales de que tienes este problema ahora

Errores comunes

Hazlo automático en Donnu

El motivo de que este error sea tan común no es falta de rigor, es falta de dato: la mayoría de los montajes registra la conversión con su sello de tiempo, pero no guarda el sello de la exposición del usuario al test. Sin los dos, el retraso no es calculable, y sin el retraso no existe curva de llegada ni cohorte de exposición cerrada.

Donnu guarda el instante de la asignación junto con el instante del evento, lo que convierte la curva de llegada en una consulta y no en un proyecto de ingeniería de datos. Si tu montaje actual no lo guarda, el paso inmediato es empezar a grabar el sello de la exposición hoy, y mientras tanto adoptar la regla conservadora: leer el test solo después de transcurrida la ventana de atribución contada desde la última exposición. Para dimensionar cuánto tiempo necesita correr el test contando ya la ventana, la calculadora de duración resuelve la cuenta, y la calculadora de significancia comprueba cualquiera de las lecturas de este artículo.

Referencias

Lee también: Métricas de tiempo hasta el evento · Madurez de cohorte · Ciclo semanal · El problema del peeking · Ley de Twyman · Calculadora de duración · Leia em português

Preguntas frecuentes

¿Qué es el retraso de conversión en un test A/B?
Es el intervalo entre la exposición del usuario a la variante y el momento en que se registra su conversión. Cuando ese intervalo es grande en relación con la duración del test, la lectura hecha antes de que la ventana cierre cuenta solo una porción de las conversiones, y la porción contada no es la misma en los dos brazos si estos cambian la velocidad de la decisión.
¿Por qué leer el test temprano puede invertir el resultado?
Porque una lectura anticipada mide a quien convirtió rápido, no a quien convirtió más. En la simulación de esta guía, dos brazos con la misma tasa final del 5 por ciento, que diferían solo en el retraso medio (96 horas contra 36), aparecieron el día 3 como un lift de más 68,62 por ciento con una z de 12,0608. El día 30, con la ventana cerrada, la diferencia cayó a más 4,53 por ciento con un valor p de 0,211119, es decir, ruido.
¿Cuánto tarda una conversión, en la práctica?
Depende brutalmente del negocio. Chapelle, en un estudio con tráfico real de Criteo publicado en KDD 2014, midió que el 35 por ciento de las conversiones ocurre dentro de la primera hora tras el clic, cerca del 50 por ciento ocurre después de 24 horas y el 13 por ciento después de dos semanas. En el mismo artículo contrasta esos números con los de la exchange RMX de Yahoo, donde el 95,5 por ciento de las conversiones sucede dentro de la primera hora. No existe un número universal: necesitas medir tu curva.
Si los dos brazos tienen el mismo retraso, ¿la lectura anticipada es segura?
Queda bastante menos peligrosa, pero sigue teniendo menos poder. En el segundo escenario de esta guía, con un retraso idéntico de 96 horas en los dos brazos y una diferencia real de más 12 por ciento, el lift leído fue de más 17,45 por ciento el día 3 y más 12,83 por ciento el día 30, convergiendo a la verdad. El riesgo es que no sabes de antemano si el cambio probado tocó la velocidad de la decisión, y los cambios de precio, urgencia y envío suelen tocarla.
¿Basta con esperar a que cierre la ventana de atribución?
Es la respuesta más segura y no siempre es la viable. Chapelle registra que esperar los 30 días completos para entrenar un modelo sería probablemente perjudicial, porque el entorno cambia: en su estudio, el tráfico proveniente de campañas nuevas llegaba al 11,3 por ciento después de 26 días. La alternativa práctica es leer antes con una cohorte de exposición cerrada y la curva de llegada medida, y tratar el número como provisional hasta que venza la ventana.
¿Cómo distinguir efecto real de efecto de velocidad?
Compara la curva de llegada acumulada de los dos brazos, no solo el total. Si las curvas terminan en el mismo lugar y difieren solo en la pendiente inicial, la variante tocó la velocidad y no el volumen. Si la curva del brazo ganador termina por encima, existe efecto real. Ese gráfico cuesta una consulta y resuelve la duda que ningún valor p resuelve.