Retraso de Conversión en Test A/B: el dato que falta
El retraso de conversión hace que leer pronto premie a quien convierte rápido, no a quien convierte más. Cómo medir la curva de llegada y cuándo leer.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Una lectura hecha antes de que cierre la ventana de atribución no mide quién convierte más, mide quién convierte primero. En la simulación de esta guía, dos brazos con exactamente la misma tasa final del 5 por ciento aparecieron el día 3 como un ganador de más 68,62 por ciento con una z de 12,0608, y el día 30 la diferencia se había vuelto ruido, con un valor p de 0,211119. Esta guía muestra por qué el retraso de conversión distorsiona la lectura, cómo medir tu propia curva de llegada, en qué caso la lectura anticipada es segura y en cuál invierte el resultado. Forma parte de nuestra guía completa de test A/B y complementa ciclo semanal y métricas de tiempo hasta el evento.
El problema: la conversión no llega junto con el clic
Casi toda calculadora de test A/B pide dos números por brazo, visitantes y conversiones, y devuelve un veredicto. La cuenta está bien. Lo que asume, sin decirlo, es que los dos números fueron medidos sobre el mismo período de oportunidad.
Eso es cierto cuando la conversión sucede en la sesión. Un clic en un botón, un registro, una compra por impulso: exposición y conversión son casi simultáneas, y una lectura el día 7 cuenta prácticamente todas las conversiones de los usuarios expuestos hasta el día 7.
Deja de ser cierto en cuanto existe deliberación. La persona ve la página de precios el martes, lo piensa, vuelve el viernes, decide el domingo siguiente. En ese mundo, el día 7 del test tienes siete días de exposiciones y bastante menos de siete días de conversiones: las conversiones de los usuarios que entraron en los últimos días todavía están en camino.
Chapelle, en un estudio con registros de tráfico real de Criteo presentado en KDD 2014, puso números a esto. Según el artículo, el 35 por ciento de las conversiones ocurre dentro de la primera hora tras el clic, pero cerca del 50 por ciento ocurre después de 24 horas y el 13 por ciento después de dos semanas. Y en el mismo artículo registra que esos números son bastante distintos de los reportados para la exchange RMX de Yahoo, donde el 95,5 por ciento de las conversiones sucede dentro de la primera hora tras el clic.
Guarda esa contradicción, es el punto de partida: no existe un número universal de retraso. Dos negocios de publicidad digital, mismo sector, y uno tiene la mitad de las conversiones después de un día mientras el otro tiene el 95,5 por ciento en la primera hora.
Cómo el retraso se convierte en sesgo
El retraso de conversión por sí solo no sesga nada. Si los dos brazos tienen exactamente la misma distribución de retraso, una lectura anticipada corta la misma porción de ambos lados, y la comparación relativa sobrevive. El problema aparece cuando la variante toca la velocidad de la decisión.
Y tocar la velocidad es justamente lo que buena parte de los cambios probados hace a propósito:
- un contador de urgencia acelera a quien ya iba a comprar
- un cupón con plazo empuja la decisión dentro del plazo
- un formulario más corto reduce el abandono en el momento, pero puede atraer a quien todavía no estaba decidido
- el envío gratis con importe mínimo hace que la persona vuelva al carrito después, retrasando
- una página de precios más clara puede aplazar la compra porque la persona pasó a comparar planes
Ninguno de esos cambios necesita alterar el total final para alterar por completo la foto del día 3.
Ejemplo trabajado 1: el ganador que no existe
Simulamos un test con 30.000 usuarios por brazo y ventana de atribución de 30 días. La verdad del mundo simulado es dura a propósito: la tasa de conversión final es exactamente 5,00 por ciento en los dos brazos. La única diferencia es el retraso, sorteado de una exponencial con media de 96 horas en el control (los 4 días que Chapelle usa en su simulación) y 36 horas en la variante.
Es decir: la variante no convierte a nadie más. Solo hace que las mismas personas decidan antes.
Puedes comprobar cada fila de la tabla de abajo en la calculadora, pegando los visitantes y las conversiones de cada día:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
| lectura | control | variante | lift relativo | z | valor p | IC 95% de la diferencia |
|---|---|---|---|---|---|---|
| día 3 | 800 / 30.000 (2,6667%) | 1.349 / 30.000 (4,4967%) | +68,62% | 12,0608 | por debajo de 1e-30 | [1,5330 pp; 2,1270 pp] |
| día 7 | 1.212 / 30.000 (4,0400%) | 1.530 / 30.000 (5,1000%) | +26,24% | 6,2166 | por debajo de 1e-9 | [0,7259 pp; 1,3941 pp] |
| día 14 | 1.433 / 30.000 (4,7767%) | 1.545 / 30.000 (5,1500%) | +7,82% | 2,1053 | 0,035267 | [0,0258 pp; 0,7209 pp] |
| día 30 | 1.478 / 30.000 (4,9267%) | 1.545 / 30.000 (5,1500%) | +4,53% | 1,2505 | 0,211119 | [-0,1267 pp; 0,5734 pp] |
Lee la columna del valor p de arriba abajo. El día 3 el resultado es aplastante. El día 7 sigue siendo aplastante. El día 14 todavía pasa el corte de 0,05, con poco margen. El día 30, cuando la ventana cierra y todas las conversiones han llegado, el test no es significativo, y el intervalo de confianza cruza el cero.
La lectura del día 30 es la correcta, y dice lo que sabemos que es verdad por construcción: los dos brazos convierten igual. El residuo de más 4,53 por ciento es ruido muestral común, exactamente el tipo de diferencia que 30.000 usuarios por brazo no logran separar de cero.
Y fíjate en la asimetría cruel: leer temprano no te da un resultado más débil, te da un resultado más fuerte y equivocado. La z del día 3 es casi diez veces la z del día 30. Ningún control de peeking resuelve esto, porque el problema no es mirar muchas veces, es mirar antes de que el dato exista. Sobre el problema de mirar muchas veces, que es distinto y también real, mira el problema del peeking.
La curva de llegada, que es donde está la respuesta
El número que explica la tabla entera es este:
| día de la lectura | fracción de las conversiones del control ya registrada | fracción de las conversiones de la variante ya registrada |
|---|---|---|
| día 1 | 21,99% | 48,22% |
| día 3 | 54,13% | 87,31% |
| día 7 | 82,00% | 99,03% |
| día 14 | 96,96% | 100,00% |
| día 30 | 100,00% | 100,00% |
El día 3, la variante ya mostró el 87,31 por ciento de lo que tenía para mostrar y el control mostró el 54,13 por ciento. La razón entre esas dos fracciones, 87,31 dividido por 54,13, da 1,6130, y el lift observado fue de más 68,62 por ciento, o factor 1,6862. Los dos números no son exactamente iguales por el ruido muestral, pero el origen del falso lift está ahí, entero: es la razón entre las madureces, no una diferencia de comportamiento de compra.
Ejemplo trabajado 2: cuando el retraso es igual en los dos lados
Vale la pena ver el caso opuesto, porque define el límite del problema. Segunda simulación, los mismos 30.000 usuarios por brazo, retraso medio de 96 horas en los dos brazos, y ahora una diferencia real: control con 5,00 por ciento y variante con 5,60 por ciento, es decir, más 12 por ciento relativo de verdad.
| lectura | control | variante | lift relativo | z | valor p |
|---|---|---|---|---|---|
| día 3 | 762 (2,5400%) | 895 (2,9833%) | +17,45% | 3,3134 | 0,000922 |
| día 7 | 1.242 (4,1400%) | 1.423 (4,7433%) | +14,57% | 3,5867 | 0,000335 |
| día 14 | 1.452 (4,8400%) | 1.650 (5,5000%) | +13,64% | 3,6507 | 0,000262 |
| día 30 | 1.504 (5,0133%) | 1.697 (5,6567%) | +12,83% | 3,5061 | 0,000455 |
Ahora el lift relativo es razonablemente estable y converge a la verdad de más 12 por ciento. La lectura anticipada no inventó un ganador: acertó la dirección y se acercó a la magnitud desde el día 3.
Dos conclusiones salen de la comparación de los dos ejemplos, y las dos importan:
- El retraso de conversión simétrico es un problema de poder, no de sesgo. El lift relativo aguanta; lo que cambia es el número de conversiones disponibles y, por lo tanto, el ancho del intervalo.
- El retraso asimétrico es un problema de sesgo, y es grave. Y no sabes cuál de los dos casos estás viviendo antes de mirar las curvas de llegada.
Esa es la razón por la que el consejo es siempre “mide tu curva”. La pregunta “¿puedo leer el día 7?” no tiene respuesta genérica: depende de cuánto de la conversión ya llegó el día 7 en cada brazo.
El retraso no es propiedad del sector, es propiedad de la campaña
La tentación de buscar un benchmark de retraso en internet y adoptarlo es fuerte, y el propio artículo de Criteo es la mejor evidencia de que eso no funciona. Chapelle ajustó distribuciones exponenciales a la distribución empírica de retraso de cuatro campañas distintas dentro de la misma plataforma, y reportó las medias:
| campaña analizada | retraso medio entre clic y conversión |
|---|---|
| campaña 1 | 43 horas |
| campaña 2 | 108 horas |
| campaña 3 | 189 horas |
| campaña 4 | 222 horas |
Más de cinco veces de diferencia entre la más rápida y la más lenta, mismo negocio, misma infraestructura, misma ventana de atribución. Si usas el número de la campaña 1 para decidir cuándo leer un test que se comporta como la campaña 4, lees con poco más del 20 por ciento de las conversiones en la mano.
Dos observaciones técnicas del mismo artículo que sirven a quien vaya a modelar esto y no solo a medirlo:
- La exponencial es una aproximación decente, no exacta. Chapelle registra que las distribuciones empíricas quedan bastante cerca de las exponenciales ajustadas, pero que el modelo exponencial tiende a subestimar los retrasos cortos, por debajo de una hora, y a sobreestimar los largos. Si usas la exponencial para proyectar el total final a partir de una lectura parcial, esa es la dirección de tu error.
- Existe ciclicidad de 24 horas en la curva. La curva acumulada de retraso tiene una forma oscilante justamente por el ciclo diario. Es el mismo motivo por el que un test debe correr semanas enteras, tratado en ciclo semanal: comparar una lectura de martes por la mañana con una de sábado por la noche compara fases distintas del ciclo.
Lo que esperar la ventana cuesta en muestra
Cerrar la cohorte de exposición no es gratis, y conviene tener el número a mano antes de proponer el cambio al equipo.
La cuenta es directa: con una entrada de tráfico constante, la fracción de expuestos que llega a completar la ventana es la duración del test menos la ventana, dividida por la duración. En un test de 28 días con ventana de 7, quedan 75 por ciento. En un test de 14 días con ventana de 14, queda cero.
Qué hacer con esa pérdida depende de cuál restricción aprieta más:
- Si te sobra tráfico, corre más días y absorbe la pérdida. Es la opción limpia.
- Si el tráfico es la restricción, acorta la ventana hasta el percentil que aceptas perder, y di cuál es. Cortar la ventana en el 85 por ciento de las conversiones es una elección defendible siempre que esté escrita en el plan de análisis y sea igual en los dos brazos.
- Si ni una ni otra, cambia la métrica primaria por algo que suceda cerca de la exposición y trata la conversión retrasada como métrica secundaria, con la lectura tardía entrando después como confirmación.
Antes de elegir, conviene hacer la cuenta de muestra ya con el descuento: toma la N que devuelve la calculadora de tamaño de muestra y divídela por la fracción aprovechable, porque ese es el número de usuarios que necesitas exponer, no el que necesitas analizar.
Cómo medir tu curva de llegada
El trabajo es una consulta, no un proyecto. Necesitas dos columnas por conversión: el instante de la exposición del usuario al test y el instante de la conversión. La diferencia entre ellas es el retraso.
Tres decisiones prácticas:
1. Fija la cohorte de exposición. Este es el arreglo más barato y el más eficaz. En vez de comparar “todas las conversiones hasta hoy” contra “todos los expuestos hasta hoy”, compara solo a los usuarios expuestos hasta hoy menos la ventana, dando a todos ellos la misma oportunidad. En un test de 21 días con ventana de 7 días, eso significa analizar a los expuestos de los días 1 a 14, cada uno con sus 7 días completos. Pierdes un tercio de la muestra y ganas una comparación limpia. Es el mismo razonamiento de madurez de cohorte, aplicado a la conversión en vez de a la retención.
2. Elige la ventana por percentil, no por costumbre. La ventana de 30 días se volvió estándar de mercado por herencia de la publicidad, no por medición. Chapelle registra que la mayoría de los anunciantes usa efectivamente una ventana de 30 días, y que él la fijó en ese valor por simplicidad. Tu ventana debería ser el día en que la curva acumulada pasa de algo como el 95 por ciento, medido en tus datos. Pueden ser 2 días, pueden ser 45.
3. Trata la lectura anticipada como provisional, y dilo en el informe. Nada impide mirar el día 3. Lo que rompe la decisión es que el número del día 3 entre en una presentación sin la marca de provisional y se convierta en la base de una proyección anual.
No se puede simplemente esperar siempre
Vale registrar el contraargumento, porque es legítimo. Chapelle muestra que esperar la ventana entera tiene coste: en su problema, entrenar un modelo solo con datos de 30 días atrás sería probablemente perjudicial porque el entorno cambia, y lo mide, el tráfico proveniente de campañas nuevas llegaba al 11,3 por ciento después de 26 días. En experimentación de producto el análogo es directo: un test que solo puede leerse 30 días después del final retrasa todo el roadmap y crea presión para decidir sin él.
La salida no es leer temprano fingiendo que todo está bien, es diseñar para leer temprano: cohorte de exposición cerrada, ventana calibrada con tus datos, y una métrica secundaria de velocidad reportada explícitamente al lado del total, para que la diferencia de pendiente sea un hallazgo y no una trampa.
Señales de que tienes este problema ahora
- El lift relativo del test encoge monótonamente conforme pasan los días, sin estabilizarse. Ese es exactamente el patrón de nuestra primera tabla.
- La variante probada toca plazo, urgencia, precio, financiación o envío. Todas cambian la velocidad de la decisión por diseño.
- Tu producto tiene un ciclo de decisión mayor que la duración habitual de los tests. B2B con aprobación de compra es el caso extremo.
- La ventana de atribución de tu herramienta es mayor que la duración del test. Si la ventana es de 30 días y el test corre 14, una parte de las conversiones nunca será contada en ningún test.
- Lees el test al final y el número no cuadra con el informe de ingresos del mes siguiente. Suele ser este el motivo, y no una atribución de ingresos rota.
Errores comunes
- Comparar el total corrido contra los expuestos corridos. El error central. El denominador crece todos los días y el numerador llega retrasado, así que la tasa observada es siempre menor que la real, y desigualmente entre brazos cuando la velocidad difiere.
- Creer que peeking y retraso de conversión son el mismo problema. El peeking es mirar muchas veces e inflar el error de tipo I; el retraso es mirar antes de que el dato exista. Corregir el alfa no arregla lo segundo.
- Usar la ventana de atribución de la herramienta sin medir. Treinta días es la herencia de otro problema. Tu curva puede cerrar en dos días, y entonces estás reteniendo la decisión en vano.
- Interpretar un cambio de velocidad como ganancia de conversión. Adelantar la compra tiene valor real de flujo de caja, y a veces es el objetivo. Solo que no es un aumento de tasa, y no debe entrar en la proyección como si lo fuera.
- Parar el test ante el primer resultado fuerte. En nuestro ejemplo, el resultado más fuerte de todos fue el más equivocado de todos. Es el caso clásico de la ley de Twyman: un resultado demasiado bueno merece desconfianza, no celebración.
- Descartar la conversión que llegó después del final del test. Existe y cuenta. Si el montaje solo graba conversiones mientras el test está encendido, el total nace truncado en los dos brazos, y más en el brazo más lento.
- Aplicar la misma ventana a métricas de naturalezas distintas. Un clic, un registro y una renovación anual no tienen la misma curva. La ventana es por métrica, no por empresa.
Hazlo automático en Donnu
El motivo de que este error sea tan común no es falta de rigor, es falta de dato: la mayoría de los montajes registra la conversión con su sello de tiempo, pero no guarda el sello de la exposición del usuario al test. Sin los dos, el retraso no es calculable, y sin el retraso no existe curva de llegada ni cohorte de exposición cerrada.
Donnu guarda el instante de la asignación junto con el instante del evento, lo que convierte la curva de llegada en una consulta y no en un proyecto de ingeniería de datos. Si tu montaje actual no lo guarda, el paso inmediato es empezar a grabar el sello de la exposición hoy, y mientras tanto adoptar la regla conservadora: leer el test solo después de transcurrida la ventana de atribución contada desde la última exposición. Para dimensionar cuánto tiempo necesita correr el test contando ya la ventana, la calculadora de duración resuelve la cuenta, y la calculadora de significancia comprueba cualquiera de las lecturas de este artículo.
Referencias
- Chapelle, O. Modeling Delayed Feedback in Display Advertising. KDD 2014, Criteo Labs. Fuente de la medida de que el 35 por ciento de las conversiones ocurre dentro de la primera hora tras el clic, de que cerca del 50 por ciento ocurre después de 24 horas y el 13 por ciento después de dos semanas; del contraste con el 95,5 por ciento en una hora reportado para la exchange RMX de Yahoo; del registro de que la mayoría de los anunciantes usa una ventana de atribución de 30 días y de que el artículo fijó esa ventana; de la medida de que el tráfico proveniente de campañas nuevas llega al 11,3 por ciento después de 26 días, lo que vuelve perjudicial esperar 30 días para entrenar; del uso de una distribución exponencial de retraso con media de 4 días en la simulación del artículo; y de la observación de que la distribución de retraso varía mucho por campaña, con medias de 43, 108, 189 y 222 horas en los cuatro casos analizados. wnzhang.net.
- Kohavi, R., Deng, A., Frasca, B., Longbotham, R., Walker, T. y Xu, Y. Trustworthy Online Controlled Experiments: Five Puzzling Outcomes Explained. KDD 2012, Microsoft. Fuente del punto de que los experimentos online reclutan usuarios de forma continua, en vez de tener un período de reclutamiento antes del experimento, lo que hace que cada usuario tenga una ventana de oportunidad distinta dentro del mismo test. exp-platform.com.
- Kohavi, R., Deng, A., Frasca, B., Walker, T., Xu, Y. y Pohlmann, N. Online Controlled Experiments at Large Scale. KDD 2013, Microsoft. Fuente de la regla de que el marcador final del experimento se cierra en un múltiplo de semanas, usualmente dos, y de la exigencia de que el criterio de decisión sea medible en plazos cortos mientras predice objetivos de largo plazo. exp-platform.com.
- Chandar, P., St. Thomas, B., Maystre, L., Pappu, V., Sanchis-Ojeda, R., Wu, T., Carterette, B., Lalmas, M. y Jebara, T. Using Survival Models to Estimate User Engagement in Online Experiments. WWW 2022, Spotify. Fuente del diseño de cohorte de exposición cerrada usado en este artículo: en su corpus, solo los usuarios expuestos durante un período de entrada de 7 días entran en el análisis, y la ventana posterior a la exposición se usa para calcular la métrica. mounia-lalmas.blog.
Lee también: Métricas de tiempo hasta el evento · Madurez de cohorte · Ciclo semanal · El problema del peeking · Ley de Twyman · Calculadora de duración · Leia em português
Preguntas frecuentes
- ¿Qué es el retraso de conversión en un test A/B?
- Es el intervalo entre la exposición del usuario a la variante y el momento en que se registra su conversión. Cuando ese intervalo es grande en relación con la duración del test, la lectura hecha antes de que la ventana cierre cuenta solo una porción de las conversiones, y la porción contada no es la misma en los dos brazos si estos cambian la velocidad de la decisión.
- ¿Por qué leer el test temprano puede invertir el resultado?
- Porque una lectura anticipada mide a quien convirtió rápido, no a quien convirtió más. En la simulación de esta guía, dos brazos con la misma tasa final del 5 por ciento, que diferían solo en el retraso medio (96 horas contra 36), aparecieron el día 3 como un lift de más 68,62 por ciento con una z de 12,0608. El día 30, con la ventana cerrada, la diferencia cayó a más 4,53 por ciento con un valor p de 0,211119, es decir, ruido.
- ¿Cuánto tarda una conversión, en la práctica?
- Depende brutalmente del negocio. Chapelle, en un estudio con tráfico real de Criteo publicado en KDD 2014, midió que el 35 por ciento de las conversiones ocurre dentro de la primera hora tras el clic, cerca del 50 por ciento ocurre después de 24 horas y el 13 por ciento después de dos semanas. En el mismo artículo contrasta esos números con los de la exchange RMX de Yahoo, donde el 95,5 por ciento de las conversiones sucede dentro de la primera hora. No existe un número universal: necesitas medir tu curva.
- Si los dos brazos tienen el mismo retraso, ¿la lectura anticipada es segura?
- Queda bastante menos peligrosa, pero sigue teniendo menos poder. En el segundo escenario de esta guía, con un retraso idéntico de 96 horas en los dos brazos y una diferencia real de más 12 por ciento, el lift leído fue de más 17,45 por ciento el día 3 y más 12,83 por ciento el día 30, convergiendo a la verdad. El riesgo es que no sabes de antemano si el cambio probado tocó la velocidad de la decisión, y los cambios de precio, urgencia y envío suelen tocarla.
- ¿Basta con esperar a que cierre la ventana de atribución?
- Es la respuesta más segura y no siempre es la viable. Chapelle registra que esperar los 30 días completos para entrenar un modelo sería probablemente perjudicial, porque el entorno cambia: en su estudio, el tráfico proveniente de campañas nuevas llegaba al 11,3 por ciento después de 26 días. La alternativa práctica es leer antes con una cohorte de exposición cerrada y la curva de llegada medida, y tratar el número como provisional hasta que venza la ventana.
- ¿Cómo distinguir efecto real de efecto de velocidad?
- Compara la curva de llegada acumulada de los dos brazos, no solo el total. Si las curvas terminan en el mismo lugar y difieren solo en la pendiente inicial, la variante tocó la velocidad y no el volumen. Si la curva del brazo ganador termina por encima, existe efecto real. Ese gráfico cuesta una consulta y resuelve la duda que ningún valor p resuelve.