CRO

Urgencia y Escasez en Test A/B: qué medir de verdad

Urgencia y escasez en test A/B: contador, stock bajo y plazo de oferta. Qué testear, la ventana que desenmascara la ganancia y el límite del dark pattern.

Ilustración plana de dos relojes de arena sobre un estante verde, una lupa examinando la arena que cae, un carrito de compras pequeño al lado y una caja verde grande a la derecha, sobre fondo verde menta

Urgencia y escasez son señales de que una oportunidad se va a acabar: un contador hasta el fin de la promoción, “últimas unidades”, stock bajo, plazo de oferta, horario de corte para despacho el mismo día, descuento de upgrade que caduca. En un test A/B casi siempre aumentan la compra rápida, y por eso engañan: buena parte de la ganancia es compra que habría ocurrido igual, solo que después. En el ejemplo trabajado de esta guía, un contador real del horario de corte aumenta la compra a 24 horas un 10,0 por ciento, con valor p menor que 0,0001, y la compra a 28 días solo un 1,8 por ciento, con valor p de 0,2557. Esta guía forma parte de nuestra guía completa de optimización de conversión (CRO) y cubre qué muestra la investigación, qué testear en ecommerce y en SaaS, por qué la ganancia de corto plazo engaña, qué métricas de guardarraíl usar, cómo elegir la ventana de medición y dónde la urgencia se convierte en dark pattern.

Qué son urgencia y escasez en una página

Los dos términos describen la misma palanca vista desde lados distintos. Urgencia es un límite de tiempo: la oferta termina en una fecha, el envío rápido tiene horario de corte, el descuento de upgrade vale por 72 horas. Escasez es un límite de cantidad o de disponibilidad: quedan tres unidades, la talla se está acabando, hay pocas plazas en el grupo de implantación. En la práctica aparecen juntas, y la investigación sobre patrones engañosos de interfaz también las trata como categorías vecinas.

El Nielsen Norman Group describe el principio de escasez como el fenómeno que hace que las personas atribuyan más valor a lo que perciben como menos disponible, y lo vincula a la aversión a la pérdida: perder pesa más que ganar. El mismo texto registra el riesgo principal, que es la pérdida de confianza cuando el visitante sospecha que la escasez no es real, y recomienda usarla con moderación y con información veraz.

La CMA, la autoridad de competencia y consumo del Reino Unido, resume en un documento de discusión de 2022 por qué esto afecta a la decisión: la presión de tiempo lleva a las personas a usar atajos mentales, mirar menos atributos y decidir por hábito. El mismo documento reconoce el lado bueno: cuando la afirmación es verdadera, ayuda al consumidor a no perder un producto realmente escaso y, posiblemente, a vencer la procrastinación.

Para quien testea, esa doble naturaleza es la cuestión central. La misma presión que ayuda a quien iba a comprar y lo aplazaba también empuja a quien no necesitaba comprar ahora, y el panel del test no separa uno de otro si la métrica es corta.

Los seis formatos más comunes

formato ejemplo en la página dónde aparece versión real versión engañosa
Contador hasta el fin de la oferta “la promoción termina en 05:12:40” página de producto, cabecera, carrito plazo fijo, igual para todos, que termina de verdad se reinicia al llegar a cero o en cada visita
Mensaje de tiempo limitado “solo por poco tiempo” banner, página de categoría fecha y hora escritas sin plazo alguno
Corte de despacho “pide en 2h13min y enviamos hoy” página de producto, checkout horario real del centro de distribución horario que nunca llega
Stock bajo “quedan 3 unidades” página de producto, selección de talla número procedente del stock número sorteado o que baja por agenda
Alta demanda “muy buscado hoy” carrito, página de producto medida real de ventas o visitas la misma frase en todos los productos
Oferta de upgrade con plazo “30% en el plan anual hasta el jueves” fin del trial, panel del SaaS plazo por cuenta, registrado en el servidor plazo que vuelve a cero en cada login

La última columna es la razón de que esta guía tenga una sección entera sobre ética y ley. En urgencia y escasez, la línea entre hipótesis de test y práctica engañosa pasa por el mismo elemento visual, y solo el origen del número la define.

Qué muestra la investigación sobre urgencia y escasez falsas

El estudio más citado sobre el tema es el rastreo de Mathur y coautores, de Princeton y de la Universidad de Chicago, publicado en la conferencia CSCW de 2019. Un robot visitó cerca de 53 mil páginas de producto en cerca de 11 mil tiendas online y encontró 1.818 apariciones de patrones engañosos de interfaz en 1.254 sitios, cerca del 11,1 por ciento de la muestra. Los autores examinaron cada aparición en busca de práctica engañosa y encontraron 183 sitios en esa situación.

La urgencia apareció en 437 sitios y la escasez en 609. Los números por tipo cuentan una historia útil para quien testea:

Apariciones de urgencia y escasez en el rastreo de 11 mil tiendasBarras horizontales con el total de apariciones por tipo y la parte engañosa. Contador regresivo: 393 apariciones, 157 engañosas en 140 sitios. Mensaje de tiempo limitado: 88 apariciones, todas sin plazo informado. Stock bajo: 632 apariciones, 17 engañosas en 17 sitios. Alta demanda: 47 apariciones, 38 mostradas en cualquier producto o carrito.urgencia y escasez en cerca de 11 mil tiendas (Mathur y coautores, 2019)contador regresivourgencia393, de las cuales 157 engañosastiempo limitado sin plazourgencia88, ninguna informa el plazostock bajoescasez632, de las cuales 17 engañosas (16 bajando por agenda, 1 sorteada)alta demandaescasez47, de las cuales 38 en cualquier productoengañosa según el criterio del estudiosin información o genéricafuente: CSCW 2019
Casi el 40 por ciento de los contadores encontrados eran engañosos: se reiniciaban al llegar a cero con la misma oferta vigente, o llegaban a cero y la oferta continuaba. En el stock bajo, el fraude era raro, pero el uso indiscriminado no: hay sitios que dicen “quedan X” en casi todos los productos.

Algunos detalles del artículo importan para diseñar un test honesto:

En enero de 2023, la Comisión Europea y autoridades de 23 Estados miembros, Noruega e Islandia divulgaron un rastreo parecido: 399 tiendas online verificadas, 148 con al menos uno de tres patrones investigados, y 42 sitios con contador falso con plazo para comprar productos específicos. La definición usada es la misma idea de Princeton: el contador es falso cuando se reinicia después de expirar con la misma oferta vigente, o cuando expira y la oferta continúa.

Y el efecto existe. La CMA registra que numerosos experimentos y estudios encuentran efecto de las afirmaciones de escasez sobre clics, compra, valor percibido y simpatía por la empresa, con evidencia mixta sobre qué formato funciona más: escasez de oferta (“quedan 2”) o de demanda (“25 personas lo están viendo”). Según la CMA, un experimento de Sugden, Wang y Zizzo encontró que quienes aceptaron ofertas con plazo, en vez de esperar para ver más opciones, terminaron en peor situación que quienes esperaron, y que el comportamiento de los participantes no mejoró con la experiencia. Para un equipo de CRO, la conclusión práctica es que la urgencia mueve el número. La pregunta es qué número, y durante cuánto tiempo.

Qué testear en urgencia y escasez: ecommerce y SaaS

Un test de urgencia bien diseñado no pregunta “¿contador o nada?”. Pregunta cómo comunicar un límite que ya existe. Si el límite no existe, no hay hipótesis que testear, hay una práctica que evitar.

palanca ecommerce: qué testear SaaS: qué testear trampa de medida
Formato del plazo real contador hasta el fin de la campaña contra fecha escrita (“termina el domingo, 23:59”) “tu descuento vale hasta el jueves” contra contador en el panel la conversión de la sesión sube porque el plazo quedó más visible, no porque compró más gente
Corte de despacho “pide en 2h13min y enviamos hoy” contra plazo de entrega sin horario “actívalo hasta el viernes y entra en el próximo grupo de implantación”, si el grupo es real compra anticipada: quien iba a comprar por la noche compra por la tarde
Stock y disponibilidad “quedan 3 en talla M”, procedente del stock, contra solo “disponible” plazas limitadas reales de un plan fundador o de implantación asistida número que cambia durante el test y es distinto entre los brazos
Posición aviso cerca del botón de compra contra arriba de la página recordatorio de fin de trial en el panel contra solo por correo el correo con el mismo plazo llega a los dos brazos
Intensidad aviso discreto contra color fuerte y animación un recordatorio contra una secuencia de recordatorios ganancia corta y caída de confianza a largo plazo
Oferta con plazo cupón de primera compra con validez descuento de upgrade al final del trial ingreso menor por cliente escondido detrás de más conversiones

Tres observaciones sobre esa matriz:

  1. El envío con corte de horario es la urgencia más defendible, porque el límite viene de la operación y el cliente gana información útil. Aun así, el estudio de Princeton cita un caso vecino, el contador de hasta cuándo pedir para tener envío gratis, como zona gris, y la ganancia medida puede ser solo anticipación. Es el caso del ejemplo trabajado 1. Para la otra mitad de esa decisión, el importe mínimo para envío gratis, ve test A/B de envío gratis.
  2. La oferta con plazo es, ante todo, un test de precio. La urgencia cambia el momento; el descuento cambia el margen. La guía de test A/B de descuentos y promociones trata la cuenta del margen, y el ejemplo trabajado 2 muestra qué pasa cuando las dos cosas vienen juntas.
  3. La alta demanda es prueba social con reloj. “12 personas compraron hoy” solo puede aparecer si el número se mide, por los mismos motivos descritos en prueba social en test A/B.

La urgencia también aparece fuera de la página de producto. El popup de salida suele llevar un cupón “solo ahora”, y el fin del trial es el punto de urgencia natural de todo SaaS, tratado en test A/B de trial a pago. En todos esos lugares vale la misma regla: el plazo es del cliente, y no cambia porque haya recargado la página.

Por qué la ganancia de urgencia y escasez engaña en el corto plazo

La urgencia mueve el cuándo antes de mover el cuánto. Un test que mide la conversión de la sesión, o del día, compara dos cosas distintas: en el control, parte de los compradores todavía no compró; en la variación, parte de ellos compró antes. Seis mecanismos hacen que el número corto exagere el efecto real.

1. Compra anticipada (pull-forward)

El cliente que iba a comprar el fin de semana compra hoy porque el contador dijo que el envío rápido se acaba en dos horas. En la ventana de 24 horas, eso aparece como conversión de más. En la ventana de 28 días, desaparece, porque el control también compró, solo que más tarde.

Compra acumulada por visitante: la variación sale por delante y el control la alcanzaDos curvas esquemáticas de porcentaje acumulado de visitantes que compraron, del día 0 al día 28. A 24 horas, control con 3,00 por ciento y variación con contador con 3,30 por ciento, diferencia de 10,0 por ciento relativos. En el día 28, control con 5,70 por ciento y variación con 5,80 por ciento, diferencia de 1,8 por ciento relativos. La distancia entre las curvas disminuye con el tiempo.compra anticipada: la ventaja del primer día casi desaparece en 28 días0%3%5,7%día 024 hdía 14día 2824 h: 3,30% contra 3,00%, más 10,0%día 28: 5,80% contra 5,70%, más 1,8%variación con contadorcontrolcurvas esquemáticas; solo los cuatro puntos marcados son números del escenario ilustrativo de esta guía
Lo que la variación gana el primer día es, en buena parte, adelanto. En el escenario, de los 420 compradores adicionales a 24 horas, quedan 140 adicionales a 28 días: dos tercios de la ganancia corta eran gente que habría comprado igual.

2. Efecto novedad y cansancio

Un contador nuevo llama la atención por ser nuevo. El cliente recurrente que ve el mismo aviso cada semana deja de reaccionar, y, si cada semana hay una promoción que “termina hoy”, aprende a esperar la siguiente. El primer efecto infla la primera semana; el segundo solo aparece meses después, y un test de cuatro semanas no lo ve. Las señales para separar novedad de efecto están en efecto novedad en test A/B, y el diseño que mide el efecto que sobrevive está en holdout de largo plazo.

3. Devolución y arrepentimiento

La presión de tiempo reduce el tiempo de búsqueda, y la compra menos pensada vuelve con más frecuencia. En Brasil, el art. 49 del Código de Defensa del Consumidor da siete días para desistir de un contrato hecho fuera del establecimiento comercial, y el Decreto 7.962/2013, que regula el comercio electrónico, trata del respeto a ese derecho. Un pedido de más que vuelve no es un pedido de más.

4. Cancelación y reembolso

En SaaS, el equivalente de la devolución es la cuenta que hace upgrade presionada por el plazo y cancela en el primer mes, o pide reembolso. La tasa de upgrade sube y la base de pago del mes siguiente no acompaña. El diseño de medición de cancelación está en flujo de cancelación sin dark pattern.

5. Recompra canibalizada

En categorías de recompra (cosmética, suplementos, comida para mascotas, café), el cliente que anticipó la compra por el plazo también aplaza la siguiente. La ventana de la métrica necesita ser lo bastante larga para captar el ciclo de recompra, o el test registra como ganancia lo que es solo un desplazamiento en el calendario.

6. Margen

Si la urgencia viene con descuento, cada conversión de la variación vale menos. Una variación puede ganar en pedidos y perder en ingresos. En ecommerce, la métrica que decide es el ingreso por visitante neto de devolución; en SaaS, el ingreso por cuenta expuesta. La calculadora de ingresos por visitante ayuda a dimensionar esa lectura.

Métricas de guardarraíl y ventana de medición

La regla práctica de esta guía: primaria con ventana larga y fija por visitante; guardarraíl en el valor que queda; compra rápida solo como diagnóstico. La ventana se cuenta a partir de la primera exposición de cada visitante, y es igual para todos, si no, quien entró el último día del test tiene menos tiempo para convertir que quien entró el primero.

Línea de tiempo de un test de urgencia con ventana fija por visitanteTres franjas en una línea de tiempo de 70 días. Exposición del día 0 al día 28. Ventana de compra de 28 días a partir de la primera visita de cada visitante, que para el último expuesto termina en el día 56. Plazo de devolución después de la compra, que empuja la lectura del guardarraíl a después del día 56. Marcas: espiar en la semana 1 es engañoso; lectura de la primaria en el día 56; lectura del guardarraíl después de eso.la lectura final no ocurre cuando el test deja de exponer visitantesdía 0día 28día 56día 70exposición: 4 semanasventana de compra: 28 días por visitanteplazo de devolución de los pedidosespiar aquí engañalee la primarialee el guardarraílplazos ilustrativos: ajusta la ventana al ciclo de compra y el plazo de devolución a tu política
Un test de urgencia de cuatro semanas pide, en la práctica, dos meses o más de calendario. Es el precio de medir el efecto que queda en vez del efecto que adelanta. La lógica de cohorte que sustenta esto está en madurez de cohorte.
palanca primaria guardarraíl diagnóstico ventana sugerida
contador de promoción (ecommerce) comprador a N días desde la primera exposición ingreso neto de devolución por visitante compra en la sesión, clic en el contador ciclo de compra de la categoría, como mínimo 28 días
corte de despacho comprador a N días tasa de devolución y comprador que mantuvo el pedido compra antes del horario de corte 28 días más el plazo de devolución
stock bajo comprador a N días devolución, contacto con atención al cliente sobre disponibilidad añadir al carrito la talla avisada 28 días
descuento de upgrade con plazo (SaaS) cuenta de pago en el día 60 cancelación con reembolso, ingreso por cuenta upgrade dentro del plazo hasta después de la primera renovación o del fin del plazo de reembolso
recordatorio de fin de trial cuenta de pago en el día 60 ingreso por cuenta, tickets de soporte clic en el recordatorio 60 días

Tres cuidados de diseño completan la tabla:

Ejemplo trabajado 1: el contador del corte de despacho

Escenario (ilustrativo). Una tienda online de hogar y decoración recibe 70.000 visitantes por semana en las páginas de producto. Hoy, el 3,0 por ciento de los visitantes compra en las primeras 24 horas después de la primera visita, y el 5,7 por ciento compra en 28 días. El centro de distribución despacha el mismo día los pedidos pagados hasta las 14h. La hipótesis: mostrar “pide en 2h13min y enviamos hoy”, con el horario real de corte, cerca del botón de compra, hace que compre más gente.

Métricas declaradas antes. Diagnóstico: compra en 24 horas. Primaria: comprador a 28 días desde la primera exposición. Guardarraíl: tasa de devolución entre compradores y visitante que compró y mantuvo el pedido. Ventana y lectura final marcadas en el plan: exposición de 28 días, lectura de la primaria en el día 56, lectura del guardarraíl después del plazo de devolución.

Muestra. El equipo quiere ver un 8 por ciento relativo en la compra a 24 horas, la métrica más sensible. En la calculadora de abajo, escribe: tasa de conversión actual 3; efecto mínimo detectable 8, relativo; confianza 95; potencia 80; visitantes por semana 70000; test bilateral.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La pantalla muestra 82.376 visitantes por variación, 164.752 en total y 17 días. El equipo redondea a cuatro semanas completas, 28 días, lo que da 140.000 visitantes por brazo. La sensibilidad al efecto mínimo, cambiando solo ese campo:

efecto relativo que quieres detectar visitantes por variación total días a 70.000 por semana
5% 207.938 415.876 42
8% 82.376 164.752 17
10% 53.211 106.422 11
15% 24.193 48.386 5

La espiada de la primera semana. Con 35.000 visitantes por brazo, eran 1.050 compras a 24 horas en el control y 1.239 en la variación: más 18,0 por ciento, valor p menor que 0,0001 (0,000059 con más decimales). En las semanas 2 a 4, con 105.000 por brazo, el marcador fue 3.150 contra 3.381, más 7,3 por ciento, valor p de 0,0037. La primera semana más fuerte es el patrón esperado de novedad. Parar ahí habría registrado casi el doble del efecto a 24 horas que mostró el test completo, y ni siquiera habría llegado a la métrica primaria. El coste de decidir pronto está en el problema del peeking.

El efecto del contador según la ventana y el periodo observadosBarras horizontales de mejora relativa. Compra a 24 horas en la semana 1: más 18,0 por ciento. Compra a 24 horas en las semanas 2 a 4: más 7,3 por ciento. Compra a 24 horas en las 4 semanas: más 10,0 por ciento. Comprador a 28 días: más 1,8 por ciento, sin significancia.cuanto más corta la lectura, mayor la ganancia que aparece24 h, semana 1+18,0%24 h, semanas 2 a 4+7,3%24 h, test completo+10,0%comprador a 28 días+1,8%, sin significanciaescenario ilustrativo calculado con el motor de las calculadoras del blog; escala de 0 a 20 por ciento
El mismo test produce cuatro titulares distintos según la ventana y el momento de la lectura. Solo el último responde a la pregunta que hizo el negocio: ¿el contador trajo compradores nuevos?

El resultado de la métrica de diagnóstico, en 28 días de exposición.

brazo visitantes compraron en 24 h tasa
A, plazo de entrega sin horario 140.000 4.200 3,00%
B, contador del corte de despacho 140.000 4.620 3,30%

La división es de 140.000 contra 140.000, sin alerta de SRM. Pega en la calculadora de significancia: control con 140000 visitantes y 4200 conversiones; variación con 140000 visitantes y 4620 conversiones; confianza 95.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

La pantalla muestra 3,00% contra 3,30%, mejora relativa de +10,0%, valor p menor que 0,0001 (la pantalla escribe el signo de menor antes del número), intervalo del 95 por ciento de la diferencia de +0,2% … +0,4% (pp) y el veredicto Ganadora con significancia · B gana. Con más decimales, el valor p es 0,000006 y el intervalo va de más 0,1706 a más 0,4294 punto porcentual, cerca de más 5,7 a más 14,3 por ciento en términos relativos. Son 420 compradores adicionales el primer día.

La primaria, en el día 56. Cuando la ventana de 28 días cierra para el último visitante expuesto:

brazo visitantes compraron en 28 días tasa
A 140.000 7.980 5,70%
B 140.000 8.120 5,80%

En la misma calculadora, escribe 140000 y 7980 contra 140000 y 8120. La pantalla muestra 5,70% contra 5,80%, mejora de +1,8%, valor p de 0,2557, intervalo de -0,1% … +0,3% (pp) y Todavía sin significancia. Con más decimales, la mejora es de 1,75 por ciento y el intervalo va de menos 0,0725 a más 0,2725 punto porcentual, cerca de menos 1,3 a más 4,8 por ciento relativos.

De los 420 compradores adicionales a 24 horas, quedaron 140 adicionales a 28 días. Los otros 280, dos tercios, compraron también en el control, solo que después.

Esto no es falta de muestra. La calculadora no muestra potencia, así que la cuenta a continuación es de esta guía, con la misma fórmula: con 140.000 por brazo y base de 5,7 por ciento, la potencia para detectar un 8 por ciento relativo en compradores a 28 días era del 99,9 por ciento, y el menor efecto que ese tamaño ve con un 80 por ciento de potencia es cerca de un 4,3 por ciento relativo. El intervalo de menos 1,3 a más 4,8 por ciento deja fuera el 10,0 por ciento de la lectura corta. La calculadora de potencia estadística hace esa cuenta con tus números.

El guardarraíl, después del plazo de devolución.

brazo compradores a 28 días devolvieron tasa de devolución visitantes que compraron y mantuvieron tasa por visitante
A 7.980 1.036 12,98% 6.944 4,96%
B 8.120 1.160 14,29% 6.960 4,97%

Para la devolución, escribe los compradores como “visitantes” y las devoluciones como “conversiones”: 7980 y 1036 contra 8120 y 1160. La pantalla muestra 12,98% contra 14,29%, mejora de +10,0%, valor p de 0,0160, intervalo de +0,2% … +2,4% (pp) y “Ganadora con significancia · B gana”. Aquí la calculadora solo dice que la tasa de B es mayor, y en esta métrica mayor es peor: el guardarraíl saltó.

Para los compradores que mantuvieron el pedido, escribe 140000 y 6944 contra 140000 y 6960. La pantalla muestra 4,96% contra 4,97%, mejora de +0,2%, valor p de 0,8893, intervalo de -0,1% … +0,2% (pp) y Todavía sin significancia. Con más decimales, la mejora es de 0,23 por ciento y el intervalo va de menos 0,1495 a más 0,1724 punto porcentual, cerca de menos 3,0 a más 3,5 por ciento relativos. La potencia para ver un 8 por ciento en esa métrica era del 99,7 por ciento, por la misma fórmula.

Intervalos de confianza del contador en cuatro métricasIntervalos del 95 por ciento en efecto relativo, en un eje de menos 5 a más 20 por ciento. Compra a 24 horas: más 10,0 por ciento, de más 5,7 a más 14,3. Comprador a 28 días: más 1,8 por ciento, de menos 1,3 a más 4,8. Tasa de devolución: más 10,0 por ciento, de más 1,9 a más 18,2, y en esta métrica subir es malo. Comprador que mantuvo el pedido: más 0,2 por ciento, de menos 3,0 a más 3,5.el mismo contador, cuatro preguntas, cuatro respuestas-5%0%+5%+10%+15%+20%compra a 24 h+10,0%comprador a 28 días+1,8%, p = 0,2557tasa de devoluciónsubir es malo+10,0%, p = 0,0160compró y mantuvo+0,2%, p = 0,8893intervalo relativo aproximado: intervalo de la diferencia dividido por la tasa del control. Escenario ilustrativo.
El contador vendió más rápido, no más. De los 140 compradores adicionales a 28 días, 124 devolvieron (1.160 menos 1.036), y el saldo es de 16 pedidos mantenidos de más en 280.000 visitantes.

Qué hacer con él. No hay motivo para lanzar el contador como “más 10 por ciento en ventas”. Hay dos caminos honestos. El primero es mantener la información de despacho sin el contador animado, como fecha escrita (“los pedidos hasta las 14h salen hoy”), que da al cliente el dato útil sin la presión, y testear eso contra el control con la misma primaria y el mismo guardarraíl. El segundo es aceptar que el contador es una herramienta de flujo de caja (vender antes) y no de crecimiento, y decidir si eso compensa el coste de las devoluciones. Los dos empiezan por abandonar la lectura de 24 horas como métrica de decisión.

Ejemplo trabajado 2: descuento de upgrade con plazo al final del trial

Escenario (ilustrativo). Un SaaS B2B tiene 1.500 cuentas por semana llegando al final del trial de 14 días. Hoy, el 12 por ciento de ellas hace upgrade en las 72 horas siguientes, por el plan anual de R$ 1.200. La hipótesis: ofrecer un 30 por ciento de descuento en el plan anual a quien haga upgrade en hasta 72 horas, con el plazo registrado por cuenta en el servidor y la misma fecha en cualquier login, aumenta la conversión de pago. La oferta es real: quien no la aprovecha paga el precio completo después.

Métricas declaradas antes. Diagnóstico: upgrade en 72 horas. Primaria: cuenta de pago en el día 60 (después del plazo de reembolso). Guardarraíl: tasa de cancelación con reembolso entre quienes hicieron upgrade, e ingreso por cuenta expuesta.

Muestra. Con el volumen de cuentas, el equipo acepta ver solo efectos del 20 por ciento relativo o más. En la misma calculadora de tamaño de muestra de más arriba, escribe: tasa actual 12; efecto mínimo 20, relativo; confianza 95; potencia 80; visitantes por semana 1500 (aquí, cuentas en fin de trial); bilateral. La pantalla muestra 3.122 por variación, 6.244 en total y 30 días. El equipo corre cinco semanas completas: 7.500 cuentas, 3.750 por brazo.

efecto relativo que quieres detectar cuentas por variación total días a 1.500 por semana
15% 5.443 10.886 51
20% 3.122 6.244 30
25% 2.036 4.072 20
30% 1.440 2.880 14

El diagnóstico: upgrade en 72 horas. En la calculadora de significancia, escribe 3750 y 450 contra 3750 y 585. La pantalla muestra 12,00% contra 15,60%, mejora de +30,0%, valor p menor que 0,0001, intervalo de +2,0% … +5,2% (pp) y Ganadora con significancia · B gana. Es el tipo de número que se convierte en diapositiva.

Qué pasa hasta el día 60.

métrica A, precio completo B, 30% con plazo de 72 h mejora relativa valor p lectura
upgrade en 72 horas 450 de 3.750 (12,00%) 585 de 3.750 (15,60%) +30,0% menor que 0,0001 significativo
upgrades hasta el día 60 510 (450 en el plazo, 60 después) 615 (585 en el plazo, 30 después)
cancelación con reembolso entre quienes hicieron upgrade 45 de 510 (8,82%) 120 de 615 (19,51%) +121,1% menor que 0,0001 el guardarraíl saltó
cuenta de pago en el día 60 465 de 3.750 (12,40%) 495 de 3.750 (13,20%) +6,5% 0,2998 sin significancia
ingreso anual contratado por cuenta expuesta R$ 148,80 R$ 113,28 -23,9% contabilidad del escenario

Para comprobar la cuenta de pago, escribe 3750 y 465 contra 3750 y 495: la pantalla muestra 12,40% contra 13,20%, mejora de +6,5%, valor p de 0,2998, intervalo de -0,7% … +2,3% (pp) y Todavía sin significancia. Con más decimales, el intervalo va de menos 0,7121 a más 2,3121 puntos porcentuales, cerca de menos 5,7 a más 18,6 por ciento relativos. Para el guardarraíl, escribe 510 y 45 contra 615 y 120: la pantalla muestra 8,82% contra 19,51%, +121,1%, valor p menor que 0,0001 e intervalo de +6,7% … +14,7% (pp).

El ingreso no pasa por test estadístico aquí; es aritmética del escenario. En el control, 465 cuentas pagan R$ 1.200: R$ 558.000, o R$ 148,80 por cuenta expuesta. En la variación, de las 495 de pago, 470 hicieron upgrade en el plazo y pagan R$ 840, y 25 hicieron upgrade después y pagan R$ 1.200: R$ 394.800 más R$ 30.000, R$ 424.800, o R$ 113,28 por cuenta. Medir esa diferencia con rigor pide un test de media, como se describe en la guía de tamaño de muestra para métricas continuas.

Descuento con plazo al final del trial: del upgrade rápido al ingresoPares de barras control y variación. Upgrade en 72 horas: 12,00 contra 15,60 por ciento. Cancelación con reembolso entre quienes hicieron upgrade: 8,82 contra 19,51 por ciento. Cuenta de pago en el día 60: 12,40 contra 13,20 por ciento, sin significancia. Ingreso anual por cuenta expuesta: 148,80 contra 113,28 reales, un 23,9 por ciento menos.la variación gana en la primera métrica y pierde en la últimaupgrade en 72 hA 12,00%B 15,60%, +30,0%canceló con reembolsoentre quienes hicieron upgradeA 8,82%B 19,51%de pago en el día 60A 12,40%B 13,20%, sin significanciaingreso por cuentaA R$ 148,80B R$ 113,28, menos 23,9%tasas en escala de 10 px por punto porcentual; ingreso en escala propia. Escenario ilustrativo.
De las 135 cuentas que hicieron upgrade de más en el plazo, 75 cancelaron con reembolso de más, y casi todas las que quedaron (470 de 495) pagan un 30 por ciento menos. Ninguna de esas pérdidas aparece en la ventana de 72 horas.

Y la primaria no tenía cómo responder bien. Por la misma fórmula, con 3.750 cuentas por brazo y base del 12,4 por ciento, la potencia para detectar un 15 por ciento relativo en cuenta de pago era de cerca del 66 por ciento, y el menor efecto visible con un 80 por ciento de potencia es cerca del 17,2 por ciento. Detectar un 15 por ciento pediría 5.241 cuentas por variación, 49 días. El resultado “sin significancia” en cuenta de pago es poca evidencia por ambos lados, pero el ingreso ya decide: aunque la ganancia del 6,5 por ciento en cuentas de pago fuera real, no compensa un descuento del 30 por ciento.

Qué hacer con él. No lanzar el descuento tal como está. Hipótesis mejores salen del propio resultado: un recordatorio de fin de trial con plazo real y sin descuento (testea solo la urgencia), un descuento menor en el plan anual sin plazo apretado (testea solo el precio), o un plazo más largo que dé tiempo al equipo del cliente a evaluar. Todas con la misma primaria y el guardarraíl de reembolso. El razonamiento de cohorte para leer la cancelación está en madurez de cohorte en test A/B, y la lectura de churn está en reduciendo el churn con experimentación.

La pregunta “¿el contador es verdadero?” viene antes de “¿el contador convierte?”, porque el panel del test mide comportamiento, no veracidad. Un contador que se reinicia puede ganar un test A/B con holgura y aun así ser una práctica prohibida en varios mercados.

jurisdicción regla qué dice, en resumen qué cambia en un test
Unión Europea Directiva 2005/29/CE (prácticas comerciales desleales), Anexo I, punto 7 entre las prácticas desleales en cualquier circunstancia: declarar falsamente que un producto solo estará disponible, o solo en ciertas condiciones, durante un tiempo muy limitado, para obtener una decisión inmediata y privar al consumidor de tiempo para elegir con información un contador que se reinicia o una oferta que continúa después del plazo no es una variación testeable
Unión Europea rastreo de la red CPC, divulgado el 30/01/2023 399 tiendas verificadas, 148 con al menos uno de los tres patrones investigados, 42 con contador falso; las autoridades nacionales contactarían a las empresas para corregirlo el criterio de contador falso es verificable por cualquier visitante que vuelva a la página
Reino Unido Digital Markets, Competition and Consumers Act 2024, Anexo 20, punto 7, en vigor desde el 06/04/2025 la misma práctica de la directiva, con la expresión “por tiempo limitado” el plazo tiene que ser real y sostenible por registro
Reino Unido CMA, documento de discusión sobre arquitectura de elección online, abril de 2022 las afirmaciones de escasez falsas o engañosas, como contadores que se reinician y stock exagerado o sin comprobación, pueden presionar indebidamente; en el caso de las reservas de hotel, las plataformas se comprometieron a hacer más precisos los mensajes de disponibilidad el mensaje de demanda tiene que medir lo que dice (misma fecha, mismo producto)
Estados Unidos FTC, informe del equipo “Bringing Dark Patterns to Light”, septiembre de 2022 cita como dark patterns el stock bajo falso, la alta demanda falsa, el contador sin base que desaparece o se reinicia al llegar a cero, el mensaje de tiempo limitado sin plazo o con plazo que se reinicia y el descuento falso es un informe del equipo, no una norma; aun así, describe lo que la agencia considera engañoso
Brasil Código de Defensa del Consumidor, arts. 30, 35, 37, 38 y 39 la información o publicidad suficientemente precisa obliga al proveedor; si hay negativa, el consumidor puede exigir su cumplimiento; se prohíbe la publicidad engañosa, incluida la total o parcialmente falsa u omisa capaz de inducir al consumidor a error; la carga de probar la veracidad es de quien la patrocina; es práctica abusiva prevalerse de la debilidad o ignorancia del consumidor, atendiendo a edad, salud, conocimiento o condición social, para imponerle productos el plazo y el stock exhibidos tienen que ser comprobables, y una oferta precisa mostrada en una variación puede obligar a la tienda ante quien la vio

Esto es contexto, no una opinión jurídica. En la práctica, cinco reglas mantienen un test de urgencia del lado correcto de la línea:

  1. Todo plazo tiene fecha y hora, y la oferta termina cuando el plazo termina.
  2. Todo plazo pertenece al cliente o a la campaña, guardado en el servidor. Recargar la página, cambiar de dispositivo o volver mañana no reinicia nada.
  3. Todo número de stock viene del stock, y todo número de demanda viene de una medida con periodo y producto declarados.
  4. “Por poco tiempo” sin plazo no entra en una variación. Si el plazo no se conoce, el mensaje no es verdadero.
  5. La oferta vale para quien la vio. En un test de descuento con plazo, la variación crea una oferta real para quien fue aleatorizado a ella, y el equipo de atención tiene que saberlo.

Checklist antes de testear urgencia y escasez

  1. ¿El límite existe? Plazo, horario de corte, stock o plazas reales, comprobables por registro.
  2. El plazo es por cliente o por campaña, en el servidor, igual en cualquier dispositivo.
  3. Primaria con ventana larga y fija por visitante, contada desde la primera exposición.
  4. Guardarraíl declarado con umbral: devolución, cancelación con reembolso, ingreso neto.
  5. Muestra dimensionada para la métrica que decide, no para la que sube primero.
  6. Lectura final marcada en el calendario: exposición más ventana más plazo del guardarraíl.
  7. Semanas completas, sin decisión en la primera semana.
  8. Filtración controlada: el correo, el anuncio y el banner con el mismo plazo están en los dos brazos o en ninguno.
  9. Nuevos y recurrentes leídos por separado, declarados antes, porque la novedad pesa distinto.
  10. SRM comprobado antes de leer cualquier efecto, sobre todo cuando el contador es un script de terceros.

Errores comunes

Hazlo automático en Donnu

El dolor específico de testear urgencia y escasez es que la ganancia aparece en horas y la cuenta llega en semanas: compra anticipada, devolución, reembolso e ingreso menor por cliente. Ninguna herramienta resuelve eso sola, pero algunas decisiones de configuración hacen el error menos probable.

En Donnu, el objetivo de conversión se puede confirmar desde tu servidor (server-to-server), por ejemplo un pedido pagado confirmado por el webhook de la pasarela, en vez de un clic en el botón de comprar. Cada experimento acepta dos métricas en el plan Estándar y tres en el Pro; en el Pro, eso cabe el núcleo del diseño de esta guía: una primaria, un guardarraíl y un diagnóstico, declarados antes de correr. Los objetivos son de conversión, así que los guardarraíles calculados sobre compradores o en dinero, como tasa de devolución e ingreso neto, siguen viniendo de tus propios datos. En el plan Pro, la segmentación incluye tipo de visitante (nuevo o recurrente) y programación, y el informe muestra los segmentos y la línea de tiempo de la probabilidad de que la variación sea mejor, lo que deja visible una ventaja de primera semana que se encoge después. El informe es bayesiano y muestra esa probabilidad con el intervalo de la mejora.

Lo que sigue siendo tuyo: garantizar que el plazo y el stock exhibidos son verdaderos, esperar a que la ventana cierre y leer el guardarraíl antes de decidir. Para las cuentas, la calculadora de tamaño de muestra, la calculadora de significancia y la calculadora de potencia estadística hacen los números de esta guía con tus datos, gratis.

Referencias

Lee también: Prueba social en test A/B · Popup de salida en test A/B · Test A/B de descuentos y promociones · Efecto novedad · Métricas de guardarraíl · Test A/B de página de producto · Trial a pago · Leia em português · Read in English

Preguntas frecuentes

¿El contador regresivo aumenta la conversión?
Con frecuencia aumenta la compra rápida, y ese es justamente el problema: parte de la ganancia es compra anticipada, no compra nueva. En el ejemplo trabajado de esta guía, un contador real del horario de corte de despacho aumenta un 10,0 por ciento la compra en las primeras 24 horas, con valor p menor que 0,0001, pero la compra en 28 días sube solo un 1,8 por ciento, con valor p de 0,2557. De los 420 compradores adicionales del primer día, 280 habrían comprado igual, solo que después.
¿Está prohibido el contador falso o el stock inventado?
En la Unión Europea, la Directiva 2005/29/CE incluye entre las prácticas desleales en cualquier circunstancia declarar falsamente que un producto solo estará disponible por un tiempo muy limitado para obtener una decisión inmediata. En el Reino Unido, la regla equivalente está en el Anexo 20 de la ley DMCC de 2024, en vigor desde el 6 de abril de 2025. En Estados Unidos, el informe del equipo de la FTC de 2022 cita el contador sin base, el stock bajo falso y la alta demanda falsa como dark patterns. En Brasil, el Código de Defensa del Consumidor prohíbe la publicidad engañosa, que incluye la información publicitaria total o parcialmente falsa capaz de inducir al consumidor a error. Esto es contexto, no una opinión jurídica.
¿Qué métrica usar en un test de urgencia?
Una primaria con ventana larga y fija por visitante, no la conversión en la sesión. En ecommerce, comprador a 28 días desde la primera exposición, con guardarraíl en devolución y en comprador que mantuvo el pedido. En SaaS, cuenta de pago en el día 60, con guardarraíl en cancelación con reembolso y en ingreso por cuenta. La compra rápida entra como diagnóstico, porque es la métrica que la urgencia más infla.
¿Cuánto tiempo hay que medir un test de urgencia y escasez?
El periodo de exposición más la ventana de la métrica primaria más el plazo del guardarraíl. En el ejemplo de ecommerce de esta guía, el test expone visitantes durante 28 días, cada visitante se sigue durante 28 días y la devolución cierra después de eso, así que la lectura final solo llega cerca del día 56 y el guardarraíl de devolución aún más tarde. Parar en la primera semana habría registrado un más 18,0 por ciento, casi el doble del efecto a 24 horas del test completo.
¿Cuánto tráfico hace falta para testear un contador regresivo?
Con un 3 por ciento de compra en 24 horas, un 95 por ciento de confianza y un 80 por ciento de potencia, detectar un 8 por ciento relativo exige 82.376 visitantes por variación, 17 días a 70 mil visitantes por semana. Detectar un 5 por ciento exige 207.938 por variación y 42 días. En un SaaS con un 12 por ciento de upgrade en 72 horas y 1.500 fines de trial por semana, detectar un 20 por ciento relativo exige 3.122 cuentas por variación y 30 días.
¿Vale la pena un descuento con plazo al final del trial?
Puede aumentar el upgrade rápido y reducir el ingreso. En el ejemplo SaaS de esta guía, un 30 por ciento de descuento con plazo de 72 horas aumenta el upgrade un 30,0 por ciento, pero la cuenta de pago en el día 60 sube solo un 6,5 por ciento, sin significancia, la cancelación con reembolso entre quienes hicieron upgrade pasa de 8,82 a 19,51 por ciento y el ingreso por cuenta cae un 23,9 por ciento. La decisión depende del ingreso neto, no de la tasa de upgrade.