CRO

Urgência e Escassez em Teste A/B: o que medir de verdade

Urgência e escassez em teste A/B: contador, estoque baixo e prazo de oferta. O que testar, a janela que desmascara o ganho e onde começa o dark pattern.

Ilustração plana de duas ampulhetas numa prateleira verde, uma lupa examinando a areia que cai, um carrinho de compras pequeno ao lado e uma caixa verde grande à direita, sobre fundo verde-menta

Urgência e escassez são sinais de que uma oportunidade vai acabar: um contador até o fim da promoção, “últimas unidades”, estoque baixo, prazo de oferta, horário de corte para despacho no mesmo dia, desconto de upgrade que expira. Num teste A/B, elas quase sempre aumentam a conversão rápida, e é por isso que enganam: boa parte do ganho é compra que aconteceria de qualquer jeito, só que depois. No exemplo trabalhado deste guia, um contador real do horário de corte aumenta a compra em 24 horas em 10,0 por cento, com valor-p menor que 0,0001, e a compra em 28 dias em só 1,8 por cento, com valor-p de 0,2557. Este guia faz parte do nosso guia completo de otimização de conversão (CRO) e cobre o que a pesquisa mostra, o que testar em ecommerce e em SaaS, por que o ganho de curto prazo engana, que métricas de guarda usar, como escolher a janela de medição e onde a urgência vira dark pattern.

O que são urgência e escassez numa página

Os dois termos descrevem a mesma alavanca vista de lados diferentes. Urgência é um limite de tempo: a oferta acaba numa data, o frete rápido tem horário de corte, o desconto de upgrade vale por 72 horas. Escassez é um limite de quantidade ou de disponibilidade: restam três unidades, o tamanho está acabando, há poucas vagas na turma de implantação. Na prática aparecem juntas, e a pesquisa sobre padrões enganosos de interface também as trata como categorias vizinhas.

O Nielsen Norman Group descreve o princípio da escassez como o fenômeno que faz as pessoas atribuírem mais valor ao que percebem como menos disponível, e o liga à aversão à perda: perder pesa mais que ganhar. O mesmo texto registra o risco principal, que é a perda de confiança quando o visitante desconfia de que a escassez não é real, e recomenda usá-la com moderação e com informação verdadeira.

O CMA, a autoridade de concorrência e consumo do Reino Unido, resume num documento de discussão de 2022 por que isso mexe com decisão: a pressão de tempo leva as pessoas a usar atalhos mentais, olhar menos atributos e decidir por hábito. O mesmo documento reconhece o lado bom: quando a afirmação é verdadeira, ela ajuda o consumidor a não perder um produto de fato escasso e, possivelmente, a vencer a procrastinação.

Para quem testa, essa dupla natureza é a questão central. A mesma pressão que ajuda quem ia comprar e adiava também empurra quem não precisava comprar agora, e o painel do teste não separa um do outro se a métrica for curta.

Os seis formatos mais comuns

formato exemplo na página onde aparece versão real versão enganosa
Contador até o fim da oferta “a promoção termina em 05:12:40” página de produto, cabeçalho, carrinho prazo fixo, igual para todos, que acaba de fato reinicia ao zerar ou a cada visita
Mensagem de tempo limitado “só por pouco tempo” banner, página de categoria data e hora escritas sem prazo nenhum
Corte de despacho “peça em 2h13min e enviamos hoje” página de produto, checkout horário real do centro de distribuição horário que nunca chega
Estoque baixo “restam 3 unidades” página de produto, seleção de tamanho número vindo do estoque número sorteado ou descendo por agenda
Alta demanda “muito procurado hoje” carrinho, página de produto medida real de vendas ou visitas mesma frase em todo produto
Oferta de upgrade com prazo “30% no plano anual até quinta” fim do trial, painel do SaaS prazo por conta, registrado no servidor prazo que volta a zero a cada login

A última coluna é a razão de este guia ter uma seção inteira sobre ética e lei. Em urgência e escassez, a linha entre hipótese de teste e prática enganosa passa pelo mesmo elemento visual, e só a origem do número a define.

O que a pesquisa mostra sobre urgência e escassez falsas

O estudo mais citado sobre o tema é a varredura de Mathur e coautores, de Princeton e da Universidade de Chicago, publicada na conferência CSCW de 2019. Um robô visitou cerca de 53 mil páginas de produto em cerca de 11 mil lojas online e encontrou 1.818 ocorrências de padrões enganosos de interface em 1.254 sites, cerca de 11,1 por cento da amostra. Os autores examinaram cada ocorrência em busca de prática enganosa e encontraram 183 sites nessa situação.

Urgência apareceu em 437 sites e escassez em 609. Os números por tipo contam uma história útil para quem testa:

Ocorrências de urgência e escassez na varredura de 11 mil lojasBarras horizontais com o total de ocorrências por tipo e a parte enganosa. Contador regressivo: 393 ocorrências, 157 enganosas em 140 sites. Mensagem de tempo limitado: 88 ocorrências, todas sem prazo informado. Estoque baixo: 632 ocorrências, 17 enganosas em 17 sites. Alta demanda: 47 ocorrências, 38 exibidas em qualquer produto ou carrinho.urgência e escassez em cerca de 11 mil lojas (Mathur e coautores, 2019)contador regressivourgência393, das quais 157 enganosastempo limitado sem prazourgência88, nenhuma informa o prazoestoque baixoescassez632, das quais 17 enganosas (16 descendo por agenda, 1 sorteada)alta demandaescassez47, das quais 38 em qualquer produtoenganosa pelo critério do estudosem informação ou genéricafonte: CSCW 2019
Quase 40 por cento dos contadores encontrados eram enganosos: reiniciavam ao zerar com a mesma oferta valendo, ou zeravam e a oferta continuava. No estoque baixo, a fraude era rara, mas o uso indiscriminado não: há sites que dizem “restam X” em quase todo produto.

Alguns detalhes do artigo importam para desenhar um teste honesto:

Em janeiro de 2023, a Comissão Europeia e autoridades de 23 Estados-membros, Noruega e Islândia divulgaram uma varredura parecida: 399 lojas online verificadas, 148 com pelo menos um de três padrões pesquisados, e 42 sites com contador falso com prazo para comprar produtos específicos. A definição usada é a mesma ideia de Princeton: o contador é falso quando reinicia depois de expirar com a mesma oferta valendo, ou quando expira e a oferta continua.

E o efeito existe. O CMA registra que numerosos experimentos e estudos encontram efeito de afirmações de escassez sobre cliques, compra, valor percebido e simpatia pela empresa, com evidência mista sobre qual formato funciona mais: escassez de oferta (“restam 2”) ou de demanda (“25 pessoas estão vendo”). Segundo o CMA, um experimento de Sugden, Wang e Zizzo encontrou que quem aceitou ofertas com prazo, em vez de esperar para ver mais opções, terminou em situação pior do que quem esperou, e que o comportamento dos participantes não melhorou com a experiência. Para um time de CRO, a conclusão prática é que urgência mexe no número. A pergunta é que número, e por quanto tempo.

O que testar em urgência e escassez: ecommerce e SaaS

Um teste de urgência bem desenhado não pergunta “contador ou nada?”. Pergunta como comunicar um limite que já existe. Se o limite não existe, não há hipótese a testar, há uma prática a evitar.

alavanca ecommerce: o que testar SaaS: o que testar armadilha de medida
Formato do prazo real contador até o fim da campanha contra data escrita (“termina domingo, 23h59”) “seu desconto vale até quinta” contra contador no painel conversão da sessão sobe porque o prazo ficou mais visível, não porque mais gente comprou
Corte de despacho “peça em 2h13min e enviamos hoje” contra prazo de entrega sem horário “ative até sexta e entre na próxima turma de implantação”, se a turma for real compra antecipada: quem ia comprar à noite compra à tarde
Estoque e disponibilidade “restam 3 no tamanho M”, vindo do estoque, contra só “disponível” vagas limitadas reais de um plano de fundador ou de implantação assistida número que muda durante o teste e diferente entre os braços
Posição aviso perto do botão de compra contra no topo da página lembrete de fim de trial no painel contra só por e-mail e-mail com o mesmo prazo chega aos dois braços
Intensidade aviso discreto contra cor forte e animação um lembrete contra sequência de lembretes ganho curto e queda de confiança no longo prazo
Oferta com prazo cupom de primeira compra com validade desconto de upgrade no fim do trial receita menor por cliente escondida atrás de mais conversões

Três observações sobre essa matriz:

  1. Frete com corte de horário é a urgência mais defensável, porque o limite vem da operação e o cliente ganha informação útil. Ainda assim, o estudo de Princeton cita um caso vizinho, o contador de até quando pedir para ter frete grátis, como zona cinzenta, e o ganho medido pode ser só antecipação. É o caso do exemplo trabalhado 1. Para a outra metade dessa decisão, o valor mínimo para frete grátis, veja teste A/B de frete grátis.
  2. Oferta com prazo é, antes de tudo, teste de preço. A urgência muda o momento; o desconto muda a margem. O guia de teste A/B de desconto e promoção trata a conta da margem, e o exemplo trabalhado 2 mostra o que acontece quando as duas coisas vêm juntas.
  3. Alta demanda é prova social com relógio. “12 pessoas compraram hoje” só pode aparecer se o número for medido, pelos mesmos motivos descritos em prova social em teste A/B.

A urgência também aparece fora da página de produto. O pop-up de saída costuma carregar um cupom “só agora”, e o fim do trial é o ponto de urgência natural de todo SaaS, tratado em teste A/B de trial para pago. Em todos esses lugares vale a mesma regra: o prazo é do cliente, e não muda porque ele recarregou a página.

Por que o ganho de urgência e escassez engana no curto prazo

Urgência mexe no quando antes de mexer no quanto. Um teste que mede a conversão da sessão, ou do dia, compara duas coisas diferentes: no controle, parte dos compradores ainda não comprou; na variação, parte deles comprou antes. Seis mecanismos fazem o número curto exagerar o efeito real.

1. Compra antecipada (pull-forward)

O cliente que ia comprar no fim de semana compra hoje porque o contador disse que o frete rápido acaba em duas horas. Na janela de 24 horas, isso aparece como conversão a mais. Na janela de 28 dias, desaparece, porque o controle também comprou, só que mais tarde.

Compra acumulada por visitante: a variação sai na frente e o controle alcançaDuas curvas esquemáticas de porcentagem acumulada de visitantes que compraram, do dia 0 ao dia 28. Em 24 horas, controle com 3,00 por cento e variação com contador com 3,30 por cento, diferença de 10,0 por cento relativos. No dia 28, controle com 5,70 por cento e variação com 5,80 por cento, diferença de 1,8 por cento relativos. A distância entre as curvas diminui com o tempo.compra antecipada: a vantagem do primeiro dia quase some em 28 dias0%3%5,7%dia 024 hdia 14dia 2824 h: 3,30% contra 3,00%, mais 10,0%dia 28: 5,80% contra 5,70%, mais 1,8%variação com contadorcontrolecurvas esquemáticas; só os quatro pontos marcados são números do cenário ilustrativo deste guia
O que a variação ganha no primeiro dia é, em boa parte, adiantamento. No cenário, dos 420 compradores a mais em 24 horas, sobram 140 a mais em 28 dias: dois terços do ganho curto eram gente que compraria de qualquer jeito.

2. Efeito novidade e cansaço

Um contador novo chama atenção por ser novo. O cliente recorrente que vê o mesmo aviso toda semana deixa de reagir, e, se toda semana houver uma promoção que “termina hoje”, ele aprende a esperar a próxima. O primeiro efeito infla a primeira semana; o segundo só aparece meses depois, e um teste de quatro semanas não o vê. Os sinais para separar novidade de efeito estão em efeito novidade em teste A/B, e o desenho que mede o efeito que sobrevive está em holdout de longo prazo.

3. Devolução e arrependimento

Pressão de tempo reduz o tempo de pesquisa, e compra menos pensada volta com mais frequência. No Brasil, o art. 49 do Código de Defesa do Consumidor dá sete dias para desistir de contrato feito fora do estabelecimento comercial, e o Decreto 7.962/2013, que regulamenta o comércio eletrônico, trata do respeito a esse direito. Um pedido a mais que volta não é um pedido a mais.

4. Cancelamento e estorno

Em SaaS, o equivalente da devolução é a conta que faz upgrade pressionada pelo prazo e cancela no primeiro mês, ou pede estorno. A taxa de upgrade sobe e a base pagante do mês seguinte não acompanha. O desenho de medição de cancelamento está em fluxo de cancelamento sem dark pattern.

5. Recompra canibalizada

Em categorias de recompra (cosmético, suplemento, ração, café), o cliente que antecipou a compra por causa do prazo também adia a próxima. A janela da métrica precisa ser longa o bastante para pegar o ciclo de recompra, ou o teste registra como ganho o que é só um deslocamento no calendário.

6. Margem

Se a urgência vem com desconto, cada conversão da variação vale menos. Uma variação pode ganhar em pedidos e perder em receita. Em ecommerce, a métrica que decide é receita por visitante líquida de devolução; em SaaS, receita por conta exposta. A calculadora de receita por visitante ajuda a dimensionar essa leitura.

Métricas de guarda e janela de medição

A regra prática deste guia: primária com janela longa e fixa por visitante; guarda no valor que fica; conversão rápida só como diagnóstico. A janela é contada a partir da primeira exposição de cada visitante, e é igual para todos, senão quem entrou no último dia do teste tem menos tempo para converter do que quem entrou no primeiro.

Linha do tempo de um teste de urgência com janela fixa por visitanteTrês faixas numa linha do tempo de 70 dias. Exposição do dia 0 ao dia 28. Janela de compra de 28 dias a partir da primeira visita de cada visitante, que para o último exposto termina no dia 56. Prazo de devolução depois da compra, que empurra a leitura da guarda para depois do dia 56. Marcações: espiar na semana 1 é enganoso; leitura da primária no dia 56; leitura da guarda depois disso.a leitura final não acontece quando o teste para de expor visitantesdia 0dia 28dia 56dia 70exposição: 4 semanasjanela de compra: 28 dias por visitanteprazo de devolução dos pedidosespiar aqui enganalê a primárialê a guardaprazos ilustrativos: ajuste a janela ao ciclo de compra e o prazo de devolução à sua política
Um teste de urgência de quatro semanas pede, na prática, dois meses ou mais de calendário. É o preço de medir o efeito que fica em vez do efeito que adianta. A lógica de coorte que sustenta isso está em maturidade de coorte.
alavanca primária guarda diagnóstico janela sugerida
contador de promoção (ecommerce) comprador em N dias desde a primeira exposição receita líquida de devolução por visitante compra na sessão, clique no contador ciclo de compra da categoria, no mínimo 28 dias
corte de despacho comprador em N dias taxa de devolução e comprador que manteve o pedido compra antes do horário de corte 28 dias mais o prazo de devolução
estoque baixo comprador em N dias devolução, contato no atendimento sobre disponibilidade adição ao carrinho do tamanho avisado 28 dias
desconto de upgrade com prazo (SaaS) conta pagante no dia 60 cancelamento com estorno, receita por conta upgrade dentro do prazo até depois da primeira renovação ou do fim do prazo de reembolso
lembrete de fim de trial conta pagante no dia 60 receita por conta, pedidos de suporte clique no lembrete 60 dias

Três cuidados de desenho completam a tabela:

Exemplo trabalhado 1: o contador do corte de despacho

Cenário (ilustrativo). Uma loja online de casa e decoração recebe 70.000 visitantes por semana nas páginas de produto. Hoje, 3,0 por cento dos visitantes compram nas primeiras 24 horas depois da primeira visita, e 5,7 por cento compram em 28 dias. O centro de distribuição despacha no mesmo dia os pedidos pagos até as 14h. A hipótese: mostrar “peça em 2h13min e enviamos hoje”, com o horário real de corte, perto do botão de compra, faz mais gente comprar.

Métricas declaradas antes. Diagnóstico: compra em 24 horas. Primária: comprador em 28 dias desde a primeira exposição. Guarda: taxa de devolução entre compradores e visitante que comprou e manteve o pedido. Janela e leitura final marcadas no plano: exposição de 28 dias, leitura da primária no dia 56, leitura da guarda depois do prazo de devolução.

Amostra. O time quer enxergar 8 por cento relativo na compra em 24 horas, a métrica mais sensível. Na calculadora abaixo, digite: taxa de conversão atual 3; efeito mínimo detectável 8, relativo; confiança 95; poder 80; visitantes por semana 70000; teste bilateral.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

A tela mostra 82.376 visitantes por variação, 164.752 no total e 17 dias. O time arredonda para quatro semanas completas, 28 dias, o que dá 140.000 visitantes por braço. A sensibilidade ao efeito mínimo, trocando só esse campo:

efeito relativo que você quer detectar visitantes por variação total dias a 70.000 por semana
5% 207.938 415.876 42
8% 82.376 164.752 17
10% 53.211 106.422 11
15% 24.193 48.386 5

A espiada da primeira semana. Com 35.000 visitantes por braço, eram 1.050 compras em 24 horas no controle e 1.239 na variação: mais 18,0 por cento, valor-p menor que 0,0001 (0,000059 com mais casas). Nas semanas 2 a 4, com 105.000 por braço, o placar foi 3.150 contra 3.381, mais 7,3 por cento, valor-p de 0,0037. A primeira semana mais forte é o formato esperado de novidade. Parar ali teria registrado quase o dobro do efeito de 24 horas que o teste completo mostrou, e nem teria chegado à métrica primária. O custo de decidir cedo está em o problema do peeking.

O efeito do contador conforme a janela e o período olhadosBarras horizontais de melhora relativa. Compra em 24 horas na semana 1: mais 18,0 por cento. Compra em 24 horas nas semanas 2 a 4: mais 7,3 por cento. Compra em 24 horas nas 4 semanas: mais 10,0 por cento. Comprador em 28 dias: mais 1,8 por cento, sem significância.quanto mais curta a leitura, maior o ganho que aparece24 h, semana 1+18,0%24 h, semanas 2 a 4+7,3%24 h, teste completo+10,0%comprador em 28 dias+1,8%, sem significânciacenário ilustrativo calculado com o motor das calculadoras do blog; escala de 0 a 20 por cento
O mesmo teste produz quatro manchetes diferentes conforme a janela e o momento da leitura. Só a última responde à pergunta que o negócio fez: o contador trouxe compradores novos?

O resultado da métrica de diagnóstico, em 28 dias de exposição.

braço visitantes compraram em 24 h taxa
A, prazo de entrega sem horário 140.000 4.200 3,00%
B, contador do corte de despacho 140.000 4.620 3,30%

A divisão é de 140.000 contra 140.000, sem alerta de SRM. Cole na calculadora de significância: controle com 140000 visitantes e 4200 conversões; variação com 140000 visitantes e 4620 conversões; confiança 95.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

A tela mostra 3,00% contra 3,30%, melhora relativa de +10,0%, valor-p menor que 0,0001 (a tela escreve o sinal de menor antes do número), intervalo de 95 por cento da diferença de +0,2% … +0,4% (pp) e o veredito Vencedora com significância · B vence. Com mais casas, o valor-p é 0,000006 e o intervalo vai de mais 0,1706 a mais 0,4294 ponto percentual, cerca de mais 5,7 a mais 14,3 por cento em termos relativos. São 420 compradores a mais no primeiro dia.

A primária, no dia 56. Quando a janela de 28 dias fecha para o último visitante exposto:

braço visitantes compraram em 28 dias taxa
A 140.000 7.980 5,70%
B 140.000 8.120 5,80%

Na mesma calculadora, digite 140000 e 7980 contra 140000 e 8120. A tela mostra 5,70% contra 5,80%, melhora de +1,8%, valor-p de 0,2557, intervalo de -0,1% … +0,3% (pp) e Ainda sem significância. Com mais casas, a melhora é de 1,75 por cento e o intervalo vai de menos 0,0725 a mais 0,2725 ponto percentual, cerca de menos 1,3 a mais 4,8 por cento relativos.

Dos 420 compradores a mais em 24 horas, sobraram 140 a mais em 28 dias. Os outros 280, dois terços, compraram também no controle, só que depois.

Isso não é falta de amostra. A calculadora não mostra poder, então a conta a seguir é deste guia, com a mesma fórmula: com 140.000 por braço e base de 5,7 por cento, o poder para detectar 8 por cento relativo em compradores de 28 dias era de 99,9 por cento, e o menor efeito que esse tamanho enxerga com 80 por cento de poder é cerca de 4,3 por cento relativo. O intervalo de menos 1,3 a mais 4,8 por cento deixa de fora os 10,0 por cento da leitura curta. A calculadora de poder estatístico faz essa conta com os seus números.

A guarda, depois do prazo de devolução.

braço compradores em 28 dias devolveram taxa de devolução visitantes que compraram e mantiveram taxa por visitante
A 7.980 1.036 12,98% 6.944 4,96%
B 8.120 1.160 14,29% 6.960 4,97%

Para a devolução, digite os compradores como “visitantes” e as devoluções como “conversões”: 7980 e 1036 contra 8120 e 1160. A tela mostra 12,98% contra 14,29%, melhora de +10,0%, valor-p de 0,0160, intervalo de +0,2% … +2,4% (pp) e “Vencedora com significância · B vence”. Aqui a calculadora só diz que a taxa de B é maior, e nesta métrica maior é pior: a guarda disparou.

Para os compradores que mantiveram o pedido, digite 140000 e 6944 contra 140000 e 6960. A tela mostra 4,96% contra 4,97%, melhora de +0,2%, valor-p de 0,8893, intervalo de -0,1% … +0,2% (pp) e Ainda sem significância. Com mais casas, a melhora é de 0,23 por cento e o intervalo vai de menos 0,1495 a mais 0,1724 ponto percentual, cerca de menos 3,0 a mais 3,5 por cento relativos. O poder para ver 8 por cento nessa métrica era de 99,7 por cento, pela mesma fórmula.

Intervalos de confiança do contador em quatro métricasIntervalos de 95 por cento em efeito relativo, num eixo de menos 5 a mais 20 por cento. Compra em 24 horas: mais 10,0 por cento, de mais 5,7 a mais 14,3. Comprador em 28 dias: mais 1,8 por cento, de menos 1,3 a mais 4,8. Taxa de devolução: mais 10,0 por cento, de mais 1,9 a mais 18,2, e nesta métrica subir é ruim. Comprador que manteve o pedido: mais 0,2 por cento, de menos 3,0 a mais 3,5.o mesmo contador, quatro perguntas, quatro respostas-5%0%+5%+10%+15%+20%compra em 24 h+10,0%comprador em 28 dias+1,8%, p = 0,2557taxa de devoluçãosubir é ruim+10,0%, p = 0,0160comprou e manteve+0,2%, p = 0,8893intervalo relativo aproximado: intervalo da diferença dividido pela taxa do controle. Cenário ilustrativo.
O contador vendeu mais rápido, não mais. Dos 140 compradores a mais em 28 dias, 124 devolveram (1.160 menos 1.036), e o saldo é de 16 pedidos mantidos a mais em 280.000 visitantes.

O que fazer com ele. Não há motivo para lançar o contador como “mais 10 por cento em vendas”. Há dois caminhos honestos. O primeiro é manter a informação de despacho sem o contador animado, como data escrita (“pedidos até as 14h saem hoje”), que dá ao cliente o dado útil sem a pressão, e testar isso contra o controle com a mesma primária e a mesma guarda. O segundo é aceitar que o contador é uma ferramenta de fluxo de caixa (vender antes) e não de crescimento, e decidir se isso vale o custo das devoluções. Os dois começam por abandonar a leitura de 24 horas como métrica de decisão.

Exemplo trabalhado 2: desconto de upgrade com prazo no fim do trial

Cenário (ilustrativo). Um SaaS B2B tem 1.500 contas por semana chegando ao fim do trial de 14 dias. Hoje, 12 por cento delas fazem upgrade nas 72 horas seguintes, pelo plano anual de R$ 1.200. A hipótese: oferecer 30 por cento de desconto no plano anual para quem fizer upgrade em até 72 horas, com o prazo registrado por conta no servidor e a mesma data em qualquer login, aumenta a conversão paga. A oferta é real: quem não aproveita paga o preço cheio depois.

Métricas declaradas antes. Diagnóstico: upgrade em 72 horas. Primária: conta pagante no dia 60 (depois do prazo de reembolso). Guarda: taxa de cancelamento com estorno entre quem fez upgrade, e receita por conta exposta.

Amostra. Com o volume de contas, o time aceita enxergar só efeitos de 20 por cento relativo ou mais. Na mesma calculadora de tamanho de amostra lá em cima, digite: taxa atual 12; efeito mínimo 20, relativo; confiança 95; poder 80; visitantes por semana 1500 (aqui, contas em fim de trial); bilateral. A tela mostra 3.122 por variação, 6.244 no total e 30 dias. O time roda cinco semanas completas: 7.500 contas, 3.750 por braço.

efeito relativo que você quer detectar contas por variação total dias a 1.500 por semana
15% 5.443 10.886 51
20% 3.122 6.244 30
25% 2.036 4.072 20
30% 1.440 2.880 14

O diagnóstico: upgrade em 72 horas. Na calculadora de significância, digite 3750 e 450 contra 3750 e 585. A tela mostra 12,00% contra 15,60%, melhora de +30,0%, valor-p menor que 0,0001, intervalo de +2,0% … +5,2% (pp) e Vencedora com significância · B vence. É o tipo de número que vira slide.

O que acontece até o dia 60.

métrica A, preço cheio B, 30% com prazo de 72 h melhora relativa valor-p leitura
upgrade em 72 horas 450 de 3.750 (12,00%) 585 de 3.750 (15,60%) +30,0% menor que 0,0001 significativo
upgrades até o dia 60 510 (450 no prazo, 60 depois) 615 (585 no prazo, 30 depois)
cancelamento com estorno entre quem fez upgrade 45 de 510 (8,82%) 120 de 615 (19,51%) +121,1% menor que 0,0001 a guarda disparou
conta pagante no dia 60 465 de 3.750 (12,40%) 495 de 3.750 (13,20%) +6,5% 0,2998 sem significância
receita anual contratada por conta exposta R$ 148,80 R$ 113,28 -23,9% contabilidade do cenário

Para conferir a conta pagante, digite 3750 e 465 contra 3750 e 495: a tela mostra 12,40% contra 13,20%, melhora de +6,5%, valor-p de 0,2998, intervalo de -0,7% … +2,3% (pp) e Ainda sem significância. Com mais casas, o intervalo vai de menos 0,7121 a mais 2,3121 pontos percentuais, cerca de menos 5,7 a mais 18,6 por cento relativos. Para a guarda, digite 510 e 45 contra 615 e 120: a tela mostra 8,82% contra 19,51%, +121,1%, valor-p menor que 0,0001 e intervalo de +6,7% … +14,7% (pp).

A receita não passa por teste estatístico aqui; é aritmética do cenário. No controle, 465 contas pagam R$ 1.200: R$ 558.000, ou R$ 148,80 por conta exposta. Na variação, das 495 pagantes, 470 fizeram upgrade no prazo e pagam R$ 840, e 25 fizeram upgrade depois e pagam R$ 1.200: R$ 394.800 mais R$ 30.000, R$ 424.800, ou R$ 113,28 por conta. Medir essa diferença com rigor pede um teste de média, como descrito no guia de tamanho de amostra para métricas contínuas.

Desconto com prazo no fim do trial: do upgrade rápido à receitaPares de barras controle e variação. Upgrade em 72 horas: 12,00 contra 15,60 por cento. Cancelamento com estorno entre quem fez upgrade: 8,82 contra 19,51 por cento. Conta pagante no dia 60: 12,40 contra 13,20 por cento, sem significância. Receita anual por conta exposta: 148,80 contra 113,28 reais, 23,9 por cento a menos.a variação ganha na primeira métrica e perde na últimaupgrade em 72 hA 12,00%B 15,60%, +30,0%cancelou com estornoentre quem fez upgradeA 8,82%B 19,51%pagante no dia 60A 12,40%B 13,20%, sem significânciareceita por contaA R$ 148,80B R$ 113,28, menos 23,9%taxas em escala de 10 px por ponto percentual; receita em escala própria. Cenário ilustrativo.
Das 135 contas que fizeram upgrade a mais no prazo, 75 cancelaram com estorno a mais, e quase todas as que ficaram (470 de 495) pagam 30 por cento menos. Nenhuma dessas perdas aparece na janela de 72 horas.

E a primária não tinha como responder bem. Pela mesma fórmula, com 3.750 contas por braço e base de 12,4 por cento, o poder para detectar 15 por cento relativo em conta pagante era de cerca de 66 por cento, e o menor efeito visível com 80 por cento de poder é cerca de 17,2 por cento. Detectar 15 por cento pediria 5.241 contas por variação, 49 dias. O resultado “sem significância” em conta pagante é pouca evidência dos dois lados, mas a receita já decide: mesmo que o ganho de 6,5 por cento em pagantes fosse real, ele não compensa um desconto de 30 por cento.

O que fazer com ele. Não lançar o desconto como está. Hipóteses melhores saem do próprio resultado: um lembrete de fim de trial com prazo real e sem desconto (testa só a urgência), um desconto menor no plano anual sem prazo apertado (testa só o preço), ou um prazo mais longo que dê tempo de a equipe do cliente avaliar. Todas com a mesma primária e a guarda de estorno. O raciocínio de coorte para ler cancelamento está em maturidade de coorte em teste A/B, e a leitura de churn está em reduzindo churn com experimentação.

A pergunta “o contador é verdadeiro?” vem antes de “o contador converte?”, porque o painel do teste mede comportamento, não veracidade. Um contador que reinicia pode vencer um teste A/B com folga e ainda assim ser uma prática proibida em vários mercados.

jurisdição regra o que diz, em resumo o que muda num teste
União Europeia Diretiva 2005/29/CE (práticas comerciais desleais), Anexo I, item 7 entre as práticas desleais em quaisquer circunstâncias: declarar falsamente que um produto só estará disponível, ou só em certas condições, por tempo muito limitado, para obter decisão imediata e privar o consumidor de tempo para escolher com informação contador que reinicia ou oferta que continua depois do prazo não é variação testável
União Europeia varredura da rede CPC, divulgada em 30/01/2023 399 lojas verificadas, 148 com pelo menos um dos três padrões pesquisados, 42 com contador falso; as autoridades nacionais contatariam as empresas para corrigir o critério de contador falso é verificável por qualquer visitante que volte à página
Reino Unido Digital Markets, Competition and Consumers Act 2024, Anexo 20, item 7, em vigor desde 06/04/2025 mesma prática da diretiva, com a expressão “por tempo limitado” prazo precisa ser real e sustentável por registro
Reino Unido CMA, documento de discussão sobre arquitetura de escolha online, abril de 2022 afirmações de escassez falsas ou enganosas, como contadores que reiniciam e estoque exagerado ou sem comprovação, podem pressionar indevidamente; no caso de reservas de hotel, as plataformas se comprometeram a tornar as mensagens de disponibilidade mais precisas mensagem de demanda precisa medir o que diz (mesma data, mesmo produto)
Estados Unidos FTC, relatório da equipe “Bringing Dark Patterns to Light”, setembro de 2022 cita como dark patterns o estoque baixo falso, a alta demanda falsa, o contador sem base que some ou reinicia ao zerar, a mensagem de tempo limitado sem prazo ou com prazo que reinicia e o desconto falso é relatório de equipe, não regra; ainda assim, descreve o que a agência considera enganoso
Brasil Código de Defesa do Consumidor, arts. 30, 35, 37, 38 e 39 a informação ou publicidade suficientemente precisa obriga o fornecedor; se houver recusa, o consumidor pode exigir o cumprimento; é proibida a publicidade enganosa, inclusive a inteira ou parcialmente falsa ou omissa capaz de induzir o consumidor em erro; o ônus de provar a veracidade é de quem patrocina; é prática abusiva prevalecer-se da fraqueza ou ignorância do consumidor, tendo em vista idade, saúde, conhecimento ou condição social, para impingir produtos o prazo e o estoque exibidos precisam ser comprováveis, e uma oferta precisa mostrada numa variação pode obrigar a loja perante quem a viu

Isto é contexto, não parecer jurídico. Na prática, cinco regras mantêm um teste de urgência do lado certo da linha:

  1. Todo prazo tem data e hora, e a oferta acaba quando o prazo acaba.
  2. Todo prazo pertence ao cliente ou à campanha, guardado no servidor. Recarregar a página, trocar de dispositivo ou voltar amanhã não reinicia nada.
  3. Todo número de estoque vem do estoque, e todo número de demanda vem de uma medida com período e produto declarados.
  4. “Por pouco tempo” sem prazo não entra em variação. Se o prazo não é conhecido, a mensagem não é verdadeira.
  5. A oferta vale para quem a viu. Num teste de desconto com prazo, a variação cria uma oferta real para quem foi sorteado, e o atendimento precisa saber disso.

Checklist antes de testar urgência e escassez

  1. O limite existe? Prazo, horário de corte, estoque ou vagas reais, comprováveis por registro.
  2. O prazo é por cliente ou por campanha, no servidor, igual em qualquer dispositivo.
  3. Primária com janela longa e fixa por visitante, contada da primeira exposição.
  4. Guarda declarada com limiar: devolução, cancelamento com estorno, receita líquida.
  5. Amostra dimensionada para a métrica que decide, não para a que sobe primeiro.
  6. Leitura final marcada no calendário: exposição mais janela mais prazo da guarda.
  7. Semanas completas, sem decisão na primeira semana.
  8. Vazamento controlado: e-mail, anúncio e banner com o mesmo prazo estão nos dois braços ou em nenhum.
  9. Novos e recorrentes lidos separadamente, declarados antes, porque a novidade pesa diferente.
  10. SRM conferido antes de ler qualquer efeito, principalmente quando o contador é um script de terceiro.

Erros comuns

Faça isso automático na Donnu

A dor específica de testar urgência e escassez é que o ganho aparece em horas e a conta chega em semanas: compra antecipada, devolução, estorno e receita menor por cliente. Nenhuma ferramenta resolve isso sozinha, mas algumas escolhas de configuração tornam o erro menos provável.

Na Donnu, a meta de conversão pode ser confirmada a partir do seu servidor (server-to-server), por exemplo um pedido pago confirmado pelo webhook do gateway, em vez de um clique no botão de comprar. Cada experimento aceita duas métricas no plano Padrão e três no Pro; no Pro, isso comporta o núcleo do desenho deste guia: uma primária, uma guarda e um diagnóstico, declarados antes de rodar. As metas são de conversão, então guardas calculadas sobre compradores ou em reais, como taxa de devolução e receita líquida, continuam vindo dos seus próprios dados. No plano Pro, a segmentação inclui tipo de visitante (novo ou recorrente) e agendamento, e o relatório mostra os segmentos e a linha do tempo da probabilidade de a variação ser melhor, o que deixa visível uma vantagem de primeira semana que encolhe depois. O relatório é bayesiano e mostra essa probabilidade com o intervalo da melhora.

O que continua sendo seu: garantir que o prazo e o estoque exibidos são verdadeiros, esperar a janela fechar e ler a guarda antes de decidir. Para as contas, a calculadora de tamanho de amostra, a calculadora de significância e a calculadora de poder estatístico fazem os números deste guia com os seus dados, de graça.

Referências

Leia também: Prova social em teste A/B · Pop-up de saída em teste A/B · Teste A/B de desconto e promoção · Efeito novidade · Métricas de guardrail · Teste A/B de página de produto · Trial para pago · Read in English

Perguntas frequentes

Contador regressivo aumenta a conversão?
Com frequência aumenta a conversão rápida, e esse é justamente o problema: parte do ganho é compra antecipada, não compra nova. No exemplo trabalhado deste guia, um contador real do horário de corte de despacho aumenta em 10,0 por cento a compra nas primeiras 24 horas, com valor-p menor que 0,0001, mas a compra em 28 dias sobe só 1,8 por cento, com valor-p de 0,2557. Dos 420 compradores a mais no primeiro dia, 280 teriam comprado de qualquer jeito, só que depois.
Contador falso ou estoque inventado é proibido?
Na União Europeia, a Diretiva 2005/29/CE lista entre as práticas desleais em quaisquer circunstâncias declarar falsamente que um produto só estará disponível por tempo muito limitado para obter uma decisão imediata. No Reino Unido, regra equivalente está no Anexo 20 da lei DMCC de 2024, em vigor desde 6 de abril de 2025. Nos Estados Unidos, o relatório da equipe da FTC de 2022 cita contador sem base, estoque baixo falso e alta demanda falsa como dark patterns. No Brasil, o Código de Defesa do Consumidor proíbe a publicidade enganosa, que inclui a informação publicitária inteira ou parcialmente falsa capaz de induzir o consumidor em erro. Isto é contexto, não parecer jurídico.
Qual métrica usar num teste de urgência?
Uma primária com janela longa e fixa por visitante, não a conversão na sessão. Em ecommerce, comprador em 28 dias desde a primeira exposição, com guarda em devolução e em comprador que manteve o pedido. Em SaaS, conta pagante no dia 60, com guarda em cancelamento e estorno e em receita por conta. A conversão rápida entra como diagnóstico, porque é a métrica que a urgência mais infla.
Por quanto tempo medir um teste de urgência e escassez?
O período de exposição mais a janela da métrica primária mais o prazo da guarda. No exemplo de ecommerce deste guia, o teste expõe visitantes por 28 dias, cada visitante é acompanhado por 28 dias e a devolução fecha depois disso, então a leitura final só sai perto do dia 56 e a guarda de devolução ainda mais tarde. Parar na primeira semana teria registrado mais 18,0 por cento, quase o dobro do efeito de 24 horas do teste completo.
Quanto tráfego é preciso para testar um contador regressivo?
Com 3 por cento de compra em 24 horas, 95 por cento de confiança e 80 por cento de poder, detectar 8 por cento relativo exige 82.376 visitantes por variação, 17 dias a 70 mil visitantes por semana. Detectar 5 por cento exige 207.938 por variação e 42 dias. Num SaaS com 12 por cento de upgrade em 72 horas e 1.500 fins de trial por semana, detectar 20 por cento relativo exige 3.122 contas por variação e 30 dias.
Desconto com prazo no fim do trial vale a pena?
Pode aumentar o upgrade rápido e reduzir a receita. No exemplo SaaS deste guia, 30 por cento de desconto com prazo de 72 horas aumenta o upgrade em 30,0 por cento, mas a conta pagante no dia 60 sobe só 6,5 por cento, sem significância, o cancelamento com estorno entre quem fez upgrade vai de 8,82 para 19,51 por cento e a receita por conta cai 23,9 por cento. A decisão depende da receita líquida, não da taxa de upgrade.