CRO

Pop-up de Saída em Teste A/B: ganho real ou ilusão

O pop-up de saída quase sempre vence na métrica local. Como testar com controle contrafactual e medir receita e margem por visitante.

Ilustração plana de uma janela de navegador verde-escura com três pontinhos na barra, um cartão branco arredondado no centro com um ícone de presente e um cursor de mouse apontando para cima, em direção à barra, sobre fundo verde-menta

Um pop-up de saída é uma janela que aparece quando a ferramenta acha que o visitante vai embora, e ele quase sempre vence na métrica que o próprio pop-up cria: e-mails capturados, cupons usados, conversão de quem viu a oferta. A pergunta de negócio é outra: quantas vendas ou leads a mais existem porque ele apareceu, e quanto sobra de receita e margem depois do desconto. No exemplo trabalhado deste guia, a conversão entre quem disparou o pop-up sobe 20,0 por cento com valor-p abaixo de 0,0001, e a margem por visitante sorteado fica em menos 0,2 por cento, com valor-p de 0,94. As duas leituras vêm do mesmo teste. Este guia mostra como o gatilho funciona no computador e no celular, por que as leituras comuns enganam, como desenhar o teste com um controle que registra quem teria visto o pop-up, como converter o efeito de quem disparou para a base inteira, quanto isso encarece a amostra e o que o Google diz e não diz sobre intersticiais. Faz parte do nosso guia completo de otimização de conversão (CRO) e aprofunda o alerta que deixamos em teste A/B de carrinho abandonado.

O que é um pop-up de saída e como o gatilho funciona

O pop-up de saída (em inglês, exit-intent popup) é definido pelo gatilho, e não pelo conteúdo. A mesma janela com cupom pode aparecer depois de 10 segundos, na metade da rolagem ou quando a pessoa ameaça sair; só o último caso é pop-up de saída. E o gatilho funciona de forma muito diferente conforme o aparelho.

No computador, o sinal é o ponteiro. Quem vai fechar a aba ou voltar tende a levar o mouse para cima, na direção dos controles do navegador. A Wisepops descreve o disparo pelo cursor indo para essa área; o Popup Maker, pelo ponteiro saindo pela borda superior da janela, com sensibilidade e atraso configuráveis para evitar falso positivo.

No celular não existe ponteiro, e as ferramentas usam sinais indiretos:

Como o gatilho de saída é detectado no computador e no celularDois painéis. À esquerda, uma janela de navegador de computador com uma linha tracejada perto do topo marcada como borda de saída e uma seta do cursor subindo além dela; legenda: sinal direto, o ponteiro sai pela borda superior. À direita, um celular com quatro sinais indiretos listados: rolagem rápida para cima, botão voltar a partir da página de entrada, troca de aba ou perda de foco, e tempo de espera. Nota, que é leitura nossa: no celular, parte dos disparos acontece em quem não ia sair.mesmo pop-up, dois mecanismos de disparoborda de saídacomputador: sinal diretoo ponteiro sai pela borda superior1. rolagem rápida para cima2. botão voltar, napágina de entrada3. troca de aba4. tempo de esperacelular: sinais indiretosnossa leitura: parte dos disparos cai em quem não ia sairesquema ilustrativo com base na documentação de Wisepops, OptiMonk e Popup Maker, conferida em 15/09/2026
O pop-up de saída no computador e no celular não é o mesmo tratamento. Os sinais indiretos podem disparar em populações diferentes, e o teste precisa registrar o disparo com a mesma regra nos dois braços e separar a leitura por aparelho.
ferramenta sinal no computador sinais no celular ressalva documentada
Wisepops cursor indo para os controles do navegador botão voltar e rolagem para cima (desligável) Chrome no Android exige interação antes do voltar; não funciona em navegadores internos de apps como o do Facebook
OptiMonk não detalhado no artigo de celular troca de aba, rolagem rápida até o topo, botão voltar do navegador e do aparelho voltar só dispara a partir da página de entrada, depois de interação
Popup Maker ponteiro saindo pela borda superior, perda de foco, botão voltar, passar o mouse sobre link botão voltar, perda de foco, atraso em milissegundos, rolagem para cima acima de 10% recomenda usar o gatilho com cookie para não incomodar o visitante

Documentação conferida em 15/09/2026. Para quem testa, “disparou o pop-up de saída” significa coisas diferentes no computador e no celular, e a leitura por aparelho é obrigatória, como explicado em efeito heterogêneo por segmento.

Por que o pop-up de saída quase sempre parece vencer

Três leituras aparecem com frequência em relatórios de pop-up de saída, e nenhuma delas responde se o negócio ganhou.

1. Contagem sem controle. “1.000 pedidos usaram o cupom do pop-up.” É uma contagem verdadeira de um evento que só existe no braço com pop-up, e não diz quantos desses compradores já iam comprar e só pegaram o desconto no caminho.

2. Quem viu contra quem não viu. Quem dispara o gatilho de saída é, por construção, quem estava indo embora. No exemplo deste guia, esses visitantes convertem 2,0 por cento sem pop-up nenhum, contra 3,6 por cento de quem nunca dispara. A comparação mede quem eles são, não o que o pop-up fez.

3. Conversão só entre quem disparou, sem converter para a base. Tem controle e tem valor-p, e por isso seduz. O efeito é real para aquele grupo, mas é grande porque o denominador é pequeno, e não inclui o custo do desconto.

Os números de mercado herdam o problema. Segundo a Wisepops, em cerca de 1 bilhão de exibições de pop-ups de captura de e-mail da própria plataforma, pop-ups de saída convertem 3,94 por cento, com conversão definida como e-mails coletados divididos por exibições. Serve para calibrar expectativa de formulário, mas é métrica local, vinda da base de quem vende a ferramenta e sem grupo de controle: não diz quantos e-mails são incrementais nem o que aconteceu com as vendas.

Kohavi e coautores, nas regras de bolso publicadas no KDD 2014, dão o nome geral para essa armadilha: é fácil aumentar uma métrica de funcionalidade destacando a funcionalidade, e muitas vezes ela só está mudando cliques de lugar e canibalizando outras áreas da página. Um cupom que aparece para quem já estava com o cartão na mão é canibalização de margem com outro nome.

Pedidos com cupom contra pedidos incrementais no exemplo do guiaBarra superior: 1.000 pedidos usaram o cupom do pop-up, o número que um painel de atribuição mostraria como vendas recuperadas. A barra é dividida em 240 pedidos que só existiram por causa do pop-up, em verde, e 760 pedidos de quem compraria de qualquer jeito e recebeu o desconto, em laranja. Abaixo, o efeito em dinheiro: receita líquida mais 35.000 reais e margem menos 1.000 reais no período.o que o painel conta e o que o controle revelapedidos com cupom do pop-up, no braço com pop-up1.000 pedidos com cupomo mesmo 1.000, separado pelo grupo de controle240 a mais760 comprariam sem descontoreceita líquida do período: 240 pedidos vezes R$ 250, menos R$ 25.000 de desconto, dá mais R$ 35.000.margem do período: 240 pedidos vezes R$ 100, menos R$ 25.000 de desconto, dá menos R$ 1.000.números do exemplo trabalhado deste guia, hipotéticos e calculados
Um painel que conta pedidos com cupom mostra a barra de cima. A barra de baixo só existe se o teste tiver um controle que registre quem teria visto a oferta.

Como desenhar um teste A/B de pop-up de saída sem enganar a si mesmo

O desenho correto tem três peças, e a terceira é a que quase todo mundo esquece.

1. Sorteio por visitante, na chegada. O visitante é sorteado assim que entra no site, antes de qualquer gatilho, e fica no mesmo braço nas visitas seguintes, porque o pop-up afeta o que acontece depois (volta com cupom, e-mail, recompra). Ver unidade de sorteio.

2. A mesma regra de disparo nos dois braços. Sinal, página, atraso e limite de frequência rodam iguais. No tratamento, a regra mostra o pop-up; no controle, não mostra nada.

3. Registro contrafactual no controle. Quando a regra teria mostrado o pop-up, o controle grava um evento “teria visto”. A equipe de experimentação da Microsoft descreve o conceito: com registro contrafactual adequado, dá para saber se um usuário do controle teria visto a mudança se estivesse no tratamento, e a condição de disparo precisa refletir essa marcação contrafactual. Kohavi resume a regra de entrada: o usuário entra na análise se existe, potencialmente, diferença entre o que ele vive no braço dele e o que viveria no outro.

Os quatro grupos de um teste de pop-up de saída com registro contrafactualGrade dois por dois. Linhas: tratamento e controle, cada um com 200.000 visitantes sorteados. Colunas: disparou e não disparou. Tratamento que disparou: 60.000 visitantes que viram o pop-up. Controle que disparou: 60.000 visitantes que teriam visto, registrados sem ver nada. Não disparados: 140.000 em cada braço, com a mesma experiência. Uma seta verde liga as duas células de quem disparou, marcada como comparação justa. Uma seta laranja liga quem viu o pop-up aos não disparados, marcada como comparação enganosa.sorteio na chegada, disparo registrado nos dois braçosdisparou (30%)não disparou (70%)tratamento200.000controle200.00060.000 viram o pop-upconversão 2,40%140.000 sem mudançaconversão 3,60%60.000 teriam vistoregistro contrafactual, 2,00%140.000 sem mudançaconversão 3,60%justaquem viu contra quem não disparou: enganosa, populações diferentesnúmeros do exemplo trabalhado; a diferença entre 2,00% e 3,60% existe sem pop-up nenhum
O grupo de 60.000 “teriam visto” é o que transforma um relatório de pop-up num experimento. Sem ele, a única comparação possível é entre gente que estava indo embora e gente que não estava.

O erro de sortear a cada disparo

Sortear a cada disparo (metade das ocasiões vê, metade não), sem fixar o visitante num braço, produz grupos comparáveis em cada ocasião, mas mistura os braços entre visitas: quem viu o cupom numa visita pode cair no controle na seguinte, e o que o pop-up muda depois (volta com cupom, e-mail, recompra) se espalha pelos dois grupos. Sortear o visitante na chegada e mantê-lo no mesmo braço preserva a base inteira no teste e deixa a análise por gatilho como recorte, não como desenho.

Quando o controle não consegue registrar nada

Se a ferramenta de pop-up só grava eventos quando mostra algo, o disparo fica observado só no tratamento. Deng, Yuan, Kanai e Salama-Manteau (WSDM 2023) chamam isso de disparo unilateral: a diferença de médias na base inteira continua sem viés para o efeito total, mas a análise por gatilho com diluição fica impossível sem saber quem, no controle, teria disparado. A saída prática é implementar o ouvinte de saída você mesmo, nos dois braços, e deixar a ferramenta só desenhar a janela.

desenho o que compara resultado honesto?
relatório da ferramenta, sem controle nada, só conta e-mails, cupons e vendas atribuídas não
quem viu o pop-up contra quem não viu quem estava saindo contra quem não estava não, viés de seleção
sorteio a cada disparo, sem fixar o visitante disparos contra disparos, ocasião a ocasião parcial, mistura efeitos entre visitas
sorteio na chegada, sem registro no controle base inteira contra base inteira sim, com muito ruído
sorteio na chegada, com registro contrafactual base inteira e recorte por gatilho, com diluição sim, com mais poder

Diluição: do efeito entre quem disparou ao efeito no negócio

A análise só entre quem disparou é mais sensível porque tira do cálculo quem tem efeito zero por construção. O preço é que o número dela precisa ser convertido para a base inteira. Deng e Hu, no WSDM 2015, registram uma fórmula muito usada: o efeito total é o efeito no grupo disparado multiplicado pela fração de usuários que dispararam. A condição é que o tratamento não afete quem não disparou, algo que eles recomendam verificar com uma análise do complemento, os não disparados, que não deve mostrar efeito.

Em conversão, a conta é em pontos percentuais. No exemplo deste guia, o ganho entre os disparados é de 0,40 ponto (de 2,00 para 2,40 por cento), e 30 por cento dos visitantes disparam. O ganho na base inteira é 0,40 vezes 0,30, ou 0,12 ponto: de 3,12 para 3,24 por cento, um aumento relativo de 3,8 por cento. O mesmo efeito, que parecia de 20 por cento, vira 3,8 por cento quando olhado contra o faturamento inteiro da loja.

A regra 2 de Kohavi e coautores traz a mesma aritmética com outro exemplo: uma melhora de 10 por cento num segmento de 1 por cento tem impacto total de aproximadamente 0,1 por cento. O blog detalha a derivação, as armadilhas e as métricas de razão em análise por gatilho e diluição.

A taxa de disparo muda tudo. A tabela abaixo mantém o mesmo efeito entre os disparados (mais 0,40 ponto sobre 2,00 por cento, com 3,60 por cento de conversão fora do gatilho) e varia só a fração que dispara.

taxa de disparo conversão da base efeito relativo na base por variação, base inteira dias a 100.000/semana sorteados por braço, análise por gatilho
10% 3,44% +1,16% 3.277.185 459 211.090
20% 3,28% +2,44% 787.285 111 105.545
30% 3,12% +3,85% 335.634 47 70.364
50% 2,80% +7,14% 110.508 16 42.218

Confiança de 95 por cento, poder de 80 por cento, teste bilateral, calculado com sampleSizePerVariant usando o efeito relativo exato. A última coluna é a amostra da análise por gatilho (21.109 disparados por variação) dividida pela taxa de disparo. Deng e coautores dão uma regra de bolso aproximada para essa diferença: a análise por gatilho com diluição reduz a variância aproximadamente pelo inverso da taxa de disparo, por exemplo cerca de 20 vezes com disparo de 5 por cento. No exemplo, a razão fica perto de 4,8 e não de 3,3, porque os não disparados convertem mais e têm variância maior; a regra dá a ordem de grandeza, não a conta exata.

Métrica primária e guardrails

Um pop-up de saída mexe em dinheiro, em lista e em experiência: a métrica primária pega o dinheiro, e as de guarda pegam o resto, na lógica de métrica primária (OEC) e métricas de guardrail.

tipo de negócio métrica primária por que não a métrica local guardrails
e-commerce com cupom receita líquida de desconto por visitante sorteado, com margem por visitante ao lado cupom usado conta também quem compraria sem desconto uso do código por não disparados (vazamento), devolução, recompra em 30, 60 e 90 dias, taxa de saída no celular
e-commerce sem desconto (frete, troca, prazo) receita por visitante sorteado clique na janela não é venda reclamação no atendimento, tempo até a compra
SaaS com trial início de trial ou conta ativada por visitante sorteado e-mail capturado pode substituir o trial descadastro e reclamação de spam da lista nova, taxa de lead para oportunidade
B2B com material rico oportunidade qualificada por visitante sorteado lead de material pode ter qualificação menor que lead de demonstração pedidos de demonstração, descadastro, velocidade de página

Três guardrails merecem atenção especial.

Vazamento do cupom. Código genérico pode acabar em sites de cupom e ser usado pelo controle, o que contamina a comparação. Use código único e monitore o uso por quem nunca disparou; o mecanismo está em interferência entre variações.

Aprendizado do cliente. Quem recebe cupom ao ameaçar sair pode aprender a ameaçar sair, e isso não aparece em quatro semanas. Um holdout de longo prazo mede recompra e ticket; o caminho inverso, a oferta perdendo força depois da primeira visita, é o efeito novidade.

Qualidade da lista. E-mail capturado sob pressão de saída pode ter perfil diferente do cadastro espontâneo. Meça descadastro e reclamação de spam na série de boas-vindas, com a disciplina do guia de teste A/B em e-mail marketing.

Exemplo trabalhado 1: loja com cupom de 10 por cento

Cenário. Uma loja de moda com 100.000 visitantes por semana, ticket médio de R$ 250 e margem bruta de 40 por cento (R$ 100 por pedido sem desconto) quer testar um pop-up de saída com cupom de 10 por cento (R$ 25 por pedido). Todos os números abaixo são hipotéticos e foram calculados com o motor estatístico do blog.

Desenho. Sorteio por visitante na chegada, 50/50, por quatro semanas: 200.000 visitantes por braço. A regra de disparo roda nos dois braços com o mesmo limite de uma exibição por visitante; o controle só registra “teria visto”. Cupom de código único. Métrica primária: receita líquida de desconto por visitante sorteado. Margem por visitante como métrica de decisão ao lado.

Resultado.

grupo visitantes por braço pedidos controle pedidos tratamento conversão controle conversão tratamento
disparou (30%) 60.000 1.200 1.440 2,00% 2,40%
não disparou (70%) 140.000 5.040 5.040 3,60% 3,60%
base inteira 200.000 6.240 6.480 3,12% 3,24%

No tratamento, 1.000 dos 1.440 pedidos de disparados usaram o cupom. A contagem de disparos bate (60.000 contra 60.000) e os não disparados têm exatamente o mesmo resultado, que é o comportamento esperado de um complemento sem efeito.

Leitura 1, a ilusória. Coloque na calculadora o recorte de quem disparou: controle com 60.000 visitantes e 1.200 conversões, variação com 60.000 visitantes e 1.440 conversões, confiança de 95 por cento.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

A tela mostra taxa de 2,00% no controle e 2,40% na variação, melhora relativa de +20,0%, valor-p < 0,0001, intervalo de +0,2% … +0,6% (pp) e o veredito Vencedora com significância · B vence. Fora da tela, com mais casas do motor estatístico do blog (significance), o z vale 4,7232, o valor-p é 0,0000023 e o intervalo vai de 0,2340 a 0,5660 ponto percentual. O efeito é real para esse grupo. É o número que costuma ir para a apresentação.

Leitura 2, a conversão diluída. Troque para a base inteira: controle com 200.000 visitantes e 6.240 conversões, variação com 200.000 e 6.480. A tela mostra 3,12% contra 3,24%, melhora de +3,8%, valor-p 0,0306, intervalo +0,0% … +0,2% (pp) e ainda Vencedora com significância · B vence. Fora da tela, pelo mesmo motor, o z vale 2,1626 e o intervalo vai de 0,0112 a 0,2288 ponto percentual; o limite de baixo quase encosta no zero. O pop-up gera pedidos a mais de verdade: 240 no período. Detalhe importante: com 200.000 por braço, esse teste tinha cerca de 58 por cento de poder para esse efeito (powerForSample), então a significância veio com margem estreita, e o efeito medido tende a vir inflado, como explica a maldição do vencedor.

Leitura 3, receita e margem. Aqui a calculadora de significância não serve, porque ela compara proporções e receita por visitante é métrica contínua. O cálculo abaixo foi feito para este guia, fora da calculadora, com um teste z de diferença de médias e três hipóteses declaradas: no máximo um pedido por visitante, desvio padrão do ticket de R$ 200 e pedidos com cupom com valor líquido médio de R$ 225 e desvio de R$ 180. O desvio padrão da receita por visitante fica em R$ 56,01 no controle.

métrica por visitante sorteado controle tratamento diferença intervalo de 95% valor-p
conversão entre disparados 2,00% 2,40% +20,0% +0,23 a +0,57 pp abaixo de 0,0001
conversão na base inteira 3,12% 3,24% +3,8% +0,01 a +0,23 pp 0,0306
receita líquida de desconto R$ 7,80 R$ 7,98 +2,2% menos R$ 0,17 a mais R$ 0,52 0,32
margem bruta menos desconto R$ 3,12 R$ 3,12 menos 0,2% menos R$ 0,14 a mais R$ 0,13 0,94

Em dinheiro do período: a receita de controle foi de R$ 1.560.000; a do tratamento, R$ 1.620.000 bruta e R$ 1.595.000 líquida de R$ 25.000 em desconto, mais R$ 35.000. A margem foi de R$ 624.000 contra R$ 623.000, menos R$ 1.000. A margem por visitante do tratamento, com mais casas, é R$ 3,115.

Quatro leituras do mesmo teste de pop-up de saídaBarras horizontais com o efeito relativo e o valor-p de cada leitura. Conversão entre quem disparou: mais 20,0 por cento, valor-p abaixo de 0,0001. Conversão na base inteira: mais 3,8 por cento, valor-p 0,0306. Receita líquida de desconto por visitante: mais 2,2 por cento, valor-p 0,32. Margem por visitante: menos 0,2 por cento, valor-p 0,94. A escala vai de menos 2 a mais 22 por cento.quanto mais perto do dinheiro, menor o efeito e maior o valor-p0%conversão entre quem disparou+20,0% · p abaixo de 0,0001conversão na base inteira+3,8% · p 0,0306receita líquida por visitante+2,2% · p 0,32margem por visitantemenos 0,2% · p 0,94receita e margem calculadas fora da calculadora, com hipótese de desvio do ticket
O pop-up gerou pedidos a mais, e isso é real. O que ele não gerou, com a evidência deste teste, foi dinheiro a mais depois do desconto. Ganho real no volume, ilusão na margem.

O que decidir. O teste não prova que o pop-up destrói margem: o intervalo da margem vai de cerca de menos 4,6 a mais 4,3 por cento. Ele mostra que o cupom de 10 por cento, dado a todo mundo que ameaça sair, paga com desconto quase exatamente o que ganha em volume, e que os 1.000 “pedidos recuperados” do painel eram 240. Os próximos testes óbvios são um desconto menor, uma oferta sem desconto (prazo de entrega, troca grátis, garantia, como sugerimos em teste A/B de desconto e promoção) e o pop-up restrito a quem nunca comprou.

O controle de sanidade. Se o registro contrafactual estivesse quebrado, a primeira pista seria a contagem de disparos. Com 60.000 disparos num braço e 58.900 no outro, o verificador de SRM acusa valor-p de 0,0014 (srmCheck). A equipe de experimentação da Microsoft recomenda exatamente esses dois testes: nenhuma divisão desigual no recorte disparado e um recorte do complemento que pareça A/A.

Exemplo trabalhado 2: SaaS B2B trocando e-mail por material

Cenário. Um SaaS B2B com 20.000 visitantes por semana testa, por seis semanas, um pop-up de saída que oferece um relatório de benchmark em troca do e-mail. O objetivo é início de trial. São 60.000 visitantes por braço, e 25 por cento disparam (15.000).

Resultado. O pop-up capturou 600 e-mails, 4,0 por cento das exibições, na ordem de grandeza do número da Wisepops. O formulário normal gerou 900 leads em cada braço.

métrica controle tratamento efeito valor-p a tela da calculadora mostra
leads (formulário mais pop-up), base inteira 900 de 60.000 (1,50%) 1.500 de 60.000 (2,50%) +66,7% abaixo de 0,0001 Vencedora com significância · B vence
trials, base inteira 1.200 de 60.000 (2,00%) 1.164 de 60.000 (1,94%) menos 3,0% 0,4546 Ainda sem significância
trials entre disparados 240 de 15.000 (1,60%) 204 de 15.000 (1,36%) menos 15,0% 0,0852 Ainda sem significância

Cole cada linha na mesma calculadora de significância acima. Na de trials na base inteira, a tela mostra 2,00% contra 1,94%, melhora de -3,0%, valor-p 0,4546, intervalo -0,2% … +0,1% (pp) e Ainda sem significância. A diluição fecha: menos 0,24 ponto entre disparados vezes 25 por cento dá menos 0,06 ponto na base, os mesmos 36 trials a menos.

A leitura ilusória é a primeira linha: leads mais 66,7 por cento. A leitura honesta é que o teste não consegue dizer se o pop-up tira trials: com 60.000 por braço e 2 por cento de base, o menor efeito detectável é de cerca de 11,3 por cento relativo (mdeForSample), e o poder para ver uma queda de 3 por cento era de 11 por cento. “Sem significância” aqui é falta de amostra, não ausência de dano, e o sinal da análise por gatilho (menos 15,0 por cento, valor-p de 0,0852) sugere que o relatório pode estar substituindo o trial. A mesma troca entre volume e qualidade aparece em formulário de demonstração e fluxo de cadastro.

Plano de amostra: quanto a diluição encarece o teste

A pergunta de planejamento é “quanto tráfego preciso para ver o efeito que importa”. Use a calculadora duas vezes, uma para cada leitura do exemplo da loja.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Análise por gatilho. Digite taxa de conversão atual de 2, efeito mínimo de 20 relativo, confiança de 95, poder de 80, visitantes por semana de 30000 (os 30 por cento de 100.000 que disparam) e teste bilateral. A tela mostra 21.109 visitantes por variação, 42.218 no total e 10 dias. Em visitantes sorteados, são 21.109 divididos por 0,30, cerca de 70.364 por braço.

Base inteira. Troque para taxa atual de 3,12, efeito mínimo de 3,85 relativo e 100000 visitantes por semana. A tela mostra 334.970 por variação, 669.940 no total e 47 dias. Com o efeito exato de 3,846 por cento, são 335.634 por variação. É cerca de 4,8 vezes a amostra da análise por gatilho, para o mesmo efeito.

Receita líquida por visitante. Essa conta a calculadora não faz, porque a métrica é contínua. Com o desvio de R$ 56,01 por visitante do exemplo e o efeito observado de R$ 0,175, a fórmula de duas médias (duas vezes a soma dos z de 95 e 80 por cento ao quadrado, vezes a variância, dividido pelo efeito ao quadrado) dá cerca de 1.608.046 visitantes por variação, ou 226 dias a 100.000 por semana. O método está em tamanho de amostra para métricas contínuas, e reduzir essa variância é o assunto de outliers e capping.

Amostra por variação para cada leitura do teste de pop-up de saídaTrês barras horizontais em escala. Análise por gatilho: cerca de 70.364 visitantes sorteados por braço, 10 dias. Conversão na base inteira: 334.970 por variação, 47 dias. Receita líquida por visitante: cerca de 1.608.046 por variação, 226 dias, calculado fora da calculadora.mesmo pop-up, três perguntas, três tamanhos de testeconversão, só quem disparou70.364 sorteados por braço · 10 diasconversão, base inteira334.970 por variação · 47 diasreceita líquida por visitante1.608.046 por variação · 226 diasa análise por gatilho diz se o pop-up mexe no comportamento de quem sai;só a base inteira, em dinheiro, diz se vale a pena. Planeje o teste pela pergunta que decide.a 100.000 visitantes por semana, 95% de confiança, 80% de poder, bilateral
A diluição não é um detalhe de relatório. Ela multiplica o tráfego necessário, e é por isso que tanto teste de pop-up acaba sendo lido pela métrica que dá significância primeiro.

O plano sensato para o tráfego da loja do exemplo: análise por gatilho para saber rápido se a oferta muda o comportamento de quem sai, conversão na base como confirmação e receita e margem lidas como intervalo. Com pouco tráfego, veja CRO para sites de baixo tráfego.

Pop-up de saída, celular e SEO: o que o Google diz e o que não diz

Pop-up e SEO costumam ser discutidos com mais convicção do que a documentação permite. Separando texto de interpretação:

O que a documentação atual diz (“Avoid intrusive interstitials and dialogs”, Google Search Central, atualizada em 10/12/2025, conferida em 15/09/2026): intersticiais e diálogos intrusivos são elementos que obstruem a visão do conteúdo, geralmente com fins promocionais; intersticiais cobrem a página inteira e diálogos, parte dela. Eles dificultam para os buscadores entender o conteúdo, o que pode levar a um desempenho pior na busca. A recomendação é usar banners que ocupem fração pequena da tela; os erros a evitar, salvo obrigação legal, são cobrir a página inteira e redirecionar para outra página para pedir consentimento ou dados.

O que ela não diz. Não menciona pop-up de saída, não separa celular de computador e não trata o momento em que o diálogo aparece. A página sobre experiência de página inclui “evitar intersticiais intrusivos” numa lista de autoavaliação e afirma que, além das Core Web Vitals, os outros aspectos de experiência de página não ajudam diretamente a ranquear, embora tornem o site mais satisfatório.

O que dizia o anúncio de 2016, hoje marcado pelo próprio Google como possivelmente desatualizado: a partir de janeiro de 2017, páginas com conteúdo pouco acessível na transição a partir da busca no celular poderiam ranquear pior. Um dos exemplos era um pop-up que cobre o conteúdo principal logo depois da chegada pela busca ou enquanto a pessoa lê a página. Avisos de cookies e de idade, diálogos de login para conteúdo não indexável e banners de tamanho razoável, fáceis de fechar, eram citados como não afetados, se usados com responsabilidade.

A nossa leitura, que é interpretação. O pop-up de saída por ponteiro no computador não aparece na chegada. No celular, os sinais indiretos disparam enquanto a pessoa ainda está na página, o que se parece com o exemplo de 2016 de pop-up durante a leitura. Nada na documentação isenta o pop-up de saída, e nada o condena especificamente. O caminho de menor risco no celular é o que o próprio Google recomenda: um banner pequeno e fácil de fechar, testado contra o de tela cheia. O paralelo está em CRO x SEO, e medir efeito em tráfego orgânico exige outro desenho, o de teste A/B para SEO.

Checklist do teste

  1. Hipótese com métrica de dinheiro. “O cupom aumenta a receita líquida por visitante”, e não “o pop-up captura e-mails”.
  2. Sorteio por visitante na chegada, estável entre visitas, antes de qualquer gatilho.
  3. Regra de disparo idêntica nos dois braços, com o mesmo sinal, o mesmo atraso e o mesmo limite de frequência.
  4. Registro contrafactual no controle, com o mesmo evento e a mesma chave de visitante do tratamento.
  5. Contagem de disparos conferida por braço com um verificador de SRM antes de olhar qualquer resultado.
  6. Complemento como A/A. Os não disparados não podem mostrar diferença entre os braços.
  7. Leitura separada por aparelho, porque computador e celular disparam por mecanismos diferentes.
  8. Cupom de código único, com o uso por não disparados monitorado.
  9. Métrica primária na base inteira, receita líquida ou conversão que paga as contas; análise por gatilho como recorte com diluição declarada.
  10. Amostra e duração fixadas antes, pela pergunta que decide, sem parar no primeiro valor-p bonito, pelo motivo explicado em o problema do peeking.
  11. Guardrails de lista e de recompra: descadastro, reclamação de spam, recompra em 30, 60 e 90 dias.
  12. Banner leve no celular como variação, para medir o custo do pop-up de tela cheia em vez de supor.

Erros comuns

Faça isso automático na Donnu

A dor específica do pop-up de saída é que a ferramenta que mostra a janela é a mesma que conta o sucesso, e ela só enxerga o braço em que a janela existe.

O snippet da Donnu sorteia cada visitante numa variação de forma estável, por um identificador de visitante, quando ele carrega uma página do experimento, e o mantém na mesma variação nas visitas seguintes: com o experimento cobrindo as páginas de entrada, é o sorteio na chegada que este guia recomenda. A variação pode carregar JavaScript próprio, o que permite ligar o pop-up só no tratamento. Para o registro contrafactual, o snippet expõe a função window.dab.event, que registra um evento personalizado e conta as metas personalizadas com esse nome nos experimentos em que o visitante foi sorteado: chame window.dab.event('saida_elegivel') no mesmo ouvinte de saída, nos dois braços, e cadastre esse evento como meta secundária. A contagem de quem chegou ao gatilho aparece por variação no relatório, pronta para o verificador de SRM. A compra ou o trial entram como meta primária, por página de confirmação, por evento ou confirmados pelo seu servidor com o identificador do visitante, disponível em window.dab.uid. A Donnu não faz análise por gatilho nem mede receita e margem: essas contas saem da sua base de pedidos.

O que continua sendo seu trabalho é a pergunta de dinheiro: desconto, margem e recompra vivem no seu sistema de pedidos. Para as contas em proporção, a calculadora de significância e a calculadora de tamanho de amostra fazem as deste guia com os seus números, e a calculadora de receita por visitante ajuda a traduzir conversão em dinheiro.

Referências

Leia também: Análise por gatilho e diluição · Teste A/B de carrinho abandonado · Teste A/B de desconto e promoção · Métricas de guardrail · Holdout de longo prazo · Calculadora de significância · Read in English

Perguntas frequentes

O que é um pop-up de saída?
É uma janela que aparece quando a ferramenta interpreta que o visitante vai sair da página. No computador, o sinal clássico é o ponteiro do mouse subindo para fora da borda superior da janela, na direção da barra de abas. No celular não existe esse movimento, e as ferramentas usam sinais indiretos, como rolagem rápida para cima, botão voltar, troca de aba ou um tempo de espera. A oferta costuma ser um cupom, um material gratuito em troca do e-mail ou uma resposta a uma dúvida.
Por que o pop-up de saída quase sempre parece vencer?
Porque ele costuma ser avaliado por métricas que só existem com ele: e-mails capturados, cupons usados, vendas atribuídas ao pop-up. Sem um grupo de controle que registre quem teria visto o pop-up, essas contagens incluem gente que compraria de qualquer jeito. No exemplo deste guia, 1.000 pedidos usaram o cupom, mas só 240 pedidos a mais aconteceram de verdade; os outros 760 teriam comprado sem desconto.
Como fazer um teste A/B de pop-up de saída do jeito certo?
Sorteie o visitante na chegada, antes de qualquer gatilho, e rode a mesma regra de disparo nos dois braços. No controle, a regra não mostra nada, só registra que o visitante teria visto o pop-up. Assim você compara quem disparou no tratamento com quem teria disparado no controle, confere se as duas contagens batem e converte o efeito para a base inteira pela taxa de disparo.
Qual deve ser a métrica primária de um teste de pop-up de saída?
Em e-commerce, receita líquida de desconto por visitante sorteado, com a margem por visitante ao lado. Em SaaS e B2B, a conversão que paga as contas, como início de trial ou oportunidade qualificada por visitante, e não o número de e-mails. No exemplo deste guia, a conversão entre quem disparou subiu 20,0 por cento com valor-p abaixo de 0,0001, e a receita líquida por visitante subiu 2,2 por cento com valor-p de 0,32.
O Google penaliza pop-up de saída no celular?
A documentação atual do Google Search Central não fala em pop-up de saída nem separa celular de computador. Ela define intersticiais e diálogos intrusivos como elementos que atrapalham a visão do conteúdo, diz que eles podem levar a um desempenho pior na busca e recomenda banners que ocupem uma fração pequena da tela. O anúncio de 2016, hoje marcado como possivelmente desatualizado, citava como exemplo um pop-up que cobre o conteúdo enquanto a pessoa lê a página.
Quanto tráfego um teste de pop-up de saída precisa?
Depende muito da taxa de disparo. No exemplo deste guia, com 30 por cento de disparo, a análise só entre quem disparou precisa de 21.109 visitantes disparados por variação, cerca de 70.364 visitantes sorteados por braço. Detectar o mesmo efeito diluído na base inteira pede 334.970 por variação, e detectar o efeito em receita líquida por visitante pede cerca de 1.608.046 por variação.