Growth Experimentation

Teste A/B de Onboarding em SaaS: o Que Move a Ativação

Teste A/B de onboarding em SaaS: como definir ativação de verdade, o que testar e como medir sem se enganar com pouco tráfego.

Ilustração abstrata em verde escuro e teal de um funil de onboarding com um degrau destacado representando o momento de ativação, sem texto

Testar A/B o onboarding de um SaaS self-serve só vale a pena quando a métrica que decide o teste é ativação de verdade, o momento em que o usuário sente o valor central do produto, e não uma métrica de vaidade como “cliques no tour” ou “telas vistas”. Este artigo faz parte do guia de growth experimentation para SaaS e cobre o experimento específico de onboarding: como definir ativação para o seu produto, o que de fato vale a pena testar em cada estágio, e o erro estatístico que invalida a maioria desses testes sem que ninguém perceba.

Ativação não é clique no tour: o que realmente conta

A armadilha mais comum de quem testa onboarding é otimizar o que é fácil de medir (telas vistas, botões clicados, porcentagem do tour concluída) em vez do que realmente prevê se aquele usuário vai ficar. A Reforge, uma das referências mais citadas em growth de produto, descreve o caminho de ativação em três etapas: setup (o usuário consegue configurar o mínimo para acessar o produto), aha moment (ele experimenta o valor central pela primeira vez, não apenas entende ele intelectualmente) e hábito (ele repete a ação o suficiente para o uso virar rotina).

Dois exemplos reais e bastante citados no mundo de growth ilustram isso, mas com uma ressalva importante que vale a pena levar a sério antes de copiar qualquer um deles.

A ressalva: uma análise da Mode sobre o próprio caso do Facebook argumenta que esse tipo de número “combina experiências diferentes num único valor” e não deveria ser tratado como um limiar científico preciso, e sim como uma bandeira quotável que ajuda o time inteiro a remar na mesma direção. Usuários diferentes ativaram de formas diferentes (alguns com 4 amigos em 20 dias, outros com 10 amizades em 2 horas), e o número “7 em 10” venceu mais por clareza de comunicação do que por precisão estatística. O mesmo cuidado vale para o número do Slack: trate os dois como inspiração de como pensar sobre ativação, nunca como uma fórmula pronta para colar no seu produto sem validar com os seus próprios dados.

Definindo a métrica de ativação do seu SaaS antes de testar qualquer coisa

Antes de rodar qualquer teste A/B de onboarding, você precisa de uma métrica de ativação validada, não copiada. O processo descrito por Lenny Rachitsky, com contribuições de líderes de growth como Merci Grace (que liderou growth no Slack), Karri Saarinen (Linear) e Jackie Bavaro (Asana), segue três passos:

  1. Liste candidatas. Olhe os dados de uso e o funil do seu produto e levante ações que parecem sinalizar que o usuário “entendeu” o valor: criar o primeiro projeto, convidar um colega, conectar uma integração, publicar o primeiro conteúdo.
  2. Valide por correlação. Rode uma regressão cruzando quem fez cada ação candidata com a retenção em 30, 60 ou 90 dias. A ação que mais separa “quem ficou” de “quem saiu” é a sua melhor candidata a aha moment.
  3. Teste causalidade, não só correlação. Uma boa métrica de ativação precisa ser causal para a retenção, não apenas correlativa: faça mais gente passar por aquela ação (por exemplo, via um teste A/B de onboarding) e confirme que a retenção realmente sobe, e não que só os usuários que já iam ficar são os que também completam aquela ação sozinhos.

A Amplitude descreve essa mesma lógica de outra forma prática: comparar a retenção em N dias de quem fez uma ação específica no primeiro dia contra quem não fez, e usar isso para calibrar o limiar de ativação (por exemplo, quantos dias até a primeira ação, ou quantas vezes ela precisa se repetir). O funil abaixo mostra onde a maioria dos SaaS self-serve perde gente antes mesmo de chegar perto desse momento:

Funil de onboarding de um SaaS self-serve com pontos de quedaDe 1.000 cadastros, cerca de 700 confirmam a conta, 450 completam a primeira ação chave e 280 chegam à ativação real, definida como o aha moment repetido dentro de uma janela fixa de dias.Cadastro concluído · 1.000Confirmou a conta · 700−30%1ª ação chave · 450−36%Ativação · 280−38%
Exemplo ilustrativo de um SaaS self-serve. A maior perda relativa costuma acontecer entre a primeira ação e a ativação de verdade, exatamente o trecho que testes de “cliques no tour” não conseguem enxergar.

O que testar A/B no onboarding (e o que cada teste realmente prova)

Com a métrica de ativação definida, a lista de variáveis testáveis no onboarding é longa, mas nem todo teste vale o esforço. A tabela resume as variações mais comuns, a hipótese que costuma motivá-las e o risco de se enganar em cada uma:

Estágio O que testar Hipótese comum Risco de se enganar
Cadastro Menos campos obrigatórios vs. formulário completo Menos fricção aumenta a conclusão do cadastro Cadastro mais fácil não implica ativação maior, só move o passo errado do funil
Primeiro acesso Tour guiado vs. sandbox livre com dados de exemplo Um caminho guiado reduz o tempo até a primeira ação Conclusão do tour é vaidade se não mover também a ativação real
Configuração inicial Checklist de progresso vs. sem checklist Barra de progresso visível aumenta a conclusão dos passos Quem conclui o checklist sozinho pode já ser quem ia ativar de qualquer forma (viés de sobrevivência)
Primeira criação Template pré-preenchido vs. canvas vazio Template reduz a barreira da “página em branco” até o primeiro valor Template pode acelerar um clique sem acelerar o aha moment de verdade
Reengajamento E-mail de ativação (timing e gatilho) vs. nenhum e-mail Lembrete no momento certo recupera quem não voltou sozinho Mistura quem já ia voltar sozinho com quem só voltou por causa do e-mail, se a janela de medição não for a mesma para os dois grupos

Alguns desses testes já têm evidência publicada que vale conhecer antes de decidir o que priorizar. Um caso relatado pela Userpilot sobre o cliente Rocketbots mostrou a ativação subir de 15% para 30% (o dobro), a conversão bater 5% e o MRR crescer 300% depois da introdução de um checklist de onboarding bem desenhado, com passos claros e visibilidade do que faltava. A Appcues, num guia próprio de experimentos de crescimento, recomenda testar diretamente um tour guiado estruturado contra deixar o usuário explorar livremente, para descobrir qual reduz o tempo até a ativação em cada segmento de usuário, além de testar a eliminação de campos não essenciais do formulário de cadastro e comparar o envio imediato de um e-mail pós-cadastro contra um envio atrasado, disparado só depois de um período de inatividade.

Repare que nenhuma dessas evidências diz “o checklist sempre ganha” ou “o tour guiado é sempre melhor”. Elas mostram que a pergunta vale a pena testar, com uma métrica de ativação de verdade decidindo o resultado, não que exista uma resposta universal pronta para copiar.

Como medir sem se enganar a si mesmo

Depois de escolher o que testar, a parte que mais gera resultado enganoso não é a estatística do teste em si, é a forma de medir a ativação depois que o teste já está rodando. Dois cuidados evitam a maior parte dos erros:

O exemplo numérico: dimensionando um teste de ativação de onboarding

Vamos trabalhar um cenário concreto. Suponha que o seu SaaS ativa hoje 25% dos cadastros dentro de 7 dias (a sua métrica de ativação já validada, seguindo o processo da seção anterior), e você quer detectar uma melhora relativa de 15% trazida por um novo checklist de onboarding, ou seja, levar a ativação para cerca de 28,75%. Com 95% de confiança e 80% de poder, dois parâmetros de mercado, o tamanho de amostra por variação é:

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Para reproduzir esse cenário na calculadora acima, ajuste a taxa base para 25, o efeito mínimo detectável para 15 (relativo) e os visitantes por semana para 700 novos cadastros. O resultado: 2.193 cadastros por variação (4.386 no total), rodando por cerca de 44 dias com esse volume de novos cadastros semanais. É a mesma matemática de qualquer teste A/B, a diferença é que a “conversão” aqui é a ativação, não uma compra.

Agora veja por que ignorar essa conta é o jeito mais comum de se enganar. Simule o mesmo efeito real (a mesma melhora de 25% para cerca de 29%) em dois volumes diferentes:

O mesmo efeito real, com e sem amostra suficienteCom 4.000 cadastros por variação, a ativação de 25% contra 29,25% dá valor-p de aproximadamente 0,00002 e é declarada significativa. Com apenas 600 cadastros por variação e a mesma diferença relativa de efeito, o valor-p sobe para cerca de 0,09 e o teste fica inconclusivo, mesmo o efeito real sendo o mesmo.4.000 por variaçãoA · 25,0%B · 29,25%p ≈ 0,00002 · significativo600 por variaçãoA · 25,0%B · 29,3%p ≈ 0,09 · inconclusivo
As barras de erro largas do painel direito mostram o problema: com pouca amostra, o mesmo ganho real de ativação não sai do campo do acaso, e o time acaba descartando uma ideia que na verdade funcionava.

Rodando os dois cenários com a mesma lógica de significance(): com 4.000 cadastros por variação (1.000 ativados em A, 1.170 em B), o valor-p bilateral fica perto de 0,00002 e o intervalo de confiança da diferença vai de aproximadamente 2,3 a 6,2 pontos percentuais, um resultado significativo. Com apenas 600 cadastros por variação (150 ativados em A, 176 em B), a mesma diferença relativa de efeito produz um valor-p perto de 0,09 e um intervalo de confiança que cruza o zero: tecnicamente inconclusivo, mesmo o ganho real sendo idêntico ao do primeiro cenário. A única coisa que mudou foi o tamanho da amostra.

O erro mais caro: rodar teste de onboarding com pouco tráfego

O exemplo acima não é hipotético, é o motivo mais comum de um time de produto abandonar uma boa ideia de onboarding cedo demais. SaaS self-serve early-stage costumam ter poucas centenas de cadastros por semana, e times ansiosos por resultado rodam o teste por 10 ou 14 dias e leem o painel achando que “não deu significativo, então a ideia não funciona”. Na maioria das vezes, o que não funcionou foi o dimensionamento do teste, não a ideia.

Antes de rodar qualquer teste de onboarding, calcule a amostra necessária na calculadora acima para o seu próprio baseline e efeito esperado, e leia como declarar significância estatística sem se enganar para entender o que um valor-p realmente diz (e o que ele não diz) sobre o seu teste. Se o seu volume de cadastros semanais está muito abaixo do que a conta pede, as saídas honestas são: aumentar o MDE que você está tentando detectar (aceitar que só ganhos maiores vão aparecer no seu volume atual), rodar o teste por mais tempo, ou aceitar que aquele teste específico simplesmente não é viável com o tráfego que você tem hoje, e buscar outra alavanca de maior potencial.

Escreva a hipótese antes de tocar no onboarding

Testar onboarding sem uma hipótese escrita é o caminho mais rápido para “descobrir” um vencedor que não existe: com dezenas de métricas secundárias disponíveis (telas vistas, cliques, tempo de sessão), alguma sempre vai parecer ter melhorado por puro acaso. Defina antes de rodar qual é a sua métrica primária (a ativação, na janela fixa de dias que você escolheu), a evidência que motivou a mudança e o efeito esperado. O guia de como escrever uma hipótese de teste A/B tem o template exato e exemplos trabalhados para isso.

Automatize isso na Donnu

Medir ativação de onboarding sem se enganar exige três coisas ao mesmo tempo: uma janela de medição fixa contada do cadastro, o denominador cheio (sem descartar quem abandonou no meio) e uma amostra dimensionada antes de rodar, não estimada de ouvido depois que o painel já está “parecendo bom”. A Donnu A/B cuida da parte estatística dessa equação: o snippet leve nunca trava o fluxo de onboarding do seu produto, e o motor de significância aplica o mesmo teste de duas proporções deste artigo a cada variação, sem inflar o resultado por causa de quem completou ou não completou o onboarding.

Comece um teste grátis de 14 dias e dimensione o próximo teste de ativação com o rigor certo, não com o volume que “parece suficiente”. Para o cenário de destino natural de um onboarding bem-sucedido, veja também teste A/B de trial para pago, o próximo experimento da mesma jornada.


Leia também: Growth experimentation para SaaS: o guia completo · Teste A/B de trial para pago · Como escrever uma hipótese de teste A/B

Referências

Perguntas frequentes

O que é ativação em um SaaS, de forma direta?
Ativação é o momento em que um usuário novo experimenta, pela primeira vez, o valor central do produto, não apenas o momento em que ele clica em algo do tour. A prática recomendada (Reforge, Amplitude) é defini-la em três etapas: setup (o usuário consegue chegar até o produto), aha moment (ele sente o valor central pela primeira vez) e hábito (ele repete essa ação o suficiente para ficar). Cliques no tour de boas-vindas raramente são qualquer uma dessas três coisas.
Qual métrica de ativação devo usar no meu SaaS?
Não existe uma métrica universal. O processo recomendado pela Reforge e descrito por Lenny Rachitsky é: primeiro, liste as ações candidatas que parecem indicar valor percebido; depois, rode uma regressão cruzando quem fez essa ação com a retenção em 30, 60 ou 90 dias; por fim, teste causalidade de verdade (não só correlação) fazendo mais gente passar por aquela ação e vendo se a retenção realmente sobe. Copiar o "7 amigos em 10 dias" do Facebook sem repetir esse processo para o seu produto é usar um número que não foi feito para o seu contexto.
Por que um teste de onboarding pode "dar significativo" e ainda assim estar errado?
O erro mais comum é o viés de sobrevivência: comparar a ativação só entre quem completou o onboarding, ignorando quem abandonou no meio do caminho. Isso infla artificialmente o resultado da variação que, por acaso, afasta mais gente cedo (quem sobra tende a ser um público mais engajado). A comparação correta inclui todo mundo que entrou no teste, do jeito que entrou, e mede a ativação numa janela fixa de dias contada a partir do cadastro, não a partir da conclusão do onboarding.
Preciso de quantos usuários para testar A/B o onboarding do meu SaaS?
Depende da sua taxa de ativação atual e do tamanho do ganho que você quer detectar (MDE), exatamente como em qualquer teste A/B. A diferença é que times de onboarding costumam superestimar o efeito de mudanças pequenas e rodar o teste com poucas centenas de cadastros, quando a conta real pede milhares por variação. Use a calculadora de tamanho de amostra deste artigo para o seu cenário antes de rodar.
Tour guiado ou sandbox livre: qual converte mais em ativação?
Não existe vencedor universal, e é exatamente por isso que isso precisa ser testado, não copiado de um blog de growth. Produtos com um único caminho óbvio até o valor central tendem a se beneficiar de um tour guiado, que reduz a chance de o usuário se perder. Produtos onde o valor depende do contexto específico do usuário (dados próprios, integrações, casos de uso variados) tendem a se beneficiar de um sandbox livre com dados de exemplo. Meça pela ativação real, não pela taxa de conclusão do tour.