CRO

Prova Social em Teste A/B: o que Testar e como Medir

Prova social em teste A/B: avaliações, logos, depoimentos e contadores. O que a evidência mostra, o que testar e a métrica que não engana.

Ilustração plana de uma sacola de compras verde-escura no centro, cercada por avatares de pessoas em balões de conversa, um balão com linhas de texto, estrelas douradas e corações, sobre fundo verde-menta

Prova social é todo sinal de que outras pessoas já escolheram, usaram ou aprovaram o que o visitante está avaliando: nota e contagem de avaliações, número de clientes, depoimentos, logos, atividade em tempo real, selos e conteúdo gerado por usuários. Ela funciona reduzindo incerteza, e por isso é uma hipótese frequente em CRO e fácil de medir mal. O erro típico não está em escolher o elemento, está em escolher a métrica: no exemplo trabalhado deste guia, um selo de avaliações na página de produto aumenta os pedidos em 8,75 por cento com valor-p de 0,0010, e os pedidos que não voltam como devolução sobem só 0,99 por cento, com valor-p de 0,7280. Este guia faz parte do nosso guia completo de otimização de conversão (CRO) e cobre o que a pesquisa mostra (e não mostra), o que testar em ecommerce e em SaaS, os cinco erros de mensuração e dois exemplos calculados de ponta a ponta.

O que é prova social e por que ela funciona

A empresa de Robert Cialdini resume o princípio numa frase: especialmente quando estão inseguras, as pessoas olham para as ações e o comportamento dos outros para decidir as próprias. A palavra que importa nessa definição é inseguras. Prova social não convence ninguém de nada sozinha; ela empresta a experiência de outras pessoas a quem ainda não tem informação suficiente para decidir.

Para quem testa, isso quer dizer que o efeito esperado depende do tamanho da incerteza naquele ponto da página. Quem chegou pela busca da sua marca, já decidido, tem pouca dúvida para reduzir; quem vê um produto caro, de marca desconhecida, tem muita. O mesmo selo pode ter efeito zero numa página e relevante na outra.

Goldstein, Cialdini e Griskevicius acrescentaram uma segunda condição, num experimento de campo de 2008: a prova funcionou melhor quando o grupo citado estava na mesma situação do leitor, o que eles chamam de norma provinciana. Na página, “clientes do seu porte” ou “quem comprou este tamanho” tende a ser hipótese mais forte que “milhares de clientes”.

Os sete tipos de prova social numa página

tipo o que sinaliza onde costuma aparecer risco principal
Nota e contagem de avaliações outras pessoas compraram e avaliaram perto do título e do preço na página de produto nota perfeita com poucas avaliações parece boa demais
Número de clientes ou usuários escala e sobrevivência da empresa home, landing page, página de preços número inflado é publicidade enganosa
Depoimentos experiência concreta de alguém parecido landing page, página de preços, checkout depoimento genérico ou de origem incerta
Logos de clientes empresas conhecidas confiaram landing page B2B e página de preços SaaS logo que o visitante não reconhece ou não se identifica
Atividade em tempo real outras pessoas estão agindo agora página de produto e carrinho contador sorteado ou fixo no código
Selos e certificações um terceiro verificou algo checkout, rodapé, página de segurança selo sem verificação real ou fora do contexto
Conteúdo gerado por usuários fotos e vídeos de uso real galeria da página de produto, redes sociais peso de página e curadoria que esconde o negativo

A última coluna é quase toda sobre credibilidade. Prova social é uma afirmação sobre fatos, e por isso está exposta a dois riscos que o painel do teste não mostra: parecer falsa e ser falsa.

O que a evidência realmente mostra

Três fontes costumam ser citadas quando o assunto é prova social, com qualidades de evidência muito diferentes. Leia cada uma pelo desenho, não pelo número de manchete.

O experimento das toalhas: forte, famoso e com uma replicação que falhou

No primeiro experimento de Goldstein, Cialdini e Griskevicius, os 190 quartos de um hotel de uma rede nacional nos Estados Unidos foram sorteados entre dois cartões. O cartão padrão falava de proteger o meio ambiente. O cartão de norma descritiva dizia que quase 75 por cento dos hóspedes participavam do programa. Considerando só o primeiro dia elegível de cada hóspede, a reutilização foi de 44,1 por cento com a norma contra 35,1 por cento com o apelo ambiental, com valor-p de 0,05 num teste qui-quadrado sobre 433 observações.

No segundo experimento, com 1.595 observações no mesmo hotel e cinco cartões, as quatro mensagens de norma juntas chegaram a 44,5 por cento contra 37,2 por cento da mensagem ambiental, e a norma “dos hóspedes que ficaram neste quarto” chegou a 49,3 por cento, contra 42,8 por cento das outras três normas juntas.

A página de Cialdini apresenta o resultado como aumentos de 26 e 33 por cento. As contas batem com o artigo (44,1 contra 35,1 dá cerca de 26 por cento relativo; 49,3 contra 37,2 dá cerca de 33), mas cada número vem de um experimento diferente, com um controle diferente. É um bom lembrete de como resultado de pesquisa vira manchete.

E existe a parte que costuma ficar de fora. Em 2014, Bohner e Schlüter repetiram o desenho em dois hotéis na Alemanha, na PLoS ONE. No estudo 1, com 724 observações, as quatro normas juntas deram 81,9 por cento de reutilização contra 83,7 por cento da mensagem ambiental, valor-p de 0,62. No estudo 2, com 204 observações, a mensagem ambiental foi a melhor de todas (93,3 por cento). A conclusão dos autores: as mensagens de norma não foram mais eficazes que a padrão, e o efeito da proximidade foi inconsistente entre os estudos.

Reutilização de toalhas no experimento original e na replicaçãoBarras horizontais de taxa de reutilização. Goldstein e coautores, experimento 1: mensagem ambiental 35,1 por cento, norma descritiva 44,1 por cento. Experimento 2: mensagem ambiental 37,2 por cento, quatro normas juntas 44,5 por cento, norma do mesmo quarto 49,3 por cento. Bohner e Schlüter, estudo 1: mensagem ambiental 83,7 por cento, quatro normas juntas 81,9 por cento, sem diferença significativa.a mesma ideia, dois resultados: o contexto muda tudoGoldstein e coautores, 2008, experimento 1 (EUA)mensagem ambiental35,1%norma descritiva44,1%Goldstein e coautores, 2008, experimento 2 (EUA)mensagem ambiental37,2%quatro normas juntas44,5%norma do mesmo quarto49,3%Bohner e Schlüter, 2014, estudo 1 (Alemanha)mensagem ambiental83,7%quatro normas juntas81,9%escala de 0 a 100 por cento a partir da linha vertical. Na replicação, valor-p de 0,62.fontes: Journal of Consumer Research, 2008; PLoS ONE, 2014
Na Alemanha, a reutilização já era alta com qualquer cartão, e a norma descritiva não acrescentou nada. Um efeito real num contexto não é um efeito garantido em outro, e é exatamente por isso que prova social se testa em vez de se copiar.

Há ainda um detalhe de desenho que interessa a quem roda experimento. No hotel americano, o sorteio foi por quarto (190 quartos no experimento 1), e a análise foi por hóspede. Quando a unidade sorteada é maior que a unidade analisada, observações do mesmo grupo tendem a ser parecidas entre si, e o teste que trata cada uma como independente tende a exagerar a precisão. O blog trata essa conta em randomização por cluster e em unidade de sorteio.

O número dos 270 por cento: observacional e com fornecedor junto

O relatório How Online Reviews Influence Sales, do Spiegel Research Center da Northwestern, feito em parceria com a PowerReviews (empresa que vende software de avaliações), é a fonte de um dos números mais repetidos sobre prova social. O que ele diz, lido na íntegra:

achado de onde vem como ler
probabilidade de compra com cinco avaliações 270% maior que com nenhuma varejista de presentes de alto valor: cerca de 15,5 milhões de visualizações, 1.800 produtos, 7,8 milhões de usuários em um ano, acompanhando produtos à medida que acumulavam avaliações observacional; produto que acumula avaliação também acumula tempo de catálogo e vendas
exibir avaliações elevou a conversão em 190% em produto barato e 380% em produto caro mesma varejista, comparando categorias a direção (mais efeito em compra arriscada) é o que se transfere, não a magnitude
a probabilidade de compra costuma atingir o pico entre 4,0 e 4,7 estrelas e cair perto de 5,0 várias categorias de produto o próprio relatório também fala em 4,2 a 4,5 no resumo final; trate como faixa, não como alvo
quase todo o ganho acontece nas primeiras 10 avaliações, e as 5 primeiras fazem a maior parte varejista de presentes argumento para coletar poucas avaliações em muitos produtos
avaliação de comprador verificado aumenta a probabilidade de compra em 15% frente à anônima cerca de 13.500 produtos, 57 mil avaliações anônimas e 65 mil verificadas selo de verificado é uma hipótese de teste barata

O desenho não é um teste A/B. Um produto que chega a cinco avaliações é, por construção, um produto que já vendeu e está há mais tempo no catálogo, então o número não é “coloque estrelas e venda 3,7 vezes mais”. O que se transfere é a direção: avaliações pesam mais onde a incerteza é maior, nota perfeita desperta desconfiança e as primeiras avaliações valem mais que as seguintes.

A prova social que é mentira

Mathur e coautores, de Princeton, rastrearam cerca de 53 mil páginas de produto em cerca de 11 mil lojas (CSCW 2019) e encontraram 1.818 ocorrências de padrões enganosos de interface em 1.254 sites. Entre as 313 notificações de atividade (quem acabou de comprar, quantas pessoas estão vendo), 29, em 20 sites, eram enganosas: a maioria gerava o número com sorteio aleatório ou exibia mensagens fixas no código. Entre os depoimentos de origem incerta, num dos casos o mesmo conjunto de depoimentos aparecia em outra loja, com nomes de clientes diferentes.

Para quem testa: um contador falso pode “ganhar” um teste A/B. O painel mede comportamento, não veracidade, então “é verdade?” vem antes de “converte?”.

O que testar em prova social: a matriz ecommerce x SaaS

Como prova social trabalha sobre incerteza, a pergunta útil não é “coloco depoimentos?”, é “qual dúvida o visitante tem neste ponto, e que prova responde a ela?”. A dúvida muda entre ecommerce e SaaS, e muda de etapa para etapa.

A dúvida do visitante e a prova que responde a elaDuas colunas. Ecommerce, página de produto: dúvidas “vai servir em mim”, “a loja é confiável”, “chega a tempo”, respondidas por avaliações com fotos e tamanho, nota com contagem e selo de compra verificada. SaaS, página de preços: dúvidas “serve para empresas como a minha”, “e se eu assinar e não funcionar”, “meus dados ficam seguros”, respondidas por depoimento do mesmo porte, logos do mesmo segmento e informação de conformidade.a prova certa é a que responde à dúvida daquele pontoEcommerce: página de produtodúvidavai servir em mim? é como na foto?essa loja entrega mesmo?outras pessoas se arrependeram?prova que respondeavaliação com foto e tamanho usadonota com contagem, perto do preçoselo de compra verificadaSaaS: página de preçosdúvidaserve para empresas como a minha?e se eu assinar e não funcionar?meus dados ficam seguros?prova que respondedepoimento de empresa do mesmo portelogos do segmento que visitaconformidade e onde o dado fica
A norma provinciana do experimento das toalhas, traduzida para página: quanto mais parecido com o visitante é o grupo citado, mais plausível é o efeito. Plausível, não garantido, como a replicação mostrou.

A matriz abaixo organiza as hipóteses mais comuns pela alavanca que elas mexem. A coluna “armadilha de medida” é a que mais pesa na hora de ler o resultado.

alavanca ecommerce: o que testar SaaS: o que testar armadilha de medida
Posição nota com contagem logo abaixo do título, perto do preço, contra só no fim da página logos e depoimento acima da tabela de planos contra abaixo dela clique na nota sobe só porque ficou visível
Especificidade avaliações filtradas por tamanho ou uso contra lista geral depoimento do mesmo porte ou setor contra depoimento genérico segmento definido depois de ver o dado
Formato da nota média com contagem contra média sozinha; mostrar a distribuição de estrelas número de clientes contra logos nota alta com poucas avaliações
Credibilidade selo de compra verificada; exibir avaliações negativas depoimento com nome, cargo e empresa contra anônimo ganho de conversão que vira devolução ou churn
Atividade “vendidos nas últimas 24 horas”, se real “empresas que começaram este mês”, se real contador que muda sozinho durante o teste
Selos e conformidade selo de segurança perto do campo de cartão informação de LGPD, local do dado, certificações reais selo que aparece nos dois braços por outro caminho
Conteúdo de usuários galeria de fotos de clientes na página de produto estudo de caso com número verificável peso da página muda junto com a prova

Duas hipóteses contrariam a intuição. Exibir avaliações negativas: o Spiegel associa nota quase perfeita a menor probabilidade de compra, e o guia de teste A/B de página de produto argumenta que o negativo calibra expectativa e tende a reduzir devolução. Trocar logos grandes por logos parecidos com o visitante: o guia da página de preços SaaS descreve o mural de grandes marcas que convence a pequena empresa de que aquilo não é para ela, e o guia de landing page B2B SaaS recomenda testar quais logos, para qual segmento.

Uma nota técnica para ecommerce: o Google pede que o conteúdo de avaliação marcado com dados estruturados esteja prontamente disponível na página marcada. Esconder as avaliações no controle, mantendo a marcação, conflita com isso. Testar posição, formato e destaque é mais seguro que testar a existência das avaliações.

Como medir prova social sem se enganar

Prova social é barata de implementar e cara de medir. Cinco problemas aparecem em quase todo teste desse tipo, e cada um produz um vencedor falso de um jeito diferente.

1. A métrica errada: clique, conversão, receita ou pedido que fica

A métrica mais tentadora é a que se move primeiro: clique nas estrelas, abertura do carrossel de depoimentos. Ela explica por que uma variação ganhou e não decide se ganhou, porque qualquer destaque visual aumenta clique.

Escada de métricas de um teste de prova socialQuatro degraus da esquerda para a direita, cada um mais alto. Ecommerce: clique nas estrelas, adição ao carrinho, pedido concluído, pedido não devolvido. SaaS: clique no logo ou depoimento, início de trial, conta paga, conta retida. Uma seta indica que, subindo a escada, a métrica fica mais perto do dinheiro, a taxa base cai e a amostra necessária sobe.quanto mais perto do dinheiro, mais amostra a métrica pedeclique na provaestrelas, logodiagnósticoetapa seguintecarrinho, trialsecundáriatransaçãopedido, conta pagaprimáriavalor que ficanão devolvido,conta retidaguarda ou decisãotaxa base menor e maturação mais lenta a cada degrau: mais visitantes e mais dias para a mesma leitura
Um teste de prova social que só mede o primeiro degrau quase sempre “ganha”. O trabalho honesto é dimensionar para o degrau que decide e usar os de baixo para explicar.

A regra prática: primária no degrau da transação, guarda no degrau do valor que fica. Em ecommerce, pedido concluído decide e pedido não devolvido (ou receita líquida de devolução) protege. Em SaaS, início de trial costuma ser a primária possível, e conta paga é a que decide valor, com amostra muito maior. As métricas de guardrail explicam como fixar o limiar antes do teste, e o guia de tamanho de amostra para métricas contínuas mostra por que receita por visitante pede ainda mais amostra que conversão.

2. Efeito novidade: o selo novo chama atenção por ser novo

Um bloco de avaliações que aparece de repente numa página que o cliente recorrente conhece é, na primeira semana, principalmente novidade, e o ganho inicial pode encolher. Para separar novidade de efeito, compare novos e recorrentes e olhe a trajetória por semana, como em efeito novidade em teste A/B.

3. Contaminação: a prova social real muda durante o teste

Toda prova social verdadeira é um número vivo: a contagem cresce, a nota oscila, uma avaliação negativa entra no topo. Isso cria três problemas:

Nada disso invalida o teste, mas muda a leitura: registre por dia a nota e a contagem exibidas, e saiba que o resultado vale para a faixa de valores que apareceu.

4. Heterogeneidade: novo x recorrente, mobile x desktop

É razoável esperar que prova social ajude mais o visitante novo e que um bloco longo de depoimentos se comporte diferente numa tela pequena. O perigo é descobrir isso depois: com dez recortes independentes testados a 5 por cento, a chance de pelo menos um falso positivo passa de 40 por cento. Declare antes dois ou três segmentos com motivo e leia a diferença pela conta certa, em efeito heterogêneo por segmento e paradoxo de Simpson.

5. Prova social falsa: o teste não vê, a lei vê

jurisdição regra o que diz, em resumo o que muda num teste
Estados Unidos FTC, regra sobre uso de avaliações e depoimentos de consumidores (16 CFR 465), anunciada em 14/08/2024, em vigor desde 21/10/2024 proíbe avaliações e depoimentos falsos (inclusive gerados por IA), pagamento condicionado a avaliação com certo sentimento, avaliação de pessoa ligada à empresa sem aviso, supressão de avaliações por ameaça e compra ou venda de indicadores falsos de influência, como seguidores e visualizações; permite ação por multa civil em violação consciente variação com avaliação selecionada, contador inventado ou depoimento de funcionário não é hipótese, é risco
Brasil Código de Defesa do Consumidor, Lei 8.078/1990, arts. 37, 38 e 67 proíbe publicidade enganosa, inclusive parcialmente falsa ou por omissão; o ônus de provar a veracidade é de quem patrocina; fazer publicidade que sabe ou deveria saber enganosa prevê detenção de três meses a um ano e multa número de clientes, nota e contador exibidos precisam ser comprováveis nos dois braços
Brasil Conar, Código Brasileiro de Autorregulamentação Publicitária, Anexo Q (testemunhais) depoimento de consumidor identificado usa nome e sobrenome verdadeiros; empregados do anunciante não se passam por consumidor comum; o anunciante deve comprovar a veracidade do testemunhal quando solicitado depoimento sem autorização ou de origem incerta não entra em variação

Nas perguntas e respostas sobre a regra, a FTC esclarece que organizar avaliações não é suprimir, mas que organizá-las de um jeito que dificulte encontrar as negativas pode ser prática enganosa pela lei geral. Para quem testa ordenação de avaliações, essa é a linha. Isto é contexto, não parecer jurídico.

Exemplo trabalhado 1: o selo de avaliações na página de produto

Cenário (ilustrativo). Uma loja de moda com 60.000 visitantes por semana nas páginas de produto converte 2,4 por cento das visitas em pedido. Hoje as avaliações existem, mas ficam no fim da página. A hipótese: mostrar a nota média com a contagem logo abaixo do título, perto do preço, reduz a dúvida no momento em que ela aparece e aumenta os pedidos.

Métricas declaradas antes. Primária: visitante com pedido concluído. Guarda: visitante com pedido não devolvido em 30 dias (no cenário, cada comprador faz um pedido). Diagnóstico: clique na nota. Segmentos: novo e recorrente. Tudo no template, para todo o catálogo, porque uma página de produto sozinha não teria tráfego.

Amostra. O time quer enxergar um ganho de 8 por cento relativo. Na calculadora abaixo, digite: taxa de conversão atual 2,4; efeito mínimo detectável 8, relativo; confiança 95; poder 80; visitantes por semana 60000; teste bilateral.

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

A tela mostra 103.633 visitantes por variação, 207.266 no total e 25 dias. O time arredonda para quatro semanas completas, 28 dias, o que dá 120.000 visitantes por braço. Para sentir a sensibilidade, troque só o efeito mínimo:

efeito relativo que você quer detectar visitantes por variação total dias a 60.000 por semana
5% 261.572 523.144 62
8% 103.633 207.266 25
10% 66.946 133.892 16
12% 46.922 93.844 11

A espiada que não se deve fazer. No fim da primeira semana, com 30.000 visitantes por braço, eram 720 pedidos no controle e 834 na variação: mais 15,8 por cento, valor-p de 0,0034. Parar ali seria registrar quase o dobro do ganho que o teste completo mostrou. Nas semanas 2 a 4, com 90.000 por braço, o placar foi de 2.160 contra 2.298, mais 6,4 por cento, valor-p de 0,0364. A primeira semana mais forte é compatível com novidade e também com ruído; o que ela não autoriza é decisão. O custo de olhar antes da hora está em o problema do peeking.

O resultado da métrica primária, em 28 dias.

braço visitantes pedidos taxa
A, avaliações no fim da página 120.000 2.880 2,40%
B, nota com contagem perto do preço 120.000 3.132 2,61%

A divisão está limpa: 120.000 contra 120.000 não acende alerta nenhum no verificador de SRM. Agora cole na calculadora de significância: controle com 120000 visitantes e 2880 conversões; variação com 120000 visitantes e 3132 conversões; confiança 95.

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

A tela mostra taxa de 2,40% no controle e 2,61% na variação, melhora relativa de +8,8%, valor-p de 0,0010, intervalo de 95 por cento da diferença de +0,1% … +0,3% (pp) e o veredito Vencedora com significância · B vence. Com mais casas, a melhora é de 8,75 por cento, o valor-p é 0,000997 e o intervalo vai de mais 0,0850 a mais 0,3350 ponto percentual, ou de cerca de mais 3,5 a mais 14,0 por cento em termos relativos (dividindo o intervalo pela taxa do controle).

Até aqui, a história de sempre: B venceu, com folga. São 252 pedidos a mais.

A reviravolta: a guarda que só amadurece 30 dias depois. Os pedidos de 30 dias de janela de devolução só fecham quase dois meses depois do início do teste. Quando fecham:

braço pedidos devolvidos taxa de devolução visitantes com pedido mantido taxa por visitante
A 2.880 461 16,01% 2.419 2,02%
B 3.132 689 22,00% 2.443 2,04%

Dos 252 pedidos a mais, 228 voltaram. Para conferir as duas leituras na mesma calculadora, digite primeiro os pedidos como “visitantes” e as devoluções como “conversões” (2880 e 461 contra 3132 e 689): a tela mostra 16,01% contra 22,00%, melhora de +37,4%, valor-p menor que 0,0001 (a tela escreve o sinal de menor antes do número), intervalo de +4,0% … +8,0% (pp) e o veredito “Vencedora com significância · B vence”. Aqui a calculadora só diz que a taxa de B é maior, e nesta métrica maior é pior.

Depois digite a guarda: 120000 e 2419 contra 120000 e 2443. A tela mostra 2,02% contra 2,04%, melhora de +1,0%, valor-p de 0,7280, intervalo de -0,1% … +0,1% (pp) e Ainda sem significância. Com mais casas, a melhora é de 0,99 por cento e o intervalo vai de menos 0,0927 a mais 0,1327 ponto percentual, cerca de menos 4,6 a mais 6,6 por cento relativos.

Efeito do selo de avaliações em pedidos e em pedidos mantidosDois intervalos de confiança de 95 por cento sobre um eixo de efeito relativo de menos 10 a mais 20 por cento. Pedidos: estimativa de mais 8,75 por cento, intervalo de mais 3,5 a mais 14,0 por cento, inteiro à direita do zero. Pedidos mantidos após 30 dias: estimativa de mais 0,99 por cento, intervalo de menos 4,6 a mais 6,6 por cento, cruzando o zero.o mesmo teste, duas perguntas: vendeu mais? ficou mais?-10%0%+10%+20%pedidos28 dias+8,75%, p = 0,0010pedidos mantidos30 dias depois+0,99%, p = 0,7280intervalo relativo aproximado: intervalo da diferença dividido pela taxa do controle.cenário ilustrativo calculado com o motor das calculadoras do blog
O intervalo de pedidos mantidos cruza o zero e deixa de fora o ganho de 8,75 por cento. O teste tinha cerca de 79 por cento de poder para ver um ganho de 8 por cento nessa métrica, então “não apareceu” aqui é informativo, não só falta de amostra.

O que o resultado diz. O selo levou à compra gente que antes rolava até as avaliações, lia sobre tamanho e desistia. No cenário, o diagnóstico sustenta essa leitura: o clique em “ver avaliações” caiu na variação, e o motivo de devolução mais citado em B é caimento. O selo respondeu à dúvida errada (confiar na loja) quando a dúvida real era o tamanho. E não é só falta de amostra: para um ganho de 8 por cento em pedidos mantidos, a base de 2,02 por cento pede 123.628 visitantes por variação (29 dias), e o teste tinha 120.000.

O que fazer com ele. Não lançar B como está. A próxima variação combina a nota perto do preço com o trecho de avaliações filtrado por tamanho, que responde à dúvida que gerava a devolução. Mesma primária, mesma guarda, e dessa vez com a leitura final marcada para depois da janela de devolução.

Exemplo trabalhado 2: logos de clientes na página de preços SaaS

Cenário (ilustrativo). Um SaaS B2B recebe 12.000 visitantes por semana na página de preços e 7 por cento deles iniciam trial. Cerca de 15 por cento dos trials viram conta paga em 30 dias, o que dá 1,05 por cento de conta paga por visitante. A hipótese: uma faixa de logos de clientes conhecidos acima da tabela de planos reduz o risco percebido de assinar.

Amostra. Na mesma calculadora de tamanho de amostra lá em cima, troque os campos: taxa atual 7; efeito mínimo 15, relativo; confiança 95; poder 80; visitantes por semana 12000; bilateral. A tela mostra 9.907 visitantes por variação, 19.814 no total e 12 dias. O time roda duas semanas completas: 12.000 visitantes por braço.

O resultado em trials. Na calculadora de significância, digite 12000 e 840 no controle e 12000 e 966 na variação. A tela mostra 7,00% contra 8,05%, melhora de +15,0%, valor-p de 0,0020, intervalo de +0,4% … +1,7% (pp) e Vencedora com significância · B vence. São 126 trials a mais.

O resultado em conta paga, 30 dias depois.

métrica A B melhora relativa valor-p leitura
início de trial por visitante 840 de 12.000 (7,00%) 966 de 12.000 (8,05%) +15,0% 0,0020 significativo
trial que vira conta paga 126 de 840 (15,00%) 130 de 966 (13,46%) -10,3% 0,3486 sem significância
conta paga por visitante 126 de 12.000 (1,05%) 130 de 12.000 (1,08%) +3,2% 0,8015 sem significância

Para conferir a última linha, digite 12000 e 126 contra 12000 e 130: a tela mostra 1,05% contra 1,08%, melhora de +3,2%, valor-p de 0,8015, intervalo de -0,2% … +0,3% (pp) e Ainda sem significância. Com mais casas, o intervalo vai de menos 0,2266 a mais 0,2933 ponto percentual, algo como menos 21,6 a mais 27,9 por cento relativos. Dos 126 trials a mais, 4 viraram conta paga a mais.

A reviravolta aqui é diferente da do ecommerce. O resultado em conta paga não diz que os logos não funcionam. Diz que o teste nunca teve como responder. Volte à calculadora de amostra e digite a métrica que decide o dinheiro: taxa 1,05, efeito 15 relativo, 95, 80, 12000 por semana. A tela mostra 70.622 por variação, 141.244 no total e 83 dias. A calculadora não mostra poder, então a conta seguinte é deste guia, com a mesma fórmula: com 12.000 por braço, o poder para detectar mais 15 por cento em conta paga era de cerca de 21 por cento, e o menor efeito que esse tamanho enxergaria com 80 por cento de poder é de cerca de 38 por cento relativo.

Dias necessários por métrica no teste de logosBarras horizontais de duração a 12 mil visitantes por semana para detectar 15 por cento relativo. Início de trial, base de 7 por cento: 9.907 visitantes por variação e 12 dias. Conta paga, base de 1,05 por cento: 70.622 visitantes por variação e 83 dias. Uma linha vertical marca os 14 dias que o teste rodou.o teste foi dimensionado para trial, e a decisão é sobre conta pagainício de trialbase 7%, 9.907 por variação12 diasconta pagabase 1,05%, 70.622 por variação83 diaso teste rodou 14 dias050 dias15% relativo, 95% de confiança, 80% de poder, 12.000 visitantes por semana, bilateral
Poder de cerca de 21 por cento para a métrica que decide o valor. O resultado “sem significância” em conta paga é ausência de evidência, e o intervalo de menos 21,6 a mais 27,9 por cento relativos mostra o tamanho da ignorância.

O que fazer com ele. Há três caminhos honestos, e a escolha deveria ter sido feita antes: aceitar trial como métrica de decisão, com guardrail declarado na taxa de trial para pago e acompanhamento da coorte; rodar 12 semanas, se a decisão vale esse calendário; ou aceitar enxergar só efeitos grandes em conta paga, por escrito. O que não se faz é anunciar “logos aumentam conversão em 15 por cento”. E um sinal vira hipótese nova: a taxa de trial para pago caiu de 15,00 para 13,46 por cento, sem significância, mas na direção de “logos grandes atraíram trials de quem não era o cliente típico”. A próxima variação testa logos do mesmo porte do visitante típico. O raciocínio de atribuir valor a esse tipo de vencedor está em atribuindo receita ao vencedor do teste A/B.

Checklist antes de testar prova social

  1. Verdade primeiro. Todo número, nota, logo, depoimento e contador exibido é real, comprovável e autorizado.
  2. Dúvida mapeada. Qual incerteza do visitante a prova responde naquele ponto da página?
  3. Primária na transação, guarda no valor que fica. Clique na prova é só diagnóstico.
  4. Amostra dimensionada para a métrica que decide, e leitura marcada para depois da maturação (devolução, fim do trial).
  5. Semanas completas, sem parar na primeira semana boa.
  6. Segmentos declarados antes, no máximo dois ou três, com motivo.
  7. Registro diário da prova exibida (nota, contagem, número de clientes) e de por onde o controle já a vê.
  8. SRM conferido antes de ler qualquer efeito, principalmente quando o bloco de avaliações vem de um app que carrega depois.

Erros comuns

Faça isso automático na Donnu

A dor específica de testar prova social é que o vencedor aparece rápido na métrica errada e o prejuízo aparece devagar na métrica certa. Nenhuma ferramenta resolve isso por mágica, mas algumas escolhas de configuração tornam o erro menos provável.

Na Donnu, a meta de conversão pode ser confirmada a partir do seu servidor (server-to-server), além de cliques, envios de formulário, visitas a páginas e eventos personalizados. Isso permite medir a transação que aconteceu de verdade, como um pedido pago confirmado pelo gateway, em vez de um clique no botão. No plano Pro, a campanha pode ser restrita por dispositivo e por tipo de visitante, novo ou recorrente, o que ajuda a declarar o segmento antes de rodar em vez de caçá-lo depois. O relatório é bayesiano e mostra a probabilidade de a variação ser melhor que o controle, com o intervalo de confiança da melhora; no plano Pro, essa probabilidade aparece também dia a dia, e uma vantagem de primeira semana que cruza a faixa de 95 por cento e volta fica visível como ruído, em vez de virar decisão.

O que continua sendo seu: garantir que a prova exibida é verdadeira, esperar a maturação da guarda e dimensionar pela métrica que decide. Para isso, a calculadora de tamanho de amostra, a calculadora de significância e a calculadora de receita por visitante fazem as contas deste guia com os seus números, de graça.

Referências

Leia também: Teste A/B de página de produto · Otimização da página de preços SaaS · Teste A/B de landing page B2B SaaS · Otimização de checkout · Efeito novidade · Métricas de guardrail · Calculadora de significância · Read in English

Perguntas frequentes

O que é prova social num site?
É qualquer sinal de que outras pessoas já escolheram, usaram ou aprovaram aquilo que o visitante está avaliando: nota e contagem de avaliações, número de clientes, depoimentos, logos de empresas clientes, atividade em tempo real, selos e certificações, e conteúdo gerado por usuários. Ela funciona reduzindo incerteza, por isso tende a pesar mais em compra cara, marca pouco conhecida e decisão arriscada, e menos quando o visitante já chegou decidido.
Adicionar avaliações aumenta a conversão?
Com frequência, mas um dos números mais citados não vem de um teste A/B. O relatório do Spiegel Research Center, da Northwestern, feito com dados da PowerReviews, relata que a probabilidade de compra de um produto com cinco avaliações é 270 por cento maior que a de um produto sem nenhuma, a partir de produtos que foram acumulando avaliações ao longo do tempo. É evidência observacional forte, não uma promessa para a sua loja. O jeito de saber no seu caso é testar, e medir pedido que não volta, não só pedido.
Qual métrica usar num teste de prova social?
A que está mais perto do dinheiro que você consegue dimensionar. Clique nas estrelas ou no depoimento é diagnóstico, nunca métrica primária. Em ecommerce, a primária é pedido concluído e a guarda é pedido não devolvido ou receita líquida. Em SaaS, a primária costuma ser início de trial e a que decide o valor é conta paga. No exemplo deste guia, um selo de avaliações ganha 8,75 por cento em pedidos com valor-p de 0,0010 e só 0,99 por cento em pedidos mantidos, com valor-p de 0,7280.
Posso usar contador de pessoas vendo o produto agora?
Só se o número for real e medido. Um estudo de Princeton que analisou cerca de 53 mil páginas de produto em cerca de 11 mil lojas encontrou 313 notificações de atividade, e 29 delas, em 20 sites, eram enganosas, a maioria gerada por sorteio de número aleatório ou fixa no código. Nos Estados Unidos, a regra da FTC sobre avaliações e depoimentos falsos está em vigor desde 21 de outubro de 2024. No Brasil, o Código de Defesa do Consumidor proíbe publicidade inteira ou parcialmente falsa e atribui a quem anuncia o ônus de provar a veracidade.
Quanto tráfego é preciso para testar prova social?
Depende da taxa base e do efeito que você quer enxergar. Com 2,4 por cento de conversão numa página de produto, 95 por cento de confiança e 80 por cento de poder, detectar 8 por cento relativo exige 103.633 visitantes por variação, 25 dias a 60 mil visitantes por semana. Numa página de preços SaaS com 7 por cento de início de trial, detectar 15 por cento relativo exige 9.907 por variação. Medir conta paga com base de 1,05 por cento, com o mesmo efeito relativo, exige 70.622 por variação, 83 dias a 12 mil visitantes por semana.
Logos de clientes funcionam em página de preços SaaS?
Podem aumentar o início de trial e não mudar a conta paga, que é o que aconteceu no exemplo trabalhado deste guia: mais 15,0 por cento em trials com valor-p de 0,0020, e mais 3,2 por cento em contas pagas com valor-p de 0,8015, num teste que tinha só cerca de 21 por cento de poder para essa segunda métrica. Logo funciona como prova quando o visitante reconhece a empresa e se identifica com ela, então vale testar quais logos, para qual segmento, em vez de ter ou não ter logos.