CRO

Teste A/B para SEO: o guia do split test de páginas

Teste A/B para SEO randomiza páginas, não usuários. O que o Google permite, o erro estatístico que invalida quase todo relatório e a conta certa.

Ilustração plana de dois grupos idênticos de cartões retangulares lado a lado, com uma lupa pairando sobre o espaço entre os dois grupos

Teste A/B para SEO é um experimento em que a unidade sorteada é a página, e não o usuário. Metade das páginas de um mesmo template recebe a mudança, a outra metade fica intacta, e a comparação acontece entre os dois grupos de páginas, no mesmo período, sob as mesmas condições externas. Isso muda tudo na estatística: como as impressões da mesma página são parecidas entre si, a conta feita por impressão infla a confiança de forma brutal. No exemplo trabalhado deste guia, a mesma leitura que parece ter valor-p abaixo do exibível (z de 10,0835 sobre 2,52 milhões de impressões por grupo) vira um valor-p de 0,124075 quando a correlação entre impressões da mesma página é levada em conta. Este guia mostra o que o Google oficialmente permite, os dois desenhos que funcionam, a correção estatística que quase nenhum relatório de teste de SEO faz, e quantas páginas você precisa antes de começar. Faz parte do nosso guia completo de otimização de conversão e é o par técnico de CRO x SEO.

Por que a ferramenta de teste A/B comum não serve aqui

Um teste A/B tradicional sorteia pessoas. Cada visitante entra num balde, vê uma versão, e o balde dele é lembrado por cookie. Isso funciona porque o visitante volta, e porque as pessoas são trocáveis entre si.

O Googlebot quebra as três premissas de uma vez:

premissa do teste A/B clássico o que acontece com o Googlebot
o sujeito é sorteado e lembrado o robô não tem cookie de balde, não é “um usuário”
o sujeito volta várias vezes ele passa, lê o HTML servido, e vai embora
todo sujeito é trocável por outro existe um só, e a decisão dele é sobre a URL, não sobre a sessão
a variação pode ser aplicada no navegador o que conta é o HTML servido, não o DOM depois do JavaScript

E há o problema legal da coisa. Servir uma versão ao robô e outra às pessoas tem nome: cloaking. A documentação oficial do Google Search é explícita ao dizer para não mostrar um conjunto de URLs ao Googlebot e outro a humanos, classifica isso como violação das políticas de spam, e registra que infringir essas políticas pode rebaixar ou remover o site dos resultados.

A saída não é sortear melhor as pessoas. É trocar a unidade de sorteio. Isso já é um assunto conhecido do blog em outro contexto: quando você não pode sortear indivíduos, sorteia grupos, e paga um preço estatístico por isso. É exatamente o problema da randomização por cluster, aplicado a páginas.

Comparação entre sortear usuários e sortear páginasDiagrama com duas faixas. Na faixa de cima, o teste A/B clássico: muitos visitantes são divididos em dois baldes e cada um vê uma versão da mesma página. Na faixa de baixo, o teste de SEO: um conjunto de páginas do mesmo template é dividido em dois grupos, cada grupo com uma versão do HTML, e o mesmo robô de busca visita os dois grupos.teste A/B clássico: a unidade sorteada é a PESSOAvisitantesversão A da páginaversão B da página1 URL, 2 experiênciasfunciona porque a pessoa voltateste de SEO: a unidade sorteada é a PÁGINA600 páginas de controle600 páginas com a mudançao mesmo robô visita os dois gruposcada URL tem UMA versão só, para todo mundoo que muda entre os grupos é o HTML servido
A mudança de unidade é a definição do método. Tudo o que vem depois, inclusive a estatística, é consequência dela.

O que o Google permite, em palavras da documentação oficial

A documentação de testes de site do Google Search é curta e quase toda composta de regras operacionais. As quatro que importam:

regra o que a documentação diz
impacto no ranqueamento mudanças pequenas, como tamanho, cor ou posição de um botão ou imagem, em geral têm pouco ou nenhum impacto no snippet ou no ranqueamento da página
cloaking não mostre um conjunto de URLs ao Googlebot e outro a humanos; isso é cloaking e vai contra as políticas de spam
URLs alternativas use rel canonical nas URLs alternativas para indicar a URL original como versão preferida, em vez de noindex
redirecionamento se o teste manda o usuário da URL original para uma URL de variação, use 302 temporário, nunca 301 permanente
duração ao concluir o teste, atualize o site com a variação desejada e remova todos os elementos do teste o quanto antes; testes que se prolongam podem ser interpretados como tentativa de enganar os buscadores

Repare no que essas regras implicam juntas. Elas não proíbem experimentar, elas proíbem experimentar mostrando coisas diferentes a robô e a pessoa. O split test por páginas passa nas cinco por construção: cada URL tem uma versão só, servida igual para todo mundo, sem redirecionamento nenhum e sem URL alternativa.

O caso que mais gente erra é o do teste rodado com ferramenta de CRO comum numa página importante para busca orgânica. Ele não viola cloaking se a variação é aplicada por JavaScript para todos, robô incluído. Mas ele também não mede SEO nenhum: mede conversão de quem já chegou. São perguntas diferentes, e a diferença entre elas é o assunto de CRO x SEO.

Os dois desenhos de teste A/B para SEO que funcionam

Desenho 1: split test randomizado por páginas

É o desenho forte, o único que merece o nome de experimento. Exige um template com muitas páginas parecidas: catálogo de produtos, páginas de categoria, perfis, listagens por cidade, artigos de um mesmo tipo.

Passo a passo:

  1. Selecione o conjunto de páginas elegíveis, todas do mesmo template.
  2. Sorteie metade para variação e metade para controle. Sorteie de verdade, e depois confira o equilíbrio: os dois grupos precisam ter volume de tráfego parecido e, principalmente, subir e descer juntos no histórico.
  3. Aplique a mudança no servidor ou na borda, de modo que ela esteja no HTML servido.
  4. Espere. Duas a quatro semanas é a faixa usual para uma leitura, segundo a SearchPilot, que opera esse tipo de teste comercialmente.
  5. Compare os dois grupos no mesmo período.

O ponto do sorteio ser checado, e não só feito, vale um parágrafo. A SearchPilot publica um exemplo didático disso: um agrupamento mal feito que colocou todos os produtos de gato num dos baldes gerou um falso positivo durante o Dia Internacional do Gato. O sorteio aleatório protege na média, mas com poucas centenas de páginas o azar acontece, e conferir o equilíbrio histórico antes de começar é barato.

Desenho 2: pré e pós com grupo de controle e modelo de série temporal

Quando não há páginas suficientes para sortear, resta o desenho observacional: aplicar a mudança num conjunto de páginas, manter outro conjunto intacto, e modelar o que teria acontecido com o grupo tratado se nada tivesse mudado.

Essa é a máquina do CausalImpact, de Brodersen, Gallusser, Koehler, Remy e Scott. A ideia é montar um controle sintético como combinação ponderada de séries de controle, ajustar o modelo no período anterior à intervenção e projetar a contrafactual depois dela. A premissa dura, declarada no artigo, é que as séries de controle não podem ser afetadas pela intervenção, porque é isso que mantém a relação estimada antes válida depois.

Essa premissa é mais frágil do que parece em SEO. Se você melhora o título de 300 páginas e elas passam a ranquear melhor para consultas que as páginas de controle também disputam, o controle foi afetado. Isso é canibalização, e é o equivalente em SEO da interferência entre variações.

A mesma família de métodos aparece no blog em série temporal interrompida e em controle sintético, com o tratamento estatístico completo.

aspecto split randomizado por páginas pré e pós com controle
exige quantas páginas centenas no mesmo template funciona com poucas ou com uma
premissa principal só o sorteio modelo da série de controle está certo
aguenta atualização de algoritmo sim, atinge os dois grupos igualmente só se o controle for de fato paralelo
aguenta sazonalidade sim, pelo mesmo motivo depende do modelo capturar a sazonalidade
risco de canibalização existe, e enviesa para menos existe, e enviesa para mais
o que dizer no relatório “medimos” “estimamos, sob estas premissas”

O erro estatístico que invalida quase todo relatório de teste A/B para SEO

Aqui está o coração deste guia. O cenário do exemplo trabalhado:

parâmetro valor
páginas elegíveis (mesmo template) 1.200
divisão 600 controle, 600 variação
impressões orgânicas por página em 28 dias 4.200
impressões por grupo 2.520.000
métrica primária CTR orgânico (cliques dividido por impressões) do Search Console
CTR do controle 3,2000% (80.640 cliques)
CTR da variação 3,3600% (84.672 cliques)

A tentação é óbvia: são duas proporções, então basta colar num teste de duas proporções. Cole você mesmo:

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Com 2.520.000 e 80.640 no controle contra 2.520.000 e 84.672 na variação, a tela mostra 3,20 por cento contra 3,36 por cento, mais 5,0 por cento relativo, o veredito de que B vence com significância e um valor-p tão pequeno que aparece como “menor que 0,0001”. Por trás do arredondamento da tela, a diferença absoluta é de mais 0,1600 ponto percentual, o z vale 10,0835 e o intervalo de confiança vai de mais 0,1289 a mais 0,1911 ponto. Parece uma vitória fora de dúvida.

É uma leitura errada, e o motivo é simples: impressões da mesma página não são independentes umas das outras. Uma página de categoria com título bom, marcação rica e boa posição média tem CTR alto nas 4.200 impressões dela. Outra página, com intenção de busca mais vaga, tem CTR baixo nas 4.200 dela. O teste de duas proporções acha que você tem 2,52 milhões de observações independentes. Você tem 600.

A correção clássica é o efeito de desenho:

efeito de desenho = 1 + (m menos 1) vezes ICC

onde m é o número de impressões por página no período e ICC é a correlação intraclasse, ou seja, quanto duas impressões da mesma página se parecem mais do que duas impressões de páginas diferentes.

z corrigido = z ingênuo dividido pela raiz do efeito de desenho

Com m igual a 4.200, olhe o que acontece:

ICC efeito de desenho z corrigido valor-p corrigido amostra efetiva por grupo
0,002 9,398 3,2892 0,001005 268.142
0,005 21,995 2,1500 0,031551 114.571
0,010 42,990 1,5379 0,124075 58.618
0,020 84,980 1,0938 0,274027 29.654
0,050 210,950 0,6943 0,487521 11.946

Leia a linha do meio devagar. Uma correlação intraclasse de 0,01, que é minúscula em termos absolutos, multiplica a variância por quase 43 e transforma um “valor-p abaixo do exibível” num “não deu”. O motivo é o m grande: quando cada cluster tem milhares de observações, até uma correlação ínfima domina a conta.

Não existe ICC de CTR orgânico por template publicado, e por isso os valores da tabela são cenários assumidos, não medidos. Ainda assim, há razão para esperar que a correlação não seja desprezível: a dispersão de CTR entre páginas de um mesmo template tende a ser grande, porque posição média, intenção da consulta e presença de recursos da SERP variam de página para página. Meça o seu no seu próprio acervo antes de escolher uma linha dessa tabela.

Como o efeito de desenho derruba o valor de z conforme a correlação intraclasse cresceGráfico de barras horizontais mostrando o valor de z corrigido para cinco níveis de correlação intraclasse. Sem correção, z vale dez vírgula zero oito. Com correlação de zero vírgula zero zero dois, cai para três vírgula vinte e nove. Com zero vírgula zero zero cinco, cai para dois vírgula quinze. Com zero vírgula zero um, cai para um vírgula cinquenta e quatro, abaixo da linha de corte de um vírgula noventa e seis. Com zero vírgula zero dois cai para um vírgula zero nove e com zero vírgula zero cinco para zero vírgula sessenta e nove.valor de z, conforme a correlação entre impressões da mesma páginasem correção nenhuma10,08ICC 0,0023,29ICC 0,0052,15ICC 0,0101,54ICC 0,0201,09ICC 0,0500,69linha de corte: z igual a 1,96os mesmos cliques, os mesmos 2,52 milhões de impressões. Muda só o que se assume sobre independência.
A barra de cima é o número que aparece na maioria dos relatórios de teste de SEO. As de baixo são o mesmo dado, contado direito.

A conta certa: a página é a unidade de análise

Existe um jeito mais direto de não errar isso, e ele dispensa estimar ICC nenhuma: analise por página.

Calcule o CTR de cada uma das 1.200 páginas, e compare a média dos 600 CTRs do controle com a média dos 600 da variação. A conta vira um teste de duas médias, e o que importa deixa de ser o volume de impressões e passa a ser quanto as páginas variam entre si.

Com efeito verdadeiro de 0,16 ponto percentual e 600 páginas por grupo:

desvio de CTR entre páginas erro-padrão da diferença estatística t valor-p
0,80 pp 0,0462 pp 3,4641 0,000532
1,10 pp 0,0635 pp 2,5193 0,011757
1,50 pp 0,0866 pp 1,8475 0,064672
2,00 pp 0,1155 pp 1,3856 0,165857

A leitura é a mesma da tabela anterior, dita de outro jeito: o teste passa ou não passa dependendo de uma quantidade que não tem nada a ver com quantas impressões você acumulou. E essa quantidade é fácil de medir: exporte o CTR por página do Search Console e tire o desvio-padrão. Leva cinco minutos e determina se o teste é viável.

Invertendo a conta, para 80 por cento de poder no mesmo efeito de 0,16 ponto:

desvio entre páginas páginas por grupo total de páginas necessárias
0,80 pp 393 786
1,10 pp 742 1.484
1,50 pp 1.380 2.760
2,00 pp 2.453 4.906

É por isso que a SearchPilot declara como requisito operacional ter centenas de páginas do mesmo template e pelo menos 30.000 sessões orgânicas por mês chegando ao grupo de páginas testado. Os dois números não são arbitrários, são a tradução comercial da tabela acima.

Dimensionando antes de rodar

O número de páginas manda, mas ainda vale dimensionar pelo lado das impressões, porque é ele que define quanto tempo o teste precisa ficar no ar. Use a base de CTR real do seu template:

Calculadora de tamanho de amostra
-Visitantes por variação
-Total (2 variações)
-Duração estimada

Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.

Com taxa base de 3,20 por cento, 95 por cento de confiança, 80 por cento de poder e teste bicaudal, a calculadora devolve a coluna do meio abaixo. A coluna da direita é a mesma conta depois de multiplicar pelo efeito de desenho de 9,398, que corresponde a uma correlação intraclasse moderada de 0,002.

MDE relativo impressões por grupo (ingênuo) com efeito de desenho 9,398 páginas por grupo a 4.200 impressões cada
3% 535.267 5.030.440 1.198
5% 194.530 1.828.193 436
8% 77.062 724.229 173
10% 49.777 467.805 112
15% 22.631 212.687 51
20% 13.015 122.315 30

A leitura prática dessa tabela é dura e útil: testes de SEO só enxergam efeitos grandes. Um ganho de 3 por cento no CTR é invisível para quase todo site. Um ganho de 15 ou 20 por cento, do tipo que uma reescrita séria de títulos produz, é detectável com poucas dezenas de páginas. Planeje mudanças ousadas, não ajustes finos, e leia isso junto de efeito mínimo detectável.

O que dá para testar e o que não dá

mudança dá para split test? por quê
padrão de title de um template sim, é o caso ideal muitas páginas, mudança no HTML servido, efeito plausível e grande
meta description sim mesma lógica; afeta CTR sem afetar posição diretamente
marcação de dados estruturados sim aparece ou não aparece no HTML por grupo
bloco de conteúdo novo no template sim server-side, aplicável a metade das páginas
links internos dentro do template com cuidado o grupo de controle recebe links do grupo tratado, o que quebra a independência
mudança de estrutura de URL não mexer em URL é mudança permanente, e 302 de teste em massa é má ideia
velocidade do site inteiro não é mudança de infraestrutura, atinge os dois grupos
migração de domínio, HTTPS, robots não não existe versão parcial disso
mudança numa página única importante não como split test use o desenho de pré e pós com controle e assuma as premissas

A linha dos links internos merece destaque. Se as páginas tratadas ganham um bloco de links que aponta para páginas de controle, você acabou de tratar o controle também, e o efeito medido encolhe em direção a zero. O nome disso é interferência, e a leitura completa está em interferência entre variações.

Confundidores e o que o grupo de controle resolve

Como o grupo de controle absorve uma atualização de algoritmo no meio do testeGráfico de linhas com duas séries ao longo de oito semanas. As duas séries sobem e descem juntas até a semana quatro, quando uma queda brusca atinge as duas ao mesmo tempo, representando uma atualização de algoritmo. Depois da queda, a série da variação fica consistentemente acima da série de controle, mostrando que a diferença entre elas sobrevive ao choque comum.tráfego orgânico por grupo, oito semanasatualização de algoritmoatinge os dois gruposcontrolevariaçãosem grupo de controle, esse gráfico vira “a mudança destruiu o SEO”.com grupo de controle, a pergunta certa é a DISTÂNCIA entre as duas linhas, e ela cresceu.
O grupo de controle simultâneo é o que converte um choque externo de fator fatal em fator irrelevante.

A lista de confundidores que um teste de SEO enfrenta é longa e nenhuma delas está sob seu controle: atualização de algoritmo, sazonalidade de demanda, mudança de layout da SERP, concorrente novo, recurso de IA ocupando o topo da página. O desenho randomizado com controle simultâneo neutraliza todos os que atingem os dois grupos igualmente, e isso cobre praticamente a lista inteira.

O que ele não neutraliza é o que atinge os grupos de forma diferente. Dois casos reais:

Para o primeiro caso, a defesa é olhar o histórico dos dois grupos antes de começar, e refazer o sorteio se eles não andarem juntos. Isso é o equivalente em SEO do teste A/A: conferir que a divisão não produz diferença quando ainda não há tratamento nenhum.

O exemplo trabalhado completo, do início ao fim

Hipótese. Incluir a faixa de preço no title das páginas de categoria aumenta o CTR orgânico, porque qualifica o clique antes dele acontecer.

Desenho. 1.200 páginas de categoria do mesmo template, sorteadas 600 e 600. Mudança aplicada no servidor. Janela de 28 dias. Métrica primária: CTR orgânico do Search Console. Métricas de guardrail: impressões totais e posição média, para detectar se o título novo derrubou relevância.

Verificação prévia. Desvio-padrão de CTR entre as 1.200 páginas nos 28 dias anteriores: 1,10 ponto percentual. Pela tabela de poder, 742 páginas por grupo seriam necessárias para 80 por cento de poder num efeito de 0,16 ponto. Temos 600. O teste nasce subdimensionado para esse efeito, e isso fica registrado no plano antes de rodar, não descoberto depois. Ele tem poder para efeitos maiores, na faixa de 0,20 ponto para cima.

Resultado bruto. Controle: 2.520.000 impressões, 80.640 cliques, CTR 3,2000 por cento. Variação: 2.520.000 impressões, 84.672 cliques, CTR 3,3600 por cento.

Leitura errada. Colando na calculadora de significância acima: mais 0,1600 ponto, mais 5,00 por cento relativo, z de 10,0835, valor-p abaixo do exibível, intervalo de mais 0,1289 a mais 0,1911 ponto. Se o relatório parasse aqui, o time comemoraria.

Leitura certa. Analisando por página, com desvio de 1,10 ponto entre páginas e 600 páginas por grupo, o erro-padrão da diferença é 0,0635 ponto, a estatística t é 2,5193 e o valor-p é 0,011757. O resultado continua significativo, com folga bem menor do que a leitura ingênua sugeria. O intervalo honesto para a diferença é de aproximadamente mais 0,0356 a mais 0,2844 ponto percentual, ou seja, entre mais 1,1 e mais 8,9 por cento relativos.

Decisão. Implementar. E registrar no relatório as duas leituras, porque a diferença entre elas é a lição: o mesmo dado sustenta “entre 1 e 9 por cento de ganho”, não “5 por cento cravado com certeza absoluta”.

O que teria mudado a decisão. Se o desvio entre páginas fosse 1,50 ponto em vez de 1,10, o mesmo resultado daria valor-p de 0,064672 e a decisão honesta seria “indeciso, rode em mais páginas”. Nada nos cliques teria mudado. Só a heterogeneidade do template.

Como aplicar isso na prática

  1. Meça o desvio-padrão de CTR entre as páginas do template antes de qualquer coisa. É o número que decide se o teste é viável, e ele sai de uma exportação do Search Console.
  2. Sorteie e confira. Depois do sorteio, plote as duas séries nas últimas oito semanas. Se elas não andarem juntas, sorteie de novo.
  3. Aplique a mudança no servidor ou na borda. Se ela só existe depois do JavaScript, você está testando outra coisa.
  4. Planeje para efeitos grandes. Mudança tímida em teste de SEO é tempo jogado fora, porque o poder não alcança.
  5. Analise por página, nunca por impressão. Se você insistir em analisar por impressão, aplique o efeito de desenho e diga qual ICC assumiu.
  6. Segure guardrails. Impressões totais e posição média precisam entrar no relatório, para separar “ganhou CTR” de “perdeu alcance e o CTR subiu por composição”.
  7. Encerre o teste e limpe a estrutura. A própria documentação do Google pede a remoção dos elementos de teste assim que ele acaba.
  8. Documente as premissas quando o desenho for observacional. Escrever “estimamos, sob a premissa de que o controle não foi afetado” é mais honesto e mais útil do que escrever “medimos”.

Erros comuns

Faça isso automático na Donnu

O gargalo do teste de SEO não é rodar o teste, é guardar quem estava em qual grupo. Depois de 28 dias, refazer qual URL estava em controle e qual estava em variação a partir de planilha e memória é onde a maior parte desses experimentos morre, e é onde aparece a tentação de mover uma página de lado para o resultado fechar.

A Donnu registra a configuração do experimento no momento em que ele é criado, com o carimbo de qual unidade caiu em qual braço, e mantém esse histórico congelado. Quando a unidade sorteada é a página em vez do usuário, é essa lista que constitui o experimento inteiro: sem ela, o que sobra é um antes e depois com nome bonito.

A recomendação prática mais barata deste guia: antes de aprovar qualquer teste de SEO, exporte o CTR por página do template e calcule o desvio-padrão. Se ele for grande e o número de páginas for pequeno, o teste não vai concluir nada, e isso é melhor descobrir em cinco minutos do que em quatro semanas. A calculadora de tamanho de amostra dá o outro eixo da mesma conta.

Referências

Leia também: Randomização por cluster · CRO x SEO · Série temporal interrompida · Controle sintético · Interferência entre variações · Calculadora de tamanho de amostra · Read in English

Perguntas frequentes

O que é teste A/B para SEO?
É um experimento controlado em que a unidade sorteada é a PÁGINA, não o usuário. Metade das páginas de um mesmo template recebe a mudança e a outra metade fica como está, as duas metades ficam no ar ao mesmo tempo, e a comparação é entre os dois grupos de páginas. Isso existe porque o visitante que interessa é o Googlebot, e não dá para mostrar uma versão para ele e outra para as pessoas.
Por que não posso usar minha ferramenta de teste A/B normal para testar SEO?
Porque ela sorteia usuários e costuma aplicar a variação no navegador, com JavaScript. O Googlebot não é um usuário sorteado, ele vê uma passagem só, e o que ele indexa é o HTML servido. Mostrar uma versão ao robô e outra às pessoas é cloaking, que o Google classifica como violação das políticas de spam e pune com rebaixamento ou remoção do índice.
O Google permite testar? Isso prejudica o ranqueamento?
Permite. A documentação oficial do Google Search diz que mudanças pequenas de tamanho, cor ou posição de um botão ou imagem em geral têm pouco ou nenhum impacto no snippet ou no ranqueamento da página. As regras são: nunca servir URLs diferentes para o Googlebot e para pessoas, usar rel canonical nas URLs alternativas quando o teste tiver várias URLs, usar redirecionamento 302 e não 301, e remover a estrutura do teste assim que ele acabar.
Qual é o erro estatístico mais comum em teste de SEO?
Rodar um teste de duas proporções sobre impressões, como se cada impressão fosse independente. Elas não são: impressões da mesma página se parecem entre si. No exemplo trabalhado deste guia, a leitura por impressão devolve z de 10,0835 e valor-p abaixo do exibível, mas com correlação intraclasse de 0,01 o efeito de desenho é 42,990, o z verdadeiro cai para 1,5379 e o valor-p vai para 0,124075, ou seja, não deu.
Quantas páginas eu preciso para um teste de SEO?
Depende de quanto as páginas variam entre si, e não do volume de impressões. No exemplo deste guia, para detectar 0,16 ponto percentual de CTR com 80 por cento de poder são necessárias 393 páginas por grupo se o desvio de CTR entre páginas for 0,80 ponto, 742 se for 1,10 ponto e 2.453 se for 2,00 pontos. O número de impressões por página quase não muda essa conta.
Dá para fazer teste A/B de SEO num site pequeno?
Na forma de split test randomizado, quase sempre não: falta o número de páginas parecidas no mesmo template. Um site com dezenas de páginas únicas não tem grupo de controle possível. A alternativa honesta é o desenho de pré e pós com controle e modelo de série temporal, que troca a randomização por uma premissa mais forte, e assumir isso no relatório em vez de fingir que houve experimento.