Teste A/B para SEO: o guia do split test de páginas
Teste A/B para SEO randomiza páginas, não usuários. O que o Google permite, o erro estatístico que invalida quase todo relatório e a conta certa.

📚 Este artigo faz parte do guia Otimização de Conversão (CRO): O Guia Completo 2026.
Teste A/B para SEO é um experimento em que a unidade sorteada é a página, e não o usuário. Metade das páginas de um mesmo template recebe a mudança, a outra metade fica intacta, e a comparação acontece entre os dois grupos de páginas, no mesmo período, sob as mesmas condições externas. Isso muda tudo na estatística: como as impressões da mesma página são parecidas entre si, a conta feita por impressão infla a confiança de forma brutal. No exemplo trabalhado deste guia, a mesma leitura que parece ter valor-p abaixo do exibível (z de 10,0835 sobre 2,52 milhões de impressões por grupo) vira um valor-p de 0,124075 quando a correlação entre impressões da mesma página é levada em conta. Este guia mostra o que o Google oficialmente permite, os dois desenhos que funcionam, a correção estatística que quase nenhum relatório de teste de SEO faz, e quantas páginas você precisa antes de começar. Faz parte do nosso guia completo de otimização de conversão e é o par técnico de CRO x SEO.
Por que a ferramenta de teste A/B comum não serve aqui
Um teste A/B tradicional sorteia pessoas. Cada visitante entra num balde, vê uma versão, e o balde dele é lembrado por cookie. Isso funciona porque o visitante volta, e porque as pessoas são trocáveis entre si.
O Googlebot quebra as três premissas de uma vez:
| premissa do teste A/B clássico | o que acontece com o Googlebot |
|---|---|
| o sujeito é sorteado e lembrado | o robô não tem cookie de balde, não é “um usuário” |
| o sujeito volta várias vezes | ele passa, lê o HTML servido, e vai embora |
| todo sujeito é trocável por outro | existe um só, e a decisão dele é sobre a URL, não sobre a sessão |
| a variação pode ser aplicada no navegador | o que conta é o HTML servido, não o DOM depois do JavaScript |
E há o problema legal da coisa. Servir uma versão ao robô e outra às pessoas tem nome: cloaking. A documentação oficial do Google Search é explícita ao dizer para não mostrar um conjunto de URLs ao Googlebot e outro a humanos, classifica isso como violação das políticas de spam, e registra que infringir essas políticas pode rebaixar ou remover o site dos resultados.
A saída não é sortear melhor as pessoas. É trocar a unidade de sorteio. Isso já é um assunto conhecido do blog em outro contexto: quando você não pode sortear indivíduos, sorteia grupos, e paga um preço estatístico por isso. É exatamente o problema da randomização por cluster, aplicado a páginas.
O que o Google permite, em palavras da documentação oficial
A documentação de testes de site do Google Search é curta e quase toda composta de regras operacionais. As quatro que importam:
| regra | o que a documentação diz |
|---|---|
| impacto no ranqueamento | mudanças pequenas, como tamanho, cor ou posição de um botão ou imagem, em geral têm pouco ou nenhum impacto no snippet ou no ranqueamento da página |
| cloaking | não mostre um conjunto de URLs ao Googlebot e outro a humanos; isso é cloaking e vai contra as políticas de spam |
| URLs alternativas | use rel canonical nas URLs alternativas para indicar a URL original como versão preferida, em vez de noindex |
| redirecionamento | se o teste manda o usuário da URL original para uma URL de variação, use 302 temporário, nunca 301 permanente |
| duração | ao concluir o teste, atualize o site com a variação desejada e remova todos os elementos do teste o quanto antes; testes que se prolongam podem ser interpretados como tentativa de enganar os buscadores |
Repare no que essas regras implicam juntas. Elas não proíbem experimentar, elas proíbem experimentar mostrando coisas diferentes a robô e a pessoa. O split test por páginas passa nas cinco por construção: cada URL tem uma versão só, servida igual para todo mundo, sem redirecionamento nenhum e sem URL alternativa.
O caso que mais gente erra é o do teste rodado com ferramenta de CRO comum numa página importante para busca orgânica. Ele não viola cloaking se a variação é aplicada por JavaScript para todos, robô incluído. Mas ele também não mede SEO nenhum: mede conversão de quem já chegou. São perguntas diferentes, e a diferença entre elas é o assunto de CRO x SEO.
Os dois desenhos de teste A/B para SEO que funcionam
Desenho 1: split test randomizado por páginas
É o desenho forte, o único que merece o nome de experimento. Exige um template com muitas páginas parecidas: catálogo de produtos, páginas de categoria, perfis, listagens por cidade, artigos de um mesmo tipo.
Passo a passo:
- Selecione o conjunto de páginas elegíveis, todas do mesmo template.
- Sorteie metade para variação e metade para controle. Sorteie de verdade, e depois confira o equilíbrio: os dois grupos precisam ter volume de tráfego parecido e, principalmente, subir e descer juntos no histórico.
- Aplique a mudança no servidor ou na borda, de modo que ela esteja no HTML servido.
- Espere. Duas a quatro semanas é a faixa usual para uma leitura, segundo a SearchPilot, que opera esse tipo de teste comercialmente.
- Compare os dois grupos no mesmo período.
O ponto do sorteio ser checado, e não só feito, vale um parágrafo. A SearchPilot publica um exemplo didático disso: um agrupamento mal feito que colocou todos os produtos de gato num dos baldes gerou um falso positivo durante o Dia Internacional do Gato. O sorteio aleatório protege na média, mas com poucas centenas de páginas o azar acontece, e conferir o equilíbrio histórico antes de começar é barato.
Desenho 2: pré e pós com grupo de controle e modelo de série temporal
Quando não há páginas suficientes para sortear, resta o desenho observacional: aplicar a mudança num conjunto de páginas, manter outro conjunto intacto, e modelar o que teria acontecido com o grupo tratado se nada tivesse mudado.
Essa é a máquina do CausalImpact, de Brodersen, Gallusser, Koehler, Remy e Scott. A ideia é montar um controle sintético como combinação ponderada de séries de controle, ajustar o modelo no período anterior à intervenção e projetar a contrafactual depois dela. A premissa dura, declarada no artigo, é que as séries de controle não podem ser afetadas pela intervenção, porque é isso que mantém a relação estimada antes válida depois.
Essa premissa é mais frágil do que parece em SEO. Se você melhora o título de 300 páginas e elas passam a ranquear melhor para consultas que as páginas de controle também disputam, o controle foi afetado. Isso é canibalização, e é o equivalente em SEO da interferência entre variações.
A mesma família de métodos aparece no blog em série temporal interrompida e em controle sintético, com o tratamento estatístico completo.
| aspecto | split randomizado por páginas | pré e pós com controle |
|---|---|---|
| exige quantas páginas | centenas no mesmo template | funciona com poucas ou com uma |
| premissa principal | só o sorteio | modelo da série de controle está certo |
| aguenta atualização de algoritmo | sim, atinge os dois grupos igualmente | só se o controle for de fato paralelo |
| aguenta sazonalidade | sim, pelo mesmo motivo | depende do modelo capturar a sazonalidade |
| risco de canibalização | existe, e enviesa para menos | existe, e enviesa para mais |
| o que dizer no relatório | “medimos” | “estimamos, sob estas premissas” |
O erro estatístico que invalida quase todo relatório de teste A/B para SEO
Aqui está o coração deste guia. O cenário do exemplo trabalhado:
| parâmetro | valor |
|---|---|
| páginas elegíveis (mesmo template) | 1.200 |
| divisão | 600 controle, 600 variação |
| impressões orgânicas por página em 28 dias | 4.200 |
| impressões por grupo | 2.520.000 |
| métrica primária | CTR orgânico (cliques dividido por impressões) do Search Console |
| CTR do controle | 3,2000% (80.640 cliques) |
| CTR da variação | 3,3600% (84.672 cliques) |
A tentação é óbvia: são duas proporções, então basta colar num teste de duas proporções. Cole você mesmo:
Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.
Com 2.520.000 e 80.640 no controle contra 2.520.000 e 84.672 na variação, a tela mostra 3,20 por cento contra 3,36 por cento, mais 5,0 por cento relativo, o veredito de que B vence com significância e um valor-p tão pequeno que aparece como “menor que 0,0001”. Por trás do arredondamento da tela, a diferença absoluta é de mais 0,1600 ponto percentual, o z vale 10,0835 e o intervalo de confiança vai de mais 0,1289 a mais 0,1911 ponto. Parece uma vitória fora de dúvida.
É uma leitura errada, e o motivo é simples: impressões da mesma página não são independentes umas das outras. Uma página de categoria com título bom, marcação rica e boa posição média tem CTR alto nas 4.200 impressões dela. Outra página, com intenção de busca mais vaga, tem CTR baixo nas 4.200 dela. O teste de duas proporções acha que você tem 2,52 milhões de observações independentes. Você tem 600.
A correção clássica é o efeito de desenho:
efeito de desenho = 1 + (m menos 1) vezes ICC
onde m é o número de impressões por página no período e ICC é a correlação intraclasse, ou seja, quanto duas impressões da mesma página se parecem mais do que duas impressões de páginas diferentes.
z corrigido = z ingênuo dividido pela raiz do efeito de desenho
Com m igual a 4.200, olhe o que acontece:
| ICC | efeito de desenho | z corrigido | valor-p corrigido | amostra efetiva por grupo |
|---|---|---|---|---|
| 0,002 | 9,398 | 3,2892 | 0,001005 | 268.142 |
| 0,005 | 21,995 | 2,1500 | 0,031551 | 114.571 |
| 0,010 | 42,990 | 1,5379 | 0,124075 | 58.618 |
| 0,020 | 84,980 | 1,0938 | 0,274027 | 29.654 |
| 0,050 | 210,950 | 0,6943 | 0,487521 | 11.946 |
Leia a linha do meio devagar. Uma correlação intraclasse de 0,01, que é minúscula em termos absolutos, multiplica a variância por quase 43 e transforma um “valor-p abaixo do exibível” num “não deu”. O motivo é o m grande: quando cada cluster tem milhares de observações, até uma correlação ínfima domina a conta.
Não existe ICC de CTR orgânico por template publicado, e por isso os valores da tabela são cenários assumidos, não medidos. Ainda assim, há razão para esperar que a correlação não seja desprezível: a dispersão de CTR entre páginas de um mesmo template tende a ser grande, porque posição média, intenção da consulta e presença de recursos da SERP variam de página para página. Meça o seu no seu próprio acervo antes de escolher uma linha dessa tabela.
A conta certa: a página é a unidade de análise
Existe um jeito mais direto de não errar isso, e ele dispensa estimar ICC nenhuma: analise por página.
Calcule o CTR de cada uma das 1.200 páginas, e compare a média dos 600 CTRs do controle com a média dos 600 da variação. A conta vira um teste de duas médias, e o que importa deixa de ser o volume de impressões e passa a ser quanto as páginas variam entre si.
Com efeito verdadeiro de 0,16 ponto percentual e 600 páginas por grupo:
| desvio de CTR entre páginas | erro-padrão da diferença | estatística t | valor-p |
|---|---|---|---|
| 0,80 pp | 0,0462 pp | 3,4641 | 0,000532 |
| 1,10 pp | 0,0635 pp | 2,5193 | 0,011757 |
| 1,50 pp | 0,0866 pp | 1,8475 | 0,064672 |
| 2,00 pp | 0,1155 pp | 1,3856 | 0,165857 |
A leitura é a mesma da tabela anterior, dita de outro jeito: o teste passa ou não passa dependendo de uma quantidade que não tem nada a ver com quantas impressões você acumulou. E essa quantidade é fácil de medir: exporte o CTR por página do Search Console e tire o desvio-padrão. Leva cinco minutos e determina se o teste é viável.
Invertendo a conta, para 80 por cento de poder no mesmo efeito de 0,16 ponto:
| desvio entre páginas | páginas por grupo | total de páginas necessárias |
|---|---|---|
| 0,80 pp | 393 | 786 |
| 1,10 pp | 742 | 1.484 |
| 1,50 pp | 1.380 | 2.760 |
| 2,00 pp | 2.453 | 4.906 |
É por isso que a SearchPilot declara como requisito operacional ter centenas de páginas do mesmo template e pelo menos 30.000 sessões orgânicas por mês chegando ao grupo de páginas testado. Os dois números não são arbitrários, são a tradução comercial da tabela acima.
Dimensionando antes de rodar
O número de páginas manda, mas ainda vale dimensionar pelo lado das impressões, porque é ele que define quanto tempo o teste precisa ficar no ar. Use a base de CTR real do seu template:
Cálculo por aproximação normal de duas proporções, 2 variações (50/50). Mexa nos campos e veja o impacto ao vivo.
Com taxa base de 3,20 por cento, 95 por cento de confiança, 80 por cento de poder e teste bicaudal, a calculadora devolve a coluna do meio abaixo. A coluna da direita é a mesma conta depois de multiplicar pelo efeito de desenho de 9,398, que corresponde a uma correlação intraclasse moderada de 0,002.
| MDE relativo | impressões por grupo (ingênuo) | com efeito de desenho 9,398 | páginas por grupo a 4.200 impressões cada |
|---|---|---|---|
| 3% | 535.267 | 5.030.440 | 1.198 |
| 5% | 194.530 | 1.828.193 | 436 |
| 8% | 77.062 | 724.229 | 173 |
| 10% | 49.777 | 467.805 | 112 |
| 15% | 22.631 | 212.687 | 51 |
| 20% | 13.015 | 122.315 | 30 |
A leitura prática dessa tabela é dura e útil: testes de SEO só enxergam efeitos grandes. Um ganho de 3 por cento no CTR é invisível para quase todo site. Um ganho de 15 ou 20 por cento, do tipo que uma reescrita séria de títulos produz, é detectável com poucas dezenas de páginas. Planeje mudanças ousadas, não ajustes finos, e leia isso junto de efeito mínimo detectável.
O que dá para testar e o que não dá
| mudança | dá para split test? | por quê |
|---|---|---|
| padrão de title de um template | sim, é o caso ideal | muitas páginas, mudança no HTML servido, efeito plausível e grande |
| meta description | sim | mesma lógica; afeta CTR sem afetar posição diretamente |
| marcação de dados estruturados | sim | aparece ou não aparece no HTML por grupo |
| bloco de conteúdo novo no template | sim | server-side, aplicável a metade das páginas |
| links internos dentro do template | com cuidado | o grupo de controle recebe links do grupo tratado, o que quebra a independência |
| mudança de estrutura de URL | não | mexer em URL é mudança permanente, e 302 de teste em massa é má ideia |
| velocidade do site inteiro | não | é mudança de infraestrutura, atinge os dois grupos |
| migração de domínio, HTTPS, robots | não | não existe versão parcial disso |
| mudança numa página única importante | não como split test | use o desenho de pré e pós com controle e assuma as premissas |
A linha dos links internos merece destaque. Se as páginas tratadas ganham um bloco de links que aponta para páginas de controle, você acabou de tratar o controle também, e o efeito medido encolhe em direção a zero. O nome disso é interferência, e a leitura completa está em interferência entre variações.
Confundidores e o que o grupo de controle resolve
A lista de confundidores que um teste de SEO enfrenta é longa e nenhuma delas está sob seu controle: atualização de algoritmo, sazonalidade de demanda, mudança de layout da SERP, concorrente novo, recurso de IA ocupando o topo da página. O desenho randomizado com controle simultâneo neutraliza todos os que atingem os dois grupos igualmente, e isso cobre praticamente a lista inteira.
O que ele não neutraliza é o que atinge os grupos de forma diferente. Dois casos reais:
- Composição enviesada dos grupos. Se um grupo concentra páginas de uma categoria sazonal, um pico dessa categoria entra como se fosse efeito. É o falso positivo do Dia Internacional do Gato.
- Canibalização entre os grupos. Se páginas tratadas passam a disputar consultas com páginas de controle, parte do ganho de um grupo é perda do outro, e o efeito medido fica maior do que o verdadeiro.
Para o primeiro caso, a defesa é olhar o histórico dos dois grupos antes de começar, e refazer o sorteio se eles não andarem juntos. Isso é o equivalente em SEO do teste A/A: conferir que a divisão não produz diferença quando ainda não há tratamento nenhum.
O exemplo trabalhado completo, do início ao fim
Hipótese. Incluir a faixa de preço no title das páginas de categoria aumenta o CTR orgânico, porque qualifica o clique antes dele acontecer.
Desenho. 1.200 páginas de categoria do mesmo template, sorteadas 600 e 600. Mudança aplicada no servidor. Janela de 28 dias. Métrica primária: CTR orgânico do Search Console. Métricas de guardrail: impressões totais e posição média, para detectar se o título novo derrubou relevância.
Verificação prévia. Desvio-padrão de CTR entre as 1.200 páginas nos 28 dias anteriores: 1,10 ponto percentual. Pela tabela de poder, 742 páginas por grupo seriam necessárias para 80 por cento de poder num efeito de 0,16 ponto. Temos 600. O teste nasce subdimensionado para esse efeito, e isso fica registrado no plano antes de rodar, não descoberto depois. Ele tem poder para efeitos maiores, na faixa de 0,20 ponto para cima.
Resultado bruto. Controle: 2.520.000 impressões, 80.640 cliques, CTR 3,2000 por cento. Variação: 2.520.000 impressões, 84.672 cliques, CTR 3,3600 por cento.
Leitura errada. Colando na calculadora de significância acima: mais 0,1600 ponto, mais 5,00 por cento relativo, z de 10,0835, valor-p abaixo do exibível, intervalo de mais 0,1289 a mais 0,1911 ponto. Se o relatório parasse aqui, o time comemoraria.
Leitura certa. Analisando por página, com desvio de 1,10 ponto entre páginas e 600 páginas por grupo, o erro-padrão da diferença é 0,0635 ponto, a estatística t é 2,5193 e o valor-p é 0,011757. O resultado continua significativo, com folga bem menor do que a leitura ingênua sugeria. O intervalo honesto para a diferença é de aproximadamente mais 0,0356 a mais 0,2844 ponto percentual, ou seja, entre mais 1,1 e mais 8,9 por cento relativos.
Decisão. Implementar. E registrar no relatório as duas leituras, porque a diferença entre elas é a lição: o mesmo dado sustenta “entre 1 e 9 por cento de ganho”, não “5 por cento cravado com certeza absoluta”.
O que teria mudado a decisão. Se o desvio entre páginas fosse 1,50 ponto em vez de 1,10, o mesmo resultado daria valor-p de 0,064672 e a decisão honesta seria “indeciso, rode em mais páginas”. Nada nos cliques teria mudado. Só a heterogeneidade do template.
Como aplicar isso na prática
- Meça o desvio-padrão de CTR entre as páginas do template antes de qualquer coisa. É o número que decide se o teste é viável, e ele sai de uma exportação do Search Console.
- Sorteie e confira. Depois do sorteio, plote as duas séries nas últimas oito semanas. Se elas não andarem juntas, sorteie de novo.
- Aplique a mudança no servidor ou na borda. Se ela só existe depois do JavaScript, você está testando outra coisa.
- Planeje para efeitos grandes. Mudança tímida em teste de SEO é tempo jogado fora, porque o poder não alcança.
- Analise por página, nunca por impressão. Se você insistir em analisar por impressão, aplique o efeito de desenho e diga qual ICC assumiu.
- Segure guardrails. Impressões totais e posição média precisam entrar no relatório, para separar “ganhou CTR” de “perdeu alcance e o CTR subiu por composição”.
- Encerre o teste e limpe a estrutura. A própria documentação do Google pede a remoção dos elementos de teste assim que ele acaba.
- Documente as premissas quando o desenho for observacional. Escrever “estimamos, sob a premissa de que o controle não foi afetado” é mais honesto e mais útil do que escrever “medimos”.
Erros comuns
- Usar a ferramenta de CRO client-side para testar título e marcação. O Googlebot quase sempre não vê isso, e o teste mede outra coisa.
- Rodar teste de SEO por 5 dias. O ciclo de rastreamento e reindexação não cabe nisso, e a leitura pega o período de transição em vez do estado novo. O raciocínio de ciclo é o mesmo de ciclo semanal em testes A/B, com constante de tempo maior.
- Trocar páginas de grupo no meio do teste. Isso destrói a randomização e contamina os dois lados.
- Comparar só antes e depois, sem grupo de controle. É o desenho mais popular e o mais fácil de enganar, porque qualquer sazonalidade vira “resultado”.
- Ignorar a posição média como guardrail. Um título mais chamativo que faz o Google reescrever o snippet ou rebaixar relevância pode subir CTR e derrubar impressões.
- Contar impressão como unidade independente. É o erro que este guia inteiro existe para desfazer.
- Prolongar o teste indefinidamente porque “ainda não deu significância”. Além do problema de peeking, a documentação do Google pede explicitamente para não prolongar testes.
Faça isso automático na Donnu
O gargalo do teste de SEO não é rodar o teste, é guardar quem estava em qual grupo. Depois de 28 dias, refazer qual URL estava em controle e qual estava em variação a partir de planilha e memória é onde a maior parte desses experimentos morre, e é onde aparece a tentação de mover uma página de lado para o resultado fechar.
A Donnu registra a configuração do experimento no momento em que ele é criado, com o carimbo de qual unidade caiu em qual braço, e mantém esse histórico congelado. Quando a unidade sorteada é a página em vez do usuário, é essa lista que constitui o experimento inteiro: sem ela, o que sobra é um antes e depois com nome bonito.
A recomendação prática mais barata deste guia: antes de aprovar qualquer teste de SEO, exporte o CTR por página do template e calcule o desvio-padrão. Se ele for grande e o número de páginas for pequeno, o teste não vai concluir nada, e isso é melhor descobrir em cinco minutos do que em quatro semanas. A calculadora de tamanho de amostra dá o outro eixo da mesma conta.
Referências
- Google Search Central. A/B testing and Google Search (Website testing). Documentação oficial. Fonte das regras citadas neste guia: de que mudanças pequenas, como tamanho, cor ou posição de um botão ou imagem, em geral têm pouco ou nenhum impacto no snippet ou no ranqueamento; da instrução de não mostrar um conjunto de URLs ao Googlebot e outro a humanos, o que a documentação classifica como cloaking e violação das políticas de spam, passível de rebaixamento ou remoção do site dos resultados; do uso de rel canonical nas URLs alternativas em vez de noindex; do uso de redirecionamento 302 temporário em vez de 301 permanente durante o teste; e da instrução de remover todos os elementos do teste assim que ele termina, porque testes prolongados podem ser interpretados como tentativa de enganar os buscadores. developers.google.com.
- SearchPilot. What is SEO split testing? A guide to setting up, designing and running SEO split tests. Fonte da descrição operacional do desenho de split test por páginas: de que o usuário testado é o Googlebot e não o visitante humano; de que os dois baldes precisam ter volume de tráfego parecido e subir e descer juntos no histórico; do exemplo de agrupamento mal feito que concentrou produtos de gato num balde e gerou falso positivo durante o Dia Internacional do Gato; da implementação server-side para que os buscadores vejam a mudança; da faixa de duas a quatro semanas para uma leitura com significância; e dos requisitos operacionais de centenas de páginas no mesmo template e pelo menos 30.000 sessões orgânicas mensais no grupo testado. searchpilot.com.
- Brodersen, K. H., Gallusser, F., Koehler, J., Remy, N. e Scott, S. L. Inferring causal impact using Bayesian structural time-series models. Annals of Applied Statistics, volume 9, número 1, 2015. Fonte do desenho de pré e pós usado quando não há páginas suficientes para sortear: a construção de um controle sintético como combinação ponderada de séries de controle, o ajuste do modelo no período anterior à intervenção para projetar a contrafactual, e a premissa declarada de que as séries de controle não podem ser afetadas pela intervenção, sem a qual a relação estimada antes deixa de valer depois. research.google.
Leia também: Randomização por cluster · CRO x SEO · Série temporal interrompida · Controle sintético · Interferência entre variações · Calculadora de tamanho de amostra · Read in English
Perguntas frequentes
- O que é teste A/B para SEO?
- É um experimento controlado em que a unidade sorteada é a PÁGINA, não o usuário. Metade das páginas de um mesmo template recebe a mudança e a outra metade fica como está, as duas metades ficam no ar ao mesmo tempo, e a comparação é entre os dois grupos de páginas. Isso existe porque o visitante que interessa é o Googlebot, e não dá para mostrar uma versão para ele e outra para as pessoas.
- Por que não posso usar minha ferramenta de teste A/B normal para testar SEO?
- Porque ela sorteia usuários e costuma aplicar a variação no navegador, com JavaScript. O Googlebot não é um usuário sorteado, ele vê uma passagem só, e o que ele indexa é o HTML servido. Mostrar uma versão ao robô e outra às pessoas é cloaking, que o Google classifica como violação das políticas de spam e pune com rebaixamento ou remoção do índice.
- O Google permite testar? Isso prejudica o ranqueamento?
- Permite. A documentação oficial do Google Search diz que mudanças pequenas de tamanho, cor ou posição de um botão ou imagem em geral têm pouco ou nenhum impacto no snippet ou no ranqueamento da página. As regras são: nunca servir URLs diferentes para o Googlebot e para pessoas, usar rel canonical nas URLs alternativas quando o teste tiver várias URLs, usar redirecionamento 302 e não 301, e remover a estrutura do teste assim que ele acabar.
- Qual é o erro estatístico mais comum em teste de SEO?
- Rodar um teste de duas proporções sobre impressões, como se cada impressão fosse independente. Elas não são: impressões da mesma página se parecem entre si. No exemplo trabalhado deste guia, a leitura por impressão devolve z de 10,0835 e valor-p abaixo do exibível, mas com correlação intraclasse de 0,01 o efeito de desenho é 42,990, o z verdadeiro cai para 1,5379 e o valor-p vai para 0,124075, ou seja, não deu.
- Quantas páginas eu preciso para um teste de SEO?
- Depende de quanto as páginas variam entre si, e não do volume de impressões. No exemplo deste guia, para detectar 0,16 ponto percentual de CTR com 80 por cento de poder são necessárias 393 páginas por grupo se o desvio de CTR entre páginas for 0,80 ponto, 742 se for 1,10 ponto e 2.453 se for 2,00 pontos. O número de impressões por página quase não muda essa conta.
- Dá para fazer teste A/B de SEO num site pequeno?
- Na forma de split test randomizado, quase sempre não: falta o número de páginas parecidas no mesmo template. Um site com dezenas de páginas únicas não tem grupo de controle possível. A alternativa honesta é o desenho de pré e pós com controle e modelo de série temporal, que troca a randomização por uma premissa mais forte, e assumir isso no relatório em vez de fingir que houve experimento.