Test A/B para SEO: la guía del split test de páginas
El test A/B para SEO aleatoriza páginas, no usuarios. Qué permite Google, el error estadístico que invalida casi todo informe y la cuenta correcta.

📚 Este artículo es parte de la guía Optimización de Conversión (CRO): La Guía Completa 2026.
Un test A/B para SEO es un experimento en el que la unidad sorteada es la página, y no el usuario. La mitad de las páginas de una misma plantilla recibe el cambio, la otra mitad queda intacta, y la comparación ocurre entre los dos grupos de páginas, en el mismo período, bajo las mismas condiciones externas. Eso lo cambia todo en la estadística: como las impresiones de la misma página se parecen entre sí, la cuenta hecha por impresión infla la confianza de forma brutal. En el ejemplo trabajado de esta guía, la misma lectura que parece tener un valor p por debajo de lo mostrable (z de 10,0835 sobre 2,52 millones de impresiones por grupo) se convierte en un valor p de 0,124075 cuando se tiene en cuenta la correlación entre impresiones de la misma página. Esta guía muestra qué permite oficialmente Google, los dos diseños que funcionan, la corrección estadística que casi ningún informe de test de SEO hace, y cuántas páginas necesitas antes de empezar. Forma parte de nuestra guía completa de optimización de conversión y es el par técnico de CRO vs SEO.
Por qué la herramienta de test A/B habitual no sirve aquí
Un test A/B tradicional sortea personas. Cada visitante entra en un balde, ve una versión, y su balde se recuerda por cookie. Eso funciona porque el visitante vuelve, y porque las personas son intercambiables entre sí.
Googlebot rompe las tres premisas de una vez:
| premisa del test A/B clásico | lo que pasa con Googlebot |
|---|---|
| el sujeto se sortea y se recuerda | el robot no tiene cookie de balde, no es “un usuario” |
| el sujeto vuelve varias veces | pasa, lee el HTML servido, y se va |
| todo sujeto es intercambiable por otro | existe uno solo, y su decisión es sobre la URL, no sobre la sesión |
| la variación puede aplicarse en el navegador | lo que cuenta es el HTML servido, no el DOM después del JavaScript |
Y está el problema normativo. Servirle una versión al robot y otra a las personas tiene nombre: cloaking. La documentación oficial de Google Search es explícita al decir que no se muestre un conjunto de URLs a Googlebot y otro a humanos, lo clasifica como infracción de las políticas de spam, y registra que infringir esas políticas puede degradar o eliminar el sitio de los resultados.
La salida no es sortear mejor a las personas. Es cambiar la unidad de sorteo. Es un tema ya conocido del blog en otro contexto: cuando no puedes sortear individuos, sorteas grupos, y pagas un precio estadístico por ello. Es exactamente el problema de la aleatorización por cluster, aplicado a páginas.
Lo que Google permite, en palabras de la documentación oficial
La documentación de tests de sitios de Google Search es corta y casi toda compuesta de reglas operativas. Las cuatro que importan:
| regla | lo que dice la documentación |
|---|---|
| impacto en el posicionamiento | los cambios pequeños, como tamaño, color o posición de un botón o una imagen, en general tienen poco o ningún impacto en el snippet o en el posicionamiento de la página |
| cloaking | no muestres un conjunto de URLs a Googlebot y otro a humanos; eso es cloaking y va contra las políticas de spam |
| URLs alternativas | usa rel canonical en las URLs alternativas para indicar la URL original como versión preferida, en lugar de noindex |
| redirección | si el test envía al usuario de la URL original a una URL de variación, usa 302 temporal, nunca 301 permanente |
| duración | al concluir el test, actualiza el sitio con la variación deseada y retira todos los elementos del test lo antes posible; los tests que se prolongan pueden interpretarse como un intento de engañar a los buscadores |
Fíjate en lo que implican esas reglas juntas. No prohíben experimentar, prohíben experimentar mostrando cosas distintas al robot y a la persona. El split test por páginas cumple las cinco por construcción: cada URL tiene una sola versión, servida igual para todos, sin ninguna redirección y sin URL alternativa.
El caso en el que más gente se equivoca es el del test corrido con una herramienta de CRO habitual en una página importante para la búsqueda orgánica. No infringe la regla de cloaking si la variación se aplica por JavaScript para todos, robot incluido. Pero tampoco mide nada de SEO: mide la conversión de quien ya llegó. Son preguntas distintas, y la diferencia entre ellas es el tema de CRO vs SEO.
Los dos diseños de test A/B para SEO que funcionan
Diseño 1: split test aleatorizado por páginas
Es el diseño fuerte, el único que merece el nombre de experimento. Exige una plantilla con muchas páginas parecidas: catálogo de productos, páginas de categoría, perfiles, listados por ciudad, artículos de un mismo tipo.
Paso a paso:
- Selecciona el conjunto de páginas elegibles, todas de la misma plantilla.
- Sortea la mitad para la variación y la mitad para el control. Sortea de verdad, y después verifica el equilibrio: los dos grupos necesitan tener un volumen de tráfico parecido y, sobre todo, subir y bajar juntos en el histórico.
- Aplica el cambio en el servidor o en el edge, de modo que esté en el HTML servido.
- Espera. De dos a cuatro semanas es la franja habitual para una lectura, según SearchPilot, que opera este tipo de test comercialmente.
- Compara los dos grupos en el mismo período.
Que el sorteo sea verificado, y no solo hecho, vale un párrafo. SearchPilot publica un ejemplo didáctico de esto: una agrupación mal hecha que puso todos los productos para gatos en uno de los baldes generó un falso positivo durante el Día Internacional del Gato. El sorteo aleatorio protege en promedio, pero con pocos cientos de páginas la mala suerte ocurre, y verificar el equilibrio histórico antes de empezar es barato.
Diseño 2: antes y después con grupo de control y modelo de serie temporal
Cuando no hay páginas suficientes para sortear, queda el diseño observacional: aplicar el cambio en un conjunto de páginas, mantener otro conjunto intacto, y modelar lo que habría pasado con el grupo tratado si nada hubiera cambiado.
Esa es la maquinaria de CausalImpact, de Brodersen, Gallusser, Koehler, Remy y Scott. La idea es armar un control sintético como combinación ponderada de series de control, ajustar el modelo en el período anterior a la intervención y proyectar el contrafactual después de ella. La premisa dura, declarada en el artículo, es que las series de control no pueden verse afectadas por la intervención, porque es eso lo que mantiene válida después la relación estimada antes.
Esa premisa es más frágil de lo que parece en SEO. Si mejoras el título de 300 páginas y pasan a posicionar mejor para consultas que las páginas de control también disputan, el control se vio afectado. Eso es canibalización, y es el equivalente en SEO de la interferencia entre variantes.
La misma familia de métodos aparece en el blog en serie temporal interrumpida y en control sintético, con el tratamiento estadístico completo.
| aspecto | split aleatorizado por páginas | antes y después con control |
|---|---|---|
| cuántas páginas exige | cientos en la misma plantilla | funciona con pocas o con una |
| premisa principal | solo el sorteo | el modelo de la serie de control es correcto |
| resiste una actualización de algoritmo | sí, afecta a los dos grupos por igual | solo si el control es de verdad paralelo |
| resiste la estacionalidad | sí, por el mismo motivo | depende de que el modelo capture la estacionalidad |
| riesgo de canibalización | existe, y sesga hacia abajo | existe, y sesga hacia arriba |
| qué decir en el informe | “medimos” | “estimamos, bajo estas premisas” |
El error estadístico que invalida casi todo informe de test A/B para SEO
Aquí está el corazón de esta guía. El escenario del ejemplo trabajado:
| parámetro | valor |
|---|---|
| páginas elegibles (misma plantilla) | 1.200 |
| división | 600 control, 600 variación |
| impresiones orgánicas por página en 28 días | 4.200 |
| impresiones por grupo | 2.520.000 |
| métrica primaria | CTR orgánico (clics divididos por impresiones) de Search Console |
| CTR del control | 3,2000% (80.640 clics) |
| CTR de la variación | 3,3600% (84.672 clics) |
La tentación es obvia: son dos proporciones, así que basta con pegarlas en un test de dos proporciones. Pégalas tú mismo:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Con 2.520.000 y 80.640 en el control contra 2.520.000 y 84.672 en la variación, la pantalla muestra 3,20 por ciento contra 3,36 por ciento, más 5,0 por ciento relativo, el veredicto de que B gana con significancia y un valor p tan pequeño que aparece como “menor que 0,0001”. Detrás del redondeo de la pantalla, la diferencia absoluta es de más 0,1600 puntos porcentuales, el z vale 10,0835 y el intervalo de confianza va de más 0,1289 a más 0,1911 puntos. Parece una victoria fuera de toda duda.
Es una lectura equivocada, y el motivo es simple: las impresiones de la misma página no son independientes unas de otras. Una página de categoría con buen título, marcado enriquecido y buena posición media tiene un CTR alto en sus 4.200 impresiones. Otra página, con una intención de búsqueda más vaga, tiene un CTR bajo en las 4.200 suyas. El test de dos proporciones cree que tienes 2,52 millones de observaciones independientes. Tienes 600.
La corrección clásica es el efecto de diseño:
efecto de diseño = 1 + (m menos 1) por ICC
donde m es el número de impresiones por página en el período e ICC es la correlación intraclase, es decir, cuánto se parecen dos impresiones de la misma página más de lo que se parecen dos impresiones de páginas distintas.
z corregido = z ingenuo dividido por la raíz del efecto de diseño
Con m igual a 4.200, mira lo que pasa:
| ICC | efecto de diseño | z corregido | valor p corregido | muestra efectiva por grupo |
|---|---|---|---|---|
| 0,002 | 9,398 | 3,2892 | 0,001005 | 268.142 |
| 0,005 | 21,995 | 2,1500 | 0,031551 | 114.571 |
| 0,010 | 42,990 | 1,5379 | 0,124075 | 58.618 |
| 0,020 | 84,980 | 1,0938 | 0,274027 | 29.654 |
| 0,050 | 210,950 | 0,6943 | 0,487521 | 11.946 |
Lee la fila del medio despacio. Una correlación intraclase de 0,01, que es minúscula en términos absolutos, multiplica la varianza por casi 43 y transforma un “valor p por debajo de lo mostrable” en un “no salió”. El motivo es la m grande: cuando cada cluster tiene miles de observaciones, hasta una correlación ínfima domina la cuenta.
No existe un ICC de CTR orgánico por plantilla publicado, y por eso los valores de la tabla son escenarios asumidos, no medidos. Aun así, hay razones para esperar que la correlación no sea despreciable: la dispersión del CTR entre páginas de una misma plantilla tiende a ser grande, porque la posición media, la intención de la consulta y la presencia de funciones de la SERP varían de página a página. Mide el tuyo en tu propio acervo antes de elegir una fila de esa tabla.
La cuenta correcta: la página es la unidad de análisis
Existe una forma más directa de no equivocarse en esto, y no requiere estimar ningún ICC: analiza por página.
Calcula el CTR de cada una de las 1.200 páginas, y compara la media de los 600 CTR del control con la media de los 600 de la variación. La cuenta se convierte en un test de dos medias, y lo que importa deja de ser el volumen de impresiones y pasa a ser cuánto varían las páginas entre sí.
Con un efecto verdadero de 0,16 puntos porcentuales y 600 páginas por grupo:
| desviación de CTR entre páginas | error estándar de la diferencia | estadístico t | valor p |
|---|---|---|---|
| 0,80 pp | 0,0462 pp | 3,4641 | 0,000532 |
| 1,10 pp | 0,0635 pp | 2,5193 | 0,011757 |
| 1,50 pp | 0,0866 pp | 1,8475 | 0,064672 |
| 2,00 pp | 0,1155 pp | 1,3856 | 0,165857 |
La lectura es la misma que la de la tabla anterior, dicha de otra forma: el test pasa o no pasa según una cantidad que no tiene nada que ver con cuántas impresiones acumulaste. Y esa cantidad es fácil de medir: exporta el CTR por página de Search Console y saca la desviación estándar. Lleva cinco minutos y determina si el test es viable.
Invirtiendo la cuenta, para 80 por ciento de poder con el mismo efecto de 0,16 puntos:
| desviación entre páginas | páginas por grupo | total de páginas necesarias |
|---|---|---|
| 0,80 pp | 393 | 786 |
| 1,10 pp | 742 | 1.484 |
| 1,50 pp | 1.380 | 2.760 |
| 2,00 pp | 2.453 | 4.906 |
Por eso SearchPilot declara como requisito operativo tener cientos de páginas de la misma plantilla y al menos 30.000 sesiones orgánicas al mes llegando al grupo de páginas testeado. Los dos números no son arbitrarios, son la traducción comercial de la tabla de arriba.
Dimensionar antes de correr
El número de páginas manda, pero aun así vale la pena dimensionar por el lado de las impresiones, porque es lo que define cuánto tiempo tiene que estar publicado el test. Usa la base de CTR real de tu plantilla:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Con una tasa base de 3,20 por ciento, 95 por ciento de confianza, 80 por ciento de poder y test bilateral, la calculadora devuelve la columna del medio de abajo. La columna de la derecha es la misma cuenta después de multiplicar por el efecto de diseño de 9,398, que corresponde a una correlación intraclase moderada de 0,002.
| MDE relativo | impresiones por grupo (ingenuo) | con efecto de diseño 9,398 | páginas por grupo a 4.200 impresiones cada una |
|---|---|---|---|
| 3% | 535.267 | 5.030.440 | 1.198 |
| 5% | 194.530 | 1.828.193 | 436 |
| 8% | 77.062 | 724.229 | 173 |
| 10% | 49.777 | 467.805 | 112 |
| 15% | 22.631 | 212.687 | 51 |
| 20% | 13.015 | 122.315 | 30 |
La lectura práctica de esta tabla es dura y útil: los tests de SEO solo ven efectos grandes. Una ganancia de 3 por ciento en el CTR es invisible para casi cualquier sitio. Una ganancia de 15 o 20 por ciento, del tipo que produce una reescritura seria de títulos, es detectable con pocas decenas de páginas. Planifica cambios audaces, no ajustes finos, y lee esto junto con efecto mínimo detectable.
Qué se puede testear y qué no
| cambio | ¿se puede hacer split test? | por qué |
|---|---|---|
| patrón de title de una plantilla | sí, es el caso ideal | muchas páginas, cambio en el HTML servido, efecto plausible y grande |
| meta description | sí | misma lógica; afecta el CTR sin afectar directamente la posición |
| marcado de datos estructurados | sí | aparece o no aparece en el HTML según el grupo |
| bloque de contenido nuevo en la plantilla | sí | server-side, aplicable a la mitad de las páginas |
| enlaces internos dentro de la plantilla | con cuidado | el grupo de control recibe enlaces del grupo tratado, lo que rompe la independencia |
| cambio de estructura de URL | no | tocar la URL es un cambio permanente, y un 302 de test masivo es mala idea |
| velocidad del sitio entero | no | es un cambio de infraestructura, afecta a los dos grupos |
| migración de dominio, HTTPS, robots | no | no existe versión parcial de eso |
| cambio en una única página importante | no como split test | usa el diseño de antes y después con control y asume las premisas |
La fila de los enlaces internos merece destacarse. Si las páginas tratadas ganan un bloque de enlaces que apunta a páginas de control, acabas de tratar también el control, y el efecto medido se encoge hacia cero. El nombre de eso es interferencia, y la lectura completa está en interferencia entre variantes.
Factores de confusión y lo que resuelve el grupo de control
La lista de factores de confusión que enfrenta un test de SEO es larga y ninguno está bajo tu control: actualización de algoritmo, estacionalidad de la demanda, cambio de diseño de la SERP, competidor nuevo, función de IA ocupando la parte superior de la página. El diseño aleatorizado con control simultáneo neutraliza todos los que afectan a los dos grupos por igual, y eso cubre prácticamente la lista entera.
Lo que no neutraliza es lo que afecta a los grupos de forma distinta. Dos casos reales:
- Composición sesgada de los grupos. Si un grupo concentra páginas de una categoría estacional, un pico de esa categoría entra como si fuera efecto. Es el falso positivo del Día Internacional del Gato.
- Canibalización entre los grupos. Si las páginas tratadas pasan a disputar consultas con páginas de control, parte de la ganancia de un grupo es pérdida del otro, y el efecto medido queda mayor que el verdadero.
Para el primer caso, la defensa es mirar el histórico de los dos grupos antes de empezar, y rehacer el sorteo si no se mueven juntos. Es el equivalente en SEO del test A/A: verificar que la división no produce diferencia cuando todavía no hay ningún tratamiento.
El ejemplo trabajado completo, de principio a fin
Hipótesis. Incluir la franja de precio en el title de las páginas de categoría aumenta el CTR orgánico, porque califica el clic antes de que ocurra.
Diseño. 1.200 páginas de categoría de la misma plantilla, sorteadas 600 y 600. Cambio aplicado en el servidor. Ventana de 28 días. Métrica primaria: CTR orgánico de Search Console. Métricas de guardrail: impresiones totales y posición media, para detectar si el título nuevo derribó la relevancia.
Verificación previa. Desviación estándar del CTR entre las 1.200 páginas en los 28 días anteriores: 1,10 puntos porcentuales. Según la tabla de poder, se necesitarían 742 páginas por grupo para 80 por ciento de poder con un efecto de 0,16 puntos. Tenemos 600. El test nace subdimensionado para ese efecto, y eso queda registrado en el plan antes de correr, no descubierto después. Tiene poder para efectos mayores, en la franja de 0,20 puntos hacia arriba.
Resultado bruto. Control: 2.520.000 impresiones, 80.640 clics, CTR 3,2000 por ciento. Variación: 2.520.000 impresiones, 84.672 clics, CTR 3,3600 por ciento.
Lectura equivocada. Pegando en la calculadora de significancia de arriba: más 0,1600 puntos, más 5,00 por ciento relativo, z de 10,0835, valor p por debajo de lo mostrable, intervalo de más 0,1289 a más 0,1911 puntos. Si el informe se detuviera aquí, el equipo celebraría.
Lectura correcta. Analizando por página, con una desviación de 1,10 puntos entre páginas y 600 páginas por grupo, el error estándar de la diferencia es 0,0635 puntos, el estadístico t es 2,5193 y el valor p es 0,011757. El resultado sigue siendo significativo, con un margen mucho menor del que sugería la lectura ingenua. El intervalo honesto para la diferencia va aproximadamente de más 0,0356 a más 0,2844 puntos porcentuales, es decir, entre más 1,1 y más 8,9 por ciento relativo.
Decisión. Implementar. Y registrar en el informe las dos lecturas, porque la diferencia entre ellas es la lección: el mismo dato sostiene “entre 1 y 9 por ciento de ganancia”, no “5 por ciento clavado con certeza absoluta”.
Lo que habría cambiado la decisión. Si la desviación entre páginas fuera de 1,50 puntos en lugar de 1,10, el mismo resultado daría un valor p de 0,064672 y la decisión honesta sería “indeciso, córrelo en más páginas”. Nada en los clics habría cambiado. Solo la heterogeneidad de la plantilla.
Cómo aplicar esto en la práctica
- Mide la desviación estándar del CTR entre las páginas de la plantilla antes que nada. Es el número que decide si el test es viable, y sale de una exportación de Search Console.
- Sortea y verifica. Después del sorteo, grafica las dos series de las últimas ocho semanas. Si no se mueven juntas, sortea de nuevo.
- Aplica el cambio en el servidor o en el edge. Si solo existe después del JavaScript, estás testeando otra cosa.
- Planifica para efectos grandes. Un cambio tímido en un test de SEO es tiempo perdido, porque el poder no alcanza.
- Analiza por página, nunca por impresión. Si insistes en analizar por impresión, aplica el efecto de diseño y di qué ICC asumiste.
- Mantén guardrails. Las impresiones totales y la posición media tienen que entrar en el informe, para separar “ganó CTR” de “perdió alcance y el CTR subió por composición”.
- Cierra el test y limpia la estructura. La propia documentación de Google pide retirar los elementos del test en cuanto termina.
- Documenta las premisas cuando el diseño sea observacional. Escribir “estimamos, bajo la premisa de que el control no se vio afectado” es más honesto y más útil que escribir “medimos”.
Errores comunes
- Usar la herramienta de CRO client-side para testear título y marcado. Googlebot casi nunca ve eso, y el test mide otra cosa.
- Correr un test de SEO durante 5 días. El ciclo de rastreo y reindexación no cabe ahí, y la lectura capta el período de transición en lugar del estado nuevo. El razonamiento de ciclo es el mismo del ciclo semanal en tests A/B, con una constante de tiempo mayor.
- Cambiar páginas de grupo en medio del test. Eso destruye la aleatorización y contamina los dos lados.
- Comparar solo antes y después, sin grupo de control. Es el diseño más popular y el más fácil de engañar, porque cualquier estacionalidad se convierte en “resultado”.
- Ignorar la posición media como guardrail. Un título más llamativo que hace que Google reescriba el snippet o degrade la relevancia puede subir el CTR y derribar las impresiones.
- Contar la impresión como unidad independiente. Es el error que esta guía entera existe para deshacer.
- Prolongar el test indefinidamente porque “todavía no dio significancia”. Además del problema del peeking, la documentación de Google pide explícitamente no prolongar los tests.
Haz esto automático en Donnu
El cuello de botella del test de SEO no es correr el test, es guardar quién estaba en qué grupo. Después de 28 días, reconstruir qué URL estaba en control y cuál en variación a partir de una hoja de cálculo y de la memoria es donde muere la mayor parte de estos experimentos, y es donde aparece la tentación de mover una página de lado para que el resultado cierre.
Donnu registra la configuración del experimento en el momento en que se crea, con el sello de qué unidad cayó en qué brazo, y mantiene ese histórico congelado. Cuando la unidad sorteada es la página en lugar del usuario, esa lista constituye el experimento entero: sin ella, lo que queda es un antes y después con nombre bonito.
La recomendación práctica más barata de esta guía: antes de aprobar cualquier test de SEO, exporta el CTR por página de la plantilla y calcula la desviación estándar. Si es grande y el número de páginas es pequeño, el test no va a concluir nada, y es mejor descubrirlo en cinco minutos que en cuatro semanas. La calculadora de tamaño de muestra da el otro eje de la misma cuenta.
Referencias
- Google Search Central. A/B testing and Google Search (Website testing). Documentación oficial. Fuente de las reglas citadas en esta guía: que los cambios pequeños, como tamaño, color o posición de un botón o una imagen, en general tienen poco o ningún impacto en el snippet o en el posicionamiento; la instrucción de no mostrar un conjunto de URLs a Googlebot y otro a humanos, que la documentación clasifica como cloaking e infracción de las políticas de spam, pasible de degradación o eliminación del sitio de los resultados; el uso de rel canonical en las URLs alternativas en lugar de noindex; el uso de redirección 302 temporal en lugar de 301 permanente durante el test; y la instrucción de retirar todos los elementos del test en cuanto termina, porque los tests prolongados pueden interpretarse como un intento de engañar a los buscadores. developers.google.com.
- SearchPilot. What is SEO split testing? A guide to setting up, designing and running SEO split tests. Fuente de la descripción operativa del diseño de split test por páginas: que el usuario testeado es Googlebot y no el visitante humano; que los dos baldes necesitan tener un volumen de tráfico parecido y subir y bajar juntos en el histórico; del ejemplo de agrupación mal hecha que concentró productos para gatos en un balde y generó un falso positivo durante el Día Internacional del Gato; de la implementación server-side para que los buscadores vean el cambio; de la franja de dos a cuatro semanas para una lectura con significancia; y de los requisitos operativos de cientos de páginas en la misma plantilla y al menos 30.000 sesiones orgánicas mensuales en el grupo testeado. searchpilot.com.
- Brodersen, K. H., Gallusser, F., Koehler, J., Remy, N. y Scott, S. L. Inferring causal impact using Bayesian structural time-series models. Annals of Applied Statistics, volumen 9, número 1, 2015. Fuente del diseño de antes y después usado cuando no hay páginas suficientes para sortear: la construcción de un control sintético como combinación ponderada de series de control, el ajuste del modelo en el período anterior a la intervención para proyectar el contrafactual, y la premisa declarada de que las series de control no pueden verse afectadas por la intervención, sin la cual la relación estimada antes deja de valer después. research.google.
Lee también: Aleatorización por cluster · CRO vs SEO · Serie temporal interrumpida · Control sintético · Interferencia entre variantes · Calculadora de tamaño de muestra · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es un test A/B para SEO?
- Es un experimento controlado en el que la unidad sorteada es la PÁGINA, no el usuario. La mitad de las páginas de una misma plantilla recibe el cambio y la otra mitad queda como está, las dos mitades están publicadas al mismo tiempo, y la comparación es entre los dos grupos de páginas. Existe porque el visitante que importa es Googlebot, y no se puede mostrarle una versión a él y otra a las personas.
- ¿Por qué no puedo usar mi herramienta de test A/B habitual para testear SEO?
- Porque sortea usuarios y suele aplicar la variación en el navegador, con JavaScript. Googlebot no es un usuario sorteado, ve una sola pasada, y lo que indexa es el HTML servido. Mostrarle una versión al robot y otra a las personas es cloaking, que Google clasifica como infracción de las políticas de spam y castiga con degradación o eliminación del índice.
- ¿Google permite testear? ¿Eso perjudica el posicionamiento?
- Lo permite. La documentación oficial de Google Search dice que los cambios pequeños de tamaño, color o posición de un botón o una imagen en general tienen poco o ningún impacto en el snippet o en el posicionamiento de la página. Las reglas son: nunca servir URLs distintas a Googlebot y a las personas, usar rel canonical en las URLs alternativas cuando el test tenga varias URLs, usar redirección 302 y no 301, y retirar la estructura del test en cuanto termine.
- ¿Cuál es el error estadístico más común en un test de SEO?
- Correr un test de dos proporciones sobre impresiones, como si cada impresión fuera independiente. No lo son: las impresiones de la misma página se parecen entre sí. En el ejemplo trabajado de esta guía, la lectura por impresión devuelve un z de 10,0835 y un valor p por debajo de lo mostrable, pero con una correlación intraclase de 0,01 el efecto de diseño es 42,990, el z verdadero cae a 1,5379 y el valor p sube a 0,124075, es decir, no salió.
- ¿Cuántas páginas necesito para un test de SEO?
- Depende de cuánto varían las páginas entre sí, y no del volumen de impresiones. En el ejemplo de esta guía, para detectar 0,16 puntos porcentuales de CTR con 80 por ciento de poder se necesitan 393 páginas por grupo si la desviación de CTR entre páginas es de 0,80 puntos, 742 si es de 1,10 puntos y 2.453 si es de 2,00 puntos. El número de impresiones por página casi no cambia esa cuenta.
- ¿Se puede hacer un test A/B de SEO en un sitio pequeño?
- En la forma de split test aleatorizado, casi siempre no: falta el número de páginas parecidas en la misma plantilla. Un sitio con decenas de páginas únicas no tiene grupo de control posible. La alternativa honesta es el diseño de antes y después con control y modelo de serie temporal, que cambia la aleatorización por una premisa más fuerte, y asumirlo en el informe en lugar de fingir que hubo experimento.