CRO

Test A/B para SEO: la guía del split test de páginas

El test A/B para SEO aleatoriza páginas, no usuarios. Qué permite Google, el error estadístico que invalida casi todo informe y la cuenta correcta.

Ilustración plana de dos grupos idénticos de tarjetas rectangulares lado a lado, con una lupa suspendida sobre el espacio entre los dos grupos

Un test A/B para SEO es un experimento en el que la unidad sorteada es la página, y no el usuario. La mitad de las páginas de una misma plantilla recibe el cambio, la otra mitad queda intacta, y la comparación ocurre entre los dos grupos de páginas, en el mismo período, bajo las mismas condiciones externas. Eso lo cambia todo en la estadística: como las impresiones de la misma página se parecen entre sí, la cuenta hecha por impresión infla la confianza de forma brutal. En el ejemplo trabajado de esta guía, la misma lectura que parece tener un valor p por debajo de lo mostrable (z de 10,0835 sobre 2,52 millones de impresiones por grupo) se convierte en un valor p de 0,124075 cuando se tiene en cuenta la correlación entre impresiones de la misma página. Esta guía muestra qué permite oficialmente Google, los dos diseños que funcionan, la corrección estadística que casi ningún informe de test de SEO hace, y cuántas páginas necesitas antes de empezar. Forma parte de nuestra guía completa de optimización de conversión y es el par técnico de CRO vs SEO.

Por qué la herramienta de test A/B habitual no sirve aquí

Un test A/B tradicional sortea personas. Cada visitante entra en un balde, ve una versión, y su balde se recuerda por cookie. Eso funciona porque el visitante vuelve, y porque las personas son intercambiables entre sí.

Googlebot rompe las tres premisas de una vez:

premisa del test A/B clásico lo que pasa con Googlebot
el sujeto se sortea y se recuerda el robot no tiene cookie de balde, no es “un usuario”
el sujeto vuelve varias veces pasa, lee el HTML servido, y se va
todo sujeto es intercambiable por otro existe uno solo, y su decisión es sobre la URL, no sobre la sesión
la variación puede aplicarse en el navegador lo que cuenta es el HTML servido, no el DOM después del JavaScript

Y está el problema normativo. Servirle una versión al robot y otra a las personas tiene nombre: cloaking. La documentación oficial de Google Search es explícita al decir que no se muestre un conjunto de URLs a Googlebot y otro a humanos, lo clasifica como infracción de las políticas de spam, y registra que infringir esas políticas puede degradar o eliminar el sitio de los resultados.

La salida no es sortear mejor a las personas. Es cambiar la unidad de sorteo. Es un tema ya conocido del blog en otro contexto: cuando no puedes sortear individuos, sorteas grupos, y pagas un precio estadístico por ello. Es exactamente el problema de la aleatorización por cluster, aplicado a páginas.

Comparación entre sortear usuarios y sortear páginasDiagrama con dos franjas. En la franja superior, el test A/B clásico: muchos visitantes se dividen en dos baldes y cada uno ve una versión de la misma página. En la franja inferior, el test de SEO: un conjunto de páginas de la misma plantilla se divide en dos grupos, cada grupo con una versión del HTML, y el mismo robot de búsqueda visita los dos grupos.test A/B clásico: la unidad sorteada es la PERSONAvisitantespágina, versión Apágina, versión B1 URL, 2 experienciasfunciona porque la persona vuelvetest de SEO: la unidad sorteada es la PÁGINA600 páginas de control600 páginas con el cambioel mismo robot visita los dos gruposcada URL tiene UNA sola versión, para todoslo que cambia entre grupos es el HTML servido
El cambio de unidad es la definición del método. Todo lo que viene después, incluida la estadística, es consecuencia de ello.

Lo que Google permite, en palabras de la documentación oficial

La documentación de tests de sitios de Google Search es corta y casi toda compuesta de reglas operativas. Las cuatro que importan:

regla lo que dice la documentación
impacto en el posicionamiento los cambios pequeños, como tamaño, color o posición de un botón o una imagen, en general tienen poco o ningún impacto en el snippet o en el posicionamiento de la página
cloaking no muestres un conjunto de URLs a Googlebot y otro a humanos; eso es cloaking y va contra las políticas de spam
URLs alternativas usa rel canonical en las URLs alternativas para indicar la URL original como versión preferida, en lugar de noindex
redirección si el test envía al usuario de la URL original a una URL de variación, usa 302 temporal, nunca 301 permanente
duración al concluir el test, actualiza el sitio con la variación deseada y retira todos los elementos del test lo antes posible; los tests que se prolongan pueden interpretarse como un intento de engañar a los buscadores

Fíjate en lo que implican esas reglas juntas. No prohíben experimentar, prohíben experimentar mostrando cosas distintas al robot y a la persona. El split test por páginas cumple las cinco por construcción: cada URL tiene una sola versión, servida igual para todos, sin ninguna redirección y sin URL alternativa.

El caso en el que más gente se equivoca es el del test corrido con una herramienta de CRO habitual en una página importante para la búsqueda orgánica. No infringe la regla de cloaking si la variación se aplica por JavaScript para todos, robot incluido. Pero tampoco mide nada de SEO: mide la conversión de quien ya llegó. Son preguntas distintas, y la diferencia entre ellas es el tema de CRO vs SEO.

Los dos diseños de test A/B para SEO que funcionan

Diseño 1: split test aleatorizado por páginas

Es el diseño fuerte, el único que merece el nombre de experimento. Exige una plantilla con muchas páginas parecidas: catálogo de productos, páginas de categoría, perfiles, listados por ciudad, artículos de un mismo tipo.

Paso a paso:

  1. Selecciona el conjunto de páginas elegibles, todas de la misma plantilla.
  2. Sortea la mitad para la variación y la mitad para el control. Sortea de verdad, y después verifica el equilibrio: los dos grupos necesitan tener un volumen de tráfico parecido y, sobre todo, subir y bajar juntos en el histórico.
  3. Aplica el cambio en el servidor o en el edge, de modo que esté en el HTML servido.
  4. Espera. De dos a cuatro semanas es la franja habitual para una lectura, según SearchPilot, que opera este tipo de test comercialmente.
  5. Compara los dos grupos en el mismo período.

Que el sorteo sea verificado, y no solo hecho, vale un párrafo. SearchPilot publica un ejemplo didáctico de esto: una agrupación mal hecha que puso todos los productos para gatos en uno de los baldes generó un falso positivo durante el Día Internacional del Gato. El sorteo aleatorio protege en promedio, pero con pocos cientos de páginas la mala suerte ocurre, y verificar el equilibrio histórico antes de empezar es barato.

Diseño 2: antes y después con grupo de control y modelo de serie temporal

Cuando no hay páginas suficientes para sortear, queda el diseño observacional: aplicar el cambio en un conjunto de páginas, mantener otro conjunto intacto, y modelar lo que habría pasado con el grupo tratado si nada hubiera cambiado.

Esa es la maquinaria de CausalImpact, de Brodersen, Gallusser, Koehler, Remy y Scott. La idea es armar un control sintético como combinación ponderada de series de control, ajustar el modelo en el período anterior a la intervención y proyectar el contrafactual después de ella. La premisa dura, declarada en el artículo, es que las series de control no pueden verse afectadas por la intervención, porque es eso lo que mantiene válida después la relación estimada antes.

Esa premisa es más frágil de lo que parece en SEO. Si mejoras el título de 300 páginas y pasan a posicionar mejor para consultas que las páginas de control también disputan, el control se vio afectado. Eso es canibalización, y es el equivalente en SEO de la interferencia entre variantes.

La misma familia de métodos aparece en el blog en serie temporal interrumpida y en control sintético, con el tratamiento estadístico completo.

aspecto split aleatorizado por páginas antes y después con control
cuántas páginas exige cientos en la misma plantilla funciona con pocas o con una
premisa principal solo el sorteo el modelo de la serie de control es correcto
resiste una actualización de algoritmo sí, afecta a los dos grupos por igual solo si el control es de verdad paralelo
resiste la estacionalidad sí, por el mismo motivo depende de que el modelo capture la estacionalidad
riesgo de canibalización existe, y sesga hacia abajo existe, y sesga hacia arriba
qué decir en el informe “medimos” “estimamos, bajo estas premisas”

El error estadístico que invalida casi todo informe de test A/B para SEO

Aquí está el corazón de esta guía. El escenario del ejemplo trabajado:

parámetro valor
páginas elegibles (misma plantilla) 1.200
división 600 control, 600 variación
impresiones orgánicas por página en 28 días 4.200
impresiones por grupo 2.520.000
métrica primaria CTR orgánico (clics divididos por impresiones) de Search Console
CTR del control 3,2000% (80.640 clics)
CTR de la variación 3,3600% (84.672 clics)

La tentación es obvia: son dos proporciones, así que basta con pegarlas en un test de dos proporciones. Pégalas tú mismo:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Con 2.520.000 y 80.640 en el control contra 2.520.000 y 84.672 en la variación, la pantalla muestra 3,20 por ciento contra 3,36 por ciento, más 5,0 por ciento relativo, el veredicto de que B gana con significancia y un valor p tan pequeño que aparece como “menor que 0,0001”. Detrás del redondeo de la pantalla, la diferencia absoluta es de más 0,1600 puntos porcentuales, el z vale 10,0835 y el intervalo de confianza va de más 0,1289 a más 0,1911 puntos. Parece una victoria fuera de toda duda.

Es una lectura equivocada, y el motivo es simple: las impresiones de la misma página no son independientes unas de otras. Una página de categoría con buen título, marcado enriquecido y buena posición media tiene un CTR alto en sus 4.200 impresiones. Otra página, con una intención de búsqueda más vaga, tiene un CTR bajo en las 4.200 suyas. El test de dos proporciones cree que tienes 2,52 millones de observaciones independientes. Tienes 600.

La corrección clásica es el efecto de diseño:

efecto de diseño = 1 + (m menos 1) por ICC

donde m es el número de impresiones por página en el período e ICC es la correlación intraclase, es decir, cuánto se parecen dos impresiones de la misma página más de lo que se parecen dos impresiones de páginas distintas.

z corregido = z ingenuo dividido por la raíz del efecto de diseño

Con m igual a 4.200, mira lo que pasa:

ICC efecto de diseño z corregido valor p corregido muestra efectiva por grupo
0,002 9,398 3,2892 0,001005 268.142
0,005 21,995 2,1500 0,031551 114.571
0,010 42,990 1,5379 0,124075 58.618
0,020 84,980 1,0938 0,274027 29.654
0,050 210,950 0,6943 0,487521 11.946

Lee la fila del medio despacio. Una correlación intraclase de 0,01, que es minúscula en términos absolutos, multiplica la varianza por casi 43 y transforma un “valor p por debajo de lo mostrable” en un “no salió”. El motivo es la m grande: cuando cada cluster tiene miles de observaciones, hasta una correlación ínfima domina la cuenta.

No existe un ICC de CTR orgánico por plantilla publicado, y por eso los valores de la tabla son escenarios asumidos, no medidos. Aun así, hay razones para esperar que la correlación no sea despreciable: la dispersión del CTR entre páginas de una misma plantilla tiende a ser grande, porque la posición media, la intención de la consulta y la presencia de funciones de la SERP varían de página a página. Mide el tuyo en tu propio acervo antes de elegir una fila de esa tabla.

Cómo el efecto de diseño derriba el valor de z a medida que crece la correlación intraclaseGráfico de barras horizontales que muestra el valor de z corregido para cinco niveles de correlación intraclase. Sin corrección, z vale diez coma cero ocho. Con una correlación de cero coma cero cero dos, cae a tres coma veintinueve. Con cero coma cero cero cinco, cae a dos coma quince. Con cero coma cero uno, cae a uno coma cincuenta y cuatro, por debajo de la línea de corte de uno coma noventa y seis. Con cero coma cero dos cae a uno coma cero nueve y con cero coma cero cinco a cero coma sesenta y nueve.valor de z, según la correlación entre impresiones de la misma páginasin ninguna corrección10,08ICC 0,0023,29ICC 0,0052,15ICC 0,0101,54ICC 0,0201,09ICC 0,0500,69línea de corte: z igual a 1,96los mismos clics, los mismos 2,52 millones de impresiones. Solo cambia lo que se asume sobre independencia.
La barra de arriba es el número que aparece en la mayoría de los informes de test de SEO. Las de abajo son el mismo dato, contado correctamente.

La cuenta correcta: la página es la unidad de análisis

Existe una forma más directa de no equivocarse en esto, y no requiere estimar ningún ICC: analiza por página.

Calcula el CTR de cada una de las 1.200 páginas, y compara la media de los 600 CTR del control con la media de los 600 de la variación. La cuenta se convierte en un test de dos medias, y lo que importa deja de ser el volumen de impresiones y pasa a ser cuánto varían las páginas entre sí.

Con un efecto verdadero de 0,16 puntos porcentuales y 600 páginas por grupo:

desviación de CTR entre páginas error estándar de la diferencia estadístico t valor p
0,80 pp 0,0462 pp 3,4641 0,000532
1,10 pp 0,0635 pp 2,5193 0,011757
1,50 pp 0,0866 pp 1,8475 0,064672
2,00 pp 0,1155 pp 1,3856 0,165857

La lectura es la misma que la de la tabla anterior, dicha de otra forma: el test pasa o no pasa según una cantidad que no tiene nada que ver con cuántas impresiones acumulaste. Y esa cantidad es fácil de medir: exporta el CTR por página de Search Console y saca la desviación estándar. Lleva cinco minutos y determina si el test es viable.

Invirtiendo la cuenta, para 80 por ciento de poder con el mismo efecto de 0,16 puntos:

desviación entre páginas páginas por grupo total de páginas necesarias
0,80 pp 393 786
1,10 pp 742 1.484
1,50 pp 1.380 2.760
2,00 pp 2.453 4.906

Por eso SearchPilot declara como requisito operativo tener cientos de páginas de la misma plantilla y al menos 30.000 sesiones orgánicas al mes llegando al grupo de páginas testeado. Los dos números no son arbitrarios, son la traducción comercial de la tabla de arriba.

Dimensionar antes de correr

El número de páginas manda, pero aun así vale la pena dimensionar por el lado de las impresiones, porque es lo que define cuánto tiempo tiene que estar publicado el test. Usa la base de CTR real de tu plantilla:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Con una tasa base de 3,20 por ciento, 95 por ciento de confianza, 80 por ciento de poder y test bilateral, la calculadora devuelve la columna del medio de abajo. La columna de la derecha es la misma cuenta después de multiplicar por el efecto de diseño de 9,398, que corresponde a una correlación intraclase moderada de 0,002.

MDE relativo impresiones por grupo (ingenuo) con efecto de diseño 9,398 páginas por grupo a 4.200 impresiones cada una
3% 535.267 5.030.440 1.198
5% 194.530 1.828.193 436
8% 77.062 724.229 173
10% 49.777 467.805 112
15% 22.631 212.687 51
20% 13.015 122.315 30

La lectura práctica de esta tabla es dura y útil: los tests de SEO solo ven efectos grandes. Una ganancia de 3 por ciento en el CTR es invisible para casi cualquier sitio. Una ganancia de 15 o 20 por ciento, del tipo que produce una reescritura seria de títulos, es detectable con pocas decenas de páginas. Planifica cambios audaces, no ajustes finos, y lee esto junto con efecto mínimo detectable.

Qué se puede testear y qué no

cambio ¿se puede hacer split test? por qué
patrón de title de una plantilla sí, es el caso ideal muchas páginas, cambio en el HTML servido, efecto plausible y grande
meta description sí misma lógica; afecta el CTR sin afectar directamente la posición
marcado de datos estructurados sí aparece o no aparece en el HTML según el grupo
bloque de contenido nuevo en la plantilla sí server-side, aplicable a la mitad de las páginas
enlaces internos dentro de la plantilla con cuidado el grupo de control recibe enlaces del grupo tratado, lo que rompe la independencia
cambio de estructura de URL no tocar la URL es un cambio permanente, y un 302 de test masivo es mala idea
velocidad del sitio entero no es un cambio de infraestructura, afecta a los dos grupos
migración de dominio, HTTPS, robots no no existe versión parcial de eso
cambio en una única página importante no como split test usa el diseño de antes y después con control y asume las premisas

La fila de los enlaces internos merece destacarse. Si las páginas tratadas ganan un bloque de enlaces que apunta a páginas de control, acabas de tratar también el control, y el efecto medido se encoge hacia cero. El nombre de eso es interferencia, y la lectura completa está en interferencia entre variantes.

Factores de confusión y lo que resuelve el grupo de control

Cómo el grupo de control absorbe una actualización de algoritmo en medio del testGráfico de líneas con dos series a lo largo de ocho semanas. Las dos series suben y bajan juntas hasta la semana cuatro, cuando una caída brusca afecta a las dos al mismo tiempo, representando una actualización de algoritmo. Después de la caída, la serie de la variación queda consistentemente por encima de la serie de control, lo que muestra que la diferencia entre ellas sobrevive al choque común.tráfico orgánico por grupo, ocho semanasactualización de algoritmoafecta a los dos gruposcontrolvariaciónsin grupo de control, este gráfico se lee como “el cambio destruyó el SEO”.con grupo de control, la pregunta correcta es la DISTANCIA entre las dos líneas, y creció.
El grupo de control simultáneo es lo que convierte un choque externo de factor fatal en factor irrelevante.

La lista de factores de confusión que enfrenta un test de SEO es larga y ninguno está bajo tu control: actualización de algoritmo, estacionalidad de la demanda, cambio de diseño de la SERP, competidor nuevo, función de IA ocupando la parte superior de la página. El diseño aleatorizado con control simultáneo neutraliza todos los que afectan a los dos grupos por igual, y eso cubre prácticamente la lista entera.

Lo que no neutraliza es lo que afecta a los grupos de forma distinta. Dos casos reales:

Para el primer caso, la defensa es mirar el histórico de los dos grupos antes de empezar, y rehacer el sorteo si no se mueven juntos. Es el equivalente en SEO del test A/A: verificar que la división no produce diferencia cuando todavía no hay ningún tratamiento.

El ejemplo trabajado completo, de principio a fin

Hipótesis. Incluir la franja de precio en el title de las páginas de categoría aumenta el CTR orgánico, porque califica el clic antes de que ocurra.

Diseño. 1.200 páginas de categoría de la misma plantilla, sorteadas 600 y 600. Cambio aplicado en el servidor. Ventana de 28 días. Métrica primaria: CTR orgánico de Search Console. Métricas de guardrail: impresiones totales y posición media, para detectar si el título nuevo derribó la relevancia.

Verificación previa. Desviación estándar del CTR entre las 1.200 páginas en los 28 días anteriores: 1,10 puntos porcentuales. Según la tabla de poder, se necesitarían 742 páginas por grupo para 80 por ciento de poder con un efecto de 0,16 puntos. Tenemos 600. El test nace subdimensionado para ese efecto, y eso queda registrado en el plan antes de correr, no descubierto después. Tiene poder para efectos mayores, en la franja de 0,20 puntos hacia arriba.

Resultado bruto. Control: 2.520.000 impresiones, 80.640 clics, CTR 3,2000 por ciento. Variación: 2.520.000 impresiones, 84.672 clics, CTR 3,3600 por ciento.

Lectura equivocada. Pegando en la calculadora de significancia de arriba: más 0,1600 puntos, más 5,00 por ciento relativo, z de 10,0835, valor p por debajo de lo mostrable, intervalo de más 0,1289 a más 0,1911 puntos. Si el informe se detuviera aquí, el equipo celebraría.

Lectura correcta. Analizando por página, con una desviación de 1,10 puntos entre páginas y 600 páginas por grupo, el error estándar de la diferencia es 0,0635 puntos, el estadístico t es 2,5193 y el valor p es 0,011757. El resultado sigue siendo significativo, con un margen mucho menor del que sugería la lectura ingenua. El intervalo honesto para la diferencia va aproximadamente de más 0,0356 a más 0,2844 puntos porcentuales, es decir, entre más 1,1 y más 8,9 por ciento relativo.

Decisión. Implementar. Y registrar en el informe las dos lecturas, porque la diferencia entre ellas es la lección: el mismo dato sostiene “entre 1 y 9 por ciento de ganancia”, no “5 por ciento clavado con certeza absoluta”.

Lo que habría cambiado la decisión. Si la desviación entre páginas fuera de 1,50 puntos en lugar de 1,10, el mismo resultado daría un valor p de 0,064672 y la decisión honesta sería “indeciso, córrelo en más páginas”. Nada en los clics habría cambiado. Solo la heterogeneidad de la plantilla.

Cómo aplicar esto en la práctica

  1. Mide la desviación estándar del CTR entre las páginas de la plantilla antes que nada. Es el número que decide si el test es viable, y sale de una exportación de Search Console.
  2. Sortea y verifica. Después del sorteo, grafica las dos series de las últimas ocho semanas. Si no se mueven juntas, sortea de nuevo.
  3. Aplica el cambio en el servidor o en el edge. Si solo existe después del JavaScript, estás testeando otra cosa.
  4. Planifica para efectos grandes. Un cambio tímido en un test de SEO es tiempo perdido, porque el poder no alcanza.
  5. Analiza por página, nunca por impresión. Si insistes en analizar por impresión, aplica el efecto de diseño y di qué ICC asumiste.
  6. Mantén guardrails. Las impresiones totales y la posición media tienen que entrar en el informe, para separar “ganó CTR” de “perdió alcance y el CTR subió por composición”.
  7. Cierra el test y limpia la estructura. La propia documentación de Google pide retirar los elementos del test en cuanto termina.
  8. Documenta las premisas cuando el diseño sea observacional. Escribir “estimamos, bajo la premisa de que el control no se vio afectado” es más honesto y más útil que escribir “medimos”.

Errores comunes

Haz esto automático en Donnu

El cuello de botella del test de SEO no es correr el test, es guardar quién estaba en qué grupo. Después de 28 días, reconstruir qué URL estaba en control y cuál en variación a partir de una hoja de cálculo y de la memoria es donde muere la mayor parte de estos experimentos, y es donde aparece la tentación de mover una página de lado para que el resultado cierre.

Donnu registra la configuración del experimento en el momento en que se crea, con el sello de qué unidad cayó en qué brazo, y mantiene ese histórico congelado. Cuando la unidad sorteada es la página en lugar del usuario, esa lista constituye el experimento entero: sin ella, lo que queda es un antes y después con nombre bonito.

La recomendación práctica más barata de esta guía: antes de aprobar cualquier test de SEO, exporta el CTR por página de la plantilla y calcula la desviación estándar. Si es grande y el número de páginas es pequeño, el test no va a concluir nada, y es mejor descubrirlo en cinco minutos que en cuatro semanas. La calculadora de tamaño de muestra da el otro eje de la misma cuenta.

Referencias

Lee también: Aleatorización por cluster · CRO vs SEO · Serie temporal interrumpida · Control sintético · Interferencia entre variantes · Calculadora de tamaño de muestra · Leia em português · Read in English

Preguntas frecuentes

¿Qué es un test A/B para SEO?
Es un experimento controlado en el que la unidad sorteada es la PÁGINA, no el usuario. La mitad de las páginas de una misma plantilla recibe el cambio y la otra mitad queda como está, las dos mitades están publicadas al mismo tiempo, y la comparación es entre los dos grupos de páginas. Existe porque el visitante que importa es Googlebot, y no se puede mostrarle una versión a él y otra a las personas.
¿Por qué no puedo usar mi herramienta de test A/B habitual para testear SEO?
Porque sortea usuarios y suele aplicar la variación en el navegador, con JavaScript. Googlebot no es un usuario sorteado, ve una sola pasada, y lo que indexa es el HTML servido. Mostrarle una versión al robot y otra a las personas es cloaking, que Google clasifica como infracción de las políticas de spam y castiga con degradación o eliminación del índice.
¿Google permite testear? ¿Eso perjudica el posicionamiento?
Lo permite. La documentación oficial de Google Search dice que los cambios pequeños de tamaño, color o posición de un botón o una imagen en general tienen poco o ningún impacto en el snippet o en el posicionamiento de la página. Las reglas son: nunca servir URLs distintas a Googlebot y a las personas, usar rel canonical en las URLs alternativas cuando el test tenga varias URLs, usar redirección 302 y no 301, y retirar la estructura del test en cuanto termine.
¿Cuál es el error estadístico más común en un test de SEO?
Correr un test de dos proporciones sobre impresiones, como si cada impresión fuera independiente. No lo son: las impresiones de la misma página se parecen entre sí. En el ejemplo trabajado de esta guía, la lectura por impresión devuelve un z de 10,0835 y un valor p por debajo de lo mostrable, pero con una correlación intraclase de 0,01 el efecto de diseño es 42,990, el z verdadero cae a 1,5379 y el valor p sube a 0,124075, es decir, no salió.
¿Cuántas páginas necesito para un test de SEO?
Depende de cuánto varían las páginas entre sí, y no del volumen de impresiones. En el ejemplo de esta guía, para detectar 0,16 puntos porcentuales de CTR con 80 por ciento de poder se necesitan 393 páginas por grupo si la desviación de CTR entre páginas es de 0,80 puntos, 742 si es de 1,10 puntos y 2.453 si es de 2,00 puntos. El número de impresiones por página casi no cambia esa cuenta.
¿Se puede hacer un test A/B de SEO en un sitio pequeño?
En la forma de split test aleatorizado, casi siempre no: falta el número de páginas parecidas en la misma plantilla. Un sitio con decenas de páginas únicas no tiene grupo de control posible. La alternativa honesta es el diseño de antes y después con control y modelo de serie temporal, que cambia la aleatorización por una premisa más fuerte, y asumirlo en el informe en lugar de fingir que hubo experimento.