CRO

FAQ Schema para que la IA te Cite: Guía 2026

Cómo estructurar el FAQ y el schema FAQPage para la citación por IA ahora que el rich result murió: qué funciona según la investigación y cómo testearlo.

Ilustración abstracta de una pila de bloques redondeados con marcadores circulares, uno de ellos saliendo hacia un grupo de nodos conectados

Escribir FAQ para ser citado por IA en 2026 dejó de ser una jugada de schema (datos estructurados) y se convirtió en una decisión de estructura de texto, porque el rich result de FAQ de Google terminó: dejó de aparecer en la Búsqueda el 7 de mayo de 2026. Lo que sigue valiendo es el formato: un bloque de preguntas y respuestas es la manera más natural de escribir afirmaciones atómicas, autosuficientes y citables, que es exactamente el tipo de fragmento que un sistema generativo consigue recortar sin romper. Esta guía, parte de la guía de GEO en 2026, cubre qué cambió exactamente y cuándo, qué mostró la investigación académica que funciona (y qué no funciona), la anatomía de una respuesta que sobrevive al recorte, y cómo testear ese cambio con rigor estadístico usando la métrica correcta, que no es la citación.

Qué cambió: el rich result de FAQ terminó

El cambio ocurrió en dos etapas, con casi tres años entre ellas.

En agosto de 2023, Google anunció que los resultados enriquecidos de FAQ pasarían a aparecer solamente para sitios gubernamentales y de salud reconocidamente autoritativos (Google Search Central, Changes to HowTo and FAQ rich results). Para la enorme mayoría de los sitios, el recurso ya había terminado ahí, aunque mucha gente haya seguido implementando el marcado por costumbre.

El 7 de mayo de 2026, Google cerró el recurso definitivamente: el rich result de FAQ dejó de aparecer en la Búsqueda, y la documentación oficial del FAQPage pasó a registrar la discontinuación (Google Search Central, FAQPage structured data). La retirada de la infraestructura alrededor siguió a continuación, con la eliminación de la documentación del recurso y del soporte en las herramientas de reporte.

Línea de tiempo de la discontinuación del rich result de FAQEn agosto de 2023 Google restringió el rich result de FAQ a sitios gubernamentales y de salud autoritativos. El 7 de mayo de 2026 el recurso dejó de aparecer en la Búsqueda. Después de eso, la documentación y el soporte en las herramientas de reporte fueron retirados. El marcado FAQPage sigue siendo un tipo válido de schema.org.ago 2023recurso restringido a sitiosde gobierno y saludreconocidamente autoritativos7 may 2026el rich result deja deaparecer en la Búsquedadespuésdocumentación y soporteen las herramientas retirados;FAQPage sigue válido en schema.orglo que terminó fue el recurso visual en la SERP, no la validez del marcado
La discontinuación fue gradual. El efecto práctico de 2026 es que ninguna inversión en FAQ puede justificarse ya prometiendo un resultado enriquecido en la Búsqueda de Google.

La consecuencia más importante es de justificación, no de código. Durante años, el argumento para escribir FAQ era “ganar espacio en la SERP”. Ese argumento murió. Quedó un argumento mejor y más difícil de vender internamente: el formato de pregunta y respuesta produce el tipo de fragmento que sobrevive a un recorte, y eso es lo que un sistema generativo hace con tu página.

El schema de FAQ y la citación por IA: ¿eliminar o mantener el marcado?

Mantenerlo. El FAQPage sigue siendo un tipo válido de schema.org, otros mecanismos además de Google siguen procesando datos estructurados, y eliminar el marcado da trabajo sin devolver nada a cambio. La tabla de abajo separa lo que cambió de lo que no cambió:

Aspecto Antes de mayo de 2026 Después
Rich result de FAQ en la Búsqueda de Google Existía (restringido desde ago/2023) Ya no aparece
Reporte y test de resultados enriquecidos Cubrían el recurso Soporte retirado
Validez del tipo FAQPage en schema.org Válido Sigue válido
Lectura por otros mecanismos y crawlers Posible Sigue siendo posible
Valor del bloque de FAQ para las personas Alto Alto, y ahora es la justificación principal

Si tu página ya tiene el marcado, no lo toques. Si estás construyendo ahora, impleméntalo porque el bloque de FAQ es útil para quien lee y porque disciplina la escritura, no porque vaya a aparecer un recurso visual.

El formato canónico sigue siendo el mismo, un JSON-LD con el tipo FAQPage y una lista de Question con acceptedAnswer:

{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [{
    "@type": "Question",
    "name": "¿Cuánto dura un test A/B?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "Un test A/B dura el tiempo necesario para acumular la muestra calculada antes de empezar, típicamente de 2 a 4 semanas..."
    }
  }]
}

Fíjate en que el valor de text es la respuesta entera, autosuficiente. Es ese texto, y no la estructura alrededor de él, el que necesita tener sentido aislado.

Qué muestra la investigación que funciona

El artículo que acuñó el término GEO, “GEO: Generative Engine Optimization”, presentado en ACM SIGKDD 2024, testeó tácticas de optimización en un benchmark de gran escala y reportó que los métodos de GEO pueden aumentar la visibilidad en respuestas generativas hasta un 40% (arXiv 2311.09735). Más útil que el número agregado es el patrón de qué tácticas funcionaron: las que agregan evidencia verificable al texto tuvieron los mejores resultados, con las citas textuales de fuentes creíbles al frente, seguidas de las estadísticas y de la citación de fuentes. Meter palabras clave repetidas quedó por debajo de la línea base sin ninguna optimización. Y vale registrar un resultado fácil de leer al revés: el artículo también testeó un método bautizado “Authoritative”, que reescribe el texto en un tono más persuasivo y de autoridad sin agregar evidencia, y no encontró mejora significativa en él. Agregar una fuente movió la aguja; sonar como autoridad no.

Esto reorienta completamente cómo escribir un bloque de FAQ:

Práctica Efecto esperado Por qué
Respuesta con número y fuente atribuida Alto Las estadísticas y la citación de fuentes estuvieron entre las tácticas de mejor desempeño en el benchmark de GEO
Citas textuales de fuente creíble dentro de la respuesta Alto Fue la táctica de mejor desempeño en el benchmark, y le da al fragmento un ancla verificable
Respuesta autosuficiente en la primera frase Alto Sobrevive al recorte, que es la operación real del sistema generativo
Pregunta escrita como alguien realmente la escribe Medio Aumenta la probabilidad de coincidir con la consulta que genera la respuesta
Doce preguntas casi idénticas con la keyword Bajo o negativo Es la táctica cosmética que el estudio mostró que tiene un desempeño débil
Respuesta que empieza con “depende de varios factores” Bajo No afirma nada; recortada, no dice absolutamente nada

Vale la advertencia de rigor: ese estudio midió visibilidad en condiciones controladas de laboratorio, con una metodología específica y en un momento específico de los modelos. No es una promesa de resultado en tu sitio, y nadie debería venderlo como tal.

Anatomía de una respuesta que sobrevive al recorte

La operación que un sistema generativo hace con tu página es recortar. No lee el artículo de principio a fin para construir la respuesta; recupera fragmentos y sintetiza. Por eso, la pregunta práctica no es “este texto está bien”, es “este párrafo sigue siendo verdadero y comprensible si aparece solo, sin nada alrededor”.

Respuesta dependiente del contexto contra respuesta autosuficienteUna respuesta que empieza con “esto depende” pierde el sentido cuando se recorta, porque depende del párrafo anterior. Una respuesta que nombra el sujeto, afirma el hecho, da el número y atribuye la fuente sigue siendo comprensible sola.Dependiente del contextoAutosuficiente“Esto depende de varios factores, comoexplicamos arriba. En general, el segundocaso suele ser mejor.”recortado solo:no dice cuál es el tema,qué caso, ni por quéinextraíble“El tiempo de un test A/B lo define lamuestra calculada antes de empezar, noel calendario. Con base de 3% y efectode 15%, son cerca de 24 mil por variación.”recortado solo:nombra el sujeto, afirma el hecho,da el número, se sostiene soloextraíble
La prueba práctica de cualquier respuesta de FAQ: tapa todo lo que está alrededor y lee solo ese párrafo. Si dejó de tener sentido, la IA tampoco va a poder usarlo.

Cuatro reglas que salen directamente de eso:

  1. Nombra el sujeto en la primera frase. “Suele durar dos semanas” no sobrevive. “Un test A/B suele durar dos semanas” sobrevive.
  2. Afirma antes de matizar. Da la respuesta y solo después las advertencias. Un fragmento que abre con tres párrafos de contexto antes de la afirmación se recorta en el lugar equivocado.
  3. Trae el número junto con la fuente. “Según X, el valor es Y” es una unidad completa y verificable. Un número suelto sin fuente es exactamente lo que un sistema cauteloso evita citar.
  4. Una pregunta, una idea. Las respuestas que empalman tres temas diferentes no tienen un punto de recorte natural, y el recorte termina cortando en medio de un razonamiento.

El error de medición: la citación no es métrica de test

Aquí está la parte que separa un trabajo de GEO honesto de un teatro de métricas. Después de reescribir los FAQ, la pregunta natural es “¿esto funcionó?”. La tentación es responder mirando la citación. No se puede, por tres motivos concretos:

Lo que queda, y que es honesto, es medir el efecto del cambio sobre la conversión del sitio entero. Es la misma lógica aplicada en el test A/B y la citación por IA: corre el test donde hay volumen, decide por él, y trata las señales de citación como panel de seguimiento direccional.

Un ejemplo trabajado: testeando el bloque de FAQ con la métrica correcta

Un sitio de contenido con 9.000 visitas por semana y una tasa de conversión base del 3,2% quiere testear agregar un bloque de FAQ answer-first al final de sus artículos principales, buscando detectar una mejora relativa del 15% (llevando la tasa a cerca de 3,68%), al 95% de confianza y 80% de poder.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Ajustando la calculadora de arriba a una tasa base de 3,2, un efecto mínimo detectable de 15 (relativo) y 9.000 visitantes por semana, el resultado es 22.631 visitas por variación (45.262 en total), corriendo durante cerca de 36 días. Fíjate en que un 15% relativo ya es un efecto ambicioso para un cambio de estructura de contenido: pedir un 5% exigiría un volumen varias veces mayor, lo que en la práctica dejaría el test fuera del alcance de ese sitio.

Supón que el test corrió el plazo planeado y acumuló 14.000 visitas en cada brazo en las páginas participantes:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Pega 14000/448 en A y 14000/518 en B en la calculadora de arriba para comprobarlo: el lift absoluto es de 0,50 punto porcentual (lift relativo de +15,63%), el score z queda en aproximadamente 2,29, y el valor p bilateral es de cerca de 0,0219, por debajo del umbral de 0,05. El intervalo de confianza del 95% de la diferencia va de 0,07 a 0,93 punto porcentual, no cruza el cero, y la variación B gana.

Resultado del ejemplo trabajado con el bloque de FAQSin bloque de FAQ, 3,20% de conversión. Con bloque de FAQ answer-first, 3,70%. Valor p de aproximadamente 0,0219, resultado significativo, con intervalo de confianza de la diferencia entre 0,07 y 0,93 punto porcentual, un intervalo ancho que casi toca el cero.3,20%A · sin FAQ3,70%B · con FAQIntervalo de confianza 95%de la diferencia, en puntos porcentualescero0,070,93significativo · p ≈ 0,0219intervalo ancho: el efecto real puede ser bastante menor
El intervalo de confianza cuenta la historia completa: la diferencia es real, pero el límite inferior de 0,07 punto porcentual casi toca el cero. Es un resultado para adoptar, no para extrapolar en proyecciones agresivas.

Fíjate en el detalle honesto que la calculadora entrega y que el titular escondería: el intervalo es ancho y el límite inferior queda muy cerca del cero. El resultado pasa el criterio de significancia, pero el efecto real puede ser bastante menor que los 0,50 punto porcentual observados. Esto es normal cuando el efecto medido queda próximo al efecto mínimo detectable para el cual el test fue dimensionado, y es exactamente el tipo de matiz que la lectura de “p menor que 0,05, ganó” borra. Si quieres un intervalo más estrecho, el camino es más muestra, no más confianza en la conclusión.

Los errores más comunes

Error Señal de alerta Corrección
Justificar el FAQ por el rich result “Vamos a ganar más espacio en la SERP” El recurso terminó en mayo de 2026; la justificación ahora es estructura de contenido y utilidad
Llenar de preguntas con la keyword Doce preguntas casi idénticas La investigación de GEO muestra que la táctica cosmética tiene un desempeño débil; prefiere pocas y autosuficientes
Respuestas que dependen del párrafo anterior Empiezan con “esto”, “él”, “como vimos” Nombra el sujeto y afirma el hecho en la primera frase
Número sin fuente “Los estudios muestran que un 70%…” Atribúyelo (“según X”) o elimínalo; un número suelto es lo que un sistema cauteloso evita citar
Usar la citación por IA como métrica del test El reporte del test tiene “menciones en IA” como KPI Decide por la conversión del sitio entero; la citación es panel direccional
Eliminar el marcado por pánico “Se acabó el rich result, quita el schema” FAQPage sigue siendo válido; eliminarlo da trabajo y no devuelve nada

Haz esto automático en Donnu

Reescribir FAQ para que sean extraíbles es trabajo de contenido, y solo vale si consigues probar que moviste lo que importa. Ahí es donde la mayoría de los equipos tropieza: mide lo que es fácil (conteo de preguntas, presencia del marcado, menciones sueltas) en lugar de lo que decide (la conversión de gente de verdad). Donnu resuelve la parte de la prueba: tú defines el cambio y la métrica primaria, y Donnu devuelve el veredicto con el intervalo de confianza del 95% entero, sin declarar una ganadora antes de que la variación acumule al menos 200 visitantes y 7 días al aire, incluso cuando el intervalo es demasiado ancho para sostener el titular.

Empieza una prueba gratis de 14 días y testea tu próximo cambio de estructura de contenido con ese rigor. Para el panorama completo, mira la guía de GEO en 2026.

Referencias

Lee también:

Preguntas frecuentes

¿El FAQ schema todavía sirve para algo en 2026?
Sirve, pero no para lo que servía antes. El rich result de FAQ dejó de aparecer en la Búsqueda de Google el 7 de mayo de 2026, cerrando un proceso que empezó en agosto de 2023, cuando Google restringió ese recurso a sitios gubernamentales y de salud reconocidamente autoritativos. El FAQPage sigue siendo un tipo válido de schema.org, sigue siendo legible por otros mecanismos y no hay indicios de que mantenerlo cause problemas. Lo que cambió es el motivo para escribir FAQ: dejó de ser un recurso visual en la SERP y pasó a ser una decisión de estructura de contenido.
¿Escribir FAQ aumenta la probabilidad de que una IA cite mi página?
El marcado por sí solo no es el factor determinante, y es honesto decir que no existe prueba pública de causalidad directa. Lo que existe es evidencia experimental sobre el CONTENIDO: el artículo académico que acuñó el término GEO, presentado en KDD 2024, midió que los métodos de optimización para motores generativos pueden aumentar la visibilidad hasta un 40%, y que las tácticas que funcionaron fueron las que agregan evidencia verificable al texto, es decir, traer citas textuales de fuentes creíbles, incluir estadísticas y citar fuentes. Vale notar que, en ese mismo benchmark, reescribir el texto en un tono más de autoridad sin agregar evidencia no produjo mejora significativa, y meter palabras clave repetidas quedó por debajo de la línea base sin optimización. Un bloque de FAQ ayuda porque es el formato más natural para escribir afirmaciones atómicas y citables, no porque el JSON-LD tenga un poder mágico.
¿Qué es una respuesta answer-first y por qué importa para la extracción por IA?
Es una respuesta que entrega la afirmación completa y autosuficiente en la primera frase, sin depender del contexto del párrafo anterior ni de la pregunta que está encima para tener sentido. Esto importa porque los sistemas generativos trabajan con fragmentos recortados del texto: si el fragmento recortado necesita el párrafo anterior para ser comprensible, no sobrevive al recorte. Una respuesta que empieza con "depende de varios factores" es casi inextraíble; una que empieza nombrando el sujeto y afirmando el hecho sobrevive aislada.
¿Debo eliminar el FAQ schema de mis páginas ahora que el rich result terminó?
No es necesario. El FAQPage sigue siendo un tipo válido de schema.org y otros mecanismos además de Google siguen procesando datos estructurados. Eliminar el marcado da trabajo, no devuelve nada a cambio y cierra una puerta que todavía puede estar abierta en otros sistemas. Lo que ya no tiene sentido es justificar una inversión en FAQ prometiendo un resultado visual en la Búsqueda de Google, porque ese resultado ya no existe.
¿Cuántas preguntas debería tener un bloque de FAQ?
No existe un número mágico, y la métrica equivocada aquí es la cantidad. El criterio útil es la autosuficiencia: cada pregunta necesita ser una duda real que alguien escribiría, y cada respuesta necesita tener sentido sola, fuera de la página. Cuatro preguntas buenas y autocontenidas valen más que doce variaciones de la misma pregunta escritas para inflar el conteo, que es justamente el patrón que la investigación de GEO mostró que tiene un desempeño débil.
¿Se puede hacer un test A/B de un bloque de FAQ?
Se puede, y es la única manera honesta de saber si ayuda a tu negocio, siempre que la métrica de decisión sea la conversión del sitio entero y no la citación por IA. En el ejemplo trabajado de esta guía, un sitio con 9.000 visitas por semana y una tasa base de 3,2% necesita 22.631 visitas por variación, cerca de 36 días, para detectar una mejora relativa del 15%. La citación por IA no sirve como métrica primaria porque no tiene volumen, granularidad ni estabilidad entre ejecuciones.
¿Un FAQ inflado con palabras clave repetidas funciona para GEO?
La evidencia disponible dice que no. En el benchmark del artículo de GEO de KDD 2024, meter palabras clave repetidas puntuó por debajo de la línea base sin optimización, o sea, no solo dejó de ayudar, mientras que las tácticas que agregan evidencia verificable (citas atribuidas, estadística, fuente citada) fueron las más eficaces. Repetir la keyword en doce preguntas casi idénticas no crea un fragmento extraíble, crea ruido.