Los sistemas de búsqueda con IA no leen una página web como lo hace una persona. Cuando un usuario hace una pregunta, el sistema recupera documentos candidatos, los divide en pasajes, puntúa esos pasajes en función de la pregunta y sus subpreguntas relacionadas, y compone una respuesta a partir de los fragmentos que mejor encajan. Google describe AI Overviews y AI Mode como funciones que utilizan una técnica de «expansión de consultas» (query fan-out), que realiza varias búsquedas relacionadas en distintos subtemas y fuentes de datos para elaborar una respuesta. Por tanto, una página se evalúa como un conjunto de unidades extraíbles, y la forma en que estas se organizan influye en cuáles, si las hay, llegan a la respuesta final.

Este artículo analiza lo que la investigación publicada dice sobre la estructura del contenido y las citas de IA. Distingue los hallazgos basados en grandes conjuntos de datos de las cifras comunicadas por proveedores con métodos no publicados, y los compara con lo que el propio Google afirma sobre la optimización para sus funciones de IA. Nuestra interpretación de la evidencia —que identificamos como propia cada vez que aparece— es que la estructura determina la facilidad con que puede extraerse un fragmento una vez que una página ya cumple los requisitos para ser recuperada, y que tiene poca capacidad para sustituir las señales de autoridad que determinan esa elegibilidad. Este artículo continúa una serie que ha examinado el marcado schema, las menciones en medios, la claridad de las entidades, la investigación original y los backlinks.

Cómo recuperan y extraen fragmentos los sistemas de IA

Muchos sistemas de respuestas de IA que citan fuentes siguen un patrón de generación aumentada por recuperación, en el que se proporciona a un modelo texto recuperado de la web o de un índice y este redacta su respuesta a partir de ese texto. El paso de recuperación opera sobre fragmentos, no sobre páginas completas, porque los modelos de lenguaje trabajan con ventanas de contexto limitadas y porque una página larga suele contener material irrelevante para cualquier pregunta concreta. Es más fácil recuperar y citar un fragmento que indica cuál es su tema, plantea una afirmación completa y puede entenderse sin el texto que lo rodea que uno cuyo significado depende de párrafos anteriores.

La ramificación de consultas añade una segunda capa. Una sola pregunta —por ejemplo, qué procesadores de pagos debería considerar una empresa fintech— puede ampliarse a varias búsquedas más específicas sobre precios, regulación, integración y fiabilidad. Cada búsqueda puede recuperar un fragmento distinto de una página diferente, y la respuesta se nutre de todos ellos. Nuestra interpretación es que, en este sistema, una página compite en muchos pequeños procesos de selección a la vez, y que una página cuyas secciones respondan cada una a una subpregunta concreta tiene más posibilidades de ser seleccionada que otra que aborde un tema como un relato continuo.

La documentación de Google añade un aspecto práctico. Indica que las buenas prácticas de SEO siguen siendo pertinentes para las funciones de IA de Google Search y recomienda asegurarse de que el contenido importante esté disponible en forma de texto. El material que solo existe dentro de imágenes, elementos interactivos o scripts que los rastreadores no procesan quizá nunca llegue al conjunto de fragmentos a partir del cual se construye una respuesta. Por eso, el texto rastreable es el primer requisito estructural, antes de decidir nada sobre encabezados o formato.

Qué demuestra y qué no demuestra la investigación disponible

Cuatro fuentes abordan directamente la cuestión, y difieren considerablemente en calidad. La tabla presenta qué midió cada una y hasta qué punto se puede confiar en sus hallazgos.

Fuente | Muestra | Hallazgo comunicado | Nota sobre la calidad Kevin Indig, a través de Search Engine Land (febrero de 2026) | 3 millones de respuestas de ChatGPT y 30 millones de citas; se analizaron 18.012 citas verificadas | El 44,2 % de las citas provenía del primer 30 % de una página, el 31,1 % de la parte central y el 24,7 % del tercio final | Analista independiente; método descrito (se compararon las respuestas con las oraciones de las fuentes mediante embeddings de oraciones); solo ChatGPT Mismo estudio, características de los fragmentos | La misma muestra | El texto citado tenía casi el doble de probabilidades de incluir definiciones claras; el texto muy citado contenía un promedio del 20,6 % de nombres propios, frente al 5-8 % habitual | Como arriba AirOps | Más de 12.000 URL | El 68,7 % de las páginas citadas por ChatGPT empleaba una estructura secuencial de encabezados, frente a menos del 25 % de los resultados de la primera página de Google; casi el 80 % de las URL citadas contenía una lista estructurada, frente a menos de un tercio de los principales resultados de Google | Informe de proveedor; la metodología no se publicó en la página Aggarwal et al., GEO (KDD 2024) | GEO-bench, un benchmark de consultas en distintos dominios | Los métodos de optimización aumentaron hasta un 40 % la visibilidad en las respuestas de motores generativos; la eficacia variaba según el dominio | Publicación revisada por pares; resultados obtenidos en un benchmark Google Search Central | Documentación oficial | No se requieren requisitos adicionales ni optimizaciones especiales para AI Overviews o AI Mode, ni marcado especial de schema.org | Fuente primaria solo para Google

Las cifras de Indig son las más útiles porque el conjunto de datos es amplio y se describe el método. En términos sencillos, alrededor de 44 de cada 100 fragmentos citados provenían del 30 % inicial de la página de la que se extrajeron, y la cifra caía bruscamente hacia el pie de página. El mismo análisis reveló que el 53 % de las oraciones citadas provenía de la parte central de un párrafo, el 24,5 % de la primera oración y el 22,5 % de la última. Por tanto, más de la mitad del material citado estaba dentro de un párrafo, lo que complica el consejo de colocar la respuesta en la primera oración de cada párrafo.

Esta evidencia tiene tres limitaciones. El estudio de Indig midió ChatGPT, por lo que no demuestra que las funciones de IA de Google u otros asistentes se comporten de la misma manera. Registra dónde se encontró el texto citado y qué características compartía, pero no puede demostrar que subir un fragmento en una página haga que se cite, ya que las páginas que exponen sus afirmaciones principales desde el principio también podrían estar mejor redactadas o ser más autoritativas en otros aspectos. Las cifras de AirOps comparan páginas citadas por ChatGPT con resultados de la primera página de Google, lo que muestra que las páginas citadas suelen tener más encabezados y listas, aunque la página no explica cómo se creó la muestra. El artículo sobre GEO ofrece respaldo revisado por pares a la proposición general de que los cambios en el contenido pueden modificar la visibilidad en respuestas generadas, aunque el efecto descrito varía según el dominio y el artículo no establece cuál sería ese efecto para un editor en particular.

Por qué se citan con más frecuencia los fragmentos iniciales y autosuficientes

Hay mecanismos plausibles que explican el patrón observado según la posición, pero los presentamos como nuestra interpretación y no como parte de los hallazgos del estudio. Los sistemas de recuperación suelen trabajar con una cantidad limitada de texto por página, lo que favorecería el material que aparece al principio. Además, las páginas que comienzan con una afirmación directa sobre su tema también suelen ofrecer las definiciones y las conclusiones resumidas que responden a las preguntas que los usuarios realmente hacen. Por tanto, la concentración de citas en la parte superior puede reflejar tanto el truncamiento como la calidad de la redacción. Ambas explicaciones apuntan a la misma conclusión práctica: la afirmación principal de una página debe aparecer en el primer tercio.

Las características de los fragmentos apuntan en una dirección coherente. El texto citado tenía casi el doble de probabilidades de incluir definiciones claras, y el texto muy citado contenía un promedio del 20,6 % de nombres propios, frente al 5-8 % habitual. Un fragmento con muchas entidades nombradas, como empresas, normativas, productos y personas, ofrece al sistema de recuperación más elementos que cotejar con una consulta y al modelo material más específico que atribuir. Esto conecta directamente con el trabajo descrito en nuestra publicación sobre la claridad de las entidades, ya que un fragmento que nombra explícitamente su tema es más fácil de relacionar con una consulta y de atribuir a una fuente.

El mismo conjunto de datos reveló que el contenido citado tenía el doble de probabilidades de contener un signo de interrogación y que el 78,4 % de las citas relacionadas con preguntas provenía de encabezados. Un encabezado que reformula con términos sencillos la pregunta del lector marca el inicio de un fragmento que la responde, lo que ayuda a un sistema a asociar una subpregunta con el segmento adecuado. Para los editores de finanzas y criptomonedas, cuyos lectores plantean preguntas precisas sobre regulación, custodia, impuestos y riesgo, esto favorece las secciones cuyo encabezado formula la pregunta, que la responden en las primeras frases y que incluyen las salvedades en las frases siguientes.

Qué prácticas estructurales se mantienen y cuáles no

La jerarquía de encabezados y las listas cuentan con el respaldo más constante de los datos disponibles, aunque ese respaldo es correlacional y procede en gran medida de un informe de proveedor. AirOps descubrió que la mayoría de las páginas citadas por ChatGPT seguía una estructura secuencial de encabezados y que casi el 80 % de las URL citadas incluía al menos una lista estructurada. También informa de un aumento de 2,8 veces en las citas de páginas con encabezados formulados como preguntas y secciones de preguntas frecuentes. Ninguna de estas cifras viene acompañada de una metodología publicada, por lo que conviene considerarlas indicativas. Vale la pena adoptar encabezados claros y listas bien elaboradas porque mejoran la legibilidad y ofrecen límites claros a los sistemas de extracción; sin embargo, la evidencia de que causen más citas es más débil que la evidencia de que estén asociadas con ellas.

El marcado schema ocupa un lugar más limitado del que sugieren muchas guías. Google afirma que no se necesitan datos estructurados especiales de schema.org para aparecer en AI Overviews o AI Mode. Los datos estructurados siguen siendo útiles para desambiguar entidades y para las funciones de búsqueda convencionales, un tema que tratamos en nuestra publicación sobre el marcado schema, pero no sustituyen a los fragmentos que se entienden por sí solos.

La longitud de los fragmentos es otro ámbito en el que las afirmaciones precisas van más allá de la evidencia. AirOps recomienda párrafos de aproximadamente 100 a 300 tokens y advierte que los mucho más largos corren el riesgo de truncarse. Es una recomendación razonable, pero no conocemos ninguna prueba independiente de ese umbral. La postura más defendible es que cada párrafo contenga una idea completa, ya que los datos de Indig muestran que las oraciones citadas aparecen dentro de los párrafos con más frecuencia que en la primera o la última oración.

La limitación más amplia tiene que ver con lo que el formato no puede aportar. Una página bien estructurada en un dominio que carece de corroboración de terceros sigue sin tener las señales que determinan si se recupera, y el benchmark GEO muestra que los efectos de los cambios en el contenido dependen del dominio en el que se realizan. Lo mejor es considerar la estructura una medida de higiene que evita que se pase por alto una página sólida y una palanca débil para una página que no reúne los requisitos por otros motivos.

Auditar una página para facilitar la extracción

Se puede realizar una auditoría estructural página por página, y conviene empezar por las páginas con mayor peso comercial, como las páginas de servicios, las comparativas y los artículos que ya atraen tráfico orgánico. La siguiente secuencia refleja la evidencia revisada anteriormente y nuestra propia interpretación.

  1. Confirma que la respuesta esté disponible como texto rastreable. Revisa el HTML renderizado para verificar que las afirmaciones principales aparezcan como texto y no estén únicamente en imágenes, pestañas que se cargan al interactuar o scripts que los rastreadores quizá no ejecuten.

  2. Coloca la afirmación principal y la definición clave al principio. Dentro del primer tercio de la página, indica qué abarca, define los términos centrales y presenta la conclusión principal, ya que esa parte aportó la mayor proporción de citas en el conjunto de datos de Indig.

  3. Haz que cada sección sea autosuficiente. Nombra explícitamente el tema en cada sección y evita referencias como «esto» o «lo anterior» que dependan del texto previo, para que el fragmento pueda entenderse por sí solo.

  4. Nombra las entidades con precisión y atribuye las cifras. Utiliza los nombres completos de empresas, normativas, productos y personas, y atribuye cada estadística a su fuente en la misma oración en la que aparece.

  5. Ajusta los encabezados a las preguntas de los lectores. Cuando una sección responda a una pregunta real, formula el encabezado como esa pregunta o como una afirmación muy similar, y respóndela directamente en las primeras frases.

Dónde encaja esto en una estrategia de autoridad más amplia

La evidencia revisada aquí respalda una secuencia en la que primero viene la elegibilidad y después la facilidad de extracción. Que una página llegue siquiera a recuperarse depende de señales que, en gran medida, están fuera de ella, como las menciones del editor, el perfil de backlinks, la claridad de la entidad subyacente y la presencia de investigación original que otros tengan motivos para citar. La estructura determina entonces cuánto de una página elegible puede utilizarse. Nuestra interpretación es que la estructura actúa como multiplicador de la autoridad, lo que sería coherente con los efectos que dependen del dominio y que se describen en el benchmark GEO.

La misma lógica se aplica a las páginas de terceros. Una publicación editorial es, en sí misma, una página que los sistemas de IA pueden recuperar y citar. Si sus primeros párrafos nombran a la empresa, definen a qué se dedica y atribuyen sus afirmaciones, ofrecen al sistema de recuperación una declaración clara procedente de una fuente independiente. Por eso conviene planificar las publicaciones en medios pensando en el fragmento: hay que considerar los párrafos iniciales del artículo y la manera de describir a la empresa, además de la publicación y el enlace.

Las organizaciones que decidan por dónde empezar pueden utilizar la Auditoría de Autoridad de IA para revisar conjuntamente el contenido, los backlinks y las señales de menciones en medios, de modo que las mejoras estructurales se prioricen en función de las brechas de autoridad externas a la página. Cuando la auditoría detecta la falta de señales en medios, PR Marketplace ofrece publicaciones editoriales y patrocinadas en medios relevantes para las finanzas, la tecnología, la IA y las criptomonedas, que pueden ajustarse a las brechas detectadas por la auditoría.

La publicación «Cómo influye la estructura del contenido en lo que citan los motores de búsqueda con IA» apareció originalmente en Visionary Financial.