La IA no guarda tu página entera: guarda pedazos. Recupera el fragmento que mejor responde, lo pega en su respuesta y cita a quien dejó ese trozo listo para copiar. Por eso da igual lo bien hilada que esté la página completa: si el bloque que necesita no se entiende solo, no lo usa. Esta guía va de la forma concreta del contenido citable por IA —cómo dar forma al texto para que un trozo se pueda levantar sin arrastrar el resto—. La estrategia de por qué la IA elige a unos y no a otros está en cómo hacer que la IA te cite, y la checklist técnica de la página entera —schema, frescura, robots— en optimizar la página para GEO. Aquí solo hablamos de una cosa: el formato del texto.
Por qué la IA cita fragmentos, no páginas
Un modelo generativo no lee tu página como un humano de arriba abajo. Por debajo trocea el contenido en fragmentos (chunks), los indexa por significado y, cuando alguien pregunta, recupera los pedazos que mejor encajan —vengan de la página que vengan— y compone la respuesta con ellos. La unidad de trabajo no es la página: es el fragmento. Optimizas un trozo para que sea la respuesta más fácil de extraer, no una web para una keyword.
Eso cambia dónde pones el esfuerzo. Un dato que se repite en todos los estudios de citación: alrededor del 44% de las citas salen del primer 30% del contenido. Traducido a forma: lo que entierras al final, para el modelo no existe, y lo que solo se entiende leyendo lo anterior, no se puede trocear. La página puede estar perfecta y aun así no dar ni una cita si su texto no está cortado en piezas que aguanten solas.
La anatomía de un chunk que se cita solo
Un chunk autoconclusivo es un bloque que responde algo completo sin necesitar el párrafo de arriba. Es la pieza que el modelo puede copiar tal cual dentro de su respuesta. Y tiene reglas de construcción concretas:
- Una idea por bloque. Si un párrafo mete dos afirmaciones, pártelo. El modelo extrae bloques enteros; si mezclas, la mitad sobra o confunde.
- La conclusión primero. La primera frase dice qué es; el resto lo desarrolla. Nunca al revés.
- Sin pronombres huérfanos. «Esto», «como veíamos», «por lo anterior» encadenan el bloque al de arriba y le quitan la autonomía. Nombra el sujeto en cada trozo.
- El contexto mínimo, dentro. Si el dato solo tiene sentido con una fecha, un quién o una unidad, mételos en la misma frase, no tres párrafos antes.
El TL;DR arriba: la respuesta antes que el contexto
La costumbre de calentar —introducción, contexto, «en los últimos años la IA ha cambiado…»— es veneno para la extracción. El modelo premia lo que puede sacar sin bajar, y ahí arriba es donde se concentran las citas. Así que empieza por el final: un TL;DR de dos o tres líneas que responda la pregunta del título, con el dato dentro, antes de cualquier introducción.
No es un resumen decorativo: es el fragmento con más probabilidad de acabar citado. Y el mismo gesto se repite en cada sección —abre cada H2 con la afirmación directa y desarrolla después—. Compara:
| Enterrado (no se cita) | Front-load (se cita) |
|---|---|
| «El concepto de contenido citable es objeto de mucho debate. Para entenderlo, primero conviene repasar cómo funcionan los motores…» | «Un contenido citable es el que se escribe en fragmentos que se sostienen solos. La IA cita el trozo, no la página.» |
| «Existen varias opiniones sobre el TL;DR. Algunos expertos creen que…» | «El TL;DR va arriba porque el 44% de las citas salen del primer tercio del contenido.» |
La columna de la derecha se puede copiar en una respuesta sin tocar nada. La de la izquierda obliga al modelo a seguir leyendo para encontrar el grano —y casi siempre elige a otro que se lo dio ya masticado—.
Pregunta → respuesta: la forma exacta que el modelo copia
El comprador le habla a la IA con preguntas. El modelo empareja esa pregunta con el fragmento que más se le parece y copia la respuesta de debajo. Así que la estructura que más se cita es la más simple de todas: la pregunta literal seguida de su respuesta directa. Es la forma de una FAQ, pero aplicada dentro del cuerpo, no solo al final.
- El encabezado es la pregunta, con las palabras del usuario. «¿Cuánto cuesta un contenido citable?» casa con la duda real; «Nuestra metodología» no casa con nada.
- La primera frase de debajo es la respuesta, entera. Nada de «depende de varios factores»: el factor primero, el matiz después.
- Un par por duda. Cada pregunta-respuesta es un fragmento independiente que puede entrar en una respuesta distinta. Seis pares bien resueltos son seis oportunidades de cita.
El efecto secundario es que te obliga a ordenar el texto por dudas reales, no por lo que a ti te apetece contar. Si no sabes qué pregunta responde un bloque, probablemente no responde ninguna —y esa es la señal de que sobra—. Elegir qué preguntas merecen su propio bloque —y responderlas para que la IA las copie— tiene su propia guía: preguntas y respuestas para GEO.
Listas y tablas: cuándo cada una (y cuándo ninguna)
Lo estructurado se parsea mejor que la prosa densa, pero meter todo en viñetas porque «se lee mejor» es otro error de forma. Cada estructura sirve para un tipo de dato, y usarla donde no toca resta en vez de sumar. La decisión no es de estilo, es de contenido:
| Si el contenido es… | Usa… | Porque la IA… |
|---|---|---|
| Pasos o elementos del mismo tipo | Una lista (ul/ol) | extrae cada ítem como una unidad limpia y los reordena en su respuesta. |
| Varias cosas comparadas por las mismas dimensiones | Una tabla | lee filas y columnas como pares clave-valor: es el formato que menos ambigüedad deja. |
| Un argumento con matiz o una relación causa-efecto | Un párrafo corto | necesita la frase entera para no perder el matiz; troceado en viñetas, se malinterpreta. |
Regla práctica: si puedes leer tu viñeta como una frase con «y» en medio y sigue teniendo sentido, no era una lista, era un párrafo mal cortado. Y si tu tabla tiene una sola columna de datos, no comparaba nada: era una lista disfrazada. La estructura sigue al contenido.
Definiciones y datos que un LLM levanta tal cual
Lo que más se cita son las frases que el modelo puede reutilizar con seguridad sin reescribir. Dos tipos por encima del resto: la definición limpia y el dato concreto con su fuente. Ambos tienen una forma que los hace copiables.
- Definiciones en forma «X es Y». «El GEO es la práctica de optimizar contenido para que los motores generativos lo citen.» Sujeto, verbo ser, definición cerrada. Es la frase que el modelo pega cuando alguien pregunta «qué es».
- Datos con su unidad y su fuente en la misma frase. «El 44% de las citas salen del primer 30% del contenido» se puede copiar; «la mayoría de las citas están arriba» no aporta nada verificable.
- Atribución dentro del bloque. «Según el estudio GEO de Princeton…» le dice al modelo quién lo dice, y eso le da permiso para citarte. Un dato sin dueño es un dato que no se arriesga a reutilizar.
Y la regla de honestidad, innegociable: no te inventes cifras para rellenar. Un dato falso que la IA reutiliza es una bomba de relojería para tu credibilidad —y, cuando el modelo lo corrija con otra fuente, te saca de la respuesta para siempre—. Si no tienes un número real, describe el mecanismo; mejor un bloque sin cifra que una cifra inventada. El marcado que le confirma al modelo quién eres lo cubre la guía de schema para GEO; esta se queda en la forma del texto.
Si prefieres que este trabajo se ejecute sobre tus páginas de dinero —reescribir cada bloque para que pase la prueba del trozo aislado, no leer sobre ello— la optimización GEO hace la mano de obra, fragmento a fragmento, y mide si mueve tus citas.