GEO técnico: cómo preparar tu web para ChatGPT, Gemini, Claude y los LLMs
La parte del posicionamiento en IA que depende del código y del servidor, explicada con las fuentes oficiales: qué rastreadores existen, cómo dejarles pasar (o no) y qué revisar en tu web.
El GEO técnico es la parte del posicionamiento en IA que no depende de escribir mejor, sino de cómo está construida y servida tu web: si los rastreadores de ChatGPT, Claude, Perplexity o Google pueden entrar, si leen tu contenido, si entienden quién eres y si tu servidor responde bien. Es la base de todo lo demás: si una IA no puede leer tu web, da igual lo buena que sea.
Aviso: esta guía resume la documentación oficial consultada el 7 de octubre de 2026. Los rastreadores y sus reglas cambian; revisa siempre las fuentes enlazadas.
1. Conoce a los rastreadores de IA
No hay un único «bot de la IA». Cada empresa tiene varios, y no hacen lo mismo. Los más relevantes hoy:
| Empresa | Agente | Para qué sirve |
|---|---|---|
| OpenAI | OAI-SearchBot | Mostrar webs en los resultados de búsqueda de ChatGPT. |
| OpenAI | GPTBot | Rastrear contenido que puede usarse para entrenar sus modelos. |
| OpenAI | ChatGPT-User | Visitas que hace ChatGPT cuando un usuario se lo pide en la conversación. |
| Anthropic | ClaudeBot | Recoger contenido web para mejorar sus modelos. |
| Anthropic | Claude-SearchBot | Mejorar la calidad de los resultados de búsqueda de Claude. |
| Anthropic | Claude-User | Visitas que hace Claude cuando un usuario se lo pide. |
| Googlebot | El rastreador de la Búsqueda, del que dependen también AI Overviews y el Modo IA. | |
| Google-Extended | No es un rastreador aparte, sino una marca para decidir si tu contenido se usa para entrenar Gemini y en sus respuestas fuera de la Búsqueda. |
Fuentes: rastreadores de OpenAI, rastreadores de Anthropic y rastreadores de Google. Perplexity documenta los suyos (PerplexityBot y Perplexity-User) en su propia web.
La distinción importante es entre búsqueda y entrenamiento. Si quieres aparecer cuando alguien pregunta, te interesa que entren los de búsqueda (OAI-SearchBot, Claude-SearchBot, Googlebot). Si no quieres que tu contenido entrene modelos, puedes bloquear los de entrenamiento (GPTBot, ClaudeBot) sin cerrar la puerta a los primeros. OpenAI indica que bloquear GPTBot significa que tu contenido no debe usarse para entrenamiento, y Google indica que Google-Extended no afecta a tu inclusión ni a tu posición en la Búsqueda.
2. Revisa tu robots.txt
El robots.txt es el primer sitio donde se bloquea a un rastreador, a veces sin querer: plantillas antiguas, plugins de seguridad o un «Disallow: /» olvidado de cuando la web estaba en pruebas. Un ejemplo para una web que quiere aparecer en los buscadores con IA pero no ceder su contenido para entrenamiento sería:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: *
Allow: /
Sitemap: https://www.tuweb.es/sitemap.xml
Es solo un ejemplo: la decisión de bloquear o no el entrenamiento es tuya. Ten en cuenta que las visitas que pide un usuario, como ChatGPT-User, pueden no seguir el robots.txt, según la propia documentación de OpenAI.
3. Que el cortafuegos y el CDN no te dejen fuera
Este es el fallo que más vemos y el que menos se revisa. Aunque el robots.txt diga «adelante», un cortafuegos, un plugin de seguridad o la protección contra bots del CDN pueden bloquear a los rastreadores de IA antes de que lleguen a tu web. Algunos proveedores ofrecen bloquear a los bots de IA con un interruptor; conviene saber si lo tienes activado.
Al revés también pasa: hay CDN que comprueban que un bot viene de verdad de las direcciones IP de su empresa y frenan a quien solo se hace pasar por él. En una revisión reciente, un CDN rechazaba nuestras pruebas con el nombre de GPTBot y, a la vez, dejaba pasar al GPTBot real, que llegaba desde las IP que publica OpenAI. Por eso no basta con probar cambiando el nombre del navegador: hay que mirar los registros reales del servidor o el panel del CDN. OpenAI publica los rangos de IP de cada rastreador, y Anthropic advierte de que bloquear por IP puede impedir que su bot lea tu robots.txt.
4. Que tu contenido se lea sin JavaScript
Googlebot renderiza JavaScript, pero no hay garantía de que todos los rastreadores de IA lo hagan. Si los textos de tu web solo aparecen después de que el navegador ejecute scripts, como en algunas webs hechas como aplicación de una sola página, un rastreador puede recibir una página casi vacía. Lo prudente:
- Que el texto principal, los títulos, los precios orientativos y las preguntas frecuentes estén en el HTML que devuelve el servidor.
- Comprobarlo mirando el código fuente de la página (no el inspector del navegador) o descargándola sin ejecutar JavaScript.
- Si tu web es una aplicación de JavaScript, valorar el renderizado en el servidor o páginas estáticas para el contenido público.
5. Indexación y fragmentos
Google es claro: no hay requisitos ni optimizaciones especiales para aparecer en AI Overviews o en el Modo IA. Para poder aparecer como enlace en ellos, una página debe estar indexada y poder mostrarse en la Búsqueda con fragmento (Google Search Central). En la práctica:
- Las páginas importantes responden con código 200 y tienen una URL canónica.
- Están en el sitemap y enlazadas desde otras páginas de tu web.
- No llevan noindex ni nosnippet, y no limitas el fragmento con max-snippet o data-nosnippet donde no quieres.
- Están dadas de alta y sin errores en Google Search Console.
Lo que vale para Google suele valer para los demás: muchas respuestas de IA se apoyan en lo que encuentran en buscadores web.
6. Datos estructurados: que no te confundan con otro
Los datos estructurados de schema.org describen tu negocio en un formato que las máquinas entienden. Para el GEO técnico importan sobre todo tres cosas:
- Una sola entidad para tu empresa (Organization, LocalBusiness o el tipo concreto de tu sector), con el mismo identificador en todas las páginas, en lugar de varias versiones que se contradicen.
- Datos idénticos a los visibles: nombre, dirección, teléfono, horario. Google recuerda que los datos estructurados deben coincidir con el texto de la página.
- Perfiles enlazados con sameAs: tu ficha de Google, LinkedIn, directorios del sector. Ayudan a distinguirte de negocios con nombres parecidos.
Añade el marcado de tus servicios, artículos y preguntas frecuentes, y valídalo con la prueba de resultados enriquecidos de Google.
7. llms.txt: útil, barato y sin promesas
El llms.txt es un archivo de texto en la raíz de tu web que resume, en formato sencillo, quién eres y cuáles son tus páginas importantes, pensado para modelos de lenguaje. Es una propuesta abierta, no un estándar oficial, y no garantiza que ninguna IA lo lea ni que te posicione. Aun así, cuesta poco y obliga a ordenar la información. Si lo publicas:
- Que diga solo hechos, sin servicios que ya no ofreces ni datos antiguos.
- Que enlace a las páginas importantes, con una frase de qué hay en cada una.
- Que lo actualices cuando cambie tu web, y que tu CDN no sirva una versión vieja en caché.
Lo explicamos a fondo en qué es llms.txt y si tu web lo necesita.
8. Velocidad y estabilidad del servidor
Un rastreador tiene un tiempo limitado para tu web. Si el servidor tarda en responder, devuelve errores 5xx o un cortafuegos lo frena por exceso de peticiones, leerá menos páginas. Revisa el tiempo de primera respuesta, las Core Web Vitals y los errores del servidor en Search Console.
9. Lista de comprobación de GEO técnico
- El robots.txt deja pasar a los rastreadores de búsqueda que quieres (OAI-SearchBot, Claude-SearchBot, Googlebot) y decides a conciencia sobre los de entrenamiento.
- El cortafuegos, los plugins de seguridad y el CDN no bloquean a esos rastreadores (compruébalo en los registros reales).
- El contenido importante está en el HTML sin necesidad de ejecutar JavaScript.
- Las páginas clave responden 200, tienen canónica, están en el sitemap y no llevan noindex ni bloqueos de fragmento.
- Una sola entidad de empresa en los datos estructurados, con datos idénticos a los visibles y perfiles enlazados.
- Nombre, dirección y teléfono iguales en la web, la ficha de Google y los directorios.
- llms.txt con hechos actuales y enlaces a las páginas importantes.
- Servidor rápido y sin errores.
- Medición periódica de si los LLMs te mencionan.
Para el último punto usamos Vigía, nuestra herramienta de medición: lo contamos en cómo saber si la IA recomienda tu marca. Y si quieres el panorama completo, más allá de lo técnico, lee nuestra página de posicionamiento en IA (GEO).
Preguntas frecuentes
¿Debo bloquear a GPTBot?
Depende de lo que quieras. GPTBot rastrea contenido que puede usarse para entrenar los modelos de OpenAI; bloquearlo indica que tu contenido no debe usarse para eso. Para aparecer en la búsqueda de ChatGPT el que importa es OAI-SearchBot, que es un agente distinto. Puedes bloquear uno y permitir el otro.
¿Bloquear Google-Extended me quita de la Búsqueda de Google?
No. Google indica que Google-Extended no afecta a la inclusión de tu web en la Búsqueda ni es una señal de posicionamiento. Sirve para decidir si tu contenido se usa para entrenar Gemini y en sus respuestas fuera de la Búsqueda.
¿Hace falta un marcado especial para aparecer en AI Overviews?
No. Según Google, no hay requisitos ni optimizaciones especiales para AI Overviews ni para el Modo IA. La página tiene que estar indexada y poder mostrarse en la Búsqueda con fragmento, y valen las buenas prácticas de SEO de siempre.
¿Cómo sé si los rastreadores de IA entran en mi web?
Mirando los registros del servidor o el panel de tu CDN, buscando sus nombres de agente (GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot…). No te fíes de pruebas cambiando el nombre del navegador: algunos CDN comprueban la dirección IP del bot y tratan distinto a quien se hace pasar por él.
¿El llms.txt me posiciona en ChatGPT?
No hay garantía. Es una propuesta abierta, no un estándar oficial, y ningún asistente se ha comprometido a usarlo para decidir a quién cita. Merece la pena porque es barato y ordena la información, pero no sustituye al resto del trabajo técnico y de contenido.
¿Quieres que lo revisemos por ti?
Evaluamos gratis el estado actual de tu web para Google y para los LLMs y te decimos qué necesitas para mejorar, ordenado por importancia.
Solicitar la evaluación gratuita