En resumen
Los asistentes de IA solo mencionan negocios cuyas páginas pueden leer, y muchas plantillas web bloquean a los rastreadores de OpenAI en el archivo robots.txt sin que el dueño se entere. Aquí aprendes cómo decide ChatGPT a quién citar, qué revisar paso a paso en tu sitio y qué atajos de moda no sirven para nada.
Un cliente potencial abre ChatGPT y escribe: “recomiéndame una agencia de contabilidad en Bogotá que trabaje con pymes”. El asistente responde con tres o cuatro nombres y sus enlaces. El tuyo no está. No es mala suerte, no es que haya que pagar para salir ahí y tampoco es que la IA prefiera a las empresas grandes. En una cantidad sorprendente de casos el motivo es mucho más aburrido: tu propia página web le está diciendo a esos sistemas que no entren.
Esa instrucción vive en un archivo de texto plano que casi nadie abre. Se llama robots.txt y suele venir preconfigurado por la plantilla, el hosting o la persona que te armó el sitio. Nadie te avisó, simplemente quedó así. Mientras tanto, tu competencia, que a veces tiene una web más fea pero abierta, es la que termina citada en la respuesta.
Esta guía es para que revises tu caso hoy mismo. Vas a entender cómo decide un asistente a quién nombrar, dónde mirar exactamente, qué corregir y qué atajos de moda no te van a servir de nada.
Cómo decide un asistente a quién mencionar
La primera confusión que hay que romper es esta: ChatGPT no “recuerda” tu negocio de memoria. Cuando alguien pide una recomendación local, el asistente busca en la web en ese momento y arma la respuesta con lo que encuentra. Si tu sitio no está en ese índice o no se puede leer, no existes para esa conversación.
OpenAI no usa un solo rastreador, usa tres, y cada uno hace algo distinto. Según su documentación oficial para desarrolladores:
- GPTBot: recorre la web para recolectar contenido que puede usarse en el entrenamiento de los modelos. Bloquearlo no te saca de las respuestas.
- OAI-SearchBot: es el que construye y mantiene el índice de búsqueda de ChatGPT. Este es el que te hace aparecer como fuente citada. Si lo bloqueas, te borras del mapa.
- ChatGPT-User: entra a una página en vivo cuando un usuario hace una pregunta que requiere consultarla en ese instante.
Son tokens independientes en robots.txt. Puedes permitir uno y negar otro. Mucha gente que quiso “proteger su contenido del entrenamiento de IA” terminó bloqueando los tres de un solo golpe, que es justo lo contrario de lo que quería.
Del lado de Google pasa algo parecido pero al revés. Google confirma en su documentación que no existe un rastreador especial para AI Overviews ni para AI Mode: esas funciones toman contenido del índice normal de Búsqueda. En sus propias palabras, no hay requisitos adicionales ni optimizaciones especiales para aparecer ahí. Lo único que importa es que la página esté indexada y sea elegible para mostrarse con un fragmento. El token Google-Extended solo regula el uso de tu contenido para entrenar Gemini y no afecta tu posicionamiento.
El archivo que puede estar dejándote por fuera
El robots.txt es un archivo de texto que vive siempre en la raíz de tu dominio. Escribe tudominio.com/robots.txt en el navegador y lo vas a ver. No necesitas ninguna herramienta.
Su sintaxis es mínima. Declara a quién le habla y qué le prohíbe:
User-agent: OAI-SearchBot
Disallow: /
Esas dos líneas le dicen al buscador de ChatGPT que no lea nada de tu sitio. Una barra sola significa “todo”. Y esta versión es todavía peor, porque aplica a cualquier rastreador que pase por ahí:
User-agent: *
Disallow: /
Es un archivo que nadie mira porque nadie tiene razones para mirarlo. No sale en tu panel, no genera alertas y tu página se ve perfecta igual. Puede llevar dos años puesto sin que te enteres.
Por qué tu plantilla lo bloquea sin que lo sepas
Hay cuatro caminos por los que un negocio pequeño termina con la puerta cerrada, y ninguno implica que alguien lo haya hecho con mala intención.
La casilla del constructor de sitios. Squarespace tiene una opción en Configuración, sección Rastreadores, para pedir que los modelos de IA excluyan tu sitio. Viene desmarcada por defecto, precisamente para no afectar tu tráfico, pero es una casilla que suena responsable y mucha gente la marca sin medir la consecuencia. Wix tiene un editor de robots.txt dentro de su panel de SEO y una función específica para bloquear rastreadores de IA. En WordPress el clásico es otro: la casilla “Disuadir a los motores de búsqueda de indexar este sitio” en Ajustes, Lectura, que genera un bloqueo total.
El sitio de pruebas que se volvió el sitio real. Este es el más común de todos. Durante el desarrollo se bloquea todo para que nadie indexe una web a medio hacer. Al lanzar, alguien tiene que quitar ese bloqueo. Si nadie lo hace, tu página vive en producción con el candado de staging puesto.
La capa de seguridad. En julio de 2025 Cloudflare se convirtió en el primer proveedor grande de infraestructura en bloquear rastreadores de IA por defecto, y a cada dominio nuevo le pregunta de entrada si quiere permitirlos. Es una decisión legítima de la industria, pero si tu hosting usa Cloudflare y alguien contestó rápido sin pensar, quedaste fuera. Ojo también con reglas de firewall que devuelven errores a los bots aunque el robots.txt esté impecable.
El plugin bienintencionado. Existen decenas de plugins de “protección contra IA” que se instalan en dos clics y bloquean listas enteras de rastreadores, incluyendo los de búsqueda.
La revisión paso a paso, en veinte minutos
- Abre tudominio.com/robots.txt. Si no existe el archivo, buena noticia: no hay bloqueo. Si existe, léelo completo.
- Busca las palabras OAI-SearchBot, ChatGPT-User, PerplexityBot y Claude-SearchBot. Si alguna aparece seguida de Disallow con una barra, estás bloqueando buscadores de IA.
- Busca User-agent: * seguido de Disallow: /. Ese es el bloqueo total y hay que quitarlo ya.
- Revisa la casilla de tu plataforma: Configuración, Rastreadores en Squarespace; SEO y el editor de robots.txt en Wix; Ajustes, Lectura en WordPress.
- Entra a tu panel de Cloudflare, si lo usas, y revisa la configuración de bots de IA.
- Verifica en Google Search Console que tus páginas clave estén indexadas. Si Google no puede leerlas, AI Overviews tampoco.
- Abre tu página de servicios con el JavaScript desactivado. Si el texto desaparece, los rastreadores tampoco lo ven.
Un detalle importante: OpenAI aclara que las reglas de robots.txt pueden no aplicar a ChatGPT-User, porque esas visitas las inicia una persona, no un rastreador automático. Aún así, dejar el archivo limpio es lo que te da control sobre los otros dos.
Lo que no te va a salvar
Si has leído sobre este tema, seguro te cruzaste con llms.txt, un archivo que supuestamente le explica tu sitio a los modelos de IA. Los datos no lo respaldan. Un estudio de Ahrefs sobre 137.210 dominios publicado en mayo de 2026 encontró que el 97% de esos archivos no recibe tráfico de ninguna fuente, y que los bots de recuperación de IA apenas representan el 1,1% de las solicitudes. El hallazgo más revelador: ningún bot de IA pidió un llms.txt en sitios donde no existía. Nunca lo van a buscar.
Google fue igual de directo. Su guía sobre funciones generativas incluye una sección de desmentidos donde dice, textualmente, que no necesitas crear archivos legibles por máquina, archivos de texto para IA ni marcado especial para aparecer en esas funciones. Gastar tiempo ahí es gastarlo en el lugar equivocado.
Lo que sí mueve la aguja
Abrir la puerta es el requisito, no el objetivo. Una vez que los rastreadores pueden entrar, lo que decide si te mencionan es qué tan fácil es entender lo que haces.
- Decir lo obvio en texto plano. Qué vendes, a quién, en qué ciudad, en qué rango de precio. Suena básico, pero muchísimas páginas de negocios pequeños dicen “transformamos ideas en experiencias” y en ninguna parte dicen “hacemos contabilidad para restaurantes en Bogotá”.
- Datos concretos y verificables. Horarios, dirección, teléfono, tiempos de respuesta, casos con números. Un asistente que recomienda necesita algo que citar.
- Tu ficha de Google Business Profile actualizada. Google la menciona explícitamente entre las buenas prácticas para aparecer en sus funciones de IA, y para negocios locales pesa muchísimo.
- Menciones fuera de tu sitio. Directorios del sector, prensa local, reseñas reales. Los asistentes cruzan fuentes antes de recomendar.
- Contenido que responda preguntas. Cada duda real de tu cliente respondida en tu web es una oportunidad de ser la fuente citada.
Por qué en Le Grand revisamos tu página antes de hablar de contenido
En Le Grand hacemos y revisamos páginas web para negocios colombianos que están arrancando, y la primera revisión que hacemos no es de diseño: es si los asistentes de inteligencia artificial pueden leer el sitio.
Casi siempre aparece el mismo hallazgo. La plantilla con la que se montó la página trae bloqueados a los rastreadores en su archivo robots.txt, y el dueño no lo sabe porque la página se ve perfecta en el navegador. Para ChatGPT, Gemini o Perplexity, ese negocio no existe.
Por eso esa revisión es parte del servicio y no un extra que se cobra aparte. Arreglar el bloqueo toma minutos; lo que cuesta es saber que está ahí. Después viene lo demás: que cada página responda una pregunta, que la respuesta esté en el primer párrafo y que los datos tengan su fuente al lado.
Y una advertencia que damos desde el principio: nadie puede garantizar que un asistente mencione tu negocio. El modelo escoge en cada respuesta y cambia de una a otra. Lo que sí se puede es dejar de estar bloqueado, publicar respuestas de verdad y medir si apareces. Eso es trabajo sostenido, no un botón.
Dónde profundizar
- Overview of OpenAI Crawlers: la documentación oficial de OpenAI con los tokens exactos de GPTBot, OAI-SearchBot y ChatGPT-User, y los rangos de IP para verificar que un bot es legítimo.
- Google Search Central: AI features and your website: la guía oficial de Google sobre qué se necesita para aparecer en AI Overviews y AI Mode, con la sección de desmentidos incluida.
- Google Search Console: gratis, te muestra si tus páginas están indexadas, si hay bloqueos por robots.txt y qué ve Google al entrar. Es la herramienta con la que empieza cualquier diagnóstico serio.
Hablemos de tu caso
Si acabas de abrir tu robots.txt y no entendiste nada de lo que dice, o si lo abriste y encontraste un Disallow ahí parado, es exactamente el tipo de cosa que pasa cuando tienes un negocio que atender y la página web es una tarea más de la lista. No es descuido tuyo. Es que nadie te dijo que había que revisarlo.
En Le Grand hacemos y revisamos páginas web para negocios que están arrancando, y esta verificación va incluida desde el primer día. No la cobramos aparte porque no tiene sentido entregarte un sitio bonito que los buscadores y los asistentes no pueden leer. Sería como imprimir un aviso y dejarlo dentro de una caja. Revisamos robots.txt, indexación, capa de seguridad, estructura del contenido y ficha de negocio, y te entregamos el diagnóstico en lenguaje claro.
Escríbenos y cuéntanos cuál es tu dominio. Le echamos un vistazo y te decimos qué encontramos, tengas o no una página con nosotros.
Preguntas frecuentes
¿Cómo hago para que ChatGPT recomiende mi negocio?
Primero asegúrate de que tu robots.txt no bloquee a OAI-SearchBot, que es el rastreador que alimenta el buscador de ChatGPT. Después, publica en texto plano qué vendes, a quién y en qué ciudad, mantén tu ficha de Google Business Profile actualizada y consigue menciones en directorios y prensa local. No hay forma de pagar por aparecer en esas recomendaciones.
¿Bloquear GPTBot me saca de las respuestas de ChatGPT?
No. Según la documentación de OpenAI, GPTBot recolecta contenido para el entrenamiento de los modelos, mientras que OAI-SearchBot es el que construye el índice de búsqueda de ChatGPT. Son tokens independientes en robots.txt. Puedes bloquear GPTBot y seguir apareciendo como fuente citada si dejas pasar a OAI-SearchBot.
¿Necesito un archivo llms.txt en mi página web?
No. Un estudio de Ahrefs sobre 137.210 dominios publicado en mayo de 2026 encontró que el 97% de esos archivos no recibe tráfico y que los bots de IA no los buscan si no existen. Google además dice explícitamente en su documentación que no hace falta crear archivos legibles por máquina para aparecer en sus funciones generativas.
¿Dónde encuentro el robots.txt de mi sitio?
Escribe tudominio.com/robots.txt en cualquier navegador. Siempre vive en la raíz del dominio y es un archivo de texto plano que puedes leer sin herramientas. Si no aparece nada, significa que tu sitio no tiene bloqueos declarados.
¿Cómo aparezco en las AI Overviews de Google?
Google confirma que no existe un rastreador ni una optimización especial para AI Overviews: esas respuestas se arman con el índice normal de Búsqueda. Basta con que tu página esté indexada por Googlebot y sea elegible para mostrarse con un fragmento. Bloquear Google-Extended solo afecta el entrenamiento de Gemini, no tu posicionamiento.
¿Mi hosting puede estar bloqueando a los rastreadores de IA sin avisarme?
Sí. En julio de 2025 Cloudflare empezó a bloquear rastreadores de IA por defecto y a preguntarle a cada dominio nuevo si quiere permitirlos. Si tu sitio pasa por Cloudflare, revisa esa configuración aunque tu robots.txt esté limpio, porque el bloqueo puede estar en la capa de seguridad.
Fuentes
- Overview of OpenAI Crawlers (documentación oficial)
- Google Search Central: AI features and your website
- Cloudflare Just Changed How AI Crawlers Scrape the Internet-at-Large
- Ahrefs: We Analyzed 137K Sites, 97% of llms.txt Files Never Get Read
- Squarespace Help Center: Request that AI models exclude your site
- Wix Help Center: Blocking AI Crawlers from Your Site