Guía · Inspeccia
Medimos el robots.txt de 1.567 sitios: el pánico por bloquear la IA está mal dirigido
Circula desde hace meses una advertencia con forma de emergencia: estás bloqueando a ChatGPT sin saberlo. Fuimos a medirla. Esta mañana pedimos el /robots.txt de los 1.838 dominios que Inspeccia auditó desde mayo; 1.567 devolvieron un archivo válido. De esos 1.567, exactamente nueve bloquean por completo a un bot que decide si puedes aparecer citado en una respuesta de IA. Nueve.
El riesgo del que habla el pánico es real. Lo que casi nadie separa es a qué bot le corresponde, y por esa confusión mucha gente revisa el archivo equivocado y se queda tranquila —o se asusta— por el motivo equivocado.
Entrenar y traer una página no son el mismo trabajo
OpenAI documenta tres rastreadores con nombres distintos y funciones distintas. GPTBot "se usa para rastrear contenido que puede emplearse para entrenar nuestros modelos fundacionales de IA generativa". OAI-SearchBot "se usa para mostrar sitios web en los resultados de búsqueda de las funciones de búsqueda de ChatGPT". ChatGPT-User visita una página cuando un usuario concreto lo pide en una conversación. Sobre el segundo, la documentación no deja margen: los sitios excluidos de OAI-SearchBot no se mostrarán en las respuestas de búsqueda de ChatGPT. Sobre GPTBot no hay ninguna frase equivalente.
Anthropic hizo la misma separación con más detalle todavía. ClaudeBot recoge contenido web que puede contribuir al entrenamiento, y bloquearlo "indica que los materiales futuros del sitio deben excluirse de nuestros conjuntos de datos de entrenamiento". Claude-SearchBot es otra cosa: "recorre la web para mejorar la calidad de los resultados de búsqueda", y deshabilitarlo "impide que nuestro sistema indexe tu contenido para la optimización de búsqueda, lo que puede reducir la visibilidad y la precisión de tu sitio en los resultados de búsqueda". Claude-User es el tercero, el que va a buscar una página porque alguien preguntó algo.
De ahí sale la única distinción que importa para esta discusión. Hay bots que entrenan —GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended, Amazonbot, Bytespider, Meta-ExternalAgent— y bots que recuperan páginas en el momento de contestar: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot. Los primeros deciden si tu texto entra en un modelo dentro de dos años. Los segundos deciden si apareces citado esta tarde.
Si lo que quieres es decidir cuál te conviene dejar entrar, esa discusión está entera en la guía sobre bloquear bots de IA en robots.txt. Lo que agrega este artículo es la otra mitad del asunto: qué hizo la gente de verdad con ese archivo, medido en 1.567 casos.
1.838 peticiones, 1.567 archivos, muy pocas decisiones
La metodología es simple y por eso es reproducible. Pedimos /robots.txt a cada dominio único de nuestra base de auditorías y parseamos los grupos de user-agent. Contamos "bloqueo total" cuando el grupo de un bot tiene un Disallow: / que ningún Allow: / contradice. Todo lo demás —una carpeta cerrada, una ruta de administración— cuenta como restricción parcial.
De los 1.838 dominios, 1.567 devolvieron un archivo válido, el 85,3 por ciento. Los 271 restantes se reparten en 139 respuestas 404, 27 respuestas 403, 39 dominios que no contestaron y 56 que devolvieron una página HTML haciéndose pasar por robots.txt: la página de error del CMS servida con estado 200. Ese detalle importa más de lo que parece y volverá a aparecer más abajo.
El primer resultado es el que reordena todo lo demás: sólo el 17,6 por ciento de los archivos (276) menciona siquiera a un bot de IA. Los otros 1.291 no tomaron ninguna decisión sobre esto. Heredaron el robots.txt que trajo el CMS y nadie lo volvió a abrir.
Sobre los que sí dicen algo, la asimetría es la noticia. El 8,2 por ciento de la base (128 sitios) bloquea por completo algún bot de entrenamiento. El 0,6 por ciento (9 sitios) bloquea por completo algún bot de recuperación. Catorce veces menos. Si ampliamos el criterio a cualquier restricción, total o parcial, sobre un bot de recuperación, llegamos al 2,3 por ciento: 36 sitios. Y 119 sitios —el 7,6 por ciento— bloquean sólo entrenamiento, que en términos de citación es inofensivo. El Disallow: / de asterisco que deja fuera a todo el mundo, incluido Googlebot, aparece en 7 sitios. El 0,4 por ciento.
Bot por bot
| Bot | Función | Lo nombran | Bloqueo total | Parcial |
|---|---|---|---|---|
| GPTBot | Entrena | 256 | 108 | 49 |
| ClaudeBot | Entrena | 231 | 100 | 43 |
| Google-Extended | Entrena | 227 | 103 | 45 |
| CCBot | Entrena | 205 | 116 | 39 |
| Applebot-Extended | Entrena | 175 | 96 | 39 |
| Bytespider | Entrena | 164 | 106 | 31 |
| Amazonbot | Entrena | 163 | 107 | 32 |
| Meta-ExternalAgent | Entrena | 162 | 99 | 35 |
| PerplexityBot | Recupera | 136 | 6 | 25 |
| ChatGPT-User | Recupera | 114 | 7 | 24 |
| OAI-SearchBot | Recupera | 94 | 3 | 22 |
| Claude-SearchBot | Recupera | 30 | 2 | 4 |
Base: 1.567 archivos robots.txt válidos, recogidos el 28 de julio de 2026. Las filas en color son los bots que deciden si puedes aparecer citado.
El 84 por ciento hizo lo correcto sin querer
Los dos cruces que siguen son, para nosotros, el hallazgo del ejercicio.
De los 108 sitios que bloquean GPTBot por completo, 91 —el 84 por ciento— no nombran a OAI-SearchBot en ninguna línea. Protegieron su contenido del entrenamiento y dejaron la puerta de la búsqueda abierta de par en par. Es exactamente la configuración que recomendaríamos a un medio o a una consultora que no quiere regalar su archivo, y llegaron ahí sin proponérselo: copiaron una plantilla que hablaba de GPTBot porque era el nombre que circulaba en 2024, y OAI-SearchBot ni existía cuando esa plantilla se escribió.
Con Anthropic el resultado es todavía más marcado y más frágil. De los 100 sitios que bloquean ClaudeBot, 96 no mencionan Claude-SearchBot. El 96 por ciento. Funciona por la misma razón —el bot de búsqueda es posterior a la plantilla— y se rompe con un solo cambio de criterio: basta con que alguien decida "bloqueemos todo lo que se llame Claude" y añada las tres líneas, y ese sitio pasa del grupo inofensivo al grupo que sí pierde citas. No hay ningún aviso cuando eso ocurre. Ni un error, ni una caída de tráfico atribuible, nada.
El orden de revisión que conviene: ¿mi robots.txt nombra a OAI-SearchBot, Claude-SearchBot o PerplexityBot? → si los nombra, ¿qué les dice? → ¿el CDN los deja pasar? → ¿algún plugin los está filtrando antes?
En Inspeccia comprobamos si la IA te nombra hoy cuando alguien pregunta por tu categoría, y con qué fuentes te describe. Empieza un análisis gratis.
Seis de treinta y cuatro, y por qué ese número no dice lo que parece
A principios de julio se hizo popular en un foro de marketing digital un recuento que hizo un lector por su cuenta: revisó 34 sitios de clientes y encontró que 6 "bloqueaban ChatGPT por completo". El hilo se citó bastante y el pánico que describe al principio de este artículo se alimenta en buena parte de recuentos así.
El trabajo está bien hecho y el porcentaje probablemente sea correcto. El problema está en la etiqueta. "Bloquear ChatGPT" no es una operación única, porque ChatGPT no llega por un solo bot. Nuestra base dice que cuando alguien bloquea algo con la palabra ChatGPT cerca, en la enorme mayoría de los casos es GPTBot: 108 bloqueos totales contra 3 de OAI-SearchBot. Si esa proporción se sostiene, de esos 6 sitios lo más probable es que cinco o seis estén perfectamente bien para aparecer citados y sólo hayan renunciado a alimentar el entrenamiento.
La corrección no vuelve inútil el hallazgo, lo hace utilizable. Un cliente al que le dices "estás bloqueando a ChatGPT" entra en pánico y borra su robots.txt entero, incluidas las reglas que sí tenían sentido. Un cliente al que le dices "bloqueaste el bot de entrenamiento, que era una decisión defendible, y por suerte no tocaste el de búsqueda" puede decidir con criterio.
llms.txt: nuestro 41 por ciento y la advertencia que lo acompaña
Ya que pedíamos archivos, pedimos también /llms.txt. Devolvieron estado 200 nada menos que 776 dominios, un 42 por ciento largo de los que respondieron. Antes de publicar ese número verificamos a mano una muestra aleatoria de 120: el 83,3 por ciento eran archivos reales y el resto eran páginas HTML de error servidas con estado 200, el mismo fenómeno de los 56 falsos robots.txt. El número honesto queda en torno al 41 por ciento de la base.
Es mucho más que el 28 por ciento que midió Ahrefs sobre 137.210 dominios, y la explicación no es que nuestra muestra sea mejor. Es que está sesgada, y en una dirección obvia: son negocios que ya se preocuparon lo suficiente por su visibilidad en IA como para pedir una auditoría. Un negocio que nunca pensó en esto no está en nuestra base. Ahrefs, por cierto, hace la misma advertencia sobre la suya, porque sus clientes también son más técnicos que la media de la web.
El dato que conviene poner al lado, del mismo estudio: de los aproximadamente 38.000 dominios con un llms.txt válido, el 97 por ciento no recibió ni una sola petición del archivo en mayo de 2026. De las peticiones que sí llegaron, el 96 por ciento eran bots, y el bloque más grande —en torno al 21 por ciento— eran herramientas de auditoría SEO comprobando si el archivo existe. Un archivo que se publica mucho y se lee muy poco. Lo desarrollamos con más números en qué es llms.txt y si de verdad sirve.
Las tres puertas que sí se cierran, y ninguna está en tu robots.txt
Si el 99,4 por ciento de los sitios tiene el robots.txt en orden respecto a los bots que traen citas, la pregunta interesante es dónde se pierde el resto de la gente. En nuestra experiencia auditando, en tres sitios.
El archivo que escribió el CMS
Es el caso de 1.291 de los 1.567 sitios que medimos: nadie tocó ese archivo nunca. Normalmente da igual, porque el silencio equivale a permitir. Pero hay excepciones caras. Un WordPress en modo mantenimiento, una tienda que salió de un entorno de staging con el Disallow: / puesto, un plugin de SEO con una casilla de "bloquear bots de IA" activada por defecto en su versión de pago. Los 7 sitios de nuestra base con bloqueo universal no lo eligieron: se lo dejaron puesto.
El plugin de seguridad que filtra por reputación
Esta es la más difícil de detectar porque no deja rastro en ningún archivo. Un firewall de aplicación o un plugin de seguridad puede devolver un 403 a cualquier user-agent que no reconozca, y los bots de recuperación son nuevos: aparecieron en las listas de reputación mucho después que Googlebot. El robots.txt dice "adelante" y el servidor contesta "prohibido". Sólo se ve mirando los logs de acceso, filtrando por el nombre del bot.
El CDN, que decide por ti
Aquí está el cambio estructural que más gente ignora. Desde el 1 de julio de 2025, Cloudflare pregunta a cada dominio nuevo, al darse de alta, si quiere permitir rastreadores de IA. En sus propias palabras, "cada dominio nuevo arranca con el control por defecto, y elimina la necesidad de que los dueños de páginas configuren manualmente sus ajustes para excluirse". Si registraste el dominio después de esa fecha y esa pantalla pasó rápido, la decisión ya está tomada y no la tomaste tú.
Encima de eso hay una segunda condición de OpenAI que casi nunca se cita. Su documentación no pide sólo permitir OAI-SearchBot en robots.txt: pide además permitir las peticiones desde sus rangos de IP publicados, que mantiene en un archivo JSON abierto para que cualquiera lo cargue en su firewall. Un robots.txt perfecto no sirve de nada si la petición nunca llega a leerlo. Es la misma trampa que describimos para los negocios locales, donde el sitio suele estar en manos de alguien que no administra el servidor.
Matriz allow/block a julio de 2026
Toda tabla de este tipo caduca. Esta refleja lo que la documentación de cada empresa dice hoy, 28 de julio de 2026, y conviene volver a mirarla cada seis meses, porque los nombres de los bots cambian más rápido que las plantillas que los copian.
| Bot | Qué hace | Decisión por defecto | Cuándo cambiarla |
|---|---|---|---|
| OAI-SearchBot | Expone tu sitio en la búsqueda de ChatGPT | Permitir | Sólo si no quieres aparecer en ChatGPT. Bloquearlo te saca, y está documentado. |
| ChatGPT-User | Visita una página porque un usuario lo pidió | Permitir | Prácticamente nunca. Es tráfico con intención detrás. |
| Claude-SearchBot | Indexa contenido para los resultados de Claude | Permitir | Igual que OAI-SearchBot. Ojo con las plantillas que agrupan todo lo que empiece por Claude. |
| Claude-User | Recupera páginas a petición de un usuario | Permitir | Anthropic avisa que bloquearlo reduce tu visibilidad en búsqueda dirigida por el usuario. |
| PerplexityBot | Rastrea para el índice de Perplexity | Permitir | Sólo si Perplexity no te interesa como canal. |
| Googlebot | Búsqueda de Google, incluidas sus superficies con IA | Permitir | Nunca. Bloquearlo te saca de Google entero. |
| GPTBot | Entrena los modelos de OpenAI | Tu decisión | Bloquéalo si no quieres ceder tu archivo. No te cuesta citaciones. |
| ClaudeBot | Entrena los modelos de Anthropic | Tu decisión | Mismo criterio. Es un bot distinto de Claude-SearchBot. |
| Google-Extended | Entrenamiento de Gemini y Vertex | Tu decisión | Bloquearlo no afecta a tu posición en la Búsqueda de Google. |
| CCBot | Common Crawl, dataset público | Tu decisión | Alimenta datasets de terceros y también investigación académica. Bloquearlo cierra las dos cosas. |
| Applebot-Extended | Entrenamiento de Apple | Tu decisión | Applebot a secas sirve a Siri y Spotlight. El sufijo cambia el significado. |
| Meta-ExternalAgent · Amazonbot · Bytespider | Entrenamiento y usos internos de cada empresa | Tu decisión | Los tres son los que más rechazo generan por volumen de peticiones. |
Qué revisar esta semana
Cuatro comprobaciones, en orden de esfuerzo. Todas las puedes hacer tú.
- Abre tu
robots.txten el navegador. Si te sale la página de diseño de tu web en lugar de texto plano, tienes el problema de los 56: tu CMS devuelve HTML con estado 200 y un rastreador no sabe qué hacer con eso. - Busca cuatro nombres:
OAI-SearchBot,Claude-SearchBot,Claude-UseryPerplexityBot. Si no aparecen, estás permitiendo, que es lo que quieres. Si aparecen con unDisallow: /debajo, ahí está tu problema y se arregla en dos minutos. - Entra en el panel de tu CDN. Busca la sección de rastreadores o bots de IA y mira qué está permitido. Esta configuración no se refleja en tu
robots.txty manda más que él. - Pide los logs de acceso de los últimos treinta días y filtra por los nombres de los bots. Si no aparece ninguna visita de OAI-SearchBot ni de Claude-SearchBot en un mes, algo los está frenando antes del archivo. La estructura que ayuda a que esa visita valga la pena está en la guía de AISO técnico.
Lo que la medición no prueba
Conviene ser preciso con lo que estos números soportan. Miden configuración, no consecuencias: sabemos qué dice cada archivo, no cuántas citas ganó o perdió cada sitio por eso. La base tampoco es una muestra de la web, es una muestra de quien pide auditorías de visibilidad en IA, con el sesgo que eso implica. Y un robots.txt es una foto: el 84 por ciento que hoy hace lo correcto por accidente lo hace porque copió una plantilla vieja, y la próxima plantilla que se ponga de moda puede invertir el resultado sin que nadie lo note.
Con esas reservas, la conclusión aguanta. La probabilidad de que estés bloqueando la vía de citación es del 0,6 por ciento y la de que el problema esté en tu CDN, en tu firewall o en un archivo que devuelve HTML es mucho mayor. Revisa esos tres antes de tocar el robots.txt.
Preguntas frecuentes
¿Bloquear GPTBot me saca de las respuestas de ChatGPT?
No, y esa es la confusión que más veces encontramos. OpenAI documenta dos rastreadores distintos: GPTBot recoge contenido que puede usarse para entrenar sus modelos, y OAI-SearchBot es el que expone sitios en los resultados de búsqueda de ChatGPT. Sobre el segundo la documentación es tajante: los sitios que se excluyen de OAI-SearchBot no se mostrarán en las respuestas de búsqueda de ChatGPT. Sobre el primero no dice nada parecido. Si tu robots.txt bloquea GPTBot y no menciona a OAI-SearchBot, tu contenido sigue siendo elegible para aparecer citado. Es exactamente la situación de 91 de los 108 sitios que bloquean GPTBot en nuestra base.
¿Cómo sé si mi robots.txt lo escribí yo o lo trajo el CMS?
Ábrelo y busca dos señales. La primera es la ausencia de cualquier nombre de bot de IA: si el archivo sólo tiene un grupo con asterisco y un par de rutas de administración, es el que vino de fábrica. La segunda es la fecha: pregunta a quien lleve el sitio cuándo se tocó por última vez. En nuestra medición, el 82,4 por ciento de los archivos no nombra ni un solo bot de IA, lo que en la práctica significa que nadie tomó una decisión. Eso no es malo por sí mismo, porque el silencio equivale a permitir. Pero conviene saber que estás en esa situación por omisión y no por criterio.
Si dejo entrar a OAI-SearchBot, ¿ya está?
Es la mitad. La documentación de OpenAI pide dos cosas: permitir OAI-SearchBot en tu robots.txt y permitir las peticiones desde sus rangos de IP publicados, que mantiene en un archivo JSON abierto. La segunda condición casi nunca se cita y es donde caen los sitios pequeños, porque la bloquea algo que el dueño no administra: un plugin de seguridad que filtra por reputación, un firewall de aplicación con reglas agresivas o la configuración de bots de IA del CDN. Un robots.txt impecable no sirve de nada si la petición nunca llega a leerlo.
¿Bloquear los bots de entrenamiento tiene algún coste de visibilidad?
Ninguno documentado en la vía de citación, y ese es el punto útil de esta medición. Ni OpenAI ni Anthropic afirman que excluirse del entrenamiento reduzca tus posibilidades de aparecer en respuestas con búsqueda activa. Lo honesto es decir también lo que no se sabe: nadie publica cuánto de lo que un modelo responde sin buscar viene de su memoria de entrenamiento, así que no se puede afirmar que el coste sea matemáticamente cero a largo plazo. Lo que sí se puede afirmar es que la vía por la que hoy se generan citas con enlace no depende de esos bots.
Uso Cloudflare. ¿Tengo que revisar algo?
Sí, y es rápido. Desde el 1 de julio de 2025 Cloudflare pregunta a cada dominio nuevo, al darse de alta, si quiere permitir rastreadores de IA, y en sus propias palabras cada dominio nuevo arranca con el control por defecto, sin que el dueño tenga que configurar nada para quedar fuera. Si registraste el dominio después de esa fecha y nadie miró esa pantalla, la decisión se tomó sola. Entra en el panel, busca la configuración de rastreadores de IA y comprueba qué categorías están permitidas. No aparece nada de esto en tu robots.txt.
Fuentes citadas
- Inspeccia — crawl propio de
/robots.txty/llms.txtsobre los 1.838 dominios únicos auditados, ejecutado el 28 de julio de 2026. 1.567 archivos válidos. Verificación manual de una muestra aleatoria de 120llms.txt. - OpenAI Developers — "Overview of OpenAI Crawlers": OAI-SearchBot expone sitios en las funciones de búsqueda de ChatGPT y los sitios excluidos no se muestran en esas respuestas; GPTBot rastrea contenido que puede usarse para entrenar; ChatGPT-User actúa a petición del usuario; recomendación de permitir además las peticiones desde los rangos de IP publicados. Documentación.
- Anthropic — "Does Anthropic crawl data from the web, and how can site owners block the crawler?": ClaudeBot recoge contenido para entrenamiento; Claude-SearchBot indexa contenido para mejorar los resultados de búsqueda y bloquearlo puede reducir la visibilidad del sitio; Claude-User recupera páginas a petición de un usuario. Centro de ayuda.
- Cloudflare — nota de prensa del 1 de julio de 2025: a cada dominio nuevo se le pregunta al darse de alta si quiere permitir rastreadores de IA, y cada dominio nuevo arranca con el control por defecto. Comunicado.
- Ahrefs — "We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read", junio de 2026: 137.210 dominios, 28 % publica el archivo, 97 % de esos no recibió ninguna petición en mayo de 2026, 96 % de las peticiones venían de bots y las herramientas de auditoría SEO fueron el bloque mayor. Estudio.
¿La IA puede leerte, y te nombra?
Comprobamos si tu sitio aparece cuando alguien pregunta por tu categoría, qué fuentes cita la IA para describirte y qué está frenando a los rastreadores antes de llegar a tu contenido.