Guía · Inspeccia
¿Deberías bloquear los bots de IA en tu robots.txt?
La pregunta suele llegar con un titular de fondo: "la IA se está robando el contenido de todos, ¿no debería cerrarle la puerta?". La respuesta corta es que sí puedes cerrarla, en dos líneas de robots.txt. La respuesta útil es que "la IA" no es una puerta sola. Detrás de esas siglas hay varios rastreadores distintos, con propósitos distintos, y la misma instrucción que protege tu contenido del entrenamiento puede dejarte invisible en la búsqueda con IA. Bloquear bien es un trabajo de bisturí, no de martillo.
Casi toda la cobertura del tema, sobre todo en español, te dice lo mismo: pega User-agent: GPTBot con Disallow: / y listo. Es un consejo que confunde dos cosas que no son lo mismo, y que a un negocio que quiere ser encontrado le puede salir caro. Vale la pena entender el mapa antes de tocar el archivo.
El error que sale caro: "bloquear la IA" son varias decisiones, no una
Cada empresa de IA seria no usa un bot, usa una familia de bots, y los separa a propósito. Hay, en general, tres roles:
- Entrenamiento. Recoge páginas que pueden terminar dentro del próximo modelo. Bloquearlo dice "no me uses para entrenar".
- Búsqueda. Indexa tu sitio para poder mostrarlo y citarlo cuando alguien hace una pregunta dentro del producto. Bloquearlo dice "no me cites en tus respuestas".
- Petición de usuario. Va a buscar una página concreta porque, en ese momento, una persona la pidió. No rastrea de forma automática.
La trampa es que mucha gente quiere lo primero —no aparecer en los datos de entrenamiento— y, al pegar un Disallow: / genérico, también activa lo segundo sin darse cuenta. Se sacan del entrenamiento y, de paso, se borran del único canal por el que querían aparecer. Es el equivalente a tapiar la vidriera para que nadie te copie el escaparate.
El mapa de bots, proveedor por proveedor
Estos son los user-agents que importan a mediados de 2026, según la documentación oficial de cada empresa. Los nombres son sensibles a mayúsculas y cada uno necesita su propia regla: bloquear ClaudeBot no bloquea Claude-SearchBot.
OpenAI (ChatGPT)
GPTBot— entrenamiento. OpenAI lo describe como el rastreador que recoge contenido que "puede usarse para entrenar nuestros modelos fundacionales de IA generativa". Bloquéalo si no quieres alimentar al modelo.OAI-SearchBot— búsqueda. Es el que "muestra sitios web en los resultados de las funciones de búsqueda de ChatGPT". Si quieres ser citable dentro de ChatGPT, este tiene que pasar.ChatGPT-User— petición de usuario. Actúa cuando alguien dentro de ChatGPT pide una página puntual; no rastrea de forma automática.
Anthropic (Claude)
ClaudeBot— entrenamiento. Recoge contenido web que "podría contribuir al entrenamiento" de los modelos de Anthropic.Claude-SearchBot— búsqueda. Navega la web "para mejorar la calidad de los resultados" que Claude le da a los usuarios. Bloquearlo reduce tu visibilidad ahí.Claude-User— petición de usuario. Accede a sitios cuando una persona le hace una pregunta concreta a Claude.
Perplexity
PerplexityBot— búsqueda, no entrenamiento. Su único objetivo, según Perplexity, es "mostrar y enlazar sitios en los resultados". No se usa para entrenar modelos. Bloquearlo te saca de Perplexity sin ningún beneficio de "no me entrenes", porque tampoco te entrenaba.Perplexity-User— petición de usuario. La propia Perplexity advierte que "por lo general ignora robots.txt", porque fue un usuario quien pidió esa página.
Google (Gemini y Vertex AI)
Aquí está el malentendido más extendido. Google-Extended no es un rastreador con identidad propia: es un token de control. Google lo deja claro por escrito en dos puntos que conviene memorizar:
- No afecta la inclusión en Google Search ni es una señal de ranking. Puedes bloquearlo sin perder posiciones orgánicas.
- Lo que controla es si tu contenido ayuda a mejorar Gemini y las APIs generativas de Vertex AI. El "grounding" con Vertex AI, por ejemplo, no usa páginas que hayan bloqueado
Google-Extended.
La consecuencia importante: tu presencia en Google Search —y, por extensión, en los AI Overviews, que se construyen sobre el índice normal— depende de Googlebot, no de Google-Extended. Bloquear el segundo es una decisión sobre el entrenamiento de la IA de Google, no sobre tu visibilidad. Son dos palancas separadas, y muchos las confunden en una sola.
Regla mental rápida: los bots con "Search" en el nombre (o que solo existen para citar, como PerplexityBot) son tu visibilidad. Los de entrenamiento (GPTBot, ClaudeBot, Google-Extended) son tus datos. Decide cada cosa por separado.
¿Quieres saber si la IA ya te cita hoy, antes de tocar nada? En Inspeccia cada análisis le pregunta a la IA por tu categoría y te muestra si te nombra y a quién nombra en tu lugar. Empieza un análisis gratis.
Entonces, ¿bloquear o permitir? Tres posturas honestas
No hay una respuesta única, hay tres, según qué tipo de sitio tengas y qué te importe más.
1. Quiero visibilidad: permitir casi todo
Es la postura por defecto para la mayoría de los negocios, blogs, SaaS y tiendas que viven de ser encontrados. Dejas pasar a todos los bots de búsqueda y, como mucho, bloqueas los de entrenamiento si te incomoda alimentarlos. El razonamiento es simple: el tráfico y las menciones que llegan desde respuestas de IA son el canal de descubrimiento que más crece, y un sitio público no gana casi nada protegiendo del entrenamiento un contenido que de todos modos quiere que la gente lea.
2. Quiero proteger mis datos sin desaparecer: el bisturí
La postura intermedia, y la que más sentido tiene para medios y creadores de contenido original. Bloqueas el entrenamiento, permites la búsqueda. Tu contenido no entra a los datasets, pero sigues siendo citable cuando la IA responde. Así se ve en robots.txt:
# Entrenamiento: fuera. Búsqueda con IA: dentro.
# OpenAI
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
# Anthropic
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
# Perplexity (no entrena: déjalo entrar para aparecer)
User-agent: PerplexityBot
Allow: /
# Google: Gemini/Vertex fuera, sin tocar tu ranking en Search
User-agent: Google-Extended
Disallow: /
Una aclaración para no engañarte: si tu archivo no tiene una regla global de Disallow: / para User-agent: *, esos Allow: / son redundantes —ya estaban permitidos por defecto—. Los dejamos explícitos a propósito: documentan tu intención y te cubren si más adelante alguien agrega un bloqueo general. La claridad vale más que el minimalismo en un archivo que tocas una vez al año.
3. Quiero cerrar todo: el portazo
Legítimo para contenido de pago, intranets, documentación confidencial o cualquier cosa que simplemente no debería estar en una respuesta de IA. Aquí sí, Disallow: / para cada bot. Solo que entonces no te quejes después de no aparecer: estás eligiendo, conscientemente, no estar. El error no es cerrar; el error es cerrar sin querer.
Lo que robots.txt no te garantiza
Antes de confiar tu estrategia a un archivo de texto, tres límites que conviene tener claros.
Es una señal, no una barrera. robots.txt funciona porque las empresas grandes deciden respetarlo. Los rastreadores de entrenamiento "éticos" lo cumplen; los user-agents disparados por una persona (ChatGPT-User, Perplexity-User) a menudo no, porque interpretan que un humano pidió esa página puntual. Y un scraper malintencionado lo ignora sin más. Si necesitas un bloqueo real, el sitio correcto es el firewall o el WAF, filtrando por user-agent y verificando contra los rangos de IP oficiales que cada empresa publica.
El default está cambiando. El 1 de julio de 2025, Cloudflare —por donde pasa cerca del 20% del tráfico web— empezó a bloquear rastreadores de IA por defecto en los dominios nuevos, y lanzó un mercado de "pago por rastreo". Si tu sitio está detrás de Cloudflare u otro proxy, puede que ya estés bloqueando bots de IA sin haberlo decidido en tu robots.txt. Vale la pena revisar el panel antes de asumir nada.
Permitir no es aparecer. Dejar pasar a OAI-SearchBot o a PerplexityBot es condición necesaria, no suficiente. Que te puedan rastrear no significa que te vayan a citar: para eso siguen pesando el contenido claro, la corroboración de otras fuentes y todo lo que trabajamos en el resto del cluster. robots.txt solo decide si te dejan entrar a la sala; lo que pasa adentro es otra historia.
Por dónde empezar
Haz dos cosas esta semana. Primero, abre tu robots.txt actual y busca si ya estás bloqueando algún bot de búsqueda sin haberlo decidido —es sorprendentemente común heredar un Disallow de una plantilla o de un plugin. Segundo, decide tu postura de las tres de arriba y déjala escrita, comentada, para que la próxima persona que toque el archivo entienda por qué está así.
Y antes de optimizar nada, mide el punto de partida: si la IA hoy no te menciona, el problema rara vez es robots.txt. Suele ser que no eres lo bastante citable todavía, y eso se arregla con contenido y reputación, no con un archivo de texto.
Preguntas frecuentes
¿Si bloqueo GPTBot desaparezco de ChatGPT?
No, y esta es la confusión más cara. GPTBot es el rastreador con el que OpenAI recoge contenido para entrenar sus modelos; OAI-SearchBot es uno distinto, el que rastrea tu sitio para mostrarlo en las funciones de búsqueda de ChatGPT. Bloquear GPTBot solo te saca del entrenamiento. Mientras dejes pasar a OAI-SearchBot, sigues siendo elegible para que ChatGPT te cite cuando alguien busca en tu categoría. El problema aparece cuando alguien escribe "Disallow: /" para todo y se lleva por delante también al bot de búsqueda.
¿Bloquear Google-Extended me baja en Google?
No. Google lo dice por escrito: Google-Extended no afecta la inclusión en Google Search ni es una señal de ranking. Lo único que controla es si tu contenido ayuda a mejorar Gemini y las APIs generativas de Vertex AI (incluido el "grounding" de Vertex, que no usa páginas que bloquean ese token). El rastreador de tu búsqueda y de los AI Overviews sigue siendo Googlebot, que es otro user-agent. O sea: puedes optar por salir del entrenamiento de IA de Google sin tocar tu posición orgánica.
¿Sirve de algo robots.txt si igual me pueden copiar?
robots.txt es una instrucción, no un muro. Las empresas de IA que se comportan —OpenAI, Anthropic, Google, Perplexity— declaran que respetan sus reglas para los rastreadores automáticos. Pero los user-agents que dispara una persona en tiempo real (ChatGPT-User, Perplexity-User) muchas veces ignoran robots.txt, con el argumento de que hubo un humano que pidió esa página concreta. Si necesitas un bloqueo de verdad y no una señal de buena fe, el lugar correcto es el firewall o el WAF, filtrando por user-agent y rango de IP oficial.
No quiero pensar bot por bot. ¿Qué hago por defecto?
Para la mayoría de los negocios que quieren ser encontrados, la postura por defecto más segura es permitir a los bots de búsqueda —OAI-SearchBot, PerplexityBot, Claude-SearchBot— y decidir aparte, con calma, si bloqueas los de entrenamiento (GPTBot, ClaudeBot, Google-Extended). Bloquear todo de un saque con "Disallow: /" es justo lo contrario de lo que quiere quien intenta aparecer en respuestas de IA: te ahorra un riesgo que un blog público no tiene y te cuesta el canal de descubrimiento que más rápido crece.
Fuentes citadas
- OpenAI — "Overview of OpenAI Crawlers" (GPTBot = entrenamiento; OAI-SearchBot = búsqueda en ChatGPT; ChatGPT-User = petición de usuario). Documentación oficial.
- Anthropic / Claude — "Does Anthropic crawl data from the web…" (ClaudeBot = entrenamiento; Claude-SearchBot = búsqueda; Claude-User = petición de usuario). Centro de ayuda.
- Perplexity — "PerplexityBot & Perplexity-User" (PerplexityBot = búsqueda, no entrena; Perplexity-User generalmente ignora robots.txt). Docs.
- Google Search Central — "Google-Extended" (no afecta inclusión ni ranking en Search; controla Gemini/Vertex AI; el grounding de Vertex AI no usa páginas que lo bloquean). Documentación oficial.
- Cloudflare — "Cloudflare Just Changed How AI Crawlers Scrape the Internet" (bloqueo por defecto en dominios nuevos desde el 1 de julio de 2025; Pay Per Crawl). Press release.
¿La IA ya te cita, o te dejaste afuera sin querer?
Antes de pelearte con robots.txt, mide el punto de partida. Cada análisis de Inspeccia le pregunta a la IA por las keywords comerciales de tu categoría y te muestra si te nombra, a quién nombra en tu lugar y qué tendrías que cambiar para entrar.