Comprobador de acceso de bots de IA
Comprueba si GPTBot, ClaudeBot, PerplexityBot y el resto de bots de IA pueden acceder a tu web — cruzando lo que declara tu robots.txt con lo que responde tu servidor de verdad. Gratis, sin cuenta.
Leyendo robots.txt…
// Qué son
¿Qué son estos bots y por qué importan?
No todos los bots de IA hacen lo mismo, y esa diferencia importa a la hora de decidir a cuáles dejar entrar. Esta herramienta los agrupa en dos familias:
🎓 Bots de entrenamiento
Recopilan contenido para alimentar el modelo. Si tu web aparece ahí, no hay atribución directa ni tráfico de vuelta — tu contenido pasa a formar parte del conocimiento general del modelo, sin más.
🔎 Bots de búsqueda / respuesta
Se usan para responder a una pregunta concreta en tiempo real, y son los que pueden citarte con un enlace dentro de una respuesta de ChatGPT o Perplexity. Bloquear estos también bloquea la posibilidad de que te mencionen.
Permitir unos y bloquear otros es una decisión legítima que depende de tu estrategia, no hay una respuesta "correcta" universal. Un medio de noticias puede querer bloquear el entrenamiento pero permitir la búsqueda; una web con contenido muy específico puede preferir bloquear ambos.
// La capa que casi nadie revisa
¿Por qué robots.txt no es toda la historia?
robots.txt es una preferencia declarada: le pide educadamente a un bot que no entre a cierta ruta, y depende de que el bot decida respetarlo (los bots serios de OpenAI, Anthropic o Perplexity lo hacen). Pero es solo eso, una petición — no es una barrera técnica.
Herramientas como el WAF / Bot Management de Cloudflare operan en una capa completamente distinta: el edge de red. Ahí se decide, petición a petición, si se deja pasar o se bloquea una conexión — y esa decisión tiene prioridad sobre lo que diga tu robots.txt, y ocurre sin que el dueño de la web lo sepa necesariamente. Un bot puede estar "permitido" en tu robots.txt y aun así recibir un 403 en el edge, o al revés.
Por eso esta herramienta comprueba las dos capas por separado y las cruza: si coinciden, todo bien. Si no coinciden, es la señal más importante de la auditoría — probablemente tienes una configuración de bot management que no sabías que estaba bloqueando a alguien que sí querías dejar pasar (o viceversa).
// El caso más habitual
Cómo revisar y ajustar esto en Cloudflare
Si tu web está detrás de Cloudflare (el caso más habitual entre nuestros clientes), la capa real de bloqueo se controla en Security → Bots del panel de Cloudflare. Ahí encontrarás:
AI Crawl Control
Un panel dedicado donde ves, bot a bot, si Cloudflare está dejando pasar o bloqueando a cada uno — con datos reales de tu tráfico, no solo una casilla genérica.
El toggle "Block AI Bots"
Un interruptor general que, si está activado, bloquea de golpe a todos los bots de entrenamiento conocidos a nivel de red — independientemente de tu robots.txt. Es la causa más común de la discrepancia ⚠️ que puede mostrar esta herramienta.
El robots.txt gestionado
Cloudflare puede generar y servir un robots.txt "gestionado" que refleja las reglas que configures en el panel, en vez de (o combinado con) el archivo que tú mismo subes.
Ajusta bot a bot
Desde ahí puedes decidir con precisión: bloquear entrenamiento, permitir búsqueda/respuesta, o al revés — según la estrategia que hayas decidido para tu web.
¿Y si además de acceder, quieres saber si te citan?
Que un bot pueda entrar es el primer paso. El siguiente es más interesante: si ChatGPT, Perplexity o Gemini realmente te mencionan y citan cuando alguien pregunta sobre tu sector. Es lo que estamos preparando como próxima herramienta — mientras tanto, hablamos de tu estrategia GEO.
// PREGUNTAS FRECUENTES
Preguntas frecuentes sobre el acceso de bots de IA
// Qué mide
¿Qué comprueba exactamente esta herramienta?
Cruza dos cosas: lo que dice tu robots.txt sobre cada bot de IA y la respuesta real de tu servidor a una petición con ese user-agent. A veces coinciden y a veces no — un firewall o un CDN pueden bloquear aunque el robots.txt permita.
// Bots
¿Qué bots se comprueban?
GPTBot, ClaudeBot y PerplexityBot entre otros. Conviene distinguir los bots de entrenamiento de los de búsqueda en tiempo real: bloquear GPTBot no impide aparecer en ChatGPT, pero bloquear OAI-SearchBot o ChatGPT-User sí impide ser citado.
// Bloqueo
¿Qué hago si un bot está bloqueado?
Si el bloqueo viene del robots.txt, se corrige añadiendo una regla Allow para ese user-agent. Si viene del servidor, hay que revisar la configuración del firewall o del CDN, porque el robots.txt no lo refleja.
// Cómo se usa
Cómo comprobar si los bots de IA pueden acceder a tu web
Comprueba en dos capas si GPTBot, ClaudeBot o PerplexityBot pueden leer tu web: lo que declara tu robots.txt y lo que responde de verdad tu servidor.
-
01
Introduce tu dominio
Escribe la URL de tu web en el comprobador. No hace falta registro.
-
02
Lee las dos columnas
Una indica lo que permite tu robots.txt; la otra, si una petición real con ese User-Agent obtiene respuesta.
-
03
Busca la discrepancia
Si robots.txt permite pero la petición real falla, el bloqueo está en tu servidor, CDN o firewall, y el robots.txt no lo refleja.
// Siguiente paso
Generador de llms.txt
Ya sabes que los bots pueden entrar. El siguiente paso es darles un índice de qué leer y en qué orden.
// Quién la ha hecho
La construyó Pablo Olóndriz, consultor SEO y GEO, para no depender de herramientas que piden registro para responder algo que se resuelve en diez segundos.
No guarda nada. La comprobación se hace en el momento y el resultado se descarta al cerrar la página.