SEO activo · GEO / IA creciendo · n8n nuevo · Anuncios de pago evitable · Tráfico orgánico sostenible · SEO Local imprescindible ·
SEO activo · GEO / IA creciendo · n8n nuevo · Anuncios de pago evitable · Tráfico orgánico sostenible · SEO Local imprescindible ·

Comprobador de acceso de bots de IA

Comprueba si GPTBot, ClaudeBot, PerplexityBot y el resto de bots de IA pueden acceder a tu web — cruzando lo que declara tu robots.txt con lo que responde tu servidor de verdad. Gratis, sin cuenta.

// Qué son

¿Qué son estos bots y por qué importan?

No todos los bots de IA hacen lo mismo, y esa diferencia importa a la hora de decidir a cuáles dejar entrar. Esta herramienta los agrupa en dos familias:

🎓 Bots de entrenamiento

GPTBot ClaudeBot CCBot Bytespider Google-Extended Meta-ExternalAgent

Recopilan contenido para alimentar el modelo. Si tu web aparece ahí, no hay atribución directa ni tráfico de vuelta — tu contenido pasa a formar parte del conocimiento general del modelo, sin más.

Permitir unos y bloquear otros es una decisión legítima que depende de tu estrategia, no hay una respuesta "correcta" universal. Un medio de noticias puede querer bloquear el entrenamiento pero permitir la búsqueda; una web con contenido muy específico puede preferir bloquear ambos.

Icono de bot de IA rastreando una web

// La capa que casi nadie revisa

¿Por qué robots.txt no es toda la historia?

robots.txt es una preferencia declarada: le pide educadamente a un bot que no entre a cierta ruta, y depende de que el bot decida respetarlo (los bots serios de OpenAI, Anthropic o Perplexity lo hacen). Pero es solo eso, una petición — no es una barrera técnica.

Herramientas como el WAF / Bot Management de Cloudflare operan en una capa completamente distinta: el edge de red. Ahí se decide, petición a petición, si se deja pasar o se bloquea una conexión — y esa decisión tiene prioridad sobre lo que diga tu robots.txt, y ocurre sin que el dueño de la web lo sepa necesariamente. Un bot puede estar "permitido" en tu robots.txt y aun así recibir un 403 en el edge, o al revés.

Por eso esta herramienta comprueba las dos capas por separado y las cruza: si coinciden, todo bien. Si no coinciden, es la señal más importante de la auditoría — probablemente tienes una configuración de bot management que no sabías que estaba bloqueando a alguien que sí querías dejar pasar (o viceversa).

// El caso más habitual

Cómo revisar y ajustar esto en Cloudflare

Si tu web está detrás de Cloudflare (el caso más habitual entre nuestros clientes), la capa real de bloqueo se controla en Security → Bots del panel de Cloudflare. Ahí encontrarás:

01

AI Crawl Control

Un panel dedicado donde ves, bot a bot, si Cloudflare está dejando pasar o bloqueando a cada uno — con datos reales de tu tráfico, no solo una casilla genérica.

02

El toggle "Block AI Bots"

Un interruptor general que, si está activado, bloquea de golpe a todos los bots de entrenamiento conocidos a nivel de red — independientemente de tu robots.txt. Es la causa más común de la discrepancia ⚠️ que puede mostrar esta herramienta.

03

El robots.txt gestionado

Cloudflare puede generar y servir un robots.txt "gestionado" que refleja las reglas que configures en el panel, en vez de (o combinado con) el archivo que tú mismo subes.

04

Ajusta bot a bot

Desde ahí puedes decidir con precisión: bloquear entrenamiento, permitir búsqueda/respuesta, o al revés — según la estrategia que hayas decidido para tu web.

¿Y si además de acceder, quieres saber si te citan?

Que un bot pueda entrar es el primer paso. El siguiente es más interesante: si ChatGPT, Perplexity o Gemini realmente te mencionan y citan cuando alguien pregunta sobre tu sector. Es lo que estamos preparando como próxima herramienta — mientras tanto, hablamos de tu estrategia GEO.

// PREGUNTAS FRECUENTES

Preguntas frecuentes sobre el acceso de bots de IA

// Qué mide

¿Qué comprueba exactamente esta herramienta?

Cruza dos cosas: lo que dice tu robots.txt sobre cada bot de IA y la respuesta real de tu servidor a una petición con ese user-agent. A veces coinciden y a veces no — un firewall o un CDN pueden bloquear aunque el robots.txt permita.

// Bots

¿Qué bots se comprueban?

GPTBot, ClaudeBot y PerplexityBot entre otros. Conviene distinguir los bots de entrenamiento de los de búsqueda en tiempo real: bloquear GPTBot no impide aparecer en ChatGPT, pero bloquear OAI-SearchBot o ChatGPT-User sí impide ser citado.

// Bloqueo

¿Qué hago si un bot está bloqueado?

Si el bloqueo viene del robots.txt, se corrige añadiendo una regla Allow para ese user-agent. Si viene del servidor, hay que revisar la configuración del firewall o del CDN, porque el robots.txt no lo refleja.

// Cómo se usa

Cómo comprobar si los bots de IA pueden acceder a tu web

Comprueba en dos capas si GPTBot, ClaudeBot o PerplexityBot pueden leer tu web: lo que declara tu robots.txt y lo que responde de verdad tu servidor.

  1. 01

    Introduce tu dominio

    Escribe la URL de tu web en el comprobador. No hace falta registro.

  2. 02

    Lee las dos columnas

    Una indica lo que permite tu robots.txt; la otra, si una petición real con ese User-Agent obtiene respuesta.

  3. 03

    Busca la discrepancia

    Si robots.txt permite pero la petición real falla, el bloqueo está en tu servidor, CDN o firewall, y el robots.txt no lo refleja.

// Siguiente paso

Generador de llms.txt

Ya sabes que los bots pueden entrar. El siguiente paso es darles un índice de qué leer y en qué orden.

// Quién la ha hecho

La construyó Pablo Olóndriz, consultor SEO y GEO, para no depender de herramientas que piden registro para responder algo que se resuelve en diez segundos.

No guarda nada. La comprobación se hace en el momento y el resultado se descarta al cerrar la página.