seodraft

Acceso de crawlers de IA

Pegá una URL. La revisión lee robots.txt como el RFC 9309 dice que debe leerlo un crawler, e informa qué puede traer cada crawler de IA documentado — en la home y en el path que diste. No hay puntaje: un crawler de entrenamiento bloqueado y uno de búsqueda bloqueado no son lo mismo, y un número solo escondería cuál de los dos pasó.

Qué lee la revisión

Tres pedidos, todos al dominio que nombrás: robots.txt, llms.txt y un HEAD de la home. No se trae nada más, no se lee el contenido de las páginas y no se falsifica ningún user agent — los pedidos salen como seodraft-site-check.

robots.txt se parsea según el RFC 9309: los grupos de líneas user-agent consecutivas se fusionan, gana la regla que coincide más largo, el empate lo gana allow, y `*` y `$` funcionan. Un 4xx significa que no hay archivo y no hay restricciones. Un 5xx, un 429, un timeout o una conexión muerta significan que el archivo no se puede leer, y el RFC dice que un crawler debe leer eso como todo el sitio bloqueado.

Cada crawler se evalúa dos veces: en la home y en un path de contenido. El path de contenido es la URL que diste cuando tiene una, porque un sitio con la home abierta y /blog/ cerrado es un sitio bloqueado para cualquier cosa que quiera citar un artículo.

Los crawlers que revisa

Una fila por crawler, con la documentación del propio operador detrás de cada una. Un crawler cuyo operador no documenta su token ni qué hace bloquearlo no entra en la lista.

Búsqueda y respuestas

Los crawlers detrás de las citas de un producto de IA. Bloqueados, el producto no puede citar ni enlazar la página.

  • Googlebot Google · Google Search, AI Overviews, AI ModeBloqueado significa fuera de Google Search y de todas sus funciones, AI Overviews incluidos. documentación del operador
  • OAI-SearchBot OpenAI · ChatGPT searchLas páginas bloqueadas no aparecen en las respuestas de búsqueda de ChatGPT. documentación del operador
  • Claude-SearchBot Anthropic · Claude searchLas páginas bloqueadas no se indexan para los resultados de búsqueda de Claude. documentación del operador
  • PerplexityBot Perplexity · Perplexity searchLas páginas bloqueadas no aparecen ni se enlazan en los resultados de Perplexity. documentación del operador
  • Applebot Apple · Siri, Spotlight, Safari searchLas páginas bloqueadas salen de la búsqueda de Apple y de las respuestas web de Siri y Search. documentación del operador
  • meta-webindexer Meta · Meta AILas páginas bloqueadas no se citan ni se enlazan en las respuestas de Meta AI. documentación del operador

Lectura a pedido de una persona

Alguien pega una URL en un chat y el producto la abre. Algunos ignoran robots.txt por diseño, así que una regla para ellos puede no sostenerse.

  • Claude-User Anthropic · Claude (user request)Bloqueado significa que Claude no puede abrir la página cuando un usuario pregunta por ella. documentación del operador
  • ChatGPT-User OpenAI · ChatGPT (user request)Lo inicia un usuario: OpenAI dice que robots.txt puede no aplicarse. No decide la inclusión en la búsqueda. documentación del operador
  • Perplexity-User Perplexity · Perplexity (user request)Lo inicia un usuario: Perplexity dice que en general ignora robots.txt. documentación del operador

Entrenamiento de modelos

Solo entrenamiento. Bloquearlos no saca al sitio de los productos de arriba, según la documentación de cada operador.

  • GPTBot OpenAI · OpenAI model trainingBloqueado significa que el contenido no se usa para entrenar modelos de OpenAI. La búsqueda de ChatGPT no cambia. documentación del operador
  • ClaudeBot Anthropic · Anthropic model trainingBloqueado significa que el contenido futuro queda fuera del entrenamiento de Anthropic. La búsqueda de Claude no cambia. documentación del operador
  • Google-Extended Google · Gemini training and groundingBloqueado significa sin entrenamiento de Gemini ni grounding en las apps de Gemini. Google Search no cambia. documentación del operador
  • Applebot-Extended Apple · Apple foundation model trainingBloqueado significa sin entrenamiento de los modelos de Apple. La búsqueda de Apple no cambia. documentación del operador
  • meta-externalagent Meta · Meta model trainingBloqueado significa que Meta no rastrea el contenido para entrenar sus modelos. documentación del operador
  • CCBot Common Crawl · Common Crawl open datasetBloqueado significa que las páginas quedan fuera de Common Crawl, un dataset con el que entrenan muchos modelos. documentación del operador

Qué no puede ver

  • Solo robots.txt. Un firewall, una regla de WAF o una política de CDN pueden bloquear a un crawler que robots.txt permite, y nada de eso se ve desde afuera.
  • Los crawlers que ignoran robots.txt. Dos de los que leen a pedido de un usuario están documentados por sus propios operadores como no atados al archivo; la revisión los marca y nunca los informa como bloqueados.
  • Si el crawler vino alguna vez. robots.txt es permiso, no tráfico. Eso lo responden los logs del servidor, no esto.
  • Si un producto te cita. El permiso es el piso, no el resultado.

Para agentes y scripts

Hacé POST con una URL y recibí el mismo informe como JSON: el veredicto por crawler, los avisos, lo que declara robots.txt y llms.txt. El gemelo en Markdown de esta página lleva el registro de crawlers y el contrato.

POST /api/ai-access

curl -s https://seodraft.app/api/ai-access \
  -H "Content-Type: application/json" \
  -d '{"url":"example.com/blog/a-post"}'

Preguntas

¿Da un puntaje?

No. Informa qué crawler puede leer qué path, y qué dice cada operador que pasa si lo bloqueás.

¿Conviene desbloquear los crawlers de entrenamiento?

Es tu decisión y la revisión no empuja para ningún lado. OpenAI, Anthropic, Google y Apple documentan que su crawler de entrenamiento está separado del que alimenta su búsqueda y sus respuestas, así que bloquear entrenamiento deja la citación intacta.

¿Por qué está Googlebot en una lista de crawlers de IA?

AI Overviews y AI Mode se construyen sobre el índice de Google Search, y Googlebot es el que lo llena. Bloquear Googlebot saca al sitio de los dos.

¿Cambia algo en mi sitio?

No. Lee tres archivos e informa. El fragmento de robots.txt es texto para que lo pegues vos, y nada de acá puede editar tu servidor.