# Crawlers de IA y qué lee un agente en tu sitio

Quince crawlers de IA documentados hacen tres trabajos distintos, y un solo grupo decide si una respuesta de IA puede citarte. Esta clase lee nuestra propia corrida: qué permitió el robots.txt, qué no pudo medir el informe agentic y qué propuesta tiró el orquestador.

Claude SEO: hacé SEO adentro de Claude Code · Módulo 2 · 4 de 13 · 18 min

> Este curso es independiente. No tiene relación con Anthropic ni con AgriciDaniel, que escribe claude-seo, y nadie de ese lado lo revisó. Corrido con claude-seo v2.4.1 el 2026-10-03.

URL: https://seodraft.app/es/learn/claude-seo/ai-crawlers-and-agent-readiness
Cursos: https://seodraft.app/es/learn/claude-seo.md

## Qué vas a poder hacer

- Nombrar los tres tipos de crawler de IA y decir qué te cuesta bloquear a cada uno.
- Leer tu propio resultado de robots.txt por crawler, en la home y en una ruta de contenido.
- Distinguir una medición que la corrida no pudo tomar de una oportunidad que propone un estándar en borrador.

Los crawlers de IA hacen tres trabajos distintos bajo un mismo nombre, y las líneas de tu robots.txt deciden con cuál de los tres te quedás. Un grupo decide si un producto de IA puede citarte y enlazarte. Otro abre una página porque una persona le preguntó a su asistente por ella. Otro junta texto para entrenar modelos, y cerrarle esa puerta deja a los dos primeros exactamente donde estaban. Esta clase lee nuestra propia corrida sobre este sitio del 2026-10-03: quince crawlers documentados chequeados contra el robots.txt en vivo, qué informaron los agentes `agentic` y `geo` de claude-seo, la única medición que la corrida no pudo tomar y la propuesta que el orquestador tiró. El sitio es el que estás leyendo, así que cada cifra de acá sale de un informe cuyo sujeto podés chequear vos.

## Los tres tipos de bot de IA, y qué te cuesta bloquear a cada uno

Bloquear un crawler te cuesta algo distinto según cuál de los tres trabajos haga ese crawler. El chequeo que corrimos agrupa así a los quince bots, y el grupo es lo único que te dice qué compra un `Disallow`.

| Grupo | Qué cuesta bloquearlo | Los crawlers que chequeamos |
| --- | --- | --- |
| Búsqueda | citas y enlaces dentro de las respuestas de un producto de IA | Googlebot, OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot, meta-webindexer |
| Pedido de un usuario | la página que abre un asistente porque alguien preguntó | Claude-User, ChatGPT-User, Perplexity-User |
| Entrenamiento | el texto con el que se entrena un modelo | GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, CCBot |

Los efectos son palabras de los propios operadores. Bloquear a Googlebot te saca de Google Search y de todas sus funciones, AI Overviews incluidos. Bloquear a OAI-SearchBot deja tus páginas afuera de las respuestas de búsqueda de ChatGPT; Claude-SearchBot, afuera del índice de búsqueda de Claude; PerplexityBot, afuera de los resultados y enlaces de Perplexity; Applebot, afuera de Siri, Spotlight y la búsqueda de Safari; meta-webindexer, afuera de lo que cita Meta AI.

## Bloquear un crawler de entrenamiento deja intacta la inclusión en búsqueda

Bloquear a GPTBot deja tu texto afuera del entrenamiento de OpenAI y deja la búsqueda de ChatGPT exactamente donde estaba, porque son dos tokens con dos trabajos. Todos los operadores grandes los separan igual:

- OpenAI: GPTBot entrena, OAI-SearchBot contesta en la búsqueda.
- Anthropic: ClaudeBot entrena, Claude-SearchBot indexa para los resultados de búsqueda de Claude.
- Google: Google-Extended cubre el entrenamiento de Gemini y el grounding en las apps de Gemini; Googlebot cubre Search.
- Apple: Applebot-Extended cubre el entrenamiento de los modelos de Apple; Applebot cubre Siri, Spotlight y Safari.

CCBot es el raro. Alimenta Common Crawl, un dataset abierto con el que entrenan muchos modelos, así que bloquearlo llega más lejos que cualquier empresa sola. meta-externalagent es el crawler de entrenamiento de Meta, y meta-webindexer es el token que decide si Meta AI puede citarte.

## Qué dice de verdad nuestro robots.txt

El robots.txt de este sitio tiene un único grupo `*`, y los quince crawlers heredan su `Allow`. El archivo contestó 200, declaró un sitemap y no traía directivas `Content-Signal` en ningún grupo. El chequeo de seodraft lo leyó en la home y en `/blog/` el 2026-10-03 y volvió con quince bots permitidos y una lista de hallazgos vacía.

Dos de esos permisos valen menos de lo que parecen. ChatGPT-User y Perplexity-User figuran con `honorsRobots: false`, porque OpenAI documenta que las reglas de robots.txt pueden no aplicarse a una búsqueda que pidió un usuario, y Perplexity documenta que Perplexity-User en general ignora robots.txt. Permitirlos no cambia nada, y un `Disallow` apuntado a ellos es un pedido que sus operadores dicen que pueden declinar. Hacerlo cumplir a ese nivel es trabajo de un firewall.

## El llms.txt está publicado acá, y Google dice que Search no hace nada con él

Nuestro `/llms.txt` contesta 200 con 6.896 bytes de texto plano: un H1, un resumen y seis secciones que apuntan a las páginas que vale la pena citar. La propia guía de optimización para IA de Google sumó el 2026-06-15 una nota contra los mitos que dice que llms.txt no hace falta para Google Search y que ahí ni ayuda ni perjudica ([developers.google.com](https://developers.google.com/search/docs/fundamentals/ai-optimization-guide)).

Las dos cosas valen a la vez. Mantenemos el archivo porque no cuesta nada sostenerlo y porque le dice a un agente que lee a mano dónde está la página fechada y citable. Nadie debería esperar un ranking de ahí, y el agente `agentic` de claude-seo lo archiva como un ítem P3 por el mismo motivo.

## El informe agentic nombró una medición que no pudo tomar

Lighthouse Agentic Browsing volvió sin medir en nuestra corrida: PageSpeed Insights contestó 429, cuota superada, en la estrategia mobile y en la de desktop, porque la sesión no tenía API key. El informe escribió "fraction unknown — cannot report X/N" donde va el número.

Ese vacío es la parte útil. Una sección sin medición es un agujero en tu evidencia, y los puntajes de alrededor nunca se apoyaron en ella, así que leer el agujero primero te evita citar un aprobado que nunca se emitió. El arreglo es una API key y volver a correr; mientras tanto, anotá "sin medir" y dejá la fila vacía.

## El 100/100 es una heurística sobre el árbol de accesibilidad

El puntaje de agent-UX de 100/100 de nuestra corrida salió de contar el árbol de accesibilidad de la página renderizada, así que informa exactamente lo que contó. El nuestro: 503 nodos, 71 interactivos, 0 elementos interactivos sin nombre, 0 inputs sin label ni nombre `aria`, 87 `<a>` reales, 3 `<button>` reales, 0 widgets de `div` con onclick y 16 landmarks semánticos. No marcó ningún problema de render parcial ni de cáscara de JavaScript, que es lo que se espera del renderizado en servidor.

Lo que ese puntaje te dice es que un agente que lee tu HTML encuentra controles con nombre y landmarks reales en lugar de una pila de divs sin etiquetar. Lo que deja abierto es si un agente puede terminar una tarea en tu sitio. Tomalo como un piso que ya pasaste.

## Las propuestas en borrador son oportunidades, no defectos

Cuatro ítems que levantó nuestro agente `agentic` son propuestas que ningún estándar fusionó todavía, y el informe los archiva con la fecha en que se chequeó cada estado:

- `/.well-known/ai-catalog.json` devuelve 404. Borrador, chequeado el 2026-09-23.
- `/.well-known/agent-card.json` devuelve 404. La propuesta de MCP Server Card, SEP-2127, seguía sin fusionar al 2026-09-12.
- La entrega en Markdown está ausente: sin `Vary: Accept`, sin `X-Markdown-Tokens`, `/index.md` da 404. Ninguna fuente primaria muestra un agente de consumo mandando `Accept: text/markdown`.
- El marcado WebMCP está ausente. Es una prueba de origen de Chrome, de M149 a M156, sin fecha de salida.

`Content-Signal` cae en el mismo cajón. Nuestro robots.txt no declara ninguna, y el informe lo llama informativo, porque Content-Signal es una política CC0 de Cloudflare cuyo borrador de la IETF venció el 2026-04-04. Los dos archivos `.well-known` que sí contestaron, `oauth-protected-resource` y `oauth-authorization-server`, devolvieron 200 con JSON válido.

Un ítem fechado así es una decisión que podés tomar en tu propio calendario. Cuando el estado cambie, la fecha del informe te dice cuánto envejeció esa recomendación.

## Cuando dos agentes se contradicen, decide el orquestador

Nuestro agente `geo` sacó 82/100 y propuso sumar marcado FAQPage a `/ai-info` y a las páginas de features; el orquestador descartó la propuesta. Google retiró los resultados enriquecidos de FAQ el 2026-05-07, así que ese marcado no gana ninguna función en la SERP y una tarde puesta ahí habría comprado nada. El FAQPage que ya está en esas páginas se queda donde está, como información para lo que lea el JSON-LD.

Ese es el mismo hábito que te pidió armar [la clase 3](/es/learn/claude-seo/seo-audit-with-claude): leer la sección de verificación antes de abrir un archivo. Un sub-agente informa lo que vio en su propio recorte, y el orquestador es la pasada que compara ese recorte con el sitio en vivo. Tu informe va a traer las dos mitades, y el desacuerdo es donde está la lectura.

## Qué cambiar en tu robots.txt y qué dejar como está

Cambiá una línea solo donde el bloqueo te cuesta algo que querés de vuelta. Cuatro decisiones cubren casi cualquier sitio:

- Dejá permitido el grupo de búsqueda si querés que las respuestas de IA te citen y te enlacen. Un bloqueo ahí es el único que te saca de una respuesta.
- Decidí el entrenamiento según tu propia postura sobre licencias. Bloquear a GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent o CCBot afecta los datos de entrenamiento, y los tokens de búsqueda de arriba siguen funcionando.
- Salteá el `Disallow` apuntado a ChatGPT-User o Perplexity-User. Sus operadores documentan que lo pueden ignorar, así que si lo necesitás obligatorio, obligalo en el borde.
- Chequeá tu CDN aparte. Cloudflare bloquea crawlers de IA por defecto en dominios nuevos desde el 2025-07-01, y el robots.txt no te puede mostrar una regla de firewall. El chequeo levanta una advertencia cuando ve un borde de Cloudflare justamente por eso.

Volvé a correr el chequeo después de cualquier edición, y volvé a correrlo cuando cambies de hosting. Con Claude Code cerrado, [el chequeo gratis de crawlers de IA](/es/tools/ai-crawlers) lee el mismo registro con las mismas reglas de la RFC 9309, sin instalar nada y sin cuenta.

## Pasos

### Paso 1 · Leé tu sitio como lo lee un agente (claude-seo)

El README de claude-seo documenta este comando suelto. El nuestro corrió adentro de `/seo audit`, que arranca el agente `agentic` entre once, así que lo que citamos es el archivo de ese agente y no una sesión aparte. Por cualquiera de los dos caminos el agente busca tus páginas, renderiza una, cuenta su árbol de accesibilidad y prueba las rutas `.well-known` que miraría un agente.

```
/seo agentic https://your-site.com
```

Qué deberías ver: Una sección de Lighthouse Agentic Browsing, una heurística de agent-UX sobre el árbol de accesibilidad y una lista de pruebas con sus códigos de estado. El nuestro dio 100/100 en la heurística y dejó la sección de Lighthouse sin medir, porque PageSpeed contestó 429 sin API key configurada.

### Paso 2 · Puntuá qué tan citable es tu sitio (claude-seo)

Misma aclaración: el README documenta el comando suelto y el nuestro corrió como parte de `/seo audit`. El agente `geo` pregunta si un motor de respuestas puede citarte: qué tan autocontenidas son tus respuestas, cómo están armados los encabezados, qué señales de entidad existen y si el texto está en el HTML antes de que corra JavaScript.

```
/seo geo https://your-site.com
```

Qué deberías ver: Un puntaje de preparación con sus dimensiones detalladas. El nuestro fue 82/100: citabilidad 20/25, legibilidad estructural 16/20, contenido multimedia 9/15, señales de autoridad y marca 17/20, accesibilidad técnica 20/20.

### Paso 3 · Conseguí la respuesta del robots.txt por crawler (seodraft)

`check_ai_access` es gratis y de solo lectura por MCP. Lee tu robots.txt con las reglas de la RFC 9309 e informa cada crawler cuyo operador documenta el token y qué pasa si lo bloqueás, agrupados por lo que te cuesta ese bloqueo. No hay puntaje, y un crawler que dice que ignora robots.txt aparece diciéndolo.

```
Run check_ai_access on my site and show me every crawler at the home page and at a content path.
```

Qué deberías ver: Una fila por crawler para las dos rutas. El nuestro volvió el 2026-10-03 con 15 bots, todos permitidos por el grupo `*`, el robots.txt en 200 con un sitemap declarado, el llms.txt presente y la lista de hallazgos vacía.

### Paso 4 · Separá los borradores de las mediciones (claude-seo)

Pegá esto como prompt en la misma sesión. Un informe agentic mezcla tres clases de línea: lo que la corrida midió, lo que no logró medir y lo que algún organismo de estándares propuso y nadie fusionó. Solo la primera clase es un resultado sobre tu sitio.

```
From the agentic report, list every item whose status is a draft or a proposal with the date it was checked, and every measurement the run could not take.
```

Qué deberías ver: Dos listas cortas. La nuestra tuvo cuatro oportunidades en estado de borrador (`ai-catalog.json`, `agent-card.json`, la entrega en Markdown y WebMCP) y una medición que la corrida no pudo tomar, Lighthouse Agentic Browsing.

## Checklist

- [ ] Puedo nombrar los tres grupos de crawlers y qué cuesta bloquear a cada uno.
- [ ] Tengo mi respuesta de robots.txt por crawler, en la home y en una ruta de contenido.
- [ ] Sé cuáles de mis bloqueos tocan las citas y cuáles tocan solo el entrenamiento.
- [ ] Me anoté qué no pudo medir mi corrida agentic, y por qué.
- [ ] Decidí qué líneas del robots.txt cambio y cuáles dejo como están.

## Checkpoint

### Bloqueás a GPTBot en el robots.txt. ¿ChatGPT deja de citar tus páginas?

No. GPTBot junta datos de entrenamiento, y la búsqueda de ChatGPT lee por OAI-SearchBot, que tiene su propia línea en el robots.txt y su propia respuesta. Todos los operadores grandes separan los dos tokens igual: ClaudeBot entrena mientras Claude-SearchBot indexa, Google-Extended alimenta a Gemini mientras Googlebot alimenta a Search, Applebot-Extended entrena mientras Applebot sirve a Siri y Spotlight. Bloquear el entrenamiento es una decisión de licencias, y la inclusión en búsqueda la deciden los tokens de búsqueda.

### Tu informe agentic tiene vacía la sección de Lighthouse Agentic Browsing. ¿Qué anotás?

Que quedó sin medir, y por qué. El nuestro decía que PageSpeed Insights contestó 429, cuota superada, en la estrategia mobile y en la de desktop sin API key configurada, así que el informe escribió "fraction unknown — cannot report X/N" donde va el número. Una medición vacía es un agujero en tu evidencia; los puntajes impresos al lado salieron de otros chequeos. Configurá una key, volvé a correr y leé esa sección antes de tomarla como aprobada.

## Qué dijo esta clase

- Los crawlers de IA hacen tres trabajos: citas en las respuestas de un producto de IA, búsquedas que pidió una persona y entrenamiento de modelos. El grupo es lo que te dice qué cuesta un bloqueo.
- Bloquear un crawler de entrenamiento deja intacta la inclusión en búsqueda. GPTBot y OAI-SearchBot, ClaudeBot y Claude-SearchBot, Google-Extended y Googlebot son pares con trabajos separados.
- Nuestro robots.txt tiene un solo grupo `*` y los 15 crawlers documentados heredan su `Allow`. ChatGPT-User y Perplexity-User informan que pueden ignorar el robots.txt, así que esos dos permisos no cambian nada.
- Nuestra corrida `agentic` dio 100/100 en la heurística del árbol de accesibilidad sobre 503 nodos y 71 elementos interactivos, y dejó Lighthouse Agentic Browsing sin medir después de que PageSpeed contestara 429 sin API key.
- El agente `geo` dio 82/100 y propuso marcado FAQPage; el orquestador lo descartó, porque Google retiró los resultados enriquecidos de FAQ el 2026-05-07.

## Preguntas

### ¿Conviene bloquear los crawlers de entrenamiento?

Esa es tu decisión sobre licencias, y el chequeo nunca la plantea como un problema. Bloquear a GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent o CCBot deja tu texto afuera de esos sets de entrenamiento y deja cada token de búsqueda funcionando igual que antes. Lo único que conviene saber primero es que CCBot alimenta Common Crawl, un dataset abierto con el que entrenan muchos modelos, así que ese bloqueo llega más lejos que cualquier empresa sola.

### ¿Hace falta un llms.txt?

Google dice que para Google Search no hace falta, y que ahí ni ayuda ni perjudica; la nota contra los mitos entró en su guía de optimización para IA el 2026-06-15. Este sitio igual publica uno, 6.896 bytes con un resumen y seis secciones, porque le señala a un agente que lee a mano la página fechada desde la que preferimos que nos citen. Publicalo si ese motivo te aplica, y no esperes nada de él en Search.

### ¿Puedo chequear esto sin instalar nada?

Sí. El chequeo gratis de crawlers de IA en /es/tools/ai-crawlers corre el mismo motor que el `check_ai_access` de seodraft: el mismo registro de bots documentados, la misma lectura del robots.txt según la RFC 9309, la home y una ruta de contenido, sin cuenta y sin puntaje. Es el camino más rápido para mirar un sitio que no es tuyo, o para mostrarle a alguien qué está haciendo su robots.txt.

Clase siguiente: [Investigación de keywords con Claude](https://seodraft.app/es/learn/claude-seo/keyword-research-with-claude)
