Los crawlers de IA hacen tres trabajos distintos bajo un mismo nombre, y las líneas de tu robots.txt deciden con cuál de los tres te quedás. Un grupo decide si un producto de IA puede citarte y enlazarte. Otro abre una página porque una persona le preguntó a su asistente por ella. Otro junta texto para entrenar modelos, y cerrarle esa puerta deja a los dos primeros exactamente donde estaban. Esta clase lee nuestra propia corrida sobre este sitio del 2026-10-03: quince crawlers documentados chequeados contra el robots.txt en vivo, qué informaron los agentes agentic y geo de claude-seo, la única medición que la corrida no pudo tomar y la propuesta que el orquestador tiró. El sitio es el que estás leyendo, así que cada cifra de acá sale de un informe cuyo sujeto podés chequear vos.
Los tres tipos de bot de IA, y qué te cuesta bloquear a cada uno
Bloquear un crawler te cuesta algo distinto según cuál de los tres trabajos haga ese crawler. El chequeo que corrimos agrupa así a los quince bots, y el grupo es lo único que te dice qué compra un Disallow.
| Grupo | Qué cuesta bloquearlo | Los crawlers que chequeamos |
|---|---|---|
| Búsqueda | citas y enlaces dentro de las respuestas de un producto de IA | Googlebot, OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot, meta-webindexer |
| Pedido de un usuario | la página que abre un asistente porque alguien preguntó | Claude-User, ChatGPT-User, Perplexity-User |
| Entrenamiento | el texto con el que se entrena un modelo | GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, CCBot |
Los efectos son palabras de los propios operadores. Bloquear a Googlebot te saca de Google Search y de todas sus funciones, AI Overviews incluidos. Bloquear a OAI-SearchBot deja tus páginas afuera de las respuestas de búsqueda de ChatGPT; Claude-SearchBot, afuera del índice de búsqueda de Claude; PerplexityBot, afuera de los resultados y enlaces de Perplexity; Applebot, afuera de Siri, Spotlight y la búsqueda de Safari; meta-webindexer, afuera de lo que cita Meta AI.
Bloquear un crawler de entrenamiento deja intacta la inclusión en búsqueda
Bloquear a GPTBot deja tu texto afuera del entrenamiento de OpenAI y deja la búsqueda de ChatGPT exactamente donde estaba, porque son dos tokens con dos trabajos. Todos los operadores grandes los separan igual:
- OpenAI: GPTBot entrena, OAI-SearchBot contesta en la búsqueda.
- Anthropic: ClaudeBot entrena, Claude-SearchBot indexa para los resultados de búsqueda de Claude.
- Google: Google-Extended cubre el entrenamiento de Gemini y el grounding en las apps de Gemini; Googlebot cubre Search.
- Apple: Applebot-Extended cubre el entrenamiento de los modelos de Apple; Applebot cubre Siri, Spotlight y Safari.
CCBot es el raro. Alimenta Common Crawl, un dataset abierto con el que entrenan muchos modelos, así que bloquearlo llega más lejos que cualquier empresa sola. meta-externalagent es el crawler de entrenamiento de Meta, y meta-webindexer es el token que decide si Meta AI puede citarte.
Qué dice de verdad nuestro robots.txt
El robots.txt de este sitio tiene un único grupo *, y los quince crawlers heredan su Allow. El archivo contestó 200, declaró un sitemap y no traía directivas Content-Signal en ningún grupo. El chequeo de seodraft lo leyó en la home y en /blog/ el 2026-10-03 y volvió con quince bots permitidos y una lista de hallazgos vacía.
Dos de esos permisos valen menos de lo que parecen. ChatGPT-User y Perplexity-User figuran con honorsRobots: false, porque OpenAI documenta que las reglas de robots.txt pueden no aplicarse a una búsqueda que pidió un usuario, y Perplexity documenta que Perplexity-User en general ignora robots.txt. Permitirlos no cambia nada, y un Disallow apuntado a ellos es un pedido que sus operadores dicen que pueden declinar. Hacerlo cumplir a ese nivel es trabajo de un firewall.
El llms.txt está publicado acá, y Google dice que Search no hace nada con él
Nuestro /llms.txt contesta 200 con 6.896 bytes de texto plano: un H1, un resumen y seis secciones que apuntan a las páginas que vale la pena citar. La propia guía de optimización para IA de Google sumó el 2026-06-15 una nota contra los mitos que dice que llms.txt no hace falta para Google Search y que ahí ni ayuda ni perjudica (developers.google.com).
Las dos cosas valen a la vez. Mantenemos el archivo porque no cuesta nada sostenerlo y porque le dice a un agente que lee a mano dónde está la página fechada y citable. Nadie debería esperar un ranking de ahí, y el agente agentic de claude-seo lo archiva como un ítem P3 por el mismo motivo.
El informe agentic nombró una medición que no pudo tomar
Lighthouse Agentic Browsing volvió sin medir en nuestra corrida: PageSpeed Insights contestó 429, cuota superada, en la estrategia mobile y en la de desktop, porque la sesión no tenía API key. El informe escribió "fraction unknown — cannot report X/N" donde va el número.
Ese vacío es la parte útil. Una sección sin medición es un agujero en tu evidencia, y los puntajes de alrededor nunca se apoyaron en ella, así que leer el agujero primero te evita citar un aprobado que nunca se emitió. El arreglo es una API key y volver a correr; mientras tanto, anotá "sin medir" y dejá la fila vacía.
El 100/100 es una heurística sobre el árbol de accesibilidad
El puntaje de agent-UX de 100/100 de nuestra corrida salió de contar el árbol de accesibilidad de la página renderizada, así que informa exactamente lo que contó. El nuestro: 503 nodos, 71 interactivos, 0 elementos interactivos sin nombre, 0 inputs sin label ni nombre aria, 87 <a> reales, 3 <button> reales, 0 widgets de div con onclick y 16 landmarks semánticos. No marcó ningún problema de render parcial ni de cáscara de JavaScript, que es lo que se espera del renderizado en servidor.
Lo que ese puntaje te dice es que un agente que lee tu HTML encuentra controles con nombre y landmarks reales en lugar de una pila de divs sin etiquetar. Lo que deja abierto es si un agente puede terminar una tarea en tu sitio. Tomalo como un piso que ya pasaste.
Las propuestas en borrador son oportunidades, no defectos
Cuatro ítems que levantó nuestro agente agentic son propuestas que ningún estándar fusionó todavía, y el informe los archiva con la fecha en que se chequeó cada estado:
/.well-known/ai-catalog.jsondevuelve 404. Borrador, chequeado el 2026-09-23./.well-known/agent-card.jsondevuelve 404. La propuesta de MCP Server Card, SEP-2127, seguía sin fusionar al 2026-09-12.- La entrega en Markdown está ausente: sin
Vary: Accept, sinX-Markdown-Tokens,/index.mdda 404. Ninguna fuente primaria muestra un agente de consumo mandandoAccept: text/markdown. - El marcado WebMCP está ausente. Es una prueba de origen de Chrome, de M149 a M156, sin fecha de salida.
Content-Signal cae en el mismo cajón. Nuestro robots.txt no declara ninguna, y el informe lo llama informativo, porque Content-Signal es una política CC0 de Cloudflare cuyo borrador de la IETF venció el 2026-04-04. Los dos archivos .well-known que sí contestaron, oauth-protected-resource y oauth-authorization-server, devolvieron 200 con JSON válido.
Un ítem fechado así es una decisión que podés tomar en tu propio calendario. Cuando el estado cambie, la fecha del informe te dice cuánto envejeció esa recomendación.
Cuando dos agentes se contradicen, decide el orquestador
Nuestro agente geo sacó 82/100 y propuso sumar marcado FAQPage a /ai-info y a las páginas de features; el orquestador descartó la propuesta. Google retiró los resultados enriquecidos de FAQ el 2026-05-07, así que ese marcado no gana ninguna función en la SERP y una tarde puesta ahí habría comprado nada. El FAQPage que ya está en esas páginas se queda donde está, como información para lo que lea el JSON-LD.
Ese es el mismo hábito que te pidió armar la clase 3: leer la sección de verificación antes de abrir un archivo. Un sub-agente informa lo que vio en su propio recorte, y el orquestador es la pasada que compara ese recorte con el sitio en vivo. Tu informe va a traer las dos mitades, y el desacuerdo es donde está la lectura.
Qué cambiar en tu robots.txt y qué dejar como está
Cambiá una línea solo donde el bloqueo te cuesta algo que querés de vuelta. Cuatro decisiones cubren casi cualquier sitio:
- Dejá permitido el grupo de búsqueda si querés que las respuestas de IA te citen y te enlacen. Un bloqueo ahí es el único que te saca de una respuesta.
- Decidí el entrenamiento según tu propia postura sobre licencias. Bloquear a GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent o CCBot afecta los datos de entrenamiento, y los tokens de búsqueda de arriba siguen funcionando.
- Salteá el
Disallowapuntado a ChatGPT-User o Perplexity-User. Sus operadores documentan que lo pueden ignorar, así que si lo necesitás obligatorio, obligalo en el borde. - Chequeá tu CDN aparte. Cloudflare bloquea crawlers de IA por defecto en dominios nuevos desde el 2025-07-01, y el robots.txt no te puede mostrar una regla de firewall. El chequeo levanta una advertencia cuando ve un borde de Cloudflare justamente por eso.
Volvé a correr el chequeo después de cualquier edición, y volvé a correrlo cuando cambies de hosting. Con Claude Code cerrado, el chequeo gratis de crawlers de IA lee el mismo registro con las mismas reglas de la RFC 9309, sin instalar nada y sin cuenta.