seodraft

Chequeo de sitemap

Escribí un dominio y este chequeo mira donde mira un crawler: las líneas Sitemap de robots.txt, después /sitemap.xml y después /sitemap_index.xml. Lee el árbol que cuelga de lo que responda. El informe cuenta las URLs, lee las fechas lastmod y nombra qué corregir.

Gratis, sin registro

Usala desde tu agente

El control de esta página también es un endpoint JSON y una herramienta en un servidor MCP público. Ninguno pide cuenta ni clave.

Endpoint JSON

curl -X POST https://seodraft.app/api/tools/sitemap-checker \
  -H 'content-type: application/json' \
  -d '{"url":"https://seodraft.app"}'

Servidor MCP gratis

Agregá esta URL en Claude, ChatGPT, Cursor o cualquier cliente MCP. Expone todas las herramientas gratis, sin iniciar sesión.

https://seodraft.app/tools/mcp  ·  check_sitemap

Esta página para agentes

La misma guía y el contrato de la API, en Markdown. /es/tools/sitemap-checker.md

Qué hace un buen sitemap XML

Un sitemap es la lista que el sitio hace de sus propias URLs: un <loc> por página, con un <lastmod> opcional que dice cuándo cambió esa página. Un crawler lo lee como una afirmación sobre lo que existe en el sitio.

Cuatro propiedades hacen que esa afirmación sirva. El archivo responde en una URL que robots.txt nombra, parsea como XML, todas sus URLs viven en el mismo dominio que el archivo, y cada lastmod es una fecha real y pasada.

El protocolo de sitemaps.org limita cada archivo a 50.000 URLs y 50 MB sin comprimir. Un sitio más grande parte la lista y publica un índice de sitemaps, que es un sitemap de sitemaps, y gzip vale para los dos.

Cómo funciona este buscador de sitemaps

Sigue el orden que sigue un crawler. Primero robots.txt, y cada línea Sitemap se prueba en el orden del archivo. Después /sitemap.xml y después /sitemap_index.xml.

Pegá una URL de sitemap y el chequeo arranca ahí. Una ruta que termina en .xml o .xml.gz, o cuyo último segmento contiene la palabra sitemap, se lee como el archivo mismo y el resto de la URL como el sitio.

Lo que responda se parsea. Si es un índice, también se abren los archivos que cuelgan de él. Todo se queda en el host que escribiste, así que una URL que apunta a otro dominio se cuenta y queda sin leer.

Qué significa cada hallazgo

Los hallazgos llegan primero los críticos, después las advertencias y después la información, y cada uno trae el número del que habla.

no-sitemap dice que no respondió nada en robots.txt, /sitemap.xml ni /sitemap_index.xml. not-in-robots dice que el archivo existe mientras robots.txt calla, y eso deja al crawler adivinando la ruta. no-urls dice que el archivo parseó y no lista nada.

off-host-urls cuenta URLs en un dominio distinto del que sirve el archivo. lastmod-invalid cuenta valores que no parsean como fecha. lastmod-future cuenta fechas posteriores a hoy, que vienen del sello del build. lastmod-missing cuenta URLs sin ninguna fecha.

sitemap-errors cuenta archivos de adentro de un índice que respondieron con algo que no es XML legible. partial-read dice que el recorrido se detuvo en un límite, así que leé los números como un piso.

Dónde se detiene este chequeo

Lee archivos de sitemap y ahí se detiene. Ninguna página se descarga, así que el informe se queda callado sobre códigos de estado, canonicals e indexación.

Una llamada lee como máximo 10 archivos de sitemap, 5.000 URLs y 15 segundos de reloj, y te devuelve una muestra de 20 URLs. Un sitio más grande recibe el hallazgo partial-read y números que cubren la parte que se leyó.

Si una URL del sitemap entró al índice es una pregunta para el informe de indexación de páginas de Search Console.

Preguntas

¿Cómo encuentro la URL de mi sitemap?
Escribí tu dominio en el campo de acá arriba y el chequeo sale a buscarlo. Busca una línea Sitemap en robots.txt y después prueba /sitemap.xml y /sitemap_index.xml. WordPress publica el suyo en /wp-sitemap.xml y los plugins lo mueven a otro lado, y para eso está la línea en robots.txt.
¿Un sitemap hace que indexen mis páginas?
Un sitemap le dice al buscador qué URLs existen y cuándo cambiaron. La indexación se decide URL por URL después del crawl, y el resultado aparece en el informe de indexación de páginas de Search Console.
¿Qué debería decir lastmod?
La fecha en que cambió el contenido de esa página. La documentación de Google dice que usa lastmod cuando el valor es consistentemente preciso, así que una fecha resellada en todas las URLs en cada deploy le enseña al crawler a ignorar el campo.
¿Puedo chequear un índice de sitemaps?
Sí, y también se abren los archivos que lista adentro, hasta 10. Pegá la URL del índice y el informe cubre las URLs de todos los archivos que leyó.
¿Por qué el informe dice off-host-urls?
Tu sitemap lista URLs de un dominio distinto del que sirve el archivo. Un sitemap cubre el host donde vive, y las URLs de otro dominio van en el sitemap de ese dominio, declarado en el robots.txt de ese dominio.
¿Lee un sitemap comprimido en gzip?
Sí, un archivo .xml.gz se descomprime y se parsea como cualquier otro. Así se sirven la mayoría de los índices de sitemaps grandes.

El proceso completo corre en seodraft

seodraft guarda el mismo recorrido como inventario del workspace: import_sitemap registra las páginas que el sitio ya publicó, y add_topics retiene una pregunta que alguna de ellas ya responde, diciéndote con qué URL choca.

Más herramientas gratis