Générateur de sitemaps XML

Bounded and polite: at most three page requests run at once; each request is capped at 900 KB/10 seconds, and the server also rate-limits each target host. This is a sitemap seed, not a full-site crawler.

Les contrôles sont exécutés depuis notre serveur ; nous récupérons l’URL saisie et ne conservons pas les résultats. The start site, its robots.txt, and eligible same-host HTML pages are sent through this site's bounded fetch endpoints. Crawl decisions and XML generation run in your browser. Des compteurs anonymes de résultats par exécution peuvent servir à la recherche agrégée ; les URL, domaines, adresses IP et identifiants ne sont jamais inclus, et aucune statistique issue de moins de 100 exécutions n’est publiée.

Commentaires
Signaler un bug

Un élément ne fonctionne pas dans Générateur de sitemaps XML ? Décrivez ce qui s’est passé : le signalement est envoyé directement dans une file de tri privée, pas dans une liste publique.

Données envoyées
 Les saisies de l’outil, fichiers importés, sources collées, résultats complets, paramètres de requête et fragments d’URL ne sont pas joints automatiquement. Vous pouvez modifier ou supprimer le passage sélectionné ci-dessus. Les métadonnées du navigateur et de protection contre les abus sont traitées pour prévenir le spam. 

À propos de cet outil

Générez un sitemap XML depuis un crawl borné du même site qui respecte robots.txt et sépare clairement les URL exclues, inconnues ou non vérifiées.

Fonctionnalités

  • Crawl poli avec limite de pages et de requêtes simultanées.
  • Exclusion noindex, canonical ailleurs, robots et réponses échouées.
  • lastmod émis uniquement lorsqu’une preuve est fournie.
  • Aperçu XML et téléchargement traités localement.

Fonctionnement

Le moteur explore la file d’URL du même site, respecte robots.txt et les limites de requêtes, puis conserve séparément les pages admissibles, exclues et inconnues. Il ajoute lastmod uniquement depuis un en-tête Last-Modified, une date visible ou une valeur JSON-LD vérifiable.

Limites

  • Le crawl est plafonné à 200 pages et ne représente pas nécessairement tout le site.
  • Les réponses non HTML, tronquées ou non-2xx restent dans l’état inconnu.
  • Le sitemap généré ne remplace pas une validation complète du site.

Questions fréquentes

L’outil explore-t-il tout mon site ?

Non. Vous choisissez une limite stricte pouvant aller jusqu’à 200 pages. L’outil signale si la file contient encore des URL lorsque cette limite est atteinte, afin qu’une exploration plafonnée ne soit jamais présentée comme exhaustive.

Quelles pages sont exclues ?

Les pages comportant un en-tête ou une balise meta noindex, celles dont l’URL canonique pointe ailleurs et les URL interdites à Googlebot dans robots.txt sont exclues. Les réponses en échec, non HTML, tronquées ou hors de la plage 2xx restent dans un état inconnu distinct.

Comment lastmod est-il choisi ?

Seuls un en-tête HTTP Last-Modified valide, l’attribut datetime d’un élément time affiché ou une valeur JSON-LD dateModified ou datePublished sont publiés. L’outil n’attribue jamais automatiquement l’horodatage actuel à toutes les pages.

Étape suivanteValidateur de sitemaps XML — verify it with a direct check. Des conseils sont disponibles en anglais.