Générateur de sitemaps XML
Bounded and polite: at most three page requests run at once; each request is capped at 900 KB/10 seconds, and the server also rate-limits each target host. This is a sitemap seed, not a full-site crawler.
Les contrôles sont exécutés depuis notre serveur ; nous récupérons l’URL saisie et ne conservons pas les résultats. The start site, its robots.txt, and eligible same-host HTML pages are sent through this site's bounded fetch endpoints. Crawl decisions and XML generation run in your browser. Des compteurs anonymes de résultats par exécution peuvent servir à la recherche agrégée ; les URL, domaines, adresses IP et identifiants ne sont jamais inclus, et aucune statistique issue de moins de 100 exécutions n’est publiée.
+ enregistre le site ou la page actuels. Utilisez ☆ à côté de tout site, page ou liste enregistré pour l’ajouter aux favoris. L’historique des vérifications récentes apparaît ci-dessous.
Créer une liste nommée
Cible remplie à partir de vos choix locaux.
Passeport du site Contexte local de ce site enregistré
Données locales
Les cibles enregistrées, les listes nommées et les résumés des vérifications récentes restent uniquement dans ce navigateur.
Sitemap output
Excluded
Unknown / not included
Évaluer cet outil
À propos de cet outil
Générez un sitemap XML depuis un crawl borné du même site qui respecte robots.txt et sépare clairement les URL exclues, inconnues ou non vérifiées.
Fonctionnalités
- Crawl poli avec limite de pages et de requêtes simultanées.
- Exclusion noindex, canonical ailleurs, robots et réponses échouées.
- lastmod émis uniquement lorsqu’une preuve est fournie.
- Aperçu XML et téléchargement traités localement.
Fonctionnement
Le moteur explore la file d’URL du même site, respecte robots.txt et les limites de requêtes, puis conserve séparément les pages admissibles, exclues et inconnues. Il ajoute lastmod uniquement depuis un en-tête Last-Modified, une date visible ou une valeur JSON-LD vérifiable.
Limites
- Le crawl est plafonné à 200 pages et ne représente pas nécessairement tout le site.
- Les réponses non HTML, tronquées ou non-2xx restent dans l’état inconnu.
- Le sitemap généré ne remplace pas une validation complète du site.
Questions fréquentes
L’outil explore-t-il tout mon site ?
Non. Vous choisissez une limite stricte pouvant aller jusqu’à 200 pages. L’outil signale si la file contient encore des URL lorsque cette limite est atteinte, afin qu’une exploration plafonnée ne soit jamais présentée comme exhaustive.
Quelles pages sont exclues ?
Les pages comportant un en-tête ou une balise meta noindex, celles dont l’URL canonique pointe ailleurs et les URL interdites à Googlebot dans robots.txt sont exclues. Les réponses en échec, non HTML, tronquées ou hors de la plage 2xx restent dans un état inconnu distinct.
Comment lastmod est-il choisi ?
Seuls un en-tête HTTP Last-Modified valide, l’attribut datetime d’un élément time affiché ou une valeur JSON-LD dateModified ou datePublished sont publiés. L’outil n’attribue jamais automatiquement l’horodatage actuel à toutes les pages.
Problèmes courants et solutions
- Avertissement La page noindex est exclue du sitemap Solution : Supprimez noindex si la page doit être indexée ; sinon, laissez-la exclue du sitemap.
- Avertissement La page non-200 est exclue du sitemap Solution : Restaurez une réponse 200 directe pour la page canonical ou laissez l’URL non-200 hors du sitemap.
- Avertissement La page canonicalisée ailleurs est exclue Solution : Incluez uniquement l’URL canonique finale et laissez hors du sitemap l’URL canonicalisée ailleurs.
- Information L’URL dupliquée est supprimée Solution : Conservez une seule entrée d’URL canonical normalisée et supprimez les variantes d’écriture ou de paramètres.
- Avertissement L’URL invalide est exclue Solution : Corrigez l’URL absolue mal formée avant de l’ajouter au sitemap.
- Avertissement L’URL d’un autre hôte est exclue Solution : Générez un sitemap séparé pour l’autre hôte vérifié et gardez ce sitemap propre à son hôte.