XML-Sitemap-Generator

Bounded and polite: at most three page requests run at once; each request is capped at 900 KB/10 seconds, and the server also rate-limits each target host. This is a sitemap seed, not a full-site crawler.

Die Prüfungen laufen auf unserem Server. Wir rufen die von dir eingegebene URL ab und speichern die Ergebnisse nicht. The start site, its robots.txt, and eligible same-host HTML pages are sent through this site's bounded fetch endpoints. Crawl decisions and XML generation run in your browser. Anonyme Ergebniszähler auf Ausführungsebene können für aggregierte Forschung verwendet werden; URLs, Domains, IP-Adressen und Kennungen werden nie einbezogen, und Statistiken werden erst ab 100 Ausführungen veröffentlicht.

Rückmeldung
Fehler melden

Funktioniert etwas in XML-Sitemap-Generator nicht? Teile uns mit, was passiert ist — die Meldung geht direkt an eine private Prüfwarteschlange, nicht in eine öffentliche Liste.

Gesendete Angaben
 Werkzeugeingaben, Uploads, eingefügte Quellen, vollständige Ergebnisse, Abfrageparameter und URL-Fragmente werden nicht automatisch angehängt. Du kannst die oben ausgewählte Passage bearbeiten oder entfernen. Browser- und Missbrauchsschutz-Metadaten werden zur Spamabwehr verarbeitet. 

Über dieses Werkzeug

Crawle eine begrenzte Menge derselben Website, respektiere robots.txt und erzeuge daraus eine ehrliche XML-Sitemap. Noindex- und off-canonical-URLs werden ausgeschlossen; fehlgeschlagene, nicht-HTML-, abgeschnittene und nicht erfolgreiche Antworten bleiben im separaten Unbekannt-Status.

Der Crawl ist ein Sitemap-Seed, kein vollständiger Website-Crawler und wird nie als vollständig dargestellt, solange die Queue am Seitenlimit nicht leer ist.

Funktionen

  • Begrenzter Same-Site-Crawl mit robots-Respekt und wählbarem Seitenlimit bis 200
  • Ausschluss von Noindex-, Off-Canonical- und Googlebot-disallowed-URLs
  • Separate Zustände für Fehler, Nicht-HTML, Kürzung und Unsicherheit
  • lastmod nur aus sichtbaren Header-, Datetime- oder JSON-LD-Nachweisen sowie XML-Validierungslink

So funktioniert es

Gib eine Start-URL ein und wähle das Seitenlimit. Der Crawl prüft robots.txt, folgt nur derselben Website und sammelt sichtbare Canonicals, Noindex-Signale, HTTP-Status, Content-Type und Größenlimits. Für jede eingeschlossene Seite wird lastmod nur aus einem gültigen Last-Modified-Header, einem sichtbaren time-Datetime oder JSON-LD dateModified/datePublished übernommen. Erzeuge anschließend die XML-Sitemap und validiere sie im nächsten Schritt.

Einschränkungen

  • Maximal 200 Seiten werden gecrawlt; eine nicht leere Queue am Limit bedeutet, dass weitere Seiten ungeprüft sind.
  • Pro Request gelten 900 KB und 10 Sekunden, höchstens drei Requests laufen parallel und Zielhosts werden zusätzlich rate-limitiert.
  • lastmod wird nicht pauschal auf das heutige Datum gesetzt; fehlende Evidenz bleibt ohne Datum.

Häufig gestellte Fragen

Crawlt der Generator meine gesamte Website?

Nein. Du wählst ein festes Limit von höchstens 200 Seiten. Das Werkzeug weist darauf hin, wenn die Queue bei Erreichen dieses Limits noch nicht leer ist, sodass ein begrenzter Crawl niemals als vollständig dargestellt wird.

Welche Seiten werden ausgeschlossen?

Ausgeschlossen werden Seiten mit einem noindex-Header oder Meta-Tag, Seiten, deren Canonical auf eine andere URL verweist, sowie URLs, die für Googlebot in robots.txt gesperrt sind. Fehlgeschlagene, nicht aus HTML bestehende, abgeschnittene und nicht mit 2xx beantwortete Abrufe bleiben im separaten Status „unbekannt“.

Wie wird lastmod ausgewählt?

Ausgegeben wird nur ein gültiger HTTP-Header Last-Modified, ein sichtbarer datetime-Wert eines time-Elements oder ein JSON-LD-Wert dateModified/datePublished. Das Werkzeug versieht niemals jede Seite mit dem heutigen Datum.

Nächster SchrittXML-Sitemap-Validator — verify it with a direct check. Anleitung auf Englisch verfügbar.