XML-Sitemap-Generator
Bounded and polite: at most three page requests run at once; each request is capped at 900 KB/10 seconds, and the server also rate-limits each target host. This is a sitemap seed, not a full-site crawler.
Die Prüfungen laufen auf unserem Server. Wir rufen die von dir eingegebene URL ab und speichern die Ergebnisse nicht. The start site, its robots.txt, and eligible same-host HTML pages are sent through this site's bounded fetch endpoints. Crawl decisions and XML generation run in your browser. Anonyme Ergebniszähler auf Ausführungsebene können für aggregierte Forschung verwendet werden; URLs, Domains, IP-Adressen und Kennungen werden nie einbezogen, und Statistiken werden erst ab 100 Ausführungen veröffentlicht.
+ speichert die aktuelle Website oder Seite. Nutze ☆ neben einer gespeicherten Website, Seite oder Liste, um sie als Favorit zu markieren. Der Verlauf der letzten Prüfungen erscheint darunter.
Benannte Liste erstellen
Ziel aus deinen lokalen Auswahlen übernommen.
Website-Pass Lokaler Kontext für diese gespeicherte Website
Lokale Daten
Gespeicherte Ziele, benannte Listen und Zusammenfassungen der letzten Prüfungen bleiben nur in diesem Browser.
Sitemap output
Excluded
Unknown / not included
Dieses Werkzeug bewerten
Über dieses Werkzeug
Crawle eine begrenzte Menge derselben Website, respektiere robots.txt und erzeuge daraus eine ehrliche XML-Sitemap. Noindex- und off-canonical-URLs werden ausgeschlossen; fehlgeschlagene, nicht-HTML-, abgeschnittene und nicht erfolgreiche Antworten bleiben im separaten Unbekannt-Status.
Der Crawl ist ein Sitemap-Seed, kein vollständiger Website-Crawler und wird nie als vollständig dargestellt, solange die Queue am Seitenlimit nicht leer ist.
Funktionen
- Begrenzter Same-Site-Crawl mit robots-Respekt und wählbarem Seitenlimit bis 200
- Ausschluss von Noindex-, Off-Canonical- und Googlebot-disallowed-URLs
- Separate Zustände für Fehler, Nicht-HTML, Kürzung und Unsicherheit
- lastmod nur aus sichtbaren Header-, Datetime- oder JSON-LD-Nachweisen sowie XML-Validierungslink
So funktioniert es
Gib eine Start-URL ein und wähle das Seitenlimit. Der Crawl prüft robots.txt, folgt nur derselben Website und sammelt sichtbare Canonicals, Noindex-Signale, HTTP-Status, Content-Type und Größenlimits. Für jede eingeschlossene Seite wird lastmod nur aus einem gültigen Last-Modified-Header, einem sichtbaren time-Datetime oder JSON-LD dateModified/datePublished übernommen. Erzeuge anschließend die XML-Sitemap und validiere sie im nächsten Schritt.
Einschränkungen
- Maximal 200 Seiten werden gecrawlt; eine nicht leere Queue am Limit bedeutet, dass weitere Seiten ungeprüft sind.
- Pro Request gelten 900 KB und 10 Sekunden, höchstens drei Requests laufen parallel und Zielhosts werden zusätzlich rate-limitiert.
- lastmod wird nicht pauschal auf das heutige Datum gesetzt; fehlende Evidenz bleibt ohne Datum.
Häufig gestellte Fragen
Crawlt der Generator meine gesamte Website?
Nein. Du wählst ein festes Limit von höchstens 200 Seiten. Das Werkzeug weist darauf hin, wenn die Queue bei Erreichen dieses Limits noch nicht leer ist, sodass ein begrenzter Crawl niemals als vollständig dargestellt wird.
Welche Seiten werden ausgeschlossen?
Ausgeschlossen werden Seiten mit einem noindex-Header oder Meta-Tag, Seiten, deren Canonical auf eine andere URL verweist, sowie URLs, die für Googlebot in robots.txt gesperrt sind. Fehlgeschlagene, nicht aus HTML bestehende, abgeschnittene und nicht mit 2xx beantwortete Abrufe bleiben im separaten Status „unbekannt“.
Wie wird lastmod ausgewählt?
Ausgegeben wird nur ein gültiger HTTP-Header Last-Modified, ein sichtbarer datetime-Wert eines time-Elements oder ein JSON-LD-Wert dateModified/datePublished. Das Werkzeug versieht niemals jede Seite mit dem heutigen Datum.
Häufige Probleme und ihre Behebung
- Warnung Noindex Seite ist excluded aus die Websitemap Lösung: Entfernen noindex wenn die Seite sollte sein indexed; otherwise beibehalten ist excluded aus die Websitemap.
- Warnung Non-200 Seite ist excluded aus die Websitemap Lösung: Wiederherstellen ein direkt 200 antwort für die kanonisch Seite oder lassen die non-200 URL out von die Websitemap.
- Warnung Seite canonicalized elsewhere ist excluded Lösung: Enthalten nur die kanonisch ziel und beibehalten die URL canonicalized elsewhere out von die Websitemap.
- Information Doppelt URL ist entfernt Lösung: Beibehalten ein normalisiert kanonisch URL entry und entfernen doppelt spellings oder parameter Varianten.
- Warnung Ungültig URL ist excluded Lösung: Korrekt die fehlerhaft absolut URL bevor adding ist zu die Websitemap.
- Warnung Cross-host URL ist excluded Lösung: Generate ein separat Websitemap für die andere verifiziert host und beibehalten dies Websitemap host-specific.