
Warum liefert ein Web-Scraper plötzlich leere Felder?
Gestern hat der Scraper funktioniert, heute fehlen die Daten. Vielleicht wurde die Seite umgebaut, ihr Inhalt verändert oder eine Hinweisseite ausgeliefert. HTTP 200 sagt nur, dass eine Antwort angekommen ist. Bei meinem Shop-Recherchewerkzeug habe ich deshalb Suche und Website-Anreicherung getrennt aufgebaut.
Recherchestand: 2026-09-11 · Titelbild: KI-generierte Illustration
Nach dem Laden den Inhalt prüfen
Drei Fragen helfen bei der Fehlersuche: Wurde die Seite geladen? Ist es der erwartete Seitentyp? Sind die benötigten Angaben vorhanden? Eine Hinweisseite kann technisch erfolgreich laden und für die Recherche trotzdem unbrauchbar sein.
Für jedes Feld muss feststehen, ob es fehlen darf. Ein optionaler Social-Link ist anders zu behandeln als die Shop-Domain. Verschwinden mehrere wichtige Felder gleichzeitig, ist das ein anderer Hinweis als ein einzelner unvollständiger Eintrag.
Wiederholen, wenn es einen Grund dafür gibt
Crawlee dokumentiert begrenzbare Wiederholungen und die Behandlung endgültig fehlgeschlagener Anfragen. Ein kurzer Netzwerkausfall kann sich beim nächsten Versuch erledigen. Ein geänderter Seitenaufbau wird durch weitere identische Abrufe meist nicht repariert.
Ungeklärte Ergebnisse sollten deshalb gekennzeichnet werden, während der ursprüngliche Fund erhalten bleibt. Zugriffsgrenzen und Sperren sind zu respektieren. Manchmal ist die nächste Aufgabe eine Anpassung des Scrapers, nicht noch ein Abruf.
Die Entscheidung im Überblick
- 01AbrufSeite erreichbar und passend?
- 02ExtraktionPflichtfelder plausibel?
- 03PrüfungÄnderung untersuchen, Werte erhalten
Die Korrektur auch an alten Beispielen prüfen
Freigegebene Beispieldokumente verschiedener Seitentypen helfen bei der Wartung. Ein Parser-Update soll den geänderten Fall reparieren und die weiterhin gültigen Fälle erhalten. So fällt auf, wenn eine Korrektur an einer Quelle anderswo etwas beschädigt.
Im Betrieb ist ein Anstieg fehlender Pflichtfelder ein Anlass, Quelle und Regeln zu prüfen. Zweifelhafte neue Ergebnisse können zurückgehalten werden. Bereits geprüfte Werte sollten nicht einfach durch leere Felder ersetzt werden.
Wartung gehört zum Recherchewerkzeug
Beim Shop Directory Lead Scraper gehören Suche, Anreicherung, Dublettenprüfung und Export zum selben Produkt. Für einen Auftrag muss deshalb auch geklärt sein, wer Quellenänderungen untersucht und wie Fehler gemeldet werden.
Beispielquellen, benötigte Felder und die geplante Verwendung sind ein guter Anfang. Daraus lässt sich eine überschaubare Datenpipeline mit Prüfbereich bauen. Das Team soll auch nach einer Quellenänderung wissen, welche Angaben noch verlässlich sind.
