Eine Website scrapen: die vollständige Anleitung
Eine Website zu scrapen bedeutet, ihre Inhalte automatisch zu sammeln (HTML, Daten, Assets). Hier ist die Schritt-für-Schritt-Methode, von der einfachen Anfrage bis zur KI-fertigen Extraktion.
Was ist Website-Scraping?
Scraping (oder Crawling) bedeutet, den Inhalt einer Webseite automatisch herunterzuladen und die nützlichen Daten zu extrahieren: Text, Preise, Bilder, Links oder Struktur.
Man unterscheidet das einfache Scraping (eine Seite), das Crawling (mehrere verlinkte Seiten) und die vollständige Archivierung (die ganze Website inkl. Assets).
Schritt 1 — Ziel und Umfang festlegen
Beginne mit einer Start-URL und lege den Umfang fest: eine Seite, ein Bereich oder die ganze Website.
Setze ein Seitenlimit, damit niemals versehentlich eine ganze Website archiviert wird.
- Einzelne Seite: punktuelle Extraktion
- Ein Bereich: Kategorie, Blog, Katalog
- Ganze Website: vollständige Archivierung + Assets
Schritt 2 — HTML abrufen (Server oder Browser)
Viele moderne Websites erzeugen ihren Inhalt mit JavaScript, sodass eine einfache HTTP-Anfrage eine fast leere Seite zurückgibt.
Ein Headless-Browser — Playwright, Puppeteer — führt das JavaScript aus und wartet auf das Laden, um das echte HTML zu erhalten.
Schritt 3 — Daten und Artefakte extrahieren
Mit dem HTML bereinigt man das DOM und konvertiert die Inhalte in nutzbare Formate: Markdown zum Lesen, JSON für interaktive Elemente und einen Text-Snapshot für Sprachmodelle.
ScraperFlow erzeugt diese drei Artefakte automatisch und bewahrt Struktur und Assets.
Schritt 4 — Anti-Bot handhaben und die Website respektieren
Viele Websites erkennen Bots (Fingerprinting, CAPTCHA, Rate Limiting). Eine Stealth-Engine und ein vernünftiges Tempo reduzieren Blockierungen.
Respektiere stets die Nutzungsbedingungen der Website, die robots.txt und die DSGVO: Erhebe nur öffentliche und notwendige Daten.
Häufige Fragen
Kann man jede Website scrapen?
Technisch fast jede. Rechtlich müssen Nutzungsbedingungen, robots.txt und DSGVO beachtet werden. Öffentliche Daten sind meist zulässig; personenbezogene Daten erfordern eine Rechtsgrundlage.
Muss man programmieren, um zu scrapen?
Nein. Ein Tool wie ScraperFlow genügt: URL eingeben und den Scrape starten. Die REST-API automatisiert bei Bedarf.
Warum liefert mein Scrape eine leere Seite?
Meist weil der Inhalt mit JavaScript erzeugt wird. Dann braucht man einen Headless-Browser, der das JS vor der Extraktion des HTML ausführt.
Bereit, eine Website zu scrapen?
Starten Sie Ihren ersten Scrape in Sekunden, kostenlos.
Scrape starten