Web-Scraping für LLMs: Das Web für Ihre Modelle aufbereiten
Ein LLM mit dem Web zu speisen erfordert saubere, strukturierte und aktuelle Inhalte. So gelangen Sie von rohem HTML zu Dokumenten, die für ein Sprachmodell bereit sind: Abruf, Bereinigung, Markdown, Token-Schätzung und RAG-Pipeline.
Warum das Web für ein LLM aufbereiten
Ein Sprachmodell „sieht“ keine Webseite: Es sieht den Text, den Sie ihm geben. Ist dieser Text rohes HTML voller Menüs, Skripte und Cookies, verbraucht das Modell Tokens für Rauschen und antwortet schlechter.
Das Web für ein LLM aufzubereiten heißt, Seiten in saubere Dokumente zu verwandeln: nutzbarer Inhalt, explizite Struktur und Metadaten. Dieser Schritt bestimmt die Qualität einer RAG-Pipeline ebenso wie eines Trainingskorpus.
- Nutzbarer Inhalt, vom Rauschen isoliert
- Explizite Struktur (Überschriften, Listen, Tabellen)
- Kurze, konsistente Dokumente
Das Problem mit rohem HTML
Eine typische HTML-Seite ertränkt den echten Inhalt in Navigation, Fußzeilen, Cookie-Bannern, Werbung und Tracking-Skripten. Diese Auszeichnung macht einen großen Teil des Dokuments aus.
Dieses HTML unverändert an ein Modell zu geben bedeutet, für Rauschen zu zahlen: Jedes Tag, Attribut und Skript verbraucht Tokens ohne nützliche Information. Deshalb muss vor dem Indexieren bereinigt werden.
Schritt 1 — Die echten Inhalte abrufen
Viele Websites rendern ihre Inhalte clientseitig: Eine einfache HTTP-Anfrage liefert nur eine leere Hülle. Man braucht einen Headless-Browser (Playwright, Puppeteer) und muss auf das Rendering warten, um das echte HTML zu erhalten.
Geschützte Websites ergänzen Fingerprinting, CAPTCHA und Rate-Limits. Eine „Stealth“-Engine und ein kontrolliertes Tempo erreichen die Inhalte ohne Nebenwirkungen auf die Quellseite.
Schritt 2 — In sauberes Markdown umwandeln
Zuerst werden Störelemente entfernt (Navigation, Skripte, Cookies, Werbung), um nur den Hauptinhalt zu behalten — idealerweise über eine Extraktion im „Readability“-Stil. Dann wird das verbleibende HTML in Markdown umgewandelt.
Markdown behält die semantische Struktur (Überschriften, Listen, Tabellen, Links) und entfernt Präsentations-Tags. Sauberes Markdown ist für Mensch und Maschine lesbar.
- Eine Überschrift der Ebene 1 pro Dokument
- Tabellen und Codeblöcke klar abgegrenzt
- Links und Bilder als absolute URLs
Die Token-Reduktion schätzen
Tokens werden auf dem Text gezählt, den man dem Modell gibt. Da ein großer Teil einer HTML-Seite aus Auszeichnung und Rauschen besteht, senkt das Ersetzen von HTML durch bereinigtes Markdown die Token-Zahl bei gleichem nutzbarem Inhalt mechanisch.
Die Größenordnung schwankt stark je nach Seite: Eine Seite mit viel Navigation, Skripten und Werbung schrumpft weit stärker als eine ohnehin minimale. Die verbreitete Vorstellung einer ~10-fachen Reduktion entspricht diesen schweren Seiten — sie muss aber gemessen, nicht angenommen werden.
- Methode: Tokens des rohen HTML zählen, dann die des bereinigten Markdown
- An IHREN Seiten messen: das Verhältnis hängt vom Rauschen ab, nicht von einer festen Zahl
- Bei gleichem nutzbarem Inhalt vergleichen (gleiche Seite, gleicher Umfang)
Strukturiertes JSON extrahieren, wenn Felder nötig sind
Markdown eignet sich zum Lesen und für RAG, aber manchmal brauchen Sie präzise Felder (Preis, Datum, Autor). Freier Text reicht dann nicht: Sie brauchen strukturierte Daten.
Beschreiben Sie das erwartete Schema und erhalten Sie konformes JSON, das Sie im Code validieren (Pydantic, Zod, JSON Schema). So kombinieren Sie ein lesbares Markdown-Dokument mit typisierten Feldern für die Automatisierung.
Eine zuverlässige RAG-Pipeline aufbauen
Eine zuverlässige RAG-Pipeline beruht auf sauberen Dokumenten, kontrolliertem Chunking und Rückverfolgbarkeit Quelle → Segment. Markdown pro Seite erleichtert dieses Chunking und das Zitieren von Quellen.
ScraperFlow liefert ein Artefakt pro Seite und bewahrt den URL-Baum: Sie behalten die Verbindung zwischen jedem Segment und seinem Ursprung, unerlässlich zum Prüfen einer Antwort oder Zitieren der Quelle.
Häufige Fragen
Kann man ein LLM mit gescrapten Inhalten speisen?
Ja, sofern Sie die Inhalte aufbereiten: echtes HTML abrufen, Rauschen entfernen und in Markdown oder JSON umwandeln. Rohes HTML verschlechtert die Qualität und verschwendet Tokens. Prüfen Sie zudem den rechtlichen Rahmen (robots.txt, DSGVO) jeder Quelle.
Welches Format wählen: HTML, Markdown oder JSON?
Markdown für Lesen und RAG (Struktur erhalten, Rauschen entfernt); JSON, wenn Sie präzise, typisierte Felder brauchen; rohes HTML nur, wenn Sie das Layout verarbeiten müssen. In der Praxis kombiniert man Markdown für den Text und JSON für die Felder.
Wie schätze ich die Token-Zahl einer Seite?
Man zählt die Tokens des Textes, den man dem Modell gibt. Wandeln Sie die Seite in bereinigtes Markdown um und zählen Sie dessen Tokens mit dem Tokenizer des Zielmodells. Vergleichen Sie mit der Zählung des rohen HTML, um die echte Reduktion an Ihren Seiten zu erhalten.
Ist es legal, das Web für ein LLM zu scrapen?
Scraping ist nicht per se verboten, aber es ist gerahmt: robots.txt und Nutzungsbedingungen beachten, personenbezogene Daten minimieren (DSGVO) und einen legitimen Zweck verfolgen. Bei kommerzieller Nutzung oder Training prüfen Sie die Rechte an den abgerufenen Inhalten.
Bereit, eine Website zu scrapen?
Starten Sie Ihren ersten Scrape in Sekunden, kostenlos.
Scrape starten