KI-Extraktion: das Web in Markdown und JSON verwandeln
Um ein LLM oder einen RAG-Index zu speisen, brauchen Sie saubere Inhalte — kein rohes HTML. ScraperFlow ruft die echten Inhalte ab, bereinigt sie und liefert Markdown, strukturiertes JSON und einen Text-Snapshot, bereit für Ihre Pipeline.
Von rohem HTML zu KI-fähigen Daten
Das HTML einer Seite ertränkt den nutzbaren Inhalt in Auszeichnung, Navigation, Skripten und Styles. Ein Sprachmodell braucht dieses Rauschen nicht: Es braucht den Text, seine Struktur und seine Metadaten.
ScraperFlow konvertiert vorgelagert und liefert direkt nutzbare Artefakte — Markdown, strukturiertes JSON und einen Text-Snapshot — ohne manuellen Bereinigungsschritt.
- Natives Markdown (Überschriften, Listen, Tabellen, Links)
- JSON der extrahierten Daten
- Text-Snapshot für die RAG-Indexierung
Warum Markdown statt HTML
Markdown behält die semantische Struktur (Überschriftenhierarchie, Listen, Tabellen, Links) und entfernt Präsentations-Tags. Der Inhalt bleibt für Mensch und Maschine lesbar.
Das Ergebnis: weniger Rauschen, eine explizite Struktur und kürzere Dokumente — das hilft Modellen, die Information zu finden, und senkt die Token-Kosten.
- Explizite Struktur: Überschriften, Listen, Tabellen
- Links und Bilder als absolute URLs
- Ein einziges Format, lesbar und diffbar
Schritt 1 — Die echten Inhalte abrufen
Viele Websites erzeugen ihre Inhalte mit JavaScript: Eine einfache HTTP-Anfrage liefert nur eine leere Hülle. ScraperFlow führt einen Headless-Browser aus und wartet auf das Rendering, um die echten Inhalte zu erhalten.
Anti-Bot-Schutz (Fingerprinting, CAPTCHA, Rate-Limits) wird durch eine „Stealth“-Engine und ein kontrolliertes Tempo bewältigt — ohne Nebenwirkungen auf die Quellseite.
Schritt 2 — HTML bereinigen (Rauschen entfernen)
Rohes HTML enthält Navigation, Fußzeilen, Cookie-Banner, Werbung und Skripte. Eine unveränderte Konvertierung würde verschmutztes Markdown erzeugen.
ScraperFlow isoliert den Hauptinhalt (Artikel, Produktseite, Dokumentation) und entfernt diese Störelemente vor der Konvertierung.
- Extraktion des Hauptinhalts (im „Readability“-Stil)
- Entfernung von Menüs, Skripten und Bannern
- Relative Links zu absoluten URLs aufgelöst
Schritt 3 — JSON nach Schema extrahieren
Wenn Sie präzise Felder benötigen (Preis, Titel, Datum, Autor), reicht freier Text nicht aus: Sie brauchen strukturierte Daten. ScraperFlow lässt Sie das erwartete Schema beschreiben und liefert konformes JSON.
Anschließend validieren Sie dieses JSON im Code mit den Werkzeugen Ihres Ökosystems (Pydantic in Python, Zod in TypeScript) für eine typisierte, sichere Integration.
- Von Ihnen selbst deklariertes Schema (Felder und Typen)
- Direkt nutzbare JSON-Ausgabe
- Validierung im Client: Pydantic, Zod, JSON Schema
RAG-Index: Struktur, Chunking, Konsistenz
Ein guter RAG-Index beruht auf sauberen, konsistenten und korrekt mit ihrer Quelle verknüpften Dokumenten. Markdown pro Seite erleichtert das Chunking in Segmente kontrollierter Größe.
ScraperFlow bewahrt den URL-Baum und ein Artefakt pro Seite: Sie behalten die Rückverfolgbarkeit Quelle → Segment, unerlässlich zum Zitieren oder Prüfen einer Antwort.
Die API in Ihre Pipeline einbinden
Die REST-API von ScraperFlow passt in jede Pipeline: Sie geben eine Start-URL an und erhalten die Artefakte (Markdown, JSON, Snapshot) zurück, bereit zum Indexieren oder Verarbeiten.
Die Abrechnung erfolgt pro Seite, ohne Multiplikator: Eine Seite mit JavaScript-Rendering kostet dasselbe Token wie eine statische Seite, was die Kosten Ihrer RAG-Pipeline planbar hält.
Häufige Fragen
Erzeugt ScraperFlow LLM-fähiges Markdown?
Ja. Jede Seite kann als natives Markdown geliefert werden (Überschriften, Listen, Tabellen, Links als absolute URLs), mit entferntem Rauschen (Navigation, Skripte, Cookies) für ein direkt von einem LLM oder einem RAG-Index nutzbares Dokument.
Kann ich JSON nach meinem eigenen Schema extrahieren?
Ja. Sie beschreiben die erwarteten Felder (Preis, Titel, Datum, Autor…) und ScraperFlow liefert strukturiertes JSON, das Sie anschließend im Code mit Pydantic, Zod oder einem JSON Schema validieren.
Brauche ich ein LLM, um ScraperFlow zu nutzen?
Nein. ScraperFlow ruft die Daten ab und strukturiert sie ohne Sprachmodell: Markdown und JSON entstehen durch deterministische Verarbeitung. Ein LLM ist nachgelagert nützlich (Zusammenfassungen, Q&A, RAG), nicht für die Extraktion selbst.
Wie senke ich die Token-Kosten meiner RAG-Pipeline?
Indem Sie mit bereinigtem Markdown statt rohem HTML arbeiten: Der nutzbare Inhalt bleibt, das Rauschen verschwindet. Die Größenordnung der Reduktion hängt von den Seiten ab (Navigation und Skripte wiegen oft schwer) — messen Sie sie an Ihren eigenen Inhalten, bevor Sie dimensionieren.
Bereit, eine Website zu scrapen?
Starten Sie Ihren ersten Scrape in Sekunden, kostenlos.
Scrape starten