Web Scraping · Open Source

Extrahieren Sie jede Website.

Erfassen Sie Quellcode, vollständige Struktur und Assets einer Website — unter Umgehung von Anti-Bot-Schutz — und exportieren Sie alles als Markdown, JSON oder LLM-Snapshot.

Open Source Integrierte Anti-Erkennung Export Markdown · JSON · LLM
run_8f3k2a · vor 2 Min fertig
exemple.com/
  assets/
    style.css
    app.js
  pages/
    index.html
    contact.html
  index.html
index.mdMarkdown
llm-snapshot.txtLLM-Snapshot
elements.jsonInteraktive Elemente
So funktioniert es

Von der Website zum nutzbaren Ordner in drei Schritten.

Keine komplexe Einrichtung. Ein sauberes, wiederverwendbares Ergebnis in wenigen Minuten.

01

Konfigurieren

Geben Sie die URL der Ziel-Website und den Zielordner ein. Legen Sie optional ein Seitenlimit fest.

02

Extrahieren und umgehen

Die Playwright- und Crawlee-Engine durchsucht die Website und umgeht Erkennungen: Stealth, Cookie-Banner, Wartestrategien.

03

Exportieren

Laden Sie index.md, llm-snapshot.txt und elements.json herunter — oder speichern Sie die vollständige Struktur in einem Ordner Ihrer Wahl.

Funktionen

Eine komplette Engine, ein einziges Tool.

Vier Bausteine: Extraktion, Schutzschild, Datenextraktion und API. Ganz ohne zu wartende Proxies oder Skripte.

LIVE

Vollständige Extraktion

Struktur, Assets, URL-Umschreibung: eine originalgetreue, navigierbare Kopie der Website.

beispiel.de/ · 42 Seiten · 3,2 MB
LIVE

Stealth-Schild

Erkennungsvermeidung, Cookie-Banner-Verwerfung und Wartestrategien, um unter dem Radar zu bleiben.

applyStealth(context) · cookie-dismisser · wait-strategies
LIVE

KI-Extraktion

DOM-Bereinigung, Tagging interaktiver Elemente, Serialisierung bereit für Sprachmodelle.

index.md · llm-snapshot.txt · elements.json
LIVE

REST-API

Starten Sie Extraktionen im Hintergrund und verfolgen Sie den Status über eine einfache, robuste API.

POST /api/scrape · GET /api/jobs · GET /api/health
Entwickler und KI

Entwickelt für Entwickler und KI-Agenten.

Automatisieren Sie Ihre Extraktionen über die REST-API oder speisen Sie Ihre LLMs mit den Extraktionsartefakten.

REST-API

Starten Sie asynchrones Scraping und verfolgen Sie den Status. Ein einziger Endpoint, JSON-Artefakte, eine begrenzte Warteschlange und integriertes Anti-SSRF.

POST /api/scrape
curl -X POST http://localhost:2027/api/scrape \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://exemple.com",
    "folderName": "mon-site",
    "maxPages": 50
  }'
Antwort 202 · jobId + pollUrl Anti-SSRF · Anti-Path-Traversal

LLM-Artefakte

Jede Extraktion erzeugt Dateien, die sofort von einem KI-Agenten oder einer Datenpipeline verarbeitet werden können.

generierte Artefakte
mon-site/
├── index.md          # Markdown-Inhalt
├── llm-snapshot.txt  # LLM-Snapshot
├── elements.json     # interaktive Elemente
└── assets/           # statische Dateien
Sauberes Markdown Strukturiertes JSON LLM-Snapshot
Preise

Zahlen Sie für das, was Sie extrahieren.

Starten Sie mit einer kostenlosen Testphase und wachsen Sie dann in Volumen, Geschwindigkeit und Support.

Kostenlos

Testphase.

€0/ Monat

100 Tokens/Monat · 1 Website · ohne Karte.

  • 1 Website, ein einzelner Test-Scrape
  • Jeden Monat 100 Tokens gratis (max. 25 Seiten pro Website)
  • Markdown · JSON · LLM-Extraktion
  • Ergebnisse 7 Tage aufbewahrt
  • Online-Dokumentation (kein Support)
Kostenlos testen

Scale

Für Teams.

€79/ Monat

6 000 Tokens/Monat · 3 Benutzer.

  • 6 000 Tokens / Monat
  • Unbegrenzte Websites · 3 Benutzer
  • Schnellere Extraktion
  • Ergebnisse 1 Jahr aufbewahrt
  • Prioritäts-Support (Antwort < 24 h)
Scale wählen

Kostenlose Testphase ohne Karte · Volumen, API und Support ab Starter — vollständige Preise ansehen. — Preise ansehen.

FAQ

Fragen, Antworten.

Was ist ScraperFlow?

ScraperFlow extrahiert eine gesamte Website — Quellcode, Struktur und Assets — unter Umgehung von Anti-Bot-Schutz. Es erzeugt wiederverwendbare Artefakte: Markdown, LLM-Snapshot und interaktive Elemente als JSON.

Brauche ich technische Kenntnisse?

Nein. Die Weboberfläche genügt: URL und Zielordner eingeben und auf Herunterladen klicken. Die REST-API steht bereit, wenn Sie automatisieren möchten.

Welche Artefakte werden erzeugt?

Drei Dateien: index.md (Markdown-Inhalt), llm-snapshot.txt (LLM-optimierter Snapshot) und elements.json (strukturierte interaktive Elemente). Struktur und Assets bleiben erhalten.

Wie funktioniert das Anti-Erkennungs-Schild?

Es kombiniert Playwright-Stealth, automatisches Verwerfen von Cookie-Bannern und frameworkabhängige Wartestrategien, um das Blockierungsrisiko zu senken.

Ist es legal?

Das Extrahieren öffentlicher Inhalte ist in der Regel legal, beachten Sie jedoch stets die Nutzungsbedingungen der Ziel-Website und geltende Vorschriften (DSGVO, Urheberrecht).

Ist es kostenlos?

Der kostenlose Tarif ist eine Testphase: 1 Website, 3 Seiten, ohne Kreditkarte. Darüber hinaus schalten kostenpflichtige Tarife Monatsvolumen, API, längere Aufbewahrung und Support frei.

Das Web hat die Daten.
Sie haben den Quellcode.

Starten Sie Ihre erste Extraktion in Sekunden.