Web-Scraping und DSGVO: der Compliance-Guide
Die DSGVO verbietet Web-Scraping nicht: Sie regelt die Verarbeitung personenbezogener Daten. So erhebst du öffentliche Daten DSGVO-konform — Rechtsgrundlage, personenbezogene Daten, robots.txt und Compliance-Maßnahmen.
Ist Web-Scraping nach der DSGVO erlaubt?
Die DSGVO regelt nicht die Erhebungstechnik selbst, sondern die Verarbeitung personenbezogener Daten. Webseiten zu scrapen ist daher nicht per se unzulässig: Die Zulässigkeit hängt davon ab, was du erhebst und wie du es nutzt.
Sobald beim Scraping personenbezogene Daten betroffen sind, handelt es sich um eine „Verarbeitung“ mit DSGVO-Pflichten: Rechtsgrundlage, Information der Betroffenen, Achtung ihrer Rechte und Datensicherheit.
Personenbezogene oder anonyme Daten?
Personenbezogene Daten sind alle Informationen über eine identifizierte oder identifizierbare natürliche Person: Name, E-Mail, Telefon, aber auch IP-Adresse oder Cookie-Kennung.
Wirklich anonymisierte Daten — irreversibel — fallen nicht unter die DSGVO. Pseudonymisierung hingegen bleibt der Verordnung unterworfen, weil die Person re-identifiziert werden kann.
- Name, E-Mail, Telefon, Adresse
- Online-Kennungen, IP-Adresse, Cookies
- Standort- und Nutzungsdaten
- Besondere Kategorien (Gesundheit, Meinungen, Orientierung): strenger
Welche Rechtsgrundlage gilt beim Scraping?
Jede Verarbeitung personenbezogener Daten braucht eine Rechtsgrundlage. Beim Scraping ist das berechtigte Interesse am häufigsten: Es verlangt eine Abwägung zwischen deinem Interesse und den Rechten der Betroffenen.
Einwilligung ist bei automatisierter Erhebung selten praktikabel; rechtliche Verpflichtung oder öffentliches Interesse gelten nur in bestimmten Fällen. Die CNIL hat ein eigenes Merkblatt zum berechtigten Interesse beim Scraping veröffentlicht.
- Berechtigtes Interesse: am häufigsten (Monitoring, Forschung, Sicherheit)
- Einwilligung: bei automatisiertem Scraping kaum praktikabel
- Rechtliche Verpflichtung oder öffentliches Interesse: Sonderfälle
- Pflicht zur Abwägung mit den Rechten der Betroffenen
robots.txt, Nutzungsbedingungen und Vertragsrecht
Die robots.txt und die Nutzungsbedingungen bringen den Willen des Website-Betreibers zum Ausdruck. Sie zu ignorieren kann eine vertragliche Haftung auslösen — unabhängig von der DSGVO.
Diese Signale zu respektieren senkt rechtliche und technische Risiken (Blockierungen) — ersetzt aber nie eine Rechtsgrundlage nach der DSGVO.
Umzusetzende Compliance-Maßnahmen
Ein DSGVO-konformes Scraping befolgt die Grundsätze: nur das Nötige erheben, den Zweck begrenzen, eine Speicherdauer festlegen und die Daten sichern.
Die CNIL empfiehlt zudem, sich auf frei zugängliche Daten zu beschränken, die Betroffenen zu informieren und ein Widerspruchsrecht vorzusehen.
- Datenminimierung: nur die nötigen Daten
- Begrenzter, festgelegter Zweck
- Definierte und begründete Speicherdauer
- Sicherheit: Verschlüsselung, eingeschränkter Zugriff
- Information der Betroffenen und Widerspruchsrecht (Opt-out)
DSFA, Verzeichnis und Rechte der Betroffenen
Manche Verarbeitungen im großen Umfang (Profiling, Überwachung) erfordern eine Datenschutz-Folgenabschätzung (DSFA) und ein Verzeichnis der Verarbeitungstätigkeiten.
Betroffene behalten ihre Rechte: Auskunft, Berichtigung, Löschung und Widerspruch. Ein konformes Scraping muss sie erfüllen können, was die Erfassung der Datenquellen voraussetzt.
Rechtsprechung, Sanktionen und Best Practices
Europäische Behörden sanktionieren Erhebungen ohne Rechtsgrundlage: 2022 verhängte die CNIL gegen Clearview AI eine Geldbuße von 20 Millionen Euro wegen Erhebung und Nutzung von Daten ohne Rechtsgrundlage.
Best Practices: die Abwägung des berechtigten Interesses dokumentieren, die Erhebung auf frei zugängliche Inhalte begrenzen, direkt bei der Erhebung anonymisieren oder pseudonymisieren und ein Quellenverzeichnis führen.
Häufige Fragen
Ist Web-Scraping legal?
Scraping ist nicht per se unzulässig: Es hängt von den erhobenen Daten und deren Nutzung ab. Solange keine personenbezogenen Daten betroffen sind — oder personenbezogene Daten mit Rechtsgrundlage und Schutzmaßnahmen verarbeitet werden — kann es DSGVO-konform sein.
Darf man öffentliche personenbezogene Daten scrapen?
Ja, unter Bedingungen. Öffentlich zugängliche Daten können auf Grundlage des berechtigten Interesses verarbeitet werden, sofern die Rechte der Betroffenen abgewogen und Maßnahmen ergriffen werden: Minimierung, Information, Widerspruchsrecht und Anonymisierung bei der Erhebung.
Muss man die robots.txt beachten?
Die robots.txt spiegelt den Willen des Website-Betreibers. Sie zu beachten ist keine DSGVO-Pflicht, senkt aber das Risiko von Vertragsstreitigkeiten und technischen Blockierungen. Sie ersetzt keine Rechtsgrundlage.
Welche Sanktionen drohen bei nicht konformem Scraping?
Die DSGVO sieht Bußgelder bis zu 20 Millionen Euro oder 4 % des weltweiten Jahresumsatzes vor. Die CNIL verhängte 2022 beispielsweise 20 Millionen Euro gegen Clearview AI wegen einer Erhebung ohne Rechtsgrundlage.
Bereit, eine Website zu scrapen?
Starten Sie Ihren ersten Scrape in Sekunden, kostenlos.
Scrape starten