Scraping et RGPD : le guide de conformité
Le RGPD n'interdit pas le web scraping : il encadre le traitement des données personnelles. Voici comment collecter des données publiques en respectant le règlement européen — base légale, données personnelles, robots.txt et mesures de conformité.
Le scraping est-il autorisé par le RGPD ?
Le RGPD ne régit pas la technique de collecte elle-même, mais le traitement des données personnelles. Aspirer des pages web n'est donc pas illégal en soi : la conformité dépend de ce que vous collectez et de l'usage que vous en faites.
Dès qu'un scraping porte sur des données personnelles, il constitue un « traitement » soumis aux obligations du RGPD : base légale, information des personnes, respect de leurs droits et sécurité.
Données personnelles ou données anonymes ?
Une donnée personnelle est toute information relative à une personne physique identifiée ou identifiable : un nom, un e-mail, un téléphone, mais aussi une adresse IP ou un identifiant de cookie.
Les données réellement anonymisées — de façon irréversible — sortent du champ du RGPD. En revanche, la pseudonymisation (remplacer un identifiant par un pseudonyme) reste soumise au règlement, car la personne peut être ré-identifiée.
- Nom, prénom, e-mail, téléphone, adresse
- Identifiants en ligne, adresse IP, cookies
- Données de localisation et de navigation
- Données sensibles (santé, opinions, orientation) : régime renforcé
Quelle base légale pour scraper ?
Tout traitement de données personnelles doit reposer sur une base légale. Pour le scraping, l'intérêt légitime est la plus courante : il suppose une mise en balance entre votre intérêt et les droits des personnes.
Le consentement est rarement mobilisable dans une collecte automatisée ; l'obligation légale ou l'intérêt public ne s'appliquent qu'à des cas précis. La CNIL a publié une fiche dédiée à l'intérêt légitime en cas de moissonnage.
- Intérêt légitime : le plus fréquent (veille, recherche, sécurité)
- Consentement : peu praticable en scraping automatisé
- Obligation légale ou intérêt public : cas spécifiques
- Mise en balance obligatoire avec les droits des personnes
robots.txt, CGU et cadre contractuel
Le robots.txt et les conditions générales d'utilisation expriment la volonté de l'éditeur du site. Les ignorer peut engager votre responsabilité contractuelle, indépendamment du RGPD.
Respecter ces signaux réduit le risque juridique et le risque de blocage technique — même s’ils ne remplacent jamais une base légale au sens du RGPD.
Les mesures de conformité à mettre en place
Un scraping conforme applique les principes du RGPD : ne collecter que le nécessaire, limiter la finalité, définir une durée de conservation et sécuriser les données.
La CNIL recommande en outre de se limiter aux données librement accessibles, d'informer les personnes et de prévoir un droit d'opposition.
- Minimisation : uniquement les données nécessaires
- Finalité limitée et déterminée
- Durée de conservation définie et justifiée
- Sécurité : chiffrement, accès restreints
- Information des personnes et droit d’opposition (opt-out)
AIPD, registre et droits des personnes
Certains traitements à grande échelle (profilage, surveillance) exigent une analyse d'impact relative à la protection des données (AIPD) et un registre des activités de traitement.
Les personnes conservent leurs droits : accès, rectification, effacement et opposition. Un scraping conforme doit pouvoir y répondre, ce qui suppose d'identifier les sources des données collectées.
Jurisprudence, sanctions et bonnes pratiques
Les autorités européennes sanctionnent les collectes sans base légale : la CNIL a ainsi infligé en 2022 une amende de 20 millions d'euros à Clearview AI pour avoir collecté et utilisé des données sans base légale.
Bonnes pratiques : documenter la mise en balance de l'intérêt légitime, limiter la collecte aux contenus librement accessibles, anonymiser ou pseudonymiser dès la collecte et tenir un registre des sources.
Questions fréquentes
Le web scraping est-il légal ?
Le scraping n'est pas illégal en soi : tout dépend des données collectées et de leur usage. Tant que la collecte porte sur des données non personnelles, ou sur des données personnelles traitées avec une base légale et des garanties, elle peut être conforme au RGPD.
Peut-on scraper des données personnelles publiques ?
Oui, mais sous conditions. Les données publiquement accessibles peuvent être traitées sur la base de l'intérêt légitime, à condition de mettre en balance les droits des personnes et de prendre des mesures : minimisation, information, droit d'opposition et anonymisation dès la collecte.
Faut-il respecter le robots.txt ?
Le robots.txt traduit la volonté de l'éditeur du site. Le respecter n'est pas une obligation du RGPD, mais il réduit le risque de litige contractuel et de blocage technique. Il ne dispense pas de définir une base légale.
Quelles sanctions en cas de scraping non conforme ?
Le RGPD prévoit des amendes pouvant atteindre 20 millions d'euros ou 4 % du chiffre d'affaires mondial. La CNIL a par exemple sanctionné Clearview AI de 20 millions d'euros en 2022 pour une collecte sans base légale.
Prêt à aspirer un site web ?
Lancez votre premier scraping en quelques secondes, gratuitement.
Lancer un scraping