Scraping web y RGPD: la guía de cumplimiento
El RGPD no prohíbe el scraping web: regula el tratamiento de los datos personales. Así puedes recopilar datos públicos cumpliendo la normativa europea — base legal, datos personales, robots.txt y medidas de cumplimiento.
¿Está permitido el scraping según el RGPD?
El RGPD no regula la técnica de recogida en sí, sino el tratamiento de datos personales. Extraer páginas web no es ilegal por sí mismo: el cumplimiento depende de qué datos recoges y del uso que les das.
En cuanto el scraping afecta a datos personales, se convierte en un «tratamiento» sujeto a las obligaciones del RGPD: base legal, información a las personas, respeto de sus derechos y seguridad.
¿Datos personales o datos anónimos?
Un dato personal es toda información relativa a una persona física identificada o identificable: un nombre, un correo, un teléfono, pero también una dirección IP o un identificador de cookie.
Los datos realmente anonimizados —de forma irreversible— quedan fuera del RGPD. En cambio, la seudonimización sigue sujeta al reglamento, porque la persona puede volver a identificarse.
- Nombre, correo, teléfono, dirección
- Identificadores en línea, dirección IP, cookies
- Datos de localización y de navegación
- Datos sensibles (salud, opiniones, orientación): régimen reforzado
¿Qué base legal se aplica al scraping?
Todo tratamiento de datos personales debe basarse en una base legal. En el scraping, el interés legítimo es el más habitual: exige ponderar tu interés con los derechos de las personas.
El consentimiento rara vez es viable en una recogida automatizada; la obligación legal o el interés público solo se aplican en casos concretos. La CNIL ha publicado una ficha específica sobre el interés legítimo en el scraping.
- Interés legítimo: el más frecuente (vigilancia, investigación, seguridad)
- Consentimiento: poco viable en el scraping automatizado
- Obligación legal o interés público: casos concretos
- Ponderación obligatoria con los derechos de las personas
robots.txt, condiciones de uso y marco contractual
El robots.txt y las condiciones de uso expresan la voluntad del editor del sitio. Ignorarlos puede generar responsabilidad contractual, al margen del RGPD.
Respetar estas señales reduce el riesgo jurídico y el de bloqueo técnico, aunque nunca sustituyen una base legal conforme al RGPD.
Medidas de cumplimiento que aplicar
Un scraping conforme aplica los principios del RGPD: recoger solo lo necesario, limitar la finalidad, fijar un plazo de conservación y proteger los datos.
Además, la CNIL recomienda limitarse a datos de acceso libre, informar a las personas y prever un derecho de oposición.
- Minimización: solo los datos necesarios
- Finalidad limitada y determinada
- Plazo de conservación definido y justificado
- Seguridad: cifrado, accesos restringidos
- Información a las personas y derecho de oposición (opt-out)
EIPD, registro y derechos de las personas
Algunos tratamientos a gran escala (elaboración de perfiles, vigilancia) exigen una evaluación de impacto (EIPD) y un registro de las actividades de tratamiento.
Las personas conservan sus derechos: acceso, rectificación, supresión y oposición. Un scraping conforme debe poder atenderlos, lo que exige registrar las fuentes de los datos recogidos.
Jurisprudencia, sanciones y buenas prácticas
Las autoridades europeas sancionan las recogidas sin base legal: en 2022 la CNIL impuso a Clearview AI una multa de 20 millones de euros por recopilar y usar datos sin base legal.
Buenas prácticas: documentar la ponderación del interés legítimo, limitar la recogida a contenidos de acceso libre, anonimizar o seudonimizar al recoger y mantener un registro de fuentes.
Preguntas frecuentes
¿Es legal el scraping web?
El scraping no es ilegal por sí mismo: depende de los datos recogidos y de su uso. Mientras la recogida afecte a datos no personales, o a datos personales tratados con una base legal y garantías, puede cumplir el RGPD.
¿Se pueden extraer datos personales públicos?
Sí, con condiciones. Los datos de acceso público pueden tratarse sobre la base del interés legítimo, siempre que se ponderen los derechos de las personas y se adopten medidas: minimización, información, derecho de oposición y anonimización al recoger.
¿Hay que respetar el robots.txt?
El robots.txt refleja la voluntad del editor del sitio. Respetarlo no es una obligación del RGPD, pero reduce el riesgo de litigio contractual y de bloqueo técnico. No exime de definir una base legal.
¿Qué sanciones hay por un scraping no conforme?
El RGPD prevé multas de hasta 20 millones de euros o el 4 % del volumen de negocio mundial. La CNIL, por ejemplo, sancionó a Clearview AI con 20 millones de euros en 2022 por una recogida sin base legal.