Extrae cualquier sitio web.
Captura el código fuente, la estructura completa y los assets de un sitio — evitando las protecciones anti-bot — y expórtalo todo como Markdown, JSON o snapshot LLM.
assets/
style.css
app.js
pages/
index.html
contact.html
index.html
Del sitio web a una carpeta útil en tres pasos.
Sin configuración compleja. Un resultado limpio y reutilizable en minutos.
Configurar
Introduce la URL del sitio de destino y la carpeta de destino. Opcionalmente define un límite de páginas.
Extraer y eludir
El motor Playwright + Crawlee recorre el sitio eludiendo las detecciones: stealth, banners de cookies, estrategias de espera.
Exportar
Descarga index.md, llm-snapshot.txt y elements.json — o guarda la estructura completa en la carpeta que elijas.
Un motor completo, una sola herramienta.
Cuatro bloques: extracción, escudo, extracción de datos y API. Todo sin proxies ni scripts que mantener.
Extracción completa
Estructura, assets, reescritura de URLs: una copia fiel y navegable del sitio.
Escudo Stealth
Evasión de detección, descarte de banners de cookies y estrategias de espera para pasar desapercibido.
Extracción IA
Purificación del DOM, etiquetado de elementos interactivos, serialización lista para modelos de lenguaje.
API REST
Lanza extracciones en segundo plano y sigue su estado mediante una API simple y robusta.
Pensado para desarrolladores y agentes de IA.
Automatiza tus extracciones mediante la API REST o alimenta tus LLM con los artefactos de extracción.
API REST
Lanza un scraping asíncrono y sigue su estado. Un solo endpoint, artefactos JSON, una cola limitada y anti-SSRF integrado.
curl -X POST http://localhost:2027/api/scrape \
-H "Content-Type: application/json" \
-d '{
"url": "https://exemple.com",
"folderName": "mon-site",
"maxPages": 50
}'
Artefactos LLM
Cada extracción produce archivos listos para consumir por un agente de IA o un pipeline de datos.
mon-site/ ├── index.md # contenido en Markdown ├── llm-snapshot.txt # snapshot para LLM ├── elements.json # elementos interactivos └── assets/ # archivos estáticos
Paga por lo que extraes.
Empieza con una prueba gratuita y luego crece en volumen, velocidad y soporte.
Gratis
Prueba de descubrimiento.
100 tokens/mes · 1 sitio · sin tarjeta.
- 1 sitio, una única extracción de prueba
- 100 tokens gratis cada mes (25 páginas máx. por sitio)
- Extracción Markdown · JSON · LLM
- Resultados conservados 7 días
- Documentación en línea (sin soporte)
Starter
Para autónomos.
1 000 tokens/mes · 5 sitios · API.
- 1 000 tokens / mes, extracciones ilimitadas
- Hasta 5 sitios
- API REST completa
- Resultados conservados 30 días
- Soporte por email
Scale
Para equipos.
6 000 tokens/mes · 3 usuarios.
- 6 000 tokens / mes
- Sitios ilimitados · 3 usuarios
- Extracción acelerada
- Resultados conservados 1 año
- Soporte prioritario (respuesta < 24 h)
Prueba gratuita sin tarjeta · volumen, API y soporte desde Starter — ver precios completos. — Ver precios.
Preguntas, respuestas.
¿Qué es ScraperFlow?
ScraperFlow extrae un sitio web completo — código fuente, estructura y assets — eludiendo las protecciones anti-bot. Produce artefactos reutilizables: Markdown, snapshot LLM y elementos interactivos en JSON.
¿Necesito conocimientos técnicos?
No. La interfaz web es suficiente: introduce una URL y una carpeta de destino y haz clic en Descargar. La API REST está disponible si quieres automatizar.
¿Qué artefactos se generan?
Tres archivos: index.md (contenido en Markdown), llm-snapshot.txt (snapshot optimizado para LLM) y elements.json (elementos interactivos estructurados). La estructura y los assets se conservan.
¿Cómo funciona el escudo anti-detección?
Combina stealth de Playwright, descarte automático de banners de cookies y estrategias de espera adaptadas al framework del sitio para reducir el riesgo de bloqueo.
¿Es legal?
Extraer contenido público suele ser legal, pero respeta siempre las condiciones de uso del sitio de destino y la normativa vigente (RGPD, derechos de autor).
¿Es gratis?
El plan Gratis es una prueba de descubrimiento: 1 sitio, 3 páginas, sin tarjeta. Más allá, los planes de pago desbloquean el volumen mensual, la API, más retención y soporte.
La web tiene los datos.
Tú tienes el código fuente.
Lanza tu primera extracción en segundos.