Web scraping · Código abierto

Extrae cualquier sitio web.

Captura el código fuente, la estructura completa y los assets de un sitio — evitando las protecciones anti-bot — y expórtalo todo como Markdown, JSON o snapshot LLM.

Código abierto Anti-detección integrada Exporta Markdown · JSON · LLM
run_8f3k2a · terminado hace 2 min
exemple.com/
  assets/
    style.css
    app.js
  pages/
    index.html
    contact.html
  index.html
index.mdMarkdown
llm-snapshot.txtSnapshot LLM
elements.jsonElementos interactivos
Cómo funciona

Del sitio web a una carpeta útil en tres pasos.

Sin configuración compleja. Un resultado limpio y reutilizable en minutos.

01

Configurar

Introduce la URL del sitio de destino y la carpeta de destino. Opcionalmente define un límite de páginas.

02

Extraer y eludir

El motor Playwright + Crawlee recorre el sitio eludiendo las detecciones: stealth, banners de cookies, estrategias de espera.

03

Exportar

Descarga index.md, llm-snapshot.txt y elements.json — o guarda la estructura completa en la carpeta que elijas.

Capacidades

Un motor completo, una sola herramienta.

Cuatro bloques: extracción, escudo, extracción de datos y API. Todo sin proxies ni scripts que mantener.

LIVE

Extracción completa

Estructura, assets, reescritura de URLs: una copia fiel y navegable del sitio.

ejemplo.com/ · 42 páginas · 3,2 MB
LIVE

Escudo Stealth

Evasión de detección, descarte de banners de cookies y estrategias de espera para pasar desapercibido.

applyStealth(context) · cookie-dismisser · wait-strategies
LIVE

Extracción IA

Purificación del DOM, etiquetado de elementos interactivos, serialización lista para modelos de lenguaje.

index.md · llm-snapshot.txt · elements.json
LIVE

API REST

Lanza extracciones en segundo plano y sigue su estado mediante una API simple y robusta.

POST /api/scrape · GET /api/jobs · GET /api/health
Desarrolladores e IA

Pensado para desarrolladores y agentes de IA.

Automatiza tus extracciones mediante la API REST o alimenta tus LLM con los artefactos de extracción.

API REST

Lanza un scraping asíncrono y sigue su estado. Un solo endpoint, artefactos JSON, una cola limitada y anti-SSRF integrado.

POST /api/scrape
curl -X POST http://localhost:2027/api/scrape \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://exemple.com",
    "folderName": "mon-site",
    "maxPages": 50
  }'
Respuesta 202 · jobId + pollUrl Anti-SSRF · anti path-traversal

Artefactos LLM

Cada extracción produce archivos listos para consumir por un agente de IA o un pipeline de datos.

artefactos generados
mon-site/
├── index.md          # contenido en Markdown
├── llm-snapshot.txt  # snapshot para LLM
├── elements.json     # elementos interactivos
└── assets/           # archivos estáticos
Markdown limpio JSON estructurado Snapshot LLM
Precios

Paga por lo que extraes.

Empieza con una prueba gratuita y luego crece en volumen, velocidad y soporte.

Gratis

Prueba de descubrimiento.

€0/ mes

100 tokens/mes · 1 sitio · sin tarjeta.

  • 1 sitio, una única extracción de prueba
  • 100 tokens gratis cada mes (25 páginas máx. por sitio)
  • Extracción Markdown · JSON · LLM
  • Resultados conservados 7 días
  • Documentación en línea (sin soporte)
Probar gratis

Scale

Para equipos.

€79/ mes

6 000 tokens/mes · 3 usuarios.

  • 6 000 tokens / mes
  • Sitios ilimitados · 3 usuarios
  • Extracción acelerada
  • Resultados conservados 1 año
  • Soporte prioritario (respuesta < 24 h)
Elegir Scale

Prueba gratuita sin tarjeta · volumen, API y soporte desde Starter — ver precios completos. — Ver precios.

FAQ

Preguntas, respuestas.

¿Qué es ScraperFlow?

ScraperFlow extrae un sitio web completo — código fuente, estructura y assets — eludiendo las protecciones anti-bot. Produce artefactos reutilizables: Markdown, snapshot LLM y elementos interactivos en JSON.

¿Necesito conocimientos técnicos?

No. La interfaz web es suficiente: introduce una URL y una carpeta de destino y haz clic en Descargar. La API REST está disponible si quieres automatizar.

¿Qué artefactos se generan?

Tres archivos: index.md (contenido en Markdown), llm-snapshot.txt (snapshot optimizado para LLM) y elements.json (elementos interactivos estructurados). La estructura y los assets se conservan.

¿Cómo funciona el escudo anti-detección?

Combina stealth de Playwright, descarte automático de banners de cookies y estrategias de espera adaptadas al framework del sitio para reducir el riesgo de bloqueo.

¿Es legal?

Extraer contenido público suele ser legal, pero respeta siempre las condiciones de uso del sitio de destino y la normativa vigente (RGPD, derechos de autor).

¿Es gratis?

El plan Gratis es una prueba de descubrimiento: 1 sitio, 3 páginas, sin tarjeta. Más allá, los planes de pago desbloquean el volumen mensual, la API, más retención y soporte.

La web tiene los datos.
Tú tienes el código fuente.

Lanza tu primera extracción en segundos.