Extracción para IA: convertir la web en Markdown y JSON
Para alimentar un LLM o un índice RAG necesitas contenido limpio, no HTML bruto. ScraperFlow obtiene el contenido real, lo limpia y lo entrega en Markdown, JSON estructurado y snapshot de texto, listos para tu pipeline.
Del HTML bruto a datos listos para la IA
El HTML de una página ahoga el contenido útil entre el marcado, la navegación, los scripts y los estilos. Un modelo de lenguaje no necesita ese ruido: necesita el texto, su estructura y sus metadatos.
ScraperFlow hace la conversión de antemano y entrega artefactos directamente utilizables — Markdown, JSON estructurado y snapshot de texto — sin limpieza manual.
- Markdown nativo (títulos, listas, tablas, enlaces)
- JSON de los datos extraídos
- Snapshot de texto para indexar en RAG
Por qué Markdown en lugar de HTML
Markdown conserva la estructura semántica (jerarquía de títulos, listas, tablas, enlaces) y elimina las etiquetas de presentación. El contenido sigue siendo legible para una persona y para una máquina.
Resultado: menos ruido, una estructura explícita y documentos más cortos — lo que ayuda a los modelos a localizar la información y reduce el coste en tokens.
- Estructura explícita: títulos, listas, tablas
- Enlaces e imágenes con URL absolutas
- Un formato único, legible y comparable
Paso 1 — Obtener el contenido real
Muchos sitios generan su contenido con JavaScript: una petición HTTP simple solo devuelve un esqueleto vacío. ScraperFlow ejecuta un navegador headless y espera el renderizado para obtener el contenido real.
Las protecciones anti-bot (fingerprinting, CAPTCHA, límite de peticiones) se gestionan con un motor « stealth » y un ritmo controlado, sin efectos secundarios en el sitio de origen.
Paso 2 — Limpiar el HTML (eliminar el ruido)
El HTML bruto contiene la navegación, los pies de página, los avisos de cookies, la publicidad y los scripts. Convertirlo tal cual produciría un Markdown contaminado.
ScraperFlow aísla el contenido principal (artículo, ficha de producto, documentación) y elimina esos elementos parásitos antes de la conversión.
- Extracción del contenido principal (estilo « Readability »)
- Eliminación de menús, scripts y avisos
- Enlaces relativos resueltos a URL absolutas
Paso 3 — Extraer JSON por esquema
Cuando buscas campos precisos (precio, título, fecha, autor), el texto libre no basta: necesitas datos estructurados. ScraperFlow permite describir el esquema esperado y devuelve un JSON conforme.
Después validas ese JSON en el código con las herramientas de tu ecosistema (Pydantic en Python, Zod en TypeScript) para una integración tipada y segura.
- Esquema que declaras tú mismo (campos y tipos)
- Salida JSON lista para usar
- Validación en el cliente: Pydantic, Zod, JSON Schema
Índice RAG: estructura, fragmentación, coherencia
Un buen índice RAG se basa en documentos limpios, coherentes y bien vinculados a su fuente. El Markdown por página facilita la fragmentación en segmentos de tamaño controlado.
ScraperFlow conserva el árbol de URL y un artefacto por página: mantienes la trazabilidad fuente → segmento, imprescindible para citar o verificar una respuesta.
Integrar la API en tu pipeline
La API REST de ScraperFlow encaja en cualquier pipeline: indicas una URL de inicio y recibes los artefactos (Markdown, JSON, snapshot), listos para indexar o procesar.
La facturación es por página, sin multiplicador: una página con renderizado JavaScript cuesta el mismo token que una página estática, lo que mantiene predecible el coste de tu pipeline RAG.
Preguntas frecuentes
¿ScraperFlow produce Markdown listo para LLM?
Sí. Cada página puede entregarse en Markdown nativo (títulos, listas, tablas, enlaces con URL absolutas), con el ruido eliminado (navegación, scripts, cookies) para un documento directamente usable por un LLM o un índice RAG.
¿Puedo extraer un JSON según mi propio esquema?
Sí. Describes los campos esperados (precio, título, fecha, autor…) y ScraperFlow devuelve un JSON estructurado, que luego validas con Pydantic, Zod o un JSON Schema en tu código.
¿Necesito un LLM para usar ScraperFlow?
No. ScraperFlow obtiene y estructura los datos sin modelo de lenguaje: el Markdown y el JSON se producen con un tratamiento determinista. Un LLM es útil después (resúmenes, preguntas y respuestas, RAG), no para la extracción.
¿Cómo reduzco el coste en tokens de mi pipeline RAG?
Trabajando con Markdown limpio en lugar de HTML bruto: se conserva el contenido útil y desaparece el ruido. El orden de magnitud de la reducción depende de las páginas (la navegación y los scripts suelen pesar mucho) — mídela en tu propio contenido antes de dimensionar.