Web scraping para LLM: preparar la web para tus modelos

Alimentar un LLM con la web exige contenido limpio, estructurado y actualizado. Aquí tienes cómo pasar del HTML bruto a documentos listos para un modelo de lenguaje: obtención, limpieza, Markdown, estimación de tokens y pipeline RAG.

  • Contenido útil aislado del ruido
  • Estructura explícita (títulos, listas, tablas)
  • Documentos cortos y coherentes
  • Un solo título de nivel 1 por documento
  • Tablas y bloques de código bien delimitados
  • Enlaces e imágenes con URL absolutas
  • Método: contar los tokens del HTML bruto y luego los del Markdown limpio
  • Medir en TUS páginas: el ratio depende del ruido, no de un número universal
  • Comparar a igualdad de contenido útil (misma página, mismo alcance)
¿Se puede alimentar un LLM con contenido scrapeado?

Sí, siempre que prepares el contenido: obtén el HTML real, elimina el ruido y convierte a Markdown o JSON. Dar HTML bruto degrada la calidad y desperdicia tokens. Comprueba también el marco legal (robots.txt, RGPD) de cada fuente.

¿Qué formato elegir: HTML, Markdown o JSON?

Markdown para la lectura y el RAG (estructura conservada, ruido eliminado); JSON cuando necesitas campos precisos y tipados; HTML bruto solo si debes tratar la maquetación. En la práctica se combinan Markdown para el texto y JSON para los campos.

¿Cómo estimo el número de tokens de una página?

Se cuentan los tokens del texto que se da al modelo. Convierte la página a Markdown limpio y cuenta los tokens de ese Markdown con el tokenizer del modelo objetivo. Compara con el recuento sobre el HTML bruto para obtener la reducción real en tus páginas.

¿Es legal hacer scraping para un LLM?

El scraping no está prohibido en sí, pero se enmarca: respeta el robots.txt y las condiciones de uso, minimiza los datos personales (RGPD) y mantén una finalidad legítima. Para uso comercial o entrenamiento, revisa los derechos sobre los contenidos obtenidos.

¿Listo para extraer un sitio web?

Lanza tu primer scraping en segundos, gratis.

Iniciar scraping