Sortear una protección anti-bot: la guía completa

Fingerprinting, retos JavaScript, CAPTCHA, límite de peticiones: así detecta un sitio a los robots, cómo reconocer un bloqueo y qué técnicas reducen los falsos positivos sin salir de la legalidad.

  • Huella del navegador (fingerprinting): Canvas, WebGL, fuentes, resolución, zona horaria
  • Huella de red: firma TLS (JA3), orden y coherencia de las cabeceras HTTP
  • Retos JavaScript: cookie de sesión o token exigido antes de la respuesta
  • CAPTCHA y retos interactivos: reCAPTCHA, hCaptcha, Turnstile
  • Límite de peticiones y honeypots: tope de peticiones, enlaces invisibles trampa
  • Códigos 403 (prohibido) o 429 (demasiadas peticiones)
  • Página de reto («Verificando…») en lugar del contenido esperado
  • HTML truncado o sin los datos visibles en el navegador
  • Redirecciones en bucle o retardos crecientes
  • Navegador headless con huella realista (Playwright + motor «stealth»)
  • Cabeceras y user-agent coherentes, con Accept-Language acorde a la localización
  • Ritmo humano: retardos aleatorios y concurrencia limitada
  • Reutilizar cookies y sesiones para conservar el token del reto
  • Ejecutar el JavaScript y esperar el selector correcto (no solo el evento load)
  • Proxies residenciales o móviles si hay bloqueo geográfico o IP vetada
¿Por qué mi scraping devuelve un error 403 o 429?

Un 403 indica un bloqueo (huella o cabeceras sospechosas); un 429, un límite de peticiones superado. Baja el ritmo, usa un navegador con huella realista y revisa tus cabeceras.

¿Es legal sortear una protección anti-bot?

Depende del contexto. Sortear una medida técnica puede infringir las condiciones de uso, y algunas protecciones están protegidas jurídicamente. Cíñete a datos públicos y revisa tus obligaciones (robots.txt, RGPD) antes de recopilar.

¿Bastan Playwright o Puppeteer para evitar la detección?

No tal cual. Un navegador headless por defecto expone señales detectables. Hay que ajustar la huella, las cabeceras y el ritmo; de ahí el interés de un motor «stealth» o de un servicio especializado.

¿Hacen falta proxies para extraer un sitio protegido?

No siempre. Los proxies son útiles cuando tu IP está bloqueada, compartida o restringida geográficamente. Un grupo de proxies residenciales o móviles mejora la fiabilidad, pero encarece la operación.

¿Listo para extraer un sitio web?

Lanza tu primer scraping en segundos, gratis.

Iniciar scraping