General

Cloudflare Crawl API: rastrear un sitio web completo ya no requiere construir un crawler

Cloudflare amplía Browser Rendering con una API capaz de rastrear sitios web completos, renderizar JavaScript y simplificar herramientas de monitorización.

Hace tiempo que Cloudflare dejó de ser únicamente un proveedor de CDN y protección frente a ataques.

En los últimos años está construyendo una plataforma cada vez más completa para desarrolladores, y su nuevo endpoint Crawl API me parece uno de los lanzamientos más interesantes de los últimos meses.

Con una única llamada es posible rastrear un sitio web completo, descubrir enlaces automáticamente y obtener el contenido listo para ser procesado.

Y creo que esto puede simplificar muchísimo el desarrollo de determinadas herramientas.

¿Qué hace exactamente?

Hasta ahora, si queríamos recorrer un sitio web completo normalmente necesitábamos combinar varias piezas.

Por ejemplo:

  • un navegador sin interfaz como Playwright o Puppeteer
  • lógica para descubrir enlaces
  • control de profundidad
  • colas de procesamiento
  • esperas para renderizar JavaScript
  • almacenamiento de resultados
  • gestión de errores y reintentos

La nueva Crawl API encapsula gran parte de esa complejidad.

Basta con indicar una URL inicial y Cloudflare se encarga de recorrer automáticamente el sitio respetando los límites configurados.

Browser Rendering como base

Uno de los aspectos más interesantes es que esta API forma parte de Browser Rendering.

Esto significa que el contenido puede renderizarse correctamente aunque la página esté desarrollada con tecnologías como:

  • React
  • Vue
  • Angular
  • Next.js
  • Nuxt
  • Astro
  • o cualquier otra aplicación basada en JavaScript

JavaScript deja de ser un problema para el rastreo.

Y eso elimina una de las mayores complicaciones que solemos encontrar cuando construimos herramientas de análisis web.

Distintos formatos de salida

Otro detalle que me ha llamado especialmente la atención es la posibilidad de obtener el contenido en distintos formatos.

Entre ellos:

  • HTML
  • Markdown
  • JSON

La salida en Markdown me parece especialmente interesante.

Reduce gran parte del ruido habitual de una página web y genera un contenido mucho más cómodo para alimentar modelos de IA, sistemas RAG o procesos de indexación documental.

Lo interesante no es el scraping

Creo que el mayor valor de esta API no está únicamente en hacer scraping.

Lo realmente interesante es todo lo que puede construirse encima.

Por ejemplo:

  • herramientas de monitorización de cambios
  • indexación documental
  • auditorías SEO
  • generación automática de documentación
  • buscadores internos
  • preparación de contenido para modelos de lenguaje

En otras palabras, deja de ser una herramienta para extraer HTML y pasa a convertirse en una pieza de infraestructura sobre la que construir aplicaciones mucho más interesantes.

También hay que hablar de sus límites

Como cualquier servicio de este tipo, tampoco conviene pensar que resuelve todos los problemas.

Seguiremos teniendo aspectos importantes que valorar:

  • coste por uso
  • límites de llamadas
  • tiempos de ejecución
  • contenido protegido
  • posibles restricciones legales
  • dependencia de un servicio externo

Simplifica mucho la infraestructura, pero no elimina todas las decisiones técnicas.

Mi primera impresión

Personalmente me parece un movimiento muy inteligente por parte de Cloudflare.

Cada vez ofrece más servicios listos para utilizar, reduciendo el tiempo que dedicamos a construir infraestructura y permitiéndonos centrarnos en desarrollar herramientas que realmente aportan valor.

En mi caso, enseguida se me ocurren aplicaciones relacionadas con monitorización de cambios, indexación documental, análisis SEO o generación de bases de conocimiento.

Tengo la sensación de que esta API va a terminar apareciendo en bastantes proyectos durante los próximos meses.

Y probablemente también en alguno de los míos.


Referencias

Preguntas frecuentes

¿Qué es Cloudflare Crawl API?

Es un nuevo endpoint de Browser Rendering que permite rastrear automáticamente un sitio web completo a partir de una URL inicial.

¿Puede renderizar JavaScript?

Sí. Al formar parte de Browser Rendering, puede procesar aplicaciones modernas desarrolladas con React, Vue, Angular y otros frameworks.

¿Qué formatos devuelve?

Puede devolver el contenido en HTML, Markdown y otros formatos preparados para ser procesados posteriormente.

¿Sirve para construir herramientas de monitorización?

Sí. Es uno de los escenarios donde más potencial le veo, ya que reduce enormemente la complejidad necesaria para recorrer sitios web completos.

Otras noticias

¿Te ha resultado útil o quieres comentar algo?

Hablemos →