Scraping web en VM0
Dale un enlace a un agente y vuelve con lo que la página dice de verdad, en texto limpio y legible. Sin darte de alta en ningún proveedor de scraping.
Datos web · Sin configuración · Dos modos de facturación, standard y enhanced
Apunta un agente a un enlace público y te lee la página: las palabras, no los menús de navegación, los avisos de cookies ni los pies de página. Pide la página como texto limpio, o solo la lista de enlaces cuando el trabajo consiste en decidir qué leer a continuación.
VM0 hace la lectura sobre Firecrawl y la paga, así que nadie de tu equipo se registra, guarda una clave ni cuadra una segunda factura. El alcance es deliberadamente estrecho: una página por petición. Encontrar páginas es tarea de la búsqueda web, y todo lo que está detrás de un inicio de sesión o de un clic pertenece al navegador remoto.
Qué es Scraping web
Toda tarea de investigación llega al punto en que un resultado de búsqueda no basta y necesitas lo que la página dice de verdad. Hacerlo bien es más difícil de lo que parece. Las páginas cargan la mitad de su contenido con scripts, y el texto útil queda entre menús, banners y anuncios.
VM0 paga eso como servicio para que tus agentes no tengan que hacerlo. El agente envía un enlace público y recibe la página como texto limpio que puede leer y resumir, o como una lista de todos sus enlaces.
Algunas páginas se resisten a una lectura normal. Para esas hay un modo más potente, y el agente tiene que pedirlo, porque cuesta más por página y deberías poder ver cuándo un flujo lo eligió.
Es lo mismo que la gente busca como API de scraping web, y el mismo motor al que se recurre al comparar el precio de Firecrawl con escribir un scraper propio. La diferencia está en dónde vive la cuenta: por tu parte no hay registro, ni clave de API, ni plan mensual, y pagas por página en créditos.
Qué puede hacer Scraping web
Qué puede hacer un agente con él y qué recibe cuando lo hace.
Alcance y límites
Lo que no hace, dicho por delante, para que nadie planifique un flujo alrededor de algo que queda fuera.
Solo páginas públicas
No hay inicio de sesión de por medio, así que una página tras un login, un muro de pago o un muro antibots queda fuera. Para eso está el navegador remoto.
Una página cada vez
Lee la página que le señalas. No recorre el resto del sitio, así que leer un sitio entero significa pedir página a página y pagar página a página.
El modo caro es una elección
La mayoría de las páginas se leen bien en modo normal. El modo potente cuesta más y el agente tiene que pedirlo, así que un flujo nunca se encarece en silencio.
Lo que vuelve es información, no órdenes
El texto de una página web se trata como algo que leer, nunca como instrucciones que seguir. Eso es lo que impide que una página hostil convenza a un agente de hacer otra cosa.
Cuánto cuesta Scraping web
Los servicios web se facturan en créditos por llamada, no por token. No hay una factura de proveedor aparte que cuadrar.
zero scrapePagas créditos por página leída, y el modo potente cuesta más que el normal. Debajo no hay suscripción de Firecrawl ni mínimo, así que un flujo que lee tres páginas por semana paga tres páginas por semana.
Configuración y acceso
Nada que configurar
Nada que conectar. Sin registro en Firecrawl, sin clave que pegar, sin nada añadido a tu lista de conectores. Esa es la diferencia con el conector de Firecrawl del catálogo de VM0: el conector corre sobre tu cuenta y tu factura de Firecrawl, y esto corre sobre las nuestras.
Quién puede usarlo
Leer páginas web es un permiso que concedes, no algo que todo agente tenga. Dáselo a los agentes y a las personas que lo necesiten, durante el tiempo que lo necesiten, y retíralo sin tocar nada más de lo que ese agente puede hacer.
Para qué usan los equipos Scraping web
Leer la página que hay detrás de un resultado de búsqueda
La búsqueda te da un titular y dos líneas. Casi todo el trabajo necesita el cuerpo, así que el patrón es buscar primero, elegir los dos o tres resultados que importan y leer solo esos.
Vigilar páginas sin otra vía de entrada
Precios de la competencia, changelogs, páginas de estado, avisos regulatorios. Un agente programado lee la página, la compara con la semana pasada y solo te avisa cuando algo se ha movido.
Convertir un documento largo en material de trabajo
Una especificación, una memoria anual, un centro de ayuda. El texto limpio es la diferencia entre un resumen del documento y un resumen de su menú de navegación.
Cuándo no usar Scraping web
Sáltalo cuando la página necesite un inicio de sesión, un clic o un formulario, y usa el navegador remoto. Sáltalo para leer un sitio entero, donde el coste por página se acumula más rápido de lo que vale la respuesta. Y sáltalo cuando la fuente publique datos propios en condiciones, que casi siempre son más estables que leer sus páginas.
Cómo se llama esto en otros sitios
Lo mismo recibe varios nombres en el mercado. Si has buscado alguno de ellos, así es como se corresponde con lo que obtienes aquí.
API de scraping web
El nombre habitual de pagar a un servicio para que traiga una página y devuelva su texto. Eso es exactamente esto. La cuenta y la clave son de VM0, no tuyas.
La API de Firecrawl sin clave de Firecrawl
Firecrawl es el motor de debajo. Obtienes su salida sin registrarte, sin generar una clave y sin elegir un plan de Firecrawl, y el uso aparece en tus créditos de VM0 en lugar de en una segunda factura.
De HTML a Markdown
La conversión que normalmente escribe uno mismo: entra una página de HTML, sale Markdown limpio. Ocurre antes de que el texto llegue al agente, y por eso el modelo dedica su atención al contenido y no al marcado.
Scraping web con IA o para LLM
Scraping cuya salida está pensada para que la lea un modelo y no para parsearla con código. Es la misma descarga, juzgada por si el texto se lee bien y no por si un selector sigue coincidiendo.
Scraping web sin código
Aquí nadie escribe un scraper. Pides la página en un mensaje y el agente la descarga, que es lo que busca quien busca scraping sin código.
Scraping web comparado
Scraping web frente a usar Firecrawl por tu cuenta
El mismo motor, una cantidad de trabajo muy distinta. Por tu cuenta significa una cuenta, una clave que alguien debe custodiar, un plan que elegir y una segunda factura que cuadrar, y cada compañero que quiera ejecutar el flujo necesita también esa clave. Aquí la lectura y la factura están en VM0, y el acceso es un permiso en lugar de un secreto compartido.
Scraping web frente a el conector de Firecrawl
VM0 también trae un conector de Firecrawl, y esa es la elección correcta si ya pagas Firecrawl y quieres el uso en tu propia cuenta, o si necesitas algo que este servicio no cubre. El integrado es el adecuado cuando preferirías no tener la cuenta en absoluto.
Scraping web frente a manejar un navegador tú mismo
Un navegador que tú operas es más capaz y mucho más trabajo, y aún tienes que convertir la página en texto legible después. Usa el navegador remoto cuando el trabajo necesite clics de verdad, y esto cuando solo quieras lo que dice la página.
En resumen
La forma por defecto de leer una página web en VM0. Si la página es pública y quieres lo que hay en ella, es un paso, sin cuenta y con un cargo por página. Todo lo que necesite iniciar sesión o hacer clic pertenece al navegador remoto.
Preguntas frecuentes
¿Necesito una cuenta de Firecrawl?
No. VM0 lee la página en tu nombre y cobra la lectura en créditos. Nunca creas una cuenta ni guardas una clave.
¿En qué se diferencia del conector de Firecrawl?
El conector corre sobre tu cuenta y tu factura de Firecrawl. Esto corre sobre las nuestras. Usa el conector si ya pagas Firecrawl o si necesitas algo que este servicio no cubre.
¿Puede leer páginas tras un login?
No. Abre páginas públicas sin inicio de sesión. Usa el navegador remoto, que puede quedarse con la sesión iniciada y que una persona puede retomar a mitad de camino.
¿Puede leer un sitio entero?
Por sí solo no. Cada lectura es una página, así que cubrir un sitio significa pedir página a página, y cada página se cobra. Conviene poner un límite.
¿Cuánto cuesta leer una página?
Créditos por lectura correcta, con un cargo mayor para el modo potente que se usa en páginas que se resisten a una lectura normal. Ese modo nunca se elige en silencio.
¿Es seguro actuar según lo que devuelve?
Trátalo como información. VM0 maneja el texto de una página web como material para leer y no como instrucciones que seguir, que es lo que impide que una página redirija al agente que la leyó.
¿Es una alternativa a Firecrawl?
Si lo que quieres es la salida de Firecrawl sin una cuenta de Firecrawl, sí. Si quieres su panel, su plan y todas sus funciones, usa el conector de Firecrawl con tu propia clave.
¿Cómo se compara el coste con un plan de scraping propio?
Los servicios de scraping venden planes mensuales con un mínimo. Aquí pagas por página en créditos sin compromiso mensual, lo que suele salir más barato para un flujo que lee unas pocas páginas por semana y peor a volúmenes muy altos.
¿Puede devolver Markdown para que lo lea un modelo?
Sí. El Markdown limpio es la forma por defecto, y es lo que convierte una página en contexto utilizable en lugar de un muro de marcado.
¿Tengo que escribir un scraper o mantener selectores?
No. No hay nada que escribir ni nada que se rompa cuando rediseñan una página, porque pides el texto de la página y no el contenido de un elemento concreto.
Cómo pides Scraping web
Describes lo que quieres en lenguaje corriente. El agente deduce qué servicio necesita y hace las llamadas.
“Lee esta página y dame las cinco cosas que importan, con la formulación exacta de cada una.”
“Saca los enlaces de este índice de documentación, luego lee los tres sobre precios y compáralos.”
“Revisa la página de precios de nuestro competidor cada lunes y avísame solo si algo ha cambiado.”