Le scraping web sur VM0
Donnez un lien à un agent et il revient avec ce que la page dit vraiment, en texte propre et lisible. Aucun prestataire de scraping chez qui s'inscrire.
Données web · Aucune mise en place · Deux modes de facturation, standard et enhanced
Pointez un agent vers un lien public et il lit la page pour vous : les mots, pas les menus de navigation, les bandeaux de cookies et les pieds de page. Demandez la page en texte propre, ou seulement la liste de ses liens quand il s'agit de décider quoi lire ensuite.
VM0 fait tourner la lecture sur Firecrawl et la paie, donc personne dans votre équipe ne s'inscrit, ne garde une clé, ni ne rapproche une deuxième facture. Le périmètre reste volontairement étroit : une page par requête. Trouver les pages est le travail de la recherche web, et tout ce qui se cache derrière une connexion ou un clic relève du navigateur distant.
Ce qu'est Scraping web
Toute recherche finit par atteindre le point où un résultat ne suffit plus et où il faut ce que la page dit vraiment. Y arriver est plus difficile qu'il n'y paraît. Les pages chargent la moitié de leur contenu par script, et le texte utile se niche entre les menus, les bandeaux et les publicités.
VM0 paie cela comme un service pour que vos agents n'aient pas à le faire. L'agent envoie un lien public et récupère la page en texte propre, qu'il peut lire et résumer, ou la liste de tous ses liens.
Certaines pages résistent à une lecture normale. Pour celles-là il existe un mode plus puissant, que l'agent doit demander explicitement, parce qu'il coûte plus cher par page et que vous devez pouvoir voir quand un workflow l'a choisi.
C'est ce que l'on cherche sous le nom d'API de scraping web, et le même moteur auquel on pense en comparant les tarifs de Firecrawl à l'écriture d'un scraper maison. La différence, c'est où se trouve le compte : de votre côté, ni inscription, ni clé d'API, ni abonnement mensuel, et vous payez à la page en crédits.
Ce que Scraping web sait faire
Ce qu'un agent peut en faire, et ce qui revient quand il le fait.
Portée et limites
Ce qu'il ne fait pas, dit d'emblée, pour que personne ne bâtisse un workflow autour de quelque chose qui est hors périmètre.
Pages publiques uniquement
Aucune connexion n'entre en jeu : une page derrière un login, un paywall ou un mur anti-robots est hors périmètre. C'est à cela que sert le navigateur distant.
Une page à la fois
Il lit la page que vous lui indiquez. Il ne se promène pas dans le reste du site : lire un site entier signifie donc demander page par page et payer page par page.
Le mode coûteux est un choix
La plupart des pages se lisent très bien en mode normal. Le mode puissant coûte davantage et l'agent doit le demander, si bien qu'un workflow ne devient jamais discrètement plus cher.
Ce qui revient est de l'information, pas des ordres
Le texte d'une page web est traité comme quelque chose à lire, jamais comme des instructions à suivre. C'est ce qui empêche une page hostile de convaincre un agent de faire autre chose.
Ce que coûte Scraping web
Les services web sont facturés en crédits par appel, pas par token. Il n'y a pas de facture fournisseur séparée à rapprocher.
zero scrapeVous payez des crédits par page lue, et le mode puissant coûte plus cher que le mode normal. Il n'y a aucun abonnement Firecrawl en dessous et aucun minimum : un workflow qui lit trois pages par semaine paie trois pages par semaine.
Mise en place et accès
Rien à mettre en place
Rien à connecter. Aucune inscription Firecrawl, aucune clé à coller, rien d'ajouté à votre liste de connecteurs. C'est là la différence avec le connecteur Firecrawl du catalogue VM0 : le connecteur tourne sur votre compte et votre facture Firecrawl, celui-ci tourne sur les nôtres.
Qui peut l'utiliser
Lire des pages web est une permission que vous accordez, pas quelque chose que tout agent possède. Donnez-la aux agents et aux personnes qui en ont besoin, aussi longtemps qu'ils en ont besoin, et reprenez-la sans toucher à quoi que ce soit d'autre que cet agent sait faire.
Ce que les équipes font avec Scraping web
Lire la page derrière un résultat de recherche
La recherche vous donne un titre et deux lignes. La plupart du travail a besoin du corps du texte : le schéma est donc de chercher d'abord, choisir les deux ou trois résultats qui comptent, puis ne lire que ceux-là.
Surveiller des pages sans autre porte d'entrée
Tarifs d'un concurrent, changelogs, pages de statut, avis réglementaires. Un agent planifié lit la page, la compare à la semaine dernière et ne vous prévient que si quelque chose a bougé.
Transformer un long document en matière de travail
Une spécification, un rapport annuel, un centre d'aide. Le texte propre fait la différence entre un résumé du document et un résumé de son menu de navigation.
Quand ne pas utiliser Scraping web
Passez votre chemin quand la page demande une connexion, un clic ou un formulaire, et utilisez le navigateur distant. Passez votre chemin pour lire un site entier : le coût à la page s'accumule plus vite que la réponse ne le vaut. Et passez votre chemin quand la source publie ses propres données en bonne et due forme, presque toujours plus stables que la lecture de ses pages.
Comment cela s'appelle ailleurs
La même chose porte plusieurs noms sur le marché. Si vous avez cherché l'un d'eux, voici à quoi il correspond ici.
API de scraping web
Le nom courant du fait de payer un service pour récupérer une page et en renvoyer le texte. C'est exactement cela. Le compte et la clé appartiennent à VM0, pas à vous.
L'API Firecrawl sans clé Firecrawl
Firecrawl est le moteur en dessous. Vous obtenez sa sortie sans vous inscrire, sans générer de clé d'API ni choisir de formule Firecrawl, et l'usage apparaît sur vos crédits VM0 plutôt que sur une seconde facture.
HTML vers Markdown
La conversion que l'on écrit d'habitude soi-même : une page HTML en entrée, du Markdown propre en sortie. Elle a lieu avant que le texte n'atteigne l'agent, et c'est pourquoi un modèle consacre son attention au contenu plutôt qu'au balisage.
Scraping web par IA ou pour LLM
Un scraping dont la sortie est destinée à être lue par un modèle plutôt qu'analysée par du code. C'est la même récupération, jugée sur la lisibilité du texte et non sur la validité d'un sélecteur.
Scraping web sans code
Ici personne n'écrit de scraper. Vous demandez la page dans un message et l'agent va la chercher — c'est ce que cherchent ceux qui cherchent du scraping sans code.
Scraping web comparé
Scraping web face à faire tourner Firecrawl vous-même
Le même moteur, une quantité de travail très différente. Par vous-même : un compte, une clé que quelqu'un doit garder en sécurité, une formule à choisir et une deuxième facture à rapprocher — et chaque collègue qui veut lancer le workflow a besoin de cette clé aussi. Ici, la lecture et la facture sont chez VM0, et l'accès est une permission plutôt qu'un secret partagé.
Scraping web face à le connecteur Firecrawl
VM0 propose aussi un connecteur Firecrawl, et c'est le bon choix si vous payez déjà Firecrawl et voulez l'usage sur votre propre compte, ou s'il vous faut quelque chose que ce service ne couvre pas. L'intégré est le bon choix quand vous préféreriez ne pas avoir le compte du tout.
Scraping web face à piloter un navigateur vous-même
Un navigateur que vous opérez est plus capable et bien plus lourd, et il reste ensuite à transformer la page en texte lisible. Prenez le navigateur distant quand le travail exige vraiment des clics, et ceci quand vous voulez simplement ce que dit la page.
En bref
La façon par défaut de lire une page web sur VM0. Si la page est publique et que vous voulez ce qu'elle contient, c'est une étape, aucun compte, et un coût à la page. Tout ce qui doit se connecter ou cliquer relève du navigateur distant.
Questions fréquentes
Ai-je besoin d'un compte Firecrawl ?
Non. VM0 lit la page en votre nom et facture la lecture en crédits. Vous ne créez jamais de compte et ne détenez jamais de clé.
En quoi est-ce différent du connecteur Firecrawl ?
Le connecteur tourne sur votre compte et votre facture Firecrawl. Celui-ci tourne sur les nôtres. Prenez le connecteur si vous payez déjà Firecrawl ou s'il vous faut quelque chose que ce service ne couvre pas.
Peut-il lire des pages derrière un login ?
Non. Il ouvre des pages publiques sans connexion. Prenez le navigateur distant, qui peut rester connecté et qu'une personne peut reprendre en cours de route.
Peut-il lire un site entier ?
Pas tout seul. Chaque lecture est une page : couvrir un site signifie demander page par page, et chaque page est facturée. Il vaut mieux fixer une limite.
Combien coûte la lecture d'une page ?
Des crédits par lecture réussie, avec un montant plus élevé pour le mode puissant utilisé sur les pages qui résistent à une lecture normale. Ce mode n'est jamais choisi en silence.
Peut-on agir en confiance sur ce qui revient ?
Traitez-le comme de l'information. VM0 considère le texte d'une page web comme de la matière à lire et non comme des instructions à suivre, ce qui empêche une page de détourner l'agent qui l'a lue.
Est-ce une alternative à Firecrawl ?
Si ce que vous voulez, c'est la sortie de Firecrawl sans compte Firecrawl, oui. Si vous voulez son tableau de bord, sa formule et l'ensemble de ses fonctionnalités, prenez plutôt le connecteur Firecrawl avec votre propre clé.
Comment le coût se compare-t-il à une formule de scraping à moi ?
Les services de scraping vendent des formules mensuelles avec un minimum. Ici vous payez à la page en crédits, sans engagement mensuel : c'est en général moins cher pour un workflow qui lit quelques pages par semaine, et moins avantageux à très gros volume.
Peut-il renvoyer du Markdown lisible par un modèle ?
Oui. Le Markdown propre est la forme par défaut, et c'est ce qui rend une page utilisable comme contexte plutôt que comme un mur de balisage.
Dois-je écrire un scraper ou maintenir des sélecteurs ?
Non. Il n'y a rien à écrire et rien qui casse quand une page est refondue, parce que vous demandez le texte de la page et non le contenu d'un élément précis.
Comment demander Scraping web
Vous décrivez ce que vous voulez en langage courant. L'agent en déduit le service dont il a besoin et fait les appels.
“Lis cette page et donne-moi les cinq points qui comptent, avec la formulation exacte de chacun.”
“Extrais les liens de cet index de documentation, puis lis les trois qui portent sur les tarifs et compare-les.”
“Vérifie la page tarifs de notre concurrent chaque lundi et préviens-moi uniquement si quelque chose a changé.”