Web scraping di VM0
Beri agen sebuah tautan dan ia kembali dengan isi halaman yang sebenarnya, dalam teks bersih yang mudah dibaca. Tanpa mendaftar ke vendor scraping mana pun.
Data web · Tanpa penyiapan · Dua mode penagihan, standar dan enhanced
Arahkan agen ke sebuah tautan publik dan ia membaca halamannya untuk Anda: kata-katanya, bukan menu navigasi, spanduk cookie, dan footer. Minta halamannya sebagai teks bersih, atau cukup daftar tautannya kalau tugasnya adalah memutuskan apa yang dibaca berikutnya.
VM0 menjalankan pembacaannya di Firecrawl dan membayarinya, jadi tidak ada anggota tim Anda yang mendaftar, menyimpan kunci, atau merekonsiliasi tagihan kedua. Cakupannya sengaja sempit: satu halaman per permintaan. Menemukan halaman adalah tugas pencarian web, dan apa pun di balik login atau klik adalah urusan browser jarak jauh.
Apa itu Web scraping
Setiap riset sampai di titik ketika hasil pencarian tidak cukup dan Anda butuh isi halaman yang sebenarnya. Melakukannya dengan benar lebih sulit daripada kelihatannya. Halaman memuat separuh isinya dengan skrip, dan teks yang berguna terselip di antara menu, spanduk, dan iklan.
VM0 membayari itu sebagai layanan supaya agen Anda tidak perlu. Agen mengirim satu tautan publik dan menerima halamannya sebagai teks bersih yang bisa ia baca dan ringkas, atau sebagai daftar semua tautan di dalamnya.
Sebagian halaman menolak dibaca dengan cara biasa. Untuk itu ada mode yang lebih kuat, dan agen harus memintanya, karena biayanya per halaman lebih tinggi dan Anda harus bisa melihat ketika sebuah alur kerja memilihnya.
Ini hal yang sama yang dicari orang sebagai API web scraping, dan mesin yang sama yang dibandingkan orang antara harga Firecrawl dan menulis scraper sendiri. Bedanya di mana akunnya berada: di sini tidak ada pendaftaran, kunci API, maupun paket bulanan di pihak Anda, dan Anda membayar per halaman dalam kredit.
Apa yang bisa dilakukan Web scraping
Apa yang bisa dikerjakan agen dengannya, dan apa yang kembali saat ia mengerjakannya.
Cakupan dan batas
Apa yang tidak dilakukannya, disebutkan sejak awal, supaya tidak ada yang menyusun alur kerja di atas sesuatu yang di luar cakupan.
Hanya halaman publik
Tidak ada login yang terlibat, jadi halaman di balik login, paywall, atau tembok anti-bot berada di luar cakupan. Untuk itulah browser jarak jauh ada.
Satu halaman sekali jalan
Ia membaca halaman yang Anda tunjuk. Ia tidak berkeliaran ke bagian lain situs, jadi membaca satu situs penuh berarti meminta halaman demi halaman dan membayar halaman demi halaman.
Mode mahal adalah pilihan
Sebagian besar halaman terbaca baik dengan cara biasa. Mode yang lebih kuat lebih mahal dan agen harus memintanya, jadi sebuah alur kerja tidak pernah diam-diam jadi lebih mahal.
Yang kembali adalah informasi, bukan perintah
Teks dari halaman web diperlakukan sebagai bahan bacaan, tidak pernah sebagai instruksi yang harus dituruti. Itulah yang mencegah halaman bermusuhan membujuk agen mengerjakan hal lain.
Berapa biaya Web scraping
Layanan web ditagih dalam kredit per panggilan, bukan per token. Tidak ada tagihan vendor terpisah yang perlu direkonsiliasi.
zero scrapeAnda membayar dalam kredit per halaman yang dibaca, dan mode yang lebih kuat lebih mahal daripada yang biasa. Tidak ada langganan Firecrawl di bawahnya dan tidak ada minimum, jadi alur kerja yang membaca tiga halaman seminggu membayar tiga halaman seminggu.
Penyiapan dan akses
Tidak ada yang perlu disiapkan
Tidak ada yang perlu dihubungkan. Tidak ada pendaftaran Firecrawl, tidak ada kunci untuk ditempel, tidak ada tambahan di daftar konektor Anda. Itulah bedanya dengan konektor Firecrawl di katalog VM0: konektor berjalan di akun dan tagihan Firecrawl Anda, sedangkan ini berjalan di milik kami.
Siapa yang boleh memakainya
Membaca halaman web adalah izin yang Anda bagikan, bukan sesuatu yang otomatis dimiliki setiap agen. Berikan kepada agen dan orang yang membutuhkannya, selama mereka membutuhkannya, dan tarik kembali tanpa menyentuh kemampuan lain agen itu.
Untuk apa tim memakai Web scraping
Membaca halaman di balik hasil pencarian
Pencarian memberi Anda judul dan dua baris. Sebagian besar pekerjaan butuh isi utamanya, jadi polanya adalah cari dulu, pilih dua atau tiga hasil yang penting, lalu baca hanya yang itu.
Memantau halaman yang tak punya pintu masuk lain
Harga pesaing, changelog, halaman status, pengumuman regulator. Agen terjadwal membaca halamannya, membandingkannya dengan pekan lalu, dan memberi tahu Anda hanya ketika ada yang bergeser.
Mengubah dokumen panjang jadi bahan kerja
Sebuah spesifikasi, laporan tahunan, pusat bantuan. Teks bersih adalah beda antara ringkasan dokumennya dan ringkasan menu navigasinya.
Kapan tidak memakai Web scraping
Lewati kalau halamannya butuh login, klik, atau formulir, dan pakai browser jarak jauh. Lewati untuk membaca satu situs penuh, karena biaya per halaman menumpuk lebih cepat daripada nilai jawabannya. Dan lewati kalau sumbernya menerbitkan datanya sendiri, yang hampir selalu lebih stabil daripada membaca halamannya.
Sebutan lain di tempat lain
Hal yang sama beredar di pasar dengan beberapa nama. Kalau Anda pernah mencari salah satunya, begini padanannya dengan yang Anda dapat di sini.
API web scraping
Nama umum untuk membayar layanan agar mengambil halaman dan mengembalikan teksnya. Persis itu yang ini. Akun dan kuncinya milik VM0, bukan milik Anda.
API Firecrawl tanpa kunci Firecrawl
Firecrawl adalah mesin di baliknya. Anda mendapat keluarannya tanpa mendaftar, membuat kunci API, atau memilih paket Firecrawl, dan pemakaiannya muncul di kredit VM0 Anda, bukan di faktur kedua.
HTML ke Markdown
Konversi yang biasanya ditulis orang sendiri: halaman HTML masuk, Markdown bersih keluar. Itu terjadi sebelum teksnya sampai ke agen, sehingga model memakai perhatiannya pada isi, bukan markup.
Scraping untuk AI atau LLM
Scraping yang keluarannya dimaksudkan untuk dibaca model, bukan diurai kode. Pengambilan yang sama, hanya dinilai dari apakah teksnya terbaca, bukan dari apakah suatu selektor masih cocok.
Scraping tanpa kode
Di sini tidak ada yang menulis scraper. Anda meminta halamannya lewat pesan dan agen yang mengambilnya, dan itulah yang dicari orang ketika mencari scraping tanpa menulis kode.
Web scraping dibandingkan
Web scraping versus menjalankan Firecrawl sendiri
Mesinnya sama, kerjanya jauh berbeda. Sendiri berarti sebuah akun, sebuah kunci yang harus dijaga seseorang, paket yang harus dipilih, dan tagihan kedua yang harus direkonsiliasi, dan setiap rekan yang ingin menjalankan alur kerjanya juga butuh kunci itu. Di sini pembacaan dan tagihannya sama-sama di VM0, dan aksesnya berupa izin, bukan rahasia bersama.
Web scraping versus konektor Firecrawl
VM0 juga menyediakan konektor Firecrawl, dan itu pilihan yang tepat kalau Anda memang sudah membayar Firecrawl dan ingin pemakaiannya di akun sendiri, atau butuh sesuatu yang tidak dicakup layanan ini. Yang bawaan tepat kalau Anda lebih suka tidak punya akunnya sama sekali.
Web scraping versus menjalankan browser sendiri
Browser yang Anda kendalikan lebih mampu dan jauh lebih merepotkan, dan setelahnya Anda tetap harus mengubah halamannya jadi teks yang terbaca. Pakai browser jarak jauh kalau pekerjaannya memang butuh klik, dan ini kalau Anda hanya butuh isi halamannya.
Ringkasnya
Cara baku membaca halaman web di VM0. Kalau halamannya publik dan Anda ingin isinya, ini satu langkah, tanpa akun, dengan biaya per halaman. Apa pun yang butuh login atau klik adalah urusan browser jarak jauh.
Pertanyaan yang sering diajukan
Apakah saya butuh akun Firecrawl?
Tidak. VM0 membaca halamannya atas nama Anda dan menagih pembacaannya dalam kredit. Anda tidak pernah membuat akun atau menyimpan kunci.
Apa bedanya dengan konektor Firecrawl?
Konektor berjalan di akun dan tagihan Firecrawl Anda. Ini berjalan di milik kami. Pakai konektor kalau Anda sudah membayar Firecrawl atau butuh sesuatu yang tidak dicakup layanan ini.
Bisakah ia membaca halaman di balik login?
Tidak. Ia membuka halaman publik tanpa login. Pakai browser jarak jauh, yang bisa tetap masuk dan bisa diambil alih orang di tengah jalan.
Bisakah ia membaca seluruh situs web?
Sendiri tidak. Setiap pembacaan adalah satu halaman, jadi mencakup satu situs berarti meminta halaman demi halaman, dan tiap halaman ditagih. Sebaiknya tetapkan batas.
Berapa biaya membaca satu halaman?
Kredit per pembacaan berhasil, dengan biaya lebih tinggi untuk mode kuat yang dipakai pada halaman yang menolak dibaca secara biasa. Mode itu tidak pernah dipilih diam-diam.
Amankah bertindak berdasarkan yang kembali?
Perlakukan sebagai informasi. VM0 menangani teks halaman web sebagai bahan bacaan, bukan instruksi yang dituruti, dan itulah yang mencegah sebuah halaman membelokkan agen yang membacanya.
Apakah ini alternatif Firecrawl?
Kalau yang Anda mau adalah keluaran Firecrawl tanpa akun Firecrawl, ya. Kalau Anda mau dasbor, paket, dan seluruh fiturnya, pakai konektor Firecrawl dengan kunci Anda sendiri.
Bagaimana biayanya dibanding paket scraping saya sendiri?
Layanan scraping menjual paket bulanan dengan minimum. Di sini Anda membayar per halaman dalam kredit tanpa komitmen bulanan, yang biasanya lebih murah untuk alur kerja yang membaca beberapa halaman seminggu dan kurang menguntungkan pada volume sangat besar.
Bisakah ia mengembalikan Markdown untuk dibaca model?
Bisa. Markdown bersih adalah bentuk bakunya, dan itulah yang membuat sebuah halaman bisa dipakai sebagai konteks, bukan sebagai tembok markup.
Apakah saya harus menulis scraper atau merawat selektor?
Tidak. Tidak ada yang perlu ditulis dan tidak ada yang rusak ketika halaman didesain ulang, karena Anda meminta teks halamannya, bukan isi satu elemen tertentu.
Cara meminta Web scraping
Anda jelaskan yang Anda mau dengan bahasa sehari-hari. Agen yang menentukan layanan mana yang dibutuhkan lalu melakukan panggilannya.
“Baca halaman ini dan beri saya lima hal yang penting, dengan kata-kata persisnya untuk tiap poin.”
“Ambil tautan dari indeks dokumentasi ini, lalu baca tiga yang soal harga dan bandingkan.”
“Cek halaman harga pesaing kami setiap Senin dan beri tahu saya hanya kalau ada yang berubah.”