Seseorang mengirimi Anda tautan ke direktori yang berisi 900 entri dan meminta data tersebut disusun dalam spreadsheet paling lambat besok.
Anda bisa membuat program pengikis data. Anda juga bisa menyalin dan menempelkan data selama tiga jam. Atau, Anda bisa menginstal ekstensi Chrome gratis, mengklik empat kali, dan mendapatkan file CSV dalam waktu sembilan puluh detik.
Instant Data Scraper, yang dikembangkan oleh WebRobots, adalah opsi ketiga. Ekstensi ini memindai halaman yang sedang Anda buka, menebak bagian mana yang berisi data, dan mengekspor hasilnya ke CSV atau Excel. Tidak perlu akun, tidak perlu kode, dan gratis.
Alat ini juga merupakan alat yang kebanyakan orang tinggalkan dalam waktu sebulan, dan alasannya cukup konsisten untuk diprediksi.
Panduan ini membahas apa yang dilakukan ekstensi ini, cara menggunakannya dengan benar, lima poin spesifik di mana ekstensi ini berhenti berfungsi, dan solusi apa yang harus diambil pada masing-masing poin tersebut.
Kami menerbitkan panduan ini sebagai Geonode, penyedia proxy residensial. Proxy relevan dengan tepat satu dari lima titik kegagalan di bawah ini, dan artikel ini menjelaskan titik mana yang dimaksud — untuk empat titik lainnya, solusinya adalah alat yang sama sekali berbeda.
Apa yang Sebenarnya Dilakukan oleh Instant Data Scraper
Ekstensi ini memecahkan satu masalah spesifik: mengubah struktur berulang pada halaman web menjadi baris-baris dalam lembar kerja.
Sebagian besar data di web tersusun dalam pola-pola tertentu — kisi produk, hasil pencarian, daftar direktori, utas komentar, tabel harga. Setiap item memiliki struktur HTML yang sama dengan item di sekitarnya. Instant Data Scraper mencari struktur berulang tersebut dan menyimpulkan bahwa itulah data yang Anda inginkan.
Anda tidak perlu menulis selektor. Anda tidak perlu membuka alat pengembang. Ekstensi ini membuat perkiraan, menampilkan pratinjau tabel, dan Anda dapat menerimanya atau menunjukkannya ke blok lain di halaman tersebut.
Fitur yang Tersedia
Deteksi otomatis. Ekstensi ini memindai halaman dan mengusulkan data yang akan diekstraksi, sehingga menghilangkan langkah yang sering menghambat pengguna non-pengembang.
Penanganan paginasi. Arahkan ekstensi ini ke tombol "halaman berikutnya", dan ekstensi ini akan menelusuri urutan halaman secara otomatis, sambil menambahkan baris data seiring prosesnya.
Gulir tak terbatas. Untuk halaman yang memuat konten lebih banyak saat Anda menggulir alih-alih menggunakan paginasi, ekstensi ini dapat terus menggulir dan mengumpulkan data.
Kontrol kolom. Ubah nama kolom, sembunyikan kolom yang tidak diinginkan, dan filter sebelum mengekspor.
Ekspor ke CSV dan Excel. Langsung ke format XLS, XLSX, atau CSV.
Gratis, tanpa tingkatan. Tanpa akun, tanpa masa uji coba, tanpa batasan baris. Hal ini cukup langka sehingga layak disebutkan secara jelas.
Apa yang Bukan
Ini bukan penjadwal — tidak dapat berjalan sendiri setiap malam. Ini bukan API — tidak ada aplikasi hilir yang dapat memanggilnya. Ini bukan crawler — berfungsi pada halaman yang sedang Anda lihat, bukan di seluruh situs. Dan ini tidak mengatasi masalah pemblokiran, karena menggunakan koneksi Anda sendiri.
Cara Menggunakannya dalam Empat Langkah
1. Buka Halaman yang Memuat Data Tersebut
Buka halaman daftar yang sebenarnya, bukan halaman beranda situs tersebut. Jika data tersebut berada di balik hasil pencarian, lakukan pencarian terlebih dahulu. Jika data tersebut berada di balik proses masuk (login) yang sah, masuklah terlebih dahulu — ekstensi ini akan menampilkan apa pun yang ditampilkan oleh browser Anda.
Atur ukuran halaman setinggi yang diizinkan situs sebelum Anda mulai. Situs yang menawarkan "100 per halaman" alih-alih "20" akan mengurangi pekerjaan paginasi Anda hingga empat per lima.
2. Jalankan Ekstensi dan Periksa Tebakannya
Klik ikon ekstensi. Ekstensi ini akan memindai halaman dan menampilkan tabel pratinjau.
Tebakan ini biasanya tepat pada tata letak konvensional. Jika salah, biasanya ekstensi ini menangkap menu navigasi atau bilah samping alih-alih konten utama — ekstensi ini menawarkan tabel lain yang terdeteksi, jadi telusuri tabel-tabel tersebut hingga pratinjau sesuai dengan yang Anda inginkan.
Periksa pratinjau dengan cermat sebelum melanjutkan. Pastikan jumlah baris terlihat masuk akal, kolom-kolom sejajar, dan tidak ada yang bergeser satu posisi. Mendeteksi ketidaksejajaran sekarang akan menghemat waktu karena Anda tidak perlu menjalankan seluruh proses ulang.
3. Atur Paginasi atau Pengguliran
Untuk situs dengan paginasi, gunakan kontrol "Locate Next" dan klik tombol halaman berikutnya yang ada di situs tersebut. Ekstensi ini akan merekam elemen tersebut dan menggunakannya kembali.
Untuk pengguliran tak terbatas, alihkan ke mode pengguliran.
Atur jeda antar halaman dengan sengaja. Pengaturan defaultnya cepat. Menaikkannya menjadi dua atau tiga detik adalah perubahan paling berharga yang bisa Anda lakukan — hal ini secara drastis mengurangi kemungkinan terkena pembatasan laju (rate-limited) di tengah proses, dan pada pekerjaan 40 halaman, hal ini hanya menghabiskan waktu dua menit.
4. Jalankan dan Ekspor
Mulai proses crawling dan biarkan tab tersebut tetap terbuka. Ekstensi ini membutuhkan halaman yang terbuka dan aktif; berpindah tab atau menidurkan komputer dapat mengganggu prosesnya.
Setelah selesai, ubah nama dan hapus kolom, lalu ekspor ke CSV atau XLSX.
Periksa hasilnya sebelum Anda menggunakannya. Bandingkan jumlah baris dengan yang diklaim situs, periksa beberapa baris secara acak dengan halaman aslinya, dan perhatikan halaman terakhir secara khusus — pemotongan data biasanya muncul di bagian akhir.
Keunggulannya
Ketepatan dalam menentukan titik optimal jauh lebih berguna daripada sekadar daftar fitur.
Ekstraksi satu kali. Daftar tunggal yang Anda butuhkan sekali saja, hari ini. Waktu penyiapan kurang dari satu menit, yang tidak dapat ditandingi oleh pendekatan berbasis skrip mana pun.
Tata letak konvensional. Tabel yang dirender oleh server, kisi produk, daftar direktori, hasil pencarian — apa pun yang memiliki struktur berulang yang jelas.
Volume kecil hingga menengah. Hingga beberapa ribu baris di beberapa lusin halaman dapat ditangani dengan mudah.
Pengguna non-teknis. Inilah nilai sebenarnya. Seseorang yang belum pernah membuka terminal pun dapat mengekstrak data terstruktur dari situs web dalam hitungan menit, dan hal ini menghilangkan hambatan yang biasanya harus ditangani oleh pengembang.
Pekerjaan eksplorasi. Sebelum mengalokasikan waktu pengembangan untuk pembuat scraper, ekstensi ini menjawab pertanyaan “apakah data ini memang berbentuk seperti yang saya bayangkan?” dalam waktu sembilan puluh detik.
Jika pekerjaan Anda sesuai dengan deskripsi tersebut, hentikan membaca di sini — ekstensi ini adalah jawaban yang tepat dan semua yang tercantum di bawah ini berkaitan dengan masalah yang tidak Anda hadapi.
Di Mana Masalahnya Muncul
Lima titik kegagalan, sesuai urutan yang paling sering dialami orang.
1. Volume
Ekstensi ini berjalan di browser Anda dengan kecepatan browser, satu halaman pada satu waktu. Beberapa lusin halaman masih bisa ditangani. Beberapa ribu halaman berarti Anda harus membiarkan tab terbuka selama berjam-jam tanpa kemampuan untuk melanjutkan dengan lancar jika prosesnya terhenti.
Tidak ada pemrosesan paralel, tidak ada antrian, dan tidak ada titik pemeriksaan. Proses perayapan yang terhenti di halaman ke-300 dari 400 biasanya berarti harus memulai dari awal.
2. Pembatasan Laju dan Pemblokiran
Inilah bagian di mana proxy adalah solusi yang tepat, sehingga bagian ini mendapat ruang paling banyak.
Setiap permintaan dikirim dari alamat IP Anda sendiri. Situs yang melacak laju permintaan akan melihat satu alamat yang mengirimkan permintaan secara stabil, dengan interval waktu yang teratur, dan struktur yang identik — yang tidak mencerminkan pola penjelajahan manusia.
Yang biasanya terjadi selanjutnya adalah CAPTCHA, kemudian pembatasan laju, lalu pemblokiran sementara. Pada situs yang penting bagi bisnis Anda, jika IP kantor Anda ditandai sebagai mencurigakan, hal itu merupakan kerugian nyata.
Memperlambat kecepatan membantu dan merupakan langkah pertama yang harus dicoba. Namun, setelah melampaui volume tertentu, hal ini tidak lagi cukup, karena masalahnya bukanlah kecepatan — melainkan bahwa setiap permintaan berasal dari satu alamat. Menyebarkan permintaan ke banyak alamatlah yang benar-benar menyelesaikan masalah ini, dan itu berarti menggunakan proxy, yang tidak dapat digunakan oleh ekstensi browser per permintaan.
3. Penjadwalan
Ekstensi tersebut tidak dapat berjalan sendiri. Jika Anda membutuhkan harga setiap pagi pukul enam, seseorang harus membuka browser dan mengklik. Setiap tugas berulang memerlukan scraper yang diotomatisasi atau layanan yang dihosting.
4. Struktur yang Rumit
Deteksi otomatis mengasumsikan pola yang berulang. Sistem ini kesulitan menangani data yang tersebar di seluruh halaman alih-alih terdaftar, konten di balik interaksi seperti tab dan accordion, halaman detail yang harus dikunjungi satu per baris, serta antarmuka yang sangat bergantung pada JavaScript yang menyusun konten dengan cara yang tidak biasa.
Sistem ini juga tidak dapat mengikuti tautan dari daftar ke halaman detail dan kembali — suatu persyaratan yang sangat umum, dan menjadi hambatan besar.
5. Integrasi
Hasilnya berupa berkas yang diunduh oleh pengguna. Jika sebuah alur kerja, dasbor, atau model memerlukan data tersebut, seseorang harus memindahkan berkas tersebut setiap kali. Tidak ada API maupun webhook.
Alternatif yang Perlu Diketahui
Sesuaikan alat dengan masalah yang Anda hadapi.
Ekstensi Browser Lainnya
Beberapa ekstensi memiliki fungsi serupa, beberapa di antaranya menambahkan deteksi bidang yang dibantu AI atau eksekusi berbasis cloud. Ekstensi-ekstensi ini layak dicoba jika deteksi adalah masalah spesifik Anda — namun, mereka memiliki keterbatasan mendasar yang sama: browser Anda, alamat IP Anda, dan klik Anda.
Mengganti ekstensi memang dapat mengatasi masalah deteksi. Namun, hal ini tidak menyelesaikan masalah volume, penjadwalan, pemblokiran, atau integrasi.
Aplikasi Pengikis Visual
Alat desktop dan cloud dengan pembuat antarmuka "point-and-click" berada di tingkat yang lebih tinggi. Alat-alat ini menangani alur kerja multi-langkah, kunjungan ke halaman detail, dan eksekusi di cloud yang dijadwalkan. Sebagian besar bersifat komersial.
Ini adalah langkah yang tepat ketika struktur situs Anda terlalu kompleks untuk deteksi otomatis, tetapi Anda tetap tidak ingin menulis kode.
Menulis Sendiri
Python dengan requests dan BeautifulSoup mendukung halaman yang dirender di server. Playwright atau Selenium menangani situs yang sarat JavaScript. Scrapy menangani perayapan skala besar dengan fitur percobaan ulang dan koncurrency yang terintegrasi.
Ini adalah metode yang paling fleksibel namun juga paling banyak kerjaannya. Metode ini menjadi layak dilakukan begitu pekerjaan tersebut bersifat berulang, karena Anda cukup menulisnya sekali dan program tersebut akan berjalan selamanya.
Menggores API
Layanan yang menerima URL dan mengembalikan data yang telah diparsing, serta menangani rotasi dan rendering di sisi server. Anda menukar biaya per permintaan dengan tidak perlu mengelola infrastruktur.
Cocok jika Anda ingin mendapatkan data tanpa harus mengelola infrastruktur pendukungnya.
Proksi dengan Kode Anda Sendiri
Anda tetap mengendalikan scraper dan mengarahkan permintaan melalui alamat yang berganti-ganti. Lebih banyak pekerjaan daripada menggunakan API, lebih murah jika dilakukan dalam volume besar, dan Anda memiliki kendali penuh atas logikanya.
Inilah pilihan yang diambil sebagian besar tim begitu tugas pengikisan data menjadi permanen.
Memperluas Cakupan Melampaui Ekstensi
Ketika suatu tugas yang semula hanya dilakukan sekali menjadi tugas berulang, sifat masalahnya pun berubah.
Mengenali Waktunya
Lakukan tindakan ini jika salah satu dari hal berikut terjadi: pekerjaan tersebut dijalankan lebih dari sekali, jumlah halamannya melebihi beberapa ratus, Anda terkena batasan kecepatan, hasilnya menjadi masukan untuk sistem otomatis, atau strukturnya memerlukan tautan lanjutan ke halaman detail.
Seperti Apa Penggantinya
Versi skrip dasar dari apa yang dilakukan ekstensi:
import time
import requests
from bs4 import BeautifulSoup
proxies = {
"http": "http://USERNAME:PASSWORD@proxy.geonode.io:9000",
"https": "http://USERNAME:PASSWORD@proxy.geonode.io:9000",
}
rows = []
for page in range(1, 41):
r = requests.get(
f"https://example.com/listings?page={page}",
proxies=proxies,
timeout=30,
)
if r.status_code != 200:
print(f"page {page}: HTTP {r.status_code}")
continue
soup = BeautifulSoup(r.text, "html.parser")
for item in soup.select(".listing-item"):
rows.append({
"title": item.select_one(".title").get_text(strip=True),
"price": item.select_one(".price").get_text(strip=True),
})
time.sleep(2)
print(f"collected {len(rows)} rows")
Sekitar tiga puluh baris, dan skrip ini memiliki keunggulan yang tidak ditawarkan ekstensi: berjalan tanpa pengawasan, dilanjutkan dari halaman yang diketahui, dan menyebarkan permintaan ke banyak alamat alih-alih membebani satu alamat saja.
Berapa Biaya Proksi pada Skala Ini
Pengambilan teks relatif ringan. Satu halaman HTML tanpa gambar biasanya berukuran 50–200 KB, sehingga sepuluh ribu halaman akan mencapai sekitar 1–2 GB.
Dengan tarif awal [Geonode
](https://geonode.com/pricing) sebesar $0,79 per GB, biayanya kira-kira $1 hingga $2 untuk seluruh pekerjaan — dan akun baru mendapatkan 1 TB gratis, yang cukup untuk menangani banyak pekerjaan seukuran itu sebelum harus mengeluarkan uang. Tarif turun menjadi $0,50 per GB pada 100 GB dan $0,27 pada 1 TB.
Pandangan yang jujur: pada sepuluh ribu halaman, biayanya tetap tidak signifikan, dan alasan untuk beralih adalah keandalan, bukan harga. Harga mulai menjadi pertimbangan saat jumlah halaman mencapai jutaan — dan di situlah tarif per GB antar penyedia, yang berkisar antara $0,79 hingga $7,00, mulai berdampak signifikan secara finansial.
Pertahankan Ekstensi Ini
Bahkan setelah Anda memiliki alur kerja yang mapan, ekstensi ini tetap berguna untuk hal yang menjadi keunggulannya: memeriksa apakah sumber baru layak untuk dikembangkan, sebelum menulis satu baris kode pun.
Tetap Berada di Sisi yang Benar
Fitur ekstensi ini memudahkan pengumpulan data, sehingga Anda cenderung mengabaikan pertanyaan apakah Anda seharusnya melakukannya.
Baca ketentuan layanan. Banyak situs secara eksplisit melarang pengumpulan data secara otomatis. Fakta bahwa suatu alat gratis dan mudah digunakan tidak mengubah apa yang telah Anda setujui saat menggunakan situs tersebut.
Prioritaskan data publik. Daftar, harga, dan spesifikasi yang dapat dilihat publik jauh lebih aman daripada informasi yang tersembunyi di balik login atau data pribadi. Jangan mengumpulkan informasi pribadi tentang individu tanpa dasar hukum yang sah.
Hormati kapasitas situs. Bahkan jika pengumpulan data diizinkan, frekuensi pengumpulan yang berlebihan akan menurunkan kualitas layanan bagi pengguna sebenarnya. Jeda antar permintaan adalah bentuk sopan santun yang sekaligus memastikan Anda tidak diblokir.
Periksa robots.txt. Ini bukan instrumen hukum, tetapi memberi tahu Anda apa yang diinginkan oleh operator, dan mengabaikannya akan melemahkan argumen itikad baik Anda di kemudian hari.
Hak cipta tetap berlaku. Fakta umumnya tidak dilindungi; konten kreatiflah yang dilindungi. Mengekstrak harga berbeda dengan mempublikasikan ulang artikel.
Yurisdiksi bervariasi. Aturan berbeda-beda di setiap negara dan mungkin bergantung pada tempat Anda beroperasi, lokasi infrastruktur Anda, serta lokasi subjek data. Untuk pekerjaan yang signifikan secara komersial, mintalah nasihat yang spesifik untuk situasi Anda.
Pertanyaan Populer
Apakah Instant Data Scraper gratis?
Ya. Ekstensi Chrome ini gratis dengan fitur lengkap dan tanpa tingkatan berbayar atau batasan penggunaan, yang cukup langka di kategori ini. Tidak ada persyaratan akun dan tidak ada masa uji coba.
Apakah ekstensi ini berfungsi di semua situs web?
Tidak. Ekstensi ini bekerja dengan baik pada halaman yang memiliki struktur berulang yang jelas — tabel, kisi produk, hasil pencarian, daftar direktori. Ekstensi ini mengalami kesulitan dengan data yang tersebar di seluruh halaman alih-alih terdaftar, konten di balik tab atau accordion, serta situs yang mengharuskan mengikuti tautan ke halaman detail dan kembali.
Mengapa proses pengambilan data saya terhenti di tengah jalan?
Biasanya karena pembatasan laju (rate limiting). Setiap permintaan berasal dari alamat IP Anda sendiri dengan ritme yang stabil dan mirip mesin, dan banyak situs membatasi atau memblokir pola tersebut. Meningkatkan jeda antar halaman menjadi dua atau tiga detik biasanya menyelesaikan sebagian besar masalah. Jika volume permintaan melebihi batas tertentu, solusinya adalah mendistribusikan permintaan ke beberapa alamat IP, yang tidak dapat dilakukan oleh ekstensi browser.
Bisakah saya menjadwalkannya agar berjalan otomatis?
Tidak. Ekstensi ini memerlukan tab browser yang terbuka dan seseorang untuk memulainya. Tugas berulang memerlukan scraper berbasis skrip atau layanan pengikisan yang dihosting.
Apakah menggunakan ekstensi ini akan membuat alamat IP saya diblokir?
Bisa saja, terutama di situs yang secara aktif memantau laju permintaan. Risikonya meningkat seiring dengan volume dan kecepatan. Jika situs tersebut penting bagi bisnis Anda, gunakan jeda waktu dengan hati-hati — jika alamat kantor Anda ditandai sebagai sumber masalah, itu akan menimbulkan kerugian nyata.
Kapan saya sebaiknya beralih ke solusi lain?
Ketika tugas tersebut berulang, melebihi beberapa ratus halaman, telah memicu pembatasan laju permintaan, menjadi sumber data untuk sistem otomatis, atau perlu mengikuti tautan ke halaman detail. Salah satu dari kondisi tersebut sudah menjadi alasan yang masuk akal untuk beralih.
Apakah saya memerlukan proxy untuk ekstensi browser?
Tidak — dan Anda juga tidak dapat menggunakannya per permintaan dengan ekstensi tersebut. Proxy menjadi relevan ketika Anda beralih ke scraper berbasis skrip, yang juga merupakan titik di mana pemblokiran biasanya menjadi masalah utama.
Kesimpulan
Instant Data Scraper sangat unggul dalam satu hal: mengubah halaman terstruktur menjadi spreadsheet, secara gratis, dalam waktu kurang dari satu menit, tanpa perlu kode. Untuk ekstraksi satu kali dari daftar konvensional, tidak ada yang bisa mengalahkannya dalam hal kecepatan menghasilkan hasil.
Alat ini memiliki lima batasan, dan semuanya dapat diprediksi. Volume, karena alat ini berjalan sesuai kecepatan browser pada satu halaman sekaligus. Pembatasan laju, karena setiap permintaan dikirim dari alamat IP Anda sendiri. Penjadwalan, karena memerlukan campur tangan manusia dan tab yang tetap terbuka. Struktur, karena deteksi otomatis mengasumsikan pola berulang dan tidak dapat mengikuti tautan ke halaman detail. Integrasi, karena hasilnya berupa file, bukan endpoint.
Batasan mana yang Anda temui akan menentukan langkah selanjutnya. Masalah deteksi mengarah pada ekstensi lain atau scraper visual. Batasan penjadwalan dan struktur mengarah pada pembuatan scraper sendiri. Batasan integrasi mengarah pada penggunaan API scraping. Pemblokiran adalah kasus di mana proxy menjadi solusinya, karena masalah dasarnya bukan kecepatan, melainkan fakta bahwa setiap permintaan berasal dari alamat tunggal.
Dan saat Anda memang beralih, angkanya lebih kecil daripada yang diperkirakan kebanyakan orang: sepuluh ribu halaman teks kira-kira 1–2 GB, yang harganya hanya beberapa dolar dengan tarif dasar dan masih jauh di bawah kuota gratis. Pada skala tersebut, alasan untuk beralih adalah keandalan, bukan biaya.
Kebiasaan yang berguna adalah mempertahankan keduanya. Ekstensi untuk pengintaian — apakah sumber ini layak dijadikan dasar pengembangan? Pipa untuk apa pun yang harus dijalankan dua kali.