WebHarvyは、ウェブサイトからあらゆる種類の情報を収集し、それらをさまざまな形式で保存できるデータスクレイパーです。これには、ユーザーが希望するあらゆるウェブサイトからのテキスト、HTML、画像、URL、メールアドレスなどが含まれます。WebHarvyは多くのプロセスを簡略化しているため、初心者でも簡単に利用できます。
大量のデータを抽出したい場合は、WebHarvyを使用する際にWebHarvyプロキシを利用する必要があります。ほとんどのウェブサイトは、サイト内でのボットの使用に対して厳しい制限を設けており、ボットの使用が検出されたアカウントは即座に利用停止処分となります。
WebHarvyプロキシは、すべてのウェブリクエストを代行処理するため、利用停止を防ぐことができます。レジデンシャルプロキシを使用し、IPアドレスを継続的にローテーションさせることで、WebHarvyは設定された時間間隔ごとに異なるIPアドレスを使用します。これにより、WebHarvyボットがリクエストを送信するたびに、ウェブサイト側には毎回異なるユーザーからのリクエストであると認識させることができます。
それでは、WebHarvyプロキシサーバーを設定してみましょう。








