ウェブスクレイピング
ボットやスクリプトを使ってサイトからデータを自動収集すること。IP BANを避けるためにプロキシが必要になることが多い。
ウェブスクレイピングは、ウェブサイトからデータを自動的に収集することです。価格モニタリング、SEO分析、マーケットリサーチ、AIモデルの学習データ作成、コンテンツ集約など、多くの用途で使われます。
大規模なスクレイピングではプロキシが必要です。サイトは大量のリクエストを送るIPをブロックするためです。ローテーションプロキシのプールを使うと、リクエストを数千の異なるIPに分散でき、スクレイピングを検出されにくくできます。
主なツール: Scrapy、Playwright、Puppeteer、Selenium、BeautifulSoup。
仕組み
スクレイピングパイプラインには3つの層があります。HTTPリクエストを発行するフェッチャー、応答からデータを抽出するパーサー、作業をスケジュールしてリトライするオーケストレーターです。プロキシなしでは、すべてのリクエストが同じIPから発信され、ターゲットサイトは数百ヒット後にレート制限またはブロックします。フェッチャーの前にローテーションプロキシプールを置けば、各リクエストは数千のプールから新しいIPを取得し、IPごとのレート制限はもはやボトルネックではなくなります。
より難しい層はフィンガープリンティングです。Cloudflare、DataDome、PerimeterXはTLSハンドシェイク(JA3、JA4)、HTTP/2フレーム、JavaScript実行時間を検査し、クライアントが本物のブラウザかを判定します。レジデンシャルプロキシとフィンガープリント耐性のあるクライアント(生HTTPはcurl-impersonate、ブラウザはundetected-chromedriverまたはplaywright-stealth)を組み合わせれば両層に対応できます。Murphyのレジデンシャルゲートウェイがネットワーク層を担い、クライアントがブラウザ層を担います。