このシナリオのポイント
スクレイピングになぜプロキシが必須か
現代のサイトは、単一の IP から届く大量のリクエストを数秒で検出します。レート制限が働き、CAPTCHA の壁が立ち、最後には IP が完全にブロックされます。プロキシの層はこの図式を変えます。リクエストが数百の異なる IP に分散すれば、各アドレスはサイトが正常と見なす低いペースにとどまります。
成功するスクレイピング運用のプロキシ要件は、3 つに集約できます: IPの多様性 (プールの規模)、 IP の品質 (レジデンシャルとデータセンターのバランス)、そして 自動ローテーション.
どのプロキシタイプを選ぶべきか
| 対象サイトの種類 | 推奨プロキシ | 理由 |
|---|---|---|
| 強い保護あり(マーケットプレイス、SNS) | レジデンシャル + ローテーション | 実ユーザーの IP が保護を突破 |
| 中程度の保護(ニュース、掲示サイト) | Rotating レジデンシャルまたは混在 | コストと成功率のバランス |
| 保護なし(公開ソース、API) | データセンター | 最高の速度、最低のコスト |
| IPv6 対応の大規模ターゲット | IPv6 | 10 分の 1 のコストで膨大な数 |
BAN されないための 5 つの基本ルール
- リクエストの間隔を人間らしくする: 一定の間隔ではなく、ランダムな遅延でリクエストを送ってください。
- ローテーションを正しく組む: 一覧ページではリクエスト単位、セッションが必要な流れでは sticky session を使ってください。
- ヘッダーを現実的に保つ: 最新の User-Agent、Accept-Language、一貫したクッキー管理。
- 失敗を計測する: 403/429 の比率が上がっているなら、ペースを落とすか IP プールを広げてください。
- robots.txt と法的な境界を尊重する: 持続可能なスクレイピングは、対象のルールを尊重することから始まります。
より踏み込んだ技術は web scraping のためのプロキシ選び の記事をお読みください。
ツール連携
Scrapy、Playwright、Puppeteer、Selenium、そしてすべての HTTP クライアントが、ゲートウェイの設定 1 つで動きます:
--proxy gw.freeproxy.tr:7777 --proxy-user kullanici:sifre — コード側は 1 行だけ。ローテーション、retry、IP の健全性は当社側で管理します。
小さく始めてスケールする
まずは無料のプロキシ IP アドレスでフローをテストし、本番の負荷へ移るときは GB 単位のレジデンシャルパッケージで続けてください。
よくある質問
01スクレイピングには何 GB のトラフィックが必要ですか?
平均的な HTML ページは 0.5-2 MB です。画像を取得せず HTML だけを取るなら、25 GB のパッケージでおよそ 25.000-50.000 ページのスクレイピングに足ります。
02CAPTCHA が出たらどうすべきですか?
CAPTCHA の発生率は、IP の品質とリクエストのペースに直結します。レジデンシャルプールに切り替えてペースを落とせば大きく下がります。残る例外については、フローを再試行できるように組んでください。
03JavaScript 主体のサイトはどうスクレイピングしますか?
Playwright や Puppeteer のようなヘッドレスブラウザを使います。どちらもプロキシのパラメータを標準で備えており、sticky session を使えばページ内の遷移も問題なく動きます。
04Web scraping は合法ですか?
公開データの収集は多くの国で合法です。ただし、対象サイトの利用規約、著作権および個人データ関連法を考慮する必要があります。判断に迷う場合は法的な助言を受けてください。