此场景的亮点
抓取为什么必须用代理?
现代网站几秒内就能发现来自单一 IP 的密集请求:先是请求限制生效,接着 CAPTCHA 墙升起,然后 IP 被彻底封禁。代理层改变了这个等式 — 当你的请求分散到数百个不同 IP 上,每个地址的节奏都保持在网站认为正常的低水平。
一次成功的抓取业务,对代理的要求可以归结为三点: IP 多样性 (IP 池规模)、 IP 质量 (住宅/数据中心的平衡)以及 自动轮换.
该选哪种代理?
| 目标网站类型 | 推荐的代理 | 原因 |
|---|---|---|
| 防护激进(电商平台、社交网络) | Residential + 轮换 | 真实用户 IP 能越过防护 |
| 中等防护(新闻、分类信息网站) | Rotating 住宅代理或混合 | 成本与成功率的平衡 |
| 无防护(开放数据源、API) | Datacenter | 速度最高,成本最低 |
| 支持 IPv6 的大型目标 | IPv6 | 十分之一的成本,海量数量 |
不被封的 5 条基本规则
- 让请求节奏更像人: 不要按固定间隔发请求,要用随机延迟。
- 把轮换设计对: 列表页用按请求轮换,需要会话的流程用 sticky session。
- 让 header 保持真实: 最新的 User-Agent、Accept-Language 和一致的 cookie 管理。
- 量化失败: 如果 403/429 比例在上升,就降低节奏或扩大 IP 池。
- 尊重 robots.txt 和法律边界: 可持续的抓取,从尊重目标站点的规则开始。
更深入的技巧,请阅读 web scraping 的代理选择 这篇文章。
工具集成
Scrapy、Playwright、Puppeteer、Selenium 以及所有 HTTP 客户端,都只需一行 gateway 配置:
--proxy gw.freeproxy.tr:7777 --proxy-user kullanici:sifre — 你这边只有一行代码;轮换、retry 和 IP 健康由我们管理。
从小规模开始,再扩展
先用免费代理 IP 地址测试你的流程;进入生产负载时,再用按 GB 计费的住宅代理套餐继续。
常见问题
01抓取需要多少 GB 流量?
一个 HTML 页面平均 0.5-2 MB。如果不下载图片、只取 HTML,25 GB 的套餐大约够抓 25.000-50.000 个页面。
02遇到 CAPTCHA 怎么办?
CAPTCHA 出现的比例,与 IP 质量和请求节奏直接相关。换用住宅 IP 池并降低节奏能明显减少;剩下的个别情况,请把流程设计成可以重试。
03JavaScript 重度的网站怎么抓?
用 Playwright 或 Puppeteer 这类无头浏览器。两者都原生支持代理参数;配合 sticky session,页面内跳转也能顺畅工作。
04Web scraping 合法吗?
采集公开数据在许多国家是合法的;但必须遵守目标网站的使用条款、版权和个人数据法规。有疑问时请咨询法律意见。