RUNNABLE CRAWLER EXAMPLES

可直接运行的代理爬虫案例

围绕真实采集流程提供完整代码:配置123Proxy网关、请求目标、解析字段、处理分页或滚动,并把结果写入JSON、JSON Lines或CSV。

框架9种完整案例网关123Proxy固定域名测试目标3类公开沙箱交付结构化文件
打开控制台获取账密
01
CHOOSE A FRAMEWORK

按你的技术栈打开完整案例

每个案例都包含安装、启动、代理认证、采集循环、终止条件和结构化输出,不省略最关键的工程代码。

02
123PROXY GATEWAYS

代码中直接使用代理网关域名

默认案例使用隧道代理爬虫混合池。复制后只需设置 PROXY_USERPROXY_PASS。切换其他动态产品时使用下表网关;最终端口和完整路由用户名以控制台生成结果为准。

代理产品网关域名端口适合任务
隧道代理proxy.123proxy.cn36923混合池 / 纯住宅池
隧道住宅代理residential.123proxy.cn33000国家地区与SESSION
不限量动态住宅unlimit.residential.123proxy.cn10253不限流量住宅任务
两类静态代理控制台分配的固定代理IP返回端口直连IP,无网关域名
三个动态产品都使用123Proxy固定网关

隧道代理、隧道住宅和不限量动态住宅分别使用上表中的固定域名与端口。两类静态代理没有网关域名,必须直连控制台分配的代理IP和返回端口。

03
VERIFY FIRST

先确认账密与代理出口

运行任何爬虫前,先用同一组网关和代理账密访问HTTP测试服务。成功返回出口IP后,再排查框架、解析器或目标页面。

export PROXY_USER="替换为控制台代理用户名"
export PROXY_PASS="替换为控制台代理密码"

curl --fail-with-body --silent --show-error \
  --proxy "http://proxy.123proxy.cn:36923" \
  --proxy-user "${PROXY_USER}:${PROXY_PASS}" \
  --connect-timeout 15 \
  --max-time 30 \
  "https://httpbin.org/ip"
04
SAFE TEST TARGETS

案例使用公开采集沙箱

httpbin

验证出口IP、请求头、状态码与超时,不承担业务采集。

https://httpbin.org/ip
Quotes to Scrape

覆盖静态分页、JavaScript渲染和无限滚动页面。

https://quotes.toscrape.com/
Books to Scrape

覆盖商品列表、详情页、相对链接和多页目录。

https://books.toscrape.com/

这些站点专用于爬虫学习和技术验证。迁移到业务目标前,仍需确认访问授权、robots规则、服务条款、个人信息和数据使用边界。

05
PRODUCT MAPPING

按采集行为选择代理套餐

采集行为推荐起点代码调整
高频HTTP列表与详情隧道代理爬虫混合池默认网关即可运行
明确国家与连续SESSION隧道住宅代理替换网关并使用完整路由用户名
持续浏览器自动化不限量动态住宅固定网关端口10253
目标系统要求固定出口长效静态代理先分配IP,再把返回代理写入代码