📢 欢迎来到万事技术论坛!本站仅讨论合法编程技术话题,严禁外挂/作弊/黑产/盗版内容,违者封号。

礼貌爬虫骨架:守 robots、限流、容错(附源码)

晚风 核心会员

写爬虫第一原则是「别把别人服务器爬挂、别碰不让爬的」。做了个异步骨架:

  • 用 urllib.robotparser 守 robots.txt,不让爬的直接 skip;
  • asyncio.Semaphore 控并发,delay 控间隔,避免打爆;
  • 超时 + 异常兜底,结果存 JSON。
if not rp.can_fetch("*", url):
    return {"url": url, "skipped": "robots"}

附件 crawler_template.zip。请只爬你有权访问的站点,并遵守其 robots 与相关法律。原创开源。

📎 附件(1)
📦
crawler_template.zip 1.5 KB · 已下载 0 次
免费 下载
附件由作者自行定价,用站内点数购买;购买后永久可下载。点数不足可在「购买邀请码」页联系管理员充值。
楼主 · 2026-09-26 18:25 · 浏览 71 · 编辑于 2026-09-26 18:25
dba_zhou 进阶会员

守 robots 这点该成为默认习惯。

1楼 · 2026-09-27 11:07
登录 后即可参与回复。