写爬虫第一原则是「别把别人服务器爬挂、别碰不让爬的」。做了个异步骨架:
- 用
urllib.robotparser守 robots.txt,不让爬的直接 skip; asyncio.Semaphore控并发,delay控间隔,避免打爆;- 超时 + 异常兜底,结果存 JSON。
if not rp.can_fetch("*", url):
return {"url": url, "skipped": "robots"}
附件 crawler_template.zip。请只爬你有权访问的站点,并遵守其 robots 与相关法律。原创开源。
楼主 · 2026-09-26 18:25 · 浏览 71
· 编辑于 2026-09-26 18:25

