claude-code-skill-scrapling Skill:让 Claude 自动判断最优网页抓取方案
claude-code-skill-scrapling:让 Claude 自动判断用哪种方式抓取网页
在 Claude Code 里让 AI 帮你写爬虫,经常遇到这样的尴尬:需求其实很简单,一个命令行就能搞定,但 Claude 不管三七二十一直接生成一套冗长的 Python 脚本;反过来,碰到 Cloudflare 防护站点时,简单脚本根本跑不通,它又不会自动切换策略。claude-code-skill-scrapling 解决的就是这个问题——在Claude Code 里装上这个 Skill,AI 会自动判断目标网站特征,替你选最合适的抓取方案,从”一行命令直接搞定”到”生成带反反爬的完整脚本”都能自适应。
这个 Skill 的核心逻辑建立在 Scrapling 库之上。Scrapling 是一个主打”智能适配”的 Python 网页抓取库,同一接口下封装了普通 Fetcher、隐身 Fetcher、动态Fetcher、Session Fetcher 等多种引擎,claude-code-skill-sckill 在此基础上又加了一层决策树:Claude 接收到抓取请求后,先分析 URL 和目标网站类型,再决定用哪个 Fetcher、要不要绕过 Cloudflare、是否需要先登录。
GitHub 数据显示(截至 2026-08-10):该仓库共获得 386 stars、52 forks,最近一次更新为 2026 年 6 月,距今约 2 个月;初始提交为 2026 年 3 月。规模不大,但质量结构完整,references/ 和 templates/ 分层清晰,属于典型的”小而精”型 Skill,最近在 GitHub Trending 上露面,显示出社区关注度正在上升。
链接
GitHub:https://github.com/Cedriccmh/claude-code-skill-scrapling
原作者
由 Cedric Chen(GitHub @Cedriccmh)开发维护,主要贡献者还包括 @cedric(Cedric Howe)和 @codex。3 人团队,MIT 许可证,Python 100%。
介绍
claude-code-skill-scrapling 的 README 开头就说明了定位:一个基于 Scrapling 的 Claude Code Skill,用于网页数据抓取和提取。核心设计理念是”渐进式复杂度”——简单任务走 CLI捷径,复杂任务才生成完整 Python 脚本,而不是反过来把简单问题复杂化。
SKILL.md 本身只是一个入口文件,核心能力分布在 references/ 目录的多个子文件中:API 速查表(api-quick-ref.md)、Cookie 保险库模板(cookie-vault.md)、站点模式库(site-patterns.md)、故障排查指南(troubleshooting.md)、安全边界说明(security.md)。这种分层结构的好处是:SKILL.md 主文件保持精简(激活时消耗的 token 很少),详细指令按需加载,不会污染上下文。
特点
- Fetcher 决策树:自动在 Fetcher、StealthyFetcher、DynamicFetcher、FetcherSession、Selector 之间选择最优方案,Claude 无需人工指定
- Cloudflare / WAF 绕过:通过 StealthyFetcher(底层基于 Camoufox)内置支持反爬虫防护站点,无需手动配置
- Session 登录:支持 HTTP 表单登录,cookie 持久化到本地,再次抓取同一站点无需重新认证
- 站点模式库:收录了 Discourse 论坛、SPA、静态博客、API 等常见站点类型的可复用抓取模式
- Cookie 保险库:本地加密存储登录 cookie,按站点提供模板,cookie 值绝不提交到版本控制
- 安全边界:references/security.md 明确覆盖授权边界、Prompt injection 防护、–ai-targeted 参数使用规范,以及 cookie/token 脱敏处理
- 上游同步:references/upstream-map.md 保持 Skill 与 D4Vinci/Scrapling 官方库的功能对齐,Scrapling 更新后 Skill 不掉队
使用方法
第一步:安装 scrapling
# pip
pip install "scrapling[fetchers]"
scrapling install # 安装浏览器依赖
# 或 uv(项目内)
uv add "scrapling[fetchers]"
uv run scrapling install
第二步:安装 Skill
# 复制到用户级 skills(所有项目可用)
cp -r . ~/.claude/skills/scrapling
# 或复制到特定项目
cp -r . /path/to/project/.claude/skills/scrapling
第三步:直接让 Claude 干活
安装完成后,当你对 Claude Code 说出以下需求时,Skill 自动激活:
- “帮我抓取这个页面的标题和正文”
- “提取这个电商网站的所有商品价格”
- “这个站有 Cloudflare,帮我绕过抓取”
- “我有这段 HTML,提取里面所有链接”
简单任务优先走 Scrapling CLI,默认带上 –ai-targeted 参数,不需要写 Python:
scrapling extract get "https://example.com/article" article.md --ai-targeted
scrapling extract stealthy-fetch "https://protected.example.com" page.md --ai-targeted --solve-cloudflare
复杂多页抓取才生成并执行 Python 脚本,全程 Claude 自动判断。
使用场景与人群
适用场景:
- 需要定期从特定网站提取结构化数据(如竞品价格、职位信息、新闻标题)
- 碰到 Cloudflare 或 WAF 防护站点,普通 requests 无法访问
- 需要登录后才能抓取内容(如社交媒体、内部后台)
- 想让 AI 在不写爬虫的前提下快速获取网页文本
目标用户:
- 数据分析师、市场调研人员:需要批量获取公开网页数据
- 开发者:快速为项目写数据管道,不用每次都从零搭爬虫
- AI 工程师:需要为 RAG 或训练数据管道采集网页语料
输入与输出案例
案例一:简单静态页面抓取
- 输入:”帮我抓取 https://news.example.com/tech 的所有文章标题和发布时间”
- 输出:Claude 自动调用
scrapling extract fetch,直接生成 article.md 文件,包含提取后的标题和发布时间列表(Markdown 格式),无需写一行 Python
案例二:Cloudflare 防护站点
- 输入:”这个站点有 Cloudflare 保护,帮我绕过抓取:https:// protected.example.com”
- 输出:Claude 识别到 Cloudflare 特征,自动切换到 StealthyFetcher,走
scrapling extract stealthy-fetch --solve-cloudflare命令,绕过防护后提取数据;如果需要登录,自动引导用户提供 cookie 并存入 Cookie 保险库
案例三:登录后抓取
- 输入:”我已登录这个网站,帮我抓取我的订单历史:https://shop.example.com/orders”
- 输出:Claude 请求用户提供登录 cookie,从 Cookie 保险库读取或新建 vault.local.md 模板,执行带 cookie 的 FetcherSession 抓取,返回结构化订单数据
claude-code-skill-scrapling 解决的不是一个新问题,而是把”让 Claude 写爬虫”这件事的门槛从”需要理解 HTTP/反爬/CSRF”降到了”说一句话”。它的渐进式复杂度设计——简单任务走 CLI、复杂任务生成脚本——在 Skill 生态里属于比较成熟的设计思路,配合完善的安全边界说明(cookie 不上版本控制、敏感信息走 local overlay),是近期 GitHub 上值得关注的新 Skill 之一。
GitHub: https://github.com/Cedriccmh/claude-code-skill-scrapling
评论区
登录后可评论。