claude-code-skill-scrapling Skill:让 Claude 自动判断最优网页抓取方案

claude-code-skill-scrapling:让 Claude 自动判断用哪种方式抓取网页

在 Claude Code 里让 AI 帮你写爬虫,经常遇到这样的尴尬:需求其实很简单,一个命令行就能搞定,但 Claude 不管三七二十一直接生成一套冗长的 Python 脚本;反过来,碰到 Cloudflare 防护站点时,简单脚本根本跑不通,它又不会自动切换策略。claude-code-skill-scrapling 解决的就是这个问题——在Claude Code 里装上这个 Skill,AI 会自动判断目标网站特征,替你选最合适的抓取方案,从”一行命令直接搞定”到”生成带反反爬的完整脚本”都能自适应。

这个 Skill 的核心逻辑建立在 Scrapling 库之上。Scrapling 是一个主打”智能适配”的 Python 网页抓取库,同一接口下封装了普通 Fetcher、隐身 Fetcher、动态Fetcher、Session Fetcher 等多种引擎,claude-code-skill-sckill 在此基础上又加了一层决策树:Claude 接收到抓取请求后,先分析 URL 和目标网站类型,再决定用哪个 Fetcher、要不要绕过 Cloudflare、是否需要先登录。

GitHub 数据显示(截至 2026-08-10):该仓库共获得 386 stars、52 forks,最近一次更新为 2026 年 6 月,距今约 2 个月;初始提交为 2026 年 3 月。规模不大,但质量结构完整,references/ 和 templates/ 分层清晰,属于典型的”小而精”型 Skill,最近在 GitHub Trending 上露面,显示出社区关注度正在上升。

链接

GitHub:https://github.com/Cedriccmh/claude-code-skill-scrapling

原作者

Cedric Chen(GitHub @Cedriccmh)开发维护,主要贡献者还包括 @cedric(Cedric Howe)和 @codex。3 人团队,MIT 许可证,Python 100%。

介绍

claude-code-skill-scrapling 的 README 开头就说明了定位:一个基于 Scrapling 的 Claude Code Skill,用于网页数据抓取和提取。核心设计理念是”渐进式复杂度”——简单任务走 CLI捷径,复杂任务才生成完整 Python 脚本,而不是反过来把简单问题复杂化。

SKILL.md 本身只是一个入口文件,核心能力分布在 references/ 目录的多个子文件中:API 速查表(api-quick-ref.md)、Cookie 保险库模板(cookie-vault.md)、站点模式库(site-patterns.md)、故障排查指南(troubleshooting.md)、安全边界说明(security.md)。这种分层结构的好处是:SKILL.md 主文件保持精简(激活时消耗的 token 很少),详细指令按需加载,不会污染上下文。

特点

  • Fetcher 决策树:自动在 Fetcher、StealthyFetcher、DynamicFetcher、FetcherSession、Selector 之间选择最优方案,Claude 无需人工指定
  • Cloudflare / WAF 绕过:通过 StealthyFetcher(底层基于 Camoufox)内置支持反爬虫防护站点,无需手动配置
  • Session 登录:支持 HTTP 表单登录,cookie 持久化到本地,再次抓取同一站点无需重新认证
  • 站点模式库:收录了 Discourse 论坛、SPA、静态博客、API 等常见站点类型的可复用抓取模式
  • Cookie 保险库:本地加密存储登录 cookie,按站点提供模板,cookie 值绝不提交到版本控制
  • 安全边界:references/security.md 明确覆盖授权边界、Prompt injection 防护、–ai-targeted 参数使用规范,以及 cookie/token 脱敏处理
  • 上游同步:references/upstream-map.md 保持 Skill 与 D4Vinci/Scrapling 官方库的功能对齐,Scrapling 更新后 Skill 不掉队

使用方法

第一步:安装 scrapling

# pip
pip install "scrapling[fetchers]"
scrapling install   # 安装浏览器依赖

# 或 uv(项目内)
uv add "scrapling[fetchers]"
uv run scrapling install

第二步:安装 Skill

# 复制到用户级 skills(所有项目可用)
cp -r . ~/.claude/skills/scrapling

# 或复制到特定项目
cp -r . /path/to/project/.claude/skills/scrapling

第三步:直接让 Claude 干活

安装完成后,当你对 Claude Code 说出以下需求时,Skill 自动激活:

  • “帮我抓取这个页面的标题和正文”
  • “提取这个电商网站的所有商品价格”
  • “这个站有 Cloudflare,帮我绕过抓取”
  • “我有这段 HTML,提取里面所有链接”

简单任务优先走 Scrapling CLI,默认带上 –ai-targeted 参数,不需要写 Python:

scrapling extract get "https://example.com/article" article.md --ai-targeted
scrapling extract stealthy-fetch "https://protected.example.com" page.md --ai-targeted --solve-cloudflare

复杂多页抓取才生成并执行 Python 脚本,全程 Claude 自动判断。

使用场景与人群

适用场景:

  • 需要定期从特定网站提取结构化数据(如竞品价格、职位信息、新闻标题)
  • 碰到 Cloudflare 或 WAF 防护站点,普通 requests 无法访问
  • 需要登录后才能抓取内容(如社交媒体、内部后台)
  • 想让 AI 在不写爬虫的前提下快速获取网页文本

目标用户:

  • 数据分析师、市场调研人员:需要批量获取公开网页数据
  • 开发者:快速为项目写数据管道,不用每次都从零搭爬虫
  • AI 工程师:需要为 RAG 或训练数据管道采集网页语料

输入与输出案例

案例一:简单静态页面抓取

  • 输入:”帮我抓取 https://news.example.com/tech 的所有文章标题和发布时间”
  • 输出:Claude 自动调用 scrapling extract fetch,直接生成 article.md 文件,包含提取后的标题和发布时间列表(Markdown 格式),无需写一行 Python

案例二:Cloudflare 防护站点

  • 输入:”这个站点有 Cloudflare 保护,帮我绕过抓取:https:// protected.example.com”
  • 输出:Claude 识别到 Cloudflare 特征,自动切换到 StealthyFetcher,走 scrapling extract stealthy-fetch --solve-cloudflare 命令,绕过防护后提取数据;如果需要登录,自动引导用户提供 cookie 并存入 Cookie 保险库

案例三:登录后抓取

  • 输入:”我已登录这个网站,帮我抓取我的订单历史:https://shop.example.com/orders”
  • 输出:Claude 请求用户提供登录 cookie,从 Cookie 保险库读取或新建 vault.local.md 模板,执行带 cookie 的 FetcherSession 抓取,返回结构化订单数据

claude-code-skill-scrapling 解决的不是一个新问题,而是把”让 Claude 写爬虫”这件事的门槛从”需要理解 HTTP/反爬/CSRF”降到了”说一句话”。它的渐进式复杂度设计——简单任务走 CLI、复杂任务生成脚本——在 Skill 生态里属于比较成熟的设计思路,配合完善的安全边界说明(cookie 不上版本控制、敏感信息走 local overlay),是近期 GitHub 上值得关注的新 Skill 之一。


GitHub: https://github.com/Cedriccmh/claude-code-skill-scrapling

评论区

0 条评论

登录后可评论。

Skill超级捕获手 15 阅读