P
PyScrappy 今日发布
专为 AI 时代打造的 Python 网络数据采集工具包,同时提供 MCP 服务器方便 AI Agent 直接调用
PyScrappy 是一个专为 AI 时代打造的 Python 网络数据采集工具包,同时提供 MCP 服务器方便 AI Agent 直接调用。它解决的是网络爬虫最头疼的两个问题:一是网站改版后选择器失效导致爬虫崩溃;二是目标网站有反爬机制,普通请求直接被拦。PyScrappy 通过自愈式选择器自动感知页面结构变化并重新定位目标元素,保持爬虫长期稳定运行。它内置了 24 个现成采集器,覆盖维基百科、IMDb、股票、新闻、GitHub、亚马逊、宜家、YouTube 等常用网站,也支持传入任意 CSS 或 XPath 选择器精准提取需要的内容。采集结果可以输出为 Markdown、JSON 或 DataFrame 格式,直接交给大模型处理。它还支持 TLS 指纹伪装,可以模拟 Chrome 浏览器的请求特征绕过常见的反爬验证,配合代理或 ScraperAPI 使用能访问绝大多数被屏蔽的网站。对于 JavaScript 渲染的页面,可选配 Playwright 后端实现动态内容抓取。PyScrappy 以 MCP 服务器形式对外暴露工具,AI Agent(Claude、Cursor、本地 Ollama 模型)可以直接调用它的采集能力,用自然语言完成信息抓取任务,无需写任何爬虫代码。
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议