j
jDataMunch MCP Skill 技能
面向 AI 编程助手和数据分析师的表格数据检索 MCP 服务器
jDataMunch MCP 是一款面向 AI 编程助手和数据分析师的表格数据检索 MCP 服务器,解决大语言模型处理 CSV / Excel / Parquet / JSONL 大文件时的 token 爆炸问题。
核心价值
默认情况下,AI 代理探索电子表格的方式是将整份文件粘贴到提示词中。一份 255 MB、100 万行的 CSV 文件直接粘贴需要约 1.11 亿 tokens——而且模型仍需在 100 万行数据中「大海捞针」来回答「这个文件有哪些列」这样的简单问题。
jDataMunch 在数据文件上建立列概览、类型基数、空值率、分布统计等元信息索引,后续查询直接在服务器端执行过滤、聚合、联表操作,仅将匹配结果返回给模型。百万行文件从消耗 1.11 亿 tokens 变为仅消耗数千 tokens。
核心功能
文件概览(describe_dataset):无需读取全文件,获取列名、类型、基数、空值率等全局统计,典型 token 消耗约 3,849(vs 粘贴全文 1.11 亿)
列深度分析(describe_column):针对特定列获取值分布、分位数、高频值等精细信息
行级过滤(get_rows):带条件的行查询,仅返回匹配行而非全表扫描
服务端聚合(aggregate):group by / count / sum 等聚合操作在服务器端完成,返回聚合结果而非全量行
跨数据集联表(join):支持多文件关联查询
Benchmark 数据
| 任务 | 无 jDataMunch | 有 jDataMunch | 节省 |
|---|---|---|---|
| 了解数据集形状 | 粘贴 1.11 亿 tokens | describe_dataset ≈ 3,849 tokens | ~25,000× |
| 单列深度分析 | 粘贴 1.11 亿 tokens | describe_dataset + describe_column ≈ 4,400 tokens | ~25,000× |
| 条件过滤行 | 加载全部 100 万行 | get_rows 带过滤条件 → 匹配行 | ~99%+ |
| 按类别统计 | 返回全量行后在模型中聚合 | aggregate(group_by=[...]) → 21 行 | ~99.9% |
工作原理
- 索引阶段:对目标数据文件执行列概览分析,存储统计信息到本地
- 查询阶段:AI 代理发出数据分析请求,服务器基于索引直接执行
- 结果返回:仅将查询结果而非原始数据返回给模型
适用场景
- 处理销售报表、财务数据、日志文件等大 CSV 的 AI 数据分析代理
- 需要对数据文件做探索性分析的 Cursor / Claude Desktop 用户
- 构建数据管道、ETL 自动化的 AI 代理
基础信息
- GitHub:github.com/jgravelle/jdatamunch-mcp(81★)
- PyPI:pypi.org/project/jdatamunch-mcp/
- 协议:双许可(个人免费,商业付费)
- 认证方式:MCP(Model Context Protocol)
- 本地优先:索引存储在本地,不上传原始数据
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议