jDataMunch MCP Skill 技能

面向 AI 编程助手和数据分析师的表格数据检索 MCP 服务器

jDataMunch MCP 是一款面向 AI 编程助手和数据分析师的表格数据检索 MCP 服务器,解决大语言模型处理 CSV / Excel / Parquet / JSONL 大文件时的 token 爆炸问题。

核心价值

默认情况下,AI 代理探索电子表格的方式是将整份文件粘贴到提示词中。一份 255 MB、100 万行的 CSV 文件直接粘贴需要约 1.11 亿 tokens——而且模型仍需在 100 万行数据中「大海捞针」来回答「这个文件有哪些列」这样的简单问题。

jDataMunch 在数据文件上建立列概览、类型基数、空值率、分布统计等元信息索引,后续查询直接在服务器端执行过滤、聚合、联表操作,仅将匹配结果返回给模型。百万行文件从消耗 1.11 亿 tokens 变为仅消耗数千 tokens。

核心功能

文件概览(describe_dataset):无需读取全文件,获取列名、类型、基数、空值率等全局统计,典型 token 消耗约 3,849(vs 粘贴全文 1.11 亿)

列深度分析(describe_column):针对特定列获取值分布、分位数、高频值等精细信息

行级过滤(get_rows):带条件的行查询,仅返回匹配行而非全表扫描

服务端聚合(aggregate):group by / count / sum 等聚合操作在服务器端完成,返回聚合结果而非全量行

跨数据集联表(join):支持多文件关联查询

Benchmark 数据

任务 无 jDataMunch 有 jDataMunch 节省
了解数据集形状 粘贴 1.11 亿 tokens describe_dataset ≈ 3,849 tokens ~25,000×
单列深度分析 粘贴 1.11 亿 tokens describe_dataset + describe_column ≈ 4,400 tokens ~25,000×
条件过滤行 加载全部 100 万行 get_rows 带过滤条件 → 匹配行 ~99%+
按类别统计 返回全量行后在模型中聚合 aggregate(group_by=[...]) → 21 行 ~99.9%

工作原理

  1. 索引阶段:对目标数据文件执行列概览分析,存储统计信息到本地
  2. 查询阶段:AI 代理发出数据分析请求,服务器基于索引直接执行
  3. 结果返回:仅将查询结果而非原始数据返回给模型

适用场景

  • 处理销售报表、财务数据、日志文件等大 CSV 的 AI 数据分析代理
  • 需要对数据文件做探索性分析的 Cursor / Claude Desktop 用户
  • 构建数据管道、ETL 自动化的 AI 代理

基础信息

  • GitHub:github.com/jgravelle/jdatamunch-mcp(81★)
  • PyPI:pypi.org/project/jdatamunch-mcp/
  • 协议:双许可(个人免费,商业付费)
  • 认证方式:MCP(Model Context Protocol)
  • 本地优先:索引存储在本地,不上传原始数据

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论