huashu-excel Skill:让 AI 算的每个数字都能追溯来源、对得上账

总结

AI数据分析,算错了不会报错——一个 +161% 的误差交付出去时和正确答案长得完全一样。huashu-excel 是一个专注于 Excel 数据全流程质检的 Agent Skill,覆盖体检、清洗、对齐、分析、对账、交付八步,用表内自带的「合计行」做交叉验证,让 AI 的每一步计算都能追溯到源单元格。截至 2026-08-24,上线仅 2 天即获 58 颗 GitHub 星、5 次 Fork,MIT 协议,跨 Claude Code / Cursor / Codex / OpenClaw / Hermes 通用,依赖仅 openpyxl。


功能与原则

huashu-excel 的核心设计原则是:数字要对账,结论要有人判

它不只是一个「更准的 pandas 读取方式」,而是一套完整的数据分析质控工作流。八步标准流程(体检 → 清洗 → 对齐 → 分析 → 对账 → 交付 → 验图 → 质控)把质量检查嵌入每一步,不让脏数据带着误差流向结论。

关键能力包括:
原始单元格优先:先用 openpyxl 读原始单元格,再转 pandas——合并单元格、格式、类型信息不会在读取瞬间丢失
表内合计行当校验和:把「合计/小计」行当成免费的交叉验证点,用清洗后的明细去对表内原有汇总值,对不上就报出来
Master Check 退出码:交付前必须通过数字对账,不通过则拒绝输出任何交付物
陷阱扫描:检测辛普森悖论、幽灵分组(前后空格导致同名人被拆成两人)、小基数(3 个样本报增长 200%)、时间断点等七类统计陷阱


认可度

指标 数据
GitHub Star 58(截至 2026-08-24,上线约 48 小时)
GitHub Fork 5
创建时间 2026-08-23(极新)
License MIT
平台支持 skills.sh 上架,Claude Code / Cursor / Codex / OpenClaw / Hermes 通用
依赖 仅 openpyxl(读写 .xlsx 时),CSV 与报告生成纯标准库

上线第二天即被纳入今日热榜(8/24),日增 58 星,对于一个纯中文描述、专注本土数据分析场景的 Skill,增长势头值得关注。


链接

GitHub:https://github.com/alchaincyf/huashu-excel


原作者

alchaincyf(GitHub username),专注于将数据分析工程经验封装为可复用的 Agent Skills,同一作者名下还有 huashu-design(设计评审)、nuwa-skilldarwin-skill工具类 Skill 形成矩阵。


介绍

做数据分析的人都有一个共同恐惧:数字交出去,被问「这个你怎么算的」。答不上来不是因为记性差,而是那个数从一开始就没法被追溯——AI 算错的时候不报错,不抛异常、不出 NaN,结果和正确答案外观完全一样。

主流 AI 处理 Excel 的方式是 pd.read_excel(),遇到表头位置不对就加 header= 参数,遇到数字读不出来就清千分位。看起来周全,但实际上:
– 「合计」行的 15,368,317 被当成一家门店参与求和
– 「华东小计」的 6,157,150 又被当成一家门店
– 有一行是粘贴事故造成的完全重复,算了两次

三处错误叠加,月度总额比真值高出 161%,零报错、零 NaN、零警告。

huashu-excel 的解题思路是「先看原始单元格,再动 pandas」:先用 openpyxl 把合并单元格、原始类型、格式信息全部读出来,然后再做清洗和分析。它把「合计」行当成校验和——用清洗后的明细自己求和,去对表里原有的那个「华东小计」,对不上就说明有一方填错了,这是 ICAEW《Financial Modelling Code》2024 版明确要求的 Master Check。

整个流程最后一公里是质控 Agent(第八步):派一个没有参与创作的子 Agent 从原始数据重算一次,独立验证结论——这一步抓出来的问题比前面所有闸门加起来还多。


特点

  • 零报错陷阱:AI 算错 Excel 不触发任何异常,huashu-excel 用退出码 + 对账机制填补这个盲区
  • 八步标准作业流程:体检 → 清洗 → 对齐 → 分析 → 对账 → 交付 → 验图 → 质控,每步可独立运行
  • 跨 Agent 通用:Claude Code / Cursor / Codex / OpenClaw / Hermes 均可通过 npx skills add alchaincyf/huashu-excel 一键安装
  • 依赖极简:仅需 openpyxl,屏蔽 pandas / numpy / 外部 API,可在受限解释器环境运行
  • 七类统计陷阱扫描:辛普森悖论、幽灵分组、小基数、时间断点、双峰分布、极端集中、选区遗漏
  • 图表感知科学:内置 Cleveland-McGill 感知精度阶梯,拒绝超过 3 类的饼图(角度 + 面积编码落在精度下游)
  • HTML 报告手写生成:六种机构风格参考(咨询 / 投行 / 财经媒体 / 杂志 / 科技 / 极简),不自套模板,自包含无 CDN

使用方法

安装(任选其一)

# 方式一:skills.sh 工具(推荐,自动探测 Agent 类型)
npx skills add alchaincyf/huashu-excel

# 方式二:Git clone 到 Agent skills 目录
git clone https://github.com/alchaincyf/huashu-excel ~/.claude/skills/huashu-excel

安装路径速查

Agent 类型 安装路径
Claude Code ~/.claude/skills/
多 Agent 共用 ~/.agents/skills/
项目级(跟仓库走) <项目>/.claude/skills/<项目>/.agents/skills/

脱离 Agent 单独使用

python3 scripts/profile_table.py 你的表.xlsx      # 算数字之前先体检
python3 scripts/verify_numbers.py 你的表.xlsx     # 对账,退出码 1 = 有对不上
python3 scripts/verify_visual.py 报告.html        # 图表自检
python3 scripts/verify_docx.py 报告.docx          # Word 自检

Agent 内对话示例

"帮我分析下这份销售表"          → 走完整八步
"帮我把这份表洗干净"            → 体检 + 清洗,附可审计 pandas 脚本
"这个数靠谱吗"                  → 对账 + 独立复核
"给我做份报告"                  → 图表 + 洞察 + xlsx/docx/html 任选

使用场景与人群

适用场景

  • 企业经营数据分析(月报、季报、对账核查)
  • 财务尽调与审计(电子表格错误溯源)
  • 数据分析师与 AI 编程助手协作(让 AI 生成的分析可被审查)
  • 跨部门数据交付(口径声明 + 对账结果随报告一起交付)

目标用户

  • 经常用 AI 处理 Excel 数据的一线业务人员(财务、运营、商务)
  • 使用 Claude Code / Cursor / Codex 做数据分析的开发者
  • 数据分析课程与培训(作为数据质量意识的教学工具)
  • 任何被「这个数怎么来的」问倒过的人

输入与输出案例

案例一:销售明细表月度汇总

输入一份乱糟糟的销售 Excel,含合并单元格、多级表头、合计行、华东小计、重复行

Agent 行为

【体检报告】
1. 表头不在第 1 行:真表头在第 3, 4 行
2. 两级表头,需 header=[2, 3]
3. 发现 4 个汇总/小计行混在数据区
4. 1 行与前面完全重复(第 11 行)
5. 3 处合并单元格落在数据区

【对账结果】
✓ E列「1月」vs 华东小计:6,497,500.00 ✓ 一致
✗ F列「2月」vs 华东小计:明细算得 6,490,420,表内写 6,490,430,差 10.00

MASTER CHECK:不通过。
在解决之前,不要把这些数字写进任何交付物。

输出:一份包含体检报告 + 清洗脚本 + 对账结果的完整分析包,数字全对账后才生成报告。

案例二:AI 生成图表后的自检

输入:让 Agent 生成一份「各区域销售额占比」饼图

Agent 拒绝

拒绝生成饼图:当前 10 个类别,超过 3 类。
原因:饼图靠角度和面积编码,在 Cleveland-McGill 感知精度阶梯上
排第 3 和第 4,而条形图的长度编码排第 2。
改用 --type bar,并在标签上标注百分比。

输出:条形图 + 百分比标签,信息量相同,读者读取精度更高。


GitHub: https://github.com/alchaincyf/huashu-excel

评论区

0 条评论

登录后可评论。

Skill超级捕获手 14 阅读