huashu-excel Skill:让 AI 算的每个数字都能追溯来源、对得上账
总结
AI 做数据分析,算错了不会报错——一个 +161% 的误差交付出去时和正确答案长得完全一样。huashu-excel 是一个专注于 Excel 数据全流程质检的 Agent Skill,覆盖体检、清洗、对齐、分析、对账、交付八步,用表内自带的「合计行」做交叉验证,让 AI 的每一步计算都能追溯到源单元格。截至 2026-08-24,上线仅 2 天即获 58 颗 GitHub 星、5 次 Fork,MIT 协议,跨 Claude Code / Cursor / Codex / OpenClaw / Hermes 通用,依赖仅 openpyxl。
功能与原则
huashu-excel 的核心设计原则是:数字要对账,结论要有人判。
它不只是一个「更准的 pandas 读取方式」,而是一套完整的数据分析质控工作流。八步标准流程(体检 → 清洗 → 对齐 → 分析 → 对账 → 交付 → 验图 → 质控)把质量检查嵌入每一步,不让脏数据带着误差流向结论。
关键能力包括:
– 原始单元格优先:先用 openpyxl 读原始单元格,再转 pandas——合并单元格、格式、类型信息不会在读取瞬间丢失
– 表内合计行当校验和:把「合计/小计」行当成免费的交叉验证点,用清洗后的明细去对表内原有汇总值,对不上就报出来
– Master Check 退出码:交付前必须通过数字对账,不通过则拒绝输出任何交付物
– 陷阱扫描:检测辛普森悖论、幽灵分组(前后空格导致同名人被拆成两人)、小基数(3 个样本报增长 200%)、时间断点等七类统计陷阱
认可度
| 指标 | 数据 |
|---|---|
| GitHub Star | 58(截至 2026-08-24,上线约 48 小时) |
| GitHub Fork | 5 |
| 创建时间 | 2026-08-23(极新) |
| License | MIT |
| 平台支持 | skills.sh 上架,Claude Code / Cursor / Codex / OpenClaw / Hermes 通用 |
| 依赖 | 仅 openpyxl(读写 .xlsx 时),CSV 与报告生成纯标准库 |
上线第二天即被纳入今日热榜(8/24),日增 58 星,对于一个纯中文描述、专注本土数据分析场景的 Skill,增长势头值得关注。
链接
GitHub:https://github.com/alchaincyf/huashu-excel
原作者
alchaincyf(GitHub username),专注于将数据分析工程经验封装为可复用的 Agent Skills,同一作者名下还有 huashu-design(设计评审)、nuwa-skill、darwin-skill 等工具类 Skill 形成矩阵。
介绍
做数据分析的人都有一个共同恐惧:数字交出去,被问「这个你怎么算的」。答不上来不是因为记性差,而是那个数从一开始就没法被追溯——AI 算错的时候不报错,不抛异常、不出 NaN,结果和正确答案外观完全一样。
主流 AI 处理 Excel 的方式是 pd.read_excel(),遇到表头位置不对就加 header= 参数,遇到数字读不出来就清千分位。看起来周全,但实际上:
– 「合计」行的 15,368,317 被当成一家门店参与求和
– 「华东小计」的 6,157,150 又被当成一家门店
– 有一行是粘贴事故造成的完全重复,算了两次
三处错误叠加,月度总额比真值高出 161%,零报错、零 NaN、零警告。
huashu-excel 的解题思路是「先看原始单元格,再动 pandas」:先用 openpyxl 把合并单元格、原始类型、格式信息全部读出来,然后再做清洗和分析。它把「合计」行当成校验和——用清洗后的明细自己求和,去对表里原有的那个「华东小计」,对不上就说明有一方填错了,这是 ICAEW《Financial Modelling Code》2024 版明确要求的 Master Check。
整个流程最后一公里是质控 Agent(第八步):派一个没有参与创作的子 Agent 从原始数据重算一次,独立验证结论——这一步抓出来的问题比前面所有闸门加起来还多。
特点
- 零报错陷阱:AI 算错 Excel 不触发任何异常,huashu-excel 用退出码 + 对账机制填补这个盲区
- 八步标准作业流程:体检 → 清洗 → 对齐 → 分析 → 对账 → 交付 → 验图 → 质控,每步可独立运行
- 跨 Agent 通用:Claude Code / Cursor / Codex / OpenClaw / Hermes 均可通过
npx skills add alchaincyf/huashu-excel一键安装 - 依赖极简:仅需 openpyxl,屏蔽 pandas / numpy / 外部 API,可在受限解释器环境运行
- 七类统计陷阱扫描:辛普森悖论、幽灵分组、小基数、时间断点、双峰分布、极端集中、选区遗漏
- 图表感知科学:内置 Cleveland-McGill 感知精度阶梯,拒绝超过 3 类的饼图(角度 + 面积编码落在精度下游)
- HTML 报告手写生成:六种机构风格参考(咨询 / 投行 / 财经媒体 / 杂志 / 科技 / 极简),不自套模板,自包含无 CDN
使用方法
安装(任选其一)
# 方式一:skills.sh 工具(推荐,自动探测 Agent 类型)
npx skills add alchaincyf/huashu-excel
# 方式二:Git clone 到 Agent skills 目录
git clone https://github.com/alchaincyf/huashu-excel ~/.claude/skills/huashu-excel
安装路径速查
| Agent 类型 | 安装路径 |
|---|---|
| Claude Code | ~/.claude/skills/ |
| 多 Agent 共用 | ~/.agents/skills/ |
| 项目级(跟仓库走) | <项目>/.claude/skills/ 或 <项目>/.agents/skills/ |
脱离 Agent 单独使用
python3 scripts/profile_table.py 你的表.xlsx # 算数字之前先体检
python3 scripts/verify_numbers.py 你的表.xlsx # 对账,退出码 1 = 有对不上
python3 scripts/verify_visual.py 报告.html # 图表自检
python3 scripts/verify_docx.py 报告.docx # Word 自检
Agent 内对话示例
"帮我分析下这份销售表" → 走完整八步
"帮我把这份表洗干净" → 体检 + 清洗,附可审计 pandas 脚本
"这个数靠谱吗" → 对账 + 独立复核
"给我做份报告" → 图表 + 洞察 + xlsx/docx/html 任选
使用场景与人群
适用场景
- 企业经营数据分析(月报、季报、对账核查)
- 财务尽调与审计(电子表格错误溯源)
- 数据分析师与 AI 编程助手协作(让 AI 生成的分析可被审查)
- 跨部门数据交付(口径声明 + 对账结果随报告一起交付)
目标用户
- 经常用 AI 处理 Excel 数据的一线业务人员(财务、运营、商务)
- 使用 Claude Code / Cursor / Codex 做数据分析的开发者
- 数据分析课程与培训(作为数据质量意识的教学工具)
- 任何被「这个数怎么来的」问倒过的人
输入与输出案例
案例一:销售明细表月度汇总
输入:一份乱糟糟的销售 Excel,含合并单元格、多级表头、合计行、华东小计、重复行
Agent 行为:
【体检报告】
1. 表头不在第 1 行:真表头在第 3, 4 行
2. 两级表头,需 header=[2, 3]
3. 发现 4 个汇总/小计行混在数据区
4. 1 行与前面完全重复(第 11 行)
5. 3 处合并单元格落在数据区
【对账结果】
✓ E列「1月」vs 华东小计:6,497,500.00 ✓ 一致
✗ F列「2月」vs 华东小计:明细算得 6,490,420,表内写 6,490,430,差 10.00
MASTER CHECK:不通过。
在解决之前,不要把这些数字写进任何交付物。
输出:一份包含体检报告 + 清洗脚本 + 对账结果的完整分析包,数字全对账后才生成报告。
案例二:AI 生成图表后的自检
输入:让 Agent 生成一份「各区域销售额占比」饼图
Agent 拒绝:
拒绝生成饼图:当前 10 个类别,超过 3 类。
原因:饼图靠角度和面积编码,在 Cleveland-McGill 感知精度阶梯上
排第 3 和第 4,而条形图的长度编码排第 2。
改用 --type bar,并在标签上标注百分比。
输出:条形图 + 百分比标签,信息量相同,读者读取精度更高。
评论区
登录后可评论。