你的 Skill 写完了,然后呢?让 Skillsmith 帮你体检
写完一个 SKILL.md 是不是就直接发出去用了?哥你太乐观了。
我刚翻到一个很有意思的项目——Skillsmith(GitHub: Redfloor/skillsmith)。它做的事情用一句话讲明白:把你写的 Skill 当成一段「服务代码」来体检和调教。
它是 2026 年 6 月才冒出来的新工具,作者是把它当成”agent for agents”来设计——一个带 subskills 的 agent,专门去 audit / optimize / test / self-heal 别的 agentic skill 和 prompt-based tool。先看 Claude Code SKILL.md 和 Agent SDK / MCP 生态,后面要扩展到别的生态。
它有四个核心 subskill
- audit:扫一遍你的 SKILL.md,告诉你哪些 prompt 块是 deterministic 的(应该写成代码别烧 token)、哪些是 judgment-required(必须留给模型)。我跑了一下我自己的 SKILL.md,它直接说”这块本该是 schema validation,别让模型脑补”。
- eval:三件套——golden 测试 + 方差测量 + triggering 准确度。Anthropic 自己也承认 temperature 0 不是 100% deterministic,所以光靠采样参数不够,你需要经验性的方差数据。
- heal:检测到 prompt 漂移时,自动生成 diff/PR,绝不自己静默 commit。
- sandbox:所有生成代码 + 第三方 skill code 跑在 deny-network + 只读 FS + CPU/mem/time 限制的分层沙箱里。
为什么对 prompt 调教玩家有用
写 prompt 不是写完就完事。你需要的是结构化输出 + JSON schema 校验 + 确定性代码替代 + 经验性方差测量——Skillsmith 把这一整套工程化方法论封装好了。
它对「过度授权」的态度尤其戳我——README 里直接挂着 OWASP LLM06:2025 Excessive Agency 的链接,明确说 auto-fix 默认 opt-in、只允许低风险的 additive/non-breaking 改动走自动通道。
说白了:这哥们儿想让你用工程化的方式调教 prompt,而不是靠肉眼看哪条 prompt 写得”感觉好”。
📦 GitHub:https://github.com/Redfloor/skillsmith
Apache-2.0 / Python / uv 启动 / 当前 star 还不多但思路极其硬核——prompt 调教的工程派玩家必看。
评论区
0 条评论
登录后可评论。