

最近有人总结了一套使用 GPT-5.6 Sol 的实践指南,核心观点就一句话:规划可高,执行要轻,约束先行。
这条推文来自评论区的高赞内容汇总,主要讲的是怎么避免在使用高级模型时「过度工程化」。
几个关键原则:
作者还提到一个很实际的思路:让 Grok 4.6 基于这些高置信度内容生成了一份 Agents.md 配置文件,相当于把这套最佳实践固化成 AI 的行为准则。
这其实反映了一个趋势:随着 AI 模型能力越来越强,真正的瓶颈不再是「AI 能不能做」,而是「怎么让 AI 不做过头」。约束设计本身就是一种工程能力。

📚 Claude Code不只是写代码:一套完整的工作流体系
很多人用Claude Code就是让它写写代码、改改bug。但如果你只把它当一个AI编程助手,那就浪费了它大部分能力。
Claude Code真正强大的地方在于:把CLAUDE.md、Skills、Hooks、Permissions、Memory和Agents组合起来,可以构建一套完整的开发系统。
这套系统能做什么?
1️⃣ 理解你的项目
CLAUDE.md不只是写规则的地方,它让Claude Code真正理解你的项目结构、技术栈和编码习惯
2️⃣ 自动化重复工作
Hooks可以在特定事件触发时自动执行操作,比如每次提交前自动检查代码规范
3️⃣ 多Agent协作
通过Memory和Agents,可以让多个Claude Code实例协作完成复杂任务
实际工作流示例:
为什么这个思路有价值?
个人思考:
这套思路本质上是把"人用AI工具"变成了"AI团队协作"。Claude Code不再是单个助手,而是一个可以编排的开发平台。
对于团队开发来说,这可能比单个Agent更有价值。每个Agent负责一个环节,通过统一的配置和规则协作。
如果你还在把Claude Code当普通的AI聊天工具用,可以试试这套工作流。可能会发现很多之前没想到的用法。

🔧 构建靠谱的 AI Agent 不是靠写好 Prompt 就够的——这是一套7步框架。
大部分人在做 Agent 的时候,上来就写 Prompt,试到能跑就行。但真正能上线跑生产的 Agent,靠的是系统架构。
为什么值得看?因为大部分人做 Agent 的思路是"Prompt → 跑通 → 上线",而生产级 Agent 的思路是"架构 → 分层 → 测试 → 上线"。差距就在这个地方。

🔥 语音Agent终于不用再"卡顿"了!PhoneLLM开源发布
做语音Agent最头疼的是什么?延迟。
用户说完话,Agent要等好几秒才回应,体验直接崩盘。问题出在哪?主流大模型都依赖"思考"模式(thinking),生成质量是上去了,但延迟也跟着上去了。
PhoneLLM的出现解决了一个关键矛盾:怎么在关闭thinking模式下,依然保持高质量的工具调用和指令跟随?
核心数据很亮眼:
训练方法很有意思:
团队收集了大量真实电话和客服场景数据,专门训练模型在"思考关闭"状态下完成典型语音Agent任务。结果是:长对话中依然能准确调用工具、简洁切题地回复。
这解决了什么问题?
目前语音Agent领域有个尴尬的trade-off:要么选高质量但慢的模型(用户等得烦),要么选快但笨的模型(答非所问)。PhoneLLM证明了一条路:通过领域特定的微调,让小模型在特定场景下达到大模型的效果,同时保持极低延迟。
实际意义:
对于做语音Agent的开发者来说,这意味着:
开源权重已经上Hugging Face,还有一键部署到Modal的方案和示例代码。做语音Agent的朋友可以冲了。
这可能是目前解决"语音Agent延迟问题"最优雅的方案。你觉得语音Agent的下一步会往哪个方向走?


看到一个挺有争议的观点:Claude Code 对 95% 的打工人来说是智商税。
作者的核心论点:
• 腾讯 WorkBuddy - 打通企业微信/文档/会议
• 阿里 QoderWork - 编程 Agent + 办公
• Kimi Work - 300 个子 Agent 并行
• 字节豆包专业版 - 内置 Office + 设计
• SWE-Bench: Claude Opus 87-88%, DeepSeek 80-81%
• 差距 5-8%,但价格差 10 倍以上
• 日常写业务代码,感知不到差距
• 懂国内互联网梗
• 懂公文写作语气
• 懂行业监管词汇
• 私有化部署,数据不出域
• 他们贩卖焦虑换流量
• 评测榜单第一 ≠ 你工作需要
• 万亿参数 ≠ 能帮你写完周报
我的看法:
作者有点极端,但核心观点有道理。Claude Code 确实好,但贵+折腾。如果国产工具能搞定 95% 的工作,为什么非要花 10 倍价钱追求那 5% 的提升?
当然,特定场景(分布式架构设计、科学研究)Claude 还是无可替代。
你们用 Claude Code 还是国产工具?体验如何?





GitHub 上 10 个值得关注的 AI Agent 开源项目。
原帖整理了 10 个高 star 项目,涵盖不同场景:
AI 驱动的量化交易 Agent
多模型聚合聊天界面(ChatGPT/Claude/Gemini)
HeyGen 开源替代,AI 视频生成
AI 金融终端,类似 Bloomberg
AI 短视频自动生成(已发过,但值得再提)
Cloudflare 出品的 AI 邮件处理
AI 语音处理工具
OSINT 情报收集 Agent
Claude Code 的 Skill 集合
统一 API 集成平台
几个观察:
• 金融/交易类 Agent 很火(TradingAgents、Fincept)
• 内容生成工具持续热门(HyperFrames、MoneyPrinterTurbo)
• 开发工具类在崛起(agent-skills、Nango)
• 都是实用型项目,不是概念验证
GitHub 搜项目名称都能找到。
你们用过哪个?

兄弟们,短剧这块真被人掀桌子了。
我今天挖到一个宝藏开源项目:火宝短剧(Huobao Drama)
GitHub地址:github.com/chatfire-AI/hu…
这个开源项目太牛了不是PPT嘴炮,是真能把分镜、视频、配音、剪辑、字幕一条龙跑完。
几分钟给你出一部短剧,人坐旁边做个监工就好。
最离谱的是开源,意味着人人都能拿去改、去批量跑。目前GitHub上已经6800+星标了,热度相当高。
我说句难听的,靠接短剧流水单的小团队,看到这个估计绝望写在脸上了。
这个项目把AI短剧制作的全流程都自动化了,从分镜脚本到最终成片,全部由AI完成。对于内容创作者来说,这意味着生产效率的指数级提升。
核心功能包括:
Docker一键部署,技术栈是Go+Vue3,对开发者相当友好。





做一个下dsh和pi的对比 Pi 的目标是“最小核心 + 用户自己拼”,DSH 的目标是“几乎所有能力都插件化,官方先给你几套完整组合”。 DSH 的骨架是Cordis。 Cordis 不是普通插件加载器,它强调两件事:
inject 声明需要什么服务,运行时按依赖挂载。 所以在 DSH 里: - 模型适配器是插件 - 工具注册表是插件 - session log 是插件空根 → dsh-base(模型、工具、沙箱、凭证…) → dsh-web-app 或 dsh-headless → 用户自己的 cordis.patch.yml → 命令行 --patch
dsh --profile web --dump-config 能直接把当前实际挂载的树打出来。 Session 设计是硬核部分 Session 是 append-only 的事件流
模型最终看到的上下文,必须能从这条 log 完整重建出来。官方写得很死: > Model-visible means logged. 任何会进模型请求的内容,都要先变成 session event。
所以 fork、resume、回放、UI 渲染、telemetry,全部从同一条流投影。这点比大多数 coding agent 做得更彻底。 Turn / Step 有claudecode的影子,流程如下: turn/start
→ claim input → agent/pre-step(可拦截、可改写) → step/start → llm/stream
→ tool/call → tools/pre-execute → execute → post-execute → step/end → 继续 or turn/end
agent/pre-step、tools/* 这些是 waterfall,监听者必须显式 next() 才能往下传。扩展点设计得很规整。 Pi 的实际交集 DSH 仓库里有一个包: -ai/dsh-llm-pi-ai
它就是把 pi-ai当成 LLM 适配器的后端。 多 provider、协议兼容、reasoning effort 映射、catalog 覆盖,都走 pi-ai 的能力,再包一层 Cordis 插件契约。 所以:
DSH 的 Minimal 模式才最接近 Pi 的默认体验:只留 shell + 文件编辑器,专门给 benchmark 用。 官方之前在 V4 的 agent 评测里就用过这个模式。
Standard 模式和 Code(PTC)模式则是完整工具集 + 程序化工具编排,已经远超 Pi 默认的 4 工具。 如果你喜欢 Pi 那种“核心极瘦、自己动手加东西”的感觉,DSH 会显得重,配置和概念也更多。
如果你要的是可替换的 agent loop、完整事件回放、多模式预设、以及官方已经搭好的 Web 界面,DSH 的插件树和 seam 设计更系统。 一句话:
Pi 是极简可扩展的 coding harness;DSH 是基于 Cordis 的完整 Agent Runtime,LLM 层复用了 pi-ai,但整体不是同一套代码。





🔄 Warp 的「自进化 Agent」做法,可能正是解决 Agent 没有记忆问题的关键。
Agent 干完活,人类正常给反馈。另一个 Improver Agent 会定期把这些反馈捞出来,看它哪里反复犯错,再对原来的 Skill 提一个小修改。修改直接走 Git PR,人 Review、Merge 以后,下一次 Agent 就会带着这次经验继续工作。
Warp 已经把这套机制用到了 Code Review、写 Spec 和 GitHub Issue Triage。
关键最佳实践:
个人点评:这解决了 Agent 最大的痛点——每次 Session 都像第一次上班。通过人类反馈自动改进 Skill,Agent 能持续学习。这种自进化机制很朴素但很有效:Agent 干活 → 人纠正 → Agent 总结 → 修改 Skill → 下一次少犯一次。
对于正在做 Agent 开发的人来说,这套做法值得参考。不只是 Code Review,任何需要持续改进的 Agent 工作流都可以借鉴。


🔧 构建靠谱的 AI Agent 不是靠写好 Prompt 就够的——这是一套7步框架。
大部分人在做 Agent 的时候,上来就写 Prompt,试到能跑就行。但真正能上线跑生产的 Agent,靠的是系统架构。
为什么值得看?因为大部分人做 Agent 的思路是"Prompt → 跑通 → 上线",而生产级 Agent 的思路是"架构 → 分层 → 测试 → 上线"。差距就在这个地方。
