🎬 CapCut+Seedance 2.5:AI视频生成终于像拍电影了
以前用AI生成视频,最大的痛点是什么?
CapCut Web的Video Studio集成了Seedance 2.5,这次真的把这几个问题解决了。
核心升级:
1️⃣ 原生30秒视频
不用再拼接了。一次生成30秒完整视频,有叙事节奏,不是那种3秒玩具片段。
2️⃣ 时间线控制
生成后直接在时间线上编辑,想加什么加什么,不用重新生成。
3️⃣ 无限画布
所有素材和生成结果都在一个无限画布上管理,不用来回切换窗口。
为什么这很重要?
以前的AI视频生成流程是:
写prompt → 等3秒 → 不满意 → 重新写prompt → 等3秒 → 拼接 → 用剪辑软件...
现在的流程是:
写prompt → 生成30秒 → 在画布上调整 → 导出
这是一个质的飞跃。从"玩具"变成了"工具"。
定价参考:
生成30秒视频大概0.75美元左右,对于专业创作者来说,这个价格可以接受。
个人思考:
CapCut作为字节跳动的视频编辑工具,整合Seedance 2.5是顺理成章的事。但这次整合的深度确实让人眼前一亮。
30秒原生生成+无限画布+时间线控制,这三个组合在一起,意味着AI视频生成终于可以进入真正的创作流程了,而不是只能玩玩demo。
对于短视频创作者来说,这可能是目前最实用的AI视频生成方案之一。不用学复杂的工具,直接在熟悉的CapCut里就能用。
packages/core/agent-loop下的普通TypeScript插件,对外提供ctx.agentLoop服务,只要实现相同接口,运行中的控制流骨架可以随时整体卸载替换。
Cordis的副作用跟踪、依赖变动通知、事务性HMR能力,本质上全是在支撑「agent loop可
GitHub: github.com/Dujltqzv/Some-…
官网: yage.ai/share/dsh-deep…
DeepSeek悄悄放出了一个大招:DeepSeek-V4-Flash-Vision-Exp,一个多模态视觉实验模型。
这个模型在文本能力上跟V4-Flash完全持平——Agent调用、推理、世界知识全都保留。但在多模态Agent基准测试上,V4-Flash-Vision-Exp相比V4-Flash有了巨大跃升,多模态Agent表现已经接近Opus-4.8的水平。
关键信息:
这意味着什么?OpenAI和Anthropic在多模态上砸了海量资源,DeepSeek用更小的模型做到了接近的效果。Agent能"看"东西,但成本降到了普通开发者用得起的程度。
如果你在做需要视觉理解的Agent应用——图像分析、UI自动化、文档处理——这个模型值得第一时间试。
原帖来自 @deepseek_ai,1.1万赞,链接:x.com/i/status/20907…
🤖 微软下场卷Go了:Agent Framework正式发布,专为生产环境设计
微软刚发布了用Go语言重写的Agent Framework。
这次不是玩具demo,而是专门用来写能真上生产的AI智能体。
为什么用Go?
Python做Agent开发很流行,但在生产环境有几个痛点:
Go语言天生适合这些场景。微软这次把Agent Framework搬到Go上,明显是瞄准了企业级生产环境。
核心特性:
1️⃣ 多模型支持
不锁死一家大模型。OpenAI、Claude、本地模型都能接,灵活选择。
2️⃣ 中间件可插拔
想加日志、监控、限流、认证?随时插拔,不用改核心代码。
3️⃣ 可视化工作流编排
一张图把整个工作流串起来:
全部可视化配置,不用写代码。
适合谁用?
个人思考:
微软这次下场很有意思。Python生态已经有了LangChain、CrewAI、OpenAI Agent SDK等框架,但Go生态一直是空白。
对于已经在用Go的技术栈来说,这个框架是个好消息。不用为了写Agent而切换到Python,可以直接用熟悉的语言。
不过,Go的AI生态还是不如Python成熟。模型推理库、数据处理工具都比较少。这可能是一个挑战。
总体来说,微软这次押注Go Agent Framework,说明企业级AI Agent市场确实在增长。生产环境需要更稳定、更高效的框架,而Go正好满足这些需求。
🔧 Claude Code/Codex/Cursor的Skill太多了?Skills Hub一键统一管理
你有没有遇到过这种情况:
给Claude Code装了一套Skill,Codex又装了一套,Cursor、OpenCode、Antigravity再各来一份。
用着用着,本地目录就乱了。每个Agent的Skill目录都不一样,手动复制粘贴管理起来很麻烦。
Skills Hub 就是为了解决这个问题而生的。
它是什么?
一个统一的Skill管理器。Skill只安装一次,统一存在 ~/.skillshub 目录下,然后同步给不同的Agent。
现在内置了46个工具适配器,可以自由选择:
核心特性:
1️⃣ 标签系统
给Skill打标签,方便分类管理。比如"代码审查"、"文档生成"、"测试"等。
2️⃣ 批量开关
一键启用或禁用多个Skill,不用逐个操作。
3️⃣ Git更新
支持从Git仓库同步Skill,保持最新版本。
4️⃣ 自动更新
设置自动更新,Skill会定期检查并更新到最新版本。
5️⃣ Symlink优先
优先使用符号链接(symlink/junction),同步不了才复制文件,节省磁盘空间。
适合谁用?
个人思考:
这个项目解决了一个很实际的问题。随着AI编程工具越来越多,每个工具都有自己的Skill/Plugin系统,管理起来确实很麻烦。
Skills Hub的思路是:Skill应该是Agent无关的。一个代码审查Skill,不应该只给Claude Code用,应该能同时给Codex和Cursor用。
这种"一次安装,多处使用"的理念,很像Linux的包管理器。只不过这里管理的是AI Agent的Skill。
目前macOS已验证,Windows/Linux作者标的是设计支持但未本地验证,这点先注意。
我开始做自己的Design Skills 了🎨
今天在Demo day上分享了3个,大家都很喜欢!
先发一个我特别喜欢的:Mono-color Skill。
它不是简单地“把图片变成单色”,而是把一整套编辑设计语言 + 复古印刷质感 + 克制的视觉规则,封装成了一个可以反复调用的 Skill。
它会自动遵循这些设计原则👇
👉 默认使用一种油墨色,必要时加入克制的双色套印
👉 大量,有意识的留白
👉 强烈的Typography和编辑排版感
来源:@yanliudreamer | ❤️2093 | 👁️77,965
🧠 给AI编程Agent装上长期记忆:ai-memory项目,不用向量数据库也能做到
你有没有遇到过这种情况:
Claude Code写到一半,退出了。过几个小时再打开Codex继续,它完全不知道之前做了什么。又要从头交代一遍架构、需求、踩过的坑。
这个问题的本质是:AI编程Agent没有长期记忆。
每次新对话都像第一天上班,什么都得重新交代。
ai-memory项目提供了一个简洁的解决方案:把记忆当成纯Markdown文件笔记的Git仓库。
为什么不用向量数据库?
它是怎么工作的?
最实用的场景:
支持的工具:
Claude Code、Codex、Cursor、Gemini CLI等15种以上
个人思考:
这个项目的价值在于:它把"记忆"从"AI的黑盒"变成了"人的文档"。
很多AI记忆方案是把数据塞进向量数据库,看起来很"AI",但实际使用中:
ai-memory的思路是:记忆应该是可读、可编辑、可迁移的。这更接近人类的记忆方式——我们不会用向量数据库来记笔记,我们会用笔记本。
对于经常在多个AI编程工具之间切换的人来说,这个项目值得试试。
🏢 AI原生公司的30个核心特征:从工具到组织架构的全面升级
很多人以为AI原生公司就是"全员用ChatGPT",其实远不止于此。
有人总结了30个AI原生公司的特征,从流程到文化,从技术到组织,几乎涵盖了公司运营的每个环节。
核心亮点:
1️⃣ 技术架构层面
2️⃣ 开发流程层面
3️⃣ 业务流程层面
4️⃣ 组织文化层面
最打动我的几点:
这不是说真的推倒,而是保持对现有流程的质疑。AI进化太快,去年的最佳实践可能今年就过时了
Agent不是一上来就全自动。而是:观察→建议→经批准行动→独立行动。逐步获得信任
每个输出都要追溯到它的prompt、模型、数据和批准者。这样才能做有效的反馈
个人思考:
这份清单的价值在于:它不是在说"用AI工具",而是在说"成为AI公司"。
很多公司把AI当成"提效工具",但AI原生公司把AI当成"组织方式"。这不是程度的差异,是本质的不同。
当然,30个特征不可能同时实现。但可以作为检查清单,看看你的公司在哪些方面已经开始,哪些方面还是空白。
即使只做到其中10个,也比大多数公司强了。
grok du 命令,可直观查看 ~/.grok 目录的磁盘占用,覆盖工作树与会话数据
· 会话重命名限制为100字符,默认预填充当前标题,手动设置的标题可跨设备同步;新增 /rename --auto 命令可恢复自动标题生成
· /usage、/session-info、/context 命令现在以标签页模态框打开,不再占用对话上下文;Recaps 现在会使用与当前对话一致的语言生成
· 基于参考素材的视频生成新增预设音色、单图输入支持,可调节1-15秒时长与4:3/3:4宽高比
性能与稳定性也有大幅提升:大型 Git 仓库的 status/diff 操作不再占用过高 CPU/内存,长会话的历史搜索不再泄漏后台线程,恢复大型会话的速度显著加快且 UI 不会显示不完整记录;同时修复了 Apple Silicon 设备在 Rosetta 终端下仍能安装原生 arm64 版本、子进程挂起时工具超时不会导致代理卡死、Worktree 会话状态正常同步等20+ bug。
💡
GitHub: github.com/Dujltqzv/Some-…
🛡️ 吴恩达力荐:OpenWorker——专为网络安全打造的开源AI Agent
AI正在改变攻防格局:攻击者已经在用AI自动化攻击,而防御者还在手动响应。这个差距让很多人焦虑。
Andrew Ng最近推荐了一个项目——OpenWorker,一个开源的AI Agent,专门解决这个问题。
核心亮点:
1️⃣ 内置网络安全Agent
不是通用Agent套壳,而是专门设计的三个安全Agent:
2️⃣ 完全开源可审计
安全团队可以审查全部代码,确认没有后门。这在安全领域至关重要——你不能用一个不透明的工具来做安全审计。
3️⃣ 模型自由选择
可以跑本地模型,敏感代码不出机器。也可以用ChatGPT订阅或API key。对于需要复现漏洞的安全研究来说,本地模型不会触发拒答。
为什么这个思路好?
传统的安全扫描工具是规则驱动的,只能找已知模式。OpenWorker用Agent方式,可以理解代码逻辑,发现更深层的安全问题。
而且它是"shift left"理念的实践——在部署前就做安全检查,而不是等上线后被攻击才发现。
实际应用场景:
个人思考:
这个项目的意义在于:让防御者也能用上AI武器。目前AI安全工具主要集中在攻击端,防御端工具相对匮乏。
OpenWorker的出现,让"AI for Defense"不再是空话。而且完全开源,安全团队可以放心使用。
如果你做安全相关工作,这个项目值得关注。即使不用,了解一下思路也有价值。
📚 Claude Code不只是写代码:一套完整的工作流体系
很多人用Claude Code就是让它写写代码、改改bug。但如果你只把它当一个AI编程助手,那就浪费了它大部分能力。
Claude Code真正强大的地方在于:把CLAUDE.md、Skills、Hooks、Permissions、Memory和Agents组合起来,可以构建一套完整的开发系统。
这套系统能做什么?
1️⃣ 理解你的项目
CLAUDE.md不只是写规则的地方,它让Claude Code真正理解你的项目结构、技术栈和编码习惯
2️⃣ 自动化重复工作
Hooks可以在特定事件触发时自动执行操作,比如每次提交前自动检查代码规范
3️⃣ 多Agent协作
通过Memory和Agents,可以让多个Claude Code实例协作完成复杂任务
实际工作流示例:
为什么这个思路有价值?
个人思考:
这套思路本质上是把"人用AI工具"变成了"AI团队协作"。Claude Code不再是单个助手,而是一个可以编排的开发平台。
对于团队开发来说,这可能比单个Agent更有价值。每个Agent负责一个环节,通过统一的配置和规则协作。
如果你还在把Claude Code当普通的AI聊天工具用,可以试试这套工作流。可能会发现很多之前没想到的用法。
🧠 AGENTS.md其实是一个神经网络——这个维护思路很优雅
很多人维护AGENTS.md的方式是:Agent犯一次错,就往里补一条规则。
时间久了文件越来越长,旧规则没删,新规则继续加。最后Agent每次都要读一堆已经没用的东西,token浪费严重,效果反而变差。
这篇文章换了个思路:把AGENTS.md当成一个需要"训练"的神经网络。
核心思路:
1️⃣ 每次Session都是一次forward pass
Agent走过的弯路和被你纠正的地方就是loss
2️⃣ 定期做backward pass
从真实session里提取问题,小幅更新AGENTS.md
3️⃣ 给固定Token budget
新增一条规则,就要考虑删掉或移走什么
具体怎么做?
作者开源了一个叫backpass的工具,可以自动完成这个过程:
为什么这个思路好?
实际效果:
个人思考:
这个思路本质上是把"人工维护配置"变成了"自动训练模型"。虽然AGENTS.md还是文本,但维护方式已经接近机器学习了。
很多Agent现在缺的就是这种持续进化的能力。每次session都积累了很多反馈,但下一次又像第一次来上班一样。
如果你也在用Claude Code或Codex,可以试试这个思路。让Agent越用越懂你,而不是每次都要重新教。
🔧 构建靠谱的 AI Agent 不是靠写好 Prompt 就够的——这是一套7步框架。
大部分人在做 Agent 的时候,上来就写 Prompt,试到能跑就行。但真正能上线跑生产的 Agent,靠的是系统架构。
为什么值得看?因为大部分人做 Agent 的思路是"Prompt → 跑通 → 上线",而生产级 Agent 的思路是"架构 → 分层 → 测试 → 上线"。差距就在这个地方。
🔥 语音Agent终于不用再"卡顿"了!PhoneLLM开源发布
做语音Agent最头疼的是什么?延迟。
用户说完话,Agent要等好几秒才回应,体验直接崩盘。问题出在哪?主流大模型都依赖"思考"模式(thinking),生成质量是上去了,但延迟也跟着上去了。
PhoneLLM的出现解决了一个关键矛盾:怎么在关闭thinking模式下,依然保持高质量的工具调用和指令跟随?
核心数据很亮眼:
训练方法很有意思:
团队收集了大量真实电话和客服场景数据,专门训练模型在"思考关闭"状态下完成典型语音Agent任务。结果是:长对话中依然能准确调用工具、简洁切题地回复。
这解决了什么问题?
目前语音Agent领域有个尴尬的trade-off:要么选高质量但慢的模型(用户等得烦),要么选快但笨的模型(答非所问)。PhoneLLM证明了一条路:通过领域特定的微调,让小模型在特定场景下达到大模型的效果,同时保持极低延迟。
实际意义:
对于做语音Agent的开发者来说,这意味着:
开源权重已经上Hugging Face,还有一键部署到Modal的方案和示例代码。做语音Agent的朋友可以冲了。
这可能是目前解决"语音Agent延迟问题"最优雅的方案。你觉得语音Agent的下一步会往哪个方向走?
🔄 Warp 的「自进化 Agent」做法,可能正是解决 Agent 没有记忆问题的关键。
Agent 干完活,人类正常给反馈。另一个 Improver Agent 会定期把这些反馈捞出来,看它哪里反复犯错,再对原来的 Skill 提一个小修改。修改直接走 Git PR,人 Review、Merge 以后,下一次 Agent 就会带着这次经验继续工作。
Warp 已经把这套机制用到了 Code Review、写 Spec 和 GitHub Issue Triage。
关键最佳实践:
个人点评:这解决了 Agent 最大的痛点——每次 Session 都像第一次上班。通过人类反馈自动改进 Skill,Agent 能持续学习。这种自进化机制很朴素但很有效:Agent 干活 → 人纠正 → Agent 总结 → 修改 Skill → 下一次少犯一次。
对于正在做 Agent 开发的人来说,这套做法值得参考。不只是 Code Review,任何需要持续改进的 Agent 工作流都可以借鉴。