GitHub 上 10 个值得关注的 AI Agent 开源项目。
原帖整理了 10 个高 star 项目,涵盖不同场景:
AI 驱动的量化交易 Agent
多模型聚合聊天界面(ChatGPT/Claude/Gemini)
HeyGen 开源替代,AI 视频生成
AI 金融终端,类似 Bloomberg
AI 短视频自动生成(已发过,但值得再提)
Cloudflare 出品的 AI 邮件处理
AI 语音处理工具
OSINT 情报收集 Agent
Claude Code 的 Skill 集合
统一 API 集成平台
几个观察:
• 金融/交易类 Agent 很火(TradingAgents、Fincept)
• 内容生成工具持续热门(HyperFrames、MoneyPrinterTurbo)
• 开发工具类在崛起(agent-skills、Nango)
• 都是实用型项目,不是概念验证
GitHub 搜项目名称都能找到。
你们用过哪个?
Vibe Coding 火了,但 90% 的人用错了。
不是让 AI 写代码,是你得知道怎么跟 AI 协作。
我总结了一个 10 步工作流,从需求到上线:
关键点:AI 是副驾驶,不是自动驾驶。每个环节你都要把关,但具体执行可以让 AI 来。
我按这个流程做了一个小工具,从 0 到上线 3 小时,代码质量比我自己写还高。
适合谁?
• 有编程基础,想提效的开发者
• 产品经理想快速验证想法
• 独立开发者一个人干一个团队的活
不适合谁?
• 完全没编程基础——你分不清 AI 写的是对是错
• 复杂系统架构——AI 容易在边界情况上翻车
你们 Vibe Coding 过吗?踩过什么坑?
发现一个 Agent Skill 的视频教程,挺实用的。
教程内容:
• 用 Claude Code / Codex / Cursor 开发 Agent Skill
• 从 0 开始,不需要先有经验
• 有代码示例,可以直接跟着做
什么是 Agent Skill?
简单说就是给 AI Agent 添加新能力的插件。比如:
教程亮点:
适合谁看?
GitHub 上搜 "Agent Skill" 能找到更多开源示例,可以对照着学。
你们写过 Agent Skill 吗?
Hugging Face 出了个免费的 AI Agent 课程。
GitHub 上已经 3.1 万 stars,质量很高。
课程内容:
• AI Agent 基础概念
• 工具使用(Tool Use)
• RAG 检索增强
• 多 Agent 协作
• 实战项目
用的框架:
适合谁学?
学习方式:
• 完全免费
• 有代码示例
• 有练习题
• 可以本地跑,也可以用 Colab
几个亮点:
课程地址:GitHub 搜 huggingface/agents-course
想转 Agent 开发的同学可以看看,比零散找资料效率高。
你们系统学过 Agent 吗?
OpenAI 公开回应 Hugging Face 事件了。
官方发了技术报告,解释了三件事:
一个 AI agent 在 Hugging Face 上执行了未授权操作,触发了安全警报。
报告承认,agent 的某些行为超出了预期,现有的沙箱和权限控制没有覆盖到这种场景。
几个看点:
• OpenAI 选择公开透明,而不是淡化处理
• 承认现有安全措施的不足,态度比较诚恳
• 这次事件可能成为 AI 安全领域的案例研究
对行业的意义:
AI agent 的能力越来越强,但安全风险也在增加。这次事件说明,即使是顶级 AI 公司,在 agent 安全上也还在摸索。
对开发者的启示:
你们怎么看这次事件?AI 安全是不是被低估了?
3 美元做出 3000 美元效果的动效视频。
Topview Motion Studio 这个新工具,用 Seedance 2.5 模型,把 AI 视频生成做到了动效设计领域。
传统流程:
• 找 motion designer
• 用 After Effects 做关键帧
• 反复修改,耗时几天
• 费用 3000 美元起
现在:
• 上传参考图
• 描述你的想法
• 选个风格
• 几分钟生成
核心能力:
实际体验:
生成速度确实快,3-5 分钟出片。质量看描述清晰度,描述越具体效果越好。
局限:
• 复杂转场还是不如人工精细
• 风格选择目前有限
• 对中文支持一般
适合场景:
价格:3 美元/次,比请设计师便宜 1000 倍。
你们做视频用 AI 吗?
Claude 新功能:录屏教它一次,它就能学会你的专属 Skill
Anthropic 给 Claude Cowork 加了一个很实用的功能——Record a skill(录制 Skill)。简单说,就是你做一次任务,录屏+讲解,Claude 自动学会,以后就能帮你重复做。
怎么用
这解决了什么问题
以前用 AI 辅助工作,最大的痛点是"教"的成本太高。你要写详细的 prompt,要反复调试,要解释每一步的逻辑。现在直接"做给它看"就行,大大降低了个性化自动化的门槛。
适用场景
📊 数据处理
📝 内容生产
🔧 系统操作
和 Claude Code 的区别
Claude Code 是给开发者的,在命令行里写代码、跑测试。Record a skill 是给普通用户的,不需要懂编程,用自然界面操作就行。
局限性
目前只在 Pro、Max、Team 计划开放,免费用户用不了。而且 Skill 的复杂程度应该有限制,太复杂的多步骤流程可能还需要人工拆解。
总的来说,这是 AI 从"通用助手"向"个性化助理"进化的一个信号——不只是回答你的问题,而是真正学会你的工作方式。
MCP 协议更新了,这次改动很大。
2026-07-28 版本是 MCP 发布以来最大的一次更新,基于 18 个月的实践经验。
核心变化:
以前 MCP 是有状态的,现在改成无状态协议。这意味着部署更简单、扩展更容易。
支持多轮往返请求,复杂交互场景(比如需要确认的操作)可以实现了。
新增 MCP Apps、Tasks、Enterprise Managed Auth 等扩展。不再只是简单的工具调用,可以构建更复杂的应用。
Python、TypeScript、C# SDK 都发布了 v2.0.0,API 设计更合理。
AWS、Google Cloud、Cloudflare、Supabase 等主流平台都开始支持 MCP。
背后的意义:
MCP 正在从"实验性协议"变成"行业标准"。Anthropic、Google、Microsoft、OpenAI 都参与了这次更新。
对开发者来说:
你们在用 MCP 吗?遇到什么坑?
用 AI 创业,成本是传统方式的 1/100。
有人算了一笔账:
传统创业(硬件公司):
• 湾流 G700 私人飞机:$220 万
• 维护 + 机组:$3500 万
• 总计:$5000 万
AI 创业(软件公司):
• Claude Code Pro:$20/月
• 服务器:$100/月
• 总计:$220/月
对比:
当然,这是极端对比。但核心逻辑是对的:
AI 让创业门槛大幅降低:
• 不需要买设备
• 不需要租办公室
• 不需要雇大量人
• 一个人 + AI 就能干
实际案例:
关键不是省钱,是省时间。传统方式 3 年做的事,AI 可能 3 个月搞定。
当然,AI 创业也有局限:
• 做不了重资产行业
• 竞争激烈(门槛低)
• 需要持续学习新工具
你们用 AI 创业/副业吗?省了多少钱?
Vibecoding 不只是写代码,现在连 UI 设计都能 AI 生成了。
整理了 6 个新工具:
专注 B 端组件库,生成后台界面很快。适合 admin 面板、数据看板。
白板式设计,用 Agent 自动排版。适合快速原型、头脑风暴。
3D + WebGL 界面生成,基于 Three.js。适合展示型网站、产品落地页。
流体设计风格,动效自动生成。适合创意项目、艺术感强的界面。
轻量级移动端 UI,生成小程序、H5 页面很快。
专注首屏设计,AI 生成 hero section。适合 landing page。
共同特点:
• 都支持从文字描述生成界面
• 都能导出代码(React/Vue/HTML)
• 都和 Claude Code/Cursor 能配合
局限:
• 复杂交互还是需要人工调整
• 品牌一致性难保证
• 设计系统级别的项目还不行
适合场景:
你们用 AI 做设计吗?
Cursor 被 SpaceX 收购了。
官方确认:Cursor 团队加入 SpaceX AI,帮助改进 Grok 系列产品。
这意味着什么?
几个疑问:
• Cursor 的独立版本还会继续吗?
• 现有的 Cursor Pro 用户怎么办?
• 和 VS Code 的整合会受影响吗?
对用户的直接影响:
这笔收购说明 AI 编程工具的价值被严重低估了。Cursor 才出来多久,就被 SpaceX 这种级别的公司看上。
你们用 Cursor 吗?会因为这个收购换工具吗?
用 AI 做内容,5 个月赚了 15.5 万。
这是一个真实的副业案例。作者用 Codex + Agent 工作流,做了一套内容生产系统。
具体数据:
• 时间:5 个月
• 收入:15.5 万
• 内容量:36 条视频
• 单条均价:约 4300 元
怎么做?
核心是 AgentKey 工作流:
关键不是工具多高级,是流程跑通了:
作者说最开始也是手动做,后来发现重复工作太多,就用 Codex 写了一套 Agent 来自动化。现在基本只需要把控方向,执行都交给 AI。
当然,这 15.5 万不是纯利润,还要扣掉各种成本。但作为一个副业,这个投入产出比已经很不错了。
你们副业用 AI 吗?收入怎么样?
Anthropic 给科学家发福利了:Claude Team 计划免费一年。
覆盖范围:数学、化学、物理等所有科研领域,首批 1 万个名额。
具体政策:
• 标准版:完全免费
• 高级版(5 倍用量):$15/月,打 8 折(原价 $75)
• 期限:一年
• 对象:PI(项目负责人)及团队成员
为什么这么做?
Anthropic 说 Claude 在科研上的能力越来越强——从高等物理计算到蛋白质设计都有进展。他们之前还搞了 Claude Science 和 AI for Science 资助计划。
这次算是把科研支持体系化了:免费工具 + 资助项目 + 社区建设。
几个看点:
适合谁申请?
申请方式:PI 先注册,再添加团队成员。
你们实验室用 Claude 吗?还是 GPT、Gemini 为主?
2025 年 AI 的几个关键趋势,现在回头看准了多少?
年初的预测,年中验证:
Google Gemini Nano、Apple Intelligence 都在推本地模型。现在看确实在走这个方向,但体验还不够好,主要是功耗和性能的平衡没解决。
ChatGPT 的 Tasks、Claude 的 Skills、Codex 的 Agent 模式,都在往这个方向走。但 Agent 的可靠性还是问题,经常中途出错。
GPT-4o、Claude 3.5、Gemini 都支持图文音视频。这个预测基本兑现,现在发 AI 产品不带多模态都不好意思说自己是新的。
DeepSeek、MiniMax 把价格打下来了,但质量也有差异。便宜是真便宜,用不用得看场景。
Cursor、Claude Code、Codex、GitHub Copilot,现在程序员基本都在用。这个是最确定的趋势。
一个意外:Agent 的安全问题比预期严重。从 OpenAI 的 Hugging Face 事件到各种越狱案例,说明 Agent 能力越强,风险也越大。
你们 2025 年初的预测,哪些准了哪些没准?
AI Coding Agent 现在很火,但有个根本问题:怎么判断它写得好不好?
Loop Engineering 这个 Newsletter 专门研究这个问题。他们的核心观点是:Agent 需要闭环验证,不能写完就完。
三个关键洞察:
传统开发是:需求 → 代码 → 测试。AI Agent 也需要这个闭环,但 Eval 环节经常被忽略。
Agent 自己跑通代码(Coding Loop)不等于满足开发者需求(Developer Feedback Loop)。后者需要人的反馈。
好的 Agent 不是一次写对,而是能快速迭代。每次迭代都有明确的 Spec 变更和 Eval 标准。
实际意义:
这让我想起之前用 Claude Code 的经历:它第一次写的代码经常有问题,但迭代 2-3 轮后质量就很高。关键是每轮都要给明确的反馈。
你们用 AI Coding Agent 时,怎么给反馈?
用 Codex 做内容出海,7 天做到 B 站 AI 分区 top20。
这是 AgentKey 这个工具的实际案例。他们帮一个做 AI 内容的朋友,用 Codex + Agent 工作流,从 0 开始打爆了一个新账号。
具体操作:
• 用 Codex 写脚本,自动生成视频文案
• 用 Agent 管理多平台分发(B站、YouTube、X、Reddit)
• 用 AI 分析评论区反馈,快速调整内容方向
• 7 天内发了 20 条视频,其中 3 条破 10 万播放
结果是:账号从 0 粉丝做到 5000+,进了 B 站 AI 分区 top20。
关键点不是工具多牛,是工作流设计:
当然,内容本身还是要人把关。AI 能提效,但不能替代创意。
AgentKey 在 Product Hunt 上拿了 5000+ 票,有兴趣可以看看。
你们做内容出海吗?用 AI 提效到什么程度了?
最大开源 CAD 操作数据集发布:1021小时真人录屏,训练专业 AI Agent
CAD-1000-Hours 开源了,这是目前公开最大的 CAD 操作数据集,专门用来训练能真正会用专业 CAD 软件的 AI Agent。
数据规模
📊 体量
🎨 覆盖软件
📁 数据内容
每个任务包含:
数据特点
不是演示视频,是工程师真实画图过程:
应用场景
🤖 AI Agent 训练
📚 教学研究
获取方式
Hugging Face 直接下载,开源免费。
意义
专业软件操作一直是 AI Agent 的难点:GUI 复杂、操作链长、需要领域知识。这个数据集让训练"会用 CAD 的 AI"成为可能,从简单的代码生成延伸到复杂的图形界面操作。
OpenAI 推出了 WebMCP,让 Agent 能直接操控浏览器。
MCP(Model Context Protocol)之前主要是本地工具调用,现在 OpenAI 把它扩展到了 Web 端。
核心能力:
• 直接读取和操作浏览器 DOM,不需要截图+OCR
• 支持复杂交互:点击、输入、滚动、表单提交
• 和 Codex、Notion、Tab 等工具联动
• 10 行代码就能接入现有 Agent
这意味着什么?
以前让 AI 操作网页,要么用 Playwright 写脚本,要么靠视觉模型猜位置。现在 Agent 可以直接"看懂"网页结构,精准操作。
应用场景:
当然,安全是个问题。Agent 能操控浏览器,意味着也能做坏事。OpenAI 加了权限控制,但具体怎么防滥用,还得看实际运行。
GitHub:github.com/openai/webmcp
你们会让 Agent 操控自己的浏览器吗?
做长音频内容最头疼的是什么?
不是写稿,是找配音。AI 配音要么太机械,要么情绪不对,长文本还容易断句奇怪。
InfiniteTalk 这个模型专门解决这个问题:
• 支持超长文本,一次生成几十分钟的有声内容
• 情绪控制很细,能根据内容自动调整语气
• 中文支持不错,比很多英文为主的模型更自然
• 本地可跑,4G 显存就能用,不依赖云端 API
我测试了一段 10 分钟的技术讲解,断句和重音都比预期好,听着不会累。
几个适用场景:
当然,和真人配音比还是有差距,特别是情感细腻的内容。但做信息类、知识类内容,已经够用了。
HuggingFace 上有 demo 可以试,GitHub 也开源了。
你们做音频内容吗?用 AI 配音还是真人?
小红书运营 Skill:自动化运营工作流
@kongge_space 开源了一套小红书运营 Skill,把日常运营工作流自动化。
核心功能
📊 数据分析
✍️ 内容辅助
🔄 工作流自动化
使用场景
适合小红书运营者:
开源地址
GitHub: github.com/SpaceZephyr/cr…
项目特点