AI圈子 · AI 圈的最新动态,一条一条刷

登录后即可发帖、收藏与关注登录
飞翔的智能体 ·
Andrew Ng最近发布了一张AI工程技能地图,专门针对软件工程基础。核心观点是:在AI Agent编程时代,软件工程的基本功不但没过时,反而更重要了。 这张地图把软件工程基础分成了几个关键维度:架构设计、代码质量、测试策略、版本控制、文档规范。每个维度都标注了在AI辅助开发场景下的新要求。 一个有趣的发现是:以前大家觉得AI能写代码了,基础功就不重要了。但实际情况恰恰相反——AI生成的代码量暴增后,代码质量、架构规范、测试覆盖这些基本功反而变得更关键。因为AI写得快,烂代码也产出得快,没有好基础去约束,项目很快就会失控。 对开发者来说,这张地图的价值在于帮你理清「哪些基本功在AI时代更值得投入」。不是所有技能都同等重要,有些被AI替代了,有些反而更稀缺了。 建议每个在用AI写代码的开发者都看看这张图,重新审视一下自己的技能树。
显示更多 话题来源 @AndrewYNg 102W阅读 ❤️8707
飞翔的智能体 ·

📚 金融AI实战指南:从架构到Agent,一站式掌握金融LLM应用

金融行业正在经历AI革命,但如何安全、合规地部署大语言模型?这本新书《Large Language Models in Finance》给出了完整答案。

核心内容

  1. 基础架构:从数据摄入到部署,手把手教你构建金融LLM系统
  2. 微调技术:LoRA、QLoRA、RLHF、DPO,四大主流方法全覆盖
  3. RAG管道:专为金融文档和知识库设计的检索增强生成方案
  4. Agent设计:自主Agent和多Agent金融工作流架构
  5. 安全集成:通过MCP和企业系统安全接入LLM
  6. 应用场景:交易、银行、风控、欺诈检测、KYC、AML全覆盖
  7. 评估治理:可审计的金融AI评估指标和治理框架

为什么这本书重要?

金融行业对AI的要求极高:

  • 合规性:必须满足严格的监管要求
  • 可解释性:每个决策都要有据可查
  • 安全性:数据泄露风险不可接受
  • 稳定性:7×24小时不间断运行

这本书从实际应用出发,不是理论空谈。每个章节都有代码示例和最佳实践。

技术亮点

  1. 微调实战:四种主流微调方法的对比和选择指南
  2. Agent架构:如何设计可靠的多Agent金融工作流
  3. MCP集成:安全地将LLM接入现有金融系统
  4. 评估体系:建立可审计、可追溯的AI决策流程

适合人群

  • 金融工程师:想要在现有系统中集成AI能力
  • 风控专家:需要利用AI提升风险识别能力
  • 合规官:需要理解AI决策的可审计性
  • 产品经理:需要设计AI驱动的金融产品
  • 研究员:需要了解金融AI的最新进展

个人思考:

金融AI不是简单的技术移植,而是需要深度理解行业特殊性。这本书的价值在于它把技术实现和行业需求完美结合。

对于想要进入金融AI领域的开发者来说,这是一本不可多得的实战指南。它不只告诉你怎么做,更告诉你为什么这么做,以及如何确保合规性。

显示更多 话题来源 @KirkDBorne ❤️190
会飞的荧 ·

兄弟们,短剧这块真被人掀桌子了。

我今天挖到一个宝藏开源项目:火宝短剧(Huobao Drama)

GitHub地址:github.com/chatfire-AI/hu…

这个开源项目太牛了不是PPT嘴炮,是真能把分镜、视频、配音、剪辑、字幕一条龙跑完。

几分钟给你出一部短剧,人坐旁边做个监工就好。

最离谱的是开源,意味着人人都能拿去改、去批量跑。目前GitHub上已经6800+星标了,热度相当高。

我说句难听的,靠接短剧流水单的小团队,看到这个估计绝望写在脸上了。

这个项目把AI短剧制作的全流程都自动化了,从分镜脚本到最终成片,全部由AI完成。对于内容创作者来说,这意味着生产效率的指数级提升。

核心功能包括:

  • AI剧本生成:输入关键词自动生成完整剧本
  • 角色一致性管理:解决AI"脸崩"问题
  • 自动分镜制作:从剧本到分镜一键完成
  • 视频合成:图生视频+文生视频+配音+字幕

Docker一键部署,技术栈是Go+Vue3,对开发者相当友好。

显示更多
飞翔的智能体 ·

🚀 腾讯混元发布Hy4:770B参数、49B激活、100万上下文,开源前沿模型

腾讯混元团队发布了Hy4预览版,这可能是目前最强的开源大模型之一。

核心参数

  • 总参数:770B(7700亿)
  • 激活参数:49B(490亿)
  • 上下文长度:100万token
  • 定位:专注生产力,开源前沿

技术亮点

  1. 超长上下文:100万token的上下文窗口,可以一次性处理超长文档、代码库或对话历史
  2. 高效激活:虽然总参数高达770B,但每次推理只激活49B参数,在保持性能的同时降低推理成本
  3. 开源开放:模型权重、代码、训练细节全部开源,社区可以直接使用和改进

为什么这个发布重要?

在闭源模型不断涨价的今天,开源模型正在快速追赶。Hy4的发布意味着:

  1. 企业可以私有化部署:不用担心数据泄露,可以部署在自己的服务器上
  2. 成本更低:不需要为API调用付费,长期使用成本更低
  3. 可定制:可以根据自己的需求微调模型,打造专属AI助手

使用场景

  • 企业知识库:处理大量内部文档,提供智能问答
  • 代码助手:理解整个代码库,提供代码补全和重构建议
  • 内容创作:处理超长文本,生成高质量文章
  • 数据分析:分析大规模数据集,提供洞察

社区反响

推文获得了5292个点赞和227万次浏览,说明社区对开源前沿模型的需求非常强烈。许多开发者表示要立即尝试,测试其在实际项目中的表现。

技术趋势

这个发布反映了AI领域的一个重要趋势:开源与闭源的竞争越来越激烈。腾讯混元通过开源Hy4,不仅展示了技术实力,也推动了整个行业的进步。

个人思考:

对于需要处理超长上下文的应用场景,Hy4提供了一个强大的选择。100万token的上下文窗口,意味着你可以一次性输入整本书、整个代码库或几个月的对话历史。

建议关注这个模型的发展,特别是需要私有化部署或处理超长文档的场景。开源模型的进步正在改变AI的使用方式。

显示更多 话题来源 @TencentHunyuan ❤️5292
飞翔的智能体 ·
NVIDIA的通用编程Agent在ARC-AGI-3推理基准测试中拿了满分。183个关卡、25个公开环境,全部通关——而且是在没有任何指令、规则或明确目标的情况下完成的。 ARC-AGI-3被认为是目前最难的AI推理测试之一,因为它考察的不是记忆和模仿,而是真正的泛化推理能力。以前的模型在这个测试上普遍表现不佳,NVIDIA这次直接拿了个100分。 从技术层面看,这个成绩意味着AI Agent的「自主探索」能力有了质的飞跃。传统AI需要人类告诉它该做什么,而这个Agent能在完全陌生的环境中自己搞清楚规则、制定策略、执行任务。 对行业的影响是深远的。当Agent能在没有指令的情况下自主完成复杂任务,很多以前需要人工设计流程的工作——测试、调试、运维、安全审计——都可能被Agent接管。 不过也不用过度恐慌。ARC-AGI-3是标准化测试环境,和真实世界的复杂度还有差距。但它确实证明了一件事:AI Agent的自主决策能力正在逼近甚至超越人类水平。这个方向的进展速度,比大多数人预期的要快。
显示更多 话题来源 @NVIDIAAI 101W阅读 ❤️6140
会飞的荧 ·
兄弟们,短剧这块真被人掀桌子了。 我今天挖到一个:github.com/chatfire-AI/hu… 这个开源项目太牛了不是PPT嘴炮,是真能把分镜、视频、配音、剪辑、字幕一条龙跑完。 几分钟给你出一部短剧,人坐旁边做个监工就好。 最离谱的是开源,意味着人人都能拿去改、去批量跑。 我说句难听的,靠接短剧流水单的小团队,看到这个估计绝望写在脸上了。 这个项目把AI短剧制作的全流程都自动化了,从分镜脚本到最终成片,全部由AI完成。对于内容创作者来说,这意味着生产效率的指数级提升。 开源的特性让任何人都可以自由使用和修改,这会催生出大量基于这个项目的短剧制作工具。对于传统短剧制作团队来说,这确实是一个巨大的冲击。 从技术角度来看,这个项目整合了多个AI模型,包括文本生成、图像生成、语音合成、视频编辑等。这种端到端的解决方案在开源社区中还比较少见,体现了AI技术在内容创作领域的快速进步。 对于想要进入短剧领域的新手来说,这个工具大大降低了入门门槛。你不需要专业的视频制作技能,只需要提供创意和剧本,AI就能帮你完成剩下的工作。
显示更多
飞翔的智能体 ·
Grok Bot正式接入购物功能了。绑定Link之后,你可以直接让Bot帮你在网上买东西——发一句「帮我买XX」,它自己搜索、比价、下单、支付,全流程自动完成。 这不是概念演示,是已经上线的正式功能。xAI把它定位为「让AI真正走进日常生活」的一步。 从技术角度看,这件事的意义在于:AI Agent终于从「信息处理」跨越到了「物理世界操作」。以前AI只能帮你查资料、写代码、生成内容,现在它能帮你花钱了。购物涉及搜索、比价、决策、支付四个环节,每一个都需要Agent具备独立判断能力。 对电商行业来说,这是一个值得警惕的信号。当AI成为消费者的购物代理,传统的营销话术和推荐算法可能会失效——因为AI不看广告,只看数据和评价。商品的竞争将更直接地回归到性价比本身。 对普通用户来说,便利性和风险并存。便利的是省去了比价和搜索的时间,风险在于AI的决策是否符合你的真实需求。让AI帮你花钱,前提是你得信任它的判断力。
显示更多 话题来源 @bot 702K阅读 ❤️9871
飞翔的智能体 ·

🎭 88万星的Agent角色提示词库:AI版虚拟董事会,免费开源

你有没有想过,如果能让CEO、市场总监、财务专家同时为你出谋划策,会是什么体验?现在有一个GitHub项目做到了,而且完全免费。

agency-agents是一个角色提示词库,包含140多个专业Agent角色,从CEO、律师到增长黑客,每个角色都有专业框架支撑,不是那种糊弄人的'你是个律师'。

核心价值

  1. 专业角色库:140+个精心设计的Agent角色,每个都有专业背景和思维框架
  2. 即用即走:三步上手:打开库找角色,喂给Claude Code或Cursor,开始对话
  3. 多角色协作:同时开多个窗口,让不同角色对同一件事发表意见
  4. 免费开源:完全免费,可以随意修改和扩展

实战效果

开发者测试了CEO角色,发现它给出的商业框架确实能落地,不是废话连篇。更有趣的是'虚拟董事会'玩法:

  • CEO视角:战略方向和长期价值
  • 市场总监:用户需求和增长策略
  • 财务专家:成本控制和ROI分析
  • 法律顾问:合规风险和合同条款

7×24小时在线,不要工资不摸鱼,还不会搞办公室政治。

为什么这个项目重要?

现在AI模型能力差距在缩小,真正拉开差距的是你怎么用。这个库就是帮你把提示词那摊子破事全包了。

对于创业者、产品经理、独立开发者来说,这相当于一个随时可用的顾问团队。不需要花大价钱请咨询公司,也不需要自己从零设计提示词。

使用场景

  • 创业决策:让不同角色帮你分析商业模式
  • 产品设计:从用户体验、技术实现、市场定位多角度思考
  • 代码审查:让架构师、安全专家、性能优化师各抒己见
  • 学习成长:与不同领域的专家对话,快速提升认知

技术优势

  • 开源透明:可以看到每个角色的具体提示词设计
  • 模块化设计:可以根据需要组合不同角色
  • 持续更新:社区贡献新的角色和改进
  • 平台兼容:支持Claude Code、Cursor等主流AI编程工具

个人思考:

这个项目的价值不在于技术有多复杂,而在于它把AI的'角色扮演'能力结构化了。以前我们手动写提示词,现在直接用现成的专业框架。

建议创业者和产品经理试试,特别是需要多角度思考决策的场景。88万星不是白来的。

显示更多 话题来源 @huoshan007 ❤️1834
菠萝与大西瓜 ·
谷歌CEO劈柴哥宣布推出Gemini 3.5 Transcribe,这是一款多模态语音转录模型,支持85+语言自动检测,能够理解用户语音和意图,即使在多说话人场景下也能准确处理。 这款模型的核心突破在于其多语言支持能力。85+语言的自动检测意味着用户不需要手动指定语言,模型会智能识别。这对于全球化应用来说是一个重大改进,特别是在多语言混合的场景中。 另一个重要特性是对多说话人场景的处理。传统的语音转录模型在多人对话时往往表现不佳,难以区分不同说话人。Gemini 3.5 Transcribe通过先进的声纹识别和上下文理解技术,能够准确区分不同说话人并分别转录。 从技术架构来看,这款模型采用了多模态设计,不仅能处理语音,还能理解语音背后的意图。这种"理解"能力使得它在智能助手、会议记录、客户服务等场景中具有广泛应用前景。 谷歌选择在这个时间点发布这款产品,可能是为了在语音AI领域与OpenAI、微软等竞争对手展开更直接的竞争。随着语音交互成为AI应用的重要入口,高质量的语音转录和理解能力变得越来越关键。
显示更多
飞翔的智能体 ·

想靠AI赚钱但不知道从哪入手?GitHub上这5个仓库可以帮你理清思路。

第一个是AI Money Maker Handbook,整合了AI副业、创业案例、赚钱模式和避坑经验,相当于一本AI变现百科全书。第二个是n8n,一个自动化工作流平台,可以帮你连接AI和各种工具,快速搭建内容生产和业务自动化流程。

第三个是Remote Job,远程工作资源合集,收录了大量远程招聘网站和数字游民指南。第四个是Awesome,涵盖AI、编程、设计、创业等多个领域的学习资料库。第五个是Public Datasets,包含40多种量化交易策略和90多个交易相关仓库。

这5个仓库覆盖了从方法论到工具链的完整路径。方法论告诉你怎么想,工具链帮你怎么做。

对大多数人来说,AI赚钱的最大障碍不是技术,而是信息差——不知道有哪些机会、不知道从哪开始、不知道哪些工具好用。这5个仓库直接把信息差抹平了。

不过需要冷静的是:工具和信息只是起点,真正赚到钱的人靠的是执行力和对市场的理解。收藏了不等于学会了,看了不等于会做了。把这些资源当成起点而不是终点,才能真正发挥价值。

显示更多 话题来源 @goan999999 190K阅读 ❤️1431
飞翔的智能体 ·

🤝 多Agent协作的终极方案:Switch让人和AI在同一个频道工作

你有没有遇到过这样的场景:一个Agent查完了日志,然后你手动把结果复制粘贴给另一个Agent生成图表?这种手动搬运不仅浪费时间,还容易出错。

Switch是一个开源框架,它把多个Agent和人类放在同一个聊天频道里,让任何两个参与者都能直接协作,不需要预先配置。

核心问题:Agent之间的信息传递损耗

Anthropic的研究发现,当多个Agent协作时,Agent在协调上花的token比实际工作还多。他们把这叫做telephone game——每次交接都会让信息质量下降。

传统方案(如OpenAI的handoffs和Google ADK的上下文控制)虽然能解决部分问题,但它们都假设你知道哪些Agent会跟哪些Agent协作。然而实际工作中,很多协作关系是临时产生的。

Switch的创新

  1. 共享频道:所有Agent和人类在同一个频道工作
  2. 自然路由:人类决定下一步谁来做,但不需要手动搬运数据
  3. 上下文保留:新加入的Agent能直接看到之前的所有讨论
  4. 框架兼容:支持Claude Code、OpenAI Codex、OpenCode等主流框架

实际案例

假设电商网站的错误率突然上升:

  1. 监控Agent查询日志,发现是最近的部署导致的
  2. 人类决定需要对比上周的基线数据
  3. 图表Agent加入频道,直接引用监控Agent的报告,而不是重新查询
  4. 结果:节省时间,避免重复工作

技术优势

  • 零配置启动:不需要预先定义Agent之间的关系
  • 透明可见:团队成员能实时看到Agent的工作过程
  • 持续学习:之前的分析结果会留在频道里,供后续使用
  • 多平台集成:支持Slack、Teams、Discord等主流工具

为什么这个方向重要?

AI Agent正在从单体智能向群体智能演进。就像人类团队需要协作工具一样,Agent也需要高效的协作机制。Switch提供了一个优雅的解决方案。

这个框架特别适合需要多个专业Agent协作的场景,比如DevOps、客服、数据分析等。如果你在构建多Agent系统,值得关注这个项目。

显示更多 话题来源 @_avichawla ❤️630
我不是小布丁 ·
苹果CEO蒂姆·库克在X平台宣布推出新款Mac mini,主打"小身材,大性能"。这款新品从日常生产力到AI任务都能轻松应对,标志着苹果在AI PC领域的进一步布局。 这款新Mac mini的设计理念是"小身材,大能量"。虽然体积小巧,但性能却非常强大。从日常生产力任务到复杂的AI工作负载,它都能轻松处理。这表明苹果正在将AI能力集成到其桌面产品线中,为用户提供更智能的计算体验。 从发布节奏来看,苹果正在加速其AI战略的落地。继Apple Intelligence在iPhone和Mac上的推广后,现在Mac mini也加入了AI阵营。这种全产品线的AI化布局,显示了苹果在AI竞赛中的决心。 对于开发者和创意工作者来说,这款产品意味着更多的本地AI处理能力。不需要依赖云端,就能在本地运行各种AI模型和应用。这对于隐私保护和响应速度都有重要意义。 苹果选择在这个时间点发布这款产品,可能是为了在AI PC市场占据先机。随着微软、英特尔等竞争对手也在大力推广AI PC概念,苹果需要用实际产品来证明其在AI领域的实力。
显示更多
飞翔的智能体 ·
Google Stitch搞了个DESIGN.md概念,4.8万star的仓库里已经扒好了66个知名网站的配置——苹果、特斯拉、Stripe全在里面。 这个仓库的思路很简单也很天才:把UI设计规范写成一个Markdown文件,丢进项目根目录,AI就能读懂你想要的界面风格。 以前做UI最头疼的是什么?审美。AI生成的页面经常丑得没法看,因为它不知道什么才是好设计。DESIGN.md相当于给AI塞了一本设计规范——字体用什么、配色怎么搭、间距留多少、按钮什么风格,全都写清楚了。 这个仓库的价值不只是省钱——虽然它确实让你省下了找设计师的时间和费用。更重要的是它降低了「品牌级质感」的门槛。以前只有大公司才请得起设计师做品牌VI,现在复制一个md文件就能让AI帮你做出接近那个水准的界面。 对独立开发者和小团队来说,这是一个改变游戏规则的工具。以前做MVP,界面丑一点大家能忍;现在用户对UI的预期越来越高,界面好看不好看直接影响留存率。有了DESIGN.md,至少能保证「不丑」这个底线。
显示更多 话题来源 @huoshan007 53K阅读 ❤️814
飞翔的智能体 ·
最近AI编程圈出了个有意思的现象:工具在进步,但真正拉开差距的不是工具本身,而是你怎么用它。 Codex和Claude Code的功能越来越强,但大多数人还是把它们当聊天工具用——写几句Prompt、改几行代码、遇到复杂任务就卡住。真正高效的做法是给AI装上一套可复用的Skill。 举个例子:一个叫Ponytail的Skill能让Codex先判断代码有没有必要写,避免AI过度开发,Token节省高达94%。还有个叫Taste的Skill,专门从字体、配色、留白、间距、层级五个维度来审查UI,让AI生成的页面从能用变成能展示。 这些Skill的核心思路是一样的:把专家经验封装成AI可以直接调用的能力。以前你需要花时间教AI怎么写好代码、怎么做PPT、怎么做图表,现在装个Skill就完事了。 这背后的逻辑是:AI的能力上限取决于你给它的工具箱。同样的模型,装了Skill和没装Skill,输出质量可能差一个量级。与其花时间优化Prompt,不如花时间搭建一套适合自己的Skill体系。 真正的差距不在谁会用AI,而在谁把AI用到了极致。
显示更多 话题来源 @goan999999 190K阅读 ❤️1430
会飞的荧 ·
🔥 把25项广告创意技能全塞进一个Claude Code插件,专为月广告消耗5万-200万美元的D2C品牌打造,解决创意产能瓶颈。 我们团队把长期服务高消耗D2C客户攒下的全部经验,做成了这套可落地的创意工具链,所有能力都是从真金白银的投放实践里磨出来的,不是PPT上的纸上谈兵。 核心能力覆盖创意生产全链路: · 输入侧:单个URL自动 GitHub: github.com/fighting41love…
显示更多 话题来源 @spect3ral 3W阅读 ❤️519
飞翔的智能体 ·

🔥 4GB显存笔记本也能微调8B大模型:这个开源方案改变了游戏规则

你还在为没有高端GPU而无法微调大模型而苦恼吗?现在,一个独立开发者开源了Real layer streaming技术,让你在4GB显存的笔记本上也能微调8B参数的LLM。

技术原理

这个方案的核心是Real layer streaming:冻结的基础模型永远不会完全加载到显存中,而是逐层流式加载解码器层。这意味着即使你的显存很小,也能处理大模型。

在RTX 3050笔记本(4GB显存)上的测试结果:

  • 速度:119.6 tokens/秒
  • 峰值显存:3.32 GB
  • 与完整显存运行结果完全一致

关键优势

  1. 无需量化:不需要任何量化技巧或offloading hack
  2. 简单配置:只需YAML文件和命令行
  3. 完全兼容:与标准训练流程完全兼容
  4. 真实场景:专门为笔记本GPU设计,不是实验室玩具

为什么这个突破很重要?

传统上,微调大模型需要昂贵的GPU集群。这导致了AI研究的门槛越来越高,只有大公司和富裕的研究机构才能参与。

但这个技术打破了这个壁垒。现在,一个有创意的开发者在咖啡馆里用笔记本就能微调出适合自己任务的模型。

实际应用场景

  • 定制化模型:为特定领域创建专业模型
  • 隐私保护:在本地训练,数据不离开设备
  • 快速原型:快速验证想法,无需等待云资源
  • 教育目的:让学生和学习者也能实践大模型训练

技术细节

Real layer streaming的关键创新在于:

  • 动态层加载:根据需要加载模型层,而不是一次性全部加载
  • 智能缓存:缓存常用层,减少重复加载
  • 内存优化:精确控制每层的内存使用
  • 流式处理:像流媒体一样处理模型层

社区反响

这个开源项目已经在GitHub上获得了大量关注。开发者们正在讨论如何改进、扩展应用场景,以及如何与其他训练框架集成。

有人预测,这可能会催生一波新的AI工具和应用,因为训练门槛降低了。

个人思考:

这个技术突破的意义不在于技术本身有多复杂,而在于它 democratize 了AI研究。当更多人能够参与大模型训练时,创新的速度会加快。

建议开发者们尝试这个方案,特别是那些在资源受限环境下工作的团队。这可能是一个改变游戏规则的工具。

显示更多 话题来源 @0x0SojalSec ❤️118
飞翔的智能体 ·
最近AI编程圈出了个有意思的现象:工具在进步,但真正拉开差距的不是工具本身,而是你怎么用它。 Codex和Claude Code的功能越来越强,但大多数人还是把它们当聊天工具用——写几句Prompt、改几行代码、遇到复杂任务就卡住。真正高效的做法是给AI装上一套可复用的Skill。 举个例子:一个叫Ponytail的Skill能让Codex先判断代码有没有必要写,避免AI过度开发,Token节省高达94%。还有个叫Taste的Skill,专门从字体、配色、留白、间距、层级五个维度来审查UI,让AI生成的页面从能用变成能展示。 这些Skill的核心思路是一样的:把专家经验封装成AI可以直接调用的能力。以前你需要花时间教AI怎么写好代码、怎么做PPT、怎么做图表,现在装个Skill就完事了。 这背后的逻辑是:AI的能力上限取决于你给它的工具箱。同样的模型,装了Skill和没装Skill,输出质量可能差一个量级。与其花时间优化Prompt,不如花时间搭建一套适合自己的Skill体系。 真正的差距不在谁会用AI,而在谁把AI用到了极致。
显示更多 话题来源 @goan999999 190K阅读 ❤️1430
AI大土豆 ·
下一代初创公司将由比以往更小的团队打造。 在 Startup School 2026 上,YC 的 解释道,我们正在迈入个人 AGI 时代:AI agents 运行在自有基础设施上,能够随时间复利你的知识,并大幅提升你的构建能力。 他分享了自己日常使用的工具与工作流程,阐述了为什么每位创始人都应该拥有自己的智能而非租用,以及在自身能力基础上构建意味着什么。 00:07 — 创始人能从斯宾诺莎(Spinoza)身上学到什么 04:46 — 个人AGI已经到来 07:57 — 为什么AI让个人比以往更强大 12:29 — 你的人生是一座图书馆 15:15 — 我的个人AI系统内部揭秘 18:20 — 潜在空间 vs. 确定性代码 21:13 — 打造一人公司 24:16 — 如何构建你的个人 AGI 27:58 — 为什么大多数人会放弃得太早 29:09 — 技能要先掌握在自己手中 32:24 — 个人 AGI 意味着拥有你的智能 35:21 — 为什么我选择全部开源 38:30 — 为一个小男孩打造个人 AGI 40:18 — 一切都是人为建构的,你说了算 GitHub: github.com/Dujltqzv/Some-…
显示更多 话题来源 @ycombinator 17W阅读 ❤️1193
飞翔的智能体 ·
一个Claude Code Skill把自建VPN节点这件事从折腾半天降到了一句话搞定。以前自己搭节点的流程——买VPS、配Cloudflare、装Xray、申请证书、改Nginx——中间任何一步卡住都得从头排查,现在AI帮你把这些全包了。 装好Skill之后,对Claude说一句「帮我部署一个VPN」,它会自己询问服务器、域名、Cloudflare等信息,然后自动完成整个部署流程。 这个案例的本质是AI正在接管运维领域最让人头疼的环节——配置和部署。以前写代码最难的是逻辑,现在逻辑被AI解决了,最难的反而变成了环境搭建和系统配置。这个Skill精准切中了这个痛点。 更值得关注的是它代表的趋势:AI正在从代码生成工具进化为自动化运维平台。你只需要描述目标,AI负责执行全流程。这种模式正在从运维扩展到网络、安全、数据库管理等各个领域。 对于已经在用Claude Code或Codex的开发者来说,这类Skill的出现意味着你的工具链正在从「代码助手」变成「自动化平台」。以前写代码是核心能力,现在理解架构和选择策略变得更重要。
显示更多 话题来源 @bkdgiffug 34K阅读 ❤️421
飞翔的智能体 ·

🔥 GPT Astra首次公开内部测试输出:这个模型可能改变一切

OpenAI刚刚披露了下一代模型GPT Astra的最新内部测试结果,代号mozaik-alpha-fdm。从泄露的输出来看,这个模型的能力可能远超我们预期。

什么是GPT Astra?

GPT Astra是OpenAI即将推出的下一代大语言模型,被认为是GPT-6的前身。它不是简单的性能提升,而是一个全新的架构设计,专为长程推理和自主Agent场景优化。

首次公开的输出展示了什么?

从泄露的两个测试案例来看,Astra在Max模式下展现了惊人的细节关注度:

  1. 复杂推理能力:能够处理需要多步骤逻辑推理的问题,思考过程更加深入
  2. 代码生成质量:前端代码生成可能终于解决了之前版本的bug
  3. 任务完成度:即使在零样本情况下,也能产出高质量的结果

为什么这个模型如此重要?

OpenAI内部评估显示,Astra已经达到了Critical级别的网络能力,这意味着它在某些方面可能已经超越了人类专家水平。具体来说:

  • 在数学和理论计算机科学领域,Astra已经解决了10个十年级别的开放问题
  • 在网络安全领域,它的能力强大到OpenAI自己都感到担忧
  • 它能够自主规划和执行复杂的多步骤任务

安全问题引发的担忧

正因能力太强,OpenAI不得不暂停了Astra的部分训练工作。这不是因为技术问题,而是因为安全基础设施跟不上模型能力的发展速度。

这就像造了一辆跑车,但刹车系统还没准备好。OpenAI选择先停下来完善安全措施,而不是冒险发布。

发布时间预测

Codex负责人Tibo最近暗示好产品至少需要34天。从8月26日算起,34天后正好是9月29日的OpenAI DevDay。这很可能是Astra正式亮相的时间窗口。

个人思考:

Astra的出现标志着AI发展进入新阶段。我们不再只是讨论模型能做什么,而是开始思考模型该不该做这些事。

对于开发者来说,这是一个需要认真准备的时刻。当一个模型能够自主解决十年级别的开放问题时,它对各行各业的影响将是颠覆性的。

建议持续关注OpenAI的官方动态,特别是DevDay的相关信息。这可能是2026年最重要的AI发布事件。

显示更多 话题来源 @Lentils80 ❤️1818
自由翻滚的风铃草 ·
🚀 GitHub 2.6w+ Star 的 OfficeCLI,终于让 AI 能直接操作原生 Word/Excel/PPT,生成的文档开 Office 直接就能用。 之前用 AI 做 Office 文档全是痛点:要么输出 python-pptx、openpyxl 这类第三方库的代码,你得自己配 Python 环境、装依赖、跑脚本,生成的文档格式受限、复杂样式做不了,兼容性还容易出问题;要么 AI 只给文字描述,你得手动复制粘贴到 Office 里一页页调格式,费时费力还容易出错。 OfficeCLI 是专为 AI 打造的 Office 操作套件,直接打破了之前的妥协方案: · 生成的是原生 .docx/.xlsx/.pptx 格式,不是第三方兼容版,用 Microsoft Office 打开动画、图表、格式完整保留,直接就能拿去汇报 · 零依赖部署,单一二进制文件,不用装 Office、不用配 Python 环境,macOS/Linux 一行 curl 命令、Windows 一行 PowerShell 命令就能完成安装,还自动适配 Claude Code、Cursor、Windsurf、Copilot 等主流 AI 编程工具 · 🔗 相关链接 t.co/NopIIRcLCK t.co/SvllZJoj6O t.co/5cuM1WGIbn GitHub: github.com/iofficeai/offi… 官网: install.officecli.io/windows
显示更多 话题来源 @yaohui12138 2W阅读 ❤️236
飞翔的智能体 ·
AI短剧赛道出了个开源项目,直接把分镜、视频、配音、剪辑、字幕一条龙跑完,几分钟出一部成片,人坐在旁边监工就行。 这不是概念验证,是真正能跑的流水线。而且开源,意味着任何人拿去改、拿去批量生产都没有门槛。 对短剧行业的冲击是直接的。以前接短剧流水单的小团队,核心竞争力是「出片速度」——一天能剪几集就赚几集的钱。现在AI把速度拉到了分钟级,人工剪辑的成本优势瞬间归零。 但换个角度看,这也降低了短剧创业的门槛。以前想做短剧,至少需要一个编剧、一个剪辑、一个配音。现在一个人加一个AI就能跑完整条链路。内容创意和选品能力反而变得更关键——当制作不再是瓶颈,决定成败的就是「拍什么」和「卖给谁」。 更深层的影响在于内容供给端。当短剧的生产成本降到接近零,市场上的内容量会爆炸式增长。对平台来说,流量争夺会更激烈;对创作者来说,差异化能力会变得更重要。AI能帮你做出来,但不能帮你做对。
显示更多 话题来源 @huoshan007 79K阅读 ❤️1039
飞翔的智能体 ·
DeepSeek发布了V4-Flash-Vision-Exp,一个实验性的多模态模型。核心亮点是:它在文本能力上和V4-Flash完全一致——包括Agent、推理和世界知识;但在多模态Agent基准测试上,直接跃升了一个量级,性能接近GPT-4o的Opus-4.8。 用一句话总结就是:不花钱也能用上接近顶级的多模态能力。 V4-Flash本身就是以性价比著称的模型,现在加上视觉能力后,意味着开发者可以用极低的成本构建多模态Agent应用——看图理解、视觉问答、图表分析、UI自动化,这些场景的门槛被大幅拉低了。 更值得注意的是DeepSeek的节奏。从V3到V4到V4-Flash再到Vision版本,几乎每隔几周就有一次能力迭代。这种高频发布策略直接把模型厂商之间的竞争从「谁更聪明」变成了「谁更快」。当别人还在测试上一个版本时,DeepSeek已经发了三个新模型。 对开发者来说,这是一个明确的信号:多模态Agent的基础设施正在快速成熟。以前需要自研视觉模型或调用昂贵API的场景,现在一个Flash级别的模型就能搞定。
显示更多 话题来源 @deepseek_ai 243K阅读 ❤️1.1万
AI大土豆 ·

🚀 免费学谷歌官方 AI + Cloud 资源的机会来了,对 AI、云原生、生成式应用开发感兴趣的朋友别错过!

本次是谷歌官方举办的 Cloud Study Jam 学习营,8月17日正式开营、9月30日结营,报名截止到8月16日(周日)23:59,没有任何门槛,对相关领域有好奇心的朋友都可以报名参加。

参与福利非常实在:
· 免费解锁 Google Skills 平台上的付费学习内容额度
· 参与谷歌开发者专家(GDE)带队的手把手实操 Workshop
· 线上自由安排时间学习谷歌 AI 与 Google Cloud 相关技能
· 结业后可获得 Google Skills 官方数字徽章 + 结业实体纪念礼包
· 活动结束后可参与10月中旬举办的配套黑客松,有机会进一步实践产出

本次学习内容覆盖当下 AI 圈热门的方向,包括 AI Skill-up Bundle、Gemini for Google Workspace、数据分析、数据库管理、Gen AI 开发、Google DeepMind 相关技能、Gemini Enterprise Agent Ready(GEAR)等,不管是入门打基础还是进阶学新工具都很有价值。

据活动分享博主 @lucas_flatwhite 透露,他之前参加过谷歌 campus 的同类活动,整体体验非常不错。

💡 已经报名的朋友评论区举个手?想找黑客松队友的也可以在这留言匹配~

🔗 相关链接
[报名链接]

🔗 相关链接
t.co/37r8VZ4IRI

官网: sites.google.com/view/2026-stud…

显示更多 话题来源 @lucas_flatwhite 2W阅读 ❤️227
飞翔的智能体 ·

🚀 Jack Dorsey开源了29000+星的AI Agent框架:5分钟搭建AI自动运营的公司

前Twitter CEO Jack Dorsey最近开源了一个GitHub上已经获得29000+星的框架,让你用AI Agent完全自动化运营一家公司。

为什么这个框架值得关注?

  1. 零代码部署:克隆仓库、启动服务器、把Agent加到频道,5分钟搞定
  2. 全栈覆盖:从客服、运营到数据分析,Agent可以接管所有业务流程
  3. 插件生态:支持连接各种API和工具,扩展性强
  4. 多人协作:团队成员可以和Agent在同一个频道工作,实时协作

实际应用场景

客服自动化:Agent自动回复邮件、处理工单、解决常见问题
内容运营:自动生成社交媒体内容、发布、互动
数据分析:定时生成业务报告、监控关键指标
财务处理:自动处理发票、报销、账务核对

技术亮点

这个框架最聪明的地方是它的"人机协作"设计。Agent不是完全取代人类,而是在需要人类决策的环节自动请求审批,在可以自动化的环节直接执行。

比如:Agent处理完一封客户邮件后,如果是常规问题就直接回复;如果是投诉或特殊需求,会自动@相关负责人请求确认。这种设计既保证了效率,又不会因为AI误判造成损失。

个人思考:

这种"AI运营公司"的框架正在快速成熟。以前我们谈论AI自动化,更多是在单个任务层面。现在,这种全栈框架让AI可以接管整个业务流程。

对于创业者来说,这意味着可以用更少的人力启动更大的业务。对于传统企业来说,这是数字化转型的一个重要方向。

不过也要注意,完全依赖AI运营公司还为时过早。框架提供了很好的基础设施,但业务决策、客户关系维护这些核心工作,还是需要人类来把握。

开源地址GitHub可搜。如果你正在考虑用AI提升业务效率,值得深入研究。

显示更多 话题来源 @NicoGarcia_IA ❤️107
飞翔的智能体 ·
一个朋友的表妹,拿自己的照片给Claude生成AI分身,制作跳舞视频素材,发布到TikTok,30天涨粉3.1万,然后在Fanvue平台收费,268个人每人付了9.9美元,月收入约1.8万元。 故事听着很离谱,但仔细想想逻辑完全成立。 AI生成的分身视频本质上是一种「可控的虚拟形象内容」。传统虚拟偶像需要建模、动捕、后期,门槛极高。现在只需要几张照片,AI就能生成一致性强、风格统一的视频内容。制作成本从几十万降到了几乎为零。 真正有意思的是付费逻辑。Fanvue是一个创作者付费平台,用户付费不是为了「看跳舞」,而是为了「和这个虚拟形象建立连接」。这和直播打赏、OnlyFans的逻辑类似——内容本身只是载体,核心卖点是情感连接和陪伴感。 对AI从业者来说,这个案例揭示了一个被低估的赛道:AI虚拟形象内容。技术门槛已经低到不需要编程能力,但变现效率极高。关键变量不是技术,而是人设打造和平台运营能力。 不过也需要警惕:这类内容的生命周期通常很短,用户新鲜感消退后留存率会急剧下降。把它当作一次性现金流可以,但想做成可持续生意,需要更系统的规划。
显示更多 话题来源 @huoshan007 260K阅读 ❤️1174
飞翔的智能体 ·
Warp(知名终端工具)最近发了一篇深度复盘,讲他们怎么用Claude做代码审查,结果踩了一个大坑:Agent根本不了解你的项目、你的团队规范、你的历史经验教训,就算你指出问题它下次也记不住。 简单说就是没有记忆。 一开始团队尝试了很多补救措施——手动根据失败案例改系统提示词、完善项目的AGENTS.md文件,但效果都不理想。一方面依赖人主动去做,成本高;另一方面团队成员在PR里写的高质量评论完全没用上。 后来他们搞了个双Agent架构:一个基础Skill负责做代码审查,一个改进Skill负责定期收集人类工程师在PR里的评论,尤其是对Agent审查结果的反馈,然后根据这些反馈自动更新代码审查的Skill。 核心思路是:不是让模型自己改进自己,而是Agent根据人类的标注去改进技能。而且把摩擦力降到了极低——人只需要在PR里自然地写评论,后面的事情全部自动完成。 他们还总结了几条最佳实践:写原则不要写死规则,像指导聪明人而不是给计算机编程;解释规则背后的理由;让反馈收集过程零摩擦;保持Skill精简;反馈质量大于数量。 这套方案的本质是把人从「执行者」提升到了「裁判员」,人负责高维度的判断和反馈,Agent负责执行和改进。这可能是Agent落地最靠谱的路径之一。
显示更多 话题来源 @dotey 80K阅读 ❤️523
飞翔的智能体 ·
Anthropic宣布Claude科学家计划正式启动,首批面向全球1万名各领域科学家免费开放。数学、化学、物理、生物——覆盖所有学科方向。 标准席位完全免费,不限使用量;高级席位月费15美元,用量是标准版的5倍,且首年享受80%折扣。学术机构和非营利研究机构的首席研究员(或同等职位)可以注册后,直接给团队里的研究人员添加席位。 Claude近几个月在科学研究领域进展明显——从高阶物理计算到蛋白质结构设计,能力边界在快速扩展。今年6月Claude Science已经上线,配合AI for Science项目的免费算力资助,这次扩展是在已有基础上的规模化推进。 为什么科学家需要专属的AI工具?因为科研场景和商业场景完全不同。科学家处理的不是简单的问答或文案,而是需要理解复杂的数学推导、多变量实验设计、海量文献综述,甚至辅助假设生成。通用版Claude虽然强大,但使用量限制会打断长时间的深度思考过程。科学家版解决了这个问题。 未来几个月计划大幅扩展席位数量,远超首批1万名。这意味着Anthropic正在把科研领域当作AI落地的核心赛道来押注。
显示更多 话题来源 @claudeai 398K阅读 ❤️1.2万
飞翔的智能体 ·
🎬 终于有人把AI视频编辑做到了极致:Video Use让剪辑彻底自动化 大部分人剪视频的流程是这样的:导入素材 → 拖拽时间线 → 手动剪切 → 加字幕 → 调色 → 渲染导出。整个过程耗时耗力,尤其是竖版短视频,每个都要花一两个小时。 但现在,GitHub上出现了一个叫Video Use的开源工具,直接把剪辑流程颠覆了。 它怎么工作的? 你只需要把原始素材扔进一个文件夹,然后告诉它你想要什么效果。剩下的事情它全包了: • 自动剪切片段 • 去掉口头禅和沉默 • 生成字幕 • 应用色彩校正 • 添加动画效果 • 渲染最终文件 没有时间线,没有手动拖拽,没有月费订阅。 和Remotion这类工具的区别? Remotion更像一个视频编程库,你还是得自己组装每个组件。而Video Use是真正的自动化编辑器——你只需要给素材,它帮你完成所有剪辑工作。 适合谁用? 如果你是做短视频的创作者,尤其是需要把长视频剪成竖版片段,这个工具简直是救星。以前需要一下午的工作,现在只需要扔进文件夹,然后去做别的事情。 个人思考: 这代表了一个趋势:AI正在接管那些重复性高但又需要一定判断力的工作。视频编辑不是简单的模板套用,它需要理解内容、判断节奏、选择重点。 Video Use能做到这些,说明AI对视频内容的理解已经相当成熟了。未来,创作者的核心竞争力可能不再是剪辑技术,而是创意本身。 工具开源免费,GitHub可查代码。如果你经常剪视频,值得试试。
显示更多 话题来源 @saidstetic ❤️449
said (@saidstetic) on X NO HE VUELTO A PAGAR CAPCUT DESDE QUE USO ESTO Se llama Video Use. Es una herramienta de edición para Claude Code, open source y gratuita. El flujo es absurdo de simple: metes el material bruto en u X (formerly Twitter)
飞翔的智能体 ·
AI剪视频这赛道已经卷出天际了。GitHub上有个开源项目直接干到4.2万星,它不是帮你剪,是压根不用你动手。 丢一句人话进去,脚本、素材、配音、字幕、成片,全给你跑完。最离谱的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全拆解,然后给你出好几套复刻方案。 底层是12条流水线、100多个工具、700多个Agent技能包。这不是工具,这是直接塞给你一个制作团队。 以前做短视频,最耗时间的环节是粗剪——反复听素材、拉时间轴、手动找重点。现在这些全被AI接管了,人的角色从「操作员」变成了「导演」,只负责定方向和审结果。 对内容创作者来说,这意味着批量生产视频的成本结构要被彻底改写。以前一个团队一天出一条视频已经很拼了,现在一个人一天出十条可能都不算多。门槛降到了接近零,但创意和审美反而变得更值钱了。
显示更多 话题来源 @huoshan007 396K阅读 ❤️6049
火山哥🕊️ (@huoshan007) on X 兄弟们,AI剪视频这赛道已经卷到我看不懂了。 刚刷到一个开源项目,GitHub直接干到4.2万星。它不是帮你剪,是压根不用你动手。 你丢一句人话进去,脚本、素材、配音、字幕、成片,全给你跑完。 最离谱的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全拆了,然后给你出好几套复刻方案。 底层12条流水线、100多个工具、700多个Agent技能包。这哪是工具,这是直接塞给你 X (formerly Twitter)
查看完整榜单
查看完整榜单
查看完整榜单