2026年08月22日 - AI资讯盘点

每日AI行业资讯汇总

GPT-Image-2 API新增透明背景 直出PNG

时间:2026年8月20日(北美时间)

地点:美国旧金山(OpenAI 总部)

人物:OpenAI

事件详情:OpenAI 近日为 GPT-Image-2 模型推出 API 透明背景功能,目前处于预览阶段。开发者只需在请求中新增 background=”transparent” 参数,即可让模型在生成阶段直接烘焙 Alpha 通道,输出无背景的 PNG 或 WebP 文件,无需二次抠图。OpenAI 同时配套发布 Cookbook,给出四大典型用例:电商商品图、PowerPoint 图表、设计图标与贴纸、周边衍生品素材。该功能同时适用于 Images API 与 Responses API 中的图像生成工具,旧快照 gpt-image-2-2026-04-21 不支持此能力,需升级到最新模型版本。

背景:GPT-Image-2 早在 2026 年 4 月便已发布,并在 Image Arena 榜单上一度以 +242 分的领先优势登顶 Text-to-Image 第一名,但一直不支持原生透明输出,开发者通常需要借助 rembg、PhotoRoom 等第三方工具二次抠图,边缘细节如透明玻璃、薄纤维、发丝等常被破坏。

影响:原生 Alpha 通道让 AI 生成的素材开箱即用,能直接进入海报、PPT、游戏场景、电商主图等下游流程,把原本至少 30 秒到数分钟的抠图步骤省掉,对中小商家与设计师尤其友好;该功能也意味着 OpenAI 在图像生成层面进一步挤压 Midjourney、Ideogram 等竞品的开发者生态。

总结:透明背景看似是一个小参数,却把 GPT-Image-2 从生成图片推向生产素材,预计将成为电商与营销自动化的标配。

参考来源:

1. The Decoder:https://the-decoder.com/openais-gpt-image-2-can-now-generate-images-without-a-background/
2. OpenAI Developer Community:https://community.openai.com/t/transparent-backgrounds-are-now-available-in-preview-for-gpt-image-2-in-the-api/1391541
3. TokenFeed:https://tokenfeed.ai/gpt-image-2-now-removes-itself-from-the-background
4. ExplainX.ai:https://www.explainx.ai/blog/openai-gpt-image-2-transparent-backgrounds-api-preview-august-2026
5. TheWinCentral:https://thewincentral.com/openai-gpt-image-2-transparent-backgrounds-api
6. OpenAI Cookbook:https://developers.openai.com/cookbook/examples/multimodal/transparent-image-assets-for-campaigns-and-presentations

Ornith-1.5开源 编程追平Claude Opus

时间:2026 年 8 月 19 日,Ornith 团队(DeepReinforce)正式发布新一代开源大模型家族 Ornith-1.5。

地点:美国,相关模型权重同步上架 Hugging Face,全球开发者可在同一时间下载。

人物:DeepReinforce(Ornith 团队),训练基底延续自 Qwen 3.5 与 Gemma 4 等开源权重。

事件详情:Ornith-1.5 一次性放出 3 款模型,分别是 9B Dense、35B MoE(每次仅激活 3B 参数)和 397B MoE 旗舰,全套按 MIT 许可开源,并同步提供 BF16、FP8、GGUF、MLX 与 NVFP4 五种量化版本,可商用、可二次分发。

旗舰版 Ornith-1.5-397B 在 Terminal-Bench 2.1 跑出 86.1,在 DeepSWE 上跑出 56.0,而 Claude Opus 4.8 在两个基准上的成绩分别是 85.0 与 59.0;在 SWE-Bench Verified 上 Ornith-1.5-397B 进一步以 86.0 比 Claude Opus 4.8 的 85.8 高出 0.2 分。35B MoE 在保持 3B 激活参数的同时,把 Terminal-Bench 2.1 推到 68.5,显著超过 Qwen 3.6-35B、Gemma 4-31B 与 Meta 的 Muse Glimmer-30B;9B 与其量化版本 Ornith-1.5-9B-Mobile 能在 iPhone 与 Android 上离线运行,部署门槛进一步下放。

背景:Ornith-1.5 是 2026 年 6 月 Ornith-1.0 的延续,1.0 让模型自己重写训练脚手架,1.5 则把”自脚手架”升级为完整的”自改进循环”:模型先自己提出新任务,再为每个任务生成专属的执行脚手架,最后把解题轨迹作为强化学习的奖励信号。任务奖励同时考虑有效性、新颖度和难度(目标成功率 0.2),把那些不再产生学习信号的题目自动淘汰掉。这相当于把”出题人”、”老师”、”学生”压到同一组权重里。

影响:MIT 全家族 + 自改进循环首次把 397B 规模的开源权重推到 Claude Opus 4.8 同档水平,意味着原来只有闭源前沿能跑的企业级 Coding Agent 任务,现在可以走本地或私有云部署;35B 的 3B 激活为中型开源 Agent 生态提供了一个新的强基座;9B + Mobile 量化把模型塞进手机,配合端侧 NPU 推理,应用侧将以更便宜的方式分发 Agent 工作流。

总结:Ornith-1.5 用一组 MIT 开源权重把”自改进”训练范式推到 397B 规模,并在 Terminal-Bench 2.1、SWE-Bench Verified 等基准上首次与 Claude Opus 4.8 互有胜负;这让”开放权重 vs 闭源前沿”的差距继续缩小,9B + 量化让端侧 Agent 拥有真正可商用的开源基座。

参考来源:
https://ornith.ai/ornith_1_5.html
https://huggingface.co/collections/ornith-ai/ornith-15
https://www.aiexpert.news/en/ticker/ornith-15-open-models-match-claude-opus-48-via-self-improvement-loopmit-license-
https://datanorth.ai/news/ornith-releases-ornith-1-5

Ornith-1.5 Is a Free Open-Source Model That Claims to Rival Claude Opus 4.8


https://bittide.aicompass.dev/article/fdbf1835-23fd-4cbe-b006-ff7cf95b0a48
https://clauday.com/article/bd2aa1a2-5b44-4386-b1c5-bcf72a0d2892

英伟达AVO拿下ARC-AGI-3满分 25环境全通

时间:2026 年 8 月 21 日(美国时间),英伟达 8 月 21 日发布技术博客宣布 Agentic Variation Operators(AVO)在 ARC-AGI-3 公榜(public set)上以 100.00 的 RHAE 分数通关全部 25 个环境的 183 个关卡;8 月 22 日北京时间上午经 Hacker News 等渠道扩散引发关注。

地点:核心研究地点位于美国加州圣克拉拉(NVIDIA 总部研发体系),基准运行由 ARC Prize 基金会托管于其官方平台 arcprize.org,评测方法学公开于 docs.arcprize.org。

人物:研究由英伟达基础 AI 研究(NVIDIA Fundamental AI Research)团队主导,论文 arXiv 编号 2603.24517 第一作者为 Terry Chen,其他作者包括 Zhifan Ye、Bing Xu、Zihao Ye、Timmy Liu、Ali Hassani、Tianqi Chen、Andrew Kerr、Haicheng Wu、Yang Xu、Yu-Jung Chen、Hanfeng Chen、Aditya Kane、Ronny Krashinsky、Ming-Yu Liu、Vinod Grover、Luis Ceze、Roger Bringmann、John Tran、Wei Liu、Fung Xie、Michael Lightstone、Humphrey Shi;ARC-AGI-3 基准由 ARC Prize 团队(François Chollet 创立)设计。

事件详情:AVO 在 ARC-AGI-3 公榜 25 个交互式推理游戏环境上以 100.00 的 RHAE(Relative Human Action Efficiency)分数通关全部 183 个关卡,与人类首玩基线相比在动作效率上打成平手;团队将 AVO 与 Anthropic Claude Opus 5 主组合跑,并在部分高难子集同时配上 OpenAI GPT-5.6 Sol,发现两者呈现”互补”操作画像——Sol 墙钟更快达到同级,Opus 同级关卡动作数更少。

背景:AVO 不是一个新模型,而是一套”长期自主 Agent 通用架构”,由三大组件构成:(1) 主 Agent 持续检视、规划、实施并评测改动;(2) 持久记忆模块承接以往实现、评测结果、编译器/profiler 输出与累积推理;(3) 监督器监测主 Agent 搜索轨迹,遇到停滞或重复无效时介入重新定向。该架构最早用于 GPU 内核自动优化——在 NVIDIA DGX B200 上连续自主运行 7 天、探索 500+ 优化方向、产出 40 个已提交版本,让多头注意力内核跑赢 cuDNN 最多 3.5%、跑赢 FlashAttention-4 最多 10.5%,并以约 30 分钟自主适配分组查询注意力,再赢 cuDNN 7.0% / FlashAttention-4 9.3%。

影响:(1) ARC-AGI-3 公榜满分的真正意义在于它把”Agent 评测 ≠ 模型评测”具象化——同一底层模型配上不同 harness 表现差距巨大,这将推动 Agent 评测方法学、各家厂商 Agent 调度层和 ARC Prize 排行榜三方同步进化。(2) NVIDIA 用研究成果证明其”严肃工程友好”的 Agent 架构可在软件工程和长程交互两类看似迥异的任务间直接迁移,意味着一家以 GPU 而非基础模型闻名的厂商,正在用通用 Agent 栈反向切入基础模型调度战场。(3) 对开源社区与初创公司而言,AVO 的 harness 思路降低了”搭一套能跑、能在 ARC-AGI-3 拿到对人类水准的 Agent”的工程门槛——但 ARC-AGI-3 公榜满分能否复现于私榜或竞赛盲测集仍是悬念,Hacker News 讨论中已经出现”公开榜训练过拟合”的怀疑。

总结:英伟达 AVO 不是模型,而是一套把 frontier 模型(Opus 5、GPT-5.6 Sol)包成长期自主 Agent 的通用 harness,在 ARC-AGI-3 公榜 25 环境 183 关卡上交出 100.00 RHAE 满分;NVIDIA Dev Blog 与 arXiv 2603.24517 双渠道首发,论文描述 AVO 此前已在 B200 多头注意力内核自动优化上击败 cuDNN / FlashAttention-4,意味着该架构向更广推理任务横向迁移。

参考来源:
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
https://arxiv.org/abs/2603.24517
https://news.ycombinator.com/item?id=49387755
https://arcprize.org/arc-agi/3
https://docs.arcprize.org/methodology
https://developer.nvidia.com/blog/where-security-fits-in-an-ai-agent-stack/

AI视频共创平台Wapoo 千万美元天使轮落地

时间:2026年8月21日极客公园首发披露融资消息;天使轮实际交割于2026年7月29日完成。

地点:美国(产品首发地,App 于 2026 年 5 月在美国上线);公司主体为上海哇卜智能科技有限公司,注册于上海市徐汇区。

人物:创始人杨名宇(早期任职快手负责用户研究,后加入 TikTok 担任产品经理,从 0 到 1 负责 TikTok Stories 与 TikTok Now 等社交模块);投资方为某互联网集团旗下战略投资方;探奇资本担任独家融资顾问;目前团队规模约 10 人。

事件详情:极客公园 8 月 21 日报道,AI 视频共创社交平台 Wapoo 宣布完成近千万美元天使轮融资,由某互联网集团旗下战略投资方独家投资,探奇资本担任独家融资顾问。团队 2026 年 7 月成立于上海徐汇,目前规模约 10 人,并已开始筹备下一轮融资。Wapoo App 于 2026 年 5 月在美国上线,定位 “Playable Video”:用户可在朋友发布的原始视频基础上,借助生成式 AI 改写其中的人物、视角或情节,形成多版本分支接力;新生成的视频作为新版本留在原内容链路中,可被其他人继续修改。其官方理念被概括为 “互动即创作,创作即关系,关系即分发”,把传统视频平台两套相对独立的 “内容系统” 与 “关系系统” 压缩为同一个 “改写” 原子动作。

背景:Wapoo 切入的 “AI 视频共创” 赛道由生成式视频模型(Runway、可灵、Sora 等)能力下沉直接催生;与此同时,TikTok、Instagram 等主流短视频平台承接了 Gen Alpha(伴随 Roblox、Minecraft 长大的群体)大量注意力,却未承接其 “修改与共创” 欲望。创始人杨名宇观察到的 “15 岁社交断层”——Roblox/Minecraft 里的主动参与者,进入大众社交平台后被算法降级为观看者——是 Wapoo 产品假设的起点。

影响:1)产品层面,Wapoo 把生成式 AI 放在交互层背后而非主角位置,把 “改视频” 轻量化到接近 “回复消息” 的一次社交动作,是对主流短视频 “合拍/Stitch” 形态的一次范式升级。2)行业层面,千万美元天使轮加前 TikTok 核心产品经理加聚焦海外 Gen Alpha 的组合,将进一步刺激国内 AI 视频社交创业潮,并可能引发主流短视频平台对 “分支共创” 功能的跟进。3)格局层面,Wapoo 选择视频而非游戏或互动小说切入,是基于 “视频已是成熟用户行为” 的判断——降低教育成本同时押注关系链壁垒(杨名宇以 TikTok Now 与 BeReal 的竞争为例论证关系壁垒不可整体搬迁)。

总结:Wapoo 以 “改写即社交” 切入 AI 视频共创赛道,借力生成式 AI 模型把 “二创” 门槛降至熟人间的轻互动,凭借创始人 TikTok 产品经理背景与近千万美元天使轮资金,押注 Gen Alpha 社交迁移窗口期;但用户规模、圈层渗透率与留存数据均未披露,从 “早期三个信号”(用户愿意改视频 / 熟人内容更易触发参与 / 多人接力形成内部梗)走向 “真正的网络效应” 仍需一年时间验证。

参考来源:
1. 极客公园(首发深度报道):http://www.geekpark.net/news/369162
2. 张通社(工商视角,融资日期 2026-07-29):https://www.zhangtongshe.com/article/detail?id=102557
3. 今日头条 / 投融湾(团队与产品技术解读):https://www.toutiao.com/a7669718181804376627
4. 腾讯新闻转载(极客公园原稿):https://new.qq.com/rain/a/20260821A079MM00
5. 腾讯看点转载(极客公园原稿):https://so.html5.qq.com/page/real/search_news?docid=70000021_3376a87ef8c94752
6. 爱企查舆情聚合:https://aqc.baidu.com/yuqing?yuqingId=ff5501b7f2ee731562e9ceab84882fab
7. 极客公园团队背景解读(杨名宇履历):http://www.geekpark.net/news/369162

微软Azure远程MCP端点GA 拒Claude接入

时间:2026年8月21日(GA 信息于当日陆续公开,约北京时间 17:55 由 InfoQ 等媒体首发深度报道)。

地点:美国雷德蒙德 / 全球 Azure DevOps 托管服务区(微软总部与全球 Azure 节点)。

人物:
– Dan Hellem(微软 Azure DevOps 产品经理,负责 Azure Boards、Repos 与 Wiki 方向)
– Farhan Shahnewaz(微软 AI 与云方案工程师)
– Mitch Ashley(The Futurum Group 副总裁兼软件生命周期工程实践负责人,行业评论方)

事件详情:
微软于 2026 年 8 月正式上线 Azure DevOps Remote MCP Server(Model Context Protocol Server)的 GA(General Availability)版本。该服务在托管端点 `https://mcp.dev.azure.com/{organization}` 提供基于 streamable HTTP 协议的连接,使 AI 助手可以直接读取 Azure DevOps 的工作项、拉取请求、代码仓库、流水线、Wiki、测试计划等核心数据,全程无需本地安装 Node.js 或自行托管服务器;身份认证统一通过 Microsoft Entra 完成,AI Agent 继承开发者本人的权限边界。

首批支持且”开箱即用”的客户端:Visual Studio Code + GitHub Copilot、Microsoft Foundry(工具目录新增 Azure DevOps MCP 工具)、Microsoft Copilot Studio、Visual Studio、GitHub Copilot CLI、GitHub Copilot App。

暂不支持的关键客户端:Anthropic Claude Desktop、Claude Code、OpenAI ChatGPT、Cursor。这些工具需要 Microsoft Entra 支持”动态 OAuth 客户端注册”或”Client ID Metadata Documents”机制后才能连接远程端点,微软表示正与 Entra 团队合作推进该能力。

背景:
MCP(Model Context Protocol)由 Anthropic 于 2024 年底推出,作为 AI 助手调用外部工具与数据源的开放标准迅速被采纳。微软此前已发布本地版 Azure DevOps MCP Server,但需要 Node.js 20+ 和 npx 维护本地进程。2026 年 7 月 28 日发布的 MCP 新规范进一步把”动态客户端注册”标记为 deprecated,并按 pre-registered client、Client ID Metadata Documents 顺序重排认证优先级——Microsoft Entra 当前尚未支持这两种机制,是远程 MCP Server 无法直接服务第三方编程 Agent 的根本原因。

影响:
对采用 VS Code + Copilot 或微软自研 Foundry / Copilot Studio 的企业开发团队而言,远程 MCP Server 直接取消了”为每位开发者或每个团队维护一个本地 MCP Server”的运维成本,并通过 Entra 把”开发者身份 → AI Agent 身份”无缝衔接,避免凭证泄露与权限越界。对 Claude Code、Cursor、ChatGPT 深度用户来说,目前仍需部署本地 Azure DevOps MCP Server,或等待 Entra 后续支持动态 OAuth 注册。微软承诺在过渡期内持续维护本地版与远端版的特性对齐,避免生态割裂。

总结:
微软通过 Azure DevOps 远程 MCP Server 把 DevOps 工具链”Agent 化”为托管基础设施,并依托 Entra 将”开发者身份”扩展到”AI Agent 身份”。但本次 GA 仅在微软自家客户端生态内闭环,Claude、Cursor、ChatGPT 等头部编程 Agent 暂被 Entra 的 OAuth 能力挡在门外,体现出微软在大模型时代”自闭环 + 生态吸力”的双重战略:先用最严的 Entra 守住安全边界,再用托管 MCP 把开发者工作流牢牢锁在 Azure 端。

参考来源:
1. Microsoft DevBlog 官方 GA 公告(Dan Hellem):https://devblogs.microsoft.com/devops/azure-devops-remote-mcp-server-ga
2. Microsoft Learn 官方文档:https://learn.microsoft.com/en-us/azure/devops/mcp-server/remote-mcp-server
3. InfoQ 深度报道:https://www.infoq.com/news/2026/08/azure-devops-remote-mcp-ga/
4. C# Corner 技术媒体:https://www.c-sharpcorner.com/news/azure-devops-remote-mcp-server-reaches-general-availability
5. DevOps.com(Foundry 集成分析):https://devops.com/azure-devops-remote-mcp-server-lands-in-microsoft-foundry-giving-ai-agents-direct-access-to-your-devops-data/
6. ContentBuffer 解读:https://www.contentbuffer.com/news/azure-devops-remote-mcp-server-hits-ga-3bfecd80
7. Farhan Shahnewaz(微软工程师)LinkedIn 实战记录:https://www.linkedin.com/pulse/azure-devops-remote-mcp-server-copilot-foundry-github-shahnewaz-uforc/

DeepMind×EVE 15年游戏AI进持久世界

时间:2026年8月21日(DeepMind 官方博客当日发布,与 Unite.AI 等英文媒体同步报道)。

地点:英国伦敦 Google DeepMind 总部 / 冰岛雷克雅未克 Fenris Creations 工作室(EVE Online 母公司)。

人物:
– Alexandre Moufarek(Google DeepMind 研究科学家,本文第一作者)
– Adrian Bolton(Google DeepMind 研究科学家,本文合著者)
– Demis Hassabis(Google DeepMind 联合创始人兼 CEO,前游戏开发者)
– Hilmar Pétursson(Fenris Creations CEO,EVE Online 工作室负责人)

事件详情:
Google DeepMind 于 2026 年 8 月 21 日发布长文《From Atari to EVE Online: Building on 15 Years of AI Research in Games》,首次系统梳理实验室成立 15 年来以”游戏”为载体的 AI 研究脉络,并正式宣布与 EVE Online 母公司 Fenris Creations 建立深度研究合作。文章时间线跨越:
– 2015 年 DQN 用深度强化学习掌握 49 款 Atari 2600 游戏(Nature 论文)
– 2016 年 AlphaGo 击败围棋世界冠军李世石
– AlphaGo Zero / AlphaZero / MuZero 摆脱人类棋谱、用一个算法横扫国际象棋、将棋、围棋
– 2019 年 AlphaStar 达到《星际争霸 II》Grandmaster 段位
– 2024 年 AlphaFold 凭相关底层原理拿下诺贝尔化学奖
– 2025 年 11 月 SIMA 2(基于 Gemini)发布,可在 600+ 技能基础上推理目标、与玩家对话、自我改进

同时披露 SIMA 2 已大幅缩小在 ASKA、《我的世界》研究版本等”未训练”环境里与人类完成度的差距,但仍存在长程任务弱、上下文窗口短、仅限小范围研究预览等限制。

在与 Fenris Creations 的新合作中,DeepMind 拿到一个自 2003 年起持续运行、单服务器承载数千玩家的”永久宇宙”作为研究沙盘,规划了四类待检验能力:持续学习不遗忘、超出上下文窗口的长期记忆、数周到数月级长程规划、合作 / 竞争 / 谈判 / 经济复合多智能体动力学。

合作分三阶段推进:先在 EVE Online 离线实例中测试,再进入 EVE Frontier 观察人-代理共存,最后才在 EVE Online / EVE Vanguard / EVE Frontier 上线真实玩家。Hilmar Pétursson 在博文中强调:”我们与 Google DeepMind 正一起进入 AI 必须学会跨周跨月学习、适应、记忆的未知领域,这是任何其他游戏环境都未提出的要求。”

背景:
DeepMind 自 2010 年由 Hassabis 创立起就把游戏视为”受限但富信息”的研究沙盒。这条主线后期反向输送给蛋白质结构预测、机器人控制等领域,AlphaFold 的诺贝尔奖是这条线的最高成就之一。然而”会下棋 / 会打游戏”与”能在真实世界中持续运行”之间存在鸿沟——现实没有分数与规则手册。SIMA 2 是 DeepMind 把研究目标从”玩得高分”转向”像人一样理解并操作游戏世界”的关键一步,而 Fenris Creations 旗下的 EVE 单服务器持续宇宙恰好提供全行业最稀缺的研究样本:跨越 23 年的真实经济与政治演化。

影响:
1. 游戏 AI 范式从”战胜游戏”走向”融入游戏”:DeepMind 计划把 EVE 持久世界作为通用代理的长期记忆、多代理博弈与经济建模实验台,可能成为下一代 AGI 评测基准的有力候选。
2. 游戏厂商首次坐拥 AGI 级研究沙盘:Fenris Creations 通过合作获得前沿 AI 工具与人才曝光,EVE Online / Vanguard / Frontier 三款产品可能逐步加入 AI 玩家、AI 经济对手等新机制。
3. 通用 AI 训练思路回到游戏 AI 主线:在 RLHF 与合成数据等路线之外,DeepMind 把”持续世界 + 真实玩家”作为下一阶段数据来源,是对当前 LLM-only 训练范式的一次补充。

总结:
DeepMind 用一篇回顾长文宣告:游戏依旧是 AI 研究的最佳试炼场,但 2026 年的目标已从”下赢一盘棋”变成”在一个 23 年持续运转的宇宙里学会长期记忆与多代理博弈”。与 EVE Online 母公司 Fenris Creations 的深度合作,把”AGI 还差什么”这个问题压到了真实玩家身上——能否跨周、跨月地持续学习并影响一个活的经济体,将是 SIMA 2 之后下一代通用代理要交出的答卷。

参考来源:
1. Google DeepMind 官方博客(Alexandre Moufarek & Adrian Bolton,2026-08-21):https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
2. Unite.AI 报道(2026-08-21):https://www.unite.ai/google-deepmind-outlines-how-15-years-of-game-research-led-to-eve-online/
3. Fenris Creations 官方公告(EVE Online 工作室独立并改名 + 与 DeepMind 合作):https://fenris.com/news/2026/studio-behind-eve-online-goes-independent-rebrands-as-fenris-creations-enters-research-partnership-with-google-deepmind
4. Nature 2015 年 DQN 原始论文:https://www.nature.com/articles/nature14236
5. DeepMind AlphaGo 历史复盘(Move 37 等):https://deepmind.google/research/breakthroughs/alphago/
6. SIMA 2 官方介绍(2025-11):https://deepmind.google/blog/sima-2-an-agent-that-plays-reasons-and-learns-with-you-in-virtual-3d-worlds/
7. Hacker News 社区讨论:https://news.ycombinator.com/item?id=38652401

Cloudflare Codex AI工程标准强制执行

时间:2026年8月4日 Cloudflare 在官方博客发布完整方法论,8月21日经 InfoQ 综合报道引发业内关注

地点:美国旧金山 Cloudflare 全球总部

人物:Cloudflare 工程团队(Codex 治理 owner + AI 评审代理团队)

事件:Cloudflare 在官方博客详细介绍其自主构建的”工程标准治理体系” Cloudflare Codex,把过去散落在文档、聊天记录和资深工程师头脑中的工程规范,统一为机器可读的 RFC 文档,并由 AI 代理在代码评审、技术设计评审和事故报告评审中自动执行。统计显示,自 2026 年初到 8 月初的四个月里,AI 代码审查代理累计标记出约 23 万条偏离标准的违规行为,其中约 1.6 万次因违反 MUST 级别条款被直接拦截合并;同期规范评审代理针对 600 多份技术设计文档进行了预审,事故报告评审代理也已覆盖 200 多份事后报告。

背景:Cloudflare 此前的工程指南分散在内部文档站、代码仓库、Slack 讨论和个人经验中,新员工入职后往往要花大量时间搜索、比对、判断哪条规则”现在还算数”,随着公司规模扩张这种”被动检索”模式难以为继。Codex 的目标是把机构记忆沉淀到一份由各领域 owner 维护、按 RFC 2119 SHOULD/MUST 关键词明确级别、由 approved 升级到 enforced 两阶段生命周期管理的中央文档库,再用 AI 把规则嵌进开发工作流。

影响:Codex 把工程治理从静态文档升级为可被 AI 消费、可在合并前自动阻断的实时控制流,对依赖 AI 编程代理的企业尤其关键——当 Copilot、Codex、Claude Code 等代理每天产出大量改动,传统人工评审已无法覆盖。Cloudflare 同时引入 oxlint 等语言级 linter 处理可机械判定的规则,把 AI 留给需要语义理解的判断;并在 Worker 加 D1 加 AI Gateway 加 Cron Trigger 的统一基础设施上跑规范与事故评审代理,单平台复用避免重复造轮子,未来还计划把 Codex 推广到非工程团队并让代理自主提出修复建议。

总结:Cloudflare 用 Codex 证明了 AI 不光能写代码,还能强制执行工程标准——这一思路与 GitHub Advanced Security、Microsoft Azure DevOps 的 AI 治理方向一致,但把边界从安全合规扩展到了架构、语言、运维、事故复盘等全部机构知识领域,可能成为大型工程团队治理的新范式参考。

参考来源:
1. Cloudflare 官方博客(原文):https://blog.cloudflare.com/engineering-standards-enforcement/
2. InfoQ 综合报道:https://www.infoq.com/news/2026/08/cloudflare-ai-enforcement/
3. Ton’s Tech Notes 评论(与 GitHub Copilot 对比分析):https://ton-technotes.com/en/blog/2026-08-06-cloudflare-codex-ai-review-standards
4. Daniliants 个人深度解读(含完整数字拆解):https://daniliants.com/insights/how-cloudflare-enforces-engineering-standards-using-ai
5. Cloudflare 中文博客(Code Orange 复盘背景):https://blogs.cloudflare.com/zh-cn/code-orange-fail-small-complete/
6. Hacker News 转贴 Cloudflare 原文:https://blog.cloudflare.com/engineering-standards-enforcement

URL tag: cloudflare codex ai engineering standards enforcement, governance, code review, agent

Starcloud再融2.5亿美元 估值飙至23亿美元

时间:2026年8月21日

地点:美国华盛顿州雷德蒙德

人物:Starcloud联合创始人兼CEO Philip Johnston;Manhattan West合伙人Ken Abdalla、Lauren Selig;NVIDIA、Cisco Investments新投资方代表

事件详情:太空AI基础设施初创公司Starcloud于8月21日宣布完成2.5亿美元A轮延伸融资,投后估值飙升至23亿美元。本轮由Manhattan West领投,NVIDIA参投2500万美元,Cisco Investments、Cedar Capital、Goanna Capital、Standard Capital等新机构加入,老股东Benchmark、EQT、Soma、NFX、776继续跟投。融资完成后,公司累计募资达4.5亿美元。

本轮资金将主要用于三大方向:在华盛顿州Woodinville扩建10万平方英尺的制造工厂、与NVIDIA联合开发Space-1 Vera Rubin Module抗辐射太空GPU、以及抢先锁定SpaceX Starship火箭的发射时段。Starcloud已向FCC申请运营最多88000颗卫星组成的轨道算力星座,目标20吉瓦在轨计算能力。

背景:Starcloud 2024年由Philip Johnston、CTO Ezra Feilden、首席工程师Adi Oltean在Y Combinator孵化成立,仅用21个月就完成首颗卫星Starcloud-1研制并于2025年11月入轨,是全球首颗搭载NVIDIA H100数据级GPU的卫星,曾在轨训练出首个AI模型并跑通Google Gemini推理版本。今年3月公司刚完成1.7亿美元A轮融资,估值11亿美元,本轮5个月内估值翻倍。本轮NVIDIA参投的关键在于双方正在联合研制Space-1 Vera Rubin Module,专为太空辐射与散热环境设计,预计在轨算力为H100的25倍。

影响:发射运力正在成为制约轨道数据中心赛道的硬约束。SpaceX主力火箭Falcon 9计划2028年退役,新一代Starship尚未成熟,Blue Origin New Glenn、ULA Vulcan、Rocket Lab Neutron都还无法稳定补给。Starcloud提前囤积发射时段和制造产能,意在与同行Cowboy Space(5月已融2.75亿美元自建火箭)争夺未来轨道算力主导权。Cisco入局也意味着传统数据中心网络架构师开始为天基算力铺路。

总结:Starcloud此轮把太空AI数据中心的估值从11亿美元直接拉到23亿美元,5个月翻倍,NVIDIA亲自下场验证赛道、SpaceX发射窗口成核心资产。轨道算力已从概念验证进入产能与发射资源卡位阶段,2027-2028将是商业化分水岭。

参考来源:
https://techcrunch.com/2026/08/21/starcloud-raises-200-million-for-orbital-data-centers-as-launch-options-dry-up/
https://www.unite.ai/starcloud-raises-250m-series-a-extension-at-2-3b-valuation/
https://www.geekwire.com/2026/starcloud-250m-data-center-satellite-network-nvidia/
https://finance.yahoo.com/technology/ai/articles/starcloud-raises-250-million-2-140000211.html
https://www.ctvnews.ca/business/article/orbital-data-center-startup-starcloud-valued-at-us23-billion-in-latest-funding/
https://spacetech.dealroom.co/news/note/starcloud-raises-250m-to-put-ai-data-centers-in-orbit
https://www.marketreview.com/news/starcloud-250-million-orbital-ai-data-centers
https://superintelligencenews.com/companies/orbital-data-centers-starcloud-raises-250m

美光100亿AI内存研究院 选址Boise

时间:2026年8月20日(美国当地时间周四)

地点:美国爱达荷州博伊西(Boise, Idaho)

人物:Micron Technology(美光科技)董事长兼CEO Sanjay Mehrotra;NVIDIA创始人兼CEO黄仁勋;Apple CEO Tim Cook;美国商务部长Howard Lutnick;白宫科技政策办公室主任Michael Kratsios;Applied Materials总裁兼CEO Gary Dickerson;Lam Research总裁兼CEO Tim Archer

事件详情:美光科技正式宣布成立Micron Research Labs(美光研究院),计划在未来十年内向其位于美国爱达荷州博伊西的总部投入100亿美元,用于建设美国首座专注于存储技术的研发枢纽。该研究院将聚焦下一代存储技术、存储与计算架构、先进封装以及未来半导体制造工艺,旗舰博伊西园区预计2027年动工,可容纳数百名研究员,并与现有的美光欧洲、日本、印度、新加坡和台湾研发中心形成全球卫星实验室网络。美光已确认的合作院校包括斯坦福大学(Stanford University)、德克萨斯大学奥斯汀分校(University of Texas at Austin)和比利时imec(Interuniversity Microelectronics Centre)。新设施还将承办国际研究会议、研讨会和创新论坛。黄仁勋表示,美光正在攻克AI时代的关键挑战——重构存储技术与架构,以驱动下一代日益强大的AI系统;Cook强调美光20多年来一直是Apple的重要存储供应商,新研究举措将进一步深化双方合作;Lutnick则将存储定位为美国技术领导力的核心要素,称该投资将强化美国创新并创造数百个就业岗位。

背景:AI基础设施的快速扩张正推动存储芯片需求结构性增长。高带宽存储(HBM)作为向AI加速器高速供给数据的关键组件,已成为现代计算基础设施的战略瓶颈。美光目前是美国唯一研发并制造前沿存储技术的公司,已承诺在美国累计投入超过2500亿美元用于制造与研发,整体项目预计支持超过9万个美国就业岗位,目标到2035年实现40%的DRAM产能落地美国。此前美光已分别宣布在博伊西(两座DRAM晶圆厂,首座预计2027年中投产)和纽约雪城附近(美国史上最大半导体制造基地)的大型制造布局,本轮100亿美元专项研发投入与制造扩张并行,强化美光”研究-制造”一体化战略。此次投资也契合特朗普政府推动国内芯片制造、降低海外依赖、保持AI竞争力的产业政策方向,美光项目已获得CHIPS法案高达62亿美元的支持。

影响:美光100亿美元研发投入是AI驱动下存储产业战略地位跃升的标志性事件,将巩固美国在全球前沿存储研发中的主导地位,同时强化美光在HBM和下一代存储领域的竞争筹码。从产业链看,NVIDIA、Apple、Applied Materials、Lam Research等上下游巨头集体站台,凸显存储与AI芯片设计、封装、设备之间的协同正在加深;从政策与就业维度,该项目叠加2500亿美元制造承诺,预计长期带动数万本土岗位,并将显著推动爱达荷州和雪城周边半导体产业集群发展。短期看,美光股价与全球存储板块情绪有望获提振;中长期看,”研究+制造”双引擎模式可能重塑存储产业从工艺研发到量产落地的节奏,也将进一步抬升HBM、先进封装和3D DRAM等下一代技术的迭代速度。

总结:美光以十年100亿美元在博伊西落子AI内存研究院,瞄准的是下一代AI算力的”内存瓶颈”,既是美国存储自主战略的关键拼图,也是AI时代存储价值重估的产业信号。研究院2027年动工、与现有2500亿美元制造布局并行的安排,意味着美光正把”前沿研发+本土量产”绑定为同一节奏,NVIDIA与Apple等巨头的站台进一步把存储推上AI基础设施核心位置。

参考来源:
1. https://finance.yahoo.com/technology/ai/articles/micron-unveils-10-billion-ai-134438383.html
2. https://qz.com/micron-research-labs-ai-memory-boise-082026
3. https://www.enr.com/articles/63535-micron-plans-boise-research-facility-as-10b-semiconductor-initiative-takes-shape
4. https://www.chosun.com/english/industry-en/2026/08/21/6M4NIBS4V5ESZOGQ3W6VI4ZMDM/
5. https://www.thestandard.com.hk/innovation/article/340552/Micron-unveils-US10-bln-Boise-research-lab-to-fuel-AI-memory-chip-innovation
6. https://www.usnews.net/news/279255344/micron-announces-usd-10-billion-research-investment-adds-to-us-manufacturing-push
7. https://www.insiderfinance.io/news/micron-research-labs-expands-boise-investment
8. https://investorshub.advfn.com/market-news/article/34741/micron-unveils-10-billion-u-s-research-lab-focused-on-memory-and-ai
9. https://news.ycombinator.com/item?id=49383582

Anthropic推Mythos 5扫描 3500万开源

时间:2026年8月21日(周五)

地点:美国旧金山 / 全球

人物:Anthropic 团队、Anthropic 联合创始人兼 CEO Dario Amodei、Claude Security 负责人

事件详情:Anthropic 8月21日宣布,将其最强的网络安全专用模型 Claude Mythos 5 正式集成进 Claude Security 漏洞扫描器,向所有 Claude Enterprise 客户开放公测。同时启动总规模 3500 万美元的 Defender Advantage Fund(0xDAF),以 Claude API Credit 形式资助开源软件安全维护者。Mythos 5 扫描返回的每条漏洞都附带 CWE 分类、严重度评级、置信度评分与建议补丁;所有补丁仍需人工签收才能落地,且计费计入现有 Enterprise 计划的 token 用量、无额外附加费。

背景:Claude Mythos 5 是 Anthropic 迄今最强的网络攻防双用模型,自 2026 年 4 月起通过 Project Glasswing 仅向约 150 家合作伙伴(AWS、Apple、Google、Microsoft、JPMorgan 等)开放,并衍生出”严格脱敏版” Claude Fable 5 供公众使用。本轮扩展是 Glasswing 之后的第三阶段,核心判断是:直接访问模型本身最具风险,而只暴露”漏洞清单 + 补丁建议”等具体输出则可控。Anthropic 同步宣布将扩大 Cyber Verification Program,未来数周内让经认证的防御方用上 Mythos 级模型。

影响:3500 万美元 Credit 直接对接开源生态,预计优先用于修复主流开源项目中的活漏洞、自动化扫描-修复流水线和”对整类攻击免疫”的架构级方案,将 Mythos 5 的防御能力扩散至整个开源供应链;企业侧则可在不直接调用 Mythos 5 的前提下享受其漏洞发现与补丁建议能力;Anthropic 用”输出而非权重”的接入模板,为其他仍在双用顾虑下封锁前沿模型的大厂树立了可复用范式。

总结:Anthropic 通过”产品层护栏+开源 Credit 激励”双管齐下,把最危险的模型开放给最需要它的防御者,同时不放出裸模型调用——这是 2026 年大模型”负责任落地”的新样板。

参考来源:
– The Decoder:https://the-decoder.com/anthropic-deploys-claude-mythos-5-in-security-tools-35m-open-source-fund/
– Anthropic 官方博客:https://claude.com/blog/bringing-claude-mythos-5-to-more-defenders
– Unite.AI:https://www.unite.ai/anthropic-deploys-claude-mythos-5-in-security-tools-35m-open-source-fund/
– Cyber Security News:https://cybersecuritynews.com/mythos-5-claude-security-scanning/
– AlphaSignal:https://alphasignal.ai/news/anthropic-opens-claude-mythos-5-to-enterprise-teams-for-hunting-code
– TipRanks(TheFly 转载):https://blog.tipranks.com/claude-says-mythos-5-now-available-in-claude-security-thefly-news

WhiteFiber融资3.1亿美元 扩张AI数据中心

时间:2026年8月21日(周五)

地点:美国 / 北卡罗来纳州

人物:WhiteFiber(NASDAQ:WYFI)CEO Sam Tabar、深创投 / CDB 资本 / Wofu Capital 等机构投资人

事件详情:AI 基础设施提供商 WhiteFiber 8月21日宣布完成 3.1 亿美元(约人民币 22 亿元)可转换高级票据私募发行,含初始购买方全额行使的 4000 万美元超额配售权,年息 5.00%,2032 年到期;初始转股价 33.84 美元/股,相对 8 月 18 日收盘价溢价 25%。公司净筹资约 2.985 亿美元,其中约 1.185 亿美元用于同步置换 2031 年到期的旧可转债,剩余约 1.8 亿美元将主要用于北卡罗来纳州 NC-2、NC-3 数据中心园区的建设、能源服务协议、GPU 服务器采购及潜在收购或合作。

背景:WhiteFiber 前身为 BitFuFu 母公司加密挖矿业务分拆出来的 GPU 云与数据中心子公司,2024 年转型专注 AI 算力租赁与超算服务,是英伟达 H100/H200 算力在欧美渠道的重要二级分销商之一。本轮融资距公司 8 月 18 日宣布以 6000 万美元现金收购北卡两座工业地产改造成数据中心仅隔 3 天,凸显 AI 数据中心”地-电-机”三位一体的资本密集投入特性。WYFI 股价 8 月 19 日因稀释担忧单日暴跌 21.83%,但 Stocktwits 散户情绪随后反转为”极度看涨”,成交量放大近 50 倍。

影响:1.8 亿美元增量资金将直接加速 WhiteFiber 在北卡的 60-200MW 数据中心产能落地,目标 2027 年 Q3 首批机柜投运;可转债置换削减 86% 旧债本金至约 3185 万美元,显著降低 2027 年到期偿付压力;对国内华为、浪潮、世纪互联等 AI 数据中心运营商而言,海外同行以可转债 + 资产收购快速扩产的模式,提供了”轻资产运营 + 滚动融资”的可行范本。

总结:WhiteFiber 用一笔 3.1 亿美元可转债同时完成”扩产 + 降债”,是 2026 年 AI 数据中心赛道”算力通胀”背景下中小型算力运营商典型的资本操作样本。

参考来源:
– Unite.AI:https://www.unite.ai/whitefiber-closes-310m-convertible-notes-to-fund-data-center-expansion/
– PR Newswire 官方公告:https://www.prnewswire.com/news-releases/whitefiber-announces-closing-of-upsized-310-0-million-convertible-senior-notes-offering-302857530.html
– Dealroom:https://app.dealroom.co/news/feed/whitefiber-prices-upsized-270m-convertible-senior-notes-offering-for-ai-infrastructure-expansion
– NewsStack:https://www.newsstack.io/article/whitefiber-announces-closing-of-upsized-3100-million-convertible-senior-notes-offering
– TradingView / Stocktwits:https://www.tradingview.com/news/stocktwits:86c6f3259094b:0-wyfi-stock-crashed-more-than-22-in-pre-market-today-what-s-the-latest-on-its-convertible-note-offering

Cloudflare让Astro积压减85%

时间
2026年8月4日(Cloudflare 官方博文发布),覆盖2026年1月至今的自动化进程

地点
Cloudflare 官方博客、Astro 开源 GitHub 仓库

人物
Cloudflare 工程团队(博文作者 Matthew Phillips);Astro 维护者;行业评论者 Jordan Matthiesen(CloudBees 高级产品经理)、Shubhanshu Singh 等

事件详情
Cloudflare 在 Astro 开源框架仓库部署了基于隔离 AI 子代理的自动 triage 流水线,把 GitHub 未解决 Issue 数量从 200 多条压到约 30 条,降幅约 85%,目标下月归零——这将是该仓库 5 年来首次清零。

整套流水线由四个独立子代理组成,每个阶段由不同隔离的子代理执行:复现(Reproduce)子代理克隆报告者提供的最小复现仓库并验证问题;诊断(Diagnose)子代理通过插桩代码定位根因;验证(Verify)子代理检查测试套件、文档与评论,判断是否为真实 Bug;修复(Fix)子代理把复现转为失败单元测试,再依据架构指南给出方案。各阶段通过 report.md 文件传递信息而非共享执行上下文,避免 LLM 一贯的”硬给方案”偏见。

流水线本质上是 GitHub Issue 标签驱动的状态机:新 Issue 标记 triage needed,修复方案得到报告者确认后转为 fix verified。一旦子代理找到修复方案,工作流会通过 pkg.pr.new 生成预览发布版本,并把诊断摘要、日志与安装说明回贴到 Issue 中。报告者验证通过后,自动开启关联 Pull Request。

底层引擎已沉淀为开源框架 Flue(flueframework.com),定位”an open, platform-agnostic framework for building durable agents and workflows”,采用 TypeScript 编写,可与 GitHub、Slack、Linear、Discord 集成,运行于 Node.js、GitHub Actions 或 Cloudflare 基础设施之上。在 Cloudflare 上,Agent 可以以 Durable Objects 形态运行并享有持久化执行能力。整条 triage 流水线封装为 GitHub Action triagebot-action(仓库 withastro/triagebot-action)供其他项目直接复用。

Cloudflare Workers AI 上运行的 Kimi-k2.7-code 模型负责 triage,Kimi-k2.6 负责复核;流水线启动延迟低于 10ms,单次子代理执行成本约 0.002 美元。Cloudflare 还修改了 Astro 7.0 的 astro dev –background 命令,使其在 AI Agent 环境下自动把开发服务器作为后台进程管理,避免 Agent 陷入交互式 CLI 的脆弱输入解析。

背景
随着 AI 编程工具普及,开源仓库收到的低质量 Issue、未审查 Patch、推测性漏洞报告数量暴涨,人工 triage 已经不可持续。Astro 项目由 Cloudflare 在 2026 年 1 月收购,维护者直接参与了流水线设计。

Flue 框架与 GitHub Copilot Workspace、Anthropic Claude Code 等”Agent Loop”路线不同,强调”显式系统设计”(explicit agent system design):把事件响应、子代理编排、推理/操作权限分离都明确建模,而非把一切都包在一个循环里。

影响
1. 开源仓库运维范式转向”AI 软件工厂”。Cloudflare 把流水线定义为”软件工厂”——AI Agent 像流水线一样协作、交付工件。triagebot-action 开源后,其他开源维护者可立即复用,把积压 Issue 数量压到接近零成为可复制实践。

2. Agent 开发周期(ADLC)开始落地。整条流水线展示了 AI Agent 作为”一等公民”的 CI/CD 集成方式——能跑后台进程、自动开 PR、按事件触发工作流。配合 Flue 框架的持久化执行能力,Agent 不再是演示循环,而是生产级流水线节点。

3. 验证成本从高级工程师迁移到可扩展算力。CloudBees 高级产品经理 Jordan Matthiesen 评价:这种设计把”先复现再诊断”作为流程硬约束,让 reporter 容易验证补丁,把繁重的 triage 工作从稀缺的高级工程师转移到了可水平扩展的算力上。

4. 模型选择实际是”国产模型组合”。Cloudflare Workers AI 上跑的 Kimi-k2.7-code 与 Kimi-k2.6 来自月之暗面,证明在生产级 Agent 流水线中,国产模型已经能与海外闭源模型同台竞技。

总结
Cloudflare 把 Astro 仓库的 Issue 积压从 200+ 压到 30(约 85% 降幅),并把背后流水线封装为开源 Flue 框架和 triagebot-action GitHub Action。这不只是 Cloudflare 内部的 DevOps 优化,而是一份可复制给任何开源维护者的”AI 软件工厂”模板。下一步关键看 Flue 在 GitHub、Slack、Linear、Discord 等多事件源上的实际部署表现,以及 Astro Issue 是否真的能在下月归零。

参考来源
1. Cloudflare 官方博客:How we built a software factory to drive Astro’s GitHub issue count to zero
https://blog.cloudflare.com/astro-issue-triage/
2. InfoQ:Cloudflare Cuts Astro Github Issues by 85% with AI Agents
https://www.infoq.com/news/2026/08/cloudflare-astro-ai-agents/
3. 网易(Ping值焦虑译稿):开源项目issue积压200+,Cloudflare用AI代理85%自动化清理
https://www.163.com/dy/article/L4SVV3GR05561FZF.html
4. 觉醒AI:Cloudflare 用 AI 软件工厂把 Astro GitHub issue 从 200 降到 30
https://www.jxxy.net/ai/articles/ah-bc43b80f
5. 稀土掘金:Astro的GitHub Issue积压量创5年新低,Cloudflare正式开源其背后的自动化工具
https://juejin.cn/post/7670437767588249646
6. World Programming:Cloudflare Cuts Astro Github Issues by 85% with AI Agents
https://www.worldprogramming.org/posts/cloudflare-cuts-astro-github-issues-by-85-with-ai-agents-d90vth
7. Charlie27 Blog:Cloudflare 打造 AI 修復工廠讓 Astro issue 降 85%
https://www.charlie27.com/2026/08/2026-08-05-cloudflare-打造-ai-修復工廠讓-astro-issue-降-85%2Cgoogle-cloud-api-gateway-開放跨模型路由

Harness定胜负 英伟达AVO让Opus 5拿满分

时间

2026 年 8 月 21 日(北京时间 8 月 22 日凌晨),Nvidia 在开发者博客正式公布 Agentic Variation Operators(AVO)研究论文与 ARC-AGI-3 基准测试结果。研究论文 arXiv 编号 2603.24517。

地点

全球范围公布,核心实验在 Nvidia AI 部门进行;基准测试结果由 ARC Prize 独立验证并由第三方科技媒体 TechCrunch、Linxi News、CoinDesk 等同步报道。

人物

– Adel El Hallack,Nvidia AI 产品副总裁,是本次研究的对外发言人
– ARC Prize 团队,ARC-AGI-3 基准的设计与维护方
– Anthropic 团队,Claude Opus 5 的提供方,本研究中作为底层模型被调用
– OpenAI 团队,因前期在 ARC-AGI-3 上得分不足 10% 而被本次研究”针对性”对比

事件详情

Nvidia 用 Claude Opus 5 作为底层模型,配合自研的 Agentic Variation Operators(AVO)自定义 Harness,在 ARC-AGI-3 交互式推理基准上拿到 100% 完美得分。

具体细节:

– AVO 包含持久记忆、监督代理(supervisor)和反馈循环三大组件
– 共完成 25 个环境、183 个关卡,使用 6624 次环境动作
– 比此前的 SOTA 系统 VISTA 少用约 12% 环境动作(VISTA 用 7542 次)
– 同样使用 Claude Opus 5,去掉 Harness 后得分从 100% 跌至 30%
– 该 30% 已经是所有裸模型测试中的最高分

Nvidia 还做了交叉实验:把 AVO 套在 OpenAI 的 GPT-5.6 Sol 上跑部分关卡,Sol 在某些关卡用时更短,Opus 5 在动作数上更省,两类前沿模型呈现互补特征。

背景

ARC-AGI-3 是一套 2D 游戏形式的无说明交互推理基准,要求 AI 像人类一样自行探索环境、发现规则并取胜,是当前公认的智能体长程任务难度天花板。

行业近期对 Harness 价值的认知迅速升温:

– OpenAI 此前模型在 ARC-AGI-3 上得分不到 10%,后通过两个 Harness 设置微调使分数翻三倍
– Microsoft 4 月研究显示,19 款主流 LLM 在长程文档编辑任务中均产生大量错误
– Databricks 7 月研究指出 Harness 选择可使 AI 推理成本最高相差 2 倍
– Anthropic Claude Code、OpenAI Codex、DeepSeek Harness 均属于 Harness 层代表产品

影响

– 进一步证实”Harness 决定上限、模型决定基线”的行业判断
– 把 AI 智能体竞争焦点从参数规模推向工程层与运行时
– Nvidia 通过 Nemo 品牌持续输出开源 Harness 组件,强化软硬一体护城河
– 给闭源厂商带来开放策略压力,倒逼 Anthropic、OpenAI 思考 Harness 透明度

总结

– Harness 而非底层模型,是 AI 智能体可靠性的真正决定因素
– 100% 的 ARC-AGI-3 得分由系统架构而非模型智能单独实现
– 这不是 Nvidia 商业产品,是研究展示,但传递的信号非常明确:Agent 竞争进入”调度层 + 工具层”工程化时代
– 业内玩家(DeepSeek、OpenAI、Anthropic)都已押注 Harness 路线,下一步看谁能做出更可靠的运行时

参考来源

1. TechCrunch(原始报道): https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/
2. Nvidia 开发者博客(论文与官方说明): https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
3. CoinDesk(基准细节): https://coindesk.cc/nvidia-s-avo-agent-completes-arc-agi-3-benchmark-with-100-success-rate-103821.html
4. Linxi News(综合分析): https://news.linxi.com.au/news/nvidia-research-suggests-ai-harness-outperforms-model-choice-in-long-horizon-tasks
5. Omega Technology(架构解读): https://www.omegatechnologysolutionsgroupinc.com/blog/nvidias-avo-agent-scores-100-on-arc-agi-3-benchmark-cc6c6c
6. explainx.ai(Codex Harness 对比): https://explainx.ai/blog/codex-as-a-platform-open-agent-harness-august-2026
7. FrontierNews.ai(DeepSeek Harness 战略): https://www.frontiernews.ai/news/article/deepseeks-modular-harness-strategy-signals-a-shift-d02b7774

Claude Code助17岁开发者搞定惠普冷门驱动

时间:2026年8月21日

地点:印度新德里 / GitHub

人物:青少年开发者 Kuber Mehta(PolyThink 创始人)、Anthropic Claude Code(底层使用 Opus 4.8 模型)

事件详情:印度开发者 Kuber Mehta 利用 Anthropic 的 Claude Code 命令行编程工具,仅用 4 小时、约 30-40 条提示指令,就为惠普 HP Laser 1008a 这款 2023 年发布的”Windows only”激光打印机写出了可在 Apple Silicon macOS 26 上原生运行的驱动。Mehta 还在 GitHub 开源了完整代码(MIT 协议),同时公布了他与 Claude Code 的完整对话记录,供开发者复盘参考。

背景:HP Laser 1008a 是一款贴牌三星 SPL3 的”主机式”激光打印机,仅随机提供 Windows 和 Linux 驱动,macOS 用户既无法使用 AirPrint、也不支持 PostScript 或 PCL,SpliX 等开源 SPL/QPDL 驱动此前也未能产出正确数据流。Mehta 通过逆向 Windows/Linux 驱动、修改开源 SpliX 引擎并辅以原生 IOKit USB 写入组件,让这台原本在 Mac 上”不工作”的打印机实现了 Cmd-P 直出打印。该项目也适配 HP Laser 1003、1006 和 1008 (a/w) 系列。

影响:这一案例展示了 AI 编程智能体在硬件兼容性、驱动开发等”小众但高门槛”领域的实战潜力——以往因投入产出比太低而被厂商和社区放弃的冷门硬件,正在借助 Claude Code 类 Agent 重新获得 macOS 生命;Mehta 自称”此前对 macOS 驱动了解甚少”,但在与 Opus 4.8 的协作中边做边学,凸显”AI 编码智能体+个人开发者”模式正在打破设备生态壁垒、延长硬件生命周期。

总结:Claude Code + 17 岁青少年开发者联手 4 小时”复活”一款 Windows 专属的惠普冷门打印机,给 macOS 用户带来无需终端操作的原生打印体验,同时也为 AI 辅助底层系统编程、填补硬件兼容空白提供了又一个可复制的样本。

参考来源:
– IT之家:https://www.ithome.com/0/992/832.htm
– GitHub 项目主页:https://github.com/Kuberwastaken/hp-laser-1008a-macos
– Tom’s Hardware:https://www.tomshardware.com/tech-industry/artificial-intelligence/dev-uses-claude-ai-to-create-native-macos-driver-for-obscure-windows-only-printer-linux-container-hack-enables-system-wide-cmd-p-printing-driver-now-available-on-github
– TechRadar:https://www.techradar.com/pro/no-driver-no-problem-devs-use-claude-ai-to-craft-native-macos-tool-for-an-obscure-windows-only-printer
– World Programming:https://www.worldprogramming.org/posts/dev-taps-claude-code-to-craft-custom-printer-driver-for-macos-aclnz1
– Duck IT Tech News:https://www.duckittech.com/news/claude-helps-build-macos-support-for-an-hp-printer-that-never-had-a-mac-driver
– 新浪财经:https://finance.sina.cn/stock/jdts/2026-08-21/detail-iniparap8126390.d.html

英伟达拟200亿美元估值入股Mercor数据标注

时间:2026年8月20日 The Information 率先披露,8月21日经华尔街见闻、网易、智通财经等多家媒体跟进报道。

地点:美国旧金山湾区;Mercor 总部位于旧金山,数据标注业务覆盖科研、法律、金融与英伟达 GPU 编程等领域。

人物:英伟达(NVDA.US)及其开源 AI 模型 Nemotron 团队;AI 数据标注服务商 Mercor;本轮潜在领投方 General Catalyst(已有股东);Mercor 现有股东 Benchmark、Felicis 等。

事件详情:英伟达正与 AI 数据标注服务商 Mercor 洽谈入股事宜,拟参与后者估值 200 亿美元的新一轮融资,现有投资方 General Catalyst 正在洽谈领投;Mercor 上半年毛收入 6.14 亿美元、全年预计达 20 亿美元,去年实现小幅经营利润转正、今年经营利润预计 2.26 亿美元、明年预计 17 亿美元,过去三年累计融资约 5.2 亿美元、去年 10 月估值 100 亿美元、本轮 200 亿美元意味着不到一年估值翻倍;上一季度英伟达向 Mercor 支付了数千万美元数据服务费,并已将 Mercor 数据用于其最新两款 Nemotron 开源模型训练,Mercor 内部已组建专门团队服务英伟达;除 Mercor 外英伟达还使用 Turing、Scale AI 等外部数据供应商并保留内部团队,同时通过 OpenRouter 平台收集开发者与 Nemotron 交互产生的数据。

背景:英伟达今年投资节奏明显提速,在截至今年 4 月的季度内向私人企业及基础设施基金共投入 186 亿美元,超过 2025 年全年的投资总额,今年以来已向云服务商 CoreWeave、Nebius 各投入 20 亿美元,向网络硬件激光器供应商 Lumentum、Coherent 注资,并持续向租用或采购英伟达芯片的 AI 初创提供资金;Mercor 此前主要客户为 OpenAI、谷歌、Anthropic 等闭源模型开发商,但随英伟达推进 Nemotron 开源模型,其对英伟达营收贡献持续增长;作为对比,英伟达曾参与 Scale AI 2024 年 140 亿美元估值的融资轮,Scale 后被 Meta 以 49% 股权入股并聘用其 CEO,Mercor 若以 200 亿美元估值完成本轮将超越 Scale,成为数据标注赛道最高估值独角兽。

影响:本轮若完成将巩固英伟达在开源 AI 模型供应链上的话语权——从”卖 GPU 算力”延伸至”控训练数据”,与开源大模型训练管线深度绑定;Mercor 估值翻倍与 200 亿美元新标杆将推高 AI 数据标注赛道整体估值水位,加速 Scaling/聚联/数据堂等中游公司估值上行;英伟达与 OpenAI、Anthropic 等闭源大客户争夺数据供应商的态势会进一步加剧,数据作为”AI 时代新石油”的战略地位被强化;伴随 Meta 入股 Scale、英伟达入股 Mercor 等动作,全球 AI 数据供应链已从”中立基础设施”转向”被超大规模厂商垂直锁定”的新阶段。

总结:英伟达正洽谈以 200 亿美元估值参与 AI 数据标注独角兽 Mercor 新一轮融资,General Catalyst 拟领投,上半年毛收入 6.14 亿美元、全年预计 20 亿美元的 Mercor 将借此超越 Scale 成为数据标注赛道最高估值独角兽,此举标志英伟达的投资触角已从芯片客户延伸至数据供应链上游,与开源 Nemotron 战略形成深度绑定。

参考来源:

1. The Information(原始信源,由华尔街见闻、格隆汇引用)- https://wallstreetcn.com/articles/3779981
2. 华尔街见闻:英伟达拟入股AI数据供应商Mercor – https://wallstreetcn.com/articles/3779981
3. 格隆汇 / 阿斯达克财经:英伟达擬投資AI數據標注公司Mercor – https://www.aastocks.com/tc/usq/quote/stock-news-content.aspx?id=GLH2621170L
4. 网易(综合 The Information):英伟达拟入股AI数据供应商Mercor – https://www.163.com/dy/article/L4SBNF3O05198NMR.html
5. 智通财经:数据标注商Mercor估值飙升至200亿美元 – https://so.html5.qq.com/page/real/search_news?docid=70000021_8396a86a96492252
6. 网易(格隆汇8月20日):英伟达拟投资AI数据标注公司Mercor – https://www.163.com/dy/article/L4OVBIH805566WVY.html

可灵AI拟180亿美元融资明年港股IPO

时间:2026年8月21日 市场消息披露,8月21日阿思达克财经、8月19日快手 Q2 财报与8月3日7月初已敲定的 30 亿美元首轮融资共同构成完整故事线。

地点:中国香港 / 北京;可灵 AI 主体北京可灵智能科技有限公司为分拆后运营实体。

人物:快手科技(01024.HK)及其管理层(董事长兼 CEO 程一笑、CFO 钟奕祺等);可灵 AI 团队;首轮 30 亿美元融资领投方 CPE 源峰、国方创投、BlueFive、腾讯、中关村科学城基金(联合国科投资)、中信证券等;产业跟投方阿里云、百度、华策影视、芒果等。

事件详情:据 8 月 21 日市场消息,快手旗下可灵 AI 正进行分拆以来首轮外部融资,投前估值 180 亿美元、为可灵 AI 上市前融资,计划于明年初递交港股上市申报材料;可灵 AI 在快手 8 月 19 日发布的 Q2 财报中实现营业收入超 8.5 亿元、同比增长超 200%,全球用户突破 1 亿,本季度围绕专业创作、高频生产和自动化工作流持续完善产品能力,可灵 AI 3.0 系列模型推出原生 4K 视频直出功能,可灵 3.0 Turbo 模型在保持动态质量和音画同步的同时提升生成效率、降低创作成本,可灵 MCP 与 CLI 上线支持 AI Agent 调度可灵 AI 进行批量创作;7 月 2 日晚间快手已公告分拆方案:以 150 亿美元投前估值引入 21 名初始投资者 138.236 亿元(20.28 亿美元)+ 15 名额外投资者 52.235 亿元(7.66 亿美元),合计上限 30 亿美元,对应北京可灵经扩大注册资本 16.67%,完成后快手持股由 100% 摊薄至约 68.33%,CPE 源峰、腾讯、中信证券等领投、阿里云、百度、华策影视、芒果等头部产业方跟投,光源资本担任独家财务顾问。

背景:可灵 AI 此前主要客户为创作者、广告、影视工作室付费渠道,2025 年全年北京可灵收入约 11 亿元、2026 年 3 月年化收入运行率(ARR)已达约 5 亿美元(约 36 亿元),Q2 单季度收入同比 +200% 的爆发式增长印证商业化曲线;可灵 AI 4 个月内完成从快手内部 AI 项目到千亿元估值独立 AI 公司的转身,但背后是年营收 11 亿元、年亏损 19 亿元、净资产为负的”矛盾体”——资本市场押注的是千亿元级 AI 视频赛道未来,以及昔日万亿元市值的快手能否长出新王牌;同期 OpenAI 3 月宣布关停 Sora 为全球视频生成赛道让出大片真空,国内字节 Seedance、生数科技等对手快速补位,可灵需在商业化、算力储备、海外渠道三线同时发力;本次分拆也是快手在 AI 算力烧钱与市盈率倍数压力下的必然选择,独立融资让可灵 AI 获得资本运作空间,母公司无需独自承担大模型训练与算力基建的高额烧钱成本。

影响:可灵 AI 180 亿美元投前估值意味着按可灵最新 ARR 5 亿美元(约 36 亿元)口径,估值倍数高达约 36 倍,是当前 AI 视频生成赛道最高估值,超越 Runway(40 亿美元)、Pika(5 亿美元)等海外对手;快手母体以 68.33% 持股保留绝对控制权,10 个月资产转让期限为 IPO 创造清晰路径,腾讯、阿里、百度三家 BAT 罕见同台参投约 2.51% 股权,避免单一巨头控制路线图;可灵 AI 30,000+ 企业客户、约 75% 收入来自海外市场已构成稳定现金流支撑;分拆后母公司无需独自承担大模型烧钱负担,可灵 AI 获得独立融资弹药应对字节 Seedance、生数科技的同台竞争,全球 AI 视频赛道正式进入”可灵 vs 字节 vs Runway”三足鼎立阶段。

总结:可灵 AI 正以 180 亿美元投前估值进行分拆后首轮上市前融资并计划明年初递交港股上市申请,叠加 Q2 营收超 8.5 亿、同比增长 200% 的商业化曲线、30 亿美元首轮融资 BAT 罕见同台入局的阵容、全球用户破 1 亿的生态规模,可灵 AI 已从快手内部 AI 项目完成到千亿元估值独立 AI 公司的转身,这场分拆既是快手 AI 战略的关键卡位,也将成为 2026 年下半年全球 AI 视频赛道最重要的 IPO 候选。

参考来源:

1. 阿思达克财经(8月21日):快手可靈AI尋求分拆後首輪融資 投前估值180億美元 – https://www.aastocks.com/sc/(Z(@@78XMF=@@sPxRU%7B%7B%7Bthis%7D%7D%7Dxca))/mobile/News.aspx?NewsID=NOW.1531644
2. 雷递网 / 搜狐:可灵AI第二季收入超8.5亿同比增超200% – https://so.html5.qq.com/page/real/search_news?docid=70000021_3066a856f0f84152
3. 每日经济新闻(7月初):腾讯、阿里、百度,历史性同台!快手旗下可灵AI首轮融资落地 – https://www.163.com/dy/article/L0VSPBOK0512B07B.html
4. 证券时报:行业最大单笔融资落定,可灵AI”单挑”字节谷歌 – https://stcn.com/article/detail/3996598.html
5. 新浪财经(7月初):快手旗下可灵AI敲定20亿美元融资 投前估值150亿美元 – https://t.cj.sina.cn/articles/view/1899684203/713ae16b001016yhu
6. 网易(7月初):可灵AI首轮融资落地 BAT 历史性同台 – https://www.163.com/dy/article/L0VSPBOK0512B07B.html
7. AI2Work:Kling AI’s Record $3B Round: Inside Kuaishou’s $18B Video Spinoff – https://ai2.work/blog/kling-ai-s-record-3b-round-inside-kuaishou-s-18b-video-spinoff

英伟达战略入股Cloverleaf强化AI工厂电力布局

时间:2026年8月21日(美东时间周五)

地点:美国得克萨斯州休斯顿 / 加利福尼亚州圣克拉拉(Cloverleaf总部位于休斯顿,NVIDIA总部位于加州圣克拉拉)

人物:David Berry(Cloverleaf联合创始人兼CEO)、Nico Caprez(NVIDIA全球AI基础设施增长副总裁)、Jensen Huang(NVIDIA创始人兼CEO)

事件详情:2026年8月21日,NVIDIA宣布对美国数据中心电力开发商Cloverleaf Infrastructure进行少数股权投资,正式建立战略合作伙伴关系。《华尔街日报》此前披露,NVIDIA本次投资规模达数亿美元。合作达成后,Cloverleaf将采用NVIDIA DSX参考设计平台,在项目设计早期就统筹考虑选址、电力、冷却、计算能力和设施等关键决策。客户可在整个AI工厂技术栈层面与NVIDIA协作,覆盖加速计算、高性能网络Spectrum-X以太网、基础设施与平台软件以及NVIDIA DSX平台。J.P. Morgan担任Cloverleaf独家财务顾问,Kirkland & Ellis担任法律顾问。

背景:Cloverleaf成立于2024年,初始投资来自Sandbrook Capital和NGP Energy Capital,是一家专注于为数据中心运营商提供高质量、清洁能源、随时可开工场地的房地产开发商。自成立以来,公司已向客户交付多个GW级项目,已售出超过7GW的电力土地项目储备,其中包括为Oracle和OpenAI在威斯康星州提供的项目场地。今年以来NVIDIA密集加码AI基础设施投资:本周早些时候宣布向SoftBank旗下SB Energy投资15亿美元,用于OpenAI俄亥俄州数据中心项目;今年早些时候还获得了电力开发商Lancium 20%的股权,涉足位于得克萨斯州阿比林的Oracle/OpenAI Crusoe园区。

影响:本次战略入股巩固了NVIDIA在AI数据中心生态系统早期阶段的角色,确保未来AI算力扩张所需的电力与场地供应。对Cloverleaf而言,NVIDIA的资金与DSX平台背书将加速其GW级项目储备转化为实际投运容量。对Oracle、OpenAI等已购地的客户而言,DSX平台可帮助其在电力、水资源和电网容量约束下,更高效地建设和运营AI工厂。对行业而言,此举标志着AI芯片巨头正从硬件供应商转型为AI基础设施全栈投资者,进一步锁定下游数据中心采购需求。

总结:NVIDIA通过少数股权战略入股Cloverleaf,将其AI工厂版图延伸到电力与场地这一最上游环节。结合年内对SB Energy、Lancium的连续投资,NVIDIA正构建从芯片、系统、网络到数据中心选址与电力的全栈控制力。这一战略转向既保障了未来AI算力扩张所需的基础设施供给,也使其在与AMD、Intel等竞争对手博弈中多了一层结构性壁垒。

参考来源:
1. PR Newswire官方新闻稿(Cloverleaf发布): https://www.prnewswire.com/news-releases/cloverleaf-infrastructure-forms-strategic-partnership-with-nvidia-to-accelerate-data-center-infrastructure-development-302857329.html
2. TechCrunch报道: https://techcrunch.com/2026/08/21/nvidia-partners-with-data-center-developer-cloverleaf/
3. 华尔街日报: https://www.wsj.com/business/deals/nvidia-in-talks-to-invest-in-data-center-power-developer-cloverleaf-infrastructure-ff94c556
4. Yahoo Finance / Reuters: https://finance.yahoo.com/technology/ai/articles/nvidia-invests-data-center-developer-143451360.html
5. BNN Bloomberg / Reuters: https://www.bnnbloomberg.ca/business/company-news/2026/08/21/nvidia-invests-in-data-center-developer-cloverleaf-infrastructure/
6. Data Center Dynamics: https://www.datacenterdynamics.com/en/news/nvidia-backs-data-center-powered-land-company-cloverleaf/
7. WSJ TNB Tech Minute播客: https://www.wsj.com/podcasts/tech-news-briefing/tnb-tech-minute-nvidia-in-talks-to-invest-in-cloverleaf-infrastructure/D6311FA1-332C-4690-833F-04CD4D98D543
8. 新浪财经 / 财联社: https://finance.sina.cn/2026-08-22/detail-inipazsi8028974.d.html
9. 财联社(HTML5): https://so.html5.qq.com/page/real/search_news?docid=70000021_8666a887c8972152

字节豆包下周推独立办公AI 直击WorkBuddy

时间:2026年8月22日

地点:北京(字节跳动总部)

人物:字节跳动CEO梁汝波、豆包产品负责人赵祺、字节豆包产品团队

事件详情:
据第一财经新皮层独家消息,字节豆包团队最快将于下周(2026年8月25日当周)正式发布一款对标腾讯WorkBuddy的独立办公类AI产品。该产品相当于把当前豆包App内的”工作任务”模式整体拆分出来,封装为一款独立应用,主打桌面级办公Agent体验。目前豆包网页端界面已经出现独立的”新工作任务”入口,与”新对话”并列。

最近一周,豆包密集更新了”工作任务”模式的多项能力,包括支持手机远程操作电脑、虚拟桌面操作Windows、新增侧边工作栏等。本次独立发布意味着豆包正式将办公场景从通用App中剥离,对标腾讯已上线半年的WorkBuddy。字节官方对上述消息暂未作出回应。

背景:
2026年7月30日,字节跳动启动面向AI业务的重大组织调整:飞书产品团队与豆包产品团队整合,成立新的豆包产品团队,由赵祺统一负责;飞书负责人谢欣向赵祺汇报。这条整合路线让”豆包企业版”在部分飞书客户中率先开启内测,飞书底层协作能力以组件形式下沉给豆包调用。

8月6日的年中全员会上,字节CEO梁汝波明确表示,集团资源将”集中培育粗主干业务”,三大主干为AI、信息平台和交易服务;抖音为现有核心主干,豆包将被培育为”全新AI主干业务”,后续更多AI产品会以豆包为中心进行整合。字节大模型业务按2026年7月平均消耗口径已达40亿美元ARR,超过国内其他模型公司总和;豆包6月月活3.82亿(QuestMobile),位列国内AI原生App第一。

影响:
字节正式以独立产品形态冲击AI办公赛道。6月PC端AI原生办公智能体市场总访问量首次突破6000万次,其中腾讯WorkBuddy以单月2097万次位列第一,超过第二名字节TRAE IDE(1279万)和第三名阿里QoderWork的总和。腾讯系(含WorkBuddy、CodeBuddy、QClaw、Marvis)合计份额约53.8%,字节系约23.8%,阿里系约15.2%。豆包独立办公产品若如期推出,字节将首次拥有直接与WorkBuddy正面竞争的桌面Agent入口,并把豆包月活优势转化为办公场景的用户基数。

总结:
AI办公”三国杀”进入下一阶段。从7月30日飞书并入豆包、8月3日阿里千问办公公测、到下周豆包独立办公App上线,国内三大云厂商在不到一个月内全部完成AI办公产品线的组织与品牌整合。桌面Agent之争的核心不再是模型参数,而是谁能成为用户打开电脑后的第一交互层;豆包这一步把通用AI助手的流量优势直接对接办公场景,让字节重新具备争夺AI办公”入口门票”的资格。

参考来源:
1. IT之家《消息称字节豆包最快下周发布对标腾讯 WorkBuddy 办公类 AI 产品》https://www.ithome.com/0/992/890.htm
2. 网易《豆包下周推类WorkBuddy办公产品,飞书合并后AI办公整合提速》https://www.163.com/dy/article/L4TN5BO905561FZX.html
3. 新浪新闻《大厂线下抢客,办公Agent争夺桌面入口》https://k.sina.com.cn/article_1651428902_626ece2602001isk0.html
4. 腾讯新闻《WorkBuddy跑出来后,钉钉飞书放下了”入口”执念》https://news.qq.com/rain/a/20260805A0DB8D00
5. IT之家《内部”一路绿灯”:消息称 WorkBuddy 已成腾讯 AI 应用战略优先级最高产品之一》https://www.ithome.com/0/987/446.htm
6. 新快报《字节阿里腾讯角逐下一代办公超级入口》https://www.xkb.com.cn/articleDetail/514708
7. 今日头条《腾讯 All In WorkBuddy,AI办公的入口争夺战刚刚开始》https://www.toutiao.com/article/7671966030402535986

AI-RAN企业恒湾科技完成数亿元B+轮融资

时间:2026年8月21日(36氪深度报道)

地点:四川成都高新区

人物:恒湾科技管理团队;深创投(领投)、国开科创、沃赋创投、东山精密(跟投)

事件:AI-RAN与6G射频技术企业恒湾科技宣布完成数亿元B+轮股权融资,本轮由深创投领投,国开科创、沃赋创投、东山精密等跟投;资金将主要用于核心芯片自研、AI-RAN与6G技术研发以及海外市场深化布局。

背景:恒湾科技(ZILLNK)成立于2019年12月,总部位于成都高新区,专注射频技术与产品的研发、生产制造与销售,核心团队来自清华、北大、电子科大等高校。公司累计获得超百项自主知识产权,发明专利43项,研发人员占比近70%,并在内部将企业级AI Agent部署到研发、交付与运营全流程。技术壁垒覆盖模块到核心芯片的全栈自主研发,客户覆盖欧美日韩等海外巨头。2024年2月英伟达联合软银、爱立信、诺基亚、微软发起AI-RAN联盟,2026年GTC正式提出AI Grid愿景——把AI算力下沉到基站与网络边缘,让每一台基站不仅是通信节点,更是分布式AI算力节点。

影响:本轮资金到位后,恒湾将加速射频核心芯片与AI-RAN/6G整机的产业化,进一步强化海外研发与销售网络,巩固其在国内AI-RAN射频芯片环节的稀缺位置。投资方看中的逻辑在于:无线接入网正从固定功能硬件走向软件定义、AI原生的可编程计算平台,而同时具备5G通信与AI算力全栈能力的国内玩家极少。

总结:恒湾科技B+轮落地,标志着国内AI-RAN与6G赛道出现既懂通信又懂AI算力的产业化领跑者,将为基站侧分布式AI算力落地提供国产核心芯片支撑,对英伟达AI Grid愿景在国内的落地具有里程碑意义。

参考来源:
1. 36氪(8月21日深度版)基站变算力节点,恒湾科技完成B+轮融资:https://www.36kr.com/p/3949069449821314
2. 36氪快讯(8月18日)恒湾科技完成数亿元B轮融资:https://36kr.com/newsflashes/3944739814866055
3. DoNews:恒湾科技完成数亿元B轮融资:https://www.donews.com/news/detail/4/6675521.html
4. 腾讯财经:恒湾科技完成数亿元B轮融资:https://new.qq.com/rain/a/20260818A0AZ7100
5. 搜狐财经:恒湾科技B轮融资,融资额数亿人民币:https://www.sohu.com/a/1065457447_121319643
6. 亿欧数据 – 恒湾科技企业信息:https://data.iyiou.com/company/details/f42e6bd4684de4fc18e180e277ba7edd/profile

Nari开源Qwen3-TTS响应打进50毫秒

时间:2026年8月19日(美国西部时间发布),2026年8月21日 Hacker News 社区热议,2026年8月22日(北京时间)国内开源圈广泛传播。

地点:韩国初创公司 Nari Labs 技术博客,全球 GitHub / Hacker News 社区同步扩散。

人物:Nari Labs(韩国首尔,两名本科生创立,曾开发 1.6B 参数开源对话模型 Dia 的核心团队)。

事件详情:Nari Labs 8月19日在官方博客发布《Pushing the Speed-Cost Frontier for Qwen3-TTS》,将阿里千问团队的 Qwen3-TTS CustomVoice 1.7B 模型作为骨干,基于单一 NVIDIA H100 SXM 部署,在 5 分钟 Poisson open-loop 流量压测下做到 10 RPS 且 p95 Time-to-First-Audio(TTFA)始终稳定在 50 ms 以下;20 RPS 时仍控制在 100 ms 以内。在 1 RPS 对比的五个开源实现中,vLLM-Omni(277.88 ms / 100% underrun)、SGLang-Omni(1140.69 ms)、VoxServe(315.06 ms)、M*(1159.95 ms)四套方案均无法触及 50 ms 门槛,Nari 的实现在该项指标上唯一胜出。其核心做法是把 Qwen3-TTS 的 Talker、Code Predictor、Codec 三个模块暴露为可独立调度的任务、由统一调度器按”先到先出 + 临近播放死线优先”重新排布,结合动态前置静音剪裁(约 80 ms)、codec_chunk 自适应起步策略、CUDA Graph 整段捕捉与预分配 KV Cache 三项优化。成本端,H100 SXM 时租 4.29 美元、10 RPS 下产出 630 字符/秒,满载折算约 2 美元 / 百万字符,同口径下 ElevenLabs V3 为 100 美元、Cartesia Sonic 3.5 为 49 美元。完整实现已在 GitHub 仓库 nari-labs/nari-qwen3-tts 与基准测试仓库 nari-labs/benchmarks 以 MIT/Apache-2.0 双协议开源。

背景:千问团队 1 月 22 日开源 Qwen3-TTS 系列(0.6B/1.7B),主打 Dual-Track 混合流式生成架构,端到端合成延迟低至 97 ms,但官方未提供低延迟流式实现,社区一直依赖 vLLM-Omni、SGLang-Omni 等第三方包;阿里 7 月 20 日再发 Qwen-Audio-3.0-TTS Flash 与 Plus 版本、8 月 17 日登顶 Artificial Analysis 全球榜。Nari Labs 早在 4 月推出 1.6B 参数 Dia 对话模型,靠 Google TPU Research Cloud 与 Hugging Face ZeroGPU 零资金起步,凭 Dia 在 ElevenLabs 与 NotebookLM 围剿下成为 Github Trending 前列。本次出击把研究对象从自研模型转向开源生态中被广泛部署的千问 TTS,体现 TTS 推理优化进入”工程化军备竞赛”阶段。

影响:5 倍到 50 倍量级压缩的首包时延让”语音对话可感”的边界从高成本 SaaS 拉低到单卡自托管,AGI 语音代理、车载智能座舱、视障辅助、长对话有声内容等场景的实时合成成本下调一个数量级;开源实施同步迫使 ElevenLabs、Cartesia、OpenAI Realtime 等闭源服务商要么跟随降价要么披露推理栈,加大 TTS 商用的毛利压力。对国内而言,千问 TTS 通过国际独立开源团队的实战认证是模型出海的代表性时刻,类似之前 Mistral / Llama / Qwen 在英文 LLM 圈的同款反向扩散——”模型在中国,推理优化可在全球社区完成”。

总结:在 1.7B 量级 Qwen3-TTS 单卡部署下,Nari Labs 凭三重模块协同调度把 TTFA 打进 50 毫秒、合成成本降到 2 美元 / 百万字符,并完整开源实现与基准,重新定义了”实时 TTS”的可商用门槛,是开源语音链路继 Dia 之后又一次非巨头主导的工程突破。

参考来源:
1. Nari Labs 官方博客:Pushing the Speed-Cost Frontier for Qwen3-TTS,https://nari-labs.com/blog/qwen3-tts-speed-cost-frontier/
2. GitHub 代码仓库:nari-labs/nari-qwen3-tts,https://github.com/nari-labs/nari-qwen3-tts
3. GitHub 基准仓库:nari-labs/benchmarks Qwen3-TTS 1.7B CustomVoice 报告汇总,https://github.com/nari-labs/benchmarks
4. Web Pulse 转录全文:How We Made a Text-to-Speech Model Respond in Sub-50 ms,https://wpnews.pro/news/how-we-made-a-text-to-speech-model-respond-in-sub-50-ms
5. Hasty Briefs 摘要:How We Made a Text-to-Speech Model Respond in Sub-50 ms(含 arXiv M* 与 Fireworks AI benchmark 出处),http://hb.int2inf.com/en/s/item/7MGW7azs11Mz4AFPBU4u1H-qwen3-tts-customvoice-real-time-performance
6. Hacker News 热门条目:How we made a text-to-speech model respond in sub-50 ms,https://news.ycombinator.com/item?id=41279833
7. Hugging Face 模型卡:Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice(被优化目标),https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
8. Qwen3-TTS 官方仓库:QwenLM/Qwen3-TTS(含技术报告与 97 ms 端到端延迟说明),https://github.com/QwenLM/Qwen3-TTS
9. 百度百科:Qwen-Audio-3.0-TTS(千问 TTS Plus 登顶 Artificial Analysis 全球榜脉络),https://baike.baidu.com/item/Qwen-Audio-3.0-TTS/68320403
10. Nari Labs / Dia 综述:Open-Source TTS Reaches New Heights — Nari Labs Releases Dia 1.6B(Toby Kim 双人零资金创业背景),https://i.aidevmd.com?p=90082/

具身机器人走出PPT 万亿独缺工厂复购单

时间:2026年8月19日(宇树科创板挂牌暨世界机器人大会开幕日)起,8月20日王兴兴在 2026 世界机器人大会主论坛公开承认”机器人效率仍不及人、暂难大规模进厂”,8月21日晚点 LatePost 发《具身智能的金钱游戏》深度调查,钛媒体 AI 资本观 8月21日发此综述,2026年8月22日(北京时间)热度持续。

地点:北京亦庄 2026 世界机器人大会会场、上海证券交易所科创板、浙江杭州宇树科技总部及全球资本市场。

人物:宇树科技创始人王兴兴;中国电力企业联合会、国家电网与南方电网采购部门;优必选 Walker S 系列项目组;Figure AI(美国)、Covariant、Physical Intelligence(美国)、亚马逊 Agility Robotics Digit 项目组。

事件详情:钛媒体 AI 资本观 8月21日发表《具身机器人的万亿狂欢,在等待工厂的一张复购单》一文指出,宇树科技上市首日(8月19日)开盘价 1100 元、总市值一度冲至 4449 亿元,次日股价大跌 18.7%、市值回落至约 2779 亿;同一时间北京亦庄世界机器人大会汇聚 300+ 厂商与 2000+ 件展品,但具身智能仍未跨过”进厂真实干活”的复购门槛。具体而言,宇树 2025 年人形机器人出货 5511 台,单台均价 16.6 万元,七成流向高校 / 科研机构 / 科技大厂研发部;优必选 Walker S 系列虽密集签约蔚来、东风柳汽、一汽-大众,但其本质仍是创新预算下的 POC 测试,距产线正式资本开支仍有差距;国家电网 4 月印发的《2026 年具身智能发展规划》拟投 68 亿元采购 8500 台具身设备,四足巡检机器狗 / 双臂机器人占 8000 台,仅 500 台为人形机器人,且测算逻辑是”年省 50-80 万人工、2-3 年回本”,已脱离讲故事阶段。文章将图 02 入驻宝马斯帕坦堡工厂装配、Optimus 在特斯拉内部署、Digit 进入亚马逊物流并称为”几家全球明星公司提交的同一张考卷——能否在不享受自家公司资本补贴的前提下获得外部实体用户的连续复购”。

背景:晚点 LatePost 8 月 21 日《具身智能的金钱游戏》援引 Smart Analytics Global 数据指出,2026 上半年全球人形机器人出货 1.91 万台、同比增长 272%,但 22 家百亿级企业”很多连产品都没有”,投资圈互相承诺下一轮跟投硬把估值拉高;钛媒体调查显示宇树首日成交额 231.6 亿元、换手率 85.28%,却被 RaaS(机器人即服务)模式下的”部署量幻觉”笼罩——一旦客户止损拒租,硬件折旧、维修和技术迭代风险全压在机器人公司或融资租赁方账上。王兴兴 8 月 20 日在世界机器人大会主论坛的坦承(”目前效率和泛用能力还不够高”)、宇树招股书披露 2026 上半年”增收不增利”(扣非净利同比 -19.34%)也佐证了这一点。演化经济学家卡萝塔·佩蕾丝的《技术革命与金融资本》框架被引用,强调当前正处于”导入期 / Installation Period”,金融资本主导泡沫扩张,部署期 / Deployment Period 的关键拐点(Turning Point)尚未到来。

影响:文章核心主张是”看订单不如看续约、看单价不如看 TCO(全生命周期成本)”——将产业真正商业化的指标由”硬件出货量”切换到”实体工厂是否愿意把它写入下一年资本开支并在第二年继续追加”。对一级市场而言,这意味着以 RaaS 租金确认的收入将被打折估值,硬件工厂的真实复购率与售后成本率成为投行尽调新焦点;对创业公司而言,谁先在电力运维、汽车焊接、3C 检测等强约束场景跑出”两年持续续约”案例,谁就能把估值锚从”万亿赛道提前折现”切换到”现实现金流支撑”;对二级市场而言,机器人板块 8 月 19 日已出现”利好出尽”式普跌(科创 50 -6.89%、科创综指 -7.16%),预示资金开始用”复购单”标尺重新挑选标的。

总结:宇树上市与亦庄大会构成 2026 具身智能”导入期末段的最高潮”,同时披露”工厂复购单”才是下一阶段唯一的价值标尺——这意味着机器人公司必须从 PoC 视频叙事走向 TCO 数据叙事,从资本补贴型自家部署走向独立第三方续约,否则再热闹的展馆也难以承接万亿估值的真正落地。

参考来源:
1. 钛媒体 AI 资本观:具身机器人的万亿狂欢,在等待工厂的一张复购单,https://www.tmtpost.com/8111584.html
2. 晚点 LatePost:具身智能的金钱游戏(被钛媒体原文引用),https://mp.weixin.qq.com/s?__biz=MzU3Mjk1OTQ0Ng==&mid=2247538248&idx=1&sn=f6d0cb4f7ebfd3b6664059a656907eb6&scene=21
3. 界面新闻独家:中国电网开启近 100 亿具身智能设备采购与投资(8500 台 / 68 亿元结构),https://news.qq.com/rain/a/20260424A02KQX00
4. 21 世纪经济报道:国网 68 亿采购机器狗和人形机器人 电力行业打响具身智能规模化第一枪,https://www.21jingji.com/article/20260429/herald/6bc0f3fbe48368de421f1a7c9d0659c7.html
5. 财联社转新华日报交汇点:国网 68 亿采购具身智能设备(四年路线图与”光明电力大模型”对接要求),https://www.xhby.net/content/s69eb6393e4b0680f6d5418de.html
6. 北京日报客户端:宇树上市首日暴涨 629.44%、市值超 4449 亿元(IPO 概况),https://www.toutiao.com/article/7675557384948826664
7. 腾讯网财经:宇树上市两日首日暴涨 460% 次日大跌 18.7%(王兴兴世界机器人大会演讲全文),https://new.qq.com/rain/a/20260821A04DDR00
8. 中国经营报:科创板迎来第三位 90 后创始人王兴兴开盘身家即超千亿(商业模式背景与表决权差异),https://so.html5.qq.com/page/real/search_news?docid=70000021_3026a85553738652
9. 澎湃新闻 / 东方财富:中一签赚 47.46 万 宇树总市值 4449 亿元(行业 PE 与图 02 / Optimus 对标讨论),https://wap.eastmoney.com/a/202608193845478425.html
10. 网易科技:国家电网启动近 100 亿具身智能采购 机器人规模化落地电力场景(云深处 / 宇树 / 智元 / 优必选 / 傅利叶入选名录),https://www.163.com/dy/article/KR9CJPF40514R9OJ.html

硅谷大谈机器人未来 现场主角九成中国造

时间:2026年8月18—19日(美国西部时间,旧金山 Fort Mason 场馆 Actuate 26 大会现场),8月21日《Business Insider》商业内幕首发深度报道,8月22日(北京时间)IT之家 / 腾讯 / 财联社同步转载。

地点:美国旧金山 Fort Mason Actuate 26 大会主会场;中国宇树科技、杭州机器人供应链。

人物:Foxglove 联合创始人兼 CEO Adrian Macneil;谷歌自动驾驶项目 Waymo 创始人之一 Sebastian Thrun;Multiply Labs CEO Fred Parietti;宇树科技(Unitree)两台 G1 / H1 人形机器人;出席 1500 名投资者、创业者、工程师;大会赞助方包括 NVIDIA、特斯拉、亚马逊机器人、Boston Dynamics、Waymo、ABB、FANUC、Universal Robots、Clearpath、ROS Foundation 等。

事件详情:8月18—19日召开的 Actuate 26(Foxglove 自办)吸引约 1500 位与会者,主办方 Adrian Macneil 称现场门票若不受场地限制销量或超 2000 张,较 2025 年增 3 倍。展区却”硬件稀缺”——提供机器人训练数据服务的数据公司数量超过机器人本体公司,Uber AI Solutions、Instawork 等现场演示大规模现实世界数据采集与标注;多位演讲嘉宾把”Physical AI”作为高频议题,却只能看到极少数真机器人,其中最受关注的就是宇树科技送来的两台人形机器人,它们进入 UFB Robot Fight Night 格斗环节,但表演过程”真正发生碰撞的场景较少、机器人频繁出现攻击落空”。会议现场一份数据被反复引用:中国企业去年约占全球人形机器人出货量的 90%;Multiply Labs CEO Fred Parietti 公开称公司部分生产环节仍依赖中国制造的人形机器人,”现在没有替代方案”。Sebastian Thrun 直接批评 FCC 早前对”外国制造先进机器人设备”实施限制的监管”存在问题”,认为压低美国本土硬件供给风险,可能反而拖累整个赛道。

背景:Crunchbase 数据显示全球机器人初创企业 2025 年融资 150 亿美元、2026 年至今 188 亿美元(继续上扬),但是从实验室 demo 跨到生产级可靠性成最大瓶颈。与会者普遍认为机器人”必须面对真实物理世界”——重力、反作用力、空间几何、扰动光照、不可预测的人机共融场景都需要真实遥操作数据集,这部分”互联网”上根本没有可爬取的免费语料。Actuate 26 设立的议程覆盖自主导航、机器人基础模型、机器人数据基础设施、仿真、车队运维、调试、评估、从田间数据到生产的开发闭环;演讲嘉宾包括 Wayve CEO Alex Kendall、Aurora 主席 Chris Urmson、Physical Intelligence 联合创始人 Chelsea Finn、Zipline CTO Keenan Wyrobek、Shield AI CTO Nathan Michael、Google DeepMind 机器人 VP Carolina Parada、NVIDIA AI 研究 VP Sanja Fidler、1X Technologies 工程 VP Tom Sanocki、Generalist CEO Pete Florence、Dyna Robotics 联合创始人 Jason Ma、Genesis AI 联合创始人 Theophile Gervet、Saronic 软件 VP Goutham Subramanian、Foundry Robotics 技术主管 Meghna Gummadi 等 30+ 位业内高管。FCC 监管之所以成议题,是因为美方在”先进机器人设备”领域曾考虑禁止新进口中国制造整机或关键零部件,目前并未真正落地。

影响:1500 位硅谷投资人在”硬件缺口 + 数据短缺 + 监管不确定”三重压力下见证宇树等中国企业以 90% 真实出货量主导现场,明显强化了中国机器人供应链”美国软件 AI 研发 + 中国硬件本体”的全球分工叙事;对一级市场而言,软件层(数据工具、模型训练、仿真平台、Foxglove/Avala/Anyscale/LiveKit/Ouster 等赞助公司)相对硬件层更易在北美融到钱,而硬件创业公司被再度推向”要么用中国本体、要么去找非中国供应链”的二选一;对监管侧,Sebastian Thrun 等意见领袖级别演讲嘉宾公开质疑 FCC 限制措施,加大了白宫与 FCC 在”是否纳入中国制造机器人”问题上的政治成本,也给中国厂商在美国继续”灰色发售”或贴牌销售打开窗口。对国内而言,宇树成 Actuate 26 的少数硬件明星事件,进一步锁定其”全球人形机器人出货第一”叙事(2025 全年 5511 台、占全球 32%,2026 H1 已被智元反超但仍为前二),但实际进厂率不足的隐忧仍需更多真实复购订单化解。

总结:Actuate 26 把”训练数据 + Physical AI + 硬件缺口”作为三件大事摆上桌面,又用 90% 中国制造的人形机器人在现场撑起”硬件稀缺”叙事,本质上是硅谷资本与中国硬件供应链在 Physical AI 时代的强绑定——下一阶段谁能解决真实世界数据飞轮与复购闭环,谁就能把”未来已来”从口号切换为利润表。

参考来源:
1. IT之家(中文首发):美国硅谷大谈机器人未来,现场主角却来自中国,https://www.ithome.com/0/992/883.htm
2. 腾讯网 / IT 时代网转载:硅谷机器人大会展品稀缺 中国厂商占九成出货量,https://new.qq.com/rain/a/20260822A00XLU00
3. Foxglove 官方公告:Announcing Actuate 26 — Annual Robotics Developer Conference(含 1,000+ 与会、30+ 演讲嘉宾名单),https://foxglove.dev/blog/announcing-actuate-2026
4. Robotics Business News:Foxglove Announces Speaker Lineup and Program for Actuate 26(完整议程与赞助商名单),https://www.roboticsbusinessnews.com/news/1/3258/foxglove-announces-speaker-lineup-and-program-for-actuate-26-robotics-developer-conference.html
5. StartUpEvents:Actuate 26 会议基本信息(Fort Mason 会场 8/18—19),https://startupevents.org/startup-events-calendar/actuate-26
6. Actuate 26 大会官网(票价、议程、赞助方),https://actuate.foxglove.dev/
7. Business Insider 原始报道(英文,作为本次中文转译源头),https://www.businessinsider.com/actuate-26-robotics-conference-silicon-valley-hardware-shortage-2026-8
8. 智东西深度回顾:宇树科技招股书披露 2025 全年 5511 台、占全球 32% 出货量结构,https://zhidx.com/p/587260.html
9. 中证报:四大交易所齐聚世界机器人大会 王兴兴回应落地与模型投入(含 Crunchbase 融资数据与 FCC 监管背景),https://www.cs.com.cn/xwzx/01/2026/08/21/detail_2026082110032818.html
10. 北京日报客户端:宇树上市首日暴涨 629.44%、市值超 4449 亿元(含发售股本与 RaaS 模式背景),https://www.toutiao.com/article/7675557384948826664

OpenAI 开源 Codex Harness 框架

时间:2026 年 8 月 21 日

地点:美国旧金山 / 全球开源社区

人物:OpenAI、OpenAI 总裁 Greg Brockman、合作伙伴 Thrive Holdings/Crete、思科 Cisco

事件详情:OpenAI 于 8 月 21 日正式宣布将驱动 Codex 智能体的底层核心框架 Codex Harness 以 Apache-2.0 协议全面开源,源代码已发布在 GitHub openai/codex 仓库。本次开源包含三大核心组件:1)CLI 工具 codex exec,面向 CI/CD 与一次性脚本场景;2)官方 Codex SDK,提供 TypeScript 与 Python 接口,可编程控制线程与任务生命周期;3)Codex app-server,基于 JSON-RPC 协议让应用深度接入本地 Codex 进程,支持持久会话、实时流式传输、中途打断、工具暴露与人工审批。Codex 本身所用的大语言模型仍通过 OpenAI API 或 ChatGPT 订阅提供,并未开源。

背景:此前 openai/codex 仓库仅开源了 CLI 前端,Rust 核心 codex-rs 与 app-server 驱动层属于内部实现;本次开源把”执行层”完整放出,是 OpenAI 在 agent-first 战略上的重要一步。同步,DeepSeek Harness 已于 8 月 13 日以开发者预览版开源,首日 Star 破 3 万、连续一周更新并把 Codex 与 Claude Code 接入子代理,业界已形成”Agent 调度层卡位”竞赛。

影响:OpenAI 给出关键性能数据,在 ARC-AGI-3 基准测试中,仅对 Harness 做保留推理与上下文压缩两项调整,GPT-5.6 Sol 模型得分从 13.3% 飙升至 38.3%,输出 token 数量减少六倍——同一模型、不同 Harness,效果差距三倍,成本降低六倍。早期合作伙伴 Thrive Holdings/Crete 将 Harness 嵌入报税系统,成功处理 7000 份申报表,准备时间缩短约三分之一;Cisco 利用 SDK 在云控制平台构建 App Builder,让客户用自然语言创建应用。这标志着 AI Agent 开发从”拼模型跑分”转向”拼落地框架”,开发者可直接把最强 Agent 循环嵌入自有产品、工程工具与运营看板,告别”通用聊天框”。

总结:OpenAI 把 Codex Harness 全面开源,把 Agent 执行层的”引擎”免费送给开发者;这意味着模型之外的执行系统、Harness 设计、审批机制将成为下一阶段 AI 落地企业级场景的核心战场,同时也把”前端业务规则归开发者、底层 AI 循环归 OpenAI”的人机协同模式正式确立。

参考来源:

1. 36氪 – 震撼,OpenAI全面开源Codex Harness:https://www.36kr.com/p/3948952877661575

2. IT之家 / 凤凰网科技 – OpenAI 开源 AI 执行框架 Codex Harness:https://tech.ifeng.com/c/8vm1qXLRAbW

3. 华尔街见闻 – 大手笔!OpenAI 全面开源 Codex Harness:https://wallstreetcn.com/articles/3779961

4. 虎嗅网 – OpenAI开源AI执行框架Codex Harness:https://www.huxiu.com/ainews/14691.html

5. 网易科技 – OpenAI开源Codex Harness 同模型得分从13.3%升至38.3%:https://www.163.com/dy/article/L4SB8GP10519QIKK.html

6. 21财经 – 超级重磅!Open AI正式开源了:https://m.21jingji.com/article/20260821/herald/708bc8a0d3a5304359faa67839191156.html

7. 七牛云 – Codex Harness 全面开源:OpenAI 向开发者开放 Agent 运行时底层:https://news.qiniu.com/archives/1787276125198

8. OpenAI Codex GitHub 仓库(Apache-2.0):https://github.com/openai/codex

9. Greg Brockman X 转发:https://x.com/gdb/status/2090246288478814281

10. OctoLink GEO – OpenAI Fully Open-Sources Codex Harness:https://www.octolinkzl.com/articles/openai_fully_open_sources_codex_harness_unpacking_its

DeepSeek V4-Flash Vision多模态

时间:2026 年 8 月 21 日

地点:中国 / DeepSeek API 平台(全球)

人物:DeepSeek(深度求索)、开发者生态

事件详情:DeepSeek 于 8 月 21 日宣布全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 API 平台,定位实验性质,开发者可通过设置 model=’deepseek-v4-flash-vision-exp’ 调用。该模型在纯文本能力(Agent、推理、世界知识)方面与 V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上,对比纯文本版实现大幅跃升,多模态 Agent 综合能力已接近 Anthropic 的 Claude Opus-4.8 旗舰水平。计费沿用 V4-Flash 现有定价,一张图片最多占 384 tokens,图片不额外收取视觉专项费用。

背景:V4-Flash 文本版 7 月 31 日上线即触发涨价、V4 Pro 8 月 13 日 GA 发布、Harness 8 月 13 日开发者预览版开源;本次 Vision-Exp 上线意味着 DeepSeek 用约三周时间把 V4 系列从纯文本扩展到多模态,并继续推进 Harness 智能体框架的视觉适配。同步上线的 Files API(免费)允许开发者先上传图片再在请求中通过 file_id 引用,省去重复上传带宽。

影响:官方公布的关键基准成绩——Terminal Bench 2.1:83.9、NL2Repo:57.7、DeepSWE:59.3、DSBench-Hard:63.6、AutomationBench(Public):25.7、ApexBench(Pass@1):36.5、Agents’ Last Exam:27.3、Chartography:64.3、ZeroBench(Pass@5):35.0。模型支持 Chat Completions、Messages(Anthropic 格式)、Responses(OpenAI 格式)三种调用方式,支持图文混合输入,提供 base64 内联、外部 URL、Files API 三种图片传入方式;可设置 high、max 推理强度,复杂多模态 Agent 推荐 max 档位。在 PPT 生成、网站重构、动态前端 Demo 等场景的实测中,模型可结合图片理解完成调研、数据提取与自动化任务编排,被业内视为 V4 系列在多模态 Agent 工作流方向的关键拼图。

总结:DeepSeek 用 V4-Flash-Vision-Exp 把视觉能力嵌入既有 Agent 框架,在保持 V4-Flash 文本性能不变的前提下,让多模态 Agent 能力逼近 Opus-4.8 水平;这不仅是 DeepSeek 多模态战略的”零号实验”,也把国内多模态 API 价格拉回到与纯文本同价的水位,加速中文 Agent 生态在视觉场景的落地。

参考来源:

1. IT之家 – DeepSeek V4-Flash-Vision-Exp 上线:开启多模态 API 服务:https://m.ithome.com/html/992755.htm

2. DeepSeek API Docs – V4-Flash-Vision-Exp 上线,开启多模态 API 服务(官方):https://api-docs.deepseek.com/zh-cn/news/news260821/

3. 新浪科技 – DeepSeek-V4-Flash-Vision-Exp 视觉模型上线:Agent 能力接近 Opus-4.8:https://tech.sina.cn/2026-08-21/detail-iniparan1302846.d.html

4. 凤凰网科技 – DeepSeek V4-Flash-Vision-Exp 上线,开启多模态 API 服务:https://tech.ifeng.com/c/8vm1qXLRAbW

5. 网易科技 – 多模态视觉理解模型 DeepSeek V4-Flash-Vision-Exp 上线:https://www.163.com/dy/article/L4SG4LKP0556I485.html

6. 新浪新闻 – DeepSeekV4 视觉模型上线:多模态能力与定价完整解读:https://k.sina.com.cn/article_7880068204_1d5b04c6c06801fu9s.html

7. 腾讯新闻 CNMO – DeepSeek V4-Flash-Vision-Exp 上线:多模态 API 正式开放:https://new.qq.com/rain/a/20260821A0CWWQ00

8. 百度百科 – DeepSeek-V4-Flash-Vision-Exp:https://baike.baidu.com/item/DeepSeek-V4-Flash-Vision-Exp/68651898

9. DeepSeek API Docs – Change Log(英文官方):https://api-docs.deepseek.com/updates

10. 威易网 – DeepSeek 多模态模型发布:V4-Flash-Vision-Exp 实验性模型上线:https://www.weste.net/2026/08-21/V4-Flash-Vision-Exp.html

小红书开源dots3-note 长程智能体底座

时间:2026年8月14日晚7点25分左右(北京时间),消息在国内科技圈于8月20日前后系统扩散。

地点:中国上海/海外开源社区(首发于海外 Hugging Face 与 GitHub;8月20日多家中文媒体集中梳理)。

人物:小红书旗下 dots 模型实验室(Dots Lab / dots studio)——小红书2025年初成立的AI实验室,源自公司内部大模型技术团队,研究方向覆盖预训练、多模态、后训练、AI Infra、AI 系统。

事件详情:dots studio 正式开源首个公开权重模型 dots3-note preview,采用混合专家(MoE)架构,总参数2800亿(280B)、激活参数160亿(16B),支持高达512K tokens 的超长上下文窗口。模型同时覆盖文本、图像、视频(含音轨)、音频四种模态输入并输出文本,瞄准从单轮问答到跨天长程任务的全场景。

权重采用 Apache 2.0 协议,同步发布在 Hugging Face、ModelScope、GitHub 三个仓库,并提供 BF16 与 FP8 两种精度版本。vLLM、SGLang 推理框架已完成原生支持,HuggingFace Transformers 主仓 PR #47848 落地集成;华为昇腾 vLLM-Ascend 推理引擎也在发布当日宣布完成 0 Day 适配。

背景:dots3 是小红书内部投入重兵的全栈模型家族。同系列未公开预览版曾在 IMO 2026(国际数学奥林匹克)拿到 42/42 满分,被官方认证为最强表现之一。dots3 家族规划三层——note(轻量)、jazz、aria,覆盖不同能力—延迟—推理成本区间。dots3-note preview 是其中”最轻量”的入门版本,280B 只是这个家族的”起步价”。

公司层面,小红书月活已超 3 亿,平台沉淀的图文笔记、短视频、评论区与消费决策链路,构成了非标准、强上下文、持续变化的用户表达,这正是通用模型难以直接覆盖的差异化数据资产。在 dots3-note 之前,小红书陆续开源过 dots.ocr(文档解析)、dots.vlm1(视觉理解)、dots.tts(语音合成)、dots.llm1(文本),dots3-note 是首次将多模态长程智能体能力整体打包。

影响:架构上只激活 16B 参数,比同级的 DeepSeek-V3(37B)、GLM-4.5(32B)、Qwen3-235B(22B)更省算力。整体为 1 层稠密 + 45 层 MoE,256 个路由专家 + 1 个共享专家,每 token 走 top-8 路由;注意力层按 1:3 比例混合 13 层 DSA 稀疏注意力(Top-2048)与 33 层滑动窗注意力,专门为 50 万 token 级上下文优化计算成本;1.13B 参数的 MTP 头可把每 token 生成时间压低 50% 以上。视觉编码器是 7B 总参 / 1.2B 激活的 MoE ViT,音频编码器是 800M 稠密模型。

性能上,官方对标清单覆盖 HY3、GLM 5.2、DeepSeek V4 flash/pro、Seed 2.1 turbo、Kimi K3、Claude Opus 4.8、GPT-5.5。抽象推理与搜索上领先:ARC-AGI-2 拿到 81.39(Claude Opus 4.8 为 72.1,Kimi K3 为 60.4,GLM 5.2 为 22.8);ARC-AGI-3 拿到 6.9(Claude Opus 4.8 为 1.5,GPT-5.5 为 0.4);IFBench 80.4(Claude Opus 4.8 为 62.2)。智能体编程上偏弱:Terminal-Bench 2.1 拿到 75.1(Kimi K3 88.3,GLM 5.2 81);SWE-bench Pro 拿到 61(Claude Opus 4.8 69.2);Toolathlon Verified 拿到 55.6(Kimi K3 76.5)。

同步开源两个评测基准——VibeSearchBench 考察用户意图逐步披露时的多轮搜索能力,VibeLifeBench 聚焦非静态环境下的跨阶段任务执行,明显指向搜索与真实生活服务。同步开源的还有 TEMPO 强化学习方法(Test-time-scaled Value Estimation with Macro-step Policy Optimization),用于解决长程轨迹中的信用分配难题。

官方演示里,模型独立完成旅行规划、装修筹备、备婚等跨天数任务;在 Slay the Spire II 推进到第 33 层、从零解出 ARC-AGI 3(耗时 320 步)、端到端构建 visionOS 应用(生成 12 个 Swift 文件、1876 行代码)。这些属于官方演示,并非标准第三方评测。

总结:dots3-note preview 释放的真正信号,不在于再多一个开源 SOTA,而在于内容平台已经走完”API 调用 → 自研底座”的切换:把模型当作上层能力(搜索 / 推荐 / 创作 / 智能服务)的工业母机来经营。Apache 2.0 + 0 Day 昇腾适配 + HuggingFace Transformers 主仓合并,把”能商用、可部署、跨硬件”的工程通道一次性交付。当 AI 开始影响核心产品体验,模型本身就具备基础设施属性——这种结构性变化,或许才是小红书这次悄悄开源真正的含金量。

参考来源:
1. https://www.geekpark.net/news/369161 – 极客公园原始报道
2. https://www.huxiu.com/ainews/14601.html – 虎嗅网技术规格深度整理
3. https://www.huxiu.com/ainews/14675.html – 虎嗅网多角度行业分析
4. https://datanorth.ai/news/dots-studio-releases-dots3-note-preview – DataNorth AI 海外独立评测
5. https://pandaily.com/xiaohongshu-red-dots3-note-open-source-content-platform-base-model-aug2026 – Pandaily 海外英文报道
6. https://freeai.help/blog/xiao-hong-shu-kai-yuan-dots3note280b-zhi-shi_zh – FreeAI 长程智能体策略解析
7. https://freeai.help/blog/xiao-hong-shu-kai-yuan-280b-duo-mo_zh – FreeAI 多模态架构详解
8. https://www.chooseai.net/ai-news/detail/5885 – ChooseAI TEMPO 方法与基准解读
9. https://www.aipuzi.cn/ai-news/dots3-note-preview.html – AI铺子
10. https://zuphp.com/5222.html – 七木的开源分享
11. https://post.m.smzdm.com/p/al3qkpqg什么值得买
12. https://huggingface.co/dots-studio/dots3-note-prev – Hugging Face 官方权重仓库
13. https://github.com/studio-dots-ai/dots3-note-prev – GitHub 官方代码仓库

看3秒就学会 机器人迎GPT-3时刻 黄仁勋李飞飞参投

**时间**

2026年8月20日(周三)凌晨

**地点**

美国硅谷

**人物**

Generalist AI 团队;投资人黄仁勋(英伟达CEO)、李飞飞(斯坦福教授)、林斌(小米联合创始人)、袁征(Zoom创始人)

**事件详情**

Generalist AI 8月20日发布新一代机器人基础模型 GEN-1.5,核心能力:给机器人看一段3至12秒的动作演示,不训练、不微调,机器人当场执行,10个任务平均成功率59%。10个梯度步骤+5分钟数据后,成功率升至83%。

GEN-1.5 将”物理提示”(Physical Prompt)技术引入具身智能——一段视频演示作为上下文记忆塞进模型窗口,机器人直接照做,0行代码介入。

团队已预训练8个月以上,覆盖家庭、仓库、工厂等真实物理交互数据,规模前所未有。

**背景**

2020年GPT-3证明大语言模型可以通过少量示例(In-Context Learning)学会新任务,无需重新训练。具身智能领域此前没有类似突破。

GEN-1.5 首次在机器人领域实现同等范式:看一遍演示,立即学会操作任务——包括从未在训练数据中出现过的工具替代(如用香蕉代替刷子扫积木进碗)。

**影响**

如果独立验证成立,机器人部署逻辑将彻底改变:从”专家编程数月”缩短为”3秒演示即可上岗”,工厂、仓库、家庭场景的机器人落地成本大幅压缩。

英伟达、黄仁勋女儿黄敏珊、李飞飞等”聪明钱”均在投资人名单中。

**总结**

GEN-1.5 被多位研究者类比为具身智能的”GPT-3时刻”,Scaling Law已在物理数据上显现,但目前仅覆盖简单短程操作,复杂长程任务仍有距离。

**参考来源**

https://generalistai.com/blog/gen-1.5
https://www.36kr.com/p/3949212725542021

机器人的GPT-3时刻真·来了!卡卡西上身,看3秒就学会新动作


https://tokenfeed.ai/robots-now-learn-new-jobs-in-under-12-seconds
https://interestingengineering.com/ai-robotics/gen-1-5-robot-learns-physical-tasks-one-demonstration
https://www.techtimes.com/articles/325174/20260821/generalist-ai-gen-15-learns-new-robot-tasks-single-demo-no-retraining.htm
https://new.qq.com/rain/a/20260821A049JM00
https://tpsreport.news/news/gen-1-5-generalist-ai-robot-single-demo
https://magica.com/news/generalist-ai-gen-1-5-one-shot-robot-learning
https://www.iottechnews.com/events/blockchain-ai-virtual-expo-2024/

Cursor/goal模式上线 Agent盯PR自动合并

时间:2026年8月19日(Cursor 官方 changelog 发布;快讯整理于 8 月 22 日)

地点:美国旧金山(Cursor / Anysphere 总部)+ 全球远程开发团队

人物:Cursor / Anysphere 工程师团队;Anysphere 已被 SpaceX 于 8 月 14 日以 600 亿美元完成收购;本次更新由 Anysphere Cloud Agents 团队交付

事件详情:8 月 19 日,Cursor 一次性为 Cloud Agents 推出五项能力。第一,Subscriptions(订阅):云端 Agent 可订阅一个 GitHub PR、一条 Slack 线程或一张定时任务表,对应事件一发生就自动唤醒;Agent 还会自动订阅自己创建的 PR,一路推到 CI 变绿、回复机器人评论。第二,/goal 命令:在新对话里输入 /goal fix all flaky tests and make CI green,Agent 会持续运行到目标真正达成,而不是一次性回复即停。第三,Subagents on their own machines:每个子 Agent 现在跑在独立虚拟机上,拿一份干净的代码副本和上下文,互不打架,可以平行验证或并行修 bug。第四,Custom Modes:任意一个 skill 可被钉成”always on”模式,让 Agent 整局对话沿用同一份剧本。第五,Steering:跟进的指令不再打断 Agent 当前工具调用,而是排队等到下次工具调用再执行。Cursor 同步披露:内部已合并的 PR 中已有超 35% 由云端 Agent 自主创建(2026 年 2 月为 30%,18 个月前为 0),并宣布 8 月 24 日起 Auto 计费从一口价改为按模型计价

背景:过去两年 AI 编程工具集中在”补全一行、生成一段”,Cursor 的本轮更新则把 Agent 推到”持续工作、长期挂机”的状态。同一时间窗内,Codex Harness、Claude Code Harness 等竞品也在强化多回合执行能力,/goal 是 Cursor 把”任务”重新定义为”持续 KPI”的尝试

影响:对开发者,Cursor 已从一款编辑器变成一个会自己盯 PR、修 CI、跨 Slack 收指令的工程同事;35% 的 PR 自主合并率意味着相当一部分中型项目的合并主线已可以无人值守运行。对企业 IT,订阅式 Agent + 按模型计价将带来更精细的成本曲线,路由到贵模型就要付贵价格。对竞争对手,这把”agent 持久化”的标杆从实验功能变成默认能力,Codex、Claude Code、Devin 必须在下一版给出对称回应

总结:Cursor 用一次 changelog 把”提示工程”拉到了”事件工程”:Agent 不再等你说话,而是订阅世界里的 PR、Slack 与定时器,/goal 让它有了可以长期追求的目标,独立 VM 让 Subagents 不再抢同一份文件;这意味着软件工程的生产线开始从”人盯 Agent”翻面到”Agent 盯仓库”

参考来源:
1. https://cursor.com/changelog/08-19-26
2. https://www.36kr.com/p/3949198571617409
3. https://aiweekly.co/alerts/cursor-gives-cloud-agents-subscriptions-goal-and-subagent-vms
4. https://aiinsiders.net/article/cursor-agents-can-now-subscribe-to-events-instead-of-prompts
5. https://www.cursorworkshop.com/research/cursor-cloud-agents-get-longer-leashes
6. https://techdevnotes.com/releases/cursor-ide/20260819-181343Z-621090ca53ad
7. https://k.sina.com.cn/article_5953466437_162dab0450670b9uve.html
8. https://pondero.ai/news/2026-08-20-cursor-cloud-agents