时间:2026 年 8 月 19 日,Ornith 团队(DeepReinforce)正式发布新一代开源大模型家族 Ornith-1.5。
地点:美国,相关模型权重同步上架 Hugging Face,全球开发者可在同一时间下载。
人物:DeepReinforce(Ornith 团队),训练基底延续自 Qwen 3.5 与 Gemma 4 等开源权重。
事件详情:Ornith-1.5 一次性放出 3 款模型,分别是 9B Dense、35B MoE(每次仅激活 3B 参数)和 397B MoE 旗舰,全套按 MIT 许可开源,并同步提供 BF16、FP8、GGUF、MLX 与 NVFP4 五种量化版本,可商用、可二次分发。
旗舰版 Ornith-1.5-397B 在 Terminal-Bench 2.1 跑出 86.1,在 DeepSWE 上跑出 56.0,而 Claude Opus 4.8 在两个基准上的成绩分别是 85.0 与 59.0;在 SWE-Bench Verified 上 Ornith-1.5-397B 进一步以 86.0 比 Claude Opus 4.8 的 85.8 高出 0.2 分。35B MoE 在保持 3B 激活参数的同时,把 Terminal-Bench 2.1 推到 68.5,显著超过 Qwen 3.6-35B、Gemma 4-31B 与 Meta 的 Muse Glimmer-30B;9B 与其量化版本 Ornith-1.5-9B-Mobile 能在 iPhone 与 Android 上离线运行,部署门槛进一步下放。
背景:Ornith-1.5 是 2026 年 6 月 Ornith-1.0 的延续,1.0 让模型自己重写训练脚手架,1.5 则把"自脚手架"升级为完整的"自改进循环":模型先自己提出新任务,再为每个任务生成专属的执行脚手架,最后把解题轨迹作为强化学习的奖励信号。任务奖励同时考虑有效性、新颖度和难度(目标成功率 0.2),把那些不再产生学习信号的题目自动淘汰掉。这相当于把"出题人"、"老师"、"学生"压到同一组权重里。
影响:MIT 全家族 + 自改进循环首次把 397B 规模的开源权重推到 Claude Opus 4.8 同档水平,意味着原来只有闭源前沿能跑的企业级 Coding Agent 任务,现在可以走本地或私有云部署;35B 的 3B 激活为中型开源 Agent 生态提供了一个新的强基座;9B + Mobile 量化把模型塞进手机,配合端侧 NPU 推理,应用侧将以更便宜的方式分发 Agent 工作流。
总结:Ornith-1.5 用一组 MIT 开源权重把"自改进"训练范式推到 397B 规模,并在 Terminal-Bench 2.1、SWE-Bench Verified 等基准上首次与 Claude Opus 4.8 互有胜负;这让"开放权重 vs 闭源前沿"的差距继续缩小,9B + 量化让端侧 Agent 拥有真正可商用的开源基座。
参考来源:
https://ornith.ai/ornith_1_5.html
https://huggingface.co/collections/ornith-ai/ornith-15
https://www.aiexpert.news/en/ticker/ornith-15-open-models-match-claude-opus-48-via-self-improvement-loopmit-license-
https://datanorth.ai/news/ornith-releases-ornith-1-5
https://startupfortune.com/ornith-15-is-a-free-open-source-model-that-claims-to-rival-claude-opus-48
https://bittide.aicompass.dev/article/fdbf1835-23fd-4cbe-b006-ff7cf95b0a48
https://clauday.com/article/bd2aa1a2-5b44-4386-b1c5-bcf72a0d2892









