时间:2026 年 9 月 17 日(北美西部时间)/ 9 月 18 日(中国时间)
地点:美国加州(PrismML 总部)
人物:PrismML 创始人兼 CEO、加州理工学院教授 Babak Hassibi;阿里 Qwen3.8 27B 模型团队;投资人 Khosla Ventures、Cerberus Capital、Caltech;Databricks 联合创始人、Berkeley Sky Computing Lab 主任 Ion Stoica(顾问)
事件详情:加州理工学院衍生公司 PrismML 宣布开源三值量化模型 Bonsai 2 27B,底座升级到阿里 Qwen3.8 27B。该模型采用 {-1, 0, +1} 三值权重加 FP16 分组缩放,每个权重有效比特仅 1.76 bit,模型总体积压缩至 5.9 GB,相比全精度原模型缩小超过 9 倍,仍保留 98.2% 的综合基准性能。Bonsai 2 27B 支持 262K token 上下文窗口、多模态图文输入,并以 Apache 2.0 协议开放权重。在 NVIDIA RTX 5090 上词元吞吐量达 143 tokens/s,在 Apple M5 Max 上可达 46.8 tokens/s;RTX 4090 上能效 0.714 mWh/token,比全精度 8B 模型低 40%。模型可经 CUDA 在 NVIDIA GPU 上运行,也可经 MLX 在 Apple 设备上运行。
背景:PrismML 由加州理工学院研究团队创立,今年 7 月已发布初代 Bonsai 27B,把 Qwen3.6 27B 压缩至 5.9 GB 并保留 95% 性能,成为首款可在 iPhone 上运行的 27B 级模型。CEO Hassibi 此前接受 CNBC 采访时确认,苹果正评估 PrismML 压缩技术用于其设备端 AI 推理,洽谈仍处初步阶段。PrismML 已完成 2225 万美元种子轮融资,投资方包括 Khosla Ventures、Cerberus Capital 与 Caltech,Databricks 联合创始人 Ion Stoica 担任顾问;Multiverse Computing 是该赛道的另一代表公司。
影响:Bonsai 2 27B 把 27B 级多模态大模型的部署门槛从数据中心拉到消费级硬件,开发者可在 PC、高端手机本地完成编程智能体循环、计算机使用工作流、私有文档解析、多模态调试与混合编排等"真正的知识工作",仅在需要时才调用云端 API。结合苹果对压缩技术的评估进展,端侧 AI 推理正成为继 Apple Foundation Models 后又一可行路径。
总结:PrismML 用 5.9 GB 体积、近无损的 98.2% 性能保留率,把 27B 多模态大模型塞进消费级硬件,叠加 Apache 2.0 开源协议与苹果潜在合作意向,进一步推动本地化大模型替代云端推理的产业趋势。
参考来源:
- PrismML 官方博客 https://prismml.com/news/bonsai-2-27b
- IT之家 https://www.ithome.com/1/004/072.htm
- TechCrunch https://techcrunch.com/2026/09/17/prismml-hopes-its-tiny-llm-could-change-how-we-all-use-ai/
- 凤凰网科技 https://tech.ifeng.com/c/8wWGUnZQRnm
- Linxi News https://news.linxi.com.au/news/prismmls-bonsai-2-27b-shrinks-ai-model-to-59gb-for-local-devices
- Vuink https://vuink.com/post/cevfzzy-d-dpbz/news/bonsai-2-27b







