时间:2026年8月10日,旧金山AI初创公司Cactus Compute正式发布并开源智能体语言模型Needle 2。
地点:美国旧金山
人物:Cactus Compute团队,核心作者Henry Ndubuaku领衔。
事件详情:Needle 2是一款45M参数的智能体LLM,整个模型仅14MB二进制大小,单会话内存峰值约28MB,专为端侧设备上的工具调用、设备操作与结构化抽取设计,采用Simple Attention Network架构,CQ2-bit量化压缩,自带推理引擎,无须额外运行时。
背景:当前主流智能体模型普遍需要数GB内存和高端GPU,难以在廉价硬件上运行。Cactus瞄准的是被忽视的边缘设备市场:全球超过210亿台IoT设备,而其中80%售价低于200美元,包括廉价手机、Raspberry Pi、微控制器、可穿戴、小型机器人与智能家居。Needle系列最早版本26M参数,今年5月已开源,此次的45M版本在保留14MB体量的同时显著扩展能力。
影响:性能方面,Needle 2在Raspberry Pi 5上达到500 tokens/秒解码,在Meta Quest 3S和Apple Vision Pro等VR设备上达到400-1500 tokens/秒,在三星A系列等200美元以下手机上达到300-700 tokens/秒,甚至可在ESP32-S3等微控制器上以约11MB内存运行;在工具调用和设备操作基准上与FunctionGemma 270M、LFM2.5 230M、Apple FM等模型打平,体积却小5-70倍,精度为2-bit对比竞品的f16。
总结:Needle 2把智能体从云端拉到了几乎任何带电的廉价硬件,单一14MB二进制覆盖手机、VR头显、嵌入式MCU全场景,并以Apache 2.0协议开源,配合学习到的置信度头可与云端大模型协作分级,标志着端侧AI普惠时代真正到来。
参考来源:
- Cactus Compute官方介绍:https://cactuscompute.com/needle
- GitHub仓库:https://github.com/cactus-compute/needle
- Hugging Face模型权重:https://huggingface.co/Cactus-Compute/needle2
- Hacker News Show HN讨论:https://news.ycombinator.com/item?id=49246804
- arXiv论文Simple Attention Networks:https://arxiv.org/abs/2607.18363
- 腾讯云开发者Needle模型实测:https://cloud.tencent.com/developer/article/2674384









