Needle 2
仅14MB的端侧智能体LLM,28MB内存可跑
Needle 2 是一款专注于端侧设备的开源智能体语言模型,由美国旧金山 AI 初创公司 Cactus Compute 于 2026 年 8 月正式发布并开源。
核心规格方面,Needle 2 仅有 4500万参数,二进制文件仅 14MB,单会话内存占用约 28MB,可直接在手机、VR 头显、嵌入式微控制器等多种廉价硬件上本地运行,无需云端算力支撑。在基准性能测试中,Needle 2 在 Raspberry Pi 5 上实现每秒 500 tokens 的解码速度,在 Meta Quest 3S 和 Apple Vision Pro 等 VR 设备上达到每秒 400 至 1500 tokens,在三星 A 系列等 200 美元以下手机上也达到每秒 300 至 700 tokens 的不俗表现。
技术层面,Needle 2 采用了团队提出的 Simple Attention Network 架构,并使用自研的 Cactus Quants 进行从预训练到后训练全流程的 2-bit 量化压缩,实现了参数体积与模型精度的精准平衡。在函数调用和设备操作等智能体核心任务上,Needle 2 的表现与 FunctionGemma 270M、LFM2.5 230M、Apple FM 等大型模型相当,但体积缩小了 5 至 70 倍。协议采用 Apache 2.0 开源许可,权重托管于 Hugging Face,配套完整自研推理引擎,无需外部依赖即可独立运行。
适用场景方面,Needle 2 瞄准的是被忽视的边缘设备市场:全球超过 210 亿台 IoT 设备,其中约 80% 售价低于 200 美元,包括廉价手机、Raspberry Pi、微控制器、可穿戴设备、小型机器人和智能家居产品。内置学习置信度评分机制,当本地模型判断请求超出处理能力时可自动降级至云端处理,在隐私保护与算力扩展之间取得平衡。对开发者而言,仅需数分钟至数小时即可在本地设备上完成针对特定产品工具词汇的微调训练。
评论与建议
登录 后参与评论或提建议