时间:2026年10月2日(周四)
地点:伦敦/远程(Y Combinator W26 校友企业 Cactus Compute)
人物:Cactus Compute 联合创始人兼 CTO Henry Ndubuaku、CEO Roman Shemet
事件:端侧 AI 公司 Cactus Compute 发布开源语音转文字模型 Whistle,单文件仅 16.9 MB,可在 CPU 上零依赖运行,延迟 11 毫秒即可吐出首个 token,整体解码速度与基准性能比肩 145 MB 的 OpenAI Whisper base。
详情:Whistle 是一个为手机、可穿戴设备、机器人、智能家居、汽车与微控制器设计的本地语音识别引擎,单一 16.9 MB 文件即可独立运行,无需 GPU 或云端 API;它加载到 Cactus 自家小型语言模型 Needle 同一套 C++ 推理引擎与同一份 .cact 容器中,与工具调用小模型共用同一进程,使一段语音可直接转写并触发结构化函数调用。语言层面支持英语、德语、法语、西班牙语、意大利语、荷兰语、波兰语 7 种语言,自动识别无需指定;功能层面除了 16 kHz 单声道最长 30 秒转写外,还提供每个词的起止时间与置信度(来自解码器注意力对齐)以及每 80 ms 一帧的语音嵌入,并支持 Aho-Corasick 自动机驱动的关键词偏置(例如人名、专有名词),低音量静音会直接返回空转写以避免幻觉。Cactus 在 17 个平台目标上提供预编译引擎,覆盖 macOS、Linux、Android、iOS、watchOS、Windows on ARM、RISC-V、MIPS、WebAssembly 与 WASI。
基准性能:在 Apple M4 Pro CPU 上,10 秒音频的首 token 延迟为 11.1 ms,解码速度达 1,319 tokens/s,分别约为 Whisper base(73.2 ms / 266 tokens/s)的 6.6 倍与 5 倍;体积却仅为后者的 1/8.6(145.3 MB)。在词错误率(WER)维度,Whistle 在 LibriSpeech test-clean(4.31% vs 4.9%)、test-other(10.49% vs 11.0%)、SPGISpeech(7.65)、Earnings-22(19.01)与 FLEURS 平均(21.4 vs 24.5)等多套基准上跑赢 Whisper base,但在 TED-LIUM、AMI 与 MLS 平均上仍由 Whisper base 领先;测试覆盖 86,174 条样本。
背景:Cactus Compute 由 Ndubuaku(前帝国理工移动 AI 研究工程师)与前量化交易员 Shemet 在 YC 联合创始人配对项目中相识后共同创立,长期押注"把足够小的模型跑进普通设备"——这一思路在 8 月已通过 14 MB 智能体模型 Needle 验证市场。本次 Whistle 是把同一思路从语言模型扩到语音,让设备既能本地"理解文字"也能本地"听懂声音",并通过与 Needle 共用运行时形成"语音+工具调用"的端侧闭环。同期 Fermion Research 也发布了 164 MB 的 Phonon 2,二者共同把端侧语音识别推进到"几十 MB 即可工业可用"的区间。
影响:Whistle 把"语音转文字"从云端 API 拉回到单芯片可用的本地能力,意味着可穿戴、车载、家电、机器人、工业 MCU 等长期受限电场景的设备,都可以在不增加电池与散热成本的前提下加入常驻语音入口;同时它与 Needle 共用引擎的架构,使端侧 Agent 能够"听到指令→转写→直接调用工具"全链路本地完成,进一步压缩对云端推理的依赖。
总结:Cactus Compute 用 16.9 MB、11 ms 首字延迟的 Whistle 证明端侧语音识别已具备替代云端 Whisper base 的工业可用性,并把"语音+Agent"闭环压进同一份二进制文件。
参考来源:
- Cactus Compute 官方发布(Whistle: Speech to Text in 16.9 MB):https://cactuscompute.com/whistle
- Whistle 技术博客(Hugging Face / 工程细节、基准表):https://huggingface.co/blog/cactus-compute/whistle-16-9-mb
- Web Pulse 报道(Cactus Compute releases a 16.9MB speech model for local CPUs):https://wpnews.pro/news/cactus-compute-releases-a-16-9mb-speech-model-for-local-cpus
- Ahmet Balaman 评测(Whistle 与 Phonon 2 对比):https://ahmetbalaman.com/en/blog/whistle-and-phonon-2-tiny-speech-to-text-models-en
- The Clarity 综合报道(Cactus fits a 16.9MB speech model into the CPU runtime):https://theclarity.today/story/cactus-fits-a-16-9mb-speech-model-into-its-tool-call-runtime-12e387aa
- Cactus Compute 官方 X 公告:https://x.com/cactuscompute
- Needle C++ 推理引擎(GitHub):https://github.com/Cactus-Compute/needle3
- NoCode MBA AI 模型发布追踪(Oct 2 Cactus Models):https://www.nocode.mba/ai-release-tracker







