热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Cactus开源Whistle 16.9MB本地语音模型

时间:2026年10月2日(周四) 地点:伦敦/远程(Y Combinator W26 校友企业 Cactus Compute) 人物:Cactus Compute 联合创始人兼 CTO Henry Ndubuaku、CEO Roman Shemet 事件:端侧 AI 公司 Cactus Compute 发布开源语音转文字模型 Whistle,单文件仅 16.9 MB,可在 CPU 上零依赖运行,延迟 11 毫秒即可吐出首个 token,整体解码速度与基准性能比肩 145 MB 的 OpenAI Whisper base。 详情:Whistle 是一个为手机、可穿戴设备、机器人、智能家居、汽车与微控制器设计的本地语音识别引擎,单一 16.9 MB 文件即可独立运行,无需 GPU 或云端 API;它加载到 Cactus 自家小型语言模型 Needle 同一套 C++ 推理引擎与同一份 .cact 容器中,与工具调用小模型共用同一进程,使一段语音可直接转写并触发结构化函数调用。语言层面支持英语、德语、法语、西班牙语、意大利语、荷兰语、波兰语 7 种语言,自动识别无需指定;功能层面除了 16 kHz 单声道最长 30 秒转写外,还提供每个词的起止时间与置信度(来自解码器注意力对齐)以及每 80 ms 一帧的语音嵌入,并支持 Aho-Corasick 自动机驱动的关键词偏置(例如人名、专有名词),低音量静音会直接返回空转写以避免幻觉。Cactus 在 17 个平台目标上提供预编译引擎,覆盖 macOS、Linux、Android、iOS、watchOS、Windows on ARM、RISC-V、MIPS、WebAssembly 与 WASI。 基准性能:在 Apple M4 Pro CPU 上,10 秒音频的首 token 延迟为 11.1 ms,解码速度达 1,319 tokens/s,分别约为 Whisper base(73.2 ms / 266 tokens/s)的 6.6 倍与 5 倍;体积却仅为后者的 1/8.6(145.3 MB)。在词错误率(WER)维度,Whistle 在 LibriSpeech test-clean(4.31% vs 4.9%)、test-other(10.49% vs 11.0%)、SPGISpeech(7.65)、Earnings-22(19.01)与 FLEURS 平均(21.4 vs 24.5)等多套基准上跑赢 Whisper base,但在 TED-LIUM、AMI 与 MLS 平均上仍由 Whisper base 领先;测试覆盖 86,174 条样本。 背景:Cactus Compute 由 Ndubuaku(前帝国理工移动 AI 研究工程师)与前量化交易员 Shemet 在 YC 联合创始人配对项目中相识后共同创立,长期押注"把足够小的模型跑进普通设备"——这一思路在 8 月已通过 14 MB 智能体模型 Needle 验证市场。本次 Whistle 是把同一思路从语言模型扩到语音,让设备既能本地"理解文字"也能本地"听懂声音",并通过与 Needle 共用运行时形成"语音+工具调用"的端侧闭环。同期 Fermion Research 也发布了 164 MB 的 Phonon 2,二者共同把端侧语音识别推进到"几十 MB 即可工业可用"的区间。 影响:Whistle 把"语音转文字"从云端 API 拉回到单芯片可用的本地能力,意味着可穿戴、车载、家电、机器人、工业 MCU 等长期受限电场景的设备,都可以在不增加电池与散热成本的前提下加入常驻语音入口;同时它与 Needle 共用引擎的架构,使端侧 Agent 能够"听到指令→转写→直接调用工具"全链路本地完成,进一步压缩对云端推理的依赖。 总结:Cactus Compute 用 16.9 MB、11 ms 首字延迟的 Whistle 证明端侧语音识别已具备替代云端 Whisper base 的工业可用性,并把"语音+Agent"闭环压进同一份二进制文件。 参考来源: - Cactus Compute 官方发布(Whistle: Speech to Text in 16.9 MB):https://cactuscompute.com/whistle - Whistle 技术博客(Hugging Face / 工程细节、基准表):https://huggingface.co/blog/cactus-compute/whistle-16-9-mb - Web Pulse 报道(Cactus Compute releases a 16.9MB speech model for local CPUs):https://wpnews.pro/news/cactus-compute-releases-a-16-9mb-speech-model-for-local-cpus - Ahmet Balaman 评测(Whistle 与 Phonon 2 对比):https://ahmetbalaman.com/en/blog/whistle-and-phonon-2-tiny-speech-to-text-models-en - The Clarity 综合报道(Cactus fits a 16.9MB speech model into the CPU runtime):https://theclarity.today/story/cactus-fits-a-16-9mb-speech-model-into-its-tool-call-runtime-12e387aa - Cactus Compute 官方 X 公告:https://x.com/cactuscompute - Needle C++ 推理引擎(GitHub):https://github.com/Cactus-Compute/needle3 - NoCode MBA AI 模型发布追踪(Oct 2 Cactus Models):https://www.nocode.mba/ai-release-tracker