时间:2026年9月9日
地点:欧洲
人物:Desert Ant Labs 团队(由视频应用 Detail 母公司孵化,核心成员包括 Paul Veugen、Finn Voorhees 等)
事件详情:欧洲前沿 AI 实验室 Desert Ant Labs 今日正式发布,首批推出 18 款面向设备本地推理的专用 AI 模型,覆盖音频、视觉与文本三大任务类型。其中 12 款为稳定版,6 款为测试版,全部通过统一的 SDK 面向 Swift、Kotlin 与 JavaScript 开放,模型权重同步开源在 Hugging Face 与 GitHub。实验室强调“主权默认值”理念:用户数据完全留在本地设备,不依赖任何云端 API,100k 月活以下应用永久免费,无需登录或按 token 计费。
背景:Desert Ant Labs 源自视频剪辑应用 Detail 团队。团队过去 5 年坚持 on-device-first 路线,但自动剪辑、播客音频增强等功能长期被迫回落到云端 API,成本随用户增长急剧攀升。核心团队多次在 Hugging Face 上搜寻可部署的本地模型均无果,遂决定自研,把模型训练视为产品设计而非研究课题,最终形成小而专、本地优先的差异化路线。
影响:四款主打模型亮点突出——Voz 在 iPhone 上 2 秒转录 10 分钟音频,比 Whisper 快 4.7 倍,在 M3 Ultra 上实时率达 319 倍;Clear 仅 9MB,可在 1 秒内将笔记本录音升级到录音棚级音质,iPhone 16 Pro 实现 302 倍实时、M5 MacBook Pro 达 345 倍;Redact 用 12MB 权重实时屏蔽 27 种语言中的姓名、地址、卡号,识别率 88.8% 接近 2.3GB 的 GLiNER-PII;Tongue 仅 2MB 即可从三个词识别 84 种语言,准确率 0.933 反超 293MB 通用检测器。Clips(284MB)作为内部替代品,已在自家产品中替换 Claude Sonnet,将 10 分钟视频切分为十余片段仅需 5 秒,速度快 10 倍、能耗低 470 倍。路线图上,实验室将前 100 款模型定位为“小脑”——常驻本地完成用户感知不到的常规任务,未来再叠加“路由皮层”,由本地小模型先答、复杂任务升级到大模型或云端。Detail 6 将随 iOS 27 发布,届时应用内所有云端 API 将被自研模型完全替换。
总结:Desert Ant Labs 以“推理成本归零、数据主权优先”为切入点,用数十款极小模型正面挑战当下以数据中心为主的 AI 范式,为欧盟监管下的本地化智能体生态开辟新路径。
参考来源:
1. https://desertant.com/blog/introducing-desert-ant-labs/
2. https://deniz.in/desert-ant-labs-launches-18-on-device-ai-models-for-audio-vision-and-text
3. https://news.linxi.com.au/news/desert-ant-labs-launches-18-specialised-ai-models-for-on-device-use
4. https://contentbuffer.com/news/desert-ant-labs-launches-18-device-ai-models-3a4d107c
5. https://vuink.com/post/qrfregnag-d-dpbz/blog/introducing-desert-ant-labs
6. https://huggingface.co/desert-ant-labs
7. https://elk.zone/code4lib.social/@finnvoorhees@mastodon.social/116749012374960679









