热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Meta Muse语音转写 实时分离20人

时间:2026年9月6日 地点:美国门罗帕克 / 全球 人物:Meta超级智能实验室 (MSL)、Alexandr Wang、Mark Zuckerberg 事件详情: 2026年9月1日,Meta超级智能实验室 (Meta Superintelligence Labs) 正式推出Muse Voice Transcribe,这是Meta首款实时音频感知模型。该模型将流式自动语音识别 (ASR)、20人以上说话人分离 (Diarization) 与端点检测 (Endpointing) 三大任务整合到一个自回归模型中,无需任何后处理步骤即可直接输出结构化文本。 模型以80毫秒为单位处理音频,每秒处理约12.5个数据块。通过名为"自适应延迟" (Adaptive Delay) 的动态决策机制,模型会针对每个词动态决定需要接收多少音频上下文后再输出识别结果:容易识别的词几乎即时转写,发音不清、术语较多或语境复杂的词则获得更多上下文信息。该机制通过强化学习训练,将词错率奖励与延迟奖励相乘,在速度与准确性之间达到帕累托前沿。 性能方面,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文本排行榜上以3.1%词错率 (WER) 位列第一,超越ElevenLabs Scribe v2 Realtime的3.6%、Cartesia Ink-2的3.4%以及谷歌Gemini 3.5 Transcribe Live的4.0%。在说话人分离基准测试中,模型平均错误率为17.5%,同样处于领先位置,并能在一小时内稳定区分超过20位发言者。 语言能力方面,模型训练覆盖70余种语言,其中25种在发布时完成广泛验证,原生支持印地语、泰米尔语、泰卢固语、卡纳达语、马拉雅拉姆语五种印度语言,并支持句内句间的自然语码切换 (code-switching)。开发者可通过语言、关键词与上下文偏置 (Contextual Bias) 进一步提升专有名词识别准确率。 背景: 2025年夏天,Meta重组AI部门成立Superintelligence Labs,从OpenAI、Google DeepMind、Apple招募顶级研究员,提供四年最高3亿美元的薪酬包,但部分招聘仅数周便重返OpenAI。该实验室近几周陆续推出编码代理Muse Code、开源模型与Meta AI Mac应用,Muse Voice Transcribe是最新力作。CEO Mark Zuckerberg与MSL负责人Alexandr Wang均在X平台发文力推该模型。 影响: Muse Voice Transcribe API定价为每1000音频分钟3美元 (约合每小时0.18美元),低于ElevenLabs Scribe v2 Realtime和Deepgram Flux的6.5美元以及Cartesia Ink-2的4美元。模型已通过Meta Model API对外开放,并整合至Meta AI for Mac与Muse Code的听写功能,用户按住Fn键即可在任何应用内调用。Meta将这一实时音频能力定位为"个人超级智能"愿景的基石,未来或将成为AI眼镜等可穿戴设备持续聆听环境的语音入口,与OpenAI、谷歌在实时语音赛道展开新一轮正面竞争。 总结: Muse Voice Transcribe凭借自适应延迟机制与3.1%的最低词错率,在流式语音转写领域取得榜首成绩,配合0.18美元/小时的低价策略,Meta正试图在实时音频AI赛道复制其在Muse Spark系列上的价格战打法,进一步压缩ElevenLabs、Cartesia、Deepgram等独立语音厂商的生存空间。 参考来源: 1. https://the-decoder.com/metas-new-real-time-audio-model-is-the-foundation-for-ai-assistants-that-never-stop-listening/ 2. https://www.ithome.com/0/997/218.htm 3. https://news.qq.com/rain/a/20260902A04TQO00 4. https://www.gadgets360.com/ai/news/meta-muse-voice-transcribe-supports-5-indian-languages-more-than-70-global-11991706 5. https://dataconomy.com/2026/09/02/meta-muse-voice-transcribe-real-time-audio-model-20-speakers/ 6. https://www.techub.news/flash/88f4599b-ec91-4b16-88be-45ba763cc971 7. https://technews.tw/2026/09/02/meta-muse-voice-transcribe 8. https://so.html5.qq.com/page/real/search_news?docid=70000021_1436a9976a639265