热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Meta Muse实时音频转写 20人分轨创SOTA

时间:2026年9月1日(美国时间),中文媒体9月2日报道。 地点:美国加利福尼亚州,Meta 超级智能实验室(Meta Superintelligence Labs,简称 MSI)。 人物:Meta CEO 马克·扎克伯格、MSI 团队负责人 Alexandr Wang。 事件详情:Meta 正式推出首个实时音频感知模型 Muse Voice Transcribe。该模型在单一流程中集成流式自动语音识别(ASR)、说话人分离(diarization)与端点检测,用户说话时系统即可同步输出文字,无需等待整段录音结束。模型可实时分离 20 人以上录音中不同发言者,训练数据覆盖 70 多种语言(25 种发布时已完成验证),并支持单句内或句间的自然语言切换(code-switching)。在技术细节上,Meta 引入自适应延迟(adaptive delay)机制,在易词上更快提交、在难词上多收一段上下文再输出,兼顾响应速度与准确率。模型同时支持超过 1 小时的长会话。定价方面,开发者通过 Meta Model API 调用价格为每 1000 音频分钟 3 美元(约合 0.18 美元/小时),现已在 Meta AI Mac 应用和 Muse Code 中提供能力演示。 背景:扎克伯格在 X 平台亲自分享演示视频,展示了 Muse Voice Transcribe 自动区分多说话人并在多语言间切换的能力。在 Artificial Analysis AA-WER Streaming 实时语音转文本基准上,该模型词错误率 3.1%,排名第一,超过 Cartesia Ink-2 的 3.4% 与 ElevenLabs Scribe v2 Real-time 的 3.6%;说话人区分错误率 17.5%,同样领先。值得注意的是,Meta 此次并未公开模型权重,与此前 Llama 系列、SeamlessM4T 等的开源策略形成明显对比。 影响:实时多说话人、多语言转写是会议记录、客服、字幕、教育、播客等高频场景的核心需求。Muse Voice Transcribe 的发布让 Meta 在这一赛道正面对决谷歌——后者一周前刚发布 Gemini 3.5 Transcribe 并集成到 Android 与 Chrome 浏览器。Meta 选择不开放权重、按 API 调用次数收费的策略,标志着其语音 AI 商业化路径从此前的"开源引流"转向"能力即服务"。对开发者而言,0.18 美元/小时的定价使大规模会议字幕、跨国客服语音转写等场景的算力成本可被精确估算。 总结:Muse Voice Transcribe 以 SOTA 成绩登顶实时语音转写榜单,20 人分轨与 70 语种同声转写能力是其最大亮点,闭源 API 收费策略也标志 Meta 语音 AI 商业化进入新阶段。 参考来源: https://www.engadget.com/2249112/meta-new-ai-transcription-model-can-distinguist-between-multiple-speakers-and-languages-in-real-time https://www.ithome.com/0/997/218.htm https://www.163.com/dy/article/L5Q4N5FK05561FZX.html https://headlinesbriefing.com/mobi/engadget/metas-real-time-audio-model-transcribes-20-speakers-6be8f921 https://guavy.com/wire/stocks/meta-surpasses-openai-and-google-in-real-time-transcription-with-muse-6XAc9a6TKzaUS0h0CFdrsN https://so.html5.qq.com/page/real/search_news?docid=70000021_7486a97708445252