Google Gemini 3.5 Transcribe

Google DeepMind推出的新一代语音转写模型,基于Gemini 3 Pro架构

AI音频 部分免费

Google Gemini 3.5 Transcribe是Google DeepMind推出的新一代语音转写模型,基于Gemini 3 Pro架构,专门针对语音转文本的精确度与低延迟进行了深度优化。该模型支持超过85种语言的自动检测与转写,能够处理多语言混说的对话场景,并提供词级时间戳标注、说话人分离(支持最多8个说话人)和自定义词汇偏置等功能。在实际评测中,Gemini 3.5 Transcribe在AlphaMetrics等权威基准上取得了行业领先的成绩,对邮箱地址、航班号、产品编号等字母数字混合内容的识别精度显著优于同类产品。该模型支持智能纠错与格式化,可自动过滤嗯啊等填充词,并根据说话人意图进行智能断句与标点补充,适合用于客服录音、会议记录、医疗口述、庭审记录等专业场景。目前已集成至Google Meet、Gmail、Google Workspace以及Vertex AI等平台供开发者API调用。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论