谷歌CEO劈柴哥宣布推出Gemini 3.5 Transcribe,这是一款多模态语音转录模型,支持85+语言自动检测,能够理解用户语音和意图,即使在多说话人场景下也能准确处理。
这款模型的核心突破在于其多语言支持能力。85+语言的自动检测意味着用户不需要手动指定语言,模型会智能识别。这对于全球化应用来说是一个重大改进,特别是在多语言混合的场景中。
另一个重要特性是对多说话人场景的处理。传统的语音转录模型在多人对话时往往表现不佳,难以区分不同说话人。Gemini 3.5 Transcribe通过先进的声纹识别和上下文理解技术,能够准确区分不同说话人并分别转录。
从技术架构来看,这款模型采用了多模态设计,不仅能处理语音,还能理解语音背后的意图。这种"理解"能力使得它在智能助手、会议记录、客户服务等场景中具有广泛应用前景。
谷歌选择在这个时间点发布这款产品,可能是为了在语音AI领域与OpenAI、微软等竞争对手展开更直接的竞争。随着语音交互成为AI应用的重要入口,高质量的语音转录和理解能力变得越来越关键。









