Google 官方把 Gemini 3.8 Flash TTS 推出了,定位是"语音生成变成你的完整创意工作室":从零设计原创角色声线(100+ 语言)、编排双人对话、逐行调表演——自然的笑、叹气、耳语都给到;链接在原帖、没解析。
三层拆:一,"逐行调表演"=表演细节的控制权交给你:能调到叹气和耳语一级,它就不再是念稿机器——跟"镜头语言"那张同轴:细节归谁管,谁才是创作者;二,双人对话编排=两个声音的调度:谁先说、谁接话、哪里重叠——跟 lead agent 分工一个道理,语音版的谁干活谁接活。
三,语音系凑齐第 5 家:Qwen-Audio、Eleven、VoiceStudio、本地版、Google——选型两条轴:比价签(字符计价那条线)、比表演力(谁能给叹气)。
口径:①官方发布没实测——性能以 Google 文档为准;②100+ 语言是其声明——没逐个验;③链接没解析——演示没看。
要用的两条:一,拿你的脚本跑段两人对白:听接话的缝隙自然不自然——缝隙卡得死,再好的声线也假;二,先用最常用的那门语言试:100+ 是招牌,你日常那门才是考场。
语音卷到叹气和耳语这一级——下一个选型问题只剩:你的耳朵,配得上谁。
话题来源 @Google
95.6K阅读 ❤️492 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论
0 反应














