做长音频内容最头疼的是什么?
不是写稿,是找配音。AI 配音要么太机械,要么情绪不对,长文本还容易断句奇怪。
InfiniteTalk 这个模型专门解决这个问题:
• 支持超长文本,一次生成几十分钟的有声内容
• 情绪控制很细,能根据内容自动调整语气
• 中文支持不错,比很多英文为主的模型更自然
• 本地可跑,4G 显存就能用,不依赖云端 API
我测试了一段 10 分钟的技术讲解,断句和重音都比预期好,听着不会累。
几个适用场景:
- 做播客、有声书,不想自己录音
- 做视频配音,需要长文本连续生成
- 做 AI 客服、语音助手,需要自然对话感
当然,和真人配音比还是有差距,特别是情感细腻的内容。但做信息类、知识类内容,已经够用了。
HuggingFace 上有 demo 可以试,GitHub 也开源了。
你们做音频内容吗?用 AI 配音还是真人?
36 浏览 0 评论
0 反应












