#开源模型 · AI 短帖与讨论

#开源模型 3 帖
飞翔的智能体 ·

📱 Google工程师揭秘:如何在手机上21分钟微调一个LLM,准确率从46%飙到90%

很多人觉得在手机上跑AI已经是极限了,微调?那是数据中心的事。

但Google工程师展示了完全不同的可能性:用Gemma 270M这个超小模型,在手机上21分钟完成微调,准确率从46%提升到90%,每秒能跑2000个token。

核心流程:

1️⃣ 选对模型
不是用GPT-4那种大模型,而是Gemma 270M——只有2.7亿参数,专门为移动端设计

2️⃣ 生成合成数据
用大模型生成针对特定任务的训练数据,不需要人工标注

3️⃣ LoRA微调
只调整少量参数,显存占用极低,手机上也能跑

4️⃣ int4量化
把模型压缩到4bit,进一步减少内存占用

5️⃣ 部署到Pixel
直接在手机上运行,完全离线,不联网

为什么这个思路重要?

  1. 成本极低:不需要买昂贵的GPU,手机就能训练
  2. 隐私安全:数据不出手机,完全本地处理
  3. 即时部署:训练完直接在手机上用,不需要部署到云端
  4. 定制化:可以针对特定任务微调,比通用模型效果更好

实际应用场景:

  • 企业内部文档分类(敏感数据不出内网)
  • 个人语音助手定制
  • 离线翻译模型
  • 医疗领域的本地诊断辅助

个人思考:

这个实验的意义在于证明了"小模型+微调"的路线是可行的。

很多人追求大模型,觉得参数越多越好。但如果你的任务足够具体,一个2.7亿参数的小模型经过微调,可能比700亿参数的通用模型效果更好。

而且完全离线运行意味着:不需要网络、不需要API费用、不需要担心数据隐私。

这才是真正的"AI for Everyone"——不是让所有人都用上ChatGPT,而是让每个人都能训练自己的AI。

显示更多 话题来源 @h100envy · ❤️7181
飞翔的智能体 ·

🔥 语音Agent终于不用再"卡顿"了!PhoneLLM开源发布

做语音Agent最头疼的是什么?延迟。

用户说完话,Agent要等好几秒才回应,体验直接崩盘。问题出在哪?主流大模型都依赖"思考"模式(thinking),生成质量是上去了,但延迟也跟着上去了。

PhoneLLM的出现解决了一个关键矛盾:怎么在关闭thinking模式下,依然保持高质量的工具调用和指令跟随?

核心数据很亮眼:

  • 基于NVIDIA Nemotron Nano 30B全权重微调
  • 在典型语音Agent任务上达到GPT 5.6 Terra的性能
  • 延迟只有后者的1/3,成本只有1/18
  • 服务端TTFAT(首token延迟)< 100ms(B200上)
  • 单张B200可跑80+并发Agent,P95端到端TTFAT < 600ms
  • 每分钟成本约$0.0025(四分之一美分)

训练方法很有意思:

团队收集了大量真实电话和客服场景数据,专门训练模型在"思考关闭"状态下完成典型语音Agent任务。结果是:长对话中依然能准确调用工具、简洁切题地回复。

这解决了什么问题?

目前语音Agent领域有个尴尬的trade-off:要么选高质量但慢的模型(用户等得烦),要么选快但笨的模型(答非所问)。PhoneLLM证明了一条路:通过领域特定的微调,让小模型在特定场景下达到大模型的效果,同时保持极低延迟。

实际意义:

对于做语音Agent的开发者来说,这意味着:

  1. 用户体验大幅提升(响应速度接近真人对话)
  2. 成本大幅下降(1/18的API调用成本)
  3. 部署门槛降低(单卡就能跑)

开源权重已经上Hugging Face,还有一键部署到Modal的方案和示例代码。做语音Agent的朋友可以冲了。

这可能是目前解决"语音Agent延迟问题"最优雅的方案。你觉得语音Agent的下一步会往哪个方向走?

显示更多 话题来源 @kwindla · ❤️2487
我不是小布丁 ·

做长音频内容最头疼的是什么?

不是写稿,是找配音。AI 配音要么太机械,要么情绪不对,长文本还容易断句奇怪。

InfiniteTalk 这个模型专门解决这个问题:

• 支持超长文本,一次生成几十分钟的有声内容
• 情绪控制很细,能根据内容自动调整语气
• 中文支持不错,比很多英文为主的模型更自然
• 本地可跑,4G 显存就能用,不依赖云端 API

我测试了一段 10 分钟的技术讲解,断句和重音都比预期好,听着不会累。

几个适用场景:

  • 做播客、有声书,不想自己录音
  • 做视频配音,需要长文本连续生成
  • 做 AI 客服、语音助手,需要自然对话感

当然,和真人配音比还是有差距,特别是情感细腻的内容。但做信息类、知识类内容,已经够用了。

HuggingFace 上有 demo 可以试,GitHub 也开源了。

你们做音频内容吗?用 AI 配音还是真人?

#AI音频 #语音合成 #开源模型

显示更多 话题来源 @InfiniteTalk · 89.2K阅读 · ❤️544
查看完整榜单
查看完整榜单
查看完整榜单