用文字生成音乐和音效?AudioCraft 让 AI 变身你的专属配乐师

你有没有过这种时刻——脑子里突然有一段旋律,但懒得打开 FL Studio / Ableton,等你打开软件灵感早跑了?或者你想要一个”下雨天的咖啡馆背景白噪音”,去 YouTube 翻半天找不到合适的?

AudioCraft 这个 Skill,就是来解决这个问题的。

它是什么

AudioCraft 是 Meta 开源的多模态音频生成框架,包含两个核心模型:

  • MusicGen —— 文本生成音乐。描述你想要的感觉,它给你一段旋律。从 300M 到 3.3B 三种参数规模,小到手机大到服务器都能跑。
  • AudioGen —— 文本生成音效。环境音、UI 音效、拟声音效……描述清楚就能生成,最长 5 秒。

两个模型都用 EnCodec 做高保真神经音频解码,输出是 WAV 格式,音质有保障。

怎么用

装上这个 Skill 后,在 Claude 里直接说人话就行:

  • “来一段 Lo-fi 咖啡馆背景音乐,30 秒”
  • “生成一个石头落入深井的水滴声”
  • “给这段旋律配个雨声氛围”

底层调用也就是几行 Python 代码:

from audiocraft.models import MusicGen
model = MusicGen.get_pretrained('facebook/musicgen-small')
model.set_generation_params(duration=8)
wav = model.generate(["chill lo-fi beat with jazz piano chords"])
torchaudio.save("output.wav", wav[0].cpu(), sample_rate=32000)

8 行代码,一段专属 BGM 就生成了。

适合谁

独立创作者 —— 短视频 BGM、游戏音效不用再去找版权音乐了,自己生。
UI/UX 设计师 —— 给 APP 原型配音效,不用去 Freesound 一点点挖。
AI 开发者 —— 构建多模态应用,音频生成能力直接嵌进去。
播客 / 有声内容创作者 —— 背景音乐、转场音效一键生成。

优点 & 局限

优点很明显:完全本地运行,隐私友好,不依赖任何付费 API,生成内容可商用。开源社区活跃,HuggingFace 上有大量预训练权重可下载。

局限也需要知道:MusicGen 默认最长约 30 秒,要做长音乐需要拼接分段生成;复杂多乐器编曲偶尔会有”糊”的感觉,极简风格最擅长。

一句话

把你的文字描述变成音乐和音效——AudioCraft 是目前开源音频生成最成熟的 Skill 之一,236k Stars 的背后是真实的生产级用户在用。如果你需要快速给创意项目配上合适的声音,这个 Skill 值得一试。

GitHubhttps://github.com/nousresearch/hermes-agent
Skill 安装npx skills add https://github.com/nousresearch/hermes-agent --skill audiocraft-audio-generation


GitHub: https://github.com/nousresearch/hermes-agent

评论区

0 条评论

登录后可评论。

苏棠 10 阅读