记录一下:给一个 AI 音乐站做 demo BGM 时, prompt 参数比形容词重要得多

3 天前
 quanmengli

最近给自己一个小页面做 demo 视频,想快速弄一段不侵权、能放在背景里的音乐。之前总觉得 AI 音乐就是输入一句“cinematic / emotional / inspiring”然后碰运气,实际折腾下来发现,真正有用的不是这些形容词,而是更具体的音乐参数。

我测试的页面是这个: https://flowmusic.co/
不是来吹效果多神,主要是拿它当一个 text-to-song 的测试对象。

比较稳定的 prompt 写法大概是:

lo-fi hip hop, dusty piano, vinyl crackle, mellow, 70 bpm, no vocals

比下面这种靠谱很多:

emotional, cinematic, inspiring

原因挺直观的:后者只给了情绪,没有告诉模型到底是什么曲风、什么乐器、有没有人声、速度大概多少。结果通常就是一段很泛的广告/预告片味背景音乐。

目前感觉比较有用的顺序是:

  1. 先写 genre ,比如 lo-fi hip hop / ambient electronic / acoustic ballad
  2. 再写 instrumentation ,比如 dusty piano / soft synth pads / light percussion
  3. 明确 vocals / no vocals
  4. 写 bpm 或 slow / mid-tempo
  5. 最后再补 mood ,比如 calm / nostalgic / darker tone

如果只是产品 demo 、加载页、短视频背景这种用途,no vocals 很重要。带人声以后变量太多,歌词、发音、声线都会抢注意力,反而不好当背景。

另一个小经验是,不要一直改 prompt 。同一个 prompt 多生成几次,往往比反复改词更有效。模型每次出来的旋律和编曲差异挺大,先 roll 几次,方向一直不对时再改 prompt 。

还有就是,哪怕只要 20 秒,也别太执着让它生成 20 秒。生成完整一首,然后在剪辑里截一段好听的,通常更自然。

限制也很明显:

所以我现在的判断是:AI 音乐比较适合做 demo / placeholder / mood test ,不太适合直接当最终音乐作品。对产品开发来说,能在 10 分钟内确认“这个页面配 jazz 还是 synthwave 更合适”,已经挺有用了。

有佬实际把 AI 生成音乐放到正式项目里的吗?尤其是授权这块,你们是怎么处理的?

733 次点击
所在节点    程序员
1 条回复
tf2
3 天前
套的 suno 模型?

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1228614

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX