SeedMusic(外文名 Seed-Music)是由字节跳动豆包大模型团队研发的一套 AI 音乐生成系统,2024 年 9 月 18 日正式发布。[1]它把自回归语言模型与扩散模型结合在同一框架内,可依据歌词、风格描述、参考音频、乐谱或语音提示等多模态输入生成人声音乐,并支持音符级别的编辑。[2]发布时对外展示了可控音乐生成、谱转曲、词曲编辑与零样本人声克隆四项核心功能,覆盖十种创作任务。[3]
定义
SeedMusic 是字节跳动豆包大模型团队推出的音乐生成与编辑系统,属于生成式人工智能在音频方向的应用,于 2024 年 9 月 18 日对外发布。[1]研发方将其定位为一套具备灵活控制能力的音乐生成模型家族,而不是单一模型。[1]
该系统的设计覆盖两类创作流程:一是根据用户输入生成音乐,二是对已生成的音乐做后期制作编辑。[4]可控生成环节接受风格描述、参考音频、乐谱和语音提示等形式的输入;编辑环节则允许直接改动音频中的歌词与人声旋律。[4]
原理
SeedMusic 在架构上分为表征模型、生成器和渲染器三个部分。表征模型把原始音频波形压缩成紧凑的中间表示,生成器按照用户的控制条件产出这种中间表示,渲染器再把它还原为可播放的音频。[2]
系统没有固定使用某一种建模方式,而是探索了音频 token、符号音乐 token 和声码器潜变量(vocoder latent)三种中间表示,每种表示各对应一条生成链路。[2]基于音频 token 的链路以自回归语言模型为生成器:分词器先把波形压缩成低码率的离散 token,语言模型在多种控制条件下预测目标 token 序列,token 扩散模型据此给出连续的声码器潜变量,最后由声码器渲染成 44.1 千赫兹的立体声音频。[5]
基于音频 token 的生成链路可以概括为:
graph LR
A[风格描述、歌词、参考音频、乐谱、语音提示] --> B[自回归语言模型]
B --> C[音频 token 序列]
C --> D[token 扩散模型]
D --> E[声码器潜变量]
E --> F[声码器]
F --> G[44.1 千赫兹立体声]
基于符号音乐 token 的链路以领谱(lead sheet)标记作为中间表示。领谱标记把歌词、和弦以及人声、钢琴、吉他、贝斯、鼓等轨道信息编码成可读的符号序列,创作者能够在最终渲染前修改旋律、和弦、配器和速度。[2]训练这类链路时,团队借助自研的音乐信息检索模型从音频中提取符号特征,包括节拍跟踪、调性与和弦检测、结构分段、五轨 MIDI 转写和歌词转写。
训练过程分为预训练、微调和后训练三个阶段,后一阶段通过强化学习提升生成结果的稳定性。[2]推理阶段采用流式解码,使语言模型与扩散模型的推理并行进行,从而把从用户下达指令到开始播放的等待时间压缩到 3 秒以内。[3]
发展历程
2024 年 9 月 18 日,字节跳动豆包大模型团队发布 SeedMusic,并公开了技术报告《Seed-Music: A Unified Framework for High Quality and Controlled Music Generation》。[1][2]发布时官方演示了可控音乐生成、谱转曲、词曲编辑和零样本人声克隆四项核心功能,合计覆盖十种创作任务。[3]
同一时期,字节跳动在豆包应用中上线了 AI 音乐生成功能,该功能支持十余种音乐风格,并可一次完成写词与作曲。
应用
系统面向不同熟练程度的使用者:普通用户可以用文字描述或歌词片段得到歌曲草稿,专业音乐人则可以在领谱层面调整音符的音高、时值和节奏。[3]
歌词转歌曲(Lyrics2Song)是任务量较大的一条链路,包含约 1 分钟的片段生成、约 3 分钟的全曲生成、依据参考音频的歌曲仿写以及纯器乐生成。[3]系统另外支持音频续写与音频风格迁移两种音频提示模式。[6]
在编辑方面,扩散链路被用于对已录制曲目做局部改写:可以只替换歌词而保留人声旋律与伴奏,也可以只改动旋律而保留歌词与伴奏。[1]零样本歌声转换只需用户提供约 10 秒的清唱或普通说话录音,系统即可参照该音色生成演唱。
研发方设想的应用场景涵盖短视频、长视频、游戏以及 AR/VR 等多媒体配乐,并提到生成音乐未来可能响应游戏剧情和视觉风格等环境信号。[3]为降低被用于模仿他人的风险,系统采用与Seed-TTS相近的安全流程,对语音内容和声音做多步验证,并在生成过程中加入多级水印与重复检查。[2]
局限
三种中间表示各有取舍。音频 token 和声码器潜变量不具备可解释性,发音、音色、音高等属性以高度纠缠的方式编码,生成器难以单独控制旋律或音色;符号音乐 token 虽然可读可改,但缺少声学细节,需要依赖渲染器补齐演奏表现,而训练这类渲染器要有大规模的音音频与符号转录对齐数据,在声乐领域尤为稀缺。[2]
在评测上,语音领域已有词错率、说话人验证等成熟指标,音乐生成缺少能给出定量分数的同类基准;音乐性本身偏主观,很难用客观指标衡量。[5]
零样本歌声转换的效果很大程度上取决于参考音色与目标演唱之间的相似度。参考与目标同为男性英语演唱时结果较好,跨性别和跨语言的场景更困难,容易出现杂音、失真和发音不一致。[2]此外,当输入歌词与参考音频在语言、结构或押韵上差别较大时,生成结果与参考之间的连贯程度会下降。[5]
研发方同时表示,文本到音乐类系统对初学者可能有较大帮助,对专业制作人提供的价值则相对有限;音乐音频采用何种中间表示最优,仍是待探索的问题。[7]
参见
参考资料
- 嗨,Seed-Music . bytedance.com [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- Seed-Music 音乐大模型正式发布!生成编辑两开花,十种创作任务,满足多样化需求 . qq.com [引用日期2026-09-29]
- AMiner - GLM满血模型-AI科研助手 . aminer.cn [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- Audio Prompting . bytedance.com [引用日期2026-09-29]
- 【论文速读】字节跳动音乐生成模型 Seed-Music . csdn.net [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T08:55:21Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。