Suno 是一款基于生成式人工智能的音乐创作软件,由美国公司 Suno, Inc. 开发,用户输入文字描述即可生成包含人声、歌词与编曲的完整歌曲。该产品于 2023 年 12 月 20 日随网页应用上线并向公众开放,同时通过与微软合作成为 Copilot 的插件[1]。Suno 把音乐创作的门槛降低到只需一段提示词,是生成式人工智能进入音频领域后用户规模较大的消费级应用之一,但其训练数据来源也引发了音乐行业的版权诉讼[2]。
定义
Suno 是一种生成式人工智能音乐创作程序,能够依据用户输入的文字提示生成带有演唱与人声伴奏的歌曲,也可以只生成纯器乐作品[1]。它把作词、作曲、编曲、演唱与混音等环节合并到一次生成之中,用户不必掌握乐器演奏或音频软件操作[3]。
与只产出短促器乐循环的早期工具不同,Suno 面向的是结构完整的歌曲,包含主歌、副歌与人声演唱,可在数十秒内完成一首作品[4]。平台采用免费额度加订阅付费的方式运营,付费订阅者对其生成的作品享有商用权利[4]。
原理
音频是连续波形,采样率高,无法像文字那样直接作为离散符号送入模型,因此 Suno 采用业界的通行做法:先由神经音频编解码器把波形压缩成离散的音频标记(token),再由大模型预测后续标记,最后经解码还原为声音[5]。据其创始人介绍,团队同时使用了自回归模型与扩散模型,前者负责推进歌曲结构与段落,后者在音色与细节质感上更灵活[5]。
在训练路线上,Suno 刻意不向模型灌输乐理规则,而是让模型从大量音频中自行归纳曲式与风格逻辑。其首席执行官在访谈中说明,如果把音乐限定为 12 个音或若干种乐器,模型的能力会被永久限制,因此团队选择直接对采样后的原始声波建模[6]。处理一条提示词时,系统先用语言模型生成或解析歌词、把风格描述扩展为模型可理解的线索,再交由音频模型合成声音[6]。
Suno 较早公开的相关成果是文本转语音与音频模型 Bark,它以 GPT 式架构配合音频量化表示,属于完全生成式的文本转音频模型,而非传统拼接式语音合成[7]。学术界对 Suno 输出的分析认为,其分层声学架构借助语义条件与细粒度解码,在振幅起伏等结构指标上更接近排行榜音乐,但曲目之间的差异度低于真人作品,反映出对平均模式的拟合倾向。
发展历程
Suno 由米奇·舒尔曼(Mikey Shulman)、格奥尔格·库茨科(Georg Kucsko)、马丁·卡马乔(Martin Camacho)与基南·弗雷伯格(Keenan Freyberg)于 2022 年在美国马萨诸塞州剑桥市创立,四人此前同在人工智能金融公司 Kensho 工作[3]。团队最初发布开源文本转语音项目 Bark,在用户反馈显示人们更想要带人声的完整歌曲后,转向音乐生成方向。
2023 年 12 月 20 日,Suno 的网页应用上线,并与微软合作作为 Copilot 插件对外提供[1]。2024 年 3 月,其 V3 模型向全体用户开放,可生成长度约两分钟、达到广播级质量的歌曲。同年 5 月,公司完成 1.25 亿美元融资,估值达 5 亿美元;7 月 1 日推出移动端应用[3][1]。
2024 年 11 月,Suno 发布 V4 模型,引入音质提升功能与歌词助手,仅向付费订阅者开放[8]。2025 年 5 月与 9 月,公司先后发布 V4.5 与 V5,官方称 V5 在音频清晰度、人声自然度与指令执行准确度上有明显提升;同年 9 月推出网页端生成式音频工作站 Suno Studio,把多轨编辑与生成式创作结合[3]。2025 年 11 月,Suno 完成 2.5 亿美元 C 轮融资,估值升至 24.5 亿美元[3]。
2026 年 3 月,Suno 发布 V5.5 模型,同步推出声音复刻、自定义模型与偏好学习等个性化功能[9]。同年 6 月,公司宣布完成超 4 亿美元 D 轮融资,投后估值达到 54 亿美元。此前其平台累计使用人数已超过 1 亿,日均生成歌曲超过 700 万首[2]。
在行业关系上,华纳音乐集团于 2025 年 11 月与 Suno 达成和解并签署授权协议,双方将共同开发使用授权音乐的新一代模型,此前双方的法律纠纷随之化解。Suno 表示将在随后数月推出首个与音乐行业合作开发的音乐模型。
应用
Suno 的主要用途是让普通用户凭一段文字描述生成歌曲,提示词中可以指定曲风、情绪、乐器编制、人声性别与速度等要素[10]。生成结果可以继续延长、重新生成、改写歌词或调整段落顺序,付费方案还提供分轨导出,最多可输出 12 条时间对齐的 WAV 分轨,供用户导入专业数字音频工作站继续制作[4]。
平台上也出现了上传或录制本人音频、训练自定义声音与声音复刻等功能,使同一创作者的多首作品在音色上保持连贯[4]。2026 年 10 月,Suno 推出语音功能 Speech,可在单次生成中同时产出配音与配套背景音乐,并提供调整声音性别、语速风格与变化幅度的选项[11]。该功能采用端到端一体化生成,而非先合成语音再拼接配乐[12]。
除个人娱乐外,Suno 生成的音乐被用于短视频与社交平台的背景音乐,也有作品在流媒体与榜单场景中获得播放[2]。2025 年 7 月,一位 Suno 用户与 Hallwood Media 签订唱片合约,成为传统唱片公司签约人工智能创作者的早期案例之一[1]。
局限
Suno 生成的不确定性与噪声问题仍然存在。官方在介绍语音功能时承认,测试版本中语音口音会偶发漂移,例如英式口音中途转向澳式口音再转回,语调与情感停顿有时过于戏剧化,导致断句节奏偏慢[11]。同类问题在音乐输出中表现为曲目之间差异度偏低,一些极端动态细节被抹平。
训练数据的合法性是 Suno 面临的最大不确定性。该公司不公开其训练数据集,并称已针对抄袭与版权问题采取防护措施[1]。Suno 承认其模型在训练中使用了受版权保护的音乐,但主张属于合理使用;索尼音乐、环球音乐与德国音乐著作权集体管理组织 GEMA 等权利方持续对其提起诉讼,而华纳音乐集团已与其和解并签订授权协议[13]。
2026 年 7 月 31 日,德国慕尼黑地区法院就 GEMA 起诉 Suno 一案作出一审判决,认定 Suno 未经许可使用受版权保护的音乐作品训练模型,且输出内容可再现原作的旋律,相关行为不适用合理使用与文本数据挖掘例外,构成侵权[14]。该判决尚未生效,但它表明模型对训练素材的记忆可能被认定为侵权依据[15]。
与训练数据相关的还有下游权利约束。按照与唱片公司达成的授权安排,Suno 计划从开放模型转向使用授权音乐的新模型,后者附带更多限制,免费用户仅能流式收听与分享,下载功能将限于付费层级并设置月度额度[10]。这意味着生成式音乐工具正被纳入与传统音乐相同的授权与控制体系[10]。
参见
参考资料
- suno.com 上的网页 . suno.com [引用日期2026-10-04]
- 一亿人用过的AI音乐创作软件,估值25亿美元 . sina.com.cn [引用日期2026-10-04]
- AI音乐创作平台Suno宣布完成2.5亿美元C轮融资- DoNews . donews.com [引用日期2026-10-04]
- Suno | AI Music Generator - Dancing With My Eyes Closed . suno.com [引用日期2026-10-04]
- Why Does Suno Evolve So Fast? . suno.hk [引用日期2026-10-04]
- sunos-mikey-shulman-everyone-can-make-music-now . podscan.fm [引用日期2026-10-04]
- Re: MathML + Suno AI . w3.org [引用日期2026-10-04]
- Suno AI . suno.com [引用日期2026-10-04]
- 4个金融男搞AI音乐,拿下27亿融资,估值超过366亿 . aichip001.com [引用日期2026-10-04]
- The rise of AI-made music . educative.io [引用日期2026-10-04]
- Suno推出Speech功能 可同时生成配音与背景音乐 . itsdw.cn [引用日期2026-10-04]
- Suno推出Speech语音功能 端到端生成语音与音乐 . qudong.com [引用日期2026-10-04]
- 深陷版权诉讼仍受资本热捧,AI音乐生成公司Suno再融资4亿美元 . jrj.com.cn [引用日期2026-10-04]
- 德国GEMA协会胜诉Suno,欧洲AI音乐版权领域迎来重要判决 . mcsc.com.cn [引用日期2026-10-04]
- naipo.com 上的网页 . naipo.com [引用日期2026-10-04]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-03T18:19:12Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。