Sesame CSM 是 Sesame 开发的对话语音生成模型,官方全称对话语音模型(Conversational Speech Model),输入文本与音频后可生成 RVQ 音频码。[1] 它由基于 Llama 架构的多模态骨干网络和较小的音频解码器组成,把对话文本与语音放进同一个模型处理,因此能合成带停顿、呼吸与语气变化的语音。[2][3] 2025 年 3 月 13 日,Sesame 以 Apache 2.0 许可证开源了 10 亿参数的 CSM-1B,这是该系列第一批公开的权重。[1]
定义
Sesame CSM 是 Sesame 研发的一类语音生成模型,官方名称为对话语音模型。它接收文本与音频两类输入,输出的是经过残差向量量化处理得到的音频码,再由解码器还原成声音。[1]
与把文字转语音拆成文字生成、声音合成两步的传统流程不同,CSM 将对话中的文字与对应语音一起交给同一个模型,属于端到端的多模态方案,因而能够在说话时参考此前几轮对话的内容。[3][4]
目前公开的权重是 10 亿参数的 CSM-1B。Sesame 表示,这是其发布的首个开源上下文文本转语音模型,模型卡同时说明公开版本是基础生成模型,并未针对某个具体音色做微调。[2][1]
原理
CSM 由两个自回归 Transformer 构成:一个是处理交错文本与音频标记的多模态骨干网络,负责预测第 0 号码本;另一个是参数量小得多的音频解码器,依据骨干网络的表示预测其余码本,从而重建语音。[2][3]
两个部分都源自 Llama 架构。文本经 Llama 分词器切分,说话人身份以编号前缀的形式与文本拼接;音频则交给 Kyutai 的 Mimi 分词器,以 12.5 赫兹的帧率逐帧编码,每帧得到 32 个码本,其中 1 个承载语义信息,其余承载声学细节。[5][2]
训练瓶颈主要来自解码器:它要按码本逐层自回归地处理大量音频帧,显存负担很重。Sesame 采用计算摊销方案,让解码器只在随机抽取的 1/16 帧上计算损失,第 0 号码本仍在全部帧上更新,官方称这样做没有观察到解码器损失的明显差异。[3][6]
推理阶段,模型产生的离散码本经 Mimi 解码器还原为 24 千赫兹的语音波形。工程实现上,它支持批量推理与 CUDA 图整图编译,也可以借助 Transformers 的训练器继续训练。[1]
发展历程
Sesame 成立于 2023 年 6 月,创始人为 Brendan Iribe、Ankit Kumar 和 Ryan Brown,其中 Iribe 是 Oculus 的联合创始人。该公司获得了 Andreessen Horowitz 领投的 A 轮融资。[7]
2025 年 2 月底,Sesame 上线 CSM 的研究预览,用户可与名为 Maya 和 Miles 的两个语音角色对话。官方博客把目标称为追求“语音临场感”,即让口语交流显得真实、被理解与被重视。[8]
2025 年 3 月 13 日,Sesame 放出 1B 版本的 CSM-1B,代码托管在 GitHub 的 SesameAILabs 仓库,权重放在 Hugging Face,许可证为 Apache 2.0,可用于商业用途。[1]
据 Sesame 披露,团队共训练了 1B、3B、8B 三种规模,最大配置由 80 亿参数的骨干网络与约 3 亿参数的解码器组成,训练语料约为 100 万小时、以英语音频为主,但只有最小的 1B 版本被开源。[8][5]
2025 年 5 月起,CSM 被集成进 Hugging Face Transformers,从 4.52.1 版本开始原生支持。[1][2]
2025 年 10 月,Sesame 宣布完成 2.5 亿美元 B 轮融资,并推出 AI 眼镜测试版;CSM-1B 正是其语音助手 Maya 所依托的基础模型。[7]
应用
CSM 主要面向对话场景的语音合成,例如交互式语音演示、语音助手与语音智能体。官方说明,当存在此前的对话音频作为上下文时,模型的生成效果最好,语气与节奏能够顺着对话延续下去。[1][4]
开发者既可以自行部署权重,也可以通过第三方推理平台调用,部分平台提供流式输出、音色选择等选项。[9]
开源发布没有附带训练代码,社区后来复现了训练流程,把 CSM 微调到新的语言和音色,说明这套架构可以继续训练。[5]
Sesame 自家的 Maya 与 Miles 是在基础模型上针对亲和力与表现力微调得到的,这两个音色并未包含在公开权重中。[4][3]
局限
CSM 只生成语音,不生成文本。官方明确说明它不是通用的多模态大模型,而是音频生成模型,并建议另配一个语言模型负责文字部分。[1]
公开的权重是基础生成模型,能够产生多种声音,但没有绑定任何固定音色。官方也说明,由于训练数据中混入非英语内容,模型对非英语只有一定处理能力,实际表现很可能并不理想。[1]
训练数据的来源并未公开,Sesame 没有说明用了哪些语料。
模型缺少内建的技术性防护手段。Sesame 主要依靠诚信约定,要求使用者不要在未获同意的情况下模仿他人声音,也不要制作假新闻等误导内容或从事违法活动。[1]
与官网演示所用的微调版本相比,公开权重在自然度与表现力上存在差距;第三方评测多把 CSM-1B 看作一个需要外部语言模型配合的语音合成模块,而不是可以直接对话的完整产品。[4][10]
参见
参考资料
- README.md · sesame/csm-1b at main . huggingface.co [引用日期2026-09-29]
- Csm · Hugging Face - Transformers documentation . huggingface.co [引用日期2026-09-29]
- sesame-csm . digitalocean.com [引用日期2026-09-29]
- rdworldonline.com 上的网页 . rdworldonline.com [引用日期2026-09-29]
- sesame-finetune . speechmatics.com [引用日期2026-09-29]
- 驱动“超真人”虚拟助手Maya的实时语音对话模型CSM-1b开源! . aliyun.com [引用日期2026-09-29]
- dataconomy.com 上的网页 . dataconomy.com [引用日期2026-09-29]
- arstechnica.com 上的网页 . arstechnica.com [引用日期2026-09-29]
- csm-1b . replicate.com [引用日期2026-09-29]
- Sesame Preview vs VoxCPM2: Agent or Open TTS Block . orcarouter.ai [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T08:58:05Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。