DiffSensei

关注
义项:AI图像生成模型

DiffSensei 是一套面向定制化漫画生成(customized manga generation)的 AI 图像生成框架, 由扩散模型图像生成器与多模态大语言模型结合而成, 由北京大学、上海人工智能实验室、南洋理工大学等机构的研究者联合提出[1]。它可以在同一页漫画的多个分格中同时控制多名角色的外观与位置, 并让角色依据每格文字说明调整表情、姿势和动作, 用以弥补一般文生图模型在多角色场景下控制力不足的问题[2]。研究团队为训练该框架还发布了 MangaZero 数据集, 含 43,264 页漫画与 427,147 个标注面板[1]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

DiffSensei 属于故事可视化方向的一项图像生成框架, 研究者为它提出了一项新任务, 即定制化漫画生成: 在给定角色图像与文字描述的条件下产出整页漫画[1]。该任务要求模型既要画准角色, 又要按剧情文字改变角色的神态与动作, 并遵守使用者指定的版面排布[3]。

系统接受四类输入, 分别是每一格的文字提示、若干张角色参考图、每一格中角色的边界框以及对话框的边界框, 输出为符合这些条件的面板画面[4]。与只依据文字出图的传统故事可视化任务不同, 这一设定把角色身份与版面布局一并交给使用者掌握[3]。

原理

该框架把多模态大语言模型当作角色特征的适配部件, 与扩散模型图像生成器串接使用[1]。角色特征来自两条路径: CLIP 图像编码器负责局部图像特征, 漫画专用编码器 Magi 负责图像级特征, 两者经重采样模块压缩为低维 token 后送入交叉注意力, 由此避免把输入图的原样像素搬进生成结果[3]。

版面控制依靠掩码交叉注意力实现。做法是从扩散模型的键值矩阵中复制出独立的角色注意力分支, 每个角色仅在与自身边界框对应的区域内参与注意力计算, 没有角色的区域则改为关注一个占位向量[4]。这一计算可写作 $\hat{\mathbf{z}} = \mathrm{Softmax}\!\left(\frac{\mathbf{Q}\mathbf{K}_t^{\top}}{\sqrt{d}}\right)\mathbf{V}_t + \alpha\,\mathrm{Softmax}\!\left(\frac{\mathbf{Q}\mathbf{K}_i^{\top}}{\sqrt{d}} + \mathbf{M}\right)\mathbf{V}_i$, 其中 $\alpha$ 控制角色注意力的权重, $\mathbf{M}$ 为限制角色出现范围的掩码矩阵[4]。


graph LR

A[面板文字提示] --> D[MLLM 角色适配器]

B[角色参考图] --> C[CLIP 与 Magi 编码器]

C --> D

D --> E[掩码交叉注意力]

F[角色与对话框边界框] --> E

E --> G[扩散模型 U-Net]

G --> H[漫画面板]

对话框的位置由可训练的嵌入来编码: 该嵌入先扩展到与噪声潜变量相同的空间尺寸, 再按对话框掩码叠加到潜变量上, 因此模型只负责气泡出现的位置, 文字内容留给人工补写[4]。若只依赖图像生成器, 生成的人像往往紧紧贴着输入角色图, 表情与姿态变化有限, 因此第二阶段引入多模态大语言模型, 让它同时读取源角色特征与面板文字, 输出与文本语义相容的目标角色特征[3]。训练分两步推进: 先在 MangaZero 上训练扩散模型学习角色与布局, 再冻结图像生成器、只微调适配器。

发展历程

DiffSensei 的论文题为《DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation》, 于 2024 年 12 月 10 日上传至预印本平台[1]。作者包括 Jianzong Wu、Chao Tang、Jingbo Wang、Yanhong Zeng、Xiangtai Li 与 Yunhai Tong, 分属北京大学、上海人工智能实验室、南洋理工大学和字节跳动 Seed[3]。

该成果被 CVPR 2025 接收并以海报形式展示, 论文收录于会议论文集的第 28684 至 28693 页[2][3]。配套的 MangaZero 数据集取自日本黑白漫画, 覆盖 48 个系列, 作品出版年份跨越 1974 年至 2024 年[3]。研究团队公开了训练与测试代码、预训练模型和数据集, 模型权重可在 Hugging Face 获取[5]。

应用

该框架的用途是定制化漫画生成: 使用者提供角色图像与每一格的剧情文字, 模型据此输出角色形象一致的整页分格漫画[1]。它也能处理真人题材, 把真人照片转为漫画形象并续写故事, 这类示例中的对话文字由人工后期填入[3]。

研究团队列出的潜在场景还包括教育可视化与广告设计, 并把该框架定位为漫画创作的辅助工具。配套的 MangaZero 数据集中同一角色存在多种状态, 可用于训练按文字灵活控制人物状态的生成模型, 亦为画风可控的漫画生成留出扩展空间。与较早的黑白漫画数据集 Manga109 相比, MangaZero 收录了更多 2000 年以后出版的作品, 其名称也由此而来。

局限

在对话处理上, 当前版本只确定气泡出现的位置, 并不生成可读的对话内容, 原因在于主流文生图模型生成较长且连贯的文字仍不可靠, 因此文字需要人工写入[4]。

角色保真与可编辑性之间存在张力: 模型容易过度贴合输入的角色图, 产生近似粘贴的效果, 团队用多模态大语言模型充当适配器来缓解这一问题, 消融实验显示移除该组件后 CLIP 指标下降 1.73%, DINO-C 分数同步走低[3]。

数据层面, MangaZero 中面板的分辨率整体偏低, 需要可变分辨率训练才能有效处理; 现有素材以日本黑白漫画为主, 彩色漫画与动画生成被研究者列为后续方向。方法对具体实现也较为敏感, 例如把对话框的傅里叶嵌入加入 SDXL 的时间步嵌入后, 布局控制的 F1 分数由 0.653 降至 0.364[3]。

参见

  • 扩散模型 —— DiffSensei 的图像生成部分建立在这类生成模型之上

  • 多模态大语言模型 —— 在框架中充当与文本相容的角色特征适配器

  • 故事可视化 —— 该框架所归属并推进的研究任务方向

  • MangaZero —— 为定制化漫画生成任务构建的配套数据集

  • 文生图 —— 与之相关、但在多角色控制上能力有限的图像生成技术

参考资料

  1. huggingface.co 上的网页 . huggingface.co [引用日期2026-09-29]
  2. thecvf.com 上的网页 . thecvf.com [引用日期2026-09-29]
  3. thecvf.com 上的 PDF 文件 . thecvf.com [引用日期2026-09-29]
  4. Motivation . arxiv.org [引用日期2026-09-29]
  5. jianzongwu/DiffSensei · Hugging Face . huggingface.co [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T08:57:47Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
故事可视化 多模态大语言模型 扩散模型 CLIP 北京大学 CVPR Hugging Face MangaZero Manga109 扩散模型 多模态大语言模型 故事可视化 MangaZero 文生图
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。