ToonCrafter 是一种生成式卡通视频插帧模型,由香港中文大学与腾讯人工智能实验室的研究团队提出。[1] 它接收两张卡通图像作为起始帧与结束帧,配合描述画面动态的文本提示,直接生成两帧之间的中间画面,并合成为一段短视频。[2] 与依赖运动对应关系的传统方法不同,ToonCrafter 把在实拍视频上预训练的扩散模型运动先验迁移到卡通画风,因此在夸张的非线性运动与去遮挡场景中结果更为自然。[3] 相关论文于 2024 年公开,代码与模型权重随后开源。[1]
定义
ToonCrafter 属于生成式卡通插帧模型:输入为两张静态卡通图像,即起始帧与结束帧,以及一段描述运动动态的文本提示,输出则是一段连续的插值视频。[2] 官方模型卡说明,该模型按 512×320 分辨率、16 帧画面的规格训练,成品时长约 2 秒、帧率 8 帧/秒。[2] 其模型类型被标注为视频扩散模型,由开源的 DynamiCrafter 插值版本微调而来。[2]
论文把这一思路概括为视频插帧中的“生成式插帧”范式。[3] 传统做法先在两帧之间求取像素或色块的对应关系,再据此合成中间画面,这类方法默认运动近似线性,也不会出现复杂的去遮挡现象。[3] 卡通动画里常见的夸张形变、大位移非线性运动与物体互相遮挡,往往使基于对应关系的方法得到不自然甚至失败的结果。[3] 若把实拍视频生成模型直接用在卡通上,还会出现领域差异带来的非卡通内容泄漏、细节劣化以及生成过程难以控制等问题。[4]
原理
ToonCrafter 运行在潜在扩散模型框架中:视频先被编码为压缩的潜在表示,前向加噪与反向去噪都在该空间内完成,插值任务通过给定首尾两帧、把中间帧留空来实现。[3] 由于卡通画面存在大面积高对比色块、精细的轮廓线,并且几乎没有运动模糊,高度压缩的潜在空间会造成明显的细节损失与画质下降。[4] 去噪网络采用三维 U-Net 结构,条件项包含文本提示与图像提示。[3]
flowchart LR
A[起始帧] --> C[3D U-Net 去噪网络]
B[结束帧] --> C
D[文本提示] --> C
E[稀疏草图] --> F[草图编码器]
F --> C
C --> G[双参考 3D 解码器]
G --> H[16 帧插值视频]
框架在基础图像到视频扩散模型上做了 3 处改动:一是卡通校正学习,冻结时序层、只微调空间层与图像上下文投影模块,在保留实拍视频运动先验的同时让外观适配卡通风格;二是双参考三维解码器,在浅层解码用交叉注意力把输入两帧的细节注入生成结果,在深层解码用残差学习保持对齐,并用伪三维卷积沿时间轴传播细节;三是与帧无关的草图编码器,允许用户以稀疏或密集的草图约束生成。[4]
该解码器单独训练,损失由像素级误差、感知损失与判别器损失共同构成。[5] 用于领域适配的卡通数据来自自建数据集,规模约 27.1 万个片段、总时长超过 500 小时,经过镜头切分、静帧剔除、文字过滤与美学评分等筛选,并用 BLIP-2 自动生成描述文本。[5]
发展历程
2024 年 5 月 28 日,项目主页上线,同期公开 arXiv 预印本,编号为 2405.17933。[1][6] 次日,代码与模型权重对外发布。[1]
该论文入选 SIGGRAPH Asia 2024 期刊轨道,并发表于 ACM Transactions on Graphics 第 43 卷第 6 期,2024 年 11 月 19 日在线出版。[4] 此后社区陆续给出多种衍生实现,包括集成到 ComfyUI 的插件、Windows 一键安装包、在线笔记本示例以及草图引导版本。[1]
ToonCrafter 也被后续研究当作预训练骨干模型使用。有工作以它为基础加入轨迹条件来合成动画视频,并指出在动画数据有限的情况下微调规模更大的模型容易出现模型崩溃或结果不理想的情况。[7]
应用
官方列出的应用方向包括卡通草图插值,即在两张草图或线稿之间生成连贯过渡;以及基于参考图的草图上色,给定一张已上色的图像,为输入草图着色。[1]
模型支持稀疏草图引导,用户只需在少数关键帧上提供草图,即可影响整段运动的生成,从而对结果进行交互式修改。[3] 在动画制作流程中,这对应的环节是中间帧绘制,传统上需要逐帧手绘完成。[4]
项目方声明其性质为开源研究探索,未设立官方盈利项目或商业网络应用,使用者需遵守当地法律并自行承担使用责任。[1]
局限
官方模型卡列出的限制包括:生成视频较短,约 2 秒、帧率 8 帧/秒;无法渲染清晰可读的文字;自编码环节有损,画面会出现轻微闪烁。[2]
当前实现支持的分辨率为 512×320、最多 16 帧;按 50 步 DDIM 采样,在 A100 显卡上约占用 24 GB 显存、耗时约 24 秒,社区优化后显存占用可降至约 10 GB。[1] 项目方还声明,受生成式视频先验随机性的影响,成功率无法保证。[1]
此外,有研究指出该方法需要额外交付结束关键帧才能完成插值。[7] 德国影视技术媒体 slashcam 在报道中提到,有用户认为官方展示的效果可能是经过挑选的样本,并指出 16 帧与 320×512 分辨率的限制。[8]
参见
-
视频插帧 —— 在已有画面之间合成中间帧的技术,ToonCrafter 是它在卡通场景下的一种生成式实现。
-
扩散模型 —— ToonCrafter 所依托的生成建模方法。
-
潜在扩散模型 —— 在压缩潜在空间中执行扩散过程的模型结构,也是 ToonCrafter 的工作空间。
-
DynamiCrafter —— ToonCrafter 直接微调而来的图像到视频插值基础模型。
-
SIGGRAPH Asia —— 收录并发表该论文的会议。
参考资料
- ___***ToonCrafter: Generative Cartoon Interpolation***___ . githubusercontent.com [引用日期2026-09-29]
- Doubiiu/ToonCrafter · Hugging Face . huggingface.co [引用日期2026-09-29]
- ToonCrafter: Generative Cartoon Interpolation . arxiv.org [引用日期2026-09-29]
- acm.org 上的网页 . acm.org [引用日期2026-09-29]
- ToonCrafter: Generative Cartoon Interpolation | alphaXiv . alphaxiv.org [引用日期2026-09-29]
- Paper page - ToonCrafter: Generative Cartoon Interpolation . huggingface.co [引用日期2026-09-29]
- content . eg.org [引用日期2026-09-29]
- ToonCrafter---Generative-KI-Zwischenbild-Generieru-18615 . slashcam.de [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T08:59:38Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。