OmniSVG 是一套端到端的多模态 SVG 生成模型, 借助预训练的视觉语言模型直接产出可缩放矢量图形, 覆盖从简单图标到复杂动漫角色的范围。 论文于 2025 年 4 月公开,同年 9 月被 NeurIPS 2025 收录。
百科
图文
技术路线
以往的方法有两类毛病:一类输出无结构、计算开销大, 一类只能生成结构过于简化的单色图标。
OmniSVG 的做法是把 SVG 的绘图命令与坐标参数化成离散词元, 让结构逻辑与底层几何解耦——前者交给语言模型的序列建模能力, 后者用有限的命令集表达。文本与图像输入先被编码成前缀词元, SVG 序列接在其后,整体送进解码器。
模型建立在 Qwen2.5-VL 之上,支持文本生成 SVG 与图像生成 SVG 两类任务。
数据集与评测
配套发布的 MMSVG-2M 收录了两百万个带标注的 SVG 资产, 分为图标、插画、角色三个子集, 其中图标约 110 万、插画约 50 万。 数据经过基于文件名、代码与元数据的去重, 统一装入 200×200 的视图框,并用视觉语言模型生成描述文字。
评测协议名为 MMSVG-Bench, 其提示词与图像均由模型合成,以保证评测数据未在训练中出现过。
开源情况
模型代码与权重在 GitHub 上以 Apache-2.0 许可发布, 数据集则采用知识共享的署名—非商业性使用—相同方式共享许可。 官方另提供在线演示与 ComfyUI 插件。
参考资料
- OmniSVG 论文(NeurIPS 2025)
- OmniSVG 项目主页
- GitHub 仓库 OmniSVG/OmniSVG
参见
- OmniLottie —— 同一团队面向矢量动画的后续工作
词条评价
词条统计
浏览次数:3 次
阅读量:3 次 · 阅读完成量:1 次
最近更新:2026-09-25T04:48:39Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。
本条目引用的词条
OmniLottie
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。