OmniSVG

关注
义项:多模态 SVG 生成模型

OmniSVG 是一套端到端的多模态 SVG 生成模型, 借助预训练的视觉语言模型直接产出可缩放矢量图形, 覆盖从简单图标到复杂动漫角色的范围。 论文于 2025 年 4 月公开,同年 9 月被 NeurIPS 2025 收录。

百科 图文
目录
  1. 技术路线
  2. 数据集与评测
  3. 开源情况
  4. 参考资料
  5. 参见

技术路线

以往的方法有两类毛病:一类输出无结构、计算开销大, 一类只能生成结构过于简化的单色图标。

OmniSVG 的做法是把 SVG 的绘图命令与坐标参数化成离散词元, 让结构逻辑与底层几何解耦——前者交给语言模型的序列建模能力, 后者用有限的命令集表达。文本与图像输入先被编码成前缀词元, SVG 序列接在其后,整体送进解码器。

模型建立在 Qwen2.5-VL 之上,支持文本生成 SVG 与图像生成 SVG 两类任务。

数据集与评测

配套发布的 MMSVG-2M 收录了两百万个带标注的 SVG 资产, 分为图标、插画、角色三个子集, 其中图标约 110 万、插画约 50 万。 数据经过基于文件名、代码与元数据的去重, 统一装入 200×200 的视图框,并用视觉语言模型生成描述文字。

评测协议名为 MMSVG-Bench, 其提示词与图像均由模型合成,以保证评测数据未在训练中出现过。

开源情况

模型代码与权重在 GitHub 上以 Apache-2.0 许可发布, 数据集则采用知识共享的署名—非商业性使用—相同方式共享许可。 官方另提供在线演示与 ComfyUI 插件。

参考资料

  • OmniSVG 论文(NeurIPS 2025)
  • OmniSVG 项目主页
  • GitHub 仓库 OmniSVG/OmniSVG

参见

  • OmniLottie —— 同一团队面向矢量动画的后续工作
词条评价
词条统计

浏览次数:3 次

阅读量:3 次 · 阅读完成量:1 次

最近更新:2026-09-25T04:48:39Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
OmniLottie
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。