GLIGEN

关注

GLIGEN(Grounded-Language-to-Image Generation)是一种为预训练文本到图像扩散模型补充空间定位能力的图像生成方法[1][2]。它在不改变原模型权重的情况下, 通过新增加的可训练层接收文本之外的定位条件, 使图像中的概念能按指定位置与形式出现[2][3]。该工作由 Yuheng Li 等人提出, 2023 年发表于计算机视觉与模式识别会议(CVPR)[4]。其在 COCO 与 LVIS 上的零样本表现优于已有的监督式布局到图像基线[3]。

百科 图文
目录
  1. 定义
  2. 背景
  3. 内容
  4. 影响与争议
  5. 参见

定义

GLIGEN 指在预训练文本到图像扩散模型中注入定位条件的生成方法, 其核心是在保留原网络结构的同时让视觉特征接收额外的定位 token[1][2]。严格地说, 它在每个 Transformer 块里保留原有的 自注意力 与交叉注意力层并冻结其参数, 再插入一层可训练的门控自注意力, 使视觉特征与定位 token 共同参与注意力计算[5]。

该门控层以残差形式回加到视觉特征上, 可写作 $v = v + \beta \cdot \tanh(\gamma) \cdot \mathrm{TS}(\mathrm{SelfAttn}([v, h^e]))$, 其中 $\gamma$ 是初始化为 0 的可学习标量, $\mathrm{TS}(\cdot)$ 只保留视觉 token, $\beta$ 在训练阶段取 1[5]。每个定位 token 同时含有实体语义(来自文本或图像编码)与空间位置(来自边界框或关键点坐标)两类信息[2]。以边界框为例, 坐标经傅里叶嵌入得到 64 维向量, 与文本嵌入拼接后送入多层感知机, 输出维度与原文本嵌入一致, 在 Stable Diffusion 情形下为 768[6]。

背景

大规模文本到图像扩散模型在图像质量与概念覆盖上进步显著, 但主流做法只使用文本输入, 这会限制可控性[2][3]。自然语言本身难以准确交代物体的具体方位, 而边界框、关键点等标注更容易表达位置; 已有的可控扩散模型与生成对抗网络虽能接受文本之外的输入, 却较少把这些输入整合进可控的文本到图像生成流程[3]。

另一方面, 以往的生成模型多在各自任务的数据集上单独训练, 而识别领域早已形成先在大规模数据上预训练、再迁移到下游任务的做法[3]。在布局到图像生成这一方向上, 早期方法往往从零开始训练, 难以利用大规模预训练模型所积累的视觉概念[3]。GLIGEN 的出发点正是在不遗忘原有知识的前提下, 为预训练模型添加新的条件输入模态[3]。

内容

为保存预训练模型已有的概念知识, GLIGEN 冻结其全部原始权重, 只让新增的可训练层通过门控机制吸收定位信息[2]。它的具体装置是每个 Transformer 块中的门控自注意力层: 该层结构与原自注意力层相同, 额外增加一个线性投影, 把定位 token 变换到与视觉 token 相同的维度, 然后视觉 token 与定位 token 拼接后送入这一注意力层[6]。

除边界框与文本外, 同一框架还能承载参考图像、人体关键点, 以及边缘图、深度图、法线图、语义图等与空间对齐的条件图[2][6]。由于定位实体与图像描述共用同一个文本编码器, 模型即使只在 COCO 标注上训练, 也能对训练类别之外的概念作出定位[3]。

训练数据包含检测标注、检测加描述标注, 以及由 GLIP 在描述中识别名词实体生成的定位标注三类[6]。推理时可使用分步采样策略: 在扩散过程的前一部分时间步启用定位层, 其余时间步关闭, 从而在定位准确度与图像质量之间取得平衡[5]。在 COCO2014 验证集上, 以微调的 LDM 为骨干时 GLIGEN 的 FID 为 5.82, YOLO 分数 AP 为 21.7[7]。

影响与争议

后续研究指出, 门控自注意力的引入会带来说描述遗漏问题: 生成图像虽然符合给定的布局, 却可能忽略文本描述中的部分内容[8]。针对这一点, ReGround 把门控自注意力与交叉注意力由串行连接改为并行连接, 在不额外训练、不增加参数的情况下改善了文本接地, 同时保持空间定位能力[9]。

与另一类控制方法 ControlNet 相比, 有研究认为 GLIGEN 的布局保真度更好, 但对文本提示的可控程度有所下降; ControlNet 保留了基于文本的风格控制, 却更易出现物体幻觉[10]。也有工作指出, GLIGEN 采用(边界框坐标, 文本)这一实例级条件, 其收敛速度慢于空间对齐更为直接的 ControlNet[11]。

论文作者也说明, 加入新的门控自注意力层后, 生成结果的风格或美学分布可能发生偏移, 当采样参数 $\tau$ 取 1 时模型有时难以生成图形风格图像[3]。此外, 有实训项目把 Grounding DINO 的目标检测能力与 GLIGEN 的边界框条件相结合, 在指定图像区域内生成物体[12]。

参见

  • Stable Diffusion —— GLIGEN 常以冻结的 Stable Diffusion 权重作为基础模型, 在其上新增门控自注意力层。

  • ControlNet —— 另一种为文本到图像扩散模型添加空间控制的方法, 与 GLIGEN 常被并列比较。

  • 扩散模型 —— GLIGEN 建立在预训练文本到图像扩散模型之上。

  • CLIP —— GLIGEN 利用其文本与图像编码器获取定位实体的语义嵌入。

  • 目标检测 —— GLIGEN 的定位条件形式与评估指标借用了目标检测中的边界框与平均精度。

参考资料

  1. GLIGEN: . GLIGEN [引用日期2026-09-27]
  2. GLIGEN: . GLIGEN [引用日期2026-09-27]
  3. GLIGEN: Open-Set Grounded Text-to-Image Generation . nsf.gov [引用日期2026-09-27]
  4. thecvf.com 上的网页 . thecvf.com [引用日期2026-09-27]
  5. file-bc315(PDF) . wisc.edu [引用日期2026-09-27]
  6. Li_GLIGEN_Open-Set_Grounded_CVPR_2023_supplemental(PDF) . thecvf.com [引用日期2026-09-27]
  7. L16_GLIGEN(PDF) . gatech.edu [引用日期2026-09-27]
  8. ReGround: Improving Textual and Spatial Grounding at No Cost . arxiv.org [引用日期2026-09-27]
  9. **Abstract . ecva.net [引用日期2026-09-27]
  10. semanticscholar.org 上的网页 . Semantic Scholar [引用日期2026-09-27]
  11. thecvf.com 上的 PDF 文件 . thecvf.com [引用日期2026-09-27]
  12. 2021级实训项目——Text-to-Image: 文本驱动的精准图像生成 . 河北师范大学 [引用日期2026-09-27]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-27T15:03:33Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
自注意力 Stable Diffusion ControlNet Grounding DINO Stable Diffusion ControlNet 扩散模型 CLIP 目标检测
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。