Grounded Generation

关注
义项:基于依据的生成

Grounded Generation(基于依据的生成)指让生成式模型在输出文本时以外部提供的信息为依据,使回答中的陈述能够被检索到的文档、知识库条目或搜索结果支撑,而不是仅凭训练阶段学到的参数化知识作答。[1][2] 它把外部证据作为生成的条件,因此可以引入训练数据之外、甚至模型知识截止日期之后的信息,用于降低幻觉并让答案可核验,常与检索增强生成配合使用。[3][1] 相关研究还使用接地文本生成、知识接地对话等称呼。[4][5]

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

Grounded Generation 是一类文本生成方法:模型在输出内容时以外部给出的证据为依据,使生成文本中的陈述能够由这些证据支撑,而不是只依靠训练阶段储存在参数里的知识。[1][2] 这里的依据可以是检索得到的网页与文档、知识库条目,也可以是一段给定的对话历史或一篇长文档。[1][6] 生成过程通常被形式化为在输入 x 与依据集合 Z 的条件下求输出 y 的概率,即 P(y | x, Z);依据既充当条件,也可以在输出中转化为供人核验的引用。[7][8]

在基于依据的生成中,依据并不等同于答案:模型仍要从依据里筛选信息并组织成连贯文字,但输出不应与依据矛盾,也不应加入依据没有蕴含的内容。[2] 这类方法通常与检索增强生成配合:后者负责取出相关段落,前者负责在段落约束下写作并给出引用。[1][3]

原理

典型的基于依据的生成系统包含三个环节:先确定依据,再在依据的约束下生成,最后为输出补上归属或引用。[9][10] 第一步既可以是系统按固定流程预先检索,也可以由模型自行判断是否必须检索,并自动生成一条或多条查询词。[10]

RetGen 是较早把检索与生成联合建模的框架。它先用稠密文档检索器从参考语料中取回文档,再由多文档生成器按文档级注意力权重融合这些文档,以类似专家混合的方式给出单一预测;训练不要求“文本—文档”平行标注,因此可以直接在既有语料上训练。[7]

《Attribute First, then Generate》把生成拆成内容选择、句子规划和逐句生成三个步骤:先挑出相关的源片段,再以这些片段为条件逐句写作,被选中的片段同时成为该句的细粒度归属,也就是“选择”即“归属”。该方法在多文档摘要与长文问答任务上给出的引用比基线更简练,人工核查所需的时间也明显缩短。[8]

在工程实现上,Google 的接地接口把整个过程自动化:模型先分析提示并判断是否需要搜索,必要时生成一条或多条查询,随后处理搜索结果并合成回答;返回结果带有接地元数据,其中列出检索到的来源,以及把回答文本片段与来源对应起来的支撑信息,开发者据此渲染行内可点击引用。[10][11] 该接口还提供动态检索配置,用阈值决定何时才真正发起检索,以控制成本与延迟。[12][1]

发展历程

早期把生成内容落到外部知识上的做法多依赖结构化来源,例如关系型知识库与知识图谱,用于对话生成等任务;也有工作直接使用非结构化的原始文本作为依据,从而不必预先构建图结构。[7] 2020 年发表的一项知识增强文本生成综述,把基于背景的对话(Background Based Conversation,又称 grounded conversation)列为当时的新兴方向。[5]

2020 年,微软研究院的一篇论文提出 Grounded Text Generation 框架,主张用深度学习与机器教学相结合的混合方式构建任务型对话机器人,使回复建立在任务规则与知识库之上,并以任务完成度作为优化目标。[4] 同年,Lewis 等人提出检索增强生成,把参数化记忆(一个预训练的序列到序列模型)与非参数化记忆(维基百科段落的稠密向量索引)结合起来,在多项知识密集型任务上取得当时的最好结果,并指出这条路线有利于为模型决策提供出处。[3]

2021 年,发表于 AAAI 的 RetGen 把文档检索器与多文档接地生成器端到端联合训练,用语言模型信号反过来优化检索器。[7] 同年,卡内基梅隆大学的研究者讨论文档接地生成,提出面向给定文档的表示与注意力方法,并在维基百科更新生成等任务上检验模型输出是否真正落在文档之中。[6]

2022 年 10 月 26 日公开的欧洲专利 EP4078472A1“可控接地文本生成”描述了一个包含机器学习模型、接地接口与控制接口的框架:模型通过接地接口访问与输入相关的信息源,并依据控制信号调节生成内容的侧重。[13] 2023 年前后,研究重心转向归属与引用。2023 年 11 月发布的《A Survey of Large Language Models Attribution》梳理了归属机制,把生成内容的归属分为模型直接给出归属、检索后作答、生成后再归属三类,并指出知识来源含糊、固有偏置以及引用过多等问题会影响系统效果。[14][15] 该综述列举的系统与数据集还包括 2021 年的 WebGPT、2022 年的 GopherCite,以及 2023 年 5 月的 ALCE。

2024 年,ACL 收录的《Attribute First, then Generate》提出局部可归属的生成方法,用更精细的引用替代整篇文档级别的引用。[8] 在工程侧,Google Cloud 的 Discovery Engine 提供了接地生成服务,其中包含生成接地内容、流式生成接地内容以及执行接地检查等方法,相关.NET 客户端文档在 2025 年 6 月 5 日更新;其示例代码演示了以 Gemini 模型配合 Google 搜索作为接地来源,并可配置动态检索。[16][12]

应用

最常见的落地形态是带引用的生成式搜索与问答:把模型与实时网页内容连接,可以回答知识截止日期之后的问题,并在回答中标注来源。[10][11] 在企业场景中,依据可以替换为内部资料库,使模型能够回答其训练数据中并不存在的私有问题。[1][12]

在研究与产品中,基于依据的生成被用于知识接地对话、基于文档的对话、多文档摘要、长文问答与数据到文本等任务;多文档摘要与长文问答还常被用来评估引用是否简洁且准确。[2][8][6]

另一类应用是让回答对应结构化数据或受控规则,例如专利文献中描述的可控接地生成框架,通过接地接口引入信息源,并用控制信号限定生成内容的方向。[13] 此外,接地内容也可以来自地图、评价等特定数据源,返回结果会区分网页、检索上下文与地图等不同来源类型的证据片段。[17]

局限

接地能够减少幻觉,但不能消除幻觉。模型可能给出看似有据、实际却得不到引用来源支持的断言;当检索结果为空时,也可能不理会“没有依据就弃答”的指令,转而凭记忆作答;此外还存在过度照抄原文、带来出处与版权问题的风险。对引用逐条抽查,被视为这类系统最重要的质量检查之一。[9]

有综述指出,检索本身并不等于归属,模型内部知识与检索到的外部信息之间可能发生冲突;归属还可能存在知识来源含糊、固有偏置与引用过多等缺陷,引用更多并不必然更可信。[14][15] 该综述转述的统计显示,四项生成式搜索引擎生成的内容中只有 51.5% 完全得到其引用文献的支持;医学与法律领域的归属不完整比例分别为 35% 和 31%,另有许多引用被专家判定来自不可靠来源。[15]

对幻觉的区分也说明了接地的边界:与依据直接矛盾的情形称为内在幻觉,既不被依据蕴含、也不被依据否定的情形称为外在幻觉;模型即使借助潜在知识补全了一个正确事实,只要该事实未被依据蕴含,仍属于不被依据支持的内容。[2]

评估上,这类系统需要按流水线分别考察检索与生成:检索侧看相关段落的召回率与准确率,生成侧看忠实性(即答案中的每个断言能否由检索到的文本支持)、答案相关性与上下文相关性,并单独测量系统在语料无法回答时是否正确地弃答。[9]

参见

  • 检索增强生成 —— 先从外部语料取回相关段落再生成,是依据的主要来源之一。

  • 大语言模型 —— 基于依据的生成当前主要的实现载体。

  • 幻觉(人工智能) —— 生成内容与事实或依据不符的现象,是接地方法试图缓解的问题。

  • 知识图谱 —— 早期接地生成使用的一类结构化依据来源。

  • 文本摘要 —— 多文档摘要常被用作检验接地生成引用质量的任务。

  • 提示工程 —— 通过提示约束模型只用给定材料作答的常用手段。

参考资料

  1. README . github.com [引用日期2026-09-29]
  2. columbia.edu 上的文件 . columbia.edu [引用日期2026-09-29]
  3. poster_6b493230205f780e1bc26945df7481e5 . neurips.cc [引用日期2026-09-29]
  4. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
  5. microsoft.com 上的 PDF 文件 . microsoft.com [引用日期2026-09-29]
  6. cmu.edu 上的网页 . cmu.edu [引用日期2026-09-29]
  7. aaai.org 上的文件 . aaai.org [引用日期2026-09-29]
  8. research.google 上的网页 . research.google [引用日期2026-09-29]
  9. 03-grounded-generation-and-eval . github.com [引用日期2026-09-29]
  10. 使用 Google 搜索建立依据 | Gemini API | Google AI for Developers . google.dev [引用日期2026-09-29]
  11. google-search . google.dev [引用日期2026-09-29]
  12. genappbuilder-grounded-generation-google-search . google.com [引用日期2026-09-29]
  13. Title (en) . epo.org [引用日期2026-09-29]
  14. Paper page - A Survey of Large Language Models Attribution . huggingface.co [引用日期2026-09-29]
  15. huggingface.co 上的网页 . huggingface.co [引用日期2026-09-29]
  16. Google.Cloud.DiscoveryEngine.V1.GroundedGenerationService . google.com [引用日期2026-09-29]
  17. GroundingMetadata . google.com [引用日期2026-09-29]
词条评价
词条统计

浏览次数:1 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:51:30Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
检索增强生成 维基百科 检索增强生成 大语言模型 幻觉(人工智能) 知识图谱 文本摘要 提示工程
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。