跨语言知识迁移

关注
义项:跨语言迁移方法

跨语言知识迁移(Cross-lingual Transfer Learning)是自然语言处理中迁移学习的一类方法,其目标是把在一种或多种源语言上学习到的模型参数、文本表示或标注知识转移到目标语言的任务上,使标注数据稀缺甚至完全缺失的语言也能获得可用的效果[1]。它建立在不同语言共享语义与句法结构的假设之上,通常借助多语言预训练模型或语言之间的对齐关系实现,是低资源语言处理的重要技术路线[2]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

跨语言知识迁移指模型把从源语言获得的知识转移到目标语言,用于完成目标语言的下游任务,所迁移的知识可以是模型参数、文本表示,也可以是源语言提供的标注信息[1]。当源语言拥有标注数据、目标语言完全没有标注时,这种设置称为零样本跨语言迁移;若目标语言还有少量标注样本可用于进一步微调,则称为少样本跨语言迁移[1]。

在自然语言处理中,跨语言迁移常被用来把资源丰富语言上的监督信号引向低资源语言,从而减少为每种语言重新构建标注语料与模型的成本[2]。与之相关的零样本学习、参数适配与表示对齐等技术,都是实现这一目标的具体手段[3]。

原理

跨语言迁移能够成立,前提是不同语言在语义、句法与任务决策层面存在可共享的结构。多语言模型在共享参数与共享子词词表的条件下联合训练,因而可能形成跨语言的通用表示[4]。探测实验显示,多语言 BERT 可以在书写系统完全不同的语言之间迁移:仅用乌尔都语的词性标注数据微调,模型在印地语测试上达到 91% 的准确率,说明其能力并非单纯的词汇记忆[4]。不过这种迁移在语言类型相近的语言对之间效果更好[4]。

实践中较常见的做法是先用源语言标注数据微调多语言模型,再把模型直接用于目标语言而不做额外微调[1]。另一类做法借助机器翻译:把源语言训练集译成目标语言后再微调,称为 translate-train;把目标语言测试集译成源语言后在源语言侧推理,称为 translate-test[1]。


graph LR

A[源语言标注数据] --> B[微调多语言模型]

B --> C[目标语言任务评估]

发展历程

2013 年出现了最早的跨语言词嵌入模型。研究者发现,两种语言的单语词向量空间具有相似的几何构型,互为译文的词落在彼此对应的位置上,由此产生了把一种语言的嵌入空间映射到另一种语言空间的投影技术[2]。

此后文献把相关方法归为若干类:可选用双语词典作为等价信号的离线线性投影模型、通过构造伪语料训练的伪跨语言模型、以平行语料优化目标函数的跨语言模型、兼顾语言内部语义的联合目标跨语言模型,以及通过联合训练与共享子词词表隐式获得共享空间的大规模预训练多语言模型[2]。

2018 年,XNLI 语料库把 MultiNLI 的开发集与测试集扩展到 15 种语言,其中包含斯瓦希里语、乌尔都语等低资源语言,成为跨语言句子表示与语言迁移的评测基准[5]。

2019 年前后,多语言预训练模型成为该方向的主流。以 104 种语言单语语料共同预训练的多语言 BERT 表现出较强的零样本跨语言迁移能力[4]。XLM 在预训练阶段引入平行语料的跨语言目标,XLM-R 则依赖单语语料训练,二者代表了两种不同的技术路线[1]。

近五年来,大语言模型背景下的研究转向自蒸馏、基于翻译的方法和提示微调等策略,并更多关注低资源语言支持与多语言表示学习[3]。

应用

在语言理解任务中,自然语言推理、文档分类、命名实体识别、词性标注与依存句法分析都可以借助跨语言迁移,在缺少目标语言标注的条件下完成[6]。一项覆盖 39 种语言、5 类任务的实验发现,多语言 BERT 的零样本迁移表现与当时已发表的方法相当[6]。

在知识图谱构建中,跨语言迁移被用于从其他语言获取监督信号或知识,涉及命名实体识别、关系抽取、指代消解与实体链接等子任务,并可借助多语言词嵌入、预训练语言模型与大语言模型提升效果。

跨语言迁移也用于双语任务,例如词对齐与跨语言句子检索。多语言模型即使只用单语语料训练也能产生质量较高的词对齐,但句子级检索通常还需要在平行语料上做对比学习或微调才能达到可用水平[7]。

对于缺乏标注数据的低资源语言,跨语言迁移被视为替代昂贵人工标注的一条途径,其效果直接决定了这些语言能否使用现有的语言技术[2]。

局限

跨语言迁移的效果一般低于在目标语言上直接进行有监督训练;在多数情形下,多语言模型的零样本迁移也不及 translate-train 或 translate-test 基线[7]。

迁移效果受语言相似度影响:源语言与目标语言共享词汇、语序一致或语言类型接近时更容易迁移,差异过大时可能出现负迁移[1]。语言相似度本身可以用世界语言结构图册等类型学资源或语言向量工具来度量,但不同研究给出的结论并不完全一致[1]。

多语言模型还面临被称为「多语言的诅咒」的容量稀释问题:模型容量需要在众多语言之间分配,导致高资源语言上的表现通常低于对应的单语模型,低资源语言的差距更大[7]。

语言之间的数据不平衡与由此产生的偏见、大规模多语言数据集的缺乏以及评价指标不够稳健,同样是当前尚未解决的问题[3]。

参见

  • 迁移学习 —— 跨语言知识迁移是迁移学习在语言维度上的具体形式。

  • 多语言预训练模型 —— 当前实现跨语言迁移的主要载体。

  • 零样本学习 —— 目标语言完全没有标注数据时的迁移设置。

  • 词嵌入 —— 早期跨语言迁移通过词向量空间的对齐来实现。

  • 机器翻译 —— 基于翻译的数据转换是跨语言迁移的常用手段。

  • 知识图谱 —— 跨语言迁移被用于多语言知识图谱的构建。

参考资料

  1. 2023.acl-long.323(PDF) . aclanthology.org [引用日期2026-09-29]
  2. S2949719125000330 . sciencedirect.com [引用日期2026-09-29]
  3. techrxiv.org 上的网页 . techrxiv.org [引用日期2026-09-29]
  4. How Multilingual is Multilingual BERT? . aclanthology.org [引用日期2026-09-29]
  5. The Cross-Lingual NLI Corpus (XNLI) . nyu.edu [引用日期2026-09-29]
  6. aclanthology.cn 上的网页 . aclanthology.cn [引用日期2026-09-29]
  7. Summary . acm.org [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:47:20Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
零样本学习 知识图谱 迁移学习 多语言预训练模型 零样本学习 词嵌入 机器翻译 知识图谱
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。