中期训练是大语言模型训练流程中位于预训练与后训练之间的一个阶段。它从已有的预训练检查点出发,用更专门的数据继续做下一词元预测,以增强数学、代码、推理与长上下文等特定能力,同时保留通用能力。国际商业机器公司(IBM)的大规模对照实验显示,中期训练对推理能力的提升可达 3 至 4 倍,而跳过它、仅依靠强化学习的模型提升有限。[1]
定义
中期训练(Mid-training)指大语言模型训练流程中介于预训练与后训练之间的一个或多个中间阶段。在这一阶段,模型从已有的预训练检查点出发继续训练,沿用与预训练相同的下一词元(token)预测目标,但把训练分布收窄到目标语言、领域或能力,并保留一部分通用数据。[2]
有综述为中期训练给出正式定义,认为它是借助中间阶段的数据与算力,系统增强数学、代码、推理、长上下文等指定能力、同时维持基础能力的开发阶段。[3] 其数据量级介于两端之间:预训练语料可达数万亿词元,而开源模型的资料给出的中期训练规模为百亿至千亿词元,并称该阶段约占总训练计算量的 5% 至 10%。[4]
由于术语尚未完全统一,有些团队把中期训练视为预训练的后半程,也有人用继续预训练或领域自适应预训练来称呼做法相近的环节。[5]
原理
中期训练沿用预训练的下一词元预测目标,其损失函数形如 $L(\theta) = -\sum_{t=1}^{|x|} \log p_\theta(x_t \mid x_{<t})$;与预训练不同的是,它把数据分布收窄到目标领域,同时混入一部分通用语料,以在获得专门能力的同时抑制对原有能力的遗忘。[2]
它与继续预训练并不等同:继续预训练通常彻底转向领域数据,可能损失通用能力;中期训练在中途始终保持混合分布,因此被视为一种粗粒度的课程学习,即对不同数据分布而非单条样本进行排序。[6]
常见的中期训练由数据配方、学习率调度与长上下文扩展 3 个要素构成,有综述据此建立了分类体系。[7] 有研究从梯度噪声尺度、信息瓶颈与课程学习 3 个角度解释它为何能促进泛化。[8]
flowchart LR
A[预训练] --> B[中期训练]
B --> C[后训练:监督微调与强化学习]
国际商业机器公司的对照实验显示,中期训练会改写模型 90% 以上的权重,而强化学习阶段只调整约 5% 的参数,两者作用机制不同、无法相互替代。[9]
发展历程
中期训练的实践雏形可追溯至 2024 年,当时并未使用这一名称:一些开发者在预训练末尾加入冷却步骤,用来扩展模型的上下文长度与工作记忆;另一些则在后训练阶段加入数据退火,把高质量领域知识注入模型。[1]
现在所说的中期训练同时包含数据退火与上下文长度扩展,位置在预训练与后训练之间。[1] IBM 的研究团队在 Granite、Mistral、Meta 的 LLaMA 与 NVIDIA 的 Nemotron-H 等 4 个模型系列、30 亿至 240 亿参数规模的模型上完成 500 多项对照实验,并把相关流程开源、用于下一代 Granite 模型。[9]
2025 年 10 月起,多篇中期训练综述相继公开,提出统一术语与分类框架,并指出该阶段已在多个前沿系统中广泛使用。[3][8] 在开源实践中,艾伦人工智能研究所(Ai2)的 OLMo 2 把专门的数据混合引入预训练退火阶段,并公开中间检查点与完整配方;MiniCPM 的开发者也较早详细描述了两阶段调度。[10]
此后相关研究扩展到更多场景。韩国的 KORMo 把中期训练拆成两个子阶段,分别用长上下文数据与高难度推理数据提升常识检索能力与精确推理能力。[11] 卡内基梅隆大学的团队用可控实验分离预训练、中期训练与强化学习的各自作用,发现在固定算力预算下,把部分算力分配给中期训练优于全部投入强化学习。[12]
应用
最直接的用途是强化数学、代码与科学推理。国际商业机器公司的实验显示,把中期训练的数据配方从数学与代码扩展为数学、代码与科学,可使整体推理得分平均提高 3 至 6 分;在 GPQA-Diamond 基准上,经过科学数据中期训练的模型比用同样数据做微调者高出 17 至 28 分。[1] 以 Granite-3.3-8B 为例,其在 MATH500 上的通过率由预训练后的 16.9% 升至中期训练后的 75.5%,再经强化学习达到 79.5%。[1]
长上下文扩展是另一类常见用途。通过在中期训练中引入长文档课程,模型可以在不重启预训练的前提下更好地处理跨文档、跨文件与长对话所要求的长距离依赖。[7]
中期训练也被用于培养智能体行为。daVinci-Dev 面向软件工程开展智能体式中期训练,用 731 亿词元让模型适应在真实代码库中浏览、修改与测试,其 32B 与 72B 模型在 SWE-Bench Verified 上的解决率分别为 56.1% 与 58.5%。[13] 面向工具调用的 MidTool 则在中期训练阶段训练模型识别工具能力、从上下文提取参数、编排多步调用,并在信息不完整时进行恢复。[14]
在推理密集型场景中,Meta 的 Thinking Mid-training 先用标注模型为预训练数据补充交错思考,再以监督微调与强化学习两步进行中期训练,使模型在进入常规后训练之前就具备推理基础。[15]
局限
中期训练无法替代后训练。跳过这一阶段、改由强化学习获取同样数学与科学知识的模型,性能提升较为有限;中期训练擅长建立能力,强化学习擅长在此基础上进一步优化行为。[1]
效果高度依赖数据配方。数据配比在中期训练阶段的影响明显大于强化学习阶段,在后者中做同样的数据构成调整几乎看不到收益。[1] 有研究还观察到,随着数据源混合比例变化,模型的最优响应会在不同数据源之间突变式切换,而非平滑过渡,且关键混合比例随模型规模变化,调参需要按规模动态调整。[16]
中期训练可能损害预训练获得的通用能力,研究中常用域外基准的分数变化来衡量这种遗忘,因此实践中需要同时监控目标领域与通用能力两类指标。[10] 在获取新领域能力方面,LoRA 等适配器方法明显弱于全参数训练,提高秩也难以弥合差距,只是遗忘更少。[10]
面向智能体的中期训练需要大规模数据与算力,资源门槛较高,这也是该方向长期研究不足的原因之一。[13]
参见
参考资料
- Mid-training is essential for LLM reasoning, IBM study shows . ibm.com [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- chapter11_数据工程 . github.com [引用日期2026-09-29]
- chapter8 . github.com [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- Mid-Training of Large Language Models: A Survey . arxiv.org [引用日期2026-09-29]
- Daily Papers . huggingface.co [引用日期2026-09-29]
- 额外训练步骤如何释放AI的推理能力 . zhiding.cn [引用日期2026-09-29]
- A Practitioner’s Guide to Mid-Training Language Models . odsc.ai [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- 研究实锤:盲目「堆数据、算力」是真错了!这才是LLM训练的正确打开方式 . baai.ac.cn [引用日期2026-09-29]
- icml.cc 上的网页 . icml.cc [引用日期2026-09-29]
- MidTool: Mid-training Data Synthesis for Agentic Tool Use . baai.ac.cn [引用日期2026-09-29]
- github.io 上的网页 . github.io [引用日期2026-09-29]
- SQZ Talk | 第35期—专题报告“大语言模型训练中期与训练后的数据优化” . sqz.ac.cn [引用日期2026-09-29]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:46:26Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。