MMLU是「大规模多任务语言理解」(Massive Multitask Language Understanding)的缩写,是人工智能领域用于评估大语言模型综合知识与推理能力的基准测试。它由丹·亨德里克斯等研究者于2020年发布,包含约15908道四选一选择题,覆盖STEM、人文学科、社会科学等57个学科,难度从初级延伸到专业水平。[1][2] 该基准以零样本和少样本方式测试模型在预训练阶段获得的知识,一度成为比较大模型能力最常用的评测工具之一。[3] 随着顶尖模型成绩趋近人类专家水平,其区分度下降,研究者又提出了多个衍生基准。[4]
定义
MMLU是一套由多项选择题构成的多任务测试集,用来衡量文本模型的知识广度与解题能力。它的题目涵盖初等数学、美国历史、计算机科学、法律等57个任务,模型要在这些任务上取得高分,必须具备广泛的世界知识和问题求解能力。[5][2]
按学科归类,57个任务被划分为STEM、人文学科、社会科学和其他四大类,具体科目包括抽象代数、解剖学、天文学、商业伦理、临床知识、国际法、法理学、机器学习、道德情景、营养学、哲学、专业会计、专业医学、病毒学、世界宗教等。[2] 官方统计的全套题目为15908道,其中1540道用于挑选和评估模型的最优设置,如温度、批处理规模和学习率;也有资料按测试集口径给出14042道或约14079道的样本数。[1][6]
基准最初被设计得比通用语言理解评估(GLUE)等既有测试更具挑战性,因为许多模型在较简单的测试上已经超过人类水平。[1] 到2024年7月,它的下载量已超过1亿次。[1]
原理
MMLU的题型是四选一的多项选择题,输入为题干和A、B、C、D四个选项,输出为正确选项的字母。若模型完全随机作答,期望正确率约为25%,即 $P = 1/4$;因此高分意味着模型必须在知识储备和推理上均明显优于猜测。[7][8]
评测通常在零样本或少样本设置下进行,也就是不针对具体题目微调模型,只在提示中给出0个或若干条示例,再要求模型作答。由于不依赖额外的下游训练,这一设置更接近衡量预训练阶段积累的知识。[3]
常见做法是给每道题附上若干条固定示例,例如开发集中选取5条,再按类别或学科聚合准确率。部分评测框架还支持在提示中要求模型先逐步思考再给出答案,即思维链提示,用以提升推理类题目的表现。[7] 原始实现中还有一类做法是直接比较模型对四个选项字母的预测概率,取概率最高者作为答案。
发展历程
该基准由丹·亨德里克斯与科林·伯恩斯、史蒂文·巴沙特、安迪·邹、曼塔斯·马泽卡、宋晓冬、雅各布·斯坦哈特等人共同完成,论文于2021年发表在国际学习表征会议(ICLR)上,数据集在2020年前后公开。[2][9]
发布之初,多数语言模型的成绩仅略高于随机水平,表现最好的GPT-3 1750亿参数版本(少样本设置)平均准确率约为43.9%,而基准创建者估计人类领域专家可达到约89.8%。[1][2] 论文作者同时指出,当时模型在道德、法律等社会重要科目上的表现仍接近随机,且经常无法判断自己是否答错。[5]
此后数年,MMLU逐渐成为模型发布报告中的常见评测项。到2024年年中,Claude 3.5 Sonnet、GPT-4o、Llama 3.1 405B等模型在该基准上稳定达到约88%。[1] 由于高分模型日益密集、区分度下降,MMLU在2025年前后已部分被更难的替代基准取代。[4]
应用
MMLU广泛用于衡量大模型的跨学科知识广度,是模型能力报告中的标准科目之一。评测工具链普遍将其纳入内置数据集,例如OpenCompass框架将MMLU作为英文多学科多选题基准,并支持按学科或大类分别统计结果。[10][7]
研究者还以MMLU为基础衍生出多个变体。MMLU-Pro由TIGER Lab在2024年提出,包含12032道题,选项由4个扩展到10个,以降低猜对概率并突出多步推理;MMMLU是多语言版本,MMLU-Redux则对原题进行了人工复核与纠错。[11][1]
在MMLU-Pro上,GPT-4o的准确率约为72.6%,GPT-4-Turbo约为63.7%,两者差距从MMLU上的约1个百分点扩大到约9个百分点,说明新版本在区分度上更强;同时思维链提示对MMLU-Pro有明显增益,对原版MMLU反而可能造成下降。[11] 此外,也有研究者基于公开数据源构建去污染版本,将题目分为开源验证集与闭源测试集,以缓解数据泄露带来的评估失真。
局限
题目本身存在标注错误。2024年6月5日发表的一篇论文对基准中5700道题做了人工分析,发现「病毒学」子集中有57%的题目存在问题,包括存在多个正确答案(4%)、表述不清(14%)或答案完全错误(33%)。[1][12] 研究者估算,整体约6.5%的题目存在错误,这意味着即使模型完美作答,可达到的最高分也明显低于100%。[4]
数据污染构成另一项威胁。由于题目与答案公开,开发者可以较容易地将其纳入训练数据,从而在实际上削弱基准的有效性。[4] 评测流程缺乏统一标准,不同开发者使用的提示与少样本设置可能不同,也增加了模型之间横向比较的难度。[12]
四选一的形式本身带来局限。随机作答即有约25%的正确率,低分模型的真实能力可能比分数所显示的更弱;题目以英文和西方文化背景为主,不能直接用来评估中文或其他语言环境下的知识。 此外,随着顶尖模型成绩接近饱和,该基准区分先进模型的能力已明显下降。[13]
参见
参考资料
- MMLU . org. [引用日期2026-10-04]
- Measuring Massive Multitask Language Understanding . githubusercontent.com [引用日期2026-10-04]
- Model for MMLU quiz¶ . nist.gov [引用日期2026-10-04]
- MMLU . wikipedia.org [引用日期2026-10-04]
- Measuring Massive Multitask Language Understanding . mlanthology.org [引用日期2026-10-04]
- 2026.tacl-1.9(PDF) . aclanthology.org [引用日期2026-10-04]
- MMLU | EvalScope - Skip to content . readthedocs.io [引用日期2026-10-04]
- MEASURING MASSIVE MULTITASK LANGUAGE UNDERSTANDING (MMLU) . toronto.edu [引用日期2026-10-04]
- BAAI/mmlu - 鲸智社区·大模型公共服务平台 . caict.ac.cn [引用日期2026-10-04]
- mmlu - question-answering数据集 . caict.ac.cn [引用日期2026-10-04]
- neurips.cc 上的 PDF 文件 . neurips.cc [引用日期2026-10-04]
- MMLU benchmark . systems-analysis.ru [引用日期2026-10-04]
- neurips.cc 上的 PDF 文件 . neurips.cc [引用日期2026-10-04]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-03T18:19:14Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。