AGIEval 是一个面向基础模型的评测基准,题目取自高考、法学院入学考试、数学竞赛、律师资格考试等人类标准化考试,用于考察模型的通用认知与问题解决能力[1][2]。该基准由微软的研究人员于 2023 年提出,含中文与英文任务,题目限于选择题、填空题等客观题[1]。论文发表于 NAACL 2024 的 Findings 部分[2][3]。发布实验中 GPT-4 在 SAT 数学和中国高考英语上分别达到 95% 与 92.5% 的准确率,但在复杂推理与专业领域任务上偏弱[4]。
定义
AGIEval 的英文全称是 AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models,可译为「以人为本的基础模型评测基准」[2]。它属于评测数据集,做法是选取高考、法学院入学考试、数学竞赛、律师资格考试等人类标准化考试的题目,要求基础模型作答,以衡量模型在人类认知与问题解决任务上的通用能力[1][5]。题目只取客观题,包括多项选择题和填空题,主观题不在收录范围内[1]。
评测覆盖中文与英文两类任务[6]。论文作者将双语设计列为与 MMLU 的主要差别之一,理由是 MMLU 只有英文数据,评测范围局限于单一语言[6]。评分以准确率为主,既可零样本直接提问,也可给出 3 至 5 个示例作少样本提示[7][8]。
背景
在 AGIEval 之前,衡量语言模型能力的基准大多依赖人工构造的数据集,考察的是特定机器技能,而非人类在现实中面对的问题[6]。GPT-4 的技术报告虽已分析模型在若干人类考试上的成绩,但所用基准与模型输出没有公开,评分方式也不透明,其他研究者难以复现或横向比较[6]。MMLU 从网络收集多学科题目,在人类中心化的方向上更进一步,但其数据来源没有明确交代,且只包含英文[6]。
AGIEval 意在补上这一缺口:公开收集到的高标准官方试题,提供标准化的自动评测指标,并发布模型输出,供社区跟进分析[6]。论文强调,所收录的考试均由官方认可并用于衡量人类水平能力,因此模型成绩与人类决策、认知能力的对照更为直接[6]。
内容
该基准的构造遵循两条原则,一是聚焦人类级别的认知任务,二是贴近真实场景[6]。据此,作者挑选的均为官方、公开、高标准的招生与资格考试,其中不少考试每年有数百万人参加,以中国高考为例,每年参加的考生约有 1200 万[6]。
收录的考试分属普通高校入学考试、法学院入学考试、律师资格考试、研究生管理入学考试和国家公务员考试等类别[6]。科目层面,中国高考部分涵盖历史、数学、英语、语文、地理、生物、化学、物理 8 个科目,GRE 只取数学题,SAT 取英语与数学;数学竞赛类题目来自 AQuA-RAT 与 MATH[6][8]。
评测工具 EvalScope 收录的版本由 21 个子集构成,样本合计 8269 条,覆盖 LSAT 的分析推理、逻辑推理与阅读理解,SAT 数学与英语,LogiQA,JEC-QA 以及高考各科[8]。其流程对多选题子集使用统一的选项模板与答案抽取方式,对数学题和填空题采用数学等价性判定,并默认开启思维链提示[8]。
该基准已被多个评测框架收录:EleutherAI 的 lm-evaluation-harness 通过合并请求加入相关任务,并说明其聚合分数按文档数量加权,与按子任务取平均的常见口径不同[9];英国 AI 安全研究所的 Inspect Evals 也把它列为考察基础模型通用能力的人类中心基准[5][10]。此外,一些研究将 AGIEval 的子任务用作下游评测对象,例如把 LSAT 分析推理归入符号推理类任务[11]。
影响与争议
论文发布时评测了 GPT-4、ChatGPT 与 Text-Davinci-003 等模型,结果显示 GPT-4 在 SAT、LSAT 和数学竞赛上的成绩超过人类平均水平,SAT 数学准确率为 95%,中国高考英语准确率为 92.5%[4]。同一批实验也表明,GPT-4 在需要复杂推理或特定领域知识的任务上表现较弱,论文据此从理解、知识、推理和计算 4 个方面归纳模型的能力边界[12]。
此后该基准被多篇稿件引用,作为考试类任务上的通用能力对照项[3][13]。也有研究关注回答的稳定性,发现参数量最小的 Owen-2 7B 虽然在相关数据集上准确率偏低,但在 AGIEval 上的一致性率最高,为 95.8%,说明准确率与一致性并不同步[14]。
相关争议集中在数据污染。由于试题出自公开发布的考试,模型在训练阶段可能已经接触过题目,评测分数存在被高估的可能;有研究因此改用非公开的校内考试题以降低污染,并把 AGIEval 一类聚合基准视为需要谨慎解读的参考[15]。也有工作在特定设置下不支持将 AGIEval 用于主要结论:某项研究因所使用的上下文学习锚点在 3 个任务上均不如直接提示,把 AGIEval 排除在主实验之外,只保留其作为诊断性任务[16]。
参见
参考资料
- 2025.findings-emnlp.465(PDF) . aclanthology.org [引用日期2026-09-27]
- [19] W . ieee.org [引用日期2026-09-27]
- Haozhen Zhang, Tao Feng, Pengrui Han, and Jiaxuan You . aclanthology.org [引用日期2026-09-27]
- aclanthology.org 上的网页 . aclanthology.org [引用日期2026-09-27]
- github.io 上的网页 . GitHub Pages [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- AGIEval | EvalScope - Skip to content . readthedocs.io [引用日期2026-09-27]
- github.com 上的网页 . github.com [引用日期2026-09-27]
- Inspect Evals . GitHub Pages [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- InternLM(PDF) . githubusercontent.com [引用日期2026-09-27]
- Non-Greedy Inference . aclanthology.org [引用日期2026-09-27]
- 2025.coling-main.413(PDF) . aclanthology.org [引用日期2026-09-27]
- AGIEval anchor diagnostic and rebuild check . arxiv.org [引用日期2026-09-27]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-27T15:44:19Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。