AGIEval

关注
义项:AI基准评测数据集

AGIEval 是一个面向基础模型的评测基准,题目取自高考、法学院入学考试、数学竞赛、律师资格考试等人类标准化考试,用于考察模型的通用认知与问题解决能力[1][2]。该基准由微软的研究人员于 2023 年提出,含中文与英文任务,题目限于选择题、填空题等客观题[1]。论文发表于 NAACL 2024 的 Findings 部分[2][3]。发布实验中 GPT-4 在 SAT 数学和中国高考英语上分别达到 95% 与 92.5% 的准确率,但在复杂推理与专业领域任务上偏弱[4]。

百科 图文
目录
  1. 定义
  2. 背景
  3. 内容
  4. 影响与争议
  5. 参见

定义

AGIEval 的英文全称是 AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models,可译为「以人为本的基础模型评测基准」[2]。它属于评测数据集,做法是选取高考、法学院入学考试、数学竞赛、律师资格考试等人类标准化考试的题目,要求基础模型作答,以衡量模型在人类认知与问题解决任务上的通用能力[1][5]。题目只取客观题,包括多项选择题和填空题,主观题不在收录范围内[1]。

评测覆盖中文与英文两类任务[6]。论文作者将双语设计列为与 MMLU 的主要差别之一,理由是 MMLU 只有英文数据,评测范围局限于单一语言[6]。评分以准确率为主,既可零样本直接提问,也可给出 3 至 5 个示例作少样本提示[7][8]。

背景

在 AGIEval 之前,衡量语言模型能力的基准大多依赖人工构造的数据集,考察的是特定机器技能,而非人类在现实中面对的问题[6]。GPT-4 的技术报告虽已分析模型在若干人类考试上的成绩,但所用基准与模型输出没有公开,评分方式也不透明,其他研究者难以复现或横向比较[6]。MMLU 从网络收集多学科题目,在人类中心化的方向上更进一步,但其数据来源没有明确交代,且只包含英文[6]。

AGIEval 意在补上这一缺口:公开收集到的高标准官方试题,提供标准化的自动评测指标,并发布模型输出,供社区跟进分析[6]。论文强调,所收录的考试均由官方认可并用于衡量人类水平能力,因此模型成绩与人类决策、认知能力的对照更为直接[6]。

内容

该基准的构造遵循两条原则,一是聚焦人类级别的认知任务,二是贴近真实场景[6]。据此,作者挑选的均为官方、公开、高标准的招生与资格考试,其中不少考试每年有数百万人参加,以中国高考为例,每年参加的考生约有 1200 万[6]。

收录的考试分属普通高校入学考试、法学院入学考试、律师资格考试、研究生管理入学考试和国家公务员考试等类别[6]。科目层面,中国高考部分涵盖历史、数学、英语、语文、地理、生物、化学、物理 8 个科目,GRE 只取数学题,SAT 取英语与数学;数学竞赛类题目来自 AQuA-RAT 与 MATH[6][8]。

评测工具 EvalScope 收录的版本由 21 个子集构成,样本合计 8269 条,覆盖 LSAT 的分析推理、逻辑推理与阅读理解,SAT 数学与英语,LogiQA,JEC-QA 以及高考各科[8]。其流程对多选题子集使用统一的选项模板与答案抽取方式,对数学题和填空题采用数学等价性判定,并默认开启思维链提示[8]。

该基准已被多个评测框架收录:EleutherAI 的 lm-evaluation-harness 通过合并请求加入相关任务,并说明其聚合分数按文档数量加权,与按子任务取平均的常见口径不同[9];英国 AI 安全研究所的 Inspect Evals 也把它列为考察基础模型通用能力的人类中心基准[5][10]。此外,一些研究将 AGIEval 的子任务用作下游评测对象,例如把 LSAT 分析推理归入符号推理类任务[11]。

影响与争议

论文发布时评测了 GPT-4、ChatGPT 与 Text-Davinci-003 等模型,结果显示 GPT-4 在 SAT、LSAT 和数学竞赛上的成绩超过人类平均水平,SAT 数学准确率为 95%,中国高考英语准确率为 92.5%[4]。同一批实验也表明,GPT-4 在需要复杂推理或特定领域知识的任务上表现较弱,论文据此从理解、知识、推理和计算 4 个方面归纳模型的能力边界[12]。

此后该基准被多篇稿件引用,作为考试类任务上的通用能力对照项[3][13]。也有研究关注回答的稳定性,发现参数量最小的 Owen-2 7B 虽然在相关数据集上准确率偏低,但在 AGIEval 上的一致性率最高,为 95.8%,说明准确率与一致性并不同步[14]。

相关争议集中在数据污染。由于试题出自公开发布的考试,模型在训练阶段可能已经接触过题目,评测分数存在被高估的可能;有研究因此改用非公开的校内考试题以降低污染,并把 AGIEval 一类聚合基准视为需要谨慎解读的参考[15]。也有工作在特定设置下不支持将 AGIEval 用于主要结论:某项研究因所使用的上下文学习锚点在 3 个任务上均不如直接提示,把 AGIEval 排除在主实验之外,只保留其作为诊断性任务[16]。

参见

  • MMLU —— 以学科知识为主的大语言模型评测基准,AGIEval 在论文中与其作过对比

  • 思维链 —— AGIEval 部分子集在评测时默认采用的提示方式

  • 高考 —— AGIEval 中文子题目的主要来源之一

  • 大语言模型 —— AGIEval 的主要评测对象

  • 通用人工智能 —— AGIEval 的提出以衡量向该目标推进的进展为背景

参考资料

  1. 2025.findings-emnlp.465(PDF) . aclanthology.org [引用日期2026-09-27]
  2. [19] W . ieee.org [引用日期2026-09-27]
  3. Haozhen Zhang, Tao Feng, Pengrui Han, and Jiaxuan You . aclanthology.org [引用日期2026-09-27]
  4. aclanthology.org 上的网页 . aclanthology.org [引用日期2026-09-27]
  5. github.io 上的网页 . GitHub Pages [引用日期2026-09-27]
  6. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  7. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  8. AGIEval | EvalScope - Skip to content . readthedocs.io [引用日期2026-09-27]
  9. github.com 上的网页 . github.com [引用日期2026-09-27]
  10. Inspect Evals . GitHub Pages [引用日期2026-09-27]
  11. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  12. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
  13. InternLM(PDF) . githubusercontent.com [引用日期2026-09-27]
  14. Non-Greedy Inference . aclanthology.org [引用日期2026-09-27]
  15. 2025.coling-main.413(PDF) . aclanthology.org [引用日期2026-09-27]
  16. AGIEval anchor diagnostic and rebuild check . arxiv.org [引用日期2026-09-27]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-27T15:44:19Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
MMLU 思维链 GPT-4 MMLU 思维链 高考 大语言模型 通用人工智能
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。