大模型能力飞速迭代的今天,传统评测基准正在失效。MMLU 上的顶级模型准确率已超过 90%,GSM8K 接近满分,HumanEval 也早已不是难以企及的高峰。当"考试分数"越来越难以区分模型的真实水平,评测社区正在转向更难、更真实、更具挑战性的新一代基准。本文系统梳理 2026 年最值得关注的大模型评测基准,涵盖代码修复、数学推理、人类偏好、科学问答等多个维度。
2026/6/13大约 13 分钟
大模型能力飞速迭代的今天,传统评测基准正在失效。MMLU 上的顶级模型准确率已超过 90%,GSM8K 接近满分,HumanEval 也早已不是难以企及的高峰。当"考试分数"越来越难以区分模型的真实水平,评测社区正在转向更难、更真实、更具挑战性的新一代基准。本文系统梳理 2026 年最值得关注的大模型评测基准,涵盖代码修复、数学推理、人类偏好、科学问答等多个维度。