在前面的文章中,我们分别介绍了 lm-evaluation-harness 和 OpenCompass 两个评测框架的设计理念和核心功能。本文将聚焦实战:从零开始搭建本地评测环境,对主流开源模型跑完整评测流程,最终输出结构化的对比报告。所有步骤均在本地 GPU 机器上完成,不依赖云端 API。
2026/6/13大约 12 分钟
在前面的文章中,我们分别介绍了 lm-evaluation-harness 和 OpenCompass 两个评测框架的设计理念和核心功能。本文将聚焦实战:从零开始搭建本地评测环境,对主流开源模型跑完整评测流程,最终输出结构化的对比报告。所有步骤均在本地 GPU 机器上完成,不依赖云端 API。