跳到正文
返回近期模型评测

历史专项测试

历史数据存档。查看近期模型,请返回模型能力评测。

知识与推理 · MMLU-Pro

记录保留原模型配置与数据提供方;计算机知识分项衡量知识,不是代码项目完成率。

数据更新:2026/03/11接入核查:2026/10/10262 条来源记录原始数据 · Apache-2.0
262 条 · 按总正确率降序缺测记为 —
总正确率成绩,按该分项排序
模型/配置总正确率数据提供方
80.8%Self-Reported
80.5%Self-Reported
80.3%Self-Reported
80.1%Self-Reported
80.1%Self-Reported
79.9%Self-Reported
79.4%Self-Reported
79.1%Self-Reported
79.1%Self-Reported
79.0%Self-Reported
78.9%Self-Reported
78.5%Self-Reported
78.4%Self-Reported
78.3%Self-Reported
78.1%Self-Reported
78.0%Self-Reported
77.9%Self-Reported
77.6%TIGER-LAb
77.6%Self-Reported
76.2%TIGER-Lab

Gemini-2.0-Flash-exp

关闭详情

数据提供方:TIGER-Lab · 参数规模:未披露/来源未提供

总正确率
76.2%
数学
86.4%
计算机知识
79.9%
物理
81.3%
化学
80.0%
生物
88.4%
工程
61.6%
经济
81.7%
商业
79.8%
健康
74.4%
心理
79.0%
法律
56.5%
历史
70.1%
哲学
69.9%
其他
74.8%
查看该版本原始成绩文件
来源、版本与使用范围

数据版本:4623b7c68d2276218d487464b0608dc978f4b301

来源许可证:Apache-2.0。模型自身许可证与成绩文件许可证分别核对。本页未运行模型评测;不同来源或配置记录不合并,价格未提供。

固定版本数据文件