历史专项测试
历史数据存档。查看近期模型,请返回模型能力评测。
知识与推理 · MMLU-Pro
记录保留原模型配置与数据提供方;计算机知识分项衡量知识,不是代码项目完成率。
262 条 · 按总正确率降序缺测记为 —
| 模型/配置 | 总正确率 | 数据提供方 |
|---|---|---|
| 86.7% | Self-Reported | |
| 86.6% | Self-Reported | |
| 86.6% | Self-Reported | |
| 86.4% | Self-Reported | |
| 86.4% | Self-Reported | |
| 86.2% | Self-Reported | |
| 86.1% | Self-Reported | |
| 86.1% | Self-Reported | |
| 86.0% | Self-Reported | |
| 86.0% | Self-Reported | |
| 85.7% | Self-Reported | |
| 85.3% | Self-Reported | |
| 85.0% | Self-Reported | |
| 85.0% | Self-Reported | |
| 84.8% | Self-Reported | |
| 84.6% | Self-Reported | |
| 84.5% | TIGER-Lab | |
| 84.5% | Self-Reported | |
| 84.2% | Self-Reported | |
| 84.0% | Self-Reported |
Gemini-2.5-Pro-Exp-03-25
关闭详情数据提供方:TIGER-Lab · 参数规模:未披露/来源未提供
- 总正确率
- 84.5%
- 数学
- 88.8%
- 计算机知识
- 85.6%
- 物理
- 88.3%
- 化学
- 87.4%
- 生物
- 93.0%
- 工程
- 73.6%
- 经济
- 88.3%
- 商业
- 89.3%
- 健康
- 81.7%
- 心理
- 87.3%
- 法律
- 72.4%
- 历史
- 75.5%
- 哲学
- 83.3%
- 其他
- 83.0%
来源、版本与使用范围
数据版本:4623b7c68d2276218d487464b0608dc978f4b301
来源许可证:Apache-2.0。模型自身许可证与成绩文件许可证分别核对。本页未运行模型评测;不同来源或配置记录不合并,价格未提供。
固定版本数据文件