历史专项测试
历史数据存档。查看近期模型,请返回模型能力评测。
知识与推理 · MMLU-Pro
记录保留原模型配置与数据提供方;计算机知识分项衡量知识,不是代码项目完成率。
262 条 · 按总正确率降序缺测记为 —
| 模型/配置 | 总正确率 | 数据提供方 |
|---|---|---|
| 91.2% | TIGER-Lab | |
| 90.1% | Self-Reported | |
| 89.3% | Self-Reported | |
| 89.1% | Self-Reported | |
| 88.6% | Self-Reported | |
| 88.0% | Self-Reported | |
| 87.8% | Self-Reported | |
| 87.7% | Self-Reported | |
| 87.5% | Self-Reported | |
| 87.4% | Self-Reported | |
| 87.4% | Self-Reported | |
| 87.3% | Self-Reported | |
| 87.3% | Self-Reported | |
| 87.3% | Self-Reported | |
| 87.2% | Self-Reported | |
| 87.1% | Self-Reported | |
| 87.1% | Self-Reported | |
| 87.0% | Self-Reported | |
| 87.0% | Self-Reported | |
| 87.0% | Self-Reported |
Gemini-3.1-Pro
关闭详情数据提供方:TIGER-Lab · 参数规模:未披露/来源未提供
- 总正确率
- 91.2%
- 数学
- 95.5%
- 计算机知识
- 93.7%
- 物理
- 93.2%
- 化学
- 92.1%
- 生物
- 95.8%
- 工程
- 87.3%
- 经济
- 93.4%
- 商业
- 93.3%
- 健康
- 86.2%
- 心理
- 91.8%
- 法律
- 85.6%
- 历史
- 85.6%
- 哲学
- 90.4%
- 其他
- 89.3%
来源、版本与使用范围
数据版本:4623b7c68d2276218d487464b0608dc978f4b301
来源许可证:Apache-2.0。模型自身许可证与成绩文件许可证分别核对。本页未运行模型评测;不同来源或配置记录不合并,价格未提供。
固定版本数据文件