历史专项测试
历史数据存档。查看近期模型,请返回模型能力评测。
知识与推理 · MMLU-Pro
记录保留原模型配置与数据提供方;计算机知识分项衡量知识,不是代码项目完成率。
262 条 · 按总正确率降序缺测记为 —
| 模型/配置 | 总正确率 | 数据提供方 |
|---|---|---|
| 70.4% | Self-Reported | |
| 70.3% | TIGER-Lab | |
| 70.2% | TIGER-Lab | |
| 69.5% | Self-Reported | |
| 69.2% | Self-Reported | |
| 69.2% | Self-Reported | |
| 69.1% | TIGER-Lab | |
| 69.0% | Self-Reported | |
| 68.5% | TIGER-Lab | |
| 68.2% | Self-Reported | |
| 67.9% | TIGER-Lab | |
| 67.5% | Self-Reported | |
| 67.3% | Self-Reported | |
| 66.8% | Sefl-Reported | |
| 66.6% | Self-Reported | |
| 66.3% | Self-Reported | |
| 65.9% | TIGER-Lab | |
| 65.9% | TIGER-Lab | |
| 65.8% | TIGER-Lab | |
| 65.1% | Self-Reported |
Mistral-Large-Instruct-2407
关闭详情数据提供方:TIGER-Lab · 参数规模:123 B
- 总正确率
- 65.9%
- 数学
- 71.3%
- 计算机知识
- 70.2%
- 物理
- 69.1%
- 化学
- 63.1%
- 生物
- 82.7%
- 工程
- 44.0%
- 经济
- 75.7%
- 商业
- 62.0%
- 健康
- 71.5%
- 心理
- 77.1%
- 法律
- 48.2%
- 历史
- 63.0%
- 哲学
- 64.5%
- 其他
- 67.9%
来源、版本与使用范围
数据版本:4623b7c68d2276218d487464b0608dc978f4b301
来源许可证:Apache-2.0。模型自身许可证与成绩文件许可证分别核对。本页未运行模型评测;不同来源或配置记录不合并,价格未提供。
固定版本数据文件