历史专项测试
历史数据存档。查看近期模型,请返回模型能力评测。
知识与推理 · MMLU-Pro
记录保留原模型配置与数据提供方;计算机知识分项衡量知识,不是代码项目完成率。
262 条 · 按总正确率降序缺测记为 —
| 模型/配置 | 总正确率 | 数据提供方 |
|---|---|---|
| 76.1% | TIGER-Lab | |
| 76.1% | Self-Reported | |
| 76.0% | Self-Reported | |
| 75.9% | Self-Reported | |
| 75.7% | Self-Reported | |
| 75.5% | Self-Reported | |
| 75.2% | Self-Reported | |
| 74.7% | TIGER-Lab | |
| 74.3% | Self-Reported | |
| 74.3% | Self-Reported | |
| 73.6% | Self-Reported | |
| 73.3% | Self-Reported | |
| 73.1% | TIGER-Lab | |
| 73.1% | TIGER-Lab | |
| 72.5% | TIGER-Lab | |
| 71.9% | Self-Reported | |
| 71.6% | Self-Reported | |
| 71.6% | Self-Reported | |
| 71.2% | Self-Reported | |
| 71.0% | Self-Reported |
GPT-oss-20B(medium)
关闭详情数据提供方:TIGER-Lab · 参数规模:20 B
- 总正确率
- 73.1%
- 数学
- 91.5%
- 计算机知识
- 82.4%
- 物理
- 83.1%
- 化学
- 80.8%
- 生物
- 85.4%
- 工程
- 56.4%
- 经济
- 80.6%
- 商业
- 80.0%
- 健康
- 73.5%
- 心理
- 73.7%
- 法律
- 39.8%
- 历史
- 59.6%
- 哲学
- 59.9%
- 其他
- 66.0%
来源、版本与使用范围
数据版本:4623b7c68d2276218d487464b0608dc978f4b301
来源许可证:Apache-2.0。模型自身许可证与成绩文件许可证分别核对。本页未运行模型评测;不同来源或配置记录不合并,价格未提供。
固定版本数据文件