跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗

gpt-5.1

关闭详情

openai · 语言对话 · 2026-10-08

Arena 评分
1438.5
来源名次
98
对战票数
44,441
评分区间
1434.9–1442.1

偏好评分;区间重叠时差异未必稳定。

模型许可:Proprietary。

原始成绩 ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
claude-opus-4-1-20250805#81 · anthropic
1448.01445–145177,252
mimo-v2-pro#82 · xiaomi
1447.71443–145225,447
Step 5 Preview#83 · stepfun
1447.31439–14564,799
gpt-5.4-mini-high#84 · openai
1447.11443–145163,493
ernie-5.0-0110#85 · baidu
1446.31442–145036,525
gemini-2.5-pro#86 · google
1445.51443–1448125,379
1444.61439–145014,547
qwen3.6-plus#88 · alibaba
1443.31439–144748,208
1442.71440–144681,927
grok-4.7-xhigh#90 · xai
1442.71436–14508,780
gpt-6-luna-max#91 · openai
1442.61438–144828,632
qwen3.5-397b-a17b#92 · alibaba
1441.71439–144591,190
grok-4.3#93 · xai
1441.61438–144571,448
glm-4.7#94 · zai
1441.21435–144712,256
inkling#95 · thinky
1441.01437–144537,744
minimax-m3#96 · minimax
1440.51437–144461,220
1438.61435–144351,859
gpt-5.1#98 · openai
1438.51435–144244,441
qwen3.8-27b#99 · alibaba
1438.11433–144320,711
gemma-4-26b-a4b#100 · google
1437.61430–14456,092
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval