跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
1473.71470–147837,527
gpt-5.5-instant#42 · openai
1472.91468–147827,187
gemini-3-flash#43 · google
1472.91469–147731,337
claude-sonnet-4-6#44 · anthropic
1472.01468–147670,971
1471.61468–147566,524
1470.51467–147465,008
claude-opus-4-5-20251101#47 · anthropic
1469.81467–147372,952
mimo-v2.5-pro#48 · xiaomi
1467.71464–147173,197
ernie-5.1#49 · baidu
1467.21463–147239,536
gpt-5.6-terra-xhigh#50 · openai
1465.81462–147040,278
grok-4.5#51 · xai
1465.81461–147039,953
1465.11462–146866,511
gpt-5.4#53 · openai
1464.71461–146867,932
qwen3.5-max-preview#54 · alibaba
1464.71460–147022,624
1464.51458–14719,815
glm-5.1#56 · zai
1464.41461–146860,592
claude-sonnet-5-high#57 · anthropic
1461.01457–146547,576
kimi-k2.6#58 · moonshot
1460.81456–146540,066
qwen3.6-max-preview#59 · alibaba
1460.31452–14695,426
grok-4.1#60 · xai
1459.01456–146268,682
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval