跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗

qwen3-235b-a22b-instruct-2507

关闭详情

alibaba · 语言对话 · 2026-10-08

Arena 评分
1422.3
来源名次
127
对战票数
98,167
评分区间
1419.7–1424.8

偏好评分;区间重叠时差异未必稳定。

模型许可:Apache 2.0。

原始成绩 ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
1424.81418–14319,008
deepseek-v3.2#122 · deepseek
1424.81421–142848,114
muse-glimmer#123 · meta
1424.51415–14343,892
glm-4.6#124 · zai
1424.21420–142835,828
qwen3-max-2025-09-23#125 · alibaba
1423.31417–14309,029
deepseek-v3.2-thinking#126 · deepseek
1422.61419–142642,076
1422.31420–142598,167
deepseek-v3.2-exp#128 · deepseek
1421.41415–142811,999
deepseek-r1-0528#129 · deepseek
1421.41416–142718,171
grok-4-fast-chat#130 · xai
1418.71411–14276,343
1418.51410–14274,752
kimi-k2-0905-preview#132 · moonshot
1418.51412–142511,592
kimi-k2-0711-preview#133 · moonshot
1417.71413–142327,148
deepseek-v3.1#134 · deepseek
1417.21411–142314,610
qwen3.5-122b-a10b#135 · alibaba
1416.31412–142129,734
1416.01406–14263,377
deepseek-v3.1-thinking#137 · deepseek
1415.81409–142211,458
minimax-m2.7#138 · minimax
1415.01412–141882,436
deepseek-v3.1-terminus#139 · deepseek
1414.81405–14243,609
gpt-4.1-2025-04-14#140 · openai
1414.61411–141850,314
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval