跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗

qwen3-235b-a22b-no-thinking

关闭详情

alibaba · 语言对话 · 2026-10-08

Arena 评分
1402.2
来源名次
157
对战票数
37,497
评分区间
1397.7–1406.7

偏好评分;区间重叠时差异未必稳定。

模型许可:Apache 2.0。

原始成绩 ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
claude-opus-4-20250514#141 · anthropic
1414.11410–141843,055
claude-haiku-4-5-20251001#142 · anthropic
1414.01412–1416146,351
mistral-large-3#143 · mistral
1413.81411–141781,759
1413.51407–142011,325
1412.81403–14233,545
1411.41407–141632,502
grok-4-0709#147 · xai
1411.01407–141539,691
glm-4.5#148 · zai
1411.01406–141623,803
gemini-2.5-flash#149 · google
1409.31407–1412125,562
hunyuan-hy3-preview#150 · tencent
1408.91401–14166,893
qwen3.5-27b#151 · alibaba
1408.81404–141328,677
mistral-medium-2508#152 · mistral
1407.71405–141095,354
Inkling Small#153 · thinky
1405.31401–141029,528
1405.31400–141018,276
1403.11399–140732,993
o1-2024-12-17#156 · openai
1402.31398–140727,807
1402.21398–140737,497
1401.71397–140634,149
gpt-5.4-nano-high#159 · openai
1401.31398–140562,468
longcat-flash-chat#160 · meituan
1401.01395–140711,174
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval