跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
1400.01393–14078,822
1398.71394–140322,763
deepseek-r1#163 · deepseek
1398.11393–140318,524
qwen3.5-flash#164 · alibaba
1396.01392–140061,845
deepseek-v3-0324#165 · deepseek
1395.21391–139944,989
1394.71388–14027,868
qwen3.5-35b-a3b#167 · alibaba
1393.81390–139830,493
1393.81381–14062,171
step-3.5-flash#169 · stepfun
1393.21390–139760,381
1393.11384–14033,740
1391.61388–139548,117
o4-mini-2025-04-16#172 · openai
1390.91387–139544,858
claude-sonnet-4-20250514#173 · anthropic
1390.91386–139539,172
minimax-m2.5#174 · minimax
1390.91387–139542,858
gpt-5-mini-high#175 · openai
1389.91385–139526,810
o1-preview#176 · openai
1388.61384–139431,122
1388.31384–139238,162
1387.51383–139225,197
mistral-medium-2505#179 · mistral
1387.31383–139232,786
hunyuan-t1-20250711#180 · tencent
1387.21379–13964,594
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval