跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗

claude-sonnet-4-5-20250929

关闭详情

anthropic · 语言对话 · 2026-10-08

Arena 评分
1455.2
来源名次
69
对战票数
82,735
评分区间
1452.3–1458.0

偏好评分;区间重叠时差异未必稳定。

模型许可:Proprietary。

原始成绩 ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
1458.41455–146191,105
deepseek-v4-pro#62 · deepseek
1457.81454–146257,657
glm-5#63 · zai
1457.51453–146229,292
1456.41454–145983,973
dola-seed-2.0-pro#65 · bytedance
1456.31453–146079,195
qwen3.7-plus#66 · alibaba
1456.01452–146042,073
gpt-6-sol-max#67 · openai
1455.91449–146310,469
gpt-5.1-high#68 · openai
1455.71452–145941,674
1455.21452–145882,735
1455.11451–146035,892
1454.81451–145954,976
grok-4.6-high#72 · xai
1454.41449–145926,115
hy3#73 · tencent
1454.21448–146111,284
gpt-5.6-luna-xhigh#74 · openai
1452.41448–145740,917
gemma-4-31b#75 · google
1452.41445–14606,145
mimo-v2.6-flash#76 · xiaomi
1450.71444–14588,226
gpt-5.3-chat-latest#77 · openai
1450.11446–145434,367
kimi-k2.5-thinking#78 · moonshot
1450.11447–145374,811
1449.81446–145349,555
1448.81442–14559,816
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval