跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗

amazon-nova-experimental-chat-26-02-10

关闭详情

amazon · 语言对话 · 2026-10-08

Arena 评分
1426.5
来源名次
116
对战票数
3,523
评分区间
1416.8–1436.2

偏好评分;区间重叠时差异未必稳定。

模型许可:Proprietary。

原始成绩 ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
gpt-5.2-high#101 · openai
1437.21434–144149,685
1436.41432–144129,306
deepseek-v4-flash#103 · deepseek
1436.01432–144052,047
gpt-5.2#104 · openai
1435.51432–143983,928
gpt-5-high#105 · openai
1434.71430–143931,723
qwen3-max-preview#106 · alibaba
1434.31430–143927,379
mimo-v2.5#107 · xiaomi
1433.71429–143847,402
glm-5v-turbo#108 · zai
1433.51427–144010,492
1432.91429–143764,257
o3-2025-04-16#110 · openai
1431.71428–143558,913
mimo-v2-omni#111 · xiaomi
1430.81425–143620,667
1430.41427–143457,574
kimi-k2.5-instant#113 · moonshot
1430.41424–14378,378
kimi-k2-thinking-turbo#114 · moonshot
1430.11427–143363,390
mistral-large-4#115 · mistral
1429.31420–14394,179
1426.51417–14363,523
mistral-medium-3.5#117 · mistral
1426.41420–143311,803
gpt-5-chat#118 · openai
1426.31422–143131,203
1426.31422–143135,913
1426.11419–143311,571
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval