跳到正文

模型能力评测

重点更新

语言对话 · Arena ↗

gemini-3.5-flash-medium

关闭详情

google · 语言对话 · 2026-10-08

Arena 评分
1475.9
来源名次
30
对战票数
47,339
评分区间
1471.7–1480.0

偏好评分;区间重叠时差异未必稳定。

模型许可:Proprietary。

原始成绩 ↗
414 个模型
语言对话公开偏好成绩,2026-10-08
模型/机构Arena 评分对战票数
gpt-6.1-sol-max#21 · openai
1483.71475–14934,512
qwen3.8-max#22 · alibaba
1483.31478–148825,378
1482.31478–148736,172
gpt-5.5-high#24 · openai
1481.71478–148569,437
claude-opus-4-8-high#25 · anthropic
1481.41478–148564,177
mimo-v2.6-pro#26 · xiaomi
1480.41471–14904,069
glm-5.3-max#27 · zai
1478.41473–148420,049
1477.61474–148148,533
gpt-5.5#29 · openai
1476.71473–148071,047
1475.91472–148047,339
1475.81472–148036,007
claude-sonnet-5.5-xhigh#32 · anthropic
1475.81467–14854,838
glm-5.2-max#33 · zai
1475.21471–147947,521
gpt-5.4-high#34 · openai
1475.21471–147964,844
gpt-6-astra-max#35 · openai
1475.11469–148210,536
qwen3.7-max-preview#36 · alibaba
1474.91465–14853,932
grok-4.20-beta1#37 · xai
1474.61470–147927,928
glm-5.3-flash#38 · zai
1474.61470–148027,678
1474.51468–148110,872
claude-opus-4-8#40 · anthropic
1474.31470–147865,259
数据来源

Arena · CC BY 4.0 · 固定版本

用户偏好评分,非正确率。下方小字为置信区间;临时成绩状态见原榜。本站选取 overall 分类、翻译字段并舍入显示,原始值保留。

每日 08:30 同步 · 最近成功:2026/10/11 08:26(北京时间)

历史专项测试:MMLU-Pro / GenEval