Qwen3.8-Max 冲上 Vision Arena 第二,1305 分仅落后榜首 13 分

阿里通义千问官方今日通过 X 宣布,旗舰模型 Qwen3.8-Max 在 Vision Arena 中排名第 2,得分 1,305,仅次于 Anthropic 的 Claude Fable 5 (High)——两者差距仅 13 分,几乎是同一水平线上的竞争。

Vision Arena 是什么? 它是 LMArena 社区的视觉模型对战平台:用户同时提交两张模型生成的答案,盲选更优的一方,系统基于真实用户投票计算 Elo 评分。与学术基准测试不同,Arena 类榜单反映的是真实用户对模型输出的主观感受,因此在业界被视为「用脚投票」的参考指标——能在这个榜单进入前三,说明模型的多模态输出在普通用户眼中已经具备第一梯队质感。榜单中的 (High) 后缀,指的是模型在高推理强度配置下的参赛表现。

这个成绩的分量。Qwen3.8-Max 是阿里今天(8 月 3 日)刚发布的旗舰模型,总参数 2.4 万亿,是 Qwen 家族迄今最强版本,基于 Qwen3.5 架构构建,在编程、办公、长程任务与多模态智能体等方面全面升级。发布当天就在 Vision Arena 拿到第二名,意味着它的视觉理解与图文生成能力经受了真实用户对战的首轮检验——尤其考虑到第一名 Claude Fable 5 是 Anthropic 最新的顶级闭源模型,13 分的差距基本可以看作「同一梯队」。

对实际应用的参考价值。视觉竞技场的排名直接对应真实使用场景:截图理解、文档解析、图表问答这类高频需求,输出质量用户一眼就能分辨。阿里今天同步开启公测的「千问办公」Agent 产品就重度依赖多模态底座,Vision Arena 的成绩相当于给这类应用做了一次免费的质量背书;对开发者来说,榜单表现加上 API 定价,一直是多模态模型选型的两个核心参考维度。

对国产模型的信号意义。过去视觉竞技场长期由 OpenAI、Anthropic、Google 的闭源模型霸榜,国产模型更多在文本赛道发力。Qwen3.8-Max 这次冲进 Vision Arena 前三,加上此前文本侧的表现,说明国产模型在多模态赛道的短板正在快速补齐。接下来值得关注的是:Qwen 团队能否延续「发布即霸榜」的节奏,以及开源版本(Qwen3.8 系列通常会在旗舰发布后跟进开源权重)会带来怎样的生态效应。

来源: