2026-05-19 10:05
阿里通义千问重磅升级:新旗舰Qwen3. 7 预览版全球首发亮相
文本核心速览
- 旗舰预览版发布—阿里云推出Qwen3.7-Max-Preview与Qwen3.7-Plus-Preview,已上线大模型竞技场与Qwen Chat,仅支持思考模式,专注逻辑推理与深度计算。
- 文本基准排名全球第13—Qwen3.7 Max Preview在文本处理综合排名中位列全球第13,助力阿里通义千问实验室整体排名跻身全球前六。
- 数学与编程领域跻身全球前十—新模型在数学领域排名全球第7,在专家应用、软件IT及纯编程能力等子榜单均杀入全球前十。
- 视觉领域取得突破—Qwen3.7 Plus Preview在视觉综合排名中位列全球第16,推动通义千问视觉实验室总排名升至全球第5。
阿里通义千问新预览版只有思考模式,网页搜索和代码解释器都暂不可用
阿里云把通义千问的两款新预览版——Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview——扔到了大模型竞技场 Arena AI 和自家 Qwen Chat 上,但只给开“思考模式”,网页搜索和代码解释器这两种辅助工具现阶段碰都碰不到。有开发者试了说,这俩模型已经憋着劲准备在即将召开的阿里云峰会上正式亮相,眼下预览阶段就一个技能:硬啃高难度逻辑推理和深度计算。
基准测试排名有点猛
在业界公认的大模型基准测试里,新模型表现让群里在传的数据惊了一下。文本处理方面,Qwen3.7 Max Preview 综合排名冲进全球第 13 位——相当于在几百个模型里排进了前 3%,但离第一梯队那几个怪物还差着几道题——但这直接把阿里通义千问的整体实验室排名推进了全球前六。
细分领域更狠:数学排名全球第 7,专家级应用、软件与IT、纯编程能力这三个子榜单全部杀入全球前十。有开发者试了说,这等于告诉行业:阿里的代码和数学底子已经能和 OpenAI、DeepSeek 正面掰手腕了。
视觉和专家赛道也突破了
除了文本推理,Qwen3.7 Plus Preview 在视觉榜单上排到了全球第 16 位——懂行的人都知道这数字意味着多模态能力已经挤进世界第一桌——直接让通义在视觉实验室总排名跳到全球第 5。
更刺激的是专家竞技场这个专门用来刁难模型的赛道,Qwen3.7 Max Preview 稳稳占了全球第 9。群里在传,这个赛道里全是高难度复杂指令,能排到这个位置说明阿里在多模态和垂直应用上真没偷懒。
接下来盯着看什么
等着阿里云峰会正式版会不会把网页搜索和代码解释器加回来,以及这个“纯思考”的预览版到底能让 DeepSeek 的编程榜、Llama 的数学榜多难受。
来源: aibase阅读原文