返回新闻列表
2026-05-19 10:05

阿里通义千问重磅升级:新旗舰Qwen3. 7 预览版全球首发亮相

文本核心速览
  1. 旗舰预览版发布阿里云推出Qwen3.7-Max-Preview与Qwen3.7-Plus-Preview,已上线大模型竞技场与Qwen Chat,仅支持思考模式,专注逻辑推理与深度计算。
  2. 文本基准排名全球第13Qwen3.7 Max Preview在文本处理综合排名中位列全球第13,助力阿里通义千问实验室整体排名跻身全球前六。
  3. 数学与编程领域跻身全球前十新模型在数学领域排名全球第7,在专家应用、软件IT及纯编程能力等子榜单均杀入全球前十。
  4. 视觉领域取得突破Qwen3.7 Plus Preview在视觉综合排名中位列全球第16,推动通义千问视觉实验室总排名升至全球第5。

阿里通义千问新预览版只有思考模式,网页搜索和代码解释器都暂不可用

阿里云把通义千问的两款新预览版——Qwen3.7-Max-PreviewQwen3.7-Plus-Preview——扔到了大模型竞技场 Arena AI 和自家 Qwen Chat 上,但只给开“思考模式”,网页搜索和代码解释器这两种辅助工具现阶段碰都碰不到。有开发者试了说,这俩模型已经憋着劲准备在即将召开的阿里云峰会上正式亮相,眼下预览阶段就一个技能:硬啃高难度逻辑推理和深度计算。

基准测试排名有点猛

在业界公认的大模型基准测试里,新模型表现让群里在传的数据惊了一下。文本处理方面,Qwen3.7 Max Preview 综合排名冲进全球第 13 位——相当于在几百个模型里排进了前 3%,但离第一梯队那几个怪物还差着几道题——但这直接把阿里通义千问的整体实验室排名推进了全球前六。

细分领域更狠:数学排名全球第 7,专家级应用软件与IT纯编程能力这三个子榜单全部杀入全球前十。有开发者试了说,这等于告诉行业:阿里的代码和数学底子已经能和 OpenAI、DeepSeek 正面掰手腕了。

视觉和专家赛道也突破了

除了文本推理,Qwen3.7 Plus Preview 在视觉榜单上排到了全球第 16 位——懂行的人都知道这数字意味着多模态能力已经挤进世界第一桌——直接让通义在视觉实验室总排名跳到全球第 5。

更刺激的是专家竞技场这个专门用来刁难模型的赛道,Qwen3.7 Max Preview 稳稳占了全球第 9。群里在传,这个赛道里全是高难度复杂指令,能排到这个位置说明阿里在多模态和垂直应用上真没偷懒。

接下来盯着看什么

等着阿里云峰会正式版会不会把网页搜索和代码解释器加回来,以及这个“纯思考”的预览版到底能让 DeepSeek 的编程榜、Llama 的数学榜多难受。

来源: aibase阅读原文

其他新闻

查看全部