返回新闻列表
2026-06-02 09:32

编程与GUI双向通吃!Qwen3.7-Plus 登场,11小时自主闭环开发真实APP

文本核心速览
  1. 发布多模态混合智能体阿里发布Qwen3.7-Plus,在文本基础上增强视觉-语言能力,无缝融合GUI与CLI交互,实现从原型到软件工程的端到端自动化。
  2. Vision Arena跻身全球前五凭借Qwen3.7-Plus强劲表现,阿里在权威视觉模型榜单Vision Arena中排名全球前五、中国第一。
  3. 三大核心技术能力模型将“看、想、写、做、验”整合,在纯文本推理Agent、多模态视觉编程、真实世界视频理解三大方向表现顶尖。
  4. 真实应用案例展示Hybrid-Agent系统持续运行11+小时,自主调用超1000次、生成超10000行代码,完成APP全链路开发,并能复刻桌面应用和自主运维云控制台。

阿里新模型自己写了个APP,全程没碰键盘

阿里昨天把 Qwen3.7-Plus 扔上线了——这个多模态大模型在 Qwen3.7 的文本底子上,硬塞进了“看、想、写、做、验”的全套技能,还能无缝混用图形界面和命令行,直接从前端原型怼到软件工程闭环。结果 Vision Arena 榜单上阿里冲进全球前五,中国第一。


三大硬核技能

纯文本与推理 Agent 有开发者试了说,在 Terminal Bench 2.0、SWE-bench 和 SciCode 这些魔鬼级软件工程和科学编程任务里,Qwen3.7-Plus 跑分很猛;GPQA Diamond 这类高难度 STEM 推理基准上,它排在 Plus 级别模型的第一梯队。

多模态推理与视觉编程 群里在传,这货能看懂图片、视频、UI 截图,然后直接吐可执行代码——比如把 SVG 还原成交互网页,或者根据一张截图自动写 HTML。BabyVision 这种空间建模任务上,表现明显比之前好一截。

真实世界感知与视频理解 文档解析、高级 OCR、长短视频事件流理解全包了。有测试者在 LingoQA 驾驶场景评测里发现,它对动态空间关系的把握挺准,比如路况变化能跟着理解。


真实应用场景:现场直接复刻macOS股市App

群里疯传的几个演示案例,一个比一个离谱:

  1. APP全链路自主开发 一群工程师让 Hybrid-Agent 系统自己搞了个英语单词学习 APP。结果它从需求文档开始,到写代码、测试、部署,全程无人工干预,持续跑了11+小时,触发调用超 1000次,自主生成超 10,000行代码——相当于一个人不吃不喝通宵写完一本小书。

  2. 桌面应用高保真复刻 智能体自己打开 macOS 原生“股市”App,截图分析布局,然后自动写 SwiftUI 代码,还接入了真实行情 API。最后跑 10项功能验证测试,全部通过,连暗色主题和交互体验都完美复刻。有开发者看了说:“这比我招的实习生快。”

  3. 云控制台无人值守运维 基于 Qwen3.7-Plus 做的“Qwen for Chrome”浏览器插件,能听懂非专业用户的话,比如“给我配个便宜点的服务器”,然后自己进阿里云控制台比价、选型、配置、购买,甚至自主处理停机扩容这些复杂运维操作。


现在能用吗

Qwen3.7-Plus 已经通过阿里云百炼和 Qwen Studio 对外提供服务。有开发者用 Claude Code、OpenClaw 或 Qwen Code 框架部署后说,这模型跨框架表现挺稳,没掉链子。


接下来盯着看什么:这会让 Copilot、Cursor 这类代码助手很难受——人家还在帮你补代码,阿里这货已经开始自己接需求写完整个 App 并上线了。更让云运维人睡不着觉的是,连买服务器、停机扩容都能自动干了。谁会受益?中小团队可以省掉前端+后端+运维三组人。

来源: aibase阅读原文

其他新闻

查看全部