编程与GUI双向通吃!Qwen3.7-Plus 登场,11小时自主闭环开发真实APP
- 发布多模态混合智能体—阿里发布Qwen3.7-Plus,在文本基础上增强视觉-语言能力,无缝融合GUI与CLI交互,实现从原型到软件工程的端到端自动化。
- Vision Arena跻身全球前五—凭借Qwen3.7-Plus强劲表现,阿里在权威视觉模型榜单Vision Arena中排名全球前五、中国第一。
- 三大核心技术能力—模型将“看、想、写、做、验”整合,在纯文本推理Agent、多模态视觉编程、真实世界视频理解三大方向表现顶尖。
- 真实应用案例展示—Hybrid-Agent系统持续运行11+小时,自主调用超1000次、生成超10000行代码,完成APP全链路开发,并能复刻桌面应用和自主运维云控制台。
阿里新模型自己写了个APP,全程没碰键盘
阿里昨天把 Qwen3.7-Plus 扔上线了——这个多模态大模型在 Qwen3.7 的文本底子上,硬塞进了“看、想、写、做、验”的全套技能,还能无缝混用图形界面和命令行,直接从前端原型怼到软件工程闭环。结果 Vision Arena 榜单上阿里冲进全球前五,中国第一。
三大硬核技能
纯文本与推理 Agent 有开发者试了说,在 Terminal Bench 2.0、SWE-bench 和 SciCode 这些魔鬼级软件工程和科学编程任务里,Qwen3.7-Plus 跑分很猛;GPQA Diamond 这类高难度 STEM 推理基准上,它排在 Plus 级别模型的第一梯队。
多模态推理与视觉编程 群里在传,这货能看懂图片、视频、UI 截图,然后直接吐可执行代码——比如把 SVG 还原成交互网页,或者根据一张截图自动写 HTML。BabyVision 这种空间建模任务上,表现明显比之前好一截。
真实世界感知与视频理解 文档解析、高级 OCR、长短视频事件流理解全包了。有测试者在 LingoQA 驾驶场景评测里发现,它对动态空间关系的把握挺准,比如路况变化能跟着理解。
真实应用场景:现场直接复刻macOS股市App
群里疯传的几个演示案例,一个比一个离谱:
-
APP全链路自主开发 一群工程师让 Hybrid-Agent 系统自己搞了个英语单词学习 APP。结果它从需求文档开始,到写代码、测试、部署,全程无人工干预,持续跑了11+小时,触发调用超 1000次,自主生成超 10,000行代码——相当于一个人不吃不喝通宵写完一本小书。
-
桌面应用高保真复刻 智能体自己打开 macOS 原生“股市”App,截图分析布局,然后自动写 SwiftUI 代码,还接入了真实行情 API。最后跑 10项功能验证测试,全部通过,连暗色主题和交互体验都完美复刻。有开发者看了说:“这比我招的实习生快。”
-
云控制台无人值守运维 基于 Qwen3.7-Plus 做的“Qwen for Chrome”浏览器插件,能听懂非专业用户的话,比如“给我配个便宜点的服务器”,然后自己进阿里云控制台比价、选型、配置、购买,甚至自主处理停机扩容这些复杂运维操作。
现在能用吗
Qwen3.7-Plus 已经通过阿里云百炼和 Qwen Studio 对外提供服务。有开发者用 Claude Code、OpenClaw 或 Qwen Code 框架部署后说,这模型跨框架表现挺稳,没掉链子。
接下来盯着看什么:这会让 Copilot、Cursor 这类代码助手很难受——人家还在帮你补代码,阿里这货已经开始自己接需求写完整个 App 并上线了。更让云运维人睡不着觉的是,连买服务器、停机扩容都能自动干了。谁会受益?中小团队可以省掉前端+后端+运维三组人。