返回新闻列表

智谱发布 GLM-5V-Turbo 多模态 Coding 大模型

文章提及的 AI 工具AutoClaw

GLM-5V-Turbo:看一眼设计稿就能生成可运行前端代码

4月2日,智谱放出了专为视觉编程打造的模型GLM-5V-Turbo。有开发者试了说,这模型不仅能写代码,还能“看懂”屏幕上的设计稿和网页界面,把AI智能体的感知从字符延伸到视觉元素。

核心突破:看画面写代码

作为原生多模态编程基座,GLM-5V-Turbo把视觉和编程能力揉在了一起:

  • 多维感知:原生理解图片、视频、设计稿及复杂文档版面,支持画框、截图、读网页等多种视觉工具调用。
  • 超长视野:上下文窗口扩展到200k,相当于一次能处理半本《三体》的文字量,处理大型工程项目或长篇技术文档不费劲。
  • 性能领先:在多模态编程、GUI智能体等核心测试中,这款模型尺寸更小,分却更高,跑分超过了同类产品。

典型场景:从草图到成品秒级搞定

群里在传,开发者可以用这个模型玩出新花样:

  1. 前端复刻:发一张设计稿截图或操作录屏,模型就能看懂布局、配色和交互逻辑,直接生成可运行的前端工程代码。
  2. GUI自主探索:结合Claude Code等框架,它能像人一样自己浏览网页、梳理跳转关系、采集素材,实现全站级别的视觉复现。
  3. 交互式编辑:通过对话就能增删模块、改样式、调布局,实现可视化代码迭代。

赋能“龙虾”:AutoClaw迎来视觉进化

智谱自研的智能体AutoClaw(龙虾)接入这个模型后,原来只能处理文字任务的“龙虾”长出了眼睛。有开发者试了说,它现在能直接看懂K线走势图、解读券商研报中的复杂图表,并且在60秒内完成多路数据采集,输出图文并茂的专业分析报告。这个速度比人工翻研报快多了。

行业反应

随着GLM-5V-Turbo的消息传开,圈子里有人讨论:智谱把AI的理解力从语法逻辑推向了美学与感知逻辑。当AI能“看见”屏幕并理解人类的操作环境时,真正的全自动编程辅助才算拉开序幕。

接下来盯着看什么:这个模型会不会让初级前端工程师和UI自动化测试工具厂商感到难受?毕竟从设计稿到代码的转化可能被AI直接替代了。

来源: aibase阅读原文

其他新闻

查看全部