返回新闻列表
2026-08-31 19:40
AI123

StartLux 27B大模型在MCP专项测试中获综合第二

2026年8月31日,中国信通院人工智能研究所公布的检验报告显示,上海原点星辉科学技术有限公司研发的本地大模型StartLux-V1.0-27B-Preview,在可信AI大模型基准测试MCP专项测试中,以27B参数量取得综合性能排名第二的成绩,超越参数规模更大的DeepSeek-V4-Flash-0731(284B)和Step-3.7-Flash(198B)。

该测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计6类专项任务及综合评估,重点考察大模型在多工具协同、复杂任务执行及真实环境交互等方面的综合表现。在单项任务中,StartLux-V1.0-27B-Preview位置导航排名第一,浏览器自动化、金融分析等任务也与1.6T参数的DeepSeek-V4-Pro并列第一或独占第一。

StartLux以Qwen3.6-27B为基座进行后训练定向增强,采用AI训练AI(Auto Research)方法,由团队自主开展训练实验并通过反馈持续优化训练策略,是国内首个采用该方法进行后训练的本地Agent模型。

全球范围内,本地模型正在加速进入行业视野。2026年4月,Google推出Gemma 4系列;8月初,Meta发布30B本地模型Muse Glimmer并开源;NVIDIA也于8月推出30B参数的MoE模型Nemotron 3.5 Lightning。盛大网络创始人陈大年近期预测,本地模型将在3年内占据80%的大模型市场。目前,StartLux-V1.0-27B-Preview可在消费级个人电脑上运行,计划于2026年内推出第一代本地智能解决方案。

来源
  1. 2026-08-31 04:23 | 36氪:最前线|本地大模型 StartLux-27B 通过 MCP-Universe 测评:综合第二,多项专项第一
    阅读原文

    王毓婵·2026年08月31日 19:23本地本地模型或将在3年内占据80%的大模型市场。汉基世界语言模型 近日,工信部中国信息通信研究院(以下简称“中国信通院”)人工智能研究所公布的一份检验报告显示,上海原点星辉科学技术有限公司(下简称StartLux)研发的本地大模型 StartLux-V1.0-27B-Preview,在可信AI大模型基准测试——MCP专项测试中,以 27B 参数量取得综合性能排名第二的成绩,高于第三名的DeepSeek-V4-Flash,能力范围已经进入DeepSeek-V4-Pro所代表的万亿参数模型能力区间。 可信AI大模型基准测试——MCP 专项测...

其他新闻

查看全部