2026-09-21 16:46
AI123

上海人工智能实验室与上交大开源全球首个8.9B隐空间基座模型,预训练效率大幅提升

上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab于2026年9月联合发布《NCP-ArchPreview Tech Report》,提出“下一个概念预测(NCP)”预训练任务,并开源全球首个8.9B规模离散隐空间基座模型。相关论文已登上HuggingFace Daily Papers榜首。

与传统“下一个Token预测(NTP)”范式不同,NCP引入隐空间概念建模:模型先通过编码器将输入压缩为离散概念序列,再由概念模块自回归预测“下一个概念”,最后将概念信息回注到解码器,辅助生成Token。研究团队在5.73T Dolma-3语料上完成全周期工业级预训练,仅消耗51.3%的Token预算便追平OLMo-3-7B的最终预训练Loss,等效收敛速度提升1.95倍,最终收敛Loss比基线低0.091。

下游评测中,NCP-ArchPreview在30个基准大类的综合宏观平均分超越OLMo-3-7B达2.45分;GSM8K数学推理提升5.99分,HumanEval代码生成提升4.28分。团队还发现,仅微调约1700万参数的VQ码本与概念预测头,即可在数学任务上超越同规模LoRA,并保持通用能力不下降;将概念表征注入推测解码草稿模型,可在不增加目标模型计算量的情况下提升平均接受长度4.17%。

目前,研究团队已在HuggingFace开放ArchSpace模型集合,公开了数十个训练阶段的Checkpoint、评测代码与草稿模型权重等全部资产。

来源
  1. 2026-09-21 15:44 | cj.sina.com.cn:上海AI Lab&上交大开源首个8.9B隐空间大模型NCP-ArchPreview
    阅读原文

    自现代大模型诞生以来,“下一个Token预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗?近日,arXiv 上悄然挂出了一篇来自上海人工智能实验室与上海交通大学人工智能学院 LUMIA Lab 团队联合撰写的技术报告——《NCP-ArchPreview Tech Report》。没有什么铺天盖地的宣发,这篇论文却在短短几天内自发引爆了开源与极客社区:一举登顶 HuggingFace Daily Papers 榜首,HuggingPapers 官方及海外多位知名科技博主纷纷转发剖析;海外科技评论人 VIS...

其他新闻

查看全部