返回新闻列表
2026-08-25 16:29
AI123

吴恩达力挺Marin 535B大模型开放训练:代码、数据、Loss全公开

AI模型

斯坦福大学基础模型研究中心(CRFM)发起的Marin开放基础模型项目,日前启动总参数达5350亿的Marin 535B-A23B混合专家模型训练。项目负责人、斯坦福副教授Percy Liang在社交平台X上公开了这一消息,帖子浏览量突破80万,随后获得AI领域知名学者吴恩达的转发与力挺。

吴恩达称Marin是捍卫AI开放性的“珍贵示范”,强调该项目不仅开放模型代码,还公开数据、训练配方和实验过程。他表示,公开发布AI研究成果曾是行业常态,感谢Percy Liang坚持的开放实验室理念。

按计划,Marin 535B-A23B将处理约18.75万亿Token,其中80%用于预训练,20%用于中期训练;训练运行在11套NVIDIA GB200 NVL72系统上,预计持续约3个月,总计算量约2.7×10^24 FLOPs。该模型采用MoE架构,总参数535B,每Token激活约23B参数。团队通过缩放梯实验预测训练曲线、监控梯度稳定性,并基于JAX/XLA/Levanter自研专家并行实现。

Marin的特别之处在于“开放实验室”机制:实验假设和配置通过GitHub Issue/Pull Request公开,外部研究者可参与Review,训练指标实时公开,成功与失败痕迹都被记录。此前Marin已训练过8B和32B模型,此次535B训练仍处早期,能否成为前沿模型尚待验证,但公开的训练记录本身已具研究价值。

来源
  1. 2026-08-25 01:03 | 36氪:535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
    阅读原文

    当大多数模型公司还在围绕“是否开放权重”争论时,一个总参数达到 5350 亿的大模型,选择在训练尚未完成、甚至仍可能中途失败的时候,把训练曲线、数据配方、模型配置和技术讨论直接放到了网上。 近日,斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任 Percy Liang 在 x 上发帖宣布,开放基础模型项目 Marin 已于上周启动 Marin 535B-A23B 的训练。 按照目前公布的计划,Marin 535B-A23B 将处理 18.75 万亿 Token,其中约 80% 用于预训练,20% 用于中期训练;训练运行在 11 套 NVIDIA GB200 NVL72...

其他新闻

查看全部