535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
斯坦福大学基础模型研究中心(CRFM)近日启动了一项名为Marin的开放基础模型项目,正式训练总参数达5350亿的Mixture-of-Experts(MoE)大模型Marin 535B-A23B。该模型采用11套NVIDIA GB200 NVL72系统,预计训练约3个月,处理18.75万亿Token,总计算量约为2.7×10^24 FLOPs。
与以往封闭训练不同,Marin项目将全程公开训练数据、代码、Loss曲线及实验配置,甚至包括失败实验和修改记录。团队提出“开放实验室”机制,通过GitHub Issue和Pull Request让外部研究者参与审查,试图将基础模型训练变成像开源软件一样透明协作的过程。
该项目获得吴恩达公开力挺,称其为“捍卫AI开放性的珍贵示范”。吴恩达表示,公开发布AI研究成果曾几何时是行业常态,感谢Percy Liang坚持开放实验室理念。
Marin 535B-A23B是一款MoE模型,拥有约5350亿总参数,但每个Token仅激活约230亿参数。模型采用共享专家与路由专家设计,以降低训练中Token Dropping风险。此前团队已通过缩放实验训练了小规模模型,用于预测和校准大模型训练稳定性。
这场公开实验的价值不仅在于最终模型,更在于全程记录大规模MoE训练中的技术细节与工程挑战,为无法承担同等算力的研究团队提供宝贵经验。Marin并非第一个公开训练过程的项目,但当前规模和透明度结合得最为激进。
- 2026-08-25 01:03 | 36氪:535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺阅读原文
当大多数模型公司还在围绕“是否开放权重”争论时,一个总参数达到 5350 亿的大模型,选择在训练尚未完成、甚至仍可能中途失败的时候,把训练曲线、数据配方、模型配置和技术讨论直接放到了网上。 近日,斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任 Percy Liang 在 x 上发帖宣布,开放基础模型项目 Marin 已于上周启动 Marin 535B-A23B 的训练。 按照目前公布的计划,Marin 535B-A23B 将处理 18.75 万亿 Token,其中约 80% 用于预训练,20% 用于中期训练;训练运行在 11 套 NVIDIA GB200 NVL72...