字节拟训练5万亿参数大模型,超Kimi K3和Qwen 3.8-Max,张一鸣严禁蒸馏
- 5万亿参数新模型—字节跳动讨论训练超5万亿参数模型,超过阿里Qwen 3.8-Max的2.4万亿与月之暗面K3的2.8万亿,成为国内已知最大规模。计划仍处早期,最终不一定发布。
- 项亮沈科牵头推进—新模型由Seed Foundation负责人项亮牵头,与大语言模型预训练数据负责人沈科合作。Seed正重新梳理组织、划分职责、分配资源,目标是把参数规模一次推到同行数倍,争取领先。
- 张一鸣严禁蒸馏—张一鸣内部会罕见表态,要求坚持长期主义、延迟满足感,不靠他人输出去换榜单排名。字节内部严禁蒸馏开源模型,并通过API检测等方式加强限制,避免偏离自研轨道。
- 梁汝波重申自研—CEO梁汝波8月6日在2026年中全员大会上表示,大语言模型上继续坚持自研、做好基本功,接受短期落后、优化长期,并澄清坚持自研并非外部压力,而是为AGI打基础。
- 差异化战略信号—高层接连发声是一次战略宣告:不跟随对手内卷,用规模优势确立领导地位,同时承担更长研发周期和更高不确定性。该计划仍处早期,最终是否发布存有变数。
字节跳动押注5万亿参数大模型:超Kimi K3与Qwen 3.8-Max,张一鸣严禁蒸馏
据媒体报道,字节跳动正在讨论训练一个参数规模超过5万亿的模型。这一数字令业界侧目——它不仅超过了阿里Qwen 3.8-Max的2.4万亿参数,也高于月之暗面K3的2.8万亿参数,成为目前国内已知参数规模最大的模型。不过,该计划仍处于早期阶段,模型最终不一定会发布。
不计成本:一次推到数倍规模
新模型由Seed Foundation负责人项亮牵头,与大语言模型预训练数据负责人沈科合作。Seed正为此重新梳理组织、划分职责、分配资源。接近Seed的人士给出的理由很直白:与其在现有尺寸上继续追赶其他大模型,不如把参数规模一次推到同行的数倍,争取领先位置。
这一策略意味着巨大的算力和数据投入。参数规模从2万亿级跃升至5万亿级,训练成本、工程复杂度都将成倍增加。对于字节这样拥有充足资源的公司而言,这是一场“大力出奇迹”的豪赌,也反映出其对AGI的执念。
张一鸣:严禁蒸馏,坚持长期主义
这背后是字节高层一连串明确的表态。创始人张一鸣在近日的内部会议中罕见表态:做模型要坚持长期主义、延迟满足感,而不是用别人的输出去换一时的榜单排名。他明确指出,字节应该愿意为长期目标牺牲一部分短期收益。
更引人注目的是,目前字节内部对开源模型严禁蒸馏,甚至通过API检测等方式加强限制。张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。所谓“蒸馏”,通常指利用大型模型(如开源模型)的输出来训练小型模型,以较低成本获得接近大模型的性能。但字节显然认为,这条路会偏离自研的轨道。
梁汝波:坚持自研,接受短期落后
8月6日的2026年中全员大会上,CEO梁汝波又把这套逻辑讲了一遍。他表示,在大语言模型上字节会继续坚持自研、做好基本功,接受短期落后,坚持优化长期。所谓“优化长期”,就是以用户和增量社会价值为中心,不为短期波动所动;落到AI业务,就是相信AGI、坚持自研。
他特意澄清外界的猜测:“昨天有外部报道说,我们是因为外部压力才坚持自研的,这是瞎猜。真实原因是希望团队延迟满足感,打好技术基础,这对长期实现AGI很关键。”
战略信号:不内卷,走自己的路
从张一鸣到梁汝波,这次高层接连发声不是单纯的技术规划,而是一次完整的战略宣告:对内统一研发思路,对外释放信号——字节无意跟随旁人技术路线内卷,打算走出一条属于自己的成长曲线。
在当前的国内AI大模型竞赛中,各家都在比拼参数规模和榜单成绩。字节的5万亿参数计划,显然是想用“碾压式”的规模优势来确立领导地位。但与此同时,严禁蒸馏、坚持自研的立场,也意味着字节将承担更长的研发周期和更高的不确定性。
该计划尚处早期,最终是否发布仍存变数。本文信息综合自媒体报道,不构成投资建议。