订阅 AI123 精选资讯,每周获取最新动态

立即订阅
返回新闻列表
新闻
2026-07-23
16

DeepSeek创始人梁文锋四小时投资人会议实录(三)

DeepSeek创始人梁文锋四小时投资人会议实录(三)

[01:26:41]

如果我半年之内就把这个钱花完的话,可能是最理想的。因为我把钱变成英伟达卡,肯定是⽐放在银⾏⾥⾯好。放银⾏⾥⾯,我现在已经可能是存两个点,好像就要。但是买英伟达卡,⼗个⽉的社会成本。

所以肯定是你能买到多少就买到多少。最先如果买了卡之后,后⾯我有很多空间,我通过提供服务或者我怎么样,我总是能够有现⾦流的。我有现⾦流我就可以活,我就不需要在我账上⾯放很多很多钱。

所以说,我们只担⼼买不到那么多卡。如果能够把钱都变成卡的话,那我们会毫不犹豫把所有的钱都变成卡,并且在这⾥⾯我们是愿意付⼀定的溢价的。就是我们愿意付⼀定的溢价去把它变成卡,因为这太划算了。

哪怕我们在付完溢价之后,其实我们也很难实现这个⽬标。那么客观上来讲,如果说我今年能够花掉两百亿,那么就属于我们的采购部门业绩超级好了。

我们跟美国的差距主要在资源上⾯,然后⼈上⾯差距不是很⼤的。⼈上⾯⼏乎没有差距,因为就是同⼀批⼈,可能是中国⼈。中国⼈出去的时候,有⼀些⼈留在国内,有些⼈留在国外,有些⼈去国外,他并没有说是聪明的⼈去国外,没有的。

其实它是⽐较随机的。最聪明的那些⼈,可能不是说⼀半多⼀点去国外的,但有⼀半少⼀点留在国内。国内⼈才是不缺的,⽽且我们的基数⼤,我们每年有那么多⼈的补充。

⼈才不是瓶颈,资源是最⼤的瓶颈。资源⾸先影响到⼈才培养,因为算⼒少,我们能做的实验机会⽐较少,所以我们的⼈才整体上⽐美国有差距。⼈才的差距,本质上也是因为算⼒的差距。

在现在最⼤的模型上,我们其实训不起的。我们哪怕把五百亿全花掉,其实也训不起。哪怕能堆起来也⽤不起。现在最⼤的模型,它激活⼤概是⼋百 B;国内的话,我们还在⼏⼗B 的这个规模,国内最⼤模型可能就⼏⼗ B 激活,那么差⼀个数量级。

如果我要训练跟 AI 同样⼤的模型,应该需要五万张 GB300,或者华为 950,⼆⼗万卡。

这只是训练,还没有考虑做研究。所以我们跟美国之间最⼤的差距是在资源上⾯。

我们现在的资源,以及我们今年之内、接下来⼏个⽉的资源,包括⻢上⼤资源,也只⾜够我们在⼗ B 激活的这个规模⾥⾯去做更多的实验。因为我在⼏⼗ B 激活的这个规模⾥⾯,还有很多实验要做,还有很多事情需要搞清楚的。我们应该离能够训⼋百 B 的模型还⽐较远,时间还⾮常多,没有那么多卡。

所以我们跟美国的区别,我认为就是资源上的区别。我们可能会认为,我们看到的所有区别,包括⼈才的区别、模型能⼒的区别、应⽤的区别,可以认为都是因为算⼒资源上的区别。

算⼒资源⼀⽅⾯是国内本⾝卡就买不到,另外⼀⽅⾯是我们的资本投⼊⽐美国要少。我们在资本投⼊层⾯上少了很多,基于⼈才的⼯资在这⾥⾯占的⽐重是很低的。你看他们开的薪⽔⼀个亿美⾦这种,但算起来,⼈才的薪⽔还是占⽐很少,⼤头还是算⼒。

这个问题⽬前基本上⽆解,因为华为的产量也是有限的。因为我要训⼋百 B 的话,我就得⼆⼗万张华为最新的卡,这只是训练,还没有考虑做研究。

所以我们现在根本就不会考虑,到这么⼤的⼀个规模上去跟美国竞争。我们现在输,还是在我们能够训练得起、能够⽤得起的规模上,就⼏⼗ B 激活的规模上要先把它做好。再等下⼀步有更多的资源的时候,再把它做到⼀百五⼗ B、⼀百五⼗六 B,或者两百五⼗ B激活的这个规模。

所以我们跟美国在这⾥⾯有⼀个⽬前看起来很难弥补的差距。你要硬要训那么⼤模型也是能训,但是你没法做充分的研究。就是你在训之前,没法做充分的研究。

还有个⼤家⽐较关⼼的问题是,所有⼤模型竞争,它终局的差距会体现在什么地⽅?就是当⼤模型最终差距会体现在哪⾥?我觉得这个差距最终可能是没有太⼤差距的。

最终的差距应该是三⽅⾯:⼀⽅⾯成本,⼀⽅⾯时间,⼀⽅⾯⽤户体验。除此以外,可能是没有什么差距的。

成本⽐较好理解,你提供同样的服务、同样质量的服务,你能够以什么成本来提供。同样⼀件服务,不如说⽐亚迪的电池,在同等技术量的情况下,其他家是不是能够按照这个价格来提供,我觉得这个是个较难的事情。不是那么容易做到的,肯定是壁垒。

所以成本肯定是⼀个差异,我觉得可能成本是排在第⼀位的区别。然后第⼆个就是时间,你什么时候能够做到。你早⼏个⽉、晚⼏个⽉,它就不⼀样了。

第三个可能是体验,⽤户体验还是有些不⼀样的。这个⽤户中间还是会有⼀些⽤户粘性和⽤户壁垒的,但它可能不本质。本质还是第⼀个成本,第⼆个时间。你先做出来还是后做出来,你做到同样东⻄,是快点还是慢⼀点。

⻓期商业化路径和产品线进⼀步丰富后,怎么定价?我们觉得现在最值得做、最值得花精⼒的,还是做 AGI。现在要把 AGI 往前再往前推,就是把智能的下限往上推,往前推。

这个应该是在现阶段,⽐做更多的产品线、考虑更多商业化路径更划算,或者说它是⼀个收益更⼤的路径。我觉得在未来的⼀段时间,以及过去的任何⼀段时间,可能都是这样的。就是说,如果说我们

[01:39:46]

我们花了很多时间去思考,丰富我们的产品有什么⽤吗?

半年前讨论出来的商业化是什么?⼀定是我要去做⼴告,然后我要去做电商,我要去在产品⾥⾯植⼊电商,然后要跟本地⽣活什么很⼤⼀体。肯定没⽤的,因为变化太快了。你这个产品,如果说你在前⾯,或者我们现在这个阶段,去花很多时间做商业化考虑、商业化路径,产品线它⽣命周期很短。

我觉得没有到这个时候。这是我们的判断,或者⾄少前⾯的这些经验都是⽀持这个判断的。在过去三年,任何⼀个时候你来跟我说商业化路径、产品线,都是浪费时间,因为你并不能够预测、不能够预⻅未来。你能够预⻅的是很少的。

因为我看时间,不知道⼤家要中场休息⼀下吗?要先吃点东⻄吗?还是我们继续聊?⼤家没有意⻅,我就继续说。

在做全球领先的 AGI 研究,并在适当时候进⾏商业化。我觉得我们⼀直在做商业化,我认为⼀直在做商业化,只是没有以商业化为⽬标。我们是以 AGI 为⽬标,但是我们⼀直在做商业化,所以我们才有 C 端的⽤户,才有 B 端的收⼊。

从历史经验来看,这个策略是成功的。然后我觉得,我们离彻底转向商业化的时间点,应该是很遥远的。所以最⼤的还是技术的延伸,然后做下⼀代的技术,更多地解决现在的问题。这些收益⽐,我个⼈觉得,就在现在能看到的未来,在任何⼀个时候你聚焦在产品上都太早了。

所以这也是我们克制的⼀部分。我希望这些商业机会能够让其他⼈来做,我们希望这些商业机会、怎么⽤这个 AI,是整个社会、我们所有的合作伙伴⼀起来做,⼤家⼀起来分享这个收益,⽽不是我想独吞,这不可能。⽽且我们没有那么多精⼒,我们的组织也没有那么多⼈去做这个事情。

对于合作伙伴,其实我们这个融资是精⼼挑选的。具体怎么合作的这个提议,但⾸先我觉得,利益是⽐较⼀致的,就是跟我们利益最⼀致的、对我们最没有敌意的,或者说最希望我们能够做成功的。不是所有⼈都希望我们能做成功的,因为我们还是损害了很多其他⼈的利益的。

公司重⼤战略、技术业务决定的流程和决策机制。我们公司整体上是建⽴在共识的基础上的,我并不是说我⼀个⼈决定所有事情,⽽是我要寻求共识。我在公司内的权威以及在公司内的影响⼒,是建⽴在共识的基础上的。

⽐如说我要做⼀个事情,我肯定是先看我们⼤家的共识是什么,⼤家想不想做。然后有可能我会有⼀些引导或者倾向,但是这引导的作⽤是有限的,引导的作⽤是⾮常有限的,还是建⽴在⼀个共识的基础上。这个决策机制其实是⼀种寻求共识的机制,这并不是说我能够推动⼀个什么事情,它⼀定是共识,我才能够推得下去,然后我才会去推。

⽬前主要精⼒基本上都在 DeepSeek 这边。我们休息五分钟。我快点写。⼤家可以开⻨,给我⼀点反馈。我们这边没问题,要不然先休息五分钟。

各家模型最终效果拉开差距,应该是⼀个综合上的。⽐较模型效果,肯定是得在相同的成本上来⽐较,这个才是有意义的。因为你⽐较两辆⻋,也是同价位的⻋来⽐较。

做得好的模型跟做得差的模型,这个差别应该不是在具体某个环节,它应该是整体上的。Anthropic 跟现在超过 OpenAI,这是不是⻓期的?我觉得这不是⻓期的,这肯定是极端性的。OpenAI 和 Google,未来⼤概率还是会交替上升,应该是会交替上升。其实现在Anthropic 在 Code Agent 上的优势没有那么⼤,其实并没有说它碾压 OpenAI。

我们公司可能有⼀半的⼈,平时有⼀半的⼈觉得 OpenAI 是更好的。其实 Anthropic 它有先发优势,但这先发优势应该很快就没了,并不是⼀个它能够⻓期占得住的优势。⼤家这三家都很厉害,这三家⾥⾯的效率是最⾼的,它花的成本、它花掉的、它烧掉的钱应该是最少的。

在全球 AI 中主导分⼯的时候,中国公司很有可能扮演的⼀个⾓⾊还是产量最⼤。常理来讲,我们的产能最⼤,包括芯⽚,芯⽚可能我们的产能最⼤,我们的电⼒最多,所以我们的 AI 最终很有可能我们是三体之⼀。

中国⼈会把这产品做到最便宜,然后再在效果上,毕竟国外的商品,现在很多商品中国产跟美国差并没有太⼤的区别。未来可能 AI 也是这样,但是中国产的 AI 可能价格会更便宜。这个便宜可能是系统性的低,就跟其他⾏业中国提供的服务更便宜可能是⼀样的。

我要做事情的时候,我习惯的思考是:我现在这个时候做什么收益最⼤?如果说我觉得现在做产品收益最⼤,我觉得去做产品;如果说我觉得现在把 AGI 先实现收益最⼤,那我就是先去做 AGI。显然,我觉得现在做产品不是收益最⼤的。

如果你是国产卡适配的问题,国产卡现在其实是有⼀个历史性的机遇的。因为之前国产卡适配有⼀个难题,叫⽣态不好。就买了卡之后,但是⽤不起来,它没有英伟达那个⽣态。所以说英伟达的护城河是很强的。

但是这个事情在发⽣变化。英伟达 CUDA 的护城河在快速地被⽡解,快速被⽡解的原因可能是有三⽅⾯。⼀⽅⾯是现在有了 AI,然后有了 AI 之后,我要建⽴起这个⽣态⽐以前容易很多了,因为 AI 可以写代码。

[01:56:36]

我可以⽤ AI 来构建这个⽣态,就可以把跟英伟达⼀模⼀样的⽣态构建出来。第⼀个,因为有 AI;第⼆个,有⼀些新的技术。⽐如说,我们家出了⼀个技术,叫 TileLang,是⼀种⾼级语⾔。

⽤这个⾼级语⾔来写 CUDA 的算⼦,可以很快地把英伟达的整套⽣态全部都写⼀遍,再结合 AI,这个看起来没有什么障碍。但是现在还没有完成,还没有做完,不过这个技术路线看起来是没有什么障碍的。

还有⼀点,因为 CUDA,英伟达它是从游戏卡演变出来的,所以它在很多地⽅,游戏卡的设计跟游戏卡的设置是⼀脉相承的。CUDA 是兼容游戏卡的。以前因为 AI 计算是⼀个很⼩的领域,⽐游戏卡的市场要⼩,所以这样是合理的。

但是现在计算卡的市场已经⽐游戏卡更⼤了,就没有理由这两个还需要耦合起来。现在的趋势是,以后就不再耦合了。那么专⽤芯⽚,不管是华为还是英伟达⾃⼰,以后都是专⽤芯⽚,都不是之前的这些东⻄了。

在这个背景下,原来英伟达⽣态的作⽤就⼤幅度减少了。因为对于⼀个专⽤芯⽚来讲,跟CUDA 没有什么关系,它跟 CUDA 是不绑定的。或者说,这个芯⽚在设计的时候,就已经考虑到怎么建⽴这个⽣态了。

有点复杂,但 anyway,国产 AI 芯⽚替代现在是有个历史性机会的。我们认为,未来⼀年之内,我们能够看到有⼀个事情被验证:国产芯⽚的⽣态完全没有问题。之前认为是有问题的,认为是⽤不起来、不好⽤,但是未来我觉得⼀年之内,我们能够扭转这个认知,或者会⽤事实来扭转这些。

国产 AI 芯⽚的硬件和⽣态都没有问题,唯⼀有问题的是产能不够。国产卡适配这⼀点,没有障碍,英伟达挡不住。如果是在⼀个正常的商业环境⾥⾯,我能买到英伟达的卡,那么国产替代是⽐较难的;但是在英伟达的卡买不到的情况下,所有⼈都迫不得已,都要去做国产芯⽚。

在这个背景下,国产卡的适配是没有任何障碍的。国产卡建⽴起跟英伟达⼀样、甚⾄⽐英伟达还好的⽣态,我觉得没有障碍,但还需要时间。

我们现在主要是跟华为有合作。华为他们⾃⼰适配,但我们⾃⼰会参与这个⽣态,会深⼊参与到华为这个⾥⾯去。华为的问题还是产能不⾜。像华为给我们的⼤概是⼀万六千张卡的产能,互联⽹⼤⼚可能是⼗⼏万张,我们⼀万多张,我觉得这个⽐例也是⽐较……但这已经可能是华为就这么多产能了。

所以我们也没法指望在华为上⾯训后⾯那个更⼤的模型,或者说训练⼏百 B 参数激活的模型,有时就有说在今年。但是明年、后年说不定是有机会的。

华为卡适配,我们主要做的⼯作是把它的⾼级语⾔编译器做好,把 TileLang 做好。把TileLang 做好之后,问题可能就迎刃⽽解了。这个事情说起来⽐较复杂,但是我们在做,做完之后再来解释会清晰⽐较多。

你可以理解,V3 训练的时候,它⽤的还是英伟达的卡,但是已经不⽤英伟达的⽣态了。

V3 ⽤英伟达的卡,但是没有⽤英伟达的⽣态,⽽是我们先写⼀个⾼级编译器叫TileLang,然后基于 TileLang 的⽣态来完成其他所有的事情,就已经⼏乎不依赖英伟达的⽣态了。

只要我把这⼀套东⻄,把这个过程重新在华为卡上做⼀遍,那么就完成了。我觉得这⾥可能是⼀个历史性的使命,即可以完全扭转之前⼤家对国产卡⽣态不好的认知。现在有些天时地利基本上都全了,就差时间。我觉得⼀年之内,应该会有很多⼈在上⾯都有,或者说都明⽩这问题算是解决了,剩下就是产能的问题。

我对国产算⼒是⽐较乐观的。我觉得在这⼀点上,英伟达是在掘⾃⼰的坟墓。华为的超节点,华为的 950 超节点,在性能和价格上可以完全平替英伟达的 GB200、GB300。价格肯定要贵,但贵得有限。价格贵百分之五⼗、百分之⼀百,贵百分之⼀百⽆所谓,贵百分之两百都⽆所谓。

⽐如贵百分之⼀百,我觉得已经可以认为在价格上可以平替了。在任务上也是可以平替的,所有 GB300 能做的任务,华为超节点都能做,延时什么都⼀样。唯⼀的代价是,四张华为卡顶⼀张英伟达的卡,同时落后两年。

四张顶⼀张这个可以理解。落后两年的意思是,四张华为 950 能顶⼀张 GB300。落后两年是时间上落后两年。华为 950 超节点是今年 Q3 还是 Q4 的货,英伟达 GB200 是两年前 Q3 的货,差两年。

英伟达今年 Q3 可能已经有新⼀代了。所以我们跟美国在芯⽚上的差距,我认为⽣态上以后不会再有差距,但是在芯⽚上是四倍加两年。

还有问题是,我们会不会向上游进⾏垂直整合?我希望不要。所以有个问题是,我们是不是会往上游应⽤进⾏垂直整合?我们希望不⽤这个,我希望是其他⼈来做这个事情。我不希望我把所有东⻄都吃了,我只要吃⼀块就好,我只要吃我最擅⻓那⼀块,或者我觉得我们⾃⼰认为最核⼼那⼀块,然后跟⽤户

[02:08:18]

直接相关那⼀块,我觉得可能对于我们的很多产业伙伴来讲,他们⽐我们更关注类似……

应该是别⼈的意义,不应该我把它诠释了。

未来我们会不会⾃建⼤型的集群?我觉得⾃建⼤型的集群是肯定要的,我们⾃⼰⼀直在做这个事情,我们所有的集群都是⾃⼰建的。但是未来要不要⾃研芯⽚,我觉得取决于这⾥的收益有多⼤,取决于收益有多⼤。

Tesla、培育……这个事情。假如说你是运营发电⼚的,你并不⼀定需要去造发电机,对不对?发电设备可以是别⼈造的,只要它的价格合理,你为什么要⾃⼰造?

所以,我希望不⽤去做芯⽚。我希望能够以合理的价格买到芯⽚,这样我就不⽤去做芯⽚。我觉得这个很有可能是这样的,就是最近英伟达芯⽚的利润,不⻅得是可以……虽然……

我们希望只做⼀块。我觉得 AI 这个事情很⼤,并不需要我……我只做⼀块。如果聚焦,并且我认为这⾥的⽣意利益已经⾜够⼤,就如果是 AI 时代会产⽣很多家万亿级别的公司,我觉得我们是其中⼀家。

我们⼀直做其中⼀⼩块,我们是其中⼀家已经没有什么问题了,并不需要我……我并不是信⼼勃勃要做地⽅。我觉得最可能是⽐较难变,且你真的想做别的话,你还是会有更多的主意,这个会……这是我们的态度。

譬如说,⾄少在 To B、To C 这两个业务上,⽬前能看到的,真的想做 To C 闭环的,反⽽我们做得好;真的想做 To B 闭环的,说不定也没有我们做得好。你想要得越多……

然后还有,To B 这个可以多说⼏句。To B 业务的上限应该还是需求,在现在这⼀代AGI、AI 技术的背景下,To B 的需求应该是有限的。它会快速增⻓,但并不是⼀个⽆穷⼤的事情,最终还是受制于需求,不是算⼒。

在当前技术的条件下,收⼊有多⼤,最终还是取决于需求。因为你这样想,我⼗个⽉就能收回成本,我肯定是如果有去处,我⼀块买,是因为没有那么多事情。对,需求应该会越来越⼤,如果随着技术持续有突破,这个需求会越来越⼤。

多模态布局,我们⼀直在做。对产品来讲,它很重要;对 C 端⽤户产品来讲,它很重要。但是对智能的上限,它是⼀个组件,它不是主线本⾝。

但是它作为⼀个组件,多模态我们肯定会做,⽽且我们也在做。我们应该会上相关的模型,就是我们 V4、V4 的后续版本会⽀持原⽣的多模态。但是我们对多模态、对智能来讲,它是个组件,我们不把它当作智能本⾝,它的主线跟搜索⼀样。

搜索也是⼀个组件,多模态也可以,我们的理解它也是⼀个组件。Scaling,我们是信Scaling,肯定是规模越⼤,效果越好,能够解锁更多的功能。阻⽌我们 Scaling 的其实就是算⼒,并不是我们不想 Scaling,是我们没有那么多的算⼒去做这个 Scaling。

我们没有触摸到这个上限在哪⾥。我们训练这么⼤的模型,并不是因为我觉得这么⼤的模型就够了,⽽是我刚好有这么多资源。我是按照我的资源来算,我能够接受、能够训练的模型是多⼤,是这样算出来的,并不是这个模型就够了。

⽬前来看,模型收益还是⾮常明显的。我们还没有机会碰到这个 Scaling 的墙,这离我们还很远。硅⾕在说 Scaling 到头的时候,那是对硅⾕来说;对中国⼈来讲,我们离那个还很远,我们根本就没有 Scaling 到那个程度。

这个 Scaling 包括数据的 Scaling、模型规模的 Scaling,然后训练成本。我们离探索这个Scaling 的上限还⽐较远,就是没有那么多算⼒。但我们也会不遗余⼒地去推进这个Scaling 的上限。

包括我们融资完之后,我们有更多的算⼒,可能训练更⼤的模型。时间内买到,就在越短时间内买到;如果能半年精⼒全花完,那么这是最好的,实际上做不到。

下⼀代模型的核⼼能⼒,我觉得它必须要有持续学习的能⼒,它才能叫下⼀代模型。在那之前,我们能做的就是成本,然后效果做得更好,速度做得更快。但是要有⼤突破,它应该是具备持续学习的。

然后还有⼀个问题,就是为什么好像我们特别在乎这个模型的计算效率?因为我确实发现,不是所有⼈都很在乎这个模型的效率。⼀个商业化公司来讲,没有动⼒去追求模型的效率,因为模型效率⾼⼀点……

所以,它没有那么⼤的动⼒去追求模型效率要⾮常⾼。所以⼏个创业公司,他们⾃⼰并不会……你没有听到他们说低成本是他们追求的东⻄,因为那个不符合他们的利益。低成本了,你还赚什么钱?低成本了,你就收不到什么钱了。

相反,这是我们愿景的⼀部分。或者说,我们的愿景,我们的同学在乎这个成本,因为我们的同学都是普通⼈,他知道⽤这个都是要花钱的。他能够有这个同理⼼:别⼈要花钱来⽤,那么别⼈如果便宜⼀点,别⼈能够接受的程度会更⾼。

所以我们有很多同学还是希望我们能够把成本做到更低。但是如果你从商业⾓度讲的话,其实不会这么考虑。从商业来讲……

DeepSeek创始人梁文锋四小时投资人会议实录(一)
DeepSeek创始人梁文锋四小时投资人会议实录(二)
DeepSeek创始人梁文锋四小时投资人会议实录(四)
DeepSeek创始人梁文锋四小时投资人会议实录(五)