DeepSeek创始人梁文锋四小时投资人会议实录(五)
[03:05:48]
我⾄少觉得, 它得能够持续学习吧。
国产硬件在这个时间能追上吗? 我觉得国产⽅⾯可能需要⼀个⼏年的时间。 国内⾸先得解决⽣态的问题, 因为⽣态是⼀个信⼼的问题。 解决⽣态的问题, 然后再解决产能的问题,我觉得应该是能够逐步解决的。
我不太相信未来五年之后, 我们还卡在产能的问题上。 现在肯定是卡在产能问题上, 今年、 明年、 后年, 我觉得可能都还是卡在产能问题上, 但五年之后, 我觉得可能不⼀定,我还是⽐较乐观的。
然后第⼆个问题是, 思考未来的组织架构, 对⼈员的规划规模。 ⾸先, 我们之前的组织架构是⾮常分散的, 因为没有组织架构。 但是我们⼈在进⼀步扩⼤之后, 这些肯定是需要做出⼀些改变的。
现在只能说, 这⾥会需要做很多改变, 但现在很难⼀下⼦全部表达出来。 最后应该还是要分不同的部门, 应该有些部门是我们需要建⽴起⽐较严谨的层级结构的。 另外⼀些部门,可能还是会维持⼀个⽐较松散、 ⽐较扁平的结构。
随着⼈员的增加, 我们会做这个调整。 应该是我们⻢上就得做这个调整, 因为我已经在做这个调整。 已经不做这个调整的话, 很多事情是没法推进下去的。 确实有很多部门, 是应该有组织架构的。
然后⼤家还有问题是, CV 是先于它的哪个版本是吧? 我觉得我们现在, 线上发了这个GCV4 这个版本, 还是⽐较粗糙的, 然后能⼒⽅⾯还很多都需要时间。
我们⼀般, 对我来讲, ⼀个⽐较舒适的发版节奏, ⼤概是两三个⽉发⼀版。 上次发版可能是四⽉底, 那么下次发版可能是六⽉底, ⼤概是这样⼦。 如果没有意外的话, 应该还是会⼀版⽐⼀版好的。
在 50B 激活的这个尺度上⾯, 我感觉最终我们跟现在的这波开源不会有太⼤差别。 就在推理速度跟效果上, 我感觉可能就不会有太⼤的差别。
但是跟它那个⼤尺⼨的模型, 就它⼀个没公开的模型, 应该差距还是⽐较⼤的。 那个差距应该是, 我们这个激活参数应该是做不到的, 这就肯定得是⼀个更⼤尺⼨的模型, 可能⽐如说是 150B。
那么 150B, 我觉得按照我们现在训练的进度, 今年, 乐观的是今年年底可以开始去训练, ⾄少是明年四……差距还是⽐较⼤的。 对, 这是跟 OCE 的差距。
你好, 我其实有⼀个问题, 就是经常您说到这个 AGI, 它实现的过程是⼀个渐进式的过程, ⽽不是会有⼀个突变。 所以我可以理解, 这是⼀个没有临界点的过程吗?
它没有临界点, 但是它是⾮线性的。 我们现在⽐较相信⼀个叙事是, AI 可以加速 AI 的研究, AI 可以加速 AI 的研究。 就是说, 它不是线性的, 因为你可以⽤ AI 来加速你⾃⼰的研究, 所以它到后⾯可能是⾮线性的。
明⽩。 所以当下您的这个, 我理解前⾯的结论可能就是, 语⾔模型继续 scaling 是够的,是⾜够的, 做到这个状态。
只能说语⾔模型的 scaling, 我现在没有看到有上限。 我们现在的智⼒⽔平, 或造成美国的智⼒⽔平, 都没有看到上限。
明⽩。 因为我⾮常好奇, 就是你说, 对美国来讲, 800B 激活这个模型, 说⽐它能训练起, 但它也⽤不起来, 所以它只能训练出来, 它也很难拿出来给⼤家⽤了, 因为确实有点贵。
我之前其实很好奇的⼀点就是, ⼈类其实拥有语⾔能⼒就是近⼗万年的事情, 然后前⾯可能进化了三⼗七亿年。 但在训练 AI 这个事情上, 可能是可以, 你说那个顺序是可以反过来的, 但最终可能还是会进⼊到所谓, 也不⼀定叫世界的模型, 还是要进⼊到物理模型或者具⾝的那部分, 是吧? 就是在这个上限之后。
对, 我觉得具⾝肯定还是要进⼊, 最终具⾝。 所以对我们公司来讲, ⾃然⽽⾔, 可能终点都是具⾝。 因为对⼀个正常⼈来讲, 他的需求并不是电脑, 对不对? 因为正常的⼈, 他吃喝玩乐、 ⾐⾷住⾏, 他不需要电脑。
他需要的是, 所以他还是需要具⾝智能来解决具体⼈⼒的需求。 如果说⽬标是解约⼈⼒需求的话, 所以具⾝我觉得就是绕不过去的。
明⽩。 所以阶段性地讲, 假如说到达类似, 也不⼀定是临界点, 就是可以⾃进化、 可以⽐较好的⾃进化, 或者接近这个与 SV 的这个上升的到那个时间点上, 我很好奇会希望这个状态的 AI 落地的第⼀个让是……
可能跟现在不⼀样。 我们是希望它能够, 就是直接假如说没有具⾝, 那么我们对 AGI 的定义, 或者我们希望 AGI 能做什么呢? 它能帮我迭代下⼀版模型, 能帮我迭代下⼀版模型⼀样。
然后如果有了具⾝之后, 我们希望它做的也是, 让它来迭代下⼀版的具⾝, 它来做下⼀版机器⼈。
我还是很好奇⼀点, 就是因为我看之前 DeepSeek 的采访等等, 应该是在⼀些重要的⽅向的选择和研究的选择上⾯, 品位和直觉是很重要的, ⽽不是简单的⼯程优化。 那如果之后 AI 可以⾃进化的话, 这个品位、 taste、 直觉这些东⻄还重要, 或者说重要的会是什么?
AI 现在不缺品位和直觉, 它缺的是持续学习的能⼒。 AI 的品位和直觉没有问题。 你让它写个⽂章, 它的品位和直觉, 我觉得没有什么问题。
前⾯还有⼏个问题, 我看⼀下那个问题。 我看屏幕上谈了⼏个问题, 但是我这边看不到了。
梁总, 我屏幕上留了个问题, 我给您再念⼀下。 其实是想请教⼀下, continuous learning, 就是持续学习, 您也提到, 很多研究员也提到是⼀个还没解决的研究问题。 然后那个 coding agent, 尤其是追上 MILES, 就是
[03:17:47]
Scaling 到这个 Office ⽔平、 MIS ⽔平是⼀个⽐较确定的⽬标。 对于⼀个还没解决的研究⽬标和⼀个⽐较确定的 Scaling ⽬标, 您认为应该怎么分配研究资源, 尤其是研究员这块的⼈才资源, 怎么样才能达到最好的平衡和效果?
模型 Office 是⼀个⽐较确定的⽬标, 但是模型 MIS, 我觉得还不好说是确定的, 只能说是⼀个⽬标。 模型 Office, 我觉得应该是⽐较确定的。
CoT 不占资源。 做朋友任意研究, 他不消耗卡, 只需要很少的卡, 他需要的是想法; 他也不消耗⼈才资源, 因为不需要有⼈⼀直在那⾥做。 他不是⼀个项⽬, ⽽是需要有很多⼈都在那⾥想这个问题。
所以并不需要给它分配什么资源, 因为它不需要资源。 你要训模型, 要做模型、 发模型,做模型的效率实验才需要资源。 刚才讲的, 对⼈、 对卡的资源消耗都不多。
所以我们叫这个叫“摸奖”。 门槛很低, 谁都可以去摸, 但是谁能摸出什么来, 这个可能我也不知道是看天赋还是看什么。
所以这⾥并不需要我们去分配资源。 只是说, 我们跟其他公司不⼀样的地⽅, 就是我们会花时间去讨论这个问题, 会去想这个问题, 然后把它当做⼀个重要的事情。
在公司⾥, 它是⼀个重要的问题, 是⼀个我们会花时间去思考的问题, 但是并不需要花很多资源去做。
然后下⾯我还看⼀个问题: ⼤模型的幻觉问题⽐较影响⽤户的体验。 幻觉问题也是有⼀个⽅法可以解决的, 但是这是⼀个⻓命题。 幻觉问题可以认为是⼀个可以通过更好的 Post-training 解决的, 是⼀个能解、 能够改善的问题。
只是⼤家没有花很⼤的⼒⽓去做。 或者说, 对我来讲, 幻觉是⼀个问题, 但我们归结可能是产品问题。 我们会去解决它, 但是不是重点的问题。
前⾯还有⼀个标数据的问题。 我们在数据标注⽅⾯, 这跟我们的资本投⼊有关。 以我们这个资本投⼊的结构, ⽀撑不起那么多⾼质量数据标注的成本, 因为成本很⾼。
美国数据标注的成本跟中国数据标注成本没有什么区别。 中国去标数据并没有成本优势, 尤其是标⾼端数据上并不会有成本优势, 使得我们很难投⼊去像美国这样标数据。 这条路在中国是很难的, 因为标数据实在太贵了, 不管是我们外标还是我们⾃⼰标, 都很难受。
所以现在基本上是两条腿⾛路。 并不是说我们完全不能标, ⽽是因为标数据有⼀些成本低, 有⼀些成本⾼。 我们先标成本低的。
所以你也可以认为, 现在我们公司有⼀半的⼈在标数据。 有⼀半的核⼼研究员, 最重要的⼈, 有⼀半在标数据。 我们就集中在标数据。 解决 AI 这个问题, 在现在这个阶段靠的就是标数据。 你只要看就是⼀个数据。
梁总, 谢谢你。 你讲得特别地, 我们⾮常有感受, ⾮常好。 感谢你。 我请教⼏个问题。
第⼀个问题, 您刚才讲, 中国的模型⽐美国的模型在效率上肯定是强的。 你讲的还有⼀些其他⽅⾯, 未来也有可能会⽐美国强。 你觉得是哪些⽅⾯, 我们在智能或者在其他⽅⾯会⽐美国强?
我觉得在很多体验⽅⾯, 有可能我们是能⽐美国做得好的。 即不说⾃⼰的体验, ⾃⼰的产品体验觉得挺好的, 我觉得我们在⽤户体验⽅⾯不⼀定会⽐美国差。
在产品⽅⾯, 产品能⼒上不⼀定会⽐美国差。 成本应该也会⽐美国低, 所以有可能中国还是会有竞争⼒的。
其他⽅⾯, 如果说有结构性的优势, 我觉得可能也没有。 但是在成本和产品这两⽅⾯, 我觉得确实是有⼀定的结构性优势的。
成本这个很好理解, 是因为他们都不⽤做, 所以他们就不发展这个能⼒。 他们肯定没有我们重视这个事情。 我们可以把它当做⼀个⾮常重要的事情, 但对于他们来讲, 这个是不重要的。
产品也是, 原⽣通过很多公司, 产品能⼒还是可以的。 所以我觉得这两⽅⾯可能是有结构性优势的。
好的。 第⼆个问题, 请教您, 您刚刚讲到后训练, 我们投⼊相对成本⼜⾼, 像 Anthropic和 OpenAI 都投⼊巨⼤的⾦额。 这次融资以后, 您觉得我们会在后训练⽅⾯加⼤投⼊吗?
差距主要是在⾼质量数据的标注上, 然后主要是在 AI 研究⾥⾯。 肯定会加⼤投⼊, 但是像⾼质量数据的标注, 典型不是资本投⼊。
⾼质量数据标注的瓶颈, 我觉得是时间, 就是需要时间。 因为对 OpenAI 来讲、 对国外来讲、 对 Anthropic 来讲, 他们都更早, 然后资本更多, 卡也更多。
这种情况下, 我们国内可以认为是最近半年才开始做, 所以在时间上, 我觉得是需要更多时间的。 这个跟资本投⼊关系不太⼤, 因为哪怕没有更多的资本投⼊, 原来的资本也够它以最快的速度在扩张了。
但是这个速度是有上限的, 瓶颈不是说我能够⻢上有更多的⼈, 并不卡在钱上, 也不卡在卡上。 但是它确实是在⼀个快速扩张的过程。
所以我们觉得⼀年之内, ⾼质量数据这个问题做得⽐较好, 我觉得国内应该是可以预期的。 我觉得⾯可能没有那么冷, 但它确实是需要时间。
谢谢。 然后第三个问题, 就是我们看到 Anthropic 他们⽤⾃⼰的模型做⾃⼰的产品, 推出了很多纵向的⾦融、 法律……
[03:29:17]
甚⾄未来要往医疗⽅向⾛, 您觉得在这种纵向应⽤⽅⾯, 某个阶段我们也会考虑吗?
我还没有想得很明⽩, 未来我们国内的商业模式是怎么样的, 或者说最顺利的路径是怎样的, 我们还没有到那个阶段。 国内情况和国外情况不⼀定⼀样, 国内到时候是什么样, 我觉得现在还⽐较难判断。
国内我们现在以⽬前的情况来看的话, 我觉得最合理的做法应该是全⼒做通⽤的 Agent,其他的 Agent 优先级应该更低, 包括⾦融、 医⽣这些 Agent。 要先做 Coding, 因为 Coding Agent 能够做到很多, 还有很多垂直的 Agent。 现阶段我们觉得最重要的, 应该还是 Coding Agent。
讲得很清楚, 谢谢您。 还有⼀个问题, 我们也想请教您。 其实我们做 DeepSeek, 也很佩服您, ⼀直在以⼀个⾮常纯粹的科研⽅式来做 DeepSeek。
但现在这个⾏业确实也⾛到了资本市场, ⾛到了资本化这条路上。 您⼜是⼀个⾮常负责任的⼈, ⽆论是对⼩伙伴还是对投资⼈, 您也都是⾮常负责的。 那么, 在纯粹科研、 纯粹做 AGI 的⽅向和资本市场之间的平衡, 您未来肯定还要⾛资本市场, 肯定还有公众股道, 您觉得以后怎么 balance? 这个您是怎么考虑的?
我现在觉得应该是能够做到的, 就都要。 假如说我今年能够有⼏个亿美⾦的 B 端收⼊,再加上我们 C 端有⽤户, 那么这本⾝就已经有⼀定的商业基础。 以明年我们 B 端有收
⼊, 如果这个需求可以再增⼤的话, 公司离净利润已经不远了, 可能就已经是净利润了。
可能就已经不是⼀个纯烧钱的阶段了, 所以我感觉后⾯能做的、 能操作的动作应该还是⽐较⼤的。 或者说, 最坏情况卖 API, 可能都能够⽀撑⼀个上市公司。 就如果说技术后⾯没有新的进步了, 我们的技术就冻结在这⾥了, 那么最后我们就全⼒卖 API, 把这些服务做好, 我觉得也够的。
所以我觉得还是有信⼼的, 确实没有那么难。 因为确实是在⼀个杠杆⾼的地⽅, ⼜在⼀个发展⾮常快的领域, 它可能就是没有那么难。 只能讲, 我们希望有更⼤的梦想, 但是我们也有保底可以拿出来的业绩。
谢谢您, 讲得很好。 问题问完了, 谢谢。
感谢您分享。 前⾯提到⼀些问题, 想跟您再问⼀下。 因为我觉得 DeepSeek 其实最⼤的和其他公司的区别在于, 我们的组织跟其他⼈不⼀样, 或者说组织形式不⼀样。
但组织形式既跟我们的⽬标相关, 可能也要去考虑组织⾃⾝的边界和效率。 我不知道, 从宏观的⾓度考虑, 我们这个组织形式会有⼀个好的学习对象吗? 历史上可能 Bell Labs,还是⼀个什么样的形态可能是⽐较理想的? 还是说我们⾃⼰觉得也没有理想的, 更多还要靠我们逐渐去探索?
可能在⼀个新的时期, 只能靠我们⾃⼰来做探索。 因为我们的组织形式其实跟美国的⼏家公司肯定都不⼀样, 对吧? 三家公司⾃⼰也不⼀样, 但他们⾄少会从⼀个商业公司的⾓度出发去探索。
我可能主要想再问⼀下组织这个问题。
⾸先, 我们没有模仿的对象。 每⼀步都是我们从实际情况出发, 实事求是, 根据实际情况来做决策, 找到我们应该怎么做。 所以它是⼀个时代的产物, 或者说是现实情况的⼀个反应, 它并不是⼀个模仿的结果。
就是说, 在这个情况下, 我确实最优解可能就是这样, 或者说我⾃⼰认为, 我们⾃⼰选的路就是这样。 每⼀步我们肯定都是思考过的, 肯定都是选过, 反正选的结果就是这么选 的。 它并不是因为看到谁这么选, 我们这么选, ⽽是因为我们分析了利弊⽽这么选。
那么在未来可能也是⼀样, 我们并没有去模仿谁。 我觉得我们跟 Bell Labs 还是不⼀样的, 因为它明确是不需要有商业化的, 因为它是个……但是我们明确是要有商业化的。 我们最终还是要能活下去, 我们毕竟是⼀个公司, 政府不会给我⼀分钱。
所以我们可以有⾮常远⼤的使命, 但我们归根结底是⼀个公司, 我们要考虑怎么活着。 所以 B 端对我们肯定是重要的, 因为可能以后可能得靠它活着。 只是说现在不重要, 因为它现在是个成本线。
所以我觉得这个还是不⼀样的, 跟 Bell Labs 还是不⼀样的。 我们本质上还是⼀个公司。 历史上也有很多公司, 它也有利润以外的追求, 但并不能说它有利润以外的追求, 它就不是个公司。
很多公司做得很伟⼤, 因为它有⼀种利润以外的追求。 那个追求最后不但没有影响到它的商业化, 反⽽能让它商业化得更好。 我们本质上还是⼀个公司, 只是说我们在考虑赚哪些钱、 什么时候赚钱、 赚多少钱、 靠什么赚钱, 只是说我们有取舍。
梁总, 我有两个⼩问题, 快速跟您请教⼀下。 ⼀个是说, 您刚刚其实有提到 MILOS 的这个, 可能不是⼀个很确定的⽬标, 但是肯定会往这个⽅向去做。 然后您也提到激活参数可能⽐如说……
[03:41:02]
下⼀代可能会是在 150 到 250 B 左右的⼀个情况。 这种情况下, 您觉得 150 到 250 B 是对标 O4.7, 还是可能会对标到别的? 这是第⼀个问题。
第⼆个问题, 您前⾯也提到了, 我们现在在整个 inference 上⾯⽤了⼀些除了 CUDA 以外的编译语⾔。 我理解原来咱们基于英伟达的⽣态, 可能会⽤ PTX 这些⽐较多。 现在⽤上更多类似您刚提到 TileLang 这些的话, 是不是会⼤幅降低我们在 inference 上⾯的⼀些效率, 或者短期降低效率?
我不知道您会怎么看编译语⾔的这种变化带来的效率损失, 还是说⻓期其实是⼀个可以补充的状态, 是提⾼效率?
是提⾼效率, 是⼤幅提⾼效率。
OK, 反倒没有什么负⾯的影响?
对, 是⼤幅提⾼效率。 所以说这是⼀个机遇。 相当于以前你是离不开 CUDA 的⽣态的,现在我们可以抛弃它的⽣态, ⽤⼀个更简单的⽅法, 就⽤ TileLang。 它是⾼级语⾔, 写那个程序也是很快的, 要写的代码量很⼩了, 我可以把它重写⼀遍。
明⽩。 所以这两个都其实是⼀个, 像您提到的 AI 带来的⽐较⼤的机会, 不是⼀个可能短期需要去弥补的缺点。
对, 它是技术发展的⼤机会。 它不是 AI 的机会, 因为我们还有⼀个项⽬, 我们在⽤ AI 来写 TileLang。
那是不是更快?
现在所有 TileLang 都是⼈写的, 但是它已经⽐原来写 CUDA 的要快很多了。
明⽩。 所以哪怕是对于硬件底层的执⾏效率, 您觉得也是没有影响?
损失 1% 到 2%, 我觉得是可以接受的。
OK, 明⽩, 理解了。 好的, 谢谢您, 很清晰。
其他⼈还有没有什么问题?
没问题, 我们今天就先这样。
好的, 谢谢。
⾮常感谢⼤家的时间, 谢谢梁总, 谢谢。拜拜。
拜拜。
DeepSeek创始人梁文锋四小时投资人会议实录(一)
DeepSeek创始人梁文锋四小时投资人会议实录(二)
DeepSeek创始人梁文锋四小时投资人会议实录(三)
DeepSeek创始人梁文锋四小时投资人会议实录(四)