03算力与国产芯片
01:26:41–01:56:36
卡不够就先做小
01:26:41
如果我半年之内就把这个钱花完的话,可能是最理想的。因为我把钱变成英伟达卡,肯定是比放在银行里面好。放银行里面,我现在已经可能是存两个点,好像就要。但是买英伟达卡,十个月的社会成本。
所以肯定是你能买到多少就买到多少。最先如果买了卡之后,后面我有很多空间,我通过提供服务或者我怎么样,我总是能够有现金流的。我有现金流我就可以活,我就不需要在我账上面放很多很多钱。
所以说,我们只担心买不到那么多卡。如果能够把钱都变成卡的话,那我们会毫不犹豫把所有的钱都变成卡,并且在这里面我们是愿意付一定的溢价的。就是我们愿意付一定的溢价去把它变成卡,因为这太划算了。
哪怕我们在付完溢价之后,其实我们也很难实现这个目标。那么客观上来讲,如果说我今年能够花掉两百亿,那么就属于我们的采购部门业绩超级好了。
我们跟美国的差距主要在资源上面,然后人上面差距不是很大的。人上面几乎没有差距,因为就是同一批人,可能是中国人。中国人出去的时候,有一些人留在国内,有些人留在国外,有些人去国外,他并没有说是聪明的人去国外,没有的。
其实它是比较随机的。最聪明的那些人,可能不是说一半多一点去国外的,但有一半少一点留在国内。国内人才是不缺的,而且我们的基数大,我们每年有那么多人的补充。
人才不是瓶颈,资源是最大的瓶颈。资源首先影响到人才培养,因为算力少,我们能做的实验机会比较少,所以我们的人才整体上比美国有差距。人才的差距,本质上也是因为算力的差距。
在现在最大的模型上,我们其实训不起的。我们哪怕把五百亿全花掉,其实也训不起。哪怕能堆起来也用不起。现在最大的模型,它激活大概是八百B;国内的话,我们还在几十B的这个规模,国内最大模型可能就几十B激活,那么差一个数量级。
如果我要训练跟 AI 同样大的模型,应该需要五万张 GB300 ,或者华为 950 ,二十万卡。
这只是训练,还没有考虑做研究。所以我们跟美国之间最大的差距是在资源上面。
我们现在的资源,以及我们今年之内、接下来几个月的资源,包括马上大资源,也只足够我们在十B激活的这个规模里面去做更多的实验。因为我在几十B激活的这个规模里面,还有很多实验要做,还有很多事情需要搞清楚的。我们应该离能够训八百B的模型还比较远,时间还非常多,没有那么多卡。
所以我们跟美国的区别,我认为就是资源上的区别。我们可能会认为,我们看到的所有区别,包括人才的区别、模型能力的区别、应用的区别,可以认为都是因为算力资源上的区别。
算力资源一方面是国内本身卡就买不到,另外一方面是我们的资本投入比美国要少。我们在资本投入层面上少了很多,基于人才的工资在这里面占的比重是很低的。你看他们开的薪水一个亿美金这种,但算起来,人才的薪水还是占比很少,大头还是算力。
这个问题目前基本上无解,因为华为的产量也是有限的。因为我要训八百B的话,我就得二十万张华为最新的卡,这只是训练,还没有考虑做研究。
所以我们现在根本就不会考虑,到这么大的一个规模上去跟美国竞争。我们现在输,还是在我们能够训练得起、能够用得起的规模上,就几十B激活的规模上要先把它做好。再等下一步有更多的资源的时候,再把它做到一百五十B、一百五十六B,或者两百五十B激活的这个规模。
所以我们跟美国在这里面有一个目前看起来很难弥补的差距。你要硬要训那么大模型也是能训,但是你没法做充分的研究。就是你在训之前,没法做充分的研究。
还有个大家比较关心的问题是,所有大模型竞争,它终局的差距会体现在什么地方?就是当大模型最终差距会体现在哪里?我觉得这个差距最终可能是没有太大差距的。
最终的差距应该是三方面:一方面成本,一方面时间,一方面用户体验。除此以外,可能是没有什么差距的。
成本比较好理解,你提供同样的服务、同样质量的服务,你能够以什么成本来提供。同样一件服务,不如说比亚迪的电池,在同等技术量的情况下,其他家是不是能够按照这个价格来提供,我觉得这个是个较难的事情。不是那么容易做到的,肯定是壁垒。
所以成本肯定是一个差异,我觉得可能成本是排在第一位的区别。然后第二个就是时间,你什么时候能够做到。你早几个月、晚几个月,它就不一样了。
第三个可能是体验,用户体验还是有些不一样的。这个用户中间还是会有一些用户粘性和用户壁垒的,但它可能不本质。本质还是第一个成本,第二个时间。你先做出来还是后做出来,你做到同样东西,是快点还是慢一点。
长期商业化路径和产品线进一步丰富后,怎么定价?我们觉得现在最值得做、最值得花精力的,还是做 AGI 。现在要把 AGI 往前再往前推,就是把智能的下限往上推,往前推。
这个应该是在现阶段,比做更多的产品线、考虑更多商业化路径更划算,或者说它是一个收益更大的路径。我觉得在未来的一段时间,以及过去的任何一段时间,可能都是这样的。就是说,如果说我们
用 AI 补芯片生态
01:56:36
我可以用 AI 来构建这个生态,就可以把跟英伟达一模一样的生态构建出来。第一个,因为有 AI ;第二个,有一些新的技术。比如说,我们家出了一个技术,叫 TileLang ,是一种高级语言。
用这个高级语言来写 CUDA 的算子,可以很快地把英伟达的整套生态全部都写一遍,再结合 AI ,这个看起来没有什么障碍。但是现在还没有完成,还没有做完,不过这个技术路线看起来是没有什么障碍的。
还有一点,因为 CUDA ,英伟达它是从游戏卡演变出来的,所以它在很多地方,游戏卡的设计跟游戏卡的设置是一脉相承的。 CUDA 是兼容游戏卡的。以前因为 AI 计算是一个很小的领域,比游戏卡的市场要小,所以这样是合理的。
但是现在计算卡的市场已经比游戏卡更大了,就没有理由这两个还需要耦合起来。现在的趋势是,以后就不再耦合了。那么专用芯片,不管是华为还是英伟达自己,以后都是专用芯片,都不是之前的这些东西了。
在这个背景下,原来英伟达生态的作用就大幅度减少了。因为对于一个专用芯片来讲,跟 CUDA 没有什么关系,它跟 CUDA 是不绑定的。或者说,这个芯片在设计的时候,就已经考虑到怎么建立这个生态了。
有点复杂,但 anyway ,国产 AI 芯片替代现在是有个历史性机会的。我们认为,未来一年之内,我们能够看到有一个事情被验证:国产芯片的生态完全没有问题。之前认为是有问题的,认为是用不起来、不好用,但是未来我觉得一年之内,我们能够扭转这个认知,或者会用事实来扭转这些。
国产 AI 芯片的硬件和生态都没有问题,唯一有问题的是产能不够。国产卡适配这一点,没有障碍,英伟达挡不住。如果是在一个正常的商业环境里面,我能买到英伟达的卡,那么国产替代是比较难的;但是在英伟达的卡买不到的情况下,所有人都迫不得已,都要去做国产芯片。
在这个背景下,国产卡的适配是没有任何障碍的。国产卡建立起跟英伟达一样、甚至比英伟达还好的生态,我觉得没有障碍,但还需要时间。
我们现在主要是跟华为有合作。华为他们自己适配,但我们自己会参与这个生态,会深入参与到华为这个里面去。华为的问题还是产能不足。像华为给我们的大概是一万六千张卡的产能,互联网大厂可能是十几万张,我们一万多张,我觉得这个比例也是比较 …… 但这已经可能是华为就这么多产能了。
所以我们也没法指望在华为上面训后面那个更大的模型,或者说训练几百B参数激活的模型,有时就有说在今年。但是明年、后年说不定是有机会的。
华为卡适配,我们主要做的工作是把它的高级语言编译器做好,把 TileLang 做好。把 TileLang 做好之后,问题可能就迎刃而解了。这个事情说起来比较复杂,但是我们在做,做完之后再来解释会清晰比较多。
你可以理解, V3 训练的时候,它用的还是英伟达的卡,但是已经不用英伟达的生态了。
V3 用英伟达的卡,但是没有用英伟达的生态,而是我们先写一个高级编译器叫 TileLang ,然后基于 TileLang 的生态来完成其他所有的事情,就已经几乎不依赖英伟达的生态了。
只要我把这一套东西,把这个过程重新在华为卡上做一遍,那么就完成了。我觉得这里可能是一个历史性的使命,即可以完全扭转之前大家对国产卡生态不好的认知。现在有些天时地利基本上都全了,就差时间。我觉得一年之内,应该会有很多人在上面都有,或者说都明白这问题算是解决了,剩下就是产能的问题。
我对国产算力是比较乐观的。我觉得在这一点上,英伟达是在掘自己的坟墓。华为的超节点,华为的 950 超节点,在性能和价格上可以完全平替英伟达的 GB200 、 GB300 。价格肯定要贵,但贵得有限。价格贵百分之五十、百分之一百,贵百分之一百无所谓,贵百分之两百都无所谓。
比如贵百分之一百,我觉得已经可以认为在价格上可以平替了。在任务上也是可以平替的,所有 GB300 能做的任务,华为超节点都能做,延时什么都一样。唯一的代价是,四张华为卡顶一张英伟达的卡,同时落后两年。
四张顶一张这个可以理解。落后两年的意思是,四张华为 950 能顶一张 GB300 。落后两年是时间上落后两年。华为 950 超节点是今年 Q3 还是 Q4 的货,英伟达 GB200 是两年前 Q3 的货,差两年。
英伟达今年 Q3 可能已经有新一代了。所以我们跟美国在芯片上的差距,我认为生态上以后不会再有差距,但是在芯片上是四倍加两年。
还有问题是,我们会不会向上游进行垂直整合?我希望不要。所以有个问题是,我们是不是会往上游应用进行垂直整合?我们希望不用这个,我希望是其他人来做这个事情。我不希望我把所有东西都吃了,我只要吃一块就好,我只要吃我最擅长那一块,或者我觉得我们自己认为最核心那一块,然后跟用户
录音 2026 年 5 月 20 日,文字据发言整理,个别专名以录音为准。