02AGI 技术路线
00:51:02–02:08:18
下一阶是学会学习
00:51:02
但就可以替代天下的人了,所以我们离下一步还差一个学习去学习。
AI 的发展,我们可以理解成它是一个阶梯。去年走的阶梯是 CoT ,就是思维链。因为我们发现,通过思维链的方式,可以让智能达到一个更高的水平。通过它自己思考,可以让这个上限,可以让这个 AI 能做更多的事情。
那么我们又跨过了一个阶梯。今年的阶梯就是 Agent ,因为我们发现,用 Agent 的方式,即便多有事情也可以做,它的能力范围会更大,它的智能上限会更高。
为什么是阶梯呢?因为后面的每一步都是基于前面的基础上的。 Agent 要用到 CoT ,然后 CoT 也要用到前面的阶梯,前面的阶梯就是语言模型,所以它并没有一步是白走的。
所以, AI 的发展,智能的走向是有迹可循的。说今年走的这个阶梯是 Agent ,但是 Agent 这个阶梯,它也是会走完的。就是它把所有可能解决的问题都解决完之后,但是它还是不能替代你的员工,但是它已经到它能力的上限了。
就好像 CoT 一样, CoT 到它的上限之后,它已经超过最顶尖的人类了,在做奥数题、写程序上面已经超过最顶尖的人类了。但是它还是停在那个地方,它那个技术并没有能够到达 AGI 。
所以你看, AI 这个智能的走向,它是有迹可循的。然后在 Agent 之后,我们觉得应该要解决的问题是持续学习,就是怎么让模型可以持续地学习,而不是说你要给它一个很强的训练,它应该能够像人一样做一个比较长时间的持续学习。
这个问题跟完成任务等等是同一回事,它们相关,解决的是同一个问题。我们现在站在 Agent 这个地方,能看到的是下一个瓶颈,就是持续学习。下一个要解决的问题,就是解决怎么持续学习,这个是看得到的,是相对来讲比较明确的。
就是卡在前面的这个障碍,你必须要跨过去,而且一定是有办法能跨过去的,但需要时间。持续学习之后,可能我们就会来到一个奇点。这个奇点就是,当这个模型能够持续学习之后,它已经能够做人类能做的所有事情了。
它就能够自己开发自己的版本,能够自己再研究,然后开发自己的下一个版本,开发更前的人工智能模型。所以它就会到一个奇点,能够实现自己的迭代。
但这个奇点,它并不是一个奇点,它也是一个渐进的过程。这个过程可能也是一个比较长的渐变,它不是个突变。但是习惯性地,我们都认为它可能是个奇点。
因为在很早之前,那些预言家认为这里会有个奇点,但其实它不是一个奇点,它是一个连续的过程。然后这一步走完之后,我觉得才是具身智能。
这是我们的推测,这是我们觉得这个时间表应该是:先解决学习去学习,然后再到那个智能的奇点,能自我迭代的奇点,然后才是具身智能。到具身智能之后,它就走进现实世界,可以给你做家务,可以给你养老。
我们觉得这是一个比较理想的路线图,但每个人的观点不一样,没有对错之分。只是我们觉得,这个路线图是最轻松的。
这个路线图是因为每一步你要做新的都很少。这个路线图我们可以不用加班。但是如果路线图是反过来的,比如说它要先实现具身智能,那么这里自己做得很累,这是一个很苦的活。我们不希望是这样的路线图,我们希望做得轻松一点。
如果说我们先解决持续学习,再解决那个自我迭代的奇点,再解决具身智能,这个路上就很轻松。因为到后面之后,你可以用前面的技术来帮助开发后面的技术。奇点之后再做具身智能,那个就不用人来做,就不用我们来做了,那个模型自己就可以出来了。
所以这个是回答我们的长期目标是什么。我就跟他说,这就是我们的长期目标,就是我们说的 AGI 。
大家回到现实。去年最重要的现实就是,大家都要做 Chatbot ,要抢C端的流量。那么今年的现实是,大家都要抢 To B的收入,要参与到这里面去,因为如果不参与的话,根本就不在牌桌上,对不对?
但我们并不认为它是一个重要事情,或者说,在我们公司内部,我们真正关心的,其实是刚刚我说的这些 AGI 的路线图,以及下一步这个技术怎么突破。
但是有一点很奇怪的是,最想得到的东西,反而你就得不到。那个并没有那么在意的事情,反而是还蛮容易能够得到。
这里边有一个战略上的优势,就是我们心里面想着 AGI ,我们做的是 AGI 。那我们再做那个应用,再做那个C端、B端的时候,根本就不用太多的心思去做那个事情,其实花很少的精力就可以了。
我觉得是说,你站在一个技术的高位上来做相对低一级别的技术,是有这样降维打击的。
至少在去年的C端,我们看到确实是这样。我们没有在C端上花很多力气,甚至一度我们都不想维护那些用户了,但是用户赶都赶不走。
因为真的是赶不走,所以最终都还在。但稍微 …… 然后今年B端的这个收入,现在看起来这个增长还比较乐观。我觉得可能这个数字跟同行比的话,应该也是比较好的,我估计。但是我们并没有花很大的精力去做这事情,我们根本就没有
芯片能买就不自己造
02:08:18
直接相关那一块,我觉得可能对于我们的很多产业伙伴来讲,他们比我们更关注类似 ……
应该是别人的意义,不应该我把它诠释了。
未来我们会不会自建大型的集群?我觉得自建大型的集群是肯定要的,我们自己一直在做这个事情,我们所有的集群都是自己建的。但是未来要不要自研芯片,我觉得取决于这里的收益有多大,取决于收益有多大。
Tesla 、培育 …… 这个事情。假如说你是运营发电厂的,你并不一定需要去造发电机,对不对?发电设备可以是别人造的,只要它的价格合理,你为什么要自己造?
所以,我希望不用去做芯片。我希望能够以合理的价格买到芯片,这样我就不用去做芯片。我觉得这个很有可能是这样的,就是最近英伟达芯片的利润,不见得是可以 …… 虽然 ……
我们希望只做一块。我觉得 AI 这个事情很大,并不需要我 …… 我只做一块。如果聚焦,并且我认为这里的生意利益已经足够大,就如果是 AI 时代会产生很多家万亿级别的公司,我觉得我们是其中一家。
我们一直做其中一小块,我们是其中一家已经没有什么问题了,并不需要我 …… 我并不是信心勃勃要做地方。我觉得最可能是比较难变,且你真的想做别的话,你还是会有更多的主意,这个会 …… 这是我们的态度。
譬如说,至少在 To B、 To C这两个业务上,目前能看到的,真的想做 To C闭环的,反而我们做得好;真的想做 To B闭环的,说不定也没有我们做得好。你想要得越多 ……
然后还有, To B这个可以多说几句。 To B业务的上限应该还是需求,在现在这一代 AGI 、 AI 技术的背景下, To B的需求应该是有限的。它会快速增长,但并不是一个无穷大的事情,最终还是受制于需求,不是算力。
在当前技术的条件下,收入有多大,最终还是取决于需求。因为你这样想,我十个月就能收回成本,我肯定是如果有去处,我一块买,是因为没有那么多事情。对,需求应该会越来越大,如果随着技术持续有突破,这个需求会越来越大。
多模态布局,我们一直在做。对产品来讲,它很重要;对C端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。
但是它作为一个组件,多模态我们肯定会做,而且我们也在做。我们应该会上相关的模型,就是我们 V4 、 V4 的后续版本会支持原生的多模态。但是我们对多模态、对智能来讲,它是个组件,我们不把它当作智能本身,它的主线跟搜索一样。
搜索也是一个组件,多模态也可以,我们的理解它也是一个组件。 Scaling ,我们是信 Scaling ,肯定是规模越大,效果越好,能够解锁更多的功能。阻止我们 Scaling 的其实就是算力,并不是我们不想 Scaling ,是我们没有那么多的算力去做这个 Scaling 。
我们没有触摸到这个上限在哪里。我们训练这么大的模型,并不是因为我觉得这么大的模型就够了,而是我刚好有这么多资源。我是按照我的资源来算,我能够接受、能够训练的模型是多大,是这样算出来的,并不是这个模型就够了。
目前来看,模型收益还是非常明显的。我们还没有机会碰到这个 Scaling 的墙,这离我们还很远。硅谷在说 Scaling 到头的时候,那是对硅谷来说;对中国人来讲,我们离那个还很远,我们根本就没有 Scaling 到那个程度。
这个 Scaling 包括数据的 Scaling 、模型规模的 Scaling ,然后训练成本。我们离探索这个 Scaling 的上限还比较远,就是没有那么多算力。但我们也会不遗余力地去推进这个 Scaling 的上限。
包括我们融资完之后,我们有更多的算力,可能训练更大的模型。时间内买到,就在越短时间内买到;如果能半年精力全花完,那么这是最好的,实际上做不到。
下一代模型的核心能力,我觉得它必须要有持续学习的能力,它才能叫下一代模型。在那之前,我们能做的就是成本,然后效果做得更好,速度做得更快。但是要有大突破,它应该是具备持续学习的。
然后还有一个问题,就是为什么好像我们特别在乎这个模型的计算效率?因为我确实发现,不是所有人都很在乎这个模型的效率。一个商业化公司来讲,没有动力去追求模型的效率,因为模型效率高一点 ……
所以,它没有那么大的动力去追求模型效率要非常高。所以几个创业公司,他们自己并不会 …… 你没有听到他们说低成本是他们追求的东西,因为那个不符合他们的利益。低成本了,你还赚什么钱?低成本了,你就收不到什么钱了。
相反,这是我们愿景的一部分。或者说,我们的愿景,我们的同学在乎这个成本,因为我们的同学都是普通人,他知道用这个都是要花钱的。他能够有这个同理心:别人要花钱来用,那么别人如果便宜一点,别人能够接受的程度会更高。
所以我们有很多同学还是希望我们能够把成本做到更低。但是如果你从商业角度讲的话,其实不会这么考虑。从商业来讲 ……
录音 2026 年 5 月 20 日,文字据发言整理,个别专名以录音为准。