行业动态MIT Technology Review AI
来源时间 本站刊期
别被骗了——LLM不会推理
Don’t be fooled—LLMs don’t reason
以围棋第37手为由证明LLM不会推理,反例虽旧,却戳中能力边界的争论
判断
如果你在医疗、工程或科研场景评估 LLM,这份观点要求你把验收标准从“答得对”改到“能拿出可检查的推理状态”;否则 next-token prediction 的中间步骤仍不可追溯。
依据
作者 Thore Graepel 参与构建 AlphaGo,他回看 2016 年首尔那场五局赛:第二局第 37 手被 policy network(策略网络,负责猜强人类会走哪)判为专家人类大约 one in 10,000 才会走的选择,是 search machinery(搜索机制,负责展开并搜索游戏树)把它推了出来;AlphaGo 最终 4-1 击败李世石。作为对照,Deep Blue 在 1997 年靠人类硬编码规则,每步向前看 six to eight moves ahead per player,每秒评估 200 million 个国际象棋局面。今天 LLM 只反复挑 next token(下一个词元),chain of thought(思维链)仍由同一 next-token prediction 迭代产生,没有独立搜索;材料列出 Three shortcomings:没有显式、持久、可检查的 epistemic state(认知状态),知识与如何操作知识之间未分离,以及思维链常在答案出来后编造。医学、工程、科研不只问结论,也问结论怎么来。
- policy network 给候选供候选
- search machinery 展开游戏树复核
- Move 37 被选中
没写清 材料没有给出今天任何具体 LLM 在医学、工程或科研任务上因缺少独立搜索机制而失败的可核对案例或基准分数,因此不能替它补上失败率或对比成绩。
下一步 下一步可核对的是:是否有团队公开把显式的可检查推理状态与 next-token 模型分离,并在医学或科研任务上给出可复核的对照结果。