跳到正文

行业动态MIT Technology Review AI

来源时间 本站刊期

别被骗了——LLM不会推理

Don’t be fooled—LLMs don’t reason

以围棋第37手为由证明LLM不会推理,反例虽旧,却戳中能力边界的争论

判断

如果你在医疗、工程或科研场景评估 LLM,这份观点要求你把验收标准从“答得对”改到“能拿出可检查的推理状态”;否则 next-token prediction 的中间步骤仍不可追溯。

依据

作者 Thore Graepel 参与构建 AlphaGo,他回看 2016 年首尔那场五局赛:第二局第 37 手被 policy network(策略网络,负责猜强人类会走哪)判为专家人类大约 one in 10,000 才会走的选择,是 search machinery(搜索机制,负责展开并搜索游戏树)把它推了出来;AlphaGo 最终 4-1 击败李世石。作为对照,Deep Blue 在 1997 年靠人类硬编码规则,每步向前看 six to eight moves ahead per player,每秒评估 200 million 个国际象棋局面。今天 LLM 只反复挑 next token(下一个词元),chain of thought(思维链)仍由同一 next-token prediction 迭代产生,没有独立搜索;材料列出 Three shortcomings:没有显式、持久、可检查的 epistemic state(认知状态),知识与如何操作知识之间未分离,以及思维链常在答案出来后编造。医学、工程、科研不只问结论,也问结论怎么来。

  1. policy network 给候选
    供候选
  2. search machinery 展开游戏树
    复核
  3. Move 37 被选中
AlphaGo 从直觉候选到搜索复核再到 Move 37,对照 LLM 只有 next-token prediction。

没写清 材料没有给出今天任何具体 LLM 在医学、工程或科研任务上因缺少独立搜索机制而失败的可核对案例或基准分数,因此不能替它补上失败率或对比成绩。

下一步 下一步可核对的是:是否有团队公开把显式的可检查推理状态与 next-token 模型分离,并在医学或科研任务上给出可复核的对照结果。

本期其他新闻

  1. 行业动态

    九月仅限赞助者简报

    Simon Willison

  2. 行业动态

    特朗普疯狂的AI品牌重塑是对科技高管的忠诚测试——而且奏效了

    Wired AI

  3. 行业动态

    由内而外的AI:在幕后和宾客体验中重建Airbnb

    Latent Space

  4. 行业动态

    ChatGPT的Mac应用中的一个漏洞可能让黑客获取敏感数据

    Wired AI