精选深读Latent Space04:11
游戏中习得的技能能迁移到现实工作吗?
Can Skills Learned in Games Transfer to Real-World Work?
同一游戏训练出金融研究增益,说明迁移瓶颈在训练设计而非题材。
判断
定训练方案的人:与其为金融场景换题材或另买领域数据,不如先把目标工作流原样搬进环境——查数据库、填 Excel、写函数再算答案;同一个 1830 里,只有这么训的那版把增益带到了 Finance-Agent。
依据
Good Start Labs 联合创始人兼 CEO Alex Duffy 说,强化学习环境是教模型任何可验证能力最可靠的方式之一。他们拿十九世纪铁路游戏《1830: The Game of Railroads and Robber Barons》训练一个 30B 模型:这游戏唯一靠运气的环节只是决定开局顺序,但内置股票竞拍机制,玩家要竞买铁路公司股票、搭出物流网络。Duffy 描述的做法是把工作流搬进游戏——模型翻数据库找这局怎么打的、写进 Excel、在里面写函数、再据此算答案,跟典型财务流程同构。实验比的是两种训练设计:单轮问答(给一个局面让模型走下一步),和多轮终端智能体(用工具探索环境、规划策略、实时调整)。两种设计都改善了自己在游戏内的目标,但只有终端智能体那一版把成绩带到了 Finance-Agent 这个金融研究基准上。更早的对照来自 Diplomacy:OpenAI 的 o3 靠提前规划背叛赢下所有对局,Claude 的 Opus 4 拒绝说谎,Duffy 说它因此「被打得很惨」。所以他把结论落在 harness(把游戏交给模型的那套脚手架)上:它怎么设计,完全改变模型能学到什么。
- 决策智能体动作轨迹
- 技能库智能体改写技能库
- 技能库回灌下一轮
- 下一轮决策
没写清 材料只给了方向——只有终端智能体那版在 Finance-Agent 上提升,没给提升幅度,也没给两版在游戏内目标上的具体成绩,因此不能替它判断这个增益有多大。
下一步 下一步可核对:Good Start Labs 是否公开 Finance-Agent 上两版设计的分数,以及把同一 harness 换到另一款游戏后,是否仍只有终端智能体那版提升。