跳到正文

精选深读Latent Space04:11

游戏中习得的技能能迁移到现实工作吗?

Can Skills Learned in Games Transfer to Real-World Work?

同一游戏训练出金融研究增益,说明迁移瓶颈在训练设计而非题材。

判断

定训练方案的人:与其为金融场景换题材或另买领域数据,不如先把目标工作流原样搬进环境——查数据库、填 Excel、写函数再算答案;同一个 1830 里,只有这么训的那版把增益带到了 Finance-Agent。

依据

Good Start Labs 联合创始人兼 CEO Alex Duffy 说,强化学习环境是教模型任何可验证能力最可靠的方式之一。他们拿十九世纪铁路游戏《1830: The Game of Railroads and Robber Barons》训练一个 30B 模型:这游戏唯一靠运气的环节只是决定开局顺序,但内置股票竞拍机制,玩家要竞买铁路公司股票、搭出物流网络。Duffy 描述的做法是把工作流搬进游戏——模型翻数据库找这局怎么打的、写进 Excel、在里面写函数、再据此算答案,跟典型财务流程同构。实验比的是两种训练设计:单轮问答(给一个局面让模型走下一步),和多轮终端智能体(用工具探索环境、规划策略、实时调整)。两种设计都改善了自己在游戏内的目标,但只有终端智能体那一版把成绩带到了 Finance-Agent 这个金融研究基准上。更早的对照来自 Diplomacy:OpenAI 的 o3 靠提前规划背叛赢下所有对局,Claude 的 Opus 4 拒绝说谎,Duffy 说它因此「被打得很惨」。所以他把结论落在 harness(把游戏交给模型的那套脚手架)上:它怎么设计,完全改变模型能学到什么。

  1. 决策智能体
    动作轨迹
  2. 技能库智能体
    改写技能库
  3. 技能库
    回灌下一轮
  4. 下一轮决策
COS-PLAY 中技能库被改写再回灌下一轮的循环

没写清 材料只给了方向——只有终端智能体那版在 Finance-Agent 上提升,没给提升幅度,也没给两版在游戏内目标上的具体成绩,因此不能替它判断这个增益有多大。

下一步 下一步可核对:Good Start Labs 是否公开 Finance-Agent 上两版设计的分数,以及把同一 harness 换到另一款游戏后,是否仍只有终端智能体那版提升。

本期其他新闻

  1. 行业动态

    AI“演员”Tilly Norwood 告诉我“所有生命都重要”

    Wired AI

  2. 行业动态

    圆桌讨论:AI 真的会杀死我们所有人吗?

    MIT Technology Review AI

  3. 行业动态

    宣布推出 Amazon SageMaker AI 训练任务的实例偏好列表

    AWS Machine Learning Blog

  4. 行业动态

    你的 Agent 完成了任务。它还能再做一次吗?

    Hugging Face

  5. AI工具

    Gemini Live 音频

    Simon Willison

  6. AI工具

    使用 Amazon Bedrock 提示缓存优化成本与延迟

    AWS Machine Learning Blog

  7. 精选深读

    推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking

    Google DeepMind