跳到正文

行业动态Latent Space06:13

Jev:面向生产而非 God 的 System One 模型 — 对话 TypeSafe AI 首席执行官 Diogo Almeida

Jev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI

只一集播客,却把System One定位讲成生产取向,做落地的人该听。

判断

把模型嵌进软件依赖链的工程负责人,下次选型评审该先问「每一步决策能不能给出可校准的概率」,把它写成验收项;先看榜单分数再挑模型,等于把幻觉和人工兜底一起采购进来。

依据

TypeSafe AI 的 CEO Diogo Almeida 是 InstructGPT 论文的共同作者、OpenAI 后训练团队出身。他的说法是:ChatGPT 的成功让自回归聊天微调以外的模式全被丢掉,之后的函数调用、结构化输出、推理,都只是打在字符串序列预测范式上的补丁。他给出的替代方案叫 RLCD,即面向校准决策的强化学习(Reinforcement Learning for Calibrated Decisions):训练目标不是人类评分,也就是 RLHF(基于人类反馈的强化学习),而是在 System One 这类短任务上直接输出带认知诚实概率的答案。按他的说法,RLHF 会养出幻觉、谄媚和对人工的长期依赖;可编程验证的 RLVR 能解出 Navier Stokes,却加剧能力参差、不好接进其他软件。他要优化的不是单点正确率,而是能不能被别的程序安全调用。

  • 6 Astra137M
  • Navier Stokes74M
  • Jev 发布视频约 40M
  • GPT4o22M
几支模型发布视频的播放量对照,Jev 约 40M

没写清 材料没给 Jev 在真实生产负载上的可靠性数字,也没给 RLCD 的训练与推理开销,所以它在你的场景里省多少人工、错在哪一步,无法替它算。

下一步 盯 TypeSafe 下一版模型(材料里预告的 ReasoningJev)发布时,是否同时给出概率校准的评测口径。

本期其他新闻

  1. 行业动态

    Cloudflare Python Workers 现已正式可用

    Simon Willison

  2. 行业动态

    BMW Group 如何检测 14,000 个云账户中的成本异常

    AWS Machine Learning Blog

  3. 行业动态

    John Ternus 能找到 Apple 的下一个重大产品吗?

    The Verge AI

  4. AI工具

    在 Amazon SageMaker AI 上运行 Positron 以支持数据科学工作流

    AWS Machine Learning Blog

  5. 精选深读

    Jev 推出一种新的 LLM 形态 - System One,又名 Decision Models

    Simon Willison

  6. 精选深读

    xAI 的 Grok 4.6 现已在 Amazon Bedrock 中可用

    AWS Machine Learning Blog

  7. 精选深读

    像物理学家一样裁剪 LLM:将块移除视为 Ising 优化问题

    Hugging Face