行业动态Latent Space06:13
Jev:面向生产而非 God 的 System One 模型 — 对话 TypeSafe AI 首席执行官 Diogo Almeida
Jev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI
只一集播客,却把System One定位讲成生产取向,做落地的人该听。
判断
把模型嵌进软件依赖链的工程负责人,下次选型评审该先问「每一步决策能不能给出可校准的概率」,把它写成验收项;先看榜单分数再挑模型,等于把幻觉和人工兜底一起采购进来。
依据
TypeSafe AI 的 CEO Diogo Almeida 是 InstructGPT 论文的共同作者、OpenAI 后训练团队出身。他的说法是:ChatGPT 的成功让自回归聊天微调以外的模式全被丢掉,之后的函数调用、结构化输出、推理,都只是打在字符串序列预测范式上的补丁。他给出的替代方案叫 RLCD,即面向校准决策的强化学习(Reinforcement Learning for Calibrated Decisions):训练目标不是人类评分,也就是 RLHF(基于人类反馈的强化学习),而是在 System One 这类短任务上直接输出带认知诚实概率的答案。按他的说法,RLHF 会养出幻觉、谄媚和对人工的长期依赖;可编程验证的 RLVR 能解出 Navier Stokes,却加剧能力参差、不好接进其他软件。他要优化的不是单点正确率,而是能不能被别的程序安全调用。
- 6 Astra137M
- Navier Stokes74M
- Jev 发布视频约 40M
- GPT4o22M
没写清 材料没给 Jev 在真实生产负载上的可靠性数字,也没给 RLCD 的训练与推理开销,所以它在你的场景里省多少人工、错在哪一步,无法替它算。
下一步 盯 TypeSafe 下一版模型(材料里预告的 ReasoningJev)发布时,是否同时给出概率校准的评测口径。