跳到正文

精选深读Simon Willison07:09

Jev 推出一种新的 LLM 形态 - System One,又名 Decision Models

Jev introduces a new shape of LLM - System One, aka Decision Models

只提决策模型形态却无评测数据,选型得先验证落地场景

判断

做风控、垃圾过滤或检索重排的团队,可以先把 Jev 放进影子评测,但别让它单独拍板;它省掉输出计费,代价是把可解释性也省掉了,出错时没有理由可查。

依据

Simon Willison 引述 TypeSafe AI 的 Jev:它把文本输入映射成带置信度的浮点决策输出,而不是文本。TypeSafe 称其为“frontier-intelligence function call”(前沿智能函数调用),即“非结构化状态进,带类型的概率决策出”。机制上,Jev 只按输入 token(文本计量单位)收费、输出免费,首模型输入价 $0.042/百万 tokens,低于 OpenAI GPT-5 Nano 的 $0.05/百万;同一文档可并行多问。但其 1.13 jaggedness 文档承认对数字、日期和对抗内容不强。Willison 还指出它更黑箱:只回浮点数,若判垃圾邮件也无法知道哪个信号触发,用于招聘排序会掩盖偏差。取舍是:高吞吐、低单次错误代价的分类可先做影子评测;需要申诉、审计或解释的决策不应让它单独拍板。

  • Jev 输入价$0.042/百万 tokens
  • GPT-5 Nano$0.05/百万 tokens
Jev 与 GPT-5 Nano 每百万输入 token 价格对照

没写清 材料只给了价格、样例用法和黑箱警告,没给 Jev 在垃圾过滤、检索重排等任务上的准确率、校准或偏差审计结果。

下一步 下一步可核对 JevBench 是否公布 Jev 与 Kev 0.8B/4B/9B 的按任务准确率和校准数据。

本期其他新闻

  1. 行业动态

    Cloudflare Python Workers 现已正式可用

    Simon Willison

  2. 行业动态

    Jev:面向生产而非 God 的 System One 模型 — 对话 TypeSafe AI 首席执行官 Diogo Almeida

    Latent Space

  3. 行业动态

    BMW Group 如何检测 14,000 个云账户中的成本异常

    AWS Machine Learning Blog

  4. 行业动态

    John Ternus 能找到 Apple 的下一个重大产品吗?

    The Verge AI

  5. AI工具

    在 Amazon SageMaker AI 上运行 Positron 以支持数据科学工作流

    AWS Machine Learning Blog

  6. 精选深读

    xAI 的 Grok 4.6 现已在 Amazon Bedrock 中可用

    AWS Machine Learning Blog

  7. 精选深读

    像物理学家一样裁剪 LLM:将块移除视为 Ising 优化问题

    Hugging Face