跳到正文

行业动态Latent Space

来源时间 本站刊期

[AINews] 今天没发生多少事

[AINews] not much happened today

今日无大新闻,正好暴露行业依赖单一热点的节奏,适合团队补基础

判断

依赖热点排期的 AI 工程团队,应把本周决策从「追新模型」改为「补评测口径」:先确认 Sol 的 $0.56 每任务成本是否包含缓存与重试,再决定是否进入选型清单。

依据

OpenAI 把 GPT-6.1 Sol 定价为每百万输入/输出 token(模型计费的最小文本单位)2 美元/10 美元,而 Astra 是 10 美元/50 美元;Agent Arena(智能体任务榜单)记录 Sol [Max] 每任务中位成本 $0.56,比 GPT-6 Sol 便宜 39%,比 Astra 便宜 81%。同一榜单里 Sonnet 5.5 [Max] 排第 3,每任务 $2.74,比排第 2 的 Opus 5.5 的 $1.58 更贵,因此没进 Pareto frontier(帕累托前沿,指成本与分数同时占优的集合)。对预算敏感的团队,选型依据不是有没有大新闻,而是每任务成本与榜单分数的边际交换。

  • Sol [Max] 每任务中位成本$0.56
  • Sonnet 5.5 [Max] 每任务成本$2.74
  • Opus 5.5 每任务成本$1.58
Sol、Sonnet 5.5 与 Opus 5.5 的每任务成本对照

没写清 材料没有说明 $0.56、$2.74 这些每任务成本是否含缓存、重试与工具调用等全部开销。

下一步 等 Agent Arena 或 OpenAI 公布 Sol 与 Sonnet 5.5 的完整成本口径时,再核对 $0.56 与 $2.74 是否可比。

本期其他新闻

  1. 行业动态

    我们几乎需要对所有东西设置默认硬性预算上限

    Simon Willison

  2. 行业动态

    Agent 说它做完了。数据库不同意。

    Hugging Face

  3. 行业动态

    Nvidia Shield TV 已上市7年。它刚刚涨价100美元

    Wired AI

  4. 行业动态

    Splice CEO Kakul Srivastava 认为 AI 邮件正在扼杀对话

    The Verge AI

  5. 行业动态

    一位 OpenAI 安全员工已离职并发出警告

    The Verge AI

  6. 行业动态

    Rex 的恐龙商店

    Simon Willison

  7. AI工具

    Muse 为你所有朋友和家人创建详细档案

    Wired AI