跳到正文

精选深读Simon Willison07:58

Qwen 3.8 27B在人工智能分析智能指数上得分52

Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index

开源小模型扛住52分,闭源大厂该掂量下性价比了。

判断

如果选型人还把「27B 只能干轻活」当默认前提,就会在同等指数分数上多背一层参数量带来的部署成本;采购名单该把参数规模从门槛项降成参考项。

依据

Simon Willison 在 2026年8月17日的链接博客里记录:Qwen 3.8 27B 在 Artificial Analysis Intelligence Index(第三方模型能力测评,把多项基准合成一个分数)拿到 52 分。他认为惊人之处不在分数本身,而在同分或邻近分数的对手体量:GPT-5.6 Luna (max) 同为 52 分,GLM-5.2 (max) 与 DeepSeek V4 Pro 0813 (max) 排在它前面,而 GLM-5.2 (max) 是 753B 参数、DeepSeek V4 Pro 0813 (max) 是 1.7T 参数,Luna 的规模他没给出、只判断远大于 27B。机制上这意味着:指数分接近的一批模型,要跑起来时背负的参数量级分别是 27B、753B 和 1.7T,部署方按分数横评却按参数量付费。

  • Qwen 3.8 27B:指数分52
  • GPT-5.6 Luna (max):指数分52
  • GLM-5.2 (max):参数753B
  • DeepSeek V4 Pro 0813 (max):参数1.7T
同拿 52 分的两个模型,对上 753B 与 1.7T 的参数量级。

没写清 材料没有推理价格、吞吐或单位推理成本,也没有各模型实际部署的显存占用,所以没法算出同分之下谁更便宜。

下一步 核对 Artificial Analysis 上 Qwen 3.8 27B 条目的价格与延迟字段,是否已和同分的 GPT-5.6 Luna (max) 并排列出。

本期其他新闻

  1. 行业动态

    我们追踪了一批珍本书的运输,最终目的地竟是亚马逊AI训练设施

    Simon Willison

  2. 行业动态

    教每个人钓取令牌

    Interconnects

  3. 行业动态

    防御者的窗口

    OpenAI

  4. 行业动态

    OpenAI加入PORTS-Pike项目

    OpenAI

  5. 精选深读

    相同集群,利用率提高33个点:变化的是顺序

    Hugging Face