精选深读Simon Willison07:58
Qwen 3.8 27B在人工智能分析智能指数上得分52
Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index
开源小模型扛住52分,闭源大厂该掂量下性价比了。
判断
如果选型人还把「27B 只能干轻活」当默认前提,就会在同等指数分数上多背一层参数量带来的部署成本;采购名单该把参数规模从门槛项降成参考项。
依据
Simon Willison 在 2026年8月17日的链接博客里记录:Qwen 3.8 27B 在 Artificial Analysis Intelligence Index(第三方模型能力测评,把多项基准合成一个分数)拿到 52 分。他认为惊人之处不在分数本身,而在同分或邻近分数的对手体量:GPT-5.6 Luna (max) 同为 52 分,GLM-5.2 (max) 与 DeepSeek V4 Pro 0813 (max) 排在它前面,而 GLM-5.2 (max) 是 753B 参数、DeepSeek V4 Pro 0813 (max) 是 1.7T 参数,Luna 的规模他没给出、只判断远大于 27B。机制上这意味着:指数分接近的一批模型,要跑起来时背负的参数量级分别是 27B、753B 和 1.7T,部署方按分数横评却按参数量付费。
- Qwen 3.8 27B:指数分52
- GPT-5.6 Luna (max):指数分52
- GLM-5.2 (max):参数753B
- DeepSeek V4 Pro 0813 (max):参数1.7T
没写清 材料没有推理价格、吞吐或单位推理成本,也没有各模型实际部署的显存占用,所以没法算出同分之下谁更便宜。
下一步 核对 Artificial Analysis 上 Qwen 3.8 27B 条目的价格与延迟字段,是否已和同分的 GPT-5.6 Luna (max) 并排列出。