精选深读Simon Willison07:52
Qwen3.8-Flash-Next
Qwen3.8-Flash-Next亮相,小参数或成性价比新选,但实测性能待验。
判断
要在单台 DGX Spark 上挑本地模型的人,筛选标准得从算力换成显存:6B 激活让推理开销接近小模型,但权重仍要 72.5GB 起步,先算清显存余量再决定是否把它列为首选。
依据
Simon Willison 说这是 Qwen 又一个开放权重模型,属于多模态 MoE(Mixture of Experts,混合专家,每个 token 只调用其中一部分专家),并称它是 Qwen4 所用架构的早期预览。机制上,125B 总参数决定权重体积,6B 激活参数决定每次前向的计算量,两者分开,所以“参数小”指的是算得省,不等于占显存少。他在 DGX Spark 上试的是 Unsloth 的量化版本,两个档位分别是 72.5GB 的 UD-IQ1_S 和 78.9GB 的 UD-Q2_K_XL,并说目前最喜欢 UD-Q2_K_XL 里 xhigh 推理努力的那次输出。按这些数字,能跑起来靠的是量化把 125B 压进单机显存,而非 6B 这个激活数。
- 总参数125B
- 激活参数6B
- UD-IQ1_S72.5GB
- UD-Q2_K_XL78.9GB
没写清 材料只给了 pelican 示例和量化文件体积,没有基准分数、吞吐数据,也没有与同档模型的同期对照,所以性价比目前只能从结构上推断,无法由实测确认。
下一步 等 Simon Willison 的后续文章或 Qwen 模型卡给出 125B/6B 在标准基准上的分数。