跳到正文

精选深读Simon Willison07:52

Qwen3.8-Flash-Next

Qwen3.8-Flash-Next亮相,小参数或成性价比新选,但实测性能待验。

判断

要在单台 DGX Spark 上挑本地模型的人,筛选标准得从算力换成显存:6B 激活让推理开销接近小模型,但权重仍要 72.5GB 起步,先算清显存余量再决定是否把它列为首选。

依据

Simon Willison 说这是 Qwen 又一个开放权重模型,属于多模态 MoE(Mixture of Experts,混合专家,每个 token 只调用其中一部分专家),并称它是 Qwen4 所用架构的早期预览。机制上,125B 总参数决定权重体积,6B 激活参数决定每次前向的计算量,两者分开,所以“参数小”指的是算得省,不等于占显存少。他在 DGX Spark 上试的是 Unsloth 的量化版本,两个档位分别是 72.5GB 的 UD-IQ1_S 和 78.9GB 的 UD-Q2_K_XL,并说目前最喜欢 UD-Q2_K_XL 里 xhigh 推理努力的那次输出。按这些数字,能跑起来靠的是量化把 125B 压进单机显存,而非 6B 这个激活数。

  • 总参数125B
  • 激活参数6B
  • UD-IQ1_S72.5GB
  • UD-Q2_K_XL78.9GB
总参数、激活参数与两个量化档位体积的对照。

没写清 材料只给了 pelican 示例和量化文件体积,没有基准分数、吞吐数据,也没有与同档模型的同期对照,所以性价比目前只能从结构上推断,无法由实测确认。

下一步 等 Simon Willison 的后续文章或 Qwen 模型卡给出 125B/6B 在标准基准上的分数。

本期其他新闻

  1. 行业动态

    突破性发布:Claude Code Opus 5 自动模式

    Simon Willison

  2. 行业动态

    试点全球首个双盲 AI 评估

    Google DeepMind

  3. 行业动态

    扩大 OpenAI 在巴西的业务版图

    OpenAI

  4. 精选深读

    Gemini Omni 1.1 Flash 助您更精细地构建应用

    Google DeepMind

  5. 精选深读

    更佳答案,更广思维:学生从 ChatGPT 与批判性思维训练中的收获

    OpenAI