跳到正文

精选深读Simon Willison06:00

Qwen 3.8 27B 非常出色,但它默认会过度思考

Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things

Qwen3.8 27B 能力虽强,默认推理过长拖慢实用,需调参享效率。

判断

在笔电或 DGX Spark 上部署 Qwen 3.8 27B 的人,第一步应把 reasoning_effort 从出厂默认的 xhigh 改到 low 或关闭,只在确实需要多步深挖的任务上再往上调。代价是复杂推理要让出部分深度,换回来的是简单任务不再被自己的思考过程吃光上下文和时间。

依据

Simon Willison 在 8月16日的博文里把 xhigh 默认称作「a hilarious default」,并明说这不是跑这个模型的好方式,尤其在消费级硬件上;他的建议是先跑 low,甚至完全不推理。机制在 Qwen 官方支持的 reasoning_effort(推理力度)参数上:xhigh 面向需要彻底分析的复杂任务,medium 在准确率与速度之间取舍,low 优先速度与成本。代价有实测对照:同一张「鹈鹕骑单车」SVG 提示词,xhigh 下花了 21 分钟,用掉 22,276 个推理 token,才产出 3,223 个输出 token;关掉推理后单次共 3,715 个 token、137 秒。更早的症状是 LM Studio 默认 8,192 token 的上下文(token 是模型处理文本的最小单位)被推理填满,加载到 262,144 上限才消失。他跑的是 17GB 的 Q4_K_M 量化版本(quantized,把权重压到约 4 位精度以缩小体积),硬件是 128GB M5 Max MacBook Pro 与 NVIDIA DGX Spark。

  • 默认 xhigh 推理 token22,276
  • 默认 xhigh 耗时21 分钟
  • 关闭推理总 token3,715
  • 关闭推理耗时137 秒
同一张鹈鹕骑单车 SVG 提示词,默认 xhigh 与关闭推理的耗时和 token 对照

没写清 材料里只有 Qwen 自报的基准,说它相对 Qwen 3.6 27B 和闭源的 Qwen 3.7-Plus 有提升,独立基准还没出;medium 档在同一提示词下的耗时与 token 数也没有,所以无法替它判断改到哪一档最划算。

下一步 等独立基准公布 Qwen 3.8 27B 的分数,或自己用同一张鹈鹕 SVG 提示词跑一遍 medium 档,记下分钟数和 token 数,再决定默认档位。

本期其他新闻

  1. 行业动态

    引用 Dario Amodei

    Simon Willison

  2. AI工具

    CORS Chat

    Simon Willison

  3. AI工具

    从零开始构建 AI 文本检测器

    Ahead of AI

  4. 精选深读

    GLM-5.3:中国实验室如何跟上前沿

    Interconnects