精选深读Simon Willison06:00
Qwen 3.8 27B 非常出色,但它默认会过度思考
Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
Qwen3.8 27B 能力虽强,默认推理过长拖慢实用,需调参享效率。
判断
在笔电或 DGX Spark 上部署 Qwen 3.8 27B 的人,第一步应把 reasoning_effort 从出厂默认的 xhigh 改到 low 或关闭,只在确实需要多步深挖的任务上再往上调。代价是复杂推理要让出部分深度,换回来的是简单任务不再被自己的思考过程吃光上下文和时间。
依据
Simon Willison 在 8月16日的博文里把 xhigh 默认称作「a hilarious default」,并明说这不是跑这个模型的好方式,尤其在消费级硬件上;他的建议是先跑 low,甚至完全不推理。机制在 Qwen 官方支持的 reasoning_effort(推理力度)参数上:xhigh 面向需要彻底分析的复杂任务,medium 在准确率与速度之间取舍,low 优先速度与成本。代价有实测对照:同一张「鹈鹕骑单车」SVG 提示词,xhigh 下花了 21 分钟,用掉 22,276 个推理 token,才产出 3,223 个输出 token;关掉推理后单次共 3,715 个 token、137 秒。更早的症状是 LM Studio 默认 8,192 token 的上下文(token 是模型处理文本的最小单位)被推理填满,加载到 262,144 上限才消失。他跑的是 17GB 的 Q4_K_M 量化版本(quantized,把权重压到约 4 位精度以缩小体积),硬件是 128GB M5 Max MacBook Pro 与 NVIDIA DGX Spark。
- 默认 xhigh 推理 token22,276
- 默认 xhigh 耗时21 分钟
- 关闭推理总 token3,715
- 关闭推理耗时137 秒
没写清 材料里只有 Qwen 自报的基准,说它相对 Qwen 3.6 27B 和闭源的 Qwen 3.7-Plus 有提升,独立基准还没出;medium 档在同一提示词下的耗时与 token 数也没有,所以无法替它判断改到哪一档最划算。
下一步 等独立基准公布 Qwen 3.8 27B 的分数,或自己用同一张鹈鹕 SVG 提示词跑一遍 medium 档,记下分钟数和 token 数,再决定默认档位。