#AI
Willison 实测 Qwen3.8-27B:默认过度思考
Simon Willison 在 M5 Max MacBook Pro 和 NVIDIA DGX Spark 上跑了两天 Qwen3.8-27B,结论是:模型本身很出色,但默认推理档 xhigh 是个糟糕的起点。
这个阿里 Qwen 实验室的 Apache 2 协议、27B 参数稠密模型支持视觉,官方文档默认开启 reasoning_effort=xhigh,他自己实测下来,画一只骑自行车的鹈鹕 SVG 用了 22776 个推理 token、耗时 21 分钟,画一个圆也会触发数
💡 为什么值得看一篇有用的一手实测:这个 17GB 本地模型能干重活,但默认推理档会导致浪费数十分钟思考简单任务,该关掉。
查证
来源与可信度
孤证
· Simon Willison 在 M5 Max MacBook Pro 和 NVIDIA DGX Spark 两台机器上实测了 Qwen3.8-27B,称其能力出色但默认推理档 xhigh 会严重过度思考。
[1]
孤证
· 在默认 xhigh 档下,画一个骑自行车的鹈鹕 SVG 用了 22776 个推理 token,耗时 21 分钟;画一个圆也触发数分钟过度设计。
[1]
延伸阅读
作者公开了鹈鹕 SVG 与圆的完整推理痕迹,可以直观看到 xhigh 档如何把小任务想复杂,以及关掉推理后 137 秒就出的对照结果
涵盖 MTP 提速 A/B 数据(RTX 4090 从 47.7 到 76.3 tokens/s)、Apple Silicon 优化挑战、以及 chat template 推理侧工程讨论,适合关心本地部署的人
CNBC 把 27B 发布放进 Meta 上周 open-source 反击的语境内,并引 Hugging Face 下载数据(Qwen 衍生模型是 Meta 的 2.6 倍),适合看行业格局的人