探所 Curio 再探再报 了解探所 →
#AI

Willison 实测 Qwen3.8-27B:默认过度思考

Simon Willison 在 M5 Max MacBook Pro 和 NVIDIA DGX Spark 上跑了两天 Qwen3.8-27B,结论是:模型本身很出色,但默认推理档 xhigh 是个糟糕的起点。

这个阿里 Qwen 实验室的 Apache 2 协议、27B 参数稠密模型支持视觉,官方文档默认开启 reasoning_effort=xhigh,他自己实测下来,画一只骑自行车的鹈鹕 SVG 用了 22776 个推理 token、耗时 21 分钟,画一个圆也会触发数

💡 为什么值得看一篇有用的一手实测:这个 17GB 本地模型能干重活,但默认推理档会导致浪费数十分钟思考简单任务,该关掉。

查证

来源与可信度

孤证 · Simon Willison 在 M5 Max MacBook Pro 和 NVIDIA DGX Spark 两台机器上实测了 Qwen3.8-27B,称其能力出色但默认推理档 xhigh 会严重过度思考。 [1]
· Qwen3.8-27B 是阿里 Qwen 实验室发布的 Apache 2 协议、27B 参数、支持视觉的稠密模型,官方文档默认启用 xhigh 推理档。 [1][2][3]
孤证 · 在默认 xhigh 档下,画一个骑自行车的鹈鹕 SVG 用了 22776 个推理 token,耗时 21 分钟;画一个圆也触发数分钟过度设计。 [1]
· 该模型量化后约 17GB,能经 LM Studio 在本地运行,具备长上下文、工具调用、多 Token 预测(MTP)等能力。 [1][3]

延伸阅读

完整实测与推理 trace · simonwillison.net 10 分钟
作者公开了鹈鹕 SVG 与圆的完整推理痕迹,可以直观看到 xhigh 档如何把小任务想复杂,以及关掉推理后 137 秒就出的对照结果
社区工程优化全景 · 36kr.com 15 分钟
涵盖 MTP 提速 A/B 数据(RTX 4090 从 47.7 到 76.3 tokens/s)、Apple Silicon 优化挑战、以及 chat template 推理侧工程讨论,适合关心本地部署的人
Alibaba 与 Meta 竞争 · cnbc.com 5 分钟
CNBC 把 27B 发布放进 Meta 上周 open-source 反击的语境内,并引 Hugging Face 下载数据(Qwen 衍生模型是 Meta 的 2.6 倍),适合看行业格局的人
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store