探所 Curio 再探再报 了解探所 →
#AI

Qwen 27B 得分追平大模型

Alibaba 的 Qwen 团队新发布的 **Qwen 3.8 27B** 在 Artificial Analysis Intelligence Index 拿到 **52 分**,与 GPT-5.6 Luna (max) 同分,仅比 753B 的 GLM-5.2 和 1.7T 参数的 DeepSeek V4 Pro 低 1 分。

Simon Willison 在 8 月 17 日的博客里称它是「真正惊人的模型」,指出这个 27B 小模型追平了体量大得多的对手。

💡 为什么值得看27B 小模型评测追平顶级大模型,性价比冲击 Anthropic 定价。

查证

来源与可信度

· Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 得 52 分,与 GPT-5.6 Luna (max) 同分,仅比 753B 的 GLM-5.2 和 1.7T 参数的 DeepSeek V4 Pro 低 1 分。 [1][2]
· 该 27B 模型的得分接近或追平参数量远超自己的大模型,形成显着性价比代差。 [1][2]
· Qwen3.8 系列(含 Flash-Next 与 27B)在多个编码与办公基准上领先或接近 Claude Opus 4.6,仅 HLE 等极难测试落后。 [1]
· Qwen3.8-Flash-Next 定价为输入 $0.16 / 输出 $0.47 每百万 token,约为主力模型 Qwen3.8-Max 的十二分之一,持续压低 OpenAI 与 Anthropic 的定价空间。 [1]

延伸阅读

Simon 一手评测视角 · simonwillison.net
Simon Willison 把 52 分数字直接对标 GPT-5.6 Luna 与 GLM/DeepSeek 大模型,点明清 27B 的性价比代差,对判断 Anthropic 定价压力最有信息量。
基准明细与定价 · the-decoder.com
The Decoder 附完整 benchmark 对比表和 Flash-Next 定价($0.16/$0.47),可量化小模型对 Claude Opus 4.6 的具体领先与落后项。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store