探所 Curio 再探再报 了解探所 →
#AI

通义开源 Qwen3.8-27B,多项榜单反超 Claude

阿里通义千问开源了 Qwen3.8-27B,**约 270 亿参数**,专攻编程、专业工作与长程 Agent 场景。官方给出的榜单里,这只 27B 在多项评测上**压过 Claude Opus 4.

6 Max**:SWE-bench Pro 领先 8.3 分、QwenSWEBench 领先 15.2 分;面向专业长任务的 CoWorkBench 拿到 70.7 分(Opus 68.2)。

💡 为什么值得看消费级显卡可整卡装下 27B 模型,Agent 与多模态分数压过 Opus 4.6 Max,本地跑「Opus 级」有了实据

查证

来源档案

量子位

中文 AI 科技媒体,报道基于 Qwen 官方榜单与社区网友实测的转述整理

榜单数字、参数与部署信息来自官方及转发渠道,可信度较高;但这些分数为官方自报口径,「反超 Claude」的表述需以独立复评为准,暂不宜当作定论

延伸阅读

榜单原始数据 · qbitai.com 5 分钟
SWE-bench Pro / QwenSWEBench / OSWorld 等具体分数与 Claude 对比都列在原文,能直接核对官方自报口径与差距
消费级部署实测 · qbitai.com 5 分钟
文中附 GH200 并发实测与单 GPU 跑视频理解的时间数据,对想本地部署的开发者有参考价值
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store