探所 Curio 再探再报 了解探所 →
#AI

Kimi K3 前端代码力压 GPT-5.6,数学落后近 50 分

月之暗面 Kimi K3 以 1679 Elo 登顶 Code Arena:Frontend 榜单,成为首个获此成绩的中国模型,领先 GPT-5.6 Sol(1618)及 Claude Fable 5(1631)。该榜以人类偏好评判,K3 在 7 个前端子领域中 6 项排名首位,较前代 K2.6 跃升 17 位。

但在数学推理上差距悬殊。Epoch AI 的 FrontierMath Tier 4 最高难度级别中,K3 正确率仅约 39%,而 OpenAI 与 Anthropic 模型可达近 90%。K3 其 2.8 万亿参数 MoE 架构、支持 100 万 token 上下文,API 输入定价 $3/百万 token(缓存 $0.3)、输出 $15,权重计划 7 月 27 日开放。

💡 为什么值得看首个登顶前端代码榜的中国模型,与 GPT-5.6 Sol 的差距一高一低,中美模型竞争进入垂直战场。

查证

来源档案

The Decoder

德国 AI 媒体引用 LMArena 与 Epoch AI 数据,交叉比对 Kimi K3 表现。

二手报道;排名直接源于 LMArena 公开榜单,数学数据来自 Epoch AI 官方页面,可交叉验证。稿件本身未做一手评测,但数据源可靠。

延伸阅读

想了解完整参数与定价策略 · the-decoder.com 约 8 分钟
K3 的 MoE 架构细节、API 开放时间及开源承诺,可配合 BenchLM.ai 和 VentureBeat 报道使用。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store