#AI
Kimi K3 前端代码力压 GPT-5.6,数学落后近 50 分
月之暗面 Kimi K3 以 1679 Elo 登顶 Code Arena:Frontend 榜单,成为首个获此成绩的中国模型,领先 GPT-5.6 Sol(1618)及 Claude Fable 5(1631)。该榜以人类偏好评判,K3 在 7 个前端子领域中 6 项排名首位,较前代 K2.6 跃升 17 位。
但在数学推理上差距悬殊。Epoch AI 的 FrontierMath Tier 4 最高难度级别中,K3 正确率仅约 39%,而 OpenAI 与 Anthropic 模型可达近 90%。K3 其 2.8 万亿参数 MoE 架构、支持 100 万 token 上下文,API 输入定价 $3/百万 token(缓存 $0.3)、输出 $15,权重计划 7 月 27 日开放。
💡 为什么值得看首个登顶前端代码榜的中国模型,与 GPT-5.6 Sol 的差距一高一低,中美模型竞争进入垂直战场。
查证
来源档案
The Decoder
德国 AI 媒体引用 LMArena 与 Epoch AI 数据,交叉比对 Kimi K3 表现。
二手报道;排名直接源于 LMArena 公开榜单,数学数据来自 Epoch AI 官方页面,可交叉验证。稿件本身未做一手评测,但数据源可靠。
延伸阅读
K3 的 MoE 架构细节、API 开放时间及开源承诺,可配合 BenchLM.ai 和 VentureBeat 报道使用。