#AI
Kimi K3 前端编码首超 Claude Fable 5
Moonshot AI 的 Kimi K3 在 Code Arena 前端编码榜单以 1679 分登顶,超越 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分),领先 7 个子任务中的 6 个。这是中国模型首次在该分类位列第一,较上代 Kimi K2.6 跃升 17 名。
但在 Epoch AI 的 FrontierMath Tier 4(最高难度专家级数学题)上,Kimi K3 正确率仅约 39%,而 OpenAI 与 Anthropic 模型接近 90%。前端编码领先与复杂推理落后并存,凸显 Moonshot 在能力侧重上的取舍。
💡 为什么值得看中国模型在竞技场前端编码首次超越 Anthropic 顶级模型,但复杂数学仍明显落后,显示侧重不同。
查证
来源档案
The Decoder
德国 AI 新闻媒体,本报道引述 Arena.ai 官方数据与 Epoch AI 的 FrontierMath 结果。
前端编码排名已由 Arena 官方推文核实,数学数据来自 Epoch AI 公开基准,核心事实可交叉验证;媒体解读部分需留意立场。
延伸阅读
查看 Arena 官方推文和 Epoch AI 的 FrontierMath 页面,了解完整榜单和测评细节
该报道可配合中文技术社区对 Kimi K3 的评测,对比实际编码体验