探所 Curio 再探再报 了解探所 →
#AI

Kimi K3 前端代码榜首,数学仍落后

月之暗面 Kimi K3 在 Code Arena: Frontend 评测中以 1,679 分登顶,领先 Claude Fable 5 的 1,631 分和 GPT-5.6 Sol 的 1,618 分,在品牌营销等 6 个子领域均居首位。

但在 Epoch AI 的 FrontierMath Tier 4 评测中,K3 高难度数学正确率仅约 39%,而 OpenAI 和 Anthropic 模型可达近 90%,推理深度上仍存在明显差距。

K3 模型参数为 2.8 万亿,采用 896 个专家中每次激活 16 个的 MoE 架构,完整权重预计 7 月 27 日前释放。API 定价为缓存命中 $0.30/百万 token,未命中 $3/百万 token。

💡 为什么值得看中国模型首登 Code Arena 前端榜首,但擅长的领域与最短的板一样醒目。

查证

来源档案

The Decoder

德国 AI 行业媒体,聚合一手数据源进行报道。

核心数据源自 Arena 与 Epoch AI 两个独立平台,非媒体打分。媒体未一手测试,解读有倾向性。可信度较高,应结合评测原文判断。

延伸阅读

一手数据 · the-decoder.com 约 5 分钟
Arena 榜单和 Epoch AI 数据是报道的骨架,直接看原平台可忽略媒体解读
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store