探所 Curio 再探再报 了解探所 →
#AI

IMO 2026 评测:Claude 依赖 harness 追分

Reddit 用户 pequalnp92 等前 IMO 奖牌获得者评测多款大语言模型在 2026 年国际数学奥林匹克试题上的表现。前沿模型 Sol 和 Fable 在无额外 harness 下获得满分或接近满分。Anthropic 的 Claude Sonnet 与 Opus 在网页端表现差,借助 Claude Code 的 harness 有所回升,叠加自研 AutoFyn 框架后进一步提升,但仍未超越前沿模型。

开源模型 GLM 在无 harness 下与 Sonnet 持平,通过 AutoFyn 提升相似。所有非前沿模型均未突破第 3 题关键化简步骤,即使运行 20 小时仍卡在同一瓶颈。Sonnet 在该题给出错误“论证”,暴露可验证领域的幻觉问题。完整数值分数与审计记录见论文。

💡 为什么值得看独立评测显示无 harness 时 Sonnet/Opus 数学表现差,Claude Code 大幅改善,开源 GLM 性能紧跟。

查证

来源档案

Reddit r/MachineLearning 帖子

前 IMO 奖牌得主团队自组织的多模型数学基准测试,使用 IMO 2026 试题评测。

单源,未经同行评审;测试者自称有人工验证,但数据源于社区帖子,应谨慎参考。

延伸阅读

全篇论文与审计跟踪 · reddit.com 约 15 分钟
包含各模型每道题的具体分数、harness 详情与运行记录,可独立复检。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store