#AI
IMO 2026 评测:Claude 依赖 harness 追分
Reddit 用户 pequalnp92 等前 IMO 奖牌获得者评测多款大语言模型在 2026 年国际数学奥林匹克试题上的表现。前沿模型 Sol 和 Fable 在无额外 harness 下获得满分或接近满分。Anthropic 的 Claude Sonnet 与 Opus 在网页端表现差,借助 Claude Code 的 harness 有所回升,叠加自研 AutoFyn 框架后进一步提升,但仍未超越前沿模型。
开源模型 GLM 在无 harness 下与 Sonnet 持平,通过 AutoFyn 提升相似。所有非前沿模型均未突破第 3 题关键化简步骤,即使运行 20 小时仍卡在同一瓶颈。Sonnet 在该题给出错误“论证”,暴露可验证领域的幻觉问题。完整数值分数与审计记录见论文。
💡 为什么值得看独立评测显示无 harness 时 Sonnet/Opus 数学表现差,Claude Code 大幅改善,开源 GLM 性能紧跟。
查证
来源档案
Reddit r/MachineLearning 帖子
前 IMO 奖牌得主团队自组织的多模型数学基准测试,使用 IMO 2026 试题评测。
单源,未经同行评审;测试者自称有人工验证,但数据源于社区帖子,应谨慎参考。
延伸阅读
包含各模型每道题的具体分数、harness 详情与运行记录,可独立复检。