#AI
Ornith-1.0 编码模型双榜超 Claude Opus
独立开发者 Simon Willison 实测了近期开源的 Ornith-1.0 编码智能体模型。该模型由 DeepReinforce 基于 Gemma 4 与 Qwen 3.5 预训练权重构建,提供 9B 至 397B MoE 四种规模,全部采用 MIT 许可且无地域限制。实测结果显示其在两个主要基准上超越 Claude Opus 4.7:397B 旗舰模型在 SWE-Bench Verified 得分为 82.4(Opus 4.7 为 80.8),Terminal-Bench 2.1 得分为 77.5(Opus 4.7 为 70.3),同时优于 Minimax M3 与 DeepSeek-V4-Pro。Willison 使用 35B 量化版(20GB GGUF)在 Pi 终端中实测,模型在 Datasette 仓库中顺利完成了多轮工具调用,推理速度达 103 tokens/秒。这是开源编码模型首次在代理性编程基准上全面超越 Anthropic 旗舰,兼具本地部署与商用灵活性。
💡 为什么值得看开源编码智能体首次在 SWE-Bench 超越 Anthropic 旗舰,MIT 许可本地运行,或影响开发者选型与 API 定价。
查证
来源档案
Simon Willison 博客
知名开源开发者在个人博客上对 Ornith-1.0 的**一手实测**,包含终端会话记录与生成图像,同时引用了官方发布的基准数字。
实测接近确认级一手体验,基准来自 DeepReinforce 官方,行业博客虽转载但未独立复现,可信但需谨慎看待性能。
延伸阅读
查看 9B 到 397B 全部变体的性能对比与技术框架说明
直接看到模型在实际代码仓库中多步代理任务的完成质量