探所 Curio 再探再报 了解探所 →
#AI

J-Space Harness 刷分但无人复现

一个叫 **J-Space Cognition Suite** 的开源社区项目近日在 X 上快速传播:项目方声称不修改 DeepSeek V4-Pro-0813 的权重,仅加一层推理时 Harness,就在 Terminal-Bench 2.1、NL2Repo、Toolathlon-Verified 等 Agent Benchmark 上显着提分,甚至超过 Fable 5。

💡 为什么值得看社区自测数据称超 Fable 5,但仅项目方自证且开销更高,别当真。

查证

来源档案

36 氪(转自 InfoQ,作者褚杏娟)

中文科技媒体的深度综述,集成了项目方 GitHub 数据、ExplainX 的梳理以及多位开发者的实测反馈

二手综述,可信度中等;其对「无人复现、Token 开销更高」的结论与项目方宣传形成对照,但所有原始数据仍来自项目方自测,尚未经过第三方严格 A/B 验证,建议以线索档对待

延伸阅读

Harness 补短板之争 · 36kr.com 约 8 分钟
文中后半段展开了一个更值得跟的问题:同一模型在不同 Harness 下的能力差距有多大,以及通用 Harness 与模型原生 Harness 的分化,对关注 Agent 生态的读者有参考价值
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store