探所 Curio 再探再报 了解探所 →
#AI

AI 编码代理缺乏时间感,高估任务时长

一项来自 MATS 研究项目的独立研究测试了两个主流编码代理的时间感知能力。结果显示,Claude Code 和 Codex 在开始任务前都无法合理预估所需时长,完成后也无法判断实际过了多久。

在 ProgramBench 的 200 个任务上,两个模型几乎无论难度都预估约 90 分钟。实际偏差明显:Claude Code 平均偏差三倍,Codex 则偏差六到十倍,短任务上的预估尤其离谱。同时,旧版 Opus 4.8 与 GPT-5.5 对自身工作质量的自评比实际分数高出约 20 个百分点,甚至在失败任务上也打出高分。

💡 为什么值得看Claude Code 与 Codex 高估耗时至十倍,妨碍长任务监督。

查证

来源档案

The Decoder

AI 行业媒体,报道了一项 MATS 研究项目下的独立研究

单源报道,具体数据来自研究者发布的 LessWrong 文章,建议查看原始论文确认细节

延伸阅读

研究原文 · the-decoder.com
查看 ProgramBench 与 18 个自建 benchmark 的完整评测细节,以及时间报告工具接入后的对比数据
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store