#AI
AI 编码代理缺乏时间感,高估任务时长
一项来自 MATS 研究项目的独立研究测试了两个主流编码代理的时间感知能力。结果显示,Claude Code 和 Codex 在开始任务前都无法合理预估所需时长,完成后也无法判断实际过了多久。
在 ProgramBench 的 200 个任务上,两个模型几乎无论难度都预估约 90 分钟。实际偏差明显:Claude Code 平均偏差三倍,Codex 则偏差六到十倍,短任务上的预估尤其离谱。同时,旧版 Opus 4.8 与 GPT-5.5 对自身工作质量的自评比实际分数高出约 20 个百分点,甚至在失败任务上也打出高分。
💡 为什么值得看Claude Code 与 Codex 高估耗时至十倍,妨碍长任务监督。
查证
来源档案
The Decoder
AI 行业媒体,报道了一项 MATS 研究项目下的独立研究
单源报道,具体数据来自研究者发布的 LessWrong 文章,建议查看原始论文确认细节
延伸阅读
查看 ProgramBench 与 18 个自建 benchmark 的完整评测细节,以及时间报告工具接入后的对比数据