探所 Curio 再探再报 了解探所 →
#AI

研究称 Codex 高估任务时长十倍

一项由两位独立 AI 研究员在 MATS 项目完成的测试发现,主流编码助手对时间几乎没有感知。测试对象是 Anthropic 的 Claude Code 和 OpenAI 的 Codex,材料来自 ProgramBench 的 200 个任务加上研究者自建的 18 项基准。

两个模型在任务执行前都会预估所需时长,却**系统性高估**:在 ProgramBench 上无论难度,两者大多猜 90 分钟左右;第二轮中 Claude Code 平均偏差三倍,**Codex 偏差达六到十倍**,短任务偏差最严重。它们对自身工作质量的评分也平均高出约 20 个百分点,失败任务上也给自己打高分。

💡 为什么值得看AI 编码助手时间感知偏差可达十倍,长期任务难以监督。

查证

来源档案

The Decoder

AI 行业媒体,报道独立研究并附原始结论与图表

二级媒体单源,报道内容具体且有数据佐证,但研究本身为两位独立研究员作品,未经同行评审,结论应按单源线索档对待

延伸阅读

harness 的影响 · the-decoder.com 5 分钟
同一语言模型在不同软件环境里步骤数差 2.5 倍,时间感知既取决于模型也取决于外围 harness,值得细读
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store