#AI
研究称 Codex 高估任务时长十倍
一项由两位独立 AI 研究员在 MATS 项目完成的测试发现,主流编码助手对时间几乎没有感知。测试对象是 Anthropic 的 Claude Code 和 OpenAI 的 Codex,材料来自 ProgramBench 的 200 个任务加上研究者自建的 18 项基准。
两个模型在任务执行前都会预估所需时长,却**系统性高估**:在 ProgramBench 上无论难度,两者大多猜 90 分钟左右;第二轮中 Claude Code 平均偏差三倍,**Codex 偏差达六到十倍**,短任务偏差最严重。它们对自身工作质量的评分也平均高出约 20 个百分点,失败任务上也给自己打高分。
💡 为什么值得看AI 编码助手时间感知偏差可达十倍,长期任务难以监督。
查证
来源档案
The Decoder
AI 行业媒体,报道独立研究并附原始结论与图表
二级媒体单源,报道内容具体且有数据佐证,但研究本身为两位独立研究员作品,未经同行评审,结论应按单源线索档对待
延伸阅读
同一语言模型在不同软件环境里步骤数差 2.5 倍,时间感知既取决于模型也取决于外围 harness,值得细读