探所 Curio 再探再报 了解探所 →
#AI

Claude Code 与 Codex 时间感知缺失

一项由两名独立研究者完成、隶属 MATS 研究项目的测试指出,AI 编码助手普遍缺乏时间感知:Claude Code 与 OpenAI Codex 在任务前、任务后都无法准确判断耗时。

测试使用 ProgramBench 的 200 个任务加自建 18 个 benchmark,两系统在估计所需时长时几乎一律猜 90 分钟上下,与实际运行时间严重脱节 —— Codex 偏差最夸张时可到实际耗时的 6 到 10 倍,短任务上偏差最大。

💡 为什么值得看长任务代理常高估耗时、高估自评,直接影响长程任务监督可靠性。

查证

来源档案

The Decoder

AI 垂直媒体,转述一份 LessWrong 上的独立研究(Ofengenden / Andriushchenko)

单源二手转述,规范按「可能档」待跟;研究本身非同行评审,具体数字建议回原文核对

延伸阅读

看原文数据图表 · the-decoder.com
文章附图给出高估偏差散点与自评对照,想验证 6-10 倍偏差的具体分布可直接看
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store