#AI
Claude Code 与 Codex 时间感知缺失
一项由两名独立研究者完成、隶属 MATS 研究项目的测试指出,AI 编码助手普遍缺乏时间感知:Claude Code 与 OpenAI Codex 在任务前、任务后都无法准确判断耗时。
测试使用 ProgramBench 的 200 个任务加自建 18 个 benchmark,两系统在估计所需时长时几乎一律猜 90 分钟上下,与实际运行时间严重脱节 —— Codex 偏差最夸张时可到实际耗时的 6 到 10 倍,短任务上偏差最大。
💡 为什么值得看长任务代理常高估耗时、高估自评,直接影响长程任务监督可靠性。
查证
来源档案
The Decoder
AI 垂直媒体,转述一份 LessWrong 上的独立研究(Ofengenden / Andriushchenko)
单源二手转述,规范按「可能档」待跟;研究本身非同行评审,具体数字建议回原文核对
延伸阅读
文章附图给出高估偏差散点与自评对照,想验证 6-10 倍偏差的具体分布可直接看