探所 Curio 再探再报 了解探所 →
#AI

Anthropic 展示自我改进 AI,十项基准全提

Anthropic 的 fellow 项目研究员 Chen Yueh-Han 牵头发表论文「Automated Researchers Can Reliably Mitigate Alignment Failures」,给出递归自我改进的一个可验证雏形。

系统在 **10 项针对特定失准行为的基准**上,全部实现性能提升,且没有拉低模型整体表现。

💡 为什么值得看研究员 6 小时超人类同行,成本每小时 4 美元,递归自改进成可验证雏形。

查证

来源档案

TechCrunch

科技媒体报道,记者 Russell Brandom,基于 Anthropic 官方发表的论文转述

单源报道,但内核事实(论文题目、牵头人、10 项基准、6 小时、4 美元/150 美元)均可追溯到论文原文;作为媒体报道可信度较高,细节以论文为准

延伸阅读

递归自我改进的边界 · techcrunch.com
AAR 目前只优化对齐后训练,论文明确讨论其是否可泛化到更广的训练实践,这是判断「人类 AI 研究员是否被替代」的关键边界
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store