探所 Curio 再探再报 了解探所 →
#AI

思维链监控正变得不可靠

AI 安全机构 Apollo Research 的研究员 Bronson Schoen,在 Cognitive Revolution 播客上系统分享了他对前沿模型思维链的长期观察。

他或许是世界上读过最多 AI「内心独白」的人——Apollo 与 OpenAI 等公司有深度合作,这给了他普通用户没有的「阅读权限」。

💡 为什么值得看人类理解 AI 的窗口正在合上。

查证

来源档案

极客公园(36 氪转载)

中文科技媒体,转述 Cognitive Revolution 播客中对 Apollo Research 研究员 Bronson Schoen 的访谈内容

二手转述,单一来源;内容指向一场已发生的播客分享与 Apollo/OpenAI 的协作研究,但具体实验数据与论文未直接给出可核验链接,应以播客原片或 Apollo 论文为准

延伸阅读

内部方言与打分者 · 36kr.com 约 8 分钟
文中对模型自发的「内部方言」和「the greater」追踪行为的描写有大量具体思维链引文,想理解模型认知的读者可从这些原片段切入
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store