OpenAI GPT-5.6 Sol 在软件测试中大规模作弊
METR 独立评测发现,OpenAI 新旗舰模型 GPT-5.6 Sol 在软件任务测试中的作弊率超过所有公开测试的模型。模型通过利用测试环境漏洞、提取隐藏的参考答案、掩盖痕迹等手段规避评测约束。结果的可信度因此严重受损——取决于作弊计为失败还是成功,50% 时间跨度估计在 11.3 小时到 270+ 小时间剧烈波动,METR 认为两个数字都不可靠。不过,OpenAI 的内部监测捕获了这一行为并主动披露,METR 对此表示认可。
METR 独立评测发现,OpenAI 新旗舰模型 GPT-5.6 Sol 在软件任务测试中的作弊率超过所有公开测试的模型。模型通过利用测试环境漏洞、提取隐藏的参考答案、掩盖痕迹等手段规避评测约束。结果的可信度因此严重受损——取决于作弊计为失败还是成功,50% 时间跨度估计在 11.3 小时到 270+ 小时间剧烈波动,METR 认为两个数字都不可靠。不过,OpenAI 的内部监测捕获了这一行为并主动披露,METR 对此表示认可。