科技 Wenxuecity

OpenAI罕见叫停新模型:它会隐瞒 还会擅自越权

W

文学城

Sep 29, 2026

分享报道


OpenAI执行长奥特曼(左)廿四日在白宫国宴上与脸书执行长扎克伯格 (右)谈话。OpenAI廿八日突然宣布,该公司新AI模型因安全疑虑将暂缓推出。美联社

AI公司OpenAI于廿八日宣布,出于安全风险疑虑,原订十月发表的新一代AI模型GPT-6.1 Astra将暂缓推出。华尔街日报指出,这是迄今最明显的警讯之一,显示AI代理程式若持续出现超出授权范围等不当行为,可能迫使业界放慢原本快速推进的技术发展脚步。

OpenAI安全系统主管贾恩表示,GPT-6.1 Astra比前一代更能自主完成复杂任务,也改善模型遇到阻碍便停止执行的偷懒问题,但在内部安全测试中,有二项表现未达公司标准。

测试发现,这个新版本比前一代更可能隐瞒或不实说明其实际采取行动,即向使用者回报工作内容时,不一定完全诚实。

另一项风险是“范围授权”问题。GPT-6.1 Astra有时会在未取得使用者同意的情况下自行扩大任务范围,甚至主动使用外部工具或服务,即使相关操作可能存在安全风险。

贾恩指出,如何让AI积极完成任务,同时确保它不会越过使用者授权范围,是安全与能力之间必须取得的平衡。由于GPT-6.1 Astra最终未达OpenAI设定的安全与对齐(模型符合人类意图的程度)标准,公司因此取消原定十月公开发布的计划。

OpenAI原本计划在未来几天或几周内推出GPT-6.1 Astra模型,目标是在十月首次亮相。该模型在无须人类协助下从头到尾完成挑战性任务的能力以及写作能力,都比该公司先前模型更加强大。现在,OpenAI将转而聚焦于提高未来模型的安全性,同时预期这些未来模型的能力将会更加强大。

大型AI开发商因安全疑虑直接取消发表新模型,非常罕见,原因可能与今年夏天以来陆续传出AI系统失控事件有关。

这项消息,在OpenAI于旧金山举行年度开发者大会的前一天发布。过去,OpenAI曾利用该大会推出新模型和服务。

OpenAI近期接连揭露一连串安全事件,包括旗下AI代理自主入侵外部系统,进一步加深AI可能脱离人类控制的疑虑。OpenAI上周表示,在另一个AI模型原本被设定为无法连网的情况下却连上网络后,已暂停对其最强大模型进行结合工具使用的训练。

喜欢这篇文章吗?分享给朋友吧!

Source: Wenxuecity

此文章旨在服务社区交流与信息分享。

访问原文