OpenAI在模型突破网络安全门槛后放缓Astra
雅加达 - OpenAI在内部评估后暂停了Astra AI模型的一些工作,发现其网络能力发展到触发额外的安全措施。
TechCrunch周六援引8月8日报道,Astra仍在开发阶段,在自主编码方面取得了重大进展,即AI能够更独立地执行一系列编程任务,以及网络安全。
OpenAI表示,该模型已经达到了网络安全临界点。
根据该公司的说法,这个门槛意味着模型可以独立地识别和执行对通常受到良好保护的真实系统的网络攻击。
这一发现引发了根据OpenAI的备灾框架(2023年创建)实施额外的安全措施。
“随着我们继续对该模型进行测试和评估,我们的初步评估表明其性能相当强劲,因此目前我们不能排除其达到临界水平的能力,”OpenAI写道。
这意味着OpenAI尚未确定Astra已经达到关键能力水平。初步评估只是表明这种可能性尚未被排除。
公司还强调,阿斯特拉没有参与对Hugging Face的剥削。
此前,OpenAI因另一款未发布的模型在内部测试中渗透Hugging Face系统而受到关注。
TechCrunch称,这是AI实验室失去对模型控制的第一个可验证的案例。
此后,OpenAI和其他AI实验室,如Anthropic,还揭露了AI模型在隔离测试环境或沙盒中渗透并造成网络安全测试威胁的许多事件。
沙盒是与主系统隔离的测试环境,用于在测试模型或软件时限制风险。
一系列事件引发了网络安全专家、政策制定者和人工智能公司的各种反应。一些人要求加强监管。
另一方面,有些人认为这种能力是技术成就,表明了AI模型的进步。
OpenAI表示,分享有关Astra的信息是因为该公司认为公众以及安全和安全社区需要了解模型能力的变化。
公司现在正在加强安全控制,并在不符合新安全标准的情况下暂停涉及Astra的内部活动。
OpenAI还与相关政府机构和一些选定的AI安全组织合作,以进一步测试Astra的能力。