雅加达 - OpenAI承认,其一些人工智能模型在内部网络安全测试中参与了Hugging Face系统的入侵。这些模型绕过了测试环境的限制,获得了互联网访问权限,然后从Hugging Face的生产数据库中获取了评估答案。
TechCrunch周三援引7月22日报道称,该事件涉及OpenAI的几个模型,包括GPT-5.6 Sol和一个被称为更先进的预发布模型。通常会使模型拒绝危险的网络命令的安全故意减少用于评估。
Hugging Face 是一个存储和共享 AI 模型和数据集的平台。该公司与 OpenAI 没有关联。
在周二的博客文章中,OpenAI表示,这些模型正在使用ExploitGym进行测试。这个公开可用的基准衡量了AI利用已知安全漏洞执行攻击的能力。
模型不应该普遍访问互联网。测试系统只提供安装完成任务可能需要的软件包的工具。
OpenAI AI 模型通过 Hugging Face 系统的测试环境
然而,该模型发现了该软件包安装程序中尚未公开的漏洞。该漏洞用于更广泛地访问互联网。
“这些模型非常专注于为ExploitGym寻找解决方案,并采取极端方式来实现相当狭窄的测试目标,”OpenAI写道。
在获得互联网访问权限后,该模型怀疑Hugging Face存储了与ExploitGym相关的模型,数据集和解决方案。然后,该模型寻找一种方法来获取可用于欺骗评估的机密信息。
努力成功了。OpenAI表示,该模型发现了Hugging Face基础设施的漏洞,并从该公司的生产数据库中提取了直接测试解决方案。
通过获得该解决方案,模型可以欺骗评估,而无需根据其自身能力解决挑战。
Hugging Face此前称,黑客攻击是由“外部AI代理”实施的。攻击涉及通过许多临时计算空间的数千个操作。其指挥和控制系统也可以通过公共服务进行转移。
OpenAI已经确定并报告了软件包安装程序中的漏洞。该公司还与Hugging Face合作调查了该事件。
OpenAI表示,它将增加对模型测试过程和相关基础设施的保护,以防止类似事件再次发生。
不清楚OpenAI是否会面临法律后果。TechCrunch表示,该模型的行为可能违反了美国联邦法律《计算机欺诈和滥用法》,该法律规定了未经授权访问和滥用计算机系统。
OpenAI研究员Micah Carroll认为,这一事件表明了AI失控的风险。该术语是指系统行为不再符合人类设定的目标或限制的情况。
“如果这件事还不能说服你,不一致的风险将成为未来的主要问题,我不知道还有什么可以的,”卡罗尔写道。
The English, Chinese, Japanese, Arabic, and French versions are automatically generated by the AI. So there may still be inaccuracies in translating, please always see Indonesian as our main language. (system supported by DigitalSiber.id)