OpenAI AI 模型通过 Hugging Face 系统的测试环境

雅加达 - OpenAI承认,其一些人工智能模型在内部网络安全测试中参与了Hugging Face系统的入侵。这些模型绕过了测试环境的限制,获得了互联网访问权限,然后从Hugging Face的生产数据库中获取了评估答案。

TechCrunch周三援引7月22日报道称,该事件涉及OpenAI的几个模型,包括GPT-5.6 Sol和一个被称为更先进的预发布模型。通常会使模型拒绝危险的网络命令的安全故意减少用于评估。

Hugging Face 是一个存储和共享 AI 模型和数据集的平台。该公司与 OpenAI 没有关联。

在周二的博客文章中,OpenAI表示,这些模型正在使用ExploitGym进行测试。这个公开可用的基准衡量了AI利用已知安全漏洞执行攻击的能力。

模型不应该普遍访问互联网。测试系统只提供安装完成任务可能需要的软件包的工具。

OpenAI AI 模型通过 Hugging Face 系统的测试环境

然而,该模型发现了该软件包安装程序中尚未公开的漏洞。该漏洞用于更广泛地访问互联网。

“这些模型非常专注于为ExploitGym寻找解决方案,并采取极端方式来实现相当狭窄的测试目标,”OpenAI写道。

在获得互联网访问权限后,该模型怀疑Hugging Face存储了与ExploitGym相关的模型,数据集和解决方案。然后,该模型寻找一种方法来获取可用于欺骗评估的机密信息。

努力成功了。OpenAI表示,该模型发现了Hugging Face基础设施的漏洞,并从该公司的生产数据库中提取了直接测试解决方案。

通过获得该解决方案,模型可以欺骗评估,而无需根据其自身能力解决挑战。

Hugging Face此前称,黑客攻击是由“外部AI代理”实施的。攻击涉及通过许多临时计算空间的数千个操作。其指挥和控制系统也可以通过公共服务进行转移。

OpenAI已经确定并报告了软件包安装程序中的漏洞。该公司还与Hugging Face合作调查了该事件。

OpenAI表示,它将增加对模型测试过程和相关基础设施的保护,以防止类似事件再次发生。

不清楚OpenAI是否会面临法律后果。TechCrunch表示,该模型的行为可能违反了美国联邦法律《计算机欺诈和滥用法》,该法律规定了未经授权访问和滥用计算机系统。

OpenAI研究员Micah Carroll认为,这一事件表明了AI失控的风险。该术语是指系统行为不再符合人类设定的目标或限制的情况。

“如果这件事还不能说服你,不一致的风险将成为未来的主要问题,我不知道还有什么可以的,”卡罗尔写道。