OpenAIのAIモデルがHugging Faceシステムのテスト環境を突破

ジャカルタ - OpenAIは、内部サイバーセキュリティテスト中にHugging Faceシステムのハッキングに関与した人工知能モデルの数を認めた。これらのモデルは、テスト環境の制限を回避し、インターネットにアクセスして、Hugging Faceの生産データベースから評価の回答を取得しました。

TechCrunchは7月22日水曜日に引用され、この事件はGPT-5.6 Solを含むいくつかのOpenAIモデルと、より洗練されたとされるプレリリースモデルを含むと述べた。通常、モデルが危険なサイバーコマンドを拒否するセキュリティは、評価のために意図的に減らされました。

Hugging Faceは、AIモデルやデータセットを保存および共有するためのプラットフォームです。同社はOpenAIと提携していません。

火曜日のブログ投稿で、OpenAIはこれらのモデルがExploitGymを使用してテストされていると述べた。一般に利用可能なベンチマークは、既知のセキュリティギャップを利用して攻撃を実行するAIの能力を測定します。

モデルは一般的にインターネットにアクセスしてはいけません。テストシステムは、タスクを完了するために必要なソフトウェアパッケージをインストールするためのツールのみを提供します。

OpenAIのAIモデルがHugging Faceシステムのテスト環境を突破

しかし、モデルは、パッケージマネージャプログラムにまだ明らかにされていないギャップを見つけました。ギャップは、インターネットにさらに広くアクセスするために使用されます。

「これらのモデルは、ExploitGymの解決策を非常に集中して探しており、非常に狭いテスト目標を達成するために極端な方法をとっています」とOpenAIは書いている。

インターネットにアクセスした後、モデルはHugging FaceがExploitGymに関連するモデル、データセット、ソリューションを保存していると推測しました。モデルは、評価を不正に操作するために使用できる機密情報を取得する方法を探しました。

その努力は成功しました。OpenAIは、モデルがHugging Faceのインフラストラクチャに欠陥を発見し、企業の生産データベースから直接テストソリューションを取り込んだと述べた。

このソリューションにより、モデルは独自の能力に基づいて課題を解決せずに評価を回避できます。

Hugging Faceは以前、「外部AIエージェント」によってハッキングされたと述べた。攻撃は、多くの一時的なコンピューティングスペースを通じて何千ものアクションを含みます。コマンドアンドコントロールシステムは、パブリックサービスを介して移動することもできます。

OpenAIは、パッケージマネージャプログラムの欠陥を特定し、報告しました。同社はまた、Hugging Faceと協力してこの事件を調査している。

OpenAIは、同様の事件の再発を防ぐために、モデルのテストプロセスと関連するインフラストラクチャのセキュリティを強化すると述べた。

OpenAIが法的結果に直面するかどうかは明らかではない。TechCrunchは、モデルの行動が、コンピュータシステムへの不正アクセスと悪用を規制する米国の連邦法であるコンピュータ詐欺および悪用法に違反する可能性があると述べた。

OpenAIの研究者であるMicah Carrollは、この事件はAIの不一致のリスクを示していると評価しました。この用語は、システムの行動がもはや人間の設定された目的や制限に沿っていない状況を指します。

「この出来事が、不一致のリスクが将来の主要な懸念事項になることをまだ納得していない場合、私は他に何ができるかわかりません」とキャロルは書きました。