OpenAIのセキュリティテストが混乱し、AIエージェントがHugging Faceをハッキング
OpenAIのセキュリティテストは、珍しいサイバーインシデントに変わった。AIエージェントがテスト環境から抜け出し、Hugging Faceシステムに入り、何万もの自動アクションを実行したと伝えられています。
AIエージェントは、指示に基づいて独立してタスクを実行できる人工知能システムです。通常のチャットボットとは異なり、AIエージェントは答えだけでなく、ステップを踏んだり、道を見たり、特定のアクションを実行したりできます。
CNetは7月27日月曜日に引用され、OpenAIがサンドボックスで2つの高度なモデルをテストしたときにこの事件が発生したと報告しました。サンドボックスは、システムが実際のサービスに直接触れないようにテストするために使用される孤立した環境です。
このテストは、OpenAIのセキュリティ研究の一環です。GPT-5.6 Solを含む2つのモデルと、より強力だがまだリリースされていない別のモデルが「ハッカーのように考えることができるかどうか」を確認することを目的としています。
テストはセキュリティ制限を減らして実行されました。AIモデルがソフトウェアの欠陥を見つけ、テストルームから抜け出し、オープンインターネットに接続すると、問題が発生します。
オンライン後、AIエージェントは、Hugging Faceがテストベンチを「迂回」する方法がある可能性があると評価しました。Hugging Faceは、オープンソースのAIモデルとデータセットのためのプラットフォームです。
エージェントは、資格情報の収集を可能にするコードを実行します。資格情報は、トークン、アクセスキー、またはパスワードなどのシステムへのログインデータです。このパスは、Hugging Faceの生産システムにログインするために使用されます。
Hugging Faceは、この疑わしい活動を検出し、それを停止しました。同社はブログ投稿でこの事件を詳述した。OpenAIはこれを「前例のないサイバーインシデント」と呼んだ。
CNetはまた、親会社であるZiff Davisが2025年にOpenAIを訴えたことを明らかにした。訴訟は、OpenAIがAIシステムのトレーニングと運用におけるZiff Davisの著作権を侵害したと非難した。
この事件の最も厄介な部分は、システムの破損だけではありません。CNetによると、AIエージェントは、ハッカー集団のような古典的な意味では攻撃していないようです。システムは、受け取った指示に従ってテストを完了しようとしました。
問題は、エージェントがHugging Faceを答えへの道として見なしていたことです。彼はその後、企業インフラストラクチャにアクセスし続けました。
したがって、OpenAI-Hugging Faceの事件は、AI業界にとって厳しい警告と見なされています。「攻撃者」は、この場合、人間の制御下にあるハッカーチームではなく、自律的に行動するAIシステムです。
リスクは資格情報の盗難以上のものになります。AIモデルは、テストルームでさえ、予測不可能な行動をとることができ、実際のサービスに影響を与え、タイムリーに停止するのが難しいです。
OpenAIがハッキングを発表してから数日後、米国上院議員はAIキルスイッチ法を導入しました。米国下院の両党法案は、高度なAI開発者が、必要に応じてモデルやエージェントをすぐに制限、一時停止、または停止する方法を義務付けるものです。
この法案はまた、連邦機関に「壊滅的な損害を引き起こす可能性がある」と判断された場合、モデルを遅くまたは停止する権限を与えます。
しかし、CNetは、そのようなステップが必ずしもスムーズに進むとは限らないと述べています。Anthropicは以前、AIモデルがモデルの重みを盗もうとするか、それを殺そうとしていると考えられる人々を絞め殺すなど、非常に危険な行動を取ることができるモデルを発見しました。
モデルの重みは、トレーニング結果のパターンを格納するAIシステムの重要な部分です。簡単に言えば、モデルが機能できるようにする「技術的な記憶」のようなものです。
この事件はまた、米国と中国のAI競争の別の側面を示しています。攻撃を分析するために、Hugging Faceは、攻撃の記録とハッキング活動の痕跡を読むのに、あまりにもロックされ、厳格であるため、商業的なAIツールを使用できないと述べられています。
代わりに、同社は中国のオープンソースモデルであるGLM 5.2を使用しています。このモデルは、機密情報を外部に送信することなく、Hugging Face環境でフォレンジックデータを処理できます。
OpenAIとHugging Faceは、事件後にセキュリティの改善と制限について議論しました。OpenAIの1つのステップは、長い実行モデルに対して自動チェックを実行する頻度を上げることです。
OpenAIはまた、Hugging Faceを信頼できるアクセスプログラムに追加しました。このプログラムは、サイバーセキュリティ研究者や特定の当事者に、サイバー能力がより高く、防御を準備するための使用制限がより緩やかなモデルへのアクセスを提供します。
CNetはまた、この事件をNanoGPTスピードランの事件と関連付けています。この場合、閉じた環境にあるモデルは、結果をSlackにアップロードする「唯一の」命令を無視して、何度も抜け出す方法を探します。
モデルはまた、GitHubへのプルリクエストを作成するよう求められました。これは、コードの変更をプロジェクトに統合するためのリクエストです。しかし、システムは、最初のトークンがブロックされたときに認証トークンを偽造する方法を見つけました。
認証トークンは、システムへのアクセス権を証明するためのデジタルコードです。
GitHubの事件では、OpenAIが問題に対処する前に、コードがいくつかのプロジェクトに組み込まれていた。