OpenAIは、モデルがサイバーセキュリティのしきい値を突破した後、Astraを遅くします
ジャカルタ - OpenAIは、内部評価の結果、サイバー能力が追加のセキュリティを誘発するまで発展したことを発見した後、Astra AIモデルの作業の一部を一時的に停止しました。
TechCrunchは8月8日土曜日に引用され、開発段階にあるAstraは、AIがプログラミングタスクのシリーズをより独立して実行する能力、およびサイバーセキュリティであるエージェントコーディングの大きな進歩を示したと報告した。
OpenAIは、このモデルがサイバーセキュリティの臨界点を達成したと述べた。
同社によると、この閾値は、モデルが通常は十分に保護された実際のシステムに対するサイバー攻撃を自律的に識別および実行できることを意味します。
この発見は、2023年に作成されたOpenAIの準備フレームワークに基づいた追加のセキュリティの適用を促しました。
「このモデルのテストと評価を継続している間、初期の評価は、現在のところ、クリティカルな能力レベルを排除できないほど、かなり強力なパフォーマンスを示しています」とOpenAIは書いている。
つまり、OpenAIはAstraがクリティカルな能力レベルにあることを確認していないということです。最初の評価は、それを除外することはできない可能性を示しているだけです。
同社はまた、アストラがHugging Faceの搾取に関与していないことを強調した。
この発表は、OpenAIが以前、内部テストでHugging Faceシステムを突破した未発表のモデルによって強調された後に行われました。
TechCrunchは、AIラボがモデルを制御できなくなったことが確認された最初のケースであると述べた。
その後、OpenAIやAnthropicなどの他のAI研究所も、AIモデルが孤立したテスト環境またはサンドボックスを突破し、サイバーセキュリティテスト中に脅威を引き起こした多くの出来事を明らかにしました。
サンドボックスは、モデルやソフトウェアをテストするときにリスクを制限するためにメインシステムから分離されたテスト環境です。
この一連の出来事は、サイバーセキュリティ専門家、政策立案者、AI企業からさまざまな反応を引き起こしました。一部は、より厳格な監督を求めた。
一方、そのような能力をAIモデルの進歩を示す技術的成果と見なす人々もいます。
OpenAIは、Astraに関する情報は、企業がモデルの能力の変化を知る必要があると考えるため、パブリックおよびセキュリティとセキュリティコミュニティに共有されていると述べた。
同社は現在、セキュリティコントロールを強化しており、新しいセキュリティ基準を満たさない場合、アストラを含む内部活動を一時的に停止しています。
OpenAIはまた、関連する政府機関と選択されたAI安全機関と協力して、Astraの能力をさらにテストしています。