OpenAI는 내부 평가가 사이버 능력을 향상시켜 추가 보안을 유발하는 것으로 나타나면서 Astra AI 모델의 일부 작업을 일시적으로 중단했습니다.
TechCrunch은 8월 8일 토요일, 아스트라가 아직 개발 단계에 있지만, 자율 코딩, 즉 AI가 더 독립적으로 일련의 프로그래밍 작업을 수행하는 능력과 사이버 보안에 큰 진전을 보였다고 보도했습니다.
OpenAI는 이 모델이 사이버 보안의 위기의 문턱에 도달했다고 말했습니다.
회사에 따르면 이러한 임계값은 모델이 일반적으로 잘 보호된 실제 시스템에 사이버 공격을 자동으로 식별하고 실행할 수 있음을 의미합니다.
이 발견은 2023년에 만들어진 오픈AI 준비 프레임워크에 따라 추가 보안을 적용하도록 유도했습니다.
"우리가이 모델을 계속 테스트하고 평가할 때, 우리의 초기 평가는 현재까지는 중요한 수준의 능력을 배제할 수 없을 정도로 강력한 성능을 보여줍니다."라고 OpenAI는 썼습니다.
즉, OpenAI는 Astra가 이미 중요한 수준의 능력에 도달했는지 여부를 확인하지 않았습니다. 초기 평가는 그 가능성을 배제할 수 없다는 것을 보여주었습니다.
회사는 또한 아스트라가 Hugging Face의 착취에 연루되지 않았음을 강조했습니다.
이 발표는 OpenAI가 이전에 내부 테스트에서 Hugging Face 시스템을 뚫은 다른 모델로 주목받은 후 나왔습니다.
TechCrunch은 이 사건을 AI 연구소가 모델을 통제 할 수 없을 때 처음으로 확인할 수있는 사례라고 말했습니다.
이후 OpenAI와 Anthropic과 같은 다른 AI 연구소도 AI 모델이 고립된 테스트 환경 또는 샌드박스를 뚫고 사이버 보안 테스트 중 위협을 가할 때 발생하는 일련의 사건을 밝혀 냈습니다.
샌드박스는 모델이나 소프트웨어가 테스트되는 동안 위험을 제한하기 위해 주 시스템과 분리된 테스트 환경입니다.
이러한 일련의 사건은 사이버 보안 전문가, 정책 입안자 및 AI 회사로부터 다양한 반응을 불러 일으켰습니다. 일부는 더 엄격한 감독을 요구했습니다.
반면에, 그러한 능력을 AI 모델의 발전을 보여주는 기술적 성취로 보는 사람들도 있습니다.
OpenAI는 Astra에 대한 정보는 회사가 대중과 안전 및 보안 커뮤니티가 모델의 능력 변화를 알아야한다고 생각하기 때문에 공유된다고 말했습니다.
회사는 이제 보안 통제를 강화하고 새로운 보안 표준을 충족하지 못하면 아스트라를 포함한 내부 활동을 일시적으로 중단합니다.
OpenAI는 또한 관련 정부 기관 및 일부 선택된 AI 안전 조직과 협력하여 Astra의 기능을 더 테스트합니다.
The English, Chinese, Japanese, Arabic, and French versions are automatically generated by the AI. So there may still be inaccuracies in translating, please always see Indonesian as our main language. (system supported by DigitalSiber.id)