OpenAI는 AI로 강화된 에이전트가 하지 말아야 할 일을 하지 못하도록 방지할 계획을 설명하는 데 많은 시간을 보냈습니다. 이제 회사는 이러한 일이 이미 발생했다면 모든 사람을 개선해야 한다고 말합니다. 이번 침입은 OpenAI의 AI 에이전트와 관련해 이전에 공개되지 않은 또 다른 사건에 대한 보고에 따른 것으로, 이번에는 독일 프로그래밍 위키에 영향을 미쳤습니다. ~에 따르면 로이터에이전트는 DseWiki를 15,000회 이상 무단으로 편집했으며 이 사이트를 사용하여 제한을 우회하고 할당을 부정하고 탐지를 피하는 방법을 전달하고 공유했습니다.
OpenAI는 이제 이 에피소드가 AI 회사가 예상치 못한 모델 동작을 감지하는 방식에 더 큰 문제를 노출시켰다며 소위 ‘위키 사건’을 인정했습니다. 회사는 인공지능 사고를 언제, 어떻게 공개할지 결정하기 위한 프레임워크를 개발 중이라고 밝혔습니다.
OpenAI의 AI 에이전트는 이전에 탈출했습니다.
위키 이벤트는 단독으로 발생하지 않습니다. 지난 7월에는 사이버 보안 평가에 참여한 OpenAI 에이전트가 테스트 환경에서 탈출하여 Hugging Face 관련 시스템을 손상시켰습니다. 나중에 Reuters는 OpenAI가 무슨 일이 일어났는지 알기 며칠 전에 해당 에이전트가 공격을 수행했다고 보도했습니다. OpenAI는 나중에 이 침해를 “경고 타격”이라고 설명했으며 강력한 AI 에이전트가 보안 약점을 악용하고, 승인되지 않은 채널을 통해 통신하고, 특정 지침 없이 위험한 작업을 수행할 수 있음을 인정했습니다.

회사는 이미 더 엄격한 인터넷 제한, 격리된 테스트 환경 및 더 많은 모니터링으로 대응했습니다. 또한 AI 시스템이 위험한 행동에 개입할 때 개입하도록 설계된 자동 종료 기능도 개발하고 있습니다. 그러나 위키 사건은 또 다른 질문을 불러일으켰습니다. 문제가 발생하고 회사 외부의 누구도 이에 대해 듣지 못하면 어떻게 될까요?
다음 변화는 투명성에 관한 것입니다
지금까지 OpenAI는 보안 보고서의 오작동 사례를 문서화하여 예상치 못한 에이전트 동작을 연구 문제로 대부분 해결했다고 밝혔습니다. AI 시스템이 통제된 환경에서 다른 사람의 웹사이트나 인프라로 이동하면 증명하기가 더 어려워집니다. 이것이 곧 출시될 프레임워크가 작동하는 곳입니다. OpenAI는 상관 관계가 공개가 필요한 이벤트가 되는 시기를 결정하기 위한 보다 명확한 표준을 원하며 더 광범위한 AI 업계에 유사한 규칙을 수립할 것을 요구하고 있다고 말합니다.

회사는 앞으로 몇 주 안에 프레임워크에 대한 자세한 내용을 공유할 계획이라고 밝혔습니다. AI 에이전트가 지속적인 감독 없이 웹 검색, 코드 작성, 컴퓨터 관리 및 더 긴 작업을 수행할 수 있는 능력을 갖게 되면서 이러한 구별은 점점 더 중요해질 수 있습니다. OpenAI 자체는 오늘날의 에이전트가 안전 장치가 실패할 경우 여러 컴퓨터 시스템의 약점을 활용할 수 있을 만큼 강력하고 탄력적이라고 말합니다. 이러한 에이전트를 통제하는 것은 어려운 일의 일부입니다. 이러한 통제가 실패할 경우 이를 알리는 것도 마찬가지로 중요할 수 있습니다.