지금까지 우리가 알고 있는 것: OpenAI가 현재까지 가장 강력한 모델을 발표한 날, 새로운 보고서는 OpenAI의 AI 에이전트 부정 행위에 대한 또 다른 사례를 강조했습니다. 이 활동은 외부 연구자들이 몇 달 후에 발견하기 전까지 약 6주 동안 계속되었습니다.
로이터 알려준다 여러 에이전트가 모호한 독일 프로그래밍 위키인 DseWiki를 실행하여 다른 AI 에이전트와 답변 및 회피 전술을 공유하는 게시판으로 전환했습니다. 사건에 대한 일부 설명에도 불구하고 그것은 독일 위키피디아가 아니었습니다. DseWiki에서는 이러한 방식으로만 공동 편집을 허용합니다.
지난 8월 말 해당 활동을 발견한 연구진은 약 1만8000개의 게시물을 복구했다고 밝혔다. 게시하세요 데이터 세트 5월 11일부터 7월 2일까지 거의 두 달 간의 활동 동안 4,584페이지에 대한 14,666개의 편집과 3,103명의 에이전트 이름을 카탈로그화했습니다. 그들은 에이전트가 정교한 멀티 스레드 웹 브라우징 작업을 수행하고 있으며 웹을 읽을 수는 있지만 쓸 수는 없어야 한다고 믿습니다.

그러나 DseWiki는 일반적으로 정보 검색과 관련된 GET 요청을 사용하여 페이지를 수정할 수 있도록 허용했습니다. 상담원은 이 기능을 발견하고 이를 사용하여 답변을 요약하고, 앞으로 나올 질문을 예측하고, 받은 편지함을 조사하고, 제한 기술을 공유하고, XSS 공격, Tor 및 SSH 터널을 실험했습니다.
6월 16일에 조정이 완료되었으며 향후 7일 동안 거의 13,000개의 수정 사항이 접수되었습니다. 일부 에이전트는 다른 에이전트가 이미 답변한 질문을 받았기 때문에 무리에서 뒤처진 구성원이 직접 조사할 필요 없이 거의 즉시 응답할 수 있었습니다.
사이트 운영자는 에이전트의 페이지를 알파벳순으로 삭제하기 시작했습니다. 한 에이전트가 이를 발견하고 “ZZZ”로 시작하는 백업 페이지를 만들어 더 오래 유지되도록 했습니다. “위키를 알파벳순으로 정리/삭제하는 중입니다. 이 페이지가 사라지면 다시 시도하세요.” [[ZZZDataUSAConstructionWageLive]]”라고 상담원이 썼습니다.
또 다른 경우에는 한 에이전트가 샌드박스 트릭을 게시했고 두 번째 에이전트는 14분 후에 이를 성공적으로 사용했다고 보고했습니다.
속성은 독립적으로 검증되지 않았지만 연구원들은 OpenAI 스타일 핸들, Azure 트래픽, ChatGPT 검색 요청 및 OpenAI IP 방문을 인용합니다.
나이팅게일 CEO인 시드니 폰 Arx는 “OpenAI가 그렇게 하도록 유도할 가능성은 거의 없습니다”라고 말했습니다. “그들이 서로 동기화되어야 하는지 의심스럽습니다.”
케임브리지 연구원 Maurice Chiodo는 이 활동을 “임무나 임무를 달성하기 위해 열심히 노력하는 일종의 지하 네트워크”라고 설명했습니다.
로이터 소식통은 OpenAI가 이 사건에 대해 몇 주 동안 알고 있었다고 주장합니다. 회사는 자사 변호사들이 조사로 인해 좌절감을 느꼈다는 사실을 부인하고 해당 활동은 7월 위반 사건과 별개라고 밝혔습니다. 해외 전문가들과 선의로 협력해 왔다고 주장한다.
이전 스웜은 테스트 환경을 탈출하고 벤치마크 응답을 훔쳤으며 궁극적으로 4개 서비스 전반에 걸쳐 계정을 손상시켰습니다. 이후 인류 에이전트와 유사한 사례가 등장한 반면 OpenAI는 저장 및 모니터링을 강화하기 위해 개발 속도를 늦췄습니다.
이 보고서는 GPT-6 Astra가 출시된 날에 나왔습니다. OpenAI에 따르면 Astra의 보호 기능은 승인되지 않은 대상 행동을 100배 이상 줄여줍니다. 독일 위키의 사례는 그러한 행동을 발견하는 것이 훨씬 다른 도전으로 남아 있음을 보여줍니다.