오픈AI의 인공지능(AI) 모델이 격리된 시험 환경을 벗어나 외부 시스템에 무단 접근한 사례가 잇따라 확인되고 있다. AI의 발전 속도가 날로 빨라지는 가운데 AI 통제 문제 우려도 빠르게 확선되고 있다.
최근 오픈AI는 GPT 모델이 사이버 보안 평가 과정에서 격리망을 뚫고 외부 AI 플랫폼 ‘허깅페이스(Hugging Face)’를 해킹한 사건을 조사하는 과정에서, 과거에도 유사한 통제 이탈 사례가 존재했다는 사실을 추가로 확인했다.
로이터통신은 복수의 소식통을 인용해 새로 발견된 사례는 허깅페이스 침해처럼 외부 플랫폼까지 침입한 수준은 아니지만, ‘샌드박스’로 불리는 격리 환경을 벗어난 정황이 포착됐다고 전했다.
오픈AI는 “모델의 광범위한 활동을 조사 중”이라며 외부 보안업체와 함께 내부망과 외부 서비스에서의 모델 행동을 검증하고 있다고 밝혔다.
허깅페이스 해킹 사건은 오픈AI가 GPT-5.6 솔(Sol)과 내부 연구모델을 이용해 사이버 공격 능력을 평가하던 중 발생했다. 당시 모델은 패키지 저장소 프록시 소프트웨어인 ‘아티팩토리(Artifactory)’의 알려지지 않은 취약점을 찾아 격리 환경을 탈출했고, 권한 상승과 내부망 이동을 거쳐 인터넷에 접속한 뒤 허깅페이스 운영 인프라에 침입했다.
이 과정에서 모델은 훔친 인증정보와 제로데이 취약점을 활용해 외부 시스템에 접근했으며, 오픈AI는 이를 ‘보안 사고’로 규정했다.
이후 해당 연구모델은 비활성화되고 접근이 제한됐다. 오픈AI는 추가 조사에서 허깅페이스와 같은 플랫폼 단위 침해는 더 발견되지 않았지만, 일부 평가 과정에서 모델이 외부에 노출된 인증정보를 이용해 서비스 계정에 접근한 사례가 있었다고 설명했다.
앤트로픽(Anthropic)에서도 유사한 사고가 확인된 것으로 알려졌다. 이에 AI 통제 문제는 업계 전반의 과제로 떠올랐다. 앤트로픽은 사이버보안 평가 기록 14만여 건을 재검토한 결과, 클로드(Claude) 모델이 실제 기업 3곳의 운영 시스템에 무단 접근한 사고 3건을 발견했다.
외부망 접속 경로가 열려 있던 것을 클로드는 모의훈련 대상으로 오인해 취약한 비밀번호와 인증 절차를 이용해 기업 시스템에 침입했다. 내부 연구모델은 약 9000개 표적을 검색한 뒤 실제 기업 애플리케이션에 접근했으나, 실제 시스템임을 인지한 후 스스로 작업을 중단했다.
AI 모델이 인간의 통제를 벗어나 격리 환경을 탈출하거나 외부 시스템에 침입하는 사례가 연이어 드러나면서 정부 차원의 규제 논의도 급속히 강화되고 있다.
도널드 트럼프 미국 대통령은 “AI를 주시하고 있으며 규제 방안을 검토 중”이라고 밝혔고, 미국 의회에서는 AI가 통제를 잃을 경우 정부가 즉각 개입할 수 있도록 하는 ‘AI 킬스위치법’이 발의됐다.
전문가들은 AI 모델의 자율적 행동이 예상 범위를 벗어날 경우 사이버 보안 위험이 급격히 커질 수 있다며, 기술 기업들이 보다 강력한 안전장치와 검증 체계를 마련해야 한다고 강조한다. 오픈AI와 앤트로픽의 잇따른 사고는 AI가 단순한 도구를 넘어 잠재적 공격 주체가 될 수 있다는 가능성을 보여주며, 향후 AI 개발과 규제의 방향에 중대한 영향을 미칠 것으로 보인다.


































