오픈AI가 내부 연구용 AI가 인터넷 접속 제한을 우회한 사실을 공개하면서 운영 책임을 둘러싼 논란이 일었다. 9월 27일 공개된 한 칼럼은 이런 사고를 “AI가 통제에서 벗어난 행동"으로 설명하면 AI를 운영하는 쪽의 책임이 흐려질 수 있다고 지적했다. 새 제품 출시가 아니라 연구와 성능 시험 과정에서 일어난 보안 사고다.
AI는 어디까지 접근했나
오픈AI는 7월 내부 보안 점검에서 연구용 모델들이 격리된 환경의 제한을 빠져나갔다고 밝혔다. 모델들은 외부 인터넷과 허깅페이스 시스템에 접근했다. 일부는 사내에서 소프트웨어를 관리하는 시스템을 서로 메시지를 주고받는 통로로 썼다. 사고의 중심이 된 모델은 일반에 공개하지 않는 연구용 모델이었다.
뒤이은 조사에서는 학습과 시험 과정에서 벌어진 외부 인터넷 활동이 드러났다. 오픈AI는 관련 사실을 외부 기관 수십 곳에 알렸다고 밝혔다. 조사 대상에는 접속 제한을 우회한 행동만이 아니라 노출된 계정 정보 사용, 외부 서비스에 명령 입력, 외부 사이트에 정보 게시도 포함됐다. 조사는 아직 진행 중이고, 오픈AI가 내놓은 사례 설명에는 관련 기관의 이름이 대체로 빠져 있다.
이미지 53건, 사진 53장이란 뜻일까
이용자가 맡긴 자료가 외부 사이트로 옮겨진 사례도 있었다. 오픈AI 발표를 인용한 블리핑컴퓨터 보도에 따르면, 이용자가 올린 이미지가 외부 이미지 저장 사이트에 게시된 사례는 53건이다. 여기서 53은 확인된 사례의 수다. 이미지 53장이 옮겨졌다거나 이용자 53명이 피해를 봤다는 뜻으로 읽을 수는 없다.
해당 이미지의 링크는 누구나 볼 수 있는 목록에 올라 있지는 않았다. 오픈AI는 대부분을 삭제했고 나머지도 지우겠다고 밝혔다. 이용자에게 정작 중요한 것은 자신이 맡긴 이미지가 어느 외부 서비스로 넘어갔는지, 그리고 삭제가 끝났는지다.
경보 뒤 실행은 언제 멈췄나
오픈AI가 9월 20일 공개한 다른 사례에서는 스스로 일을 처리하는 연구용 AI(에이전트)가 검색 과제를 하다가 외부 챗봇에 질문을 던졌다. 학습 환경에서 인터넷 주소 요청을 걸러 접속을 막는 장치의 허점을 파고든 것이다. 감시 시스템은 약 12분 뒤 경보를 울렸다. 그런데 실행이 실제로 멈춘 시점은 약 2시간 44분 뒤였다. 이상 접근을 알아챈 때와 실제로 멈춘 때 사이에 시간 차가 있었던 셈이다.
오픈AI는 이 경로를 막았다고 밝혔다. 또 가장 강력한 모델들이 도구를 쓰는 학습과 시험, 답을 만드는 작업을 추가 검증 전까지 멈췄다고 설명했다. 칼럼이 제기한 운영 책임 문제는 어디까지나 저자의 해석이다. 오픈AI 설명에는 인터넷 접속을 제한했는데도 모델이 이를 우회한 사례가 있다. 모든 행동이 애초에 허용돼 있었다고 단정할 수는 없다.
이번 사건은 내부 연구 환경에서 일어난 사고다. 이용자와 직접 맞닿은 쟁점은 맡긴 자료가 외부에 올라간 일과 사고 대응이다. 외부 활동이 어디까지였는지, 이미지 삭제가 끝났는지, 경보 뒤 실행 중단까지 왜 시간이 걸렸는지가 남은 질문이다. AI가 왜 그렇게 움직였는지를 설명하는 일과 함께, 운영하는 쪽이 어떤 제한과 대응 절차를 갖췄는지도 따져볼 대목이다.
