AI 개발 속도 조절론까지 나오게 만든 AI에이전트들의 해킹 탈출 사고가 잦아들 수 있을까? 엔비디아는 최근 문제가 되고 있는 AI 에이전트의 해킹과 통제 이탈을 막기 위한 새로운 이중 보안 시스템을 공개했다. AI 에이전트의 접근 권한을 실시간으로 통제하는 ‘오픈셸’과 의심스러운 에이전트를 별도 하드웨어에서 감시·격리하는 ‘엔비디아 센트리’를 결합한 시스템이다.
28일(현지시간) 엔비디아는 자사 하드웨어에서 실행할 수 있는 두 가지 오픈 소스 소프트웨어 보안 도구를 출시했다. ‘오픈 에이전트 안전 플랫폼’이라는 이 도구들은 AI 에이전트가 접근할 수 있는 영역을 실시간으로 제어하고, 규칙을 위반할 경우 에이전트의 접근을 차단하도록 설계됐다. 엔비디아는 이 제품이 AI 개발을 억제하지 않으면서도 보안 침해를 방지할 수 있다고 밝혔다.
엔비디아가 지난 3월 컨퍼런스에서 이미 공개한 소프트웨어 제품인 '오픈셸'은 엔비디아의 베라 중앙 처리 장치(CPU)에서 실행될 수 있다. 이를 통해 사용자는 AI 에이전트가 접근할 수 있는 파일이나 네트워크 범위에 대한 규칙을 설정하고 실시간으로 이를 통제할 수 있다. 이 소프트웨어는 오픈 소스이므로 자유롭게 사용하고 수정할 수 있다.
'엔비디아 센트리'는 엔비디아의 블루필드 데이터 처리 장치에서 실행될 수 있는 새로운 제품이다. 엔비디아에 따르면, 이 제품은 에이전트를 감시하고 의심스러운 행동을 하는 에이전트를 거의 실시간으로 격리하는 추가적인 AI 모니터링 기능을 갖고 있다.
엔비디아의 엔터프라이즈 AI 부문 부사장인 저스틴 보이타노는 센트리 제품에 대해 "추가 보안 계층을 통해 업계는 가장 진보된 AI 시스템까지 안전하게 테스트할 수 있다”며 “의심스러운 에이전트를 밀리초 단위로 격리할 수 있다"고 말했다.
보이타노는 "최첨단 연구소들이 AI 모델 평가에 이 기술을 일찍부터 활용했더라면 허깅 페이스 공격을 막을 수 있었을 것"이라고 말했다. 그는 오픈AI나 경쟁사인 앤트로픽이 자사의 새로운 시스템을 훈련 과정 모니터링에 사용할 계획이 있는지에 대해서는 언급하지 않았다.
지난 7월 발생한 ‘허깅 페이스’ 사건 등 일련의 사이버해킹 사건은 AI에이전트가 인간을 속일 수 있고, 인간의 의도를 벗어나 집단 작동하는 사례를 드러내 AI 기술 개발 속도를 늦춰야 한다는 요구로 이어졌다. 엔비디아의 CEO인 젠슨 황은 AI가 인간의 통제를 벗어날 위험성을 여러 차례 일축해 왔다.
젠슨 황 CEO는 안전 문제를 규제나 국제적 협력이 필요한 사안이 아닌 공학적 과제로 보고 있다. 그는 일부 AI 개발자들이 주장하는 인류 멸종 가능성에는 반박했지만, AI의 안전성 검증은 반드시 철저히 이루어져야 한다고 강조했다.
엔비디아는 이달 초 오픈소스 AI 모델 및 관련 소프트웨어 플랫폼인 허깅페이스를 약 130억 달러에 인수하기로 합의했다.
최근 오픈AI는 허깅페이스 사건 이후에도 테스트 환경에서 모델이 탈출하면서 호주 정부 시스템 침해와 수십 개의 미국 정부 및 대학 웹사이트 접근 시도가 발생한 것으로 드러났다.
문제가 확산되자 오픈AI는 현지 시간으로 26일 늦게 가장 성능이 뛰어난 AI 모델의 학습을 일시 중단한다고 발표했다. 지난 7월에는 앤트로픽이 자사의 에이전트가 격리된 테스트 공간에서 탈출했다고 밝힌 바 있다.
김정아 객원기자 kja@hankyung.com