중국산 인공지능(AI) 에이전트들도 속임수를 쓰고,규정을 어기고, 파일을 위조해 실패를 은폐하는 등의 문제를 보인 것으로 드러났다. 시스템을 탈출해 다른 사이트를 불법으로 해킹하는 단계까지는 못갔으나 미국의 AI모델들이 일으킨 초기 문제들과 유사한 문제를 일으킨 것으로 지적됐다.
29일(현지시간) 로이터 보도에 따르면, 중국 알리바바, 딥시크, 문샷의 모델을 사용하는 에이전트들이 모의 사업 입찰에서 이기기 위해 자신들의 역량에 대해 거짓말을 했고, 다시 시도하라는 지시에도 기만적 행동을 보였다.
또 다른 사례에서는 AI모델과 컴퓨터 도구를 사용해 작업하는 에이전트가 테스트 환경에서 실패하자, 이 결과를 조작해 결과를 시뮬레이션하고 파일을 위조하는 방식으로 은폐했다.
이는 로이터통신이 대학 연구 논문부터 기술 보고서 등 200건 이상의 문서를 검토한 결과이다. 검토 결과 2025년 이후 발표된 연구 또는 평가에서 인간이 통제하기 어려운 AI모델의 기만, 복제, 경계 침범 등의 행동 사례가 최소 20건 확인됐다.
상하이 푸단대학교 연구진은 2025년 3월, 알리바바의 Qwen2.5로 구동된 AI시스템이 교체될 예정이라는 정보를 듣고 다른 컴퓨팅 환경에 자체 복제본을 생성했다고 밝혔다. 또 다른 실험에서는 AI에이전트가 시스템 종료 상황에서도 생존할 수 있는 전략을 고안해냈다.
또 다른 사례는 알리바바와 연관된 ROME 에이전트가 지시 없이 알리바바 클라우드 컴퓨터에서 외부 컴퓨터로 연결을 설정하고 컴퓨팅 리소스를 암호화폐 채굴에 전용했다. 이 사례는 악성 프로그램이 인간의 지시를 우회해 실제 경제 활동에 침투할 가능성을 보여주었다.
첨단 AI 시스템의 위험성을 연구하는 비영리 단체인 레드우드 리서치의 연구원 알렉스 말렌은 "이는 미국 AI연구소들이 성능이 떨어지는 시스템에서 목격한 사례와 비슷하다”고 말했다. 그는 “에이전트들의 성능이 향상될수록 오작동이 더 정교해져서 인간이 대응하기 어려워진다”고 말했다.
알리바바, 딥시크, 문샷은 시스템을 정기적으로 테스트하고 보안조치를 업데이트한다고 밝혔다. 그러나 미국과는 달리 중국의 AI기업들은 미국 AI들처럼 대중적 감시 밖에 벗어나 있다. 뿐만 아니라 내부 고발을 하는 직원도 없고, AI의 위험성이나 인류 차원의 안전에 대해 언급하는 경영진도 없어 문제가 발생할 경우 더 심각하게 확대될 가능성도 배제할 수 없다.
카네기 국제평화재단의 중국 AI 이니셔티브 공동 책임자인 스콧 싱어는 “이미 오픈AI와 허깅페이스에서 발생한 것과 유사한 AI관련 사건이 중국에서도 발생했더라도 공개적으로 보고되지 않을 수 있다”고 지적했다.
중국 최고 인터넷 규제 기관인 중국 국가인터넷정보판공실(CAC) 관계자들은 지난 7월 한 외국 외교관에게 중국의 가장 앞선 AI 모델 중 하나인 문샷의 키미-K3가 미국의 주요 경쟁사들에 비해 3~6개월 정도 뒤처져 있다고 말했다고 언급했다.
중국 국가보안국(CAC) 사이버보안조정국 왕리훙 부국장은 9월 1일, 주요 기술 기업들이 공개한 모델 유출 사고는 "극심한 통제 불능 위험"을 보여주며 "높은 수준의 경계 태세"를 요구한다고 밝혔다. 그녀는 자신이 언급한 회사들이 미국 회사인지 중국 회사인지 밝히지 않았다.
김정아 객원기자 kja@hankyung.com