오픈AI가 GPT-6 아스트라에 이어 GPT-6 솔(Sol)과 루나(Luna)를 추가로 내놨다. 최고 성능이 필요한 작업은 아스트라에 맡기고 일상적인 전문 업무나 개발 작업에선 속도·비용 효율을 높인 솔·루나를 선택하도록 GPT-6 제품군을 세분화한 것이다. 이들 두 모델은 이전 세대보다 업무 수행, 사실 정확성, 코딩, 컴퓨터 사용 능력을 끌어올렸다. 그러면서도 응용프로그램인터페이스(API) 가격은 기존 프로모션 가격 대비 절반 수준으로 낮췄다.
오픈AI는 23일 GPT-6 솔·GPT-6 루나를 출시했다고 밝혔다. 두 모델은 GPT-6 아스트라와 유사한 방식으로 학습됐다. 각각 GPT-5.6 솔과 GPT-5.6 루나보다 전문 업무, 사실 정확성, 코딩, 컴퓨터 사용, 정렬 등에서 성능을 개선했다. 아스트라가 높은 수준의 성능이 필요한 중요 작업에 초점을 맞췄다면 솔·루나는 더 빠르고 비용 효율적인 방식으로 GPT-6를 활용할 수 있도록 설계됐다.
실제 업무 환경을 가정한 평가에서도 성능 개선이 나타났다. 영업·마케팅·운영·고객지원·재무·인사 등에서 47개 도구를 활용해 업무 전 과정을 수행하는 능력을 평가하는 오토메이션벤치에서 GPT-6 솔은 '매우 높음'(xhigh) 추론 수준 기준으로 33.2%를 기록했다. GPT-6 아스트라를 '낮음'(low) 추론 수준으로 설정했을 때(30.3%)보다 높은 점수다. GPT-6 루나는 '높음'(high) 추론 수준에서 GPT-5.6 루나보다 5.4%포인트 높은 점수를 내면서도 작업당 비용은 58% 낮췄다. 추론 수준은 모델이 문제를 풀 때 투입하는 '추론 자원'의 양을 조절하는 설정이다.
사실 오류도 줄었다. 오픈AI가 이용자들이 기존 모델의 오류를 지적한 비식별화된 실제 챗GPT 대화를 대상으로 평가한 결과 GPT-6 솔의 오류는 GPT-5.6 솔 대비 약 절반 수준이었다. 더 적은 비용으로 GPT-6 아스트라에 근접한 정확성을 보였다는 설명이다. GPT-6 루나는 높은 추론 수준에서 GPT-5.6 솔과 비슷한 정확성을 내면서 비용은 약 100분의 1 수준에 그쳤다. 다만 이 평가는 오류가 발생하기 쉬운 대화를 선별해 진행한 만큼 일반적인 챗GPT 사용 환경에서 나타나는 오류율을 뜻하지는 않는다.
코딩 작업에선 모델이 스스로 수행한 작업을 사실과 다르게 설명하는 현상도 대폭 줄었다. 오픈AI 내부 평가에서 이 같은 응답 비율은 GPT-6 솔이 1.3%, GPT-6 루나가 2.8%였다. GPT-5.6 솔은 10.4%, GPT-5.6 루나는 9.5%였던 것에 비하면 개선 폭이 큰 셈이다. 이는 사실과 다른 설명을 유도하기 위해 선정한 어려운 코딩 작업을 대상으로 한 평가 결과다.
개발 비용을 낮추기 위한 기능도 강화했다. 반복적으로 사용하는 입력 문맥을 다시 처리하지 않고 재사용하는 '프롬프트 캐싱'의 기본 적중률을 높였다. 캐시된 입력 토큰에는 90% 할인된 가격을 적용한다. 깃허브는 최근 수개월 동안 이 같은 개선으로 새롭게 처리해야 하는 프롬프트 토큰 비중이 50% 이상 줄었다고 했다.
컴퓨터를 직접 조작하는 능력에서도 비용 효율을 높였다. AI가 컴퓨터를 이용해 여러 단계로 이어지는 일상·전문 업무를 수행하는 능력을 측정하는 'OSWorld 2.0' 오프라인 평가에서 GPT-6 솔과 루나는 각각 이전 세대보다 높은 비용 효율을 보였다. 특히 GPT-6 루나는 최대(max) 추론 수준에서 GPT-5.6 솔의 중간(medium) 추론 수준보다 높은 성능을 기록하면서 비용은 약 10분의 1 수준에 불과했다.
GPT-6 솔과 루나는 플러스·프로·비즈니스·엔터프라이즈·에듀 이용자를 대상으로 챗GPT 워크·코덱스에서 제공된다. 무료나 '고' 요금제 이용자는 데스크톱 앱에서 GPT-6 루나를 사용할 수 있다.
가격은 GPT-6 솔이 입력 100만토큰당 2달러, 출력 100만토큰당 10달러다. GPT-6 루나는 각각 0.1달러와 0.5달러다. 두 모델 모두 GPT-5.6 솔·루나의 프로모션 가격보다 50% 낮다. 출시 당일 챗GPT 워크·코덱스에 순차 적용되고 일반 챗GPT 대화 화면엔 아직 제공되지 않는다.
김대영 한경닷컴 기자 kdy@hankyung.com