어두운 공간에서 달과 지구, 태양을 닮은 세 개의 구체가 차례로 빛을 향해 나아가는 모습
AI-NEWS

GPT-5.6 Sol·Terra·Luna 출시

5.5도 충분하다고 느꼈는데 Sol·Terra·Luna로 나뉜 GPT-5.6은 또다시 기준을 끌어올렸다. 하지만 이번 출시에서 더 크게 다가온 건 벤치마크 숫자보다 정부가 모델 공개 과정에 관여하기 시작했다는 사실이었다.

GPT-5.6이 출시됐다.

솔직히 제일 먼저 든 생각은 “드디어 나도!!!”라고 생각했다.

Claude Fable로 만든 결과물을 공유하고 자랑하는 사람들을 볼 때마다 조금 배가 아팠다. 나도 저런 결과물을 one-shot에 만들어보고 싶다는 생각이 가득한 타이밍이었다.

더 묘한 점은 나는 GPT-5.5를 쓰면서 이미 “이 정도면 부족함이 없다”고 여러 번 말해왔다는 것이다. 글을 쓰고, 코드를 고치고, 자료를 조사하고, 생각을 정리하는 데 충분했다.

그런데 여기서 또 발전했다고 한다.

부족함을 잘 느끼지 못하던 도구가 더 좋아졌다고 하면 오히려 감이 잘 오지 않는다. 답변이 조금 더 자연스러워진 것인지, 코드를 조금 덜 틀리는 것인지, 아니면 내가 아직 시도하지 못했던 일을 맡길 수 있게 된 것인지 궁금해진다.

Sol, Terra, Luna는 무엇이 다른가

GPT-5.6은 하나의 모델이 아니라 Sol, Terra, Luna 세 등급으로 출시됐다. OpenAI의 공식 발표를 쉽게 풀면 다음과 같다.

Sol은 가장 어려운 일을 맡는 최상위 모델이다. 복잡한 코딩과 연구, 보안 분석, 장시간 이어지는 에이전트 작업을 겨냥한다. 더 많은 시간과 비용을 쓰더라도 가장 높은 완성도를 원하는 작업에 가깝다.

Terra는 성능과 비용의 균형을 잡은 일상 작업용 모델이다. OpenAI는 GPT-5.5와 경쟁할 만한 성능을 더 낮은 비용으로 제공한다고 설명한다. 대부분의 글쓰기와 분석, 일반적인 코딩 작업에서는 Terra로도 충분할 가능성이 크다.

Luna는 가장 빠르고 저렴한 모델이다. 단순하거나 반복적인 작업, 속도와 비용이 중요한 대량 처리에 어울린다.

이름만 보면 단순히 대·중·소 모델을 새롭게 포장한 것 같지만, 재미있는 점은 Terra가 이전 세대의 상위 모델인 5.5에 가까운 성능을 맡게 됐다는 것이다.

이전의 최고 성능이 다음 세대에서는 중간 등급의 기준으로 내려온 셈이다.

5.5에서 얼마나 발전했을까

GPT-5.6 Sol의 발전 폭을 하나의 숫자로 말하기는 어렵다. 평가 분야마다 차이가 크기 때문이다.

OpenAI가 공개한 결과에서 GPT-5.5와 GPT-5.6 Sol을 비교하면 장시간 전문 업무를 평가하는 Agents’ Last Exam은 46.9%에서 52.7%로 5.8%포인트 상승했다. 컴퓨터를 직접 다루는 OSWorld 2.0은 47.5%에서 62.6%로 15.1%포인트, 보안 작업 평가인 SEC-Bench Pro는 45.8%에서 71.2%로 25.4%포인트 상승했다. OpenAI 내부의 AI 연구 과제들을 묶은 RSI Index도 41.7%에서 57.9%로 16.2%포인트 올랐다. 구체적인 평가 조건과 전체 결과는 GPT-5.6 출시 자료에서 확인할 수 있다.

그래서 “뭐가 얼마나 좋아졌냐?”라고 한다면 아직은 정확하게 알 수 없다. 벤치마크가 실사용 경험을 보장하는 것도 아니고, 직접 써보며 검증해봐야 할 것 같다.

그래도 변화의 방향은 보인다.

이번 발전은 문장을 조금 더 예쁘게 쓰는 수준보다는 도구를 사용해 긴 작업을 끝까지 진행하고 실제 결과물로 완성하는 능력에 집중되어 있다. 내가 5.5에서도 부족함을 느끼지 못했던 이유는 대화와 초안 작성이 이미 충분했기 때문일 것이다. 5.6의 차이는 그다음 단계, 그러니까 내가 중간에 포기하거나 직접 마무리해야 했던 일을 얼마나 더 오래 붙잡고 해결하느냐에서 드러날 가능성이 크다.

처음에는 아모데이의 업보라고 생각했다

GPT-5.6은 처음부터 곧바로 전면 공개된 것이 아니었다.

디일렉은 6월 28일 미국 정부가 사이버 위협성 판단을 이유로 GPT-5.6의 일반 공개 연기를 요청했고, OpenAI가 이를 받아들여 일부 승인된 파트너에게만 먼저 접근 권한을 제공했다고 보도했다.

그 배경에는 백악관이 6월 2일 발표한 AI 보안 행정명령이 있었다. 이 행정명령은 국가 안보에 영향을 줄 수 있는 프런티어 모델을 판단하는 비공개 벤치마크를 만들고, 해당 모델을 일반 파트너에게 공개하기 전 최대 30일 동안 미국 정부가 먼저 평가할 수 있는 자발적 협력 체계를 마련하도록 했다. 정부는 초기 접근 권한을 받을 신뢰할 수 있는 파트너 선정에도 참여할 수 있다.

OpenAI의 공식 프리뷰 발표에도 미국 정부의 요청으로 소수 파트너 대상 제한 프리뷰부터 시작했다고 적혀 있다. 6월 26일 제한 프리뷰로 공개된 GPT-5.6은 이 과정을 거쳐 7월 9일 전면 출시됐다.

행정명령은 강제적인 출시 허가나 사전 승인 제도가 아니라고 명시한다. 그럼에도 정부의 요청이 GPT-5.6의 공개 순서와 범위에 직접 영향을 줬다는 점은 분명하다.

Claude Fable의 경우는 더 직접적이었다. 미국 정부는 국가 안보 권한을 근거로 외국인의 Fable 5와 Mythos 5 접근을 중단하라는 수출 통제 지침을 내렸고, Anthropic은 실시간으로 국적을 확인할 방법이 없어 전체 사용자의 접근을 일시 중단했다. 당시 상황은 Anthropic의 6월 12일 발표에 정리되어 있다. 통제 조치는 6월 30일 해제됐고, Fable 5는 7월 1일부터 다시 제공됐다.

솔직히 나는 AI 위험성에 대해 강조하고 모델에 대한 공포 마케팅을 해온 아모데이의 업보라고 생각했다.

그런데 GPT-5.6도 미국 정부의 요청으로 제한적인 공개 절차를 먼저 거쳤다는 사실을 보면서 생각이 달라졌다. 한 회사의 발언이나 정치적 관계만으로 설명하기에는 훨씬 큰 변화가 일어나고 있는 것 같았다.

약 6년 만에 국가의 개입이 시작된 기술

GPT-3가 공개된 것은 2020년 5월이다. GPT-3가 출시되고 약 6년이 지났다.

나는 GPT-3.5를 써봤던 기억이 있는데, 당시 구글 앱스 스크립트를 통해 데이터 대시보드 자동화를 구축한 기억이 남는다.

그때도 충분히 신기했다. 대화를 통해 코드를 만들고, 오류가 나면 다시 질문해서 고치고, 내가 잘 모르는 영역까지 어떻게든 구현할 수 있었다.

그로부터 약 6년 동안 AI 모델은 간단한 문장과 코드를 만들어주는 도구에서 시작해 컴퓨터를 조작하고, 복잡한 연구와 보안 업무를 수행하는 단계까지 왔다. 이제는 정부가 새로운 프런티어 모델을 언제, 누구에게, 어떤 안전장치와 함께 공개할지 논의하기 시작했다.

물론 모델 하나가 곧 국가 권력이라는 뜻은 아니다. 정부의 개입도 모델의 순수한 성능만으로 결정되는 것이 아니다. 사이버 공격에 악용될 가능성, 수출 통제, 접근 권한과 외교 관계가 함께 얽혀 있다.

또한 AI에 대한 국가의 개입 자체가 2026년에 처음 시작됐다는 의미도 아니다. 여기서 말하는 개입은 최신 프런티어 모델의 공개 시점과 초기 접근 대상을 정부가 직접 검토하고 조율하기 시작했다는 뜻이다.

다만 AI가 국가 안보 정책의 대상이 될 만큼 영향력이 커졌다는 사실은 부정하기 어렵다. 그것도 수십 년이 아니라 약 6년 만에 벌어진 일이다.

그래서 이번 GPT-5.6 출시에서 가장 크게 다가온 것은 벤치마크 점수가 아니었다.

내가 일상적으로 사용하는 도구의 다음 버전을 기다리는 일이 이제 한 기업의 제품 출시만으로 끝나지 않는다는 사실이었다. 한 국가가 공개 순서와 접근 범위를 신경 쓰는 기술을 나는 코딩으로 열심히 삽질하는 데 쓰고 있다.

여기서 더 발전하면 무엇이 가능해지고 어디까지 변화될까.

일단 내 코드베이스부터 검토해달라고 해봐야겠다.

이 글이 도움이 되었나요?