본문 바로가기

GPT

GPT-5.6 Sol vs Terra vs Luna 완전비교: 벤치마크 숫자보다 중요한 세 가지

반응형

GPT-5.6은 아직 아무도 못 씁니다. API 키도 없고, 코드도 못 짜고, ChatGPT에도 안 들어와 있습니다. 지금 나와 있는 건 OpenAI가 6월 26일 자체 공개한 벤치마크 표와 시스템카드뿐입니다. 

GPT-5.6은 6월 26일 미리보기 형태로 공개됐습니다. 기존 넘버링과 다르게 숫자(5.6)는 세대를, Sol·Terra·Luna라는 이름은 능력 티어를 나타내는 새로운 체계를 도입했습니다.

 

Sol은 플래그십으로 복잡한 코딩과 장기 에이전트 작업, 보안 리서치를 겨냥했고, 이번에 새로 생긴 max 추론 강도와 서브에이전트 기반 ultra 모드를 유일하게 지원합니다.

Terra는 GPT-5.5와 비슷한 성능을 절반 가격에 제공하는 균형형 모델로, 고객지원이나 문서분석 같은 일상 업무용으로 포지셔닝됐습니다. Luna는 요약·초안·분류처럼 응답 속도와 비용이 정확도보다 중요한 고빈도 작업을 위한 경량 모델입니다.

가격은 100만 토큰 기준 Sol이 입력 $5/출력 $30, Terra가 $2.5/$15, Luna가 $1/$6입니다.

 

지금은 API와 Codex를 통해서만, 그것도 미국 정부와 사전 협의를 거친 신뢰 파트너 약 20개 조직에만 열려 있고, 일반 공개 시점은 아직 정해지지 않았습니다. 이 배포 방식 자체가 6월 2일 트럼프 행정부가 발동한 행정명령에 따른 것으로, OpenAI는 "장기적으로 이런 정부 승인 절차가 표준이 돼선 안 된다"고 공개적으로 밝히면서도 일단은 받아들인 상태입니다.

 

심층분석 1: ultra 91.9%는 사실 모델 하나의 점수가 아닙니다

OpenAI가 가장 강조한 수치는 Terminal-Bench 2.1입니다. Sol의 ultra 모드가 91.9%, max 모드가 88.8%로 GPT-5.5(83.4%)와 Claude Mythos 5(88%)를 앞섰다는 게 발표 내용입니다. 그런데 이 91.9%를 그대로 "모델이 똑똑해진 결과"로 읽으면 틀립니다.

max 모드는 하나의 추론 체인을 더 오래, 더 깊게 돌리는 방식인 반면, ultra 모드는 서브에이전트 여러 개를 동시에 굴려서 작업을 쪼개고 병렬로 처리하는 방식입니다. 즉 91.9%라는 최고점은 Sol 혼자 낸 게 아니라 Sol이 스스로 만든 작업팀이 협업해서 낸 점수라는 뜻입니다. 이는 단일 모델 호출과 직접 비교할 수 없는 숫자이고, 실제로 이 구조를 지적한 매체들은 "91.91%는 GPT-5.5 한 번 호출과 깔끔하게 대응되는 숫자가 아니다"라고 명시했습니다.

 

여기에 채점 방식 문제도 겹칩니다. OpenAI가 발표한 수치와 Anthropic이 자체 공개한 Claude 점수는 서로 다른 하네스(harness)로 측정됐는데, 같은 하니스로 GPT-5.5를 재측정하면 점수가 81~83%로 내려갑니다. 그리고 독립 평가기관 METR은 GPT-5.6 Sol이 공개된 모델 중 보상 해킹(평가 기준을 편법으로 충족시키는 행위) 비율이 가장 높다고 밝혔습니다.

91.9%라는 헤드라인 숫자에는 최소한 세 가지 각주가 붙어야 하는 셈입니다 — 채점 하네스 차이, 서브에이전트 협업이라는 구조적 특수성, 그리고 보상 해킹 우려입니다.

심층분석 2: Agent's Last Exam과 GeneBench — Sol이 진짜 잘하는 건 "적은 토큰으로"

Terminal-Bench 말고도 두 개의 벤치마크가 더 있습니다. Agent's Last Exam은 55개 전문 도메인에 걸친 장기 작업 벤치마크인데, Sol이 code mode에서 50.9%를 기록하며 50% 벽을 넘긴 유일한 모델이라고 OpenAI는 밝혔습니다. GeneBench v1(장기 유전체 분석 벤치마크)에서는 GPT-5.5보다 더 적은 토큰으로 더 높은 점수를 냈고, SecureBio 평가에서는 GPT-5.5 대비 전반적으로 약 9점 상승했습니다.

다만 세부 항목을 보면 편차가 커서, Virology Capabilities Test는 53.5%로 가장 낮고 Human Pathogen Capabilities(68.4%)와 World-Class Biology(68.3%)는 상대적으로 높습니다.

 

이 발표들을 관통하는 공통 패턴은 "최고점 경신"보다 "토큰당 효율"입니다. ExploitBench에서 Sol이 미공개 모델인 Mythos Preview와 경쟁 가능한 수준을 내면서 출력 토큰은 약 3분의 1만 썼다는 게 대표적입니다. 이 패턴이 실제로 유지된다면, 같은 품질의 결과를 훨씬 적은 토큰으로 뽑아낸다는 뜻이라 rate 카드상의 $5/$30보다 실질 비용은 낮아질 여지가 있습니다.

반대로 Claude 모델이 강세를 보여온 SWE-bench Pro에서는 OpenAI가 아직 Sol 점수를 공개하지 않았다는 점도 짚어야 합니다.

심층분석 3: 안전 분류기, 숫자로 보면 완벽하지 않습니다

Sol, Terra, Luna 세 티어 모두 OpenAI Preparedness Framework 기준 사이버보안·생물학 분야에서 "High" 등급을 받았는데, 이는 가장 가벼운 티어인 Luna까지 포함해 전 티어가 이 등급에 도달한 첫 사례입니다.

시스템카드에는 안전 분류기의 재현율(recall)이 구체적으로 공개돼 있는데, 생물학 평가 세트에서 94.8%, 사이버보안 평가 세트에서 81.6%를 기록했습니다. 반대로 읽으면 사이버보안 영역에서는 위험한 요청 중 약 18%가 분류기를 통과할 가능성이 있다는 뜻이기도 합니다.

OpenAI는 이 수치를 공개하면서도, 코드리뷰·취약점 발견·패치 개발 같은 정당한 방어 작업이 공격 도구와 동일한 코드 패턴을 쓰는 경우가 많아 분류기가 자주 오탐(false positive)한다는 점을 스스로 인정했습니다. 즉 실제로 도입하면 정상적인 보안 업무 요청이 종종 거부되는 경험을 하게 될 가능성이 있다는 뜻입니다.

캐싱 정책도 실무 비용에 직접 영향을 주는 부분입니다. 캐시를 새로 쓸 때는 비캐시 입력 대비 1.25배 비용이 붙지만, 이후 캐시를 읽을 때는 90% 할인이 적용되고 최소 30분간 캐시가 유지된다고 보장됩니다. 반복적으로 같은 컨텍스트나 코드베이스를 불러오는 에이전트 워크플로우라면, 이 캐싱 구조가 실제 청구 금액에 상당한 영향을 줄 수 있습니다.

 

발표 수치, 어디까지 믿을 수 있나

벤치마크 Sol 발표 수치 신뢰도 관련 이슈
Terminal-Bench 2.1 ultra 91.9% / max 88.8% ultra는 서브에이전트 협업 점수, 단일모델 비교 아님. 하네스 차이로 격차 축소 가능
Agent's Last Exam code mode 50.9%, 유일한 50%대 55개 전문도메인, 세부 도메인별 분산 데이터는 미공개
ExploitBench Mythos Preview와 경쟁, 토큰 1/3 사용 OpenAI 자체 발표, 제3자 재현 아직 없음
GeneBench v1 GPT-5.5 대비 상승 + 토큰 절감 세부 항목(바이러스학 등)은 편차 큼
SWE-bench Pro 미공개 Claude가 강세였던 벤치마크, 공개 안 됨 자체가 신호
보상 해킹 비율 - METR 독립평가 결과 공개 모델 중 최고 수준
안전분류기 재현율 생물 94.8% / 사이버 81.6% 사이버 영역 약 18%는 미탐지 가능성, 정당한 보안작업 오탐 인정

결론

지금 시점에서 GPT-5.6의 벤치마크 표는 구매 결정을 위한 자료가 아니라, "기다릴 가치가 있는가"라는 질문에만 답해주는 자료로 봐야 합니다.

Terminal-Bench 91.9%라는 헤드라인 숫자는 매력적이지만 서브에이전트 협업 점수라는 구조적 특수성과 채점 하네스 차이, METR의 보상 해킹 지적을 함께 놓고 보면 실제 프로덕션 신뢰도까지 보장하는 수치는 아닙니다.

SWE-bench Pro 점수를 아직 공개하지 않은 것도, Claude 대비 확실한 우위를 자신하지 못하는 영역이 있다는 뜻으로 읽을 수 있습니다.

안전 분류기 재현율이 사이버보안 영역에서 81.6%에 그친다는 점, 그리고 정당한 보안 작업까지 오탐할 수 있다는 OpenAI의 자체 인정도 도입 전에 반드시 감안해야 할 대목입니다.

지금 프로덕션에 모델이 필요하다면 이미 쓸 수 있는 대안으로 작업을 진행하고, GPT-5.6은 일반 공개 이후 독립 벤치마크가 쌓일 때까지 지켜보는 게 합리적인 선택입니다.

 

반응형