본문 바로가기

LLM

Fable 5 vs Mythos 5 vs GPT-5.6 Sol 코딩벤치마크 비교

반응형

같은 "Terminal-Bench 2.1"인데 출처마다 Fable 5 점수가 83.4%, 84.3%, 88.0%로 제각각 나옵니다. 오타가 아니라 세 모델이 서로 다른 조건에서 측정됐기 때문입니다. 이번 글은 어느 숫자가 왜 다른지, 그리고 실제로 뭘 기준으로 골라야 하는지를 벤치마크 원문까지 파고들어서 정리했습니다.

핵심은 "Fable 5"와 "Mythos 5"가 점수부터 다르다는 것

Fable 5와 Mythos 5는 같은 가중치를 쓰는 동일한 모델입니다. 그런데도 벤치마크 점수가 갈리는 이유는 안전장치 하나 때문입니다. Fable 5는 사이버·생물·증류 관련 위험 요청이 감지되면 자동으로 Opus 4.8로 전환되는 안전장치가 걸려 있고, Mythos 5는 이 장치가 빠진 채로 소수 신뢰 기관에만 제공됩니다.

시스템카드에 따르면 Terminal-Bench 2.1 시행 중 Fable 5가 안전 전환에 걸린 비율이 20.9%에 달했고, 그 결과 Fable 5는 84.3%, 안전장치가 없는 Mythos 5는 88.0%를 받았습니다.

 

SWE-bench Verified에서도 Fable 5가 95.0%, Mythos 5가 95.5%로 근소하게 벌어지는데, Anthropic은 이 차이를 "능력 차이가 아니라 안전 폴백 때문"이라고 명시적으로 설명합니다.

가장 극단적인 사례는 ExploitBench인데, 발표 표에는 78.0%라는 점수가 별표(*)와 함께 붙어 있지만, 이건 안전장치가 없는 Mythos 5의 점수이고 실제 배포되는 Fable 5는 같은 공격형 사이버 작업에서 진행률 0%를 기록했습니다.

즉 표에 나온 숫자와 실제로 손에 쥐는 모델의 성능이 항목에 따라 완전히 다를 수 있다는 뜻입니다.

SWE-bench Pro는 그나마 믿을 만한 비교 지표입니다

여러 매체가 공통으로 짚는 지점은, SWE-bench Pro가 세 모델(정확히는 Fable 5, Opus 4.8, GPT-5.5)을 공개적으로 검증 가능한 동일 방법론으로 측정한 몇 안 되는 벤치마크라는 점입니다.

Fable 5가 80.3%, Opus 4.8이 69.2%, Mythos Preview(구세대)가 77.8%, GPT-5.5가 58.6%, Gemini 3.1 Pro가 54.2%를 기록했습니다. Fable 5와 GPT-5.5 사이의 22점 격차는 실제 소프트웨어 이슈 다섯 개 중 네 개를 해결하는 모델과 세 개도 채 못 푸는 모델의 차이라고 해석될 만큼 큰 폭입니다.

이 수치가 신뢰받는 이유는 Anthropic이 공개한 표의 값이 OpenAI가 자체 발표한 GPT-5.5의 SWE-bench Pro 58.6%, OSWorld-Verified 78.7%, Humanity's Last Exam(41.4%/52.2%) 수치와 정확히 일치하기 때문입니다. 서로 다른 연구소가 상대방 모델을 재측정한 값이 같다면, 최소한 그 항목만큼은 조작이나 유리한 조건 설정의 여지가 적다고 볼 수 있습니다.

 

FrontierCode Diamond(오픈소스 저장소 150개 기반 자율 패치 평가)에서는 격차가 더 벌어져서 Fable 5 29.3% 대 Opus 4.8 13.4%, GPT-5.5 5.7%로 나타났는데, 이 항목에서는 Fable 5가 Mythos 5를 포함해 전체 1위라는 점도 눈여겨볼 만합니다. 안전 분류기가 잘 걸리지 않는 유형의 작업에서는 안전장치로 인한 손해를 보지 않는다는 뜻입니다.

Terminal-Bench만큼은 GPT 진영이 이겼다고 볼 여지가 있습니다

유일하게 Fable 5가 명확히 앞선다고 말하기 어려운 항목이 Terminal-Bench 2.1입니다.

Anthropic 표에는 Fable 5가 88.0%로 나오지만 이건 별표가 붙은 Mythos 5 수치이고, 실제 Fable 5는 84.3%입니다. 반면 GPT-5.5는 자체 Codex CLI 하니스 기준 83.4%, Opus 4.8은 82.7%를 기록해 셋이 사실상 오차범위 안에서 붙어 있습니다.

여기에 새로 나온 GPT-5.6 Sol이 max 모드 88.8%, 서브에이전트를 쓰는 ultra 모드로는 91.9%까지 올라가는데, 이 ultra 점수는 단일 모델이 아니라 여러 서브에이전트가 협업한 결과라 다른 모델의 단일 호출 점수와 나란히 놓고 비교하기엔 성격이 다릅니다.

정리하면 Terminal-Bench는 Claude와 GPT 진영이 실질적으로 백중세이고, GPT-5.6 Sol의 최고 점수는 구조 자체가 달라서 헤드라인 숫자만 보고 우열을 가리기 애매한 항목입니다.

벤치마크 신뢰도에 대한 회의적인 시각도 있습니다

모든 사람이 이 발표치를 그대로 받아들이는 건 아닙니다. 오픈소스 연구자 Victor Taelin은 사전 유출된 벤치마크가 특정 결과를 부각시키기 위해 설계된 게 아니냐는 의문을 공개적으로 제기했습니다. 이런 회의론이 완전히 근거 없다고 보기는 어렵고, 결국 독립 평가 기관들이 재현한 결과가 쌓여야 신뢰도가 확정된다는 게 업계의 공통된 시각입니다. 다만 Stripe, Cursor, GitHub, Hex, IMC 같은 실제 유료 고객들의 사용 후기는 Anthropic과 이해관계가 없는 제3자 평가라는 점에서 벤치마크 표보다는 신뢰도가 조금 더 높게 취급되는 편입니다.

세 모델·다섯 벤치마크 한눈에 정리

벤치마크 Fable 5 Mythos 5  GPT-5.5  GPT-5.6 Sol Opus 4.8
SWE-bench Pro 80.3% (Preview 77.8%) 58.6% 미공개 69.2%
SWE-bench Verified 95.0% 95.5% 82.6% 미공개 88.6%
Terminal-Bench 2.1 84.3% 88.0% 83.4% max 88.8%/ultra 91.9%(서브에이전트) 82.7%
FrontierCode Diamond 29.3%(1위) - 5.7% 미공개 13.4%
ExploitBench(공격형) 실사용 0% 78.0%(승인기관 한정) - Mythos Preview 수준(토큰 1/3) -
가격(입력/출력, 100만 토큰) $10/$50 $15/$75(추정) $5/$30 $5/$30 $5/$25

결론

세 모델을 한 표에 놓고 비교할 때 가장 조심해야 할 건 "같은 이름의 벤치마크라도 측정 대상과 조건이 다르다"는 사실입니다.

Fable 5와 Mythos 5는 같은 가중치를 쓰면서도 안전 폴백 하나로 항목별 점수가 갈리고, 표에 별표로 표시된 수치는 실제로 손에 쥐는 모델의 성능이 아니라 승인 기관만 쓸 수 있는 상한선일 뿐입니다.

 

GPT-5.6 Sol의 91.9%도 서브에이전트 협업 점수라는 구조적 특수성 때문에 다른 모델의 단일 호출 점수와 직접 비교하기엔 무리가 있습니다. 그나마 신뢰할 만한 비교 축은 여러 연구소가 서로의 수치를 재확인한 SWE-bench Pro 정도이고, 여기서는 Fable 5가 GPT-5.5보다 22점 앞선다는 격차가 가장 재현성 있는 신호로 남습니다.

결국 벤치마크표는 참고 자료일 뿐이고, 실제 도입 전에는 자신의 워크로드가 안전 분류기에 자주 걸리는 유형인지부터 따져보는 게 숫자 자체보다 훨씬 중요한 판단 기준입니다.

반응형