본문 바로가기

반응형

LLM

GPT-5.6 Sol vs Claude Opus 4.8 vs Fable 5, 코딩 벤치마크 비교 GPT-5.6 라인업 중에서 제일 좋은 건 역시 최상위 등급인 Sol입니다. 그런데 막상 "그럼 지금 최고 모델이 뭐냐"고 물으면 이야기가 좀 복잡해집니다. 앤트로픽 쪽에는 대중에게 공개된 최상위 모델 오퍼스4.8이 있고, 그 위에 새로 나온 미토스 등급의 첫 GA 모델 페이블5가 있기 때문입니다.오늘은 GPT-5.6 Sol, 클로드 오퍼스4.8, 클로드 페이블5 세 모델을 벤치마크 수치와 가격, 지금 당장 쓸 수 있는지 여부까지 한 번에 정리해 드리겠습니다. 핵심 요약세 모델은 사실 같은 체급이 아닙니다.GPT-5.6 Sol과 클로드 오퍼스4.8은 각 회사가 대중에게 공개한 최상위 플래그십이라는 점에서 비슷한 위치지만, 클로드 페이블5는 앤트로픽이 새로 만든 미토스 등급의 첫 모델이라 사실상 오퍼스4... 더보기
중국 AI 모델 4종 비교 정리 : Qwen 3.7 Max, Kimi K2.7 Code, MiniMax M3, GLM-5.2 Qwen 3.7 Max·Kimi K2.7 Code·MiniMax M3·GLM-5.2는 전부 중국 빅테크가 최근 두 달 사이 내놓은 최신 AI 모델이고, 이 중에서 지금 당장 가입만 하면 무료로 체험해볼 수 있는 건 Kimi 하나입니다. 요즘 개발자 커뮤니티에서 이 네 모델 이름이 자주 언급되는데, 막상 찾아보면 회사 이름도 낯설고 뭐가 다른지 감이 잘 안 오실 수 있습니다. 알리바바, 문샷AI, 미니맥스, 지푸AI라는 네 회사가 각각 5월과 6월 사이에 신형 모델을 쏟아냈는데, 공통점은 전부 코딩과 복잡한 작업을 자동으로 처리하는 "에이전트형" AI라는 점이고, 차이점은 무료로 써볼 수 있는지, 어떤 작업에 특화됐는지, 그리고 요금 체계가 어떻게 다른지입니다.이번 글에서는 이 네 모델을 하나씩 뜯어보면서.. 더보기
GLM-5.2 셀프호스팅 실전 가이드: MIT 라이선스로 프런티어급 코딩모델 직접 돌리기 "MIT 라이선스니까 그냥 다운받아서 돌리면 되지 않나" 싶겠지만, 753B 파라미터 모델을 실제로 띄우려면 최소 8장짜리 GPU 클러스터부터 필요합니다. 이번 글은 GLM-5.2를 실제로 자기 인프라에 올리려는 사람을 위해, 하드웨어 산정부터 프레임워크 선택, 실제 서빙 명령까지 순서대로 정리했습니다. GLM-5.2는 6월 13일 Zhipu AI(Z.ai)가 공개한 753B 파라미터 MoE 모델로, 활성 파라미터는 약 40B입니다. 가중치는 Hugging Face의 zai-org/GLM-5.2 저장소에 MIT 라이선스로 지역 제한 없이 공개돼 있어서, 다운로드·수정·재배포·상업적 이용까지 자유롭게 허용됩니다. 다만 한 가지 헷갈리기 쉬운 부분이 있는데, GitHub의 추론 코드 저장소는 Apache 2.. 더보기
Fable 5 vs Mythos 5 vs GPT-5.6 Sol 코딩벤치마크 비교 같은 "Terminal-Bench 2.1"인데 출처마다 Fable 5 점수가 83.4%, 84.3%, 88.0%로 제각각 나옵니다. 오타가 아니라 세 모델이 서로 다른 조건에서 측정됐기 때문입니다. 이번 글은 어느 숫자가 왜 다른지, 그리고 실제로 뭘 기준으로 골라야 하는지를 벤치마크 원문까지 파고들어서 정리했습니다.핵심은 "Fable 5"와 "Mythos 5"가 점수부터 다르다는 것Fable 5와 Mythos 5는 같은 가중치를 쓰는 동일한 모델입니다. 그런데도 벤치마크 점수가 갈리는 이유는 안전장치 하나 때문입니다. Fable 5는 사이버·생물·증류 관련 위험 요청이 감지되면 자동으로 Opus 4.8로 전환되는 안전장치가 걸려 있고, Mythos 5는 이 장치가 빠진 채로 소수 신뢰 기관에만 제공됩니.. 더보기
LLaMA Factory로 LLM 파인튜닝 시작하기 특정 도메인에 맞춰서 LLM을 파인튜닝해보고 싶은데 어디서부터 시작해야 할지 막막하신 분들 많으실 텐데요, 지금 가장 널리 쓰이는 오픈소스 파인튜닝 프레임워크인 LLaMA Factory 기준으로 정리해봤어요. 이번엔 공식 깃허브 리포지토리에 있는 하드웨어 요구사항 표까지 직접 확인하고 썼어요.LLaMA Factory가 왜 표준처럼 자리 잡았나LLaMA Factory는 깃허브에서 70,600개가 넘는 스타를 받은 오픈소스 프레임워크예요. 포크 수도 8,600개가 넘고, 아마존이나 NVIDIA, 알리윤 같은 조직들도 채택했다고 해요. Llama, Qwen, DeepSeek, Gemma, Mistral, Phi, GLM-4를 포함해서 100개가 넘는 모델 아키텍처를 지원하고, SFT(지도 파인튜닝), DPO,.. 더보기
LLM FP8 엔드투엔드 파이프라인, 추론 비용이 왜 이렇게 줄어드나 LLM 인프라 쪽 최신 논문이랑 블로그를 보면 FP8 얘기가 계속 나옵니다. 그냥 서빙 단계 양자화 기법 하나가 아니라, 사전학습부터 파인튜닝, 서빙까지 전체 파이프라인을 FP8로 통일하려는 흐름 자체가 지금 인프라 진영의 화두더라고요. 이번엔 실제 학술 논문이랑 공식 기술 문서까지 확인하고 썼어요.FP8이 정확히 뭘 줄여주나FP8은 기존에 많이 쓰던 FP16이나 BF16 대비 숫자를 표현하는 비트 수를 절반으로 줄인 부동소수점 형식이에요. 엔비디아 텐서RT-LLM 관련 기술 블로그에 따르면 FP8 양자화를 적용한 엔진을 FP16 베이스라인과 비교했을 때 정밀도 손실을 최소화하면서 메모리 요구 사항과 추론 지연 시간을 동시에 줄일 수 있다고 해요. 이 방식을 제대로 쓰려면 호퍼 아키텍처 이상의 엔비디아 .. 더보기
딥시크 DSpark 완전분석: LLM 추론 속도 85% 끌어올린 비결 며칠 전부터 딥시크가 또 일을 냈다는 얘기가 여기저기서 들려왔어요. 이번엔 새 모델이 아니라 추론 속도를 끌어올리는 프레임워크였는데, 막상 뜯어보니 단순한 속도 개선 그 이상이더라고요. GPU를 더 사지 않고도 답변 생성 속도를 85%까지 끌어올렸다는 건, 추론 비용에 허덕이던 입장에서는 그냥 지나칠 수 없는 소식이죠.핵심 요약DSpark는 딥시크가 지난 주말 오픈소스로 공개한 추측형 디코딩(speculative decoding) 프레임워크로, 모델 자체를 새로 학습하지 않고도 기존 DeepSeek-V4 가중치 위에 작은 드래프트 모듈을 얹어서 생성 속도를 끌어올리는 방식으로 동작합니다.실제 운영 트래픽에서 V4-Flash는 기존 MTP-1 방식 대비 60~85%, V4-Pro는 57~78% 빠른 사용자.. 더보기
ByteDance Seedance 2.5 완전분석 AI 영상 생성 모델 시장에서 2026년 상반기를 통틀어 가장 파급력 있던 릴리스를 꼽으라고 하면 많은 개발자들이 Seedance 2.0을 먼저 떠올립니다. 2026년 2월 공개 직후 소셜 미디어를 뒤흔든 그 모델의 후속작이 6월 23일 Volcano Engine FORCE 컨퍼런스에서 발표됐습니다. Seedance 2.5는 30초 원패스 생성, 50개 멀티모달 레퍼런스 입력, 네이티브 4K 출력이라는 세 가지 업그레이드를 들고 왔습니다. 현재는 글로벌 기업 베타 단계이고 2026년 7월 초 공개 출시 예정입니다.Seedance 2.0이 왜 충격이었나Seedance 2.5를 이해하려면 2.0부터 짚어야 합니다. ByteDance가 2026년 2월 공개한 Seedance 2.0은 텍스트, 이미지, 오디오를.. 더보기

반응형