오픈소스 AI 씬에서 2026년 2분기를 통틀어 가장 많이 회자된 한 줄 요약이 있습니다. "27B가 397B를 코딩 벤치마크 전 항목에서 이겼다." Alibaba Qwen 팀이 4월 22일 공개한 Qwen3.6-27B 얘기입니다. Apache 2.0 라이선스에 Hugging Face 완전 공개, 소비자 GPU 한 장으로 돌아가는 Dense 모델인데 성능이 이 수준이면 얘기가 달라집니다.
왜 Dense가 MoE를 이긴 게 충격인가
MoE(Mixture of Experts)는 파라미터를 엄청나게 쌓아두되, 토큰 처리 시 일부만 활성화하는 구조입니다. 총 파라미터 수는 크지만 실제 연산은 적어서 효율적이라는 게 장점이고, 오픈소스 진영이 지난 1년간 거대 MoE 모델에 집중해온 이유가 바로 이 때문입니다. Qwen 팀 자체도 이전에 Qwen3.5-397B-A17B라는 397B MoE 플래그십을 갖고 있었습니다. 이 모델이 추론 시 활성화하는 파라미터는 17B입니다.
Qwen3.6-27B는 Dense, 즉 모든 27B 파라미터가 토큰마다 전부 활성화됩니다. 이 구조가 왜 배포하기 편한지는 뒤에 다시 나오는데, 핵심은 이 Dense 27B 모델이 397B MoE를 주요 코딩 벤치마크 전 항목에서 앞질렀다는 겁니다. 단순히 비슷한 게 아니라, SkillsBench에서는 48.2 대 30.0으로 60% 이상의 격차가 납니다. 아키텍처와 학습 방식이 파라미터 수 자체보다 중요하다는 걸 수치로 보여준 사례입니다.
아키텍처: Gated DeltaNet 하이브리드
Qwen3.6-27B가 이 결과를 낸 핵심에는 하이브리드 어텐션 구조가 있습니다. 64개 레이어 전체를 16개 블록으로 나누는데, 각 블록 안에서 Gated DeltaNet 레이어 3개와 일반 Gated Attention 레이어 1개가 3:1 비율로 배치됩니다.
Gated DeltaNet은 선형 어텐션(Linear Attention) 계열로, 시퀀스 길이에 따른 복잡도가 O(n)입니다. 기존 트랜스포머 어텐션이 O(n²)인 것과 비교하면 긴 컨텍스트 처리에서 연산과 메모리 부담이 훨씬 작습니다. 네 번째 위치에 배치된 Gated Attention은 정밀도 높은 추론을 담당하고, KV 캐시 오버헤드를 줄이기 위해 쿼리 헤드 24개에 키/밸류 헤드를 4개만 씁니다. 선형 어텐션으로 효율을 챙기면서 쿼드라틱 어텐션으로 정확도를 보완하는 구조입니다. 숨겨진 차원은 5,120이고 FFN 중간 차원은 17,408이며, 총 파라미터는 278억 개입니다. 네이티브 컨텍스트 윈도우는 262,144 토큰이고, YaRN 확장을 적용하면 약 100만 토큰까지 늘어납니다.
멀티모달: 코딩만 되는 모델이 아니다
Qwen3.6-27B는 비전 인코더가 통합된 멀티모달 모델입니다. 코딩 모델로 포지셔닝돼 있어 간과하기 쉬운데, 실제로는 이미지, 문서 OCR, 동영상 입력까지 지원하고 시간 단위 길이의 동영상을 최대 224K 비디오 토큰으로 처리할 수 있다고 공식 문서에 명시돼 있습니다.
벤치마크 수치를 보면 멀티모달 종합 평가인 MMMU에서 82.9%, 시각 추론 평가인 MMStar에서 81.4%를 기록했습니다. 영상 이해 평가인 VideoMME에서는 87.7%로 Claude 4.5 Opus의 77.7%를 10포인트 이상 앞섰고, 안드로이드 앱을 자율 조작하는 GUI 에이전트 벤치마크 AndroidWorld에서는 70.3%입니다. 코딩 에이전트와 멀티모달 파이프라인을 하나의 27B 모델로 커버한다는 점이 실무 배포에서 의미 있습니다.
코딩 벤치마크 수치
코딩 성능을 벤치마크별로 보면 이렇습니다. SWE-bench Verified 77.2%로 397B MoE 플래그십(76.2%)을 넘었고, Claude 4.5 Opus(80.9%)보다 3.7포인트 낮습니다. SWE-bench Pro는 53.5%로 역시 397B(50.9%)를 상회합니다. Terminal-Bench 2.0은 59.3%로 Claude 4.5 Opus와 동등한 수치가 나왔는데, 이 벤치마크는 3시간 타임아웃, CPU 32개, RAM 48GB 환경에서 에이전트가 실제 터미널을 자율로 조작해 작업을 완수하는 테스트라 단순 코드 생성과 차원이 다릅니다. SkillsBench는 48.2%로 397B(30.0%) 대비 60% 이상 향상됐고, GPQA Diamond(대학원 수준 과학 추론)에서는 87.8%로 Claude 4.5 Opus의 87.0%를 소폭 앞섰습니다. 다만 이 수치들은 Qwen 팀 내부 에이전트 스캐폴드 기반이라는 점은 감안해야 하고, 4월 시점 기준 독립 제3자 재현 결과가 제한적이었기 때문에 외부 스캐폴드 환경에서는 다소 낮게 나올 수 있습니다.
Thinking Preservation: 멀티턴 에이전트의 고질병을 잡는다
Qwen3.6-27B가 이전 세대와 구별되는 기능 중 하나가 Thinking Preservation입니다. 멀티턴 대화나 에이전트 워크플로에서 이전 턴의 추론 과정(thinking content)을 다음 턴으로 그대로 이어받는 기능입니다.
에이전트 실무에서 작업 세션이 길어지면 모델이 앞서 한 추론을 기억하지 못하고 방향이 틀어지거나 일관성 없는 코드를 생성하는 문제가 흔히 발생합니다. 컨텍스트 드리프트라고 부르는 현상인데, Thinking Preservation은 구조적으로 이 문제를 줄여줍니다. Alibaba 공식 문서에서도 에이전틱 태스크에 특히 권장한다고 명시하고 있고, API 메시지에 preserve_thinking 파라미터를 추가하는 방식으로 활성화합니다.
로컬 배포: vLLM으로 띄우기
로컬 배포를 고려한다면 VRAM 요구사항부터 확인해야 합니다. Q4_K_M 양자화 기준 약 16.8GB가 필요해서 RTX 4080 16GB에 빡빡하게 들어가고, RTX 4090 24GB에서는 여유 있게 돌아갑니다. Q6_K는 22.5GB 수준으로 RTX 4090 또는 Mac M4 Pro 24GB가 적절하고, 풀 멀티모달 동영상 처리까지 원한다면 RTX 5090(32GB) 또는 Mac M4 Max 36GB 이상을 권장합니다.
vLLM으로 서빙할 때 pip로 vLLM 0.19.0 이상을 먼저 설치하고, 아래 커맨드로 서버를 띄웁니다. Tool Use를 함께 쓰려면 끝에 --enable-auto-tool-choice --tool-call-parser qwen3_coder를 붙이면 됩니다.
vllm serve Qwen/Qwen3.6-27B \
--port 8000 \
--tensor-parallel-size 2 \
--max-model-len 262144 \
--reasoning-parser qwen3
실행 후 http://localhost:8000/v1/chat/completions 엔드포인트로 OpenAI 호환 API 요청을 보낼 수 있습니다. 텍스트 전용으로만 운영할 경우에는 --language-model-only 플래그를 추가해 비전 인코더를 제외하면 VRAM을 추가로 아낄 수 있습니다.
SGLang을 쓴다면 sglang 0.5.10 이상을 설치한 뒤 아래와 같이 실행합니다. MTP(Multi-Token Prediction)로 추론 속도를 높이려면 --speculative-algo NEXTN 옵션을 함께 붙이면 됩니다.
python -m sglang.launch_server \
--model-path Qwen/Qwen3.6-27B \
--port 8000 \
--tp-size 2 \
--mem-fraction-static 0.8 \
--context-length 262144 \
--reasoning-parser qwen3
한 가지 주의할 점은 2026년 4월 기준 CUDA 13.2에서 출력이 깨지는 버그가 보고되고 있다는 것입니다. CUDA 13.1 또는 12.x 버전을 사용하는 것이 안전합니다.
API 비용과 통합
자체 서버를 안 올리고 API로 쓴다면 Novita 기준 입력 토큰 100만 개당 $0.60, 출력 100만 개당 $3.60이고, OpenRouter 경로를 쓰면 입력 $0.26까지 내려갑니다. Claude Opus 4.8($6.25 입력)과 비교하면 20배 이상 저렴합니다. Claude Code, OpenClaw, Qwen Code 등 주요 AI 코딩 어시스턴트와 공식 통합을 지원하기 때문에, Claude Code 사용자가 백엔드 모델을 Qwen3.6-27B로 바꿔 비용을 줄이는 구성도 바로 가능합니다. 실제로 6월 Fable 5 접근 제한 사태 이후 대안 모델로 Qwen3.6 계열이 급부상한 배경이 이 통합 지원에 있습니다.
결론
Qwen3.6-27B는 오픈소스 코딩 에이전트 분야에서 2026년 상반기 가장 중요한 릴리스 중 하나입니다. 소비자 GPU 한 장에서 돌아가는 27B Dense 모델이 Terminal-Bench 기준 Claude 4.5 Opus와 동등하고, VideoMME에서 Claude를 10포인트 앞서는 수치는 "오픈소스 = 성능 타협"이라는 공식이 이제 맞지 않는다는 걸 보여줍니다. Apache 2.0 라이선스라 상업 활용 제한도 없고, 멀티모달 통합으로 코딩과 비전 파이프라인을 하나의 모델로 커버합니다. 클로즈드 소스 API에만 의존하는 에이전트 파이프라인을 자체 호스팅으로 전환하거나 운영 비용을 줄이려는 팀이라면 2026년 현재 가장 먼저 테스트해봐야 할 오픈웨이트 모델입니다.
'LLM' 카테고리의 다른 글
| 딥시크 DSpark 완전분석: LLM 추론 속도 85% 끌어올린 비결 (0) | 2026.06.30 |
|---|---|
| ByteDance Seedance 2.5 완전분석 (0) | 2026.06.29 |
| Microsoft가 OpenAI 없이 만든 첫 코딩 모델 — MAI-Code-1-Flash, GitHub Copilot에 탑재 (0) | 2026.06.26 |
| GPT-5.5보다 코딩 점수 높고 가격은 12분의 1 — MiniMax M3 실사용 정리 (0) | 2026.06.26 |
| Claude가 막혔을 때 중국이 내놓은 카드 — GLM-5.2, MIT 오픈소스로 전면 공개 (0) | 2026.06.26 |