본문 바로가기

반응형

DiffusionGemma

LLM이 토큰을 하나씩 뱉지 않는다면? DiffusionGemma 완전분석 AI 모델이 텍스트를 생성하는 방식은 지난 몇 년간 사실상 단 하나였습니다. GPT, Claude, Gemini, Llama 할 것 없이 모두 왼쪽에서 오른쪽으로, 토큰 하나씩, 이전 맥락을 조건으로 다음 토큰을 예측하는 자동회귀(autoregressive) 방식입니다. 이 방식이 워낙 지배적이다 보니 "LLM = 토큰 하나씩 생성"이라는 등식이 자연스러운 상식처럼 굳어졌습니다. 2026년 6월 10일, Google DeepMind가 그 등식을 깼습니다. DiffusionGemma는 256개 토큰 블록을 동시에 생성하는 텍스트 확산(discrete diffusion) 방식을 채택한 26B MoE 오픈웨이트 모델로, H100 단일 GPU에서 초당 1,000토큰 이상을 뽑아냅니다. Apache 2.0 라이선.. 더보기
DiffusionGemma 완전 분석: Gemma 4랑 뭐가 다른 거예요? 한줄요약: DiffusionGemma는 Gemma 4 베이스에 텍스트 diffusion 기술을 붙여 속도를 최대 4배 높인 실험적 모델인데, 품질은 낮습니다.어제 구글이 조용히 하나 올렸는데 꽤 신기합니다. 이름은 DiffusionGemma. Gemma 4랑 같은 26B MoE 구조인데, 텍스트 생성 방식 자체를 갈아엎었습니다.→ 출시일: 2026년 6월 10일→ 라이선스: Apache 2.0→ 공개 위치: Hugging Face (google/diffusiongemma-26B-A4B-it)→ 성격: 실험적(Experimental) 오픈 모델→ 개발: Google DeepMind→ 기반: Gemma 4 아키텍처 + Gemini Diffusion 연구→ 총 파라미터: 26B (추론 시 활성 파라미터: 3... 더보기

반응형