Qwen3.8-Flash-Next: 비용 효율을 높인 Qwen4 선행 아키텍처

작성자

카테고리:

← 피드로
GeekNews · neo · 2026-08-27 개발(SW)

Qwen4에 적용할 설계를 먼저 공개한 멀티모달 MoE 모델로, 125B 본체와 51B N-gram 임베딩 가운데 토큰당 6B 매개변수만 활성화함 GDN과 QSA로 과거 정보를 압축하고 중요한 문맥을 마이크로 블록 단위로 검색해, 1M 토큰에서 Attention Kernel의 Prefill과 Decode…

원문 보기 ↗

출처: news.hada.io · https://news.hada.io/topic?id=32911