← 피드로
Qwen4에 적용할 설계를 먼저 공개한 멀티모달 MoE 모델로, 125B 본체와 51B N-gram 임베딩 가운데 토큰당 6B 매개변수만 활성화함 GDN과 QSA로 과거 정보를 압축하고 중요한 문맥을 마이크로 블록 단위로 검색해, 1M 토큰에서 Attention Kernel의 Prefill과 Decode…
출처: news.hada.io · https://news.hada.io/topic?id=32911