모델 아키텍처·학습 기법Zihan Qiu 외 (Alibaba Qwen)
On the Design of Qwen3.8-Next Architecture 공개
On the Design of Qwen3.8-Next Architecture 공개 — 파라미터 125B·토큰당 활성 6B에 가속기 밖에 두는 51B n-gram 임베딩 테이블을 더한 희소 MoE 모델 Qwen3.8-Flash-Next의 설계를 기술. 네 층마다 하나만 전체 어텐션을 두는 Gated DeltaNet(GDN)-전역 어텐션 층별 하이브리드에 Qwen Sparse Attention과 Gated Residual을 결합했고, 각 설계 변경을 손실과 다운스트림 벤치마크·학습과 프리필과 디코드 비용·최적 하이퍼파라미터에 미치는 영향이라는 세 축으로 평가
왜 중요한가
프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2608.303202026년 8월 31일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.04'Formalizing Fermat's Last Theorem' 공개공식 발표09.03Grok Bot 기업용 제공 시작공식 발표09.03GPT-6 Astra 공개공식 발표09.03Random Attention 공개논문