한국어EN
모델 아키텍처·학습 기법Shaowen Wang 외

SMELT 공개

SMELT 공개 — 공유 층 블록을 반복해 유효 깊이를 늘리는 루프드 트랜스포머 평가가 대개 모델 크기를 고정한 채 비교해 아키텍처 이점과 추가 FLOPs를 뒤섞는다고 지적하고, 토큰당 FLOPs·비임베딩 총 파라미터·KV 캐시 세 예산을 모두 맞춘 상태에서 MoE 트랜스포머의 중간 절반 층을 두 번 도는 레시피(Sparse MoE Transformer, middle layers Loop Twice)를 제시. 비임베딩 파라미터 54B까지 네 규모로 확장해 아키텍처별로 친칠라식 스케일링 법칙을 따로 적합

왜 중요한가

깊이 재사용(루프)이 예산을 엄격히 맞춘 뒤에도 이득이 남는지를 스케일링 법칙 수준에서 판정한 연구. 저자 자체 보고로 계산 최적 프런티어에서 학습 FLOPs 6.8~18.0% 절감, 이득은 코드에서 가장 크고 샘플 길이와 인컨텍스트 예시 수가 늘수록 커지며, 두 번째 방문이 어텐션 싱크를 줄이고 주의 질량을 내용 관련 토큰으로 재배분한다는 기계적 분석을 제시.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.013432026년 8월 31일에 더한 조각 · 그 주 보기