모델 아키텍처·학습 기법Shaowen Wang 외
SMELT 공개
SMELT 공개 — 공유 층 블록을 반복해 유효 깊이를 늘리는 루프드 트랜스포머 평가가 대개 모델 크기를 고정한 채 비교해 아키텍처 이점과 추가 FLOPs를 뒤섞는다고 지적하고, 토큰당 FLOPs·비임베딩 총 파라미터·KV 캐시 세 예산을 모두 맞춘 상태에서 MoE 트랜스포머의 중간 절반 층을 두 번 도는 레시피(Sparse MoE Transformer, middle layers Loop Twice)를 제시. 비임베딩 파라미터 54B까지 네 규모로 확장해 아키텍처별로 친칠라식 스케일링 법칙을 따로 적합
왜 중요한가
깊이 재사용(루프)이 예산을 엄격히 맞춘 뒤에도 이득이 남는지를 스케일링 법칙 수준에서 판정한 연구. 저자 자체 보고로 계산 최적 프런티어에서 학습 FLOPs 6.8~18.0% 절감, 이득은 코드에서 가장 크고 샘플 길이와 인컨텍스트 예시 수가 늘수록 커지며, 두 번째 방문이 어텐션 싱크를 줄이고 주의 질량을 내용 관련 토큰으로 재배분한다는 기계적 분석을 제시.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.013432026년 8월 31일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.04'Formalizing Fermat's Last Theorem' 공개공식 발표09.03Grok Bot 기업용 제공 시작공식 발표09.03GPT-6 Astra 공개공식 발표09.03Random Attention 공개논문