Muon Optimizer 정리
원 출처: Muon: An optimizer for hidden layers in neural networks (Keller Jordan) 대규모 확장: Muon is Scalable for LLM Training (Moonshot AI) 모멘텀을 직교화해서 업데이트한다는 M...
원 출처: Muon: An optimizer for hidden layers in neural networks (Keller Jordan) 대규모 확장: Muon is Scalable for LLM Training (Moonshot AI) 모멘텀을 직교화해서 업데이트한다는 M...
논문: ZeRO: Memory Optimizations Toward Training Trillion Parameter Models 데이터 병렬화의 메모리 중복을 제거하는 ZeRO를 정리했습니다. 모델 상태를 다루는 ZeRO-DP와 잔여 상태를 다루는 ZeRO-R 두 축으로 나...
논문: BitPipe: Bidirectional Interleaved Pipeline Parallelism for Accelerating Large Models Training 파이프라인 병렬화의 버블 문제부터 시작해, 인터리브드 방식과 양방향 방식을 결합한 BitPipe까지...
논문: RoFormer: Enhanced Transformer with Rotary Position Embedding 위치 인코딩의 흐름(절대 → 상대 → 회전)을 따라가면서, RoPE의 수식 유도를 단계별로 정리하고 PyTorch 구현까지 확인합니다. 손으로 정리한 유도 과...
논문: Better & Faster Large Language Models via Multi-token Prediction 한 번에 여러 개의 미래 토큰을 예측하도록 학습시키는 MTP를 정리한 글입니다. 뒤에 나오는 코드는 구조를 이해하기 위한 의사 코드로, 그대로 실...