최근 포스트

Muon Optimizer 정리

원 출처: Muon: An optimizer for hidden layers in neural networks (Keller Jordan) 대규모 확장: Muon is Scalable for LLM Training (Moonshot AI) 모멘텀을 직교화해서 업데이트한다는 M...

Interleaved Pipeline Parallelism과 BitPipe 논문정리

논문: BitPipe: Bidirectional Interleaved Pipeline Parallelism for Accelerating Large Models Training 파이프라인 병렬화의 버블 문제부터 시작해, 인터리브드 방식과 양방향 방식을 결합한 BitPipe까지...

RoPE(Rotary Position Embedding): RoFormer 논문정리

논문: RoFormer: Enhanced Transformer with Rotary Position Embedding 위치 인코딩의 흐름(절대 → 상대 → 회전)을 따라가면서, RoPE의 수식 유도를 단계별로 정리하고 PyTorch 구현까지 확인합니다. 손으로 정리한 유도 과...