ZeRO: Memory Optimizations Toward Training Trillion Parameter Models 논문정리
논문: ZeRO: Memory Optimizations Toward Training Trillion Parameter Models 데이터 병렬화의 메모리 중복을 제거하는 ZeRO를 정리했습니다. 모델 상태를 다루는 ZeRO-DP와 잔여 상태를 다루는 ZeRO-R 두 축으로 나...
논문: ZeRO: Memory Optimizations Toward Training Trillion Parameter Models 데이터 병렬화의 메모리 중복을 제거하는 ZeRO를 정리했습니다. 모델 상태를 다루는 ZeRO-DP와 잔여 상태를 다루는 ZeRO-R 두 축으로 나...
논문: BitPipe: Bidirectional Interleaved Pipeline Parallelism for Accelerating Large Models Training 파이프라인 병렬화의 버블 문제부터 시작해, 인터리브드 방식과 양방향 방식을 결합한 BitPipe까지...
논문: RoFormer: Enhanced Transformer with Rotary Position Embedding 위치 인코딩의 흐름(절대 → 상대 → 회전)을 따라가면서, RoPE의 수식 유도를 단계별로 정리하고 PyTorch 구현까지 확인합니다. 손으로 정리한 유도 과...
논문: Better & Faster Large Language Models via Multi-token Prediction 한 번에 여러 개의 미래 토큰을 예측하도록 학습시키는 MTP를 정리한 글입니다. 뒤에 나오는 코드는 구조를 이해하기 위한 의사 코드로, 그대로 실...
논문: DeepSeek-V3 Technical Report Section 2.2 앞서 정리한 MTP(Multi-token Prediction)의 후속 글입니다. 원래 MTP가 독립적인 헤드를 병렬로 두었다면, DeepSeek-V3는 모듈을 순차로 이어 붙여 인과 체인을 유지합...