RoPE(Rotary Position Embedding): RoFormer 논문정리
논문: RoFormer: Enhanced Transformer with Rotary Position Embedding 위치 인코딩의 흐름(절대 → 상대 → 회전)을 따라가면서, RoPE의 수식 유도를 단계별로 정리하고 PyTorch 구현까지 확인합니다. 손으로 정리한 유도 과...
논문: RoFormer: Enhanced Transformer with Rotary Position Embedding 위치 인코딩의 흐름(절대 → 상대 → 회전)을 따라가면서, RoPE의 수식 유도를 단계별로 정리하고 PyTorch 구현까지 확인합니다. 손으로 정리한 유도 과...
논문: Better & Faster Large Language Models via Multi-token Prediction 한 번에 여러 개의 미래 토큰을 예측하도록 학습시키는 MTP를 정리한 글입니다. 뒤에 나오는 코드는 구조를 이해하기 위한 의사 코드로, 그대로 실...
논문: DeepSeek-V3 Technical Report Section 2.2 앞서 정리한 MTP(Multi-token Prediction)의 후속 글입니다. 원래 MTP가 독립적인 헤드를 병렬로 두었다면, DeepSeek-V3는 모듈을 순차로 이어 붙여 인과 체인을 유지합...
논문: DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model DeepSeek-V2 논문 중 MLA(Multi-head Latent Attention) 부분만 정리한 글입니다. 앞선 ...
논문: DeepSeek-V3.2-Exp: Boosting Long-Context Efficiency with DeepSeek Sparse Attention DSA는 MLA 위에 얹어서 구현되므로, MLA를 먼저 보고 오면 이해가 빠릅니다. 논문의 수식은 직접 구현한 PyTor...