Hands-On LLM Serving and Optimization Study: Speculative Decoding, 병렬화, PD 분리 정리Hands-On LLM Serving and Optimization 스터디 정리입니다. 책 7장 Advanced LLM Optimization Techniques를 따라 그 위에 얹는 고급 최적화 세 가지를 다룹니다. Speculative Decoding, 멀티 GPU/멀티 노드 병렬화(TP, PP, EP, DP), 그리고 Prefill-Decode 분리입니다.이 글의 목표는 세 기법이 각각 어떤 병목을 겨냥하는지, 무엇을 내주고 무엇을 얻는지 이해하고, 그래서 내 워크로드와 하드웨어에서 무엇을 켜고 무엇을 켜지 말아야 할지 스스로 판단할 수 있게 되는 것입니다...