Hands-On LLM Serving and Optimization Study: vLLM으로 Qwen3-14B 서빙 처리량 끌어올리기Hands-On LLM Serving and Optimization 스터디 정리입니다. 지난 정리가 책 7장의 Speculative Decoding, 병렬화, PD 분리처럼 서빙 구조 위에 얹는 고급 기법을 다뤘다면, 이번에는 책 9장 LLM Optimization in Practice를 따라 "실제로 숫자를 재고 바꿔보는" 이야기를 합니다. Qwen3-14B를 vLLM으로 서빙할 때 무엇을 측정하고, 어떤 순서로 손을 대고, 그 결과를 어떻게 읽어야 하는지가 중심입니다.이 글을 읽고 나면 단일 GPU에서 LLM 서빙 벤치마크를 세우는 순서, 처리량과 지연 시간 숫자를 벤치..