전체 글 87

Hands-On LLM Serving and Optimization Study 7주차 Envoy Agent Router

Hands-On LLM Serving and Optimization Study 7주차 Envoy Agent RouterHands-On LLM Serving and Optimization Study 7주차 Envoy Agent Router 내용입니다. 여러 모델 프로바이더와 자체 호스팅 모델을 하나의 진입점으로 묶는 AI Gateway 계층을 다룹니다. 쿠버네티스와 Envoy는 다뤄 봤지만 LLM 서빙은 처음인 DevOps 엔지니어를 독자로 상정합니다.이 글을 읽고 나면 세 가지를 얻는 것이 목표입니다. 첫째, AI Gateway가 왜 일반 API Gateway와 다른 계층으로 필요한지, 그리고 어느 시점에 도입해야 하는지를 LLM 트래픽의 성격에서부터 설명할 수 있게 됩니다. 둘째, Agent Route..

DevOps/Study 2026.09.19

Hands-On LLM Serving and Optimization Study 6주차 Scaling LLM Inference with vLLM and AWS Tranium Workshop

Scaling LLM Inference with vLLM and AWS Tranium WorkshopAWS 워크숍 "Scaling LLM Inference with vLLM and AWS Trainium"을 따라가며 정리한 글입니다. 워크숍은 Amazon EKS에 Trainium 노드를 붙이고, vLLM과 NeuronX Distributed(NxD)로 TinyLlama-1.1B를 서빙한 뒤, Ingress, 모니터링, 부하 테스트, 오토스케일링까지 붙이는 구성입니다. 쿠버네티스는 운영해 봤지만 LLM 서빙은 처음인 DevOps 엔지니어를 독자로 상정합니다.1. 배경1.1 AWS Trainium과 trn1.2xlargeTrainium은 AWS가 딥러닝 학습과 추론용으로 설계한 가속 칩이고, EC2 Trn1..

DevOps/Study 2026.09.13

Hands-On LLM Serving and Optimization Study 5주차 LLM Optimization in Practice

Hands-On LLM Serving and Optimization Study: vLLM으로 Qwen3-14B 서빙 처리량 끌어올리기Hands-On LLM Serving and Optimization 스터디 정리입니다. 지난 정리가 책 7장의 Speculative Decoding, 병렬화, PD 분리처럼 서빙 구조 위에 얹는 고급 기법을 다뤘다면, 이번에는 책 9장 LLM Optimization in Practice를 따라 "실제로 숫자를 재고 바꿔보는" 이야기를 합니다. Qwen3-14B를 vLLM으로 서빙할 때 무엇을 측정하고, 어떤 순서로 손을 대고, 그 결과를 어떻게 읽어야 하는지가 중심입니다.이 글을 읽고 나면 단일 GPU에서 LLM 서빙 벤치마크를 세우는 순서, 처리량과 지연 시간 숫자를 벤치..

DevOps/Study 2026.09.05

Hands-On LLM Serving and Optimization Study 4주차 LLM Serving and Optimization

Hands-On LLM Serving and Optimization Study: Speculative Decoding, 병렬화, PD 분리 정리Hands-On LLM Serving and Optimization 스터디 정리입니다. 책 7장 Advanced LLM Optimization Techniques를 따라 그 위에 얹는 고급 최적화 세 가지를 다룹니다. Speculative Decoding, 멀티 GPU/멀티 노드 병렬화(TP, PP, EP, DP), 그리고 Prefill-Decode 분리입니다.이 글의 목표는 세 기법이 각각 어떤 병목을 겨냥하는지, 무엇을 내주고 무엇을 얻는지 이해하고, 그래서 내 워크로드와 하드웨어에서 무엇을 켜고 무엇을 켜지 말아야 할지 스스로 판단할 수 있게 되는 것입니다...

DevOps/Study 2026.08.30

Hands-On LLM Serving and Optimization Study 3주차 Challenges When Serving LLMs

Hands-On LLM Serving and Optimization Study 3주차 Challenges When Serving LLMsHands-On LLM Serving and Optimization 스터디 4주차 정리입니다. 지난 주차까지가 서빙 시스템을 "어떻게 구성하는가"의 이야기였다면, 이번 주는 그 시스템이 "왜, 어디서 느려지는가"의 이야기입니다. 책 5장(Challenges When Serving LLMs)을 따라가며 최적화가 왜 사업의 문제인지, GPU 스펙을 어떻게 읽어야 하는지, 그리고 모델 로딩과 실행 각각에서 병목이 어디에 생기는지를 정리했습니다.결론을 미리 말하면 이렇습니다. LLM 서빙 최적화는 "무조건 더 빠르게"가 아니라 지연 시간, 처리량, 모델 품질(크기) 사이의 트레..

DevOps/Study 2026.08.22

Hands-On LLM Serving and Optimization Study 2주차 Model Serving System Design

Hands-On LLM Serving and Optimization Study 2주차 Model Serving System DesignHands-On LLM Serving and Optimization 스터디 2주차 정리입니다. 이번 주는 AI 모델을 실제 서비스로 만드는 이야기입니다. 책 3장(Model Serving System Design: A Deep Dive)의 설계를 따라가며, 서빙 시스템을 구성하는 원리를 중심으로 정리했습니다.1. 배경: 프레임워크를 고르기 전에 알아야 하는 것이런 상황을 가정해 봅시다. 사내에 LLM 기반 기능을 올리기로 했고, 서빙 프레임워크를 골라야 합니다. vLLM, Triton, TGI — 선택지는 많고 각자 내세우는 벤치마크 수치도 제각각입니다. 어느 것을 골라야..

DevOps/Study 2026.08.15

Hands-On LLM Serving and Optimization Study 스터디 1주차 - GPT-2(small)로 뜯어보는 Transformer 내부 구조

Hands-On LLM Serving and Optimization Study 스터디 1주차 — GPT-2(small)로 뜯어보는 Transformer 내부 구조개요이 게시물은 가시다님의 Hands-On LLM Serving and Optimization Study 1주차 추가내용으로, GPT-2(small) 모델이 텍스트를 입력받아 다음 단어를 예측하기까지의 전체 과정을 단계별로 정리한 게시글입니다. Transformer Explainer는 GPT-2(small) 모델이 브라우저 안에서 실제로 실행되는 인터랙티브 시각화 도구이기 때문에, 글을 읽으면서 사이트를 함께 열어 두고 각 단계를 직접 눌러보는 것을 권장합니다.행렬 곱셈이 무엇인지 정도만 알고 있으면 따라올 수 있도록 수식보다는 "각 단계가 왜 ..

DevOps/Study 2026.08.08

AI Datacenter Network Study 4주차 - Nokia SR Linux 텔레메트리 랩(srl-telemetry-lab) Deep Dive

Nokia SR Linux 텔레메트리 랩(srl-telemetry-lab) Deep Dive — SNMP 폴링 vs gNMI 스트리밍 감지 지연 실측개요이 게시물은 Nokia SR Linux 기반의 srl-telemetry-lab을 WSL2 환경에서 배포하고, SNMP 폴링과 gNMI 스트리밍 텔레메트리의 감지 지연 차이를 실측한 내용을 정리한 게시글입니다.쿠버네티스 클러스터는 node_exporter를 15초마다 스크레이프하면서, 그 클러스터가 올라가 있는 네트워크 스위치는 여전히 5분 주기 SNMP로 모니터링하는 환경이 많습니다. 이 글에서는 그 간극이 실제로 무엇을 놓치는지 컨테이너 랩에서 직접 측정합니다. Windows PC의 WSL2만으로 Nokia SR Linux 5대짜리 Clos 패브릭과 g..

DevOps/Study 2026.07.12

AI Datacenter Network Study 3주차 — RDMA Write Deep Dive + Congestion Control(ECN·PFC·DCQCN), Load Balancing, AI Fabric Topology

AI Datacenter Network Study 3주차 — RDMA Write Deep Dive + Congestion Control(ECN·PFC·DCQCN), Load Balancing, AI Fabric TopologyAI Datacenter Network 스터디 3주차 정리입니다. 2주차가 "무손실 이더넷을 PFC·ECN·DCQCN으로 만든다"는 개념과 ROD·RUD 토폴로지에서 끝났다면, 이번 주는 그 아래로 내려갑니다. RDMA Write 한 번이 성립하기까지의 실제 절차, 임계값 네 개의 순서가 fabric의 성패를 가르는 이유, elephant flow를 나누는 세 가지 방법, 그리고 rail을 물리 스위치에 담는 방식까지 다룹니다.1. 개요이 글은 AI Datacenter Network..

DevOps/Study 2026.07.04

AI Datacenter Network Study 2주차 IB, RoCEv2 + GPU Cluster Network Design, ROD/RUD

AI Datacenter Network Study 2주차 IB, RoCEv2 + GPU Cluster Network Design, ROD/RUDAI Datacenter Network 스터디 2주차 정리입니다. 1주차가 GPU 간 통신을 RDMA와 InfiniBand·RoCEv2로 처리한다는 데서 끝났다면, 이번에는 그 두 전송 기술을 한 겹 더 파고들고, 수천 장의 GPU를 실제로 어떻게 배선하는지까지 내려가 봅니다.1. 개요이 글은 AI Datacenter Network 스터디 2주차 발표 내용을 바탕으로, GPU 클러스터의 전송 기술과 네트워크 설계를 정리한 기록입니다.1주차의 흐름을 짧게 되짚어 보겠습니다. "GPU가 빠른데 왜 AI는 느리고 비싼가"라는 질문에서 출발해, 병목이 연산이 아니라 메모..

DevOps/Study 2026.06.28