Published on2026년 8월 12일vLLM 내부 구조 (7) — 배포 튜닝과 흔한 함정, OOM 진단 순서vllmgpuquantizationtensor-parallelllmvLLM 배포를 실제로 튜닝하는 순서를 정리했습니다. gpu_memory_utilization이 무엇을 정하는지, 텐서 병렬과 파이프라인 병렬을 언제 쓰는지, 양자화와 KV 캐시 자료형을 어떻게 고르는지, 그리고 OOM이 났을 때 기동 단계와 운영 단계를 나눠 진단하는 순서까지 공식 문서 기준으로 확인해 정리했습니다. vLLM 내부 구조 시리즈 마지막 편.