Published on2026년 6월 26일KV 캐시와 PagedAttention — 추론 메모리의 모든 것kv-cachepaged-attentioninferencegpu-memoryquantizationtransformervllmLLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
Published on2026년 3월 17일GPU 메모리 관리 & LLM 추론 최적화: vLLM, PagedAttention, GPTQ, TensorRT-LLM까지gpu-memoryllm-inferencevllmpaged-attentiongptqtensorrt-llm2026-03HBM 메모리 계층, KV 캐시 계산, PagedAttention, GPTQ/AWQ 양자화, continuous batching, vLLM vs TensorRT-LLM 비교까지 LLM 추론 최적화 완전 가이드입니다.