LLM GPU 메모리(VRAM) 계산기
GPU VRAM Calculator for LLMs
이 모델, 내 GPU에서 돌아갈까? LLM 추론·파인튜닝에 필요한 메모리를 공식을 화면에 그대로 보여주며 계산합니다. 가중치 = 파라미터 × 비트 ÷ 8, GQA를 반영한 KV 캐시, 숨은 보정계수 대신 명시적 오버헤드 슬라이더, INT8/Q5/Q4 양자화(가중치당 비트 편집 가능), 풀 파인튜닝과 LoRA/QLoRA, 멀티 GPU와 Apple 통합 메모리까지. 모든 모델 구성과 GPU 용량은 1차 출처(HF config.json, 제조사 스펙 페이지)에서 검증했고 프리셋마다 출처 링크와 구성 기준일을 표시합니다. 모든 결과는 추정치로 표기되며 실제 사용량은 런타임(vLLM, llama.cpp 등)에 따라 다릅니다.
모델
가중치 정밀도
INT8/Q5/Q4 기본값은 GGUF Q8_0·Q5_0·Q4_0 블록 구조에서 계산한 값(8.5/5.5/4.5비트)입니다. K-quant(Q4_K_M ≈ 4.8 등)를 쓰면 직접 입력하세요.
KV 캐시
오버헤드
숨은 보정계수 대신 명시적 가정으로 둡니다. CUDA 컨텍스트(≈0.3–1 GiB) + 프레임워크 버퍼·커널 워크스페이스 + 디코딩 활성값 몫이며, 런타임마다 다릅니다. 기본 2 GiB는 그 대역의 보수적 가운데 값입니다.
필요 VRAM (추정) — 17.96 GiB
- 가중치: 8,030,261,248 × 16 ÷ 8 = 14.96 GiB
- KV 캐시: 2 × 32 × 8 × 128 × 2B × 8,192 × 1 = 1.00 GiB
- 오버헤드: 2.0 GiB
- 합계: 17.96 GiB
가중치 = 파라미터 수 × 비트 ÷ 8 · KV 캐시 = 2 × 레이어 × KV헤드 × 헤드차원 × 바이트 × 컨텍스트 × 배치
GPU에 들어갈까?
컨슈머
- RTX 3060 12GB부족함
용량 12 GiB − 18.0 GiB → 부족 6.0 GiB
- RTX 4080 16GB부족함
용량 16 GiB − 18.0 GiB → 부족 2.0 GiB
- RTX 3090 24GB여유 있음
용량 24 GiB − 18.0 GiB → 여유 6.0 GiB
- RTX 4090 24GB여유 있음
용량 24 GiB − 18.0 GiB → 여유 6.0 GiB
- RTX 5090 32GB여유 있음
용량 32 GiB − 18.0 GiB → 여유 14.0 GiB
데이터센터
- T4 16GB부족함
용량 16 GiB − 18.0 GiB → 부족 2.0 GiB
- L4 24GB여유 있음
용량 24 GiB − 18.0 GiB → 여유 6.0 GiB
- A10G 24GB여유 있음
용량 24 GiB − 18.0 GiB → 여유 6.0 GiB
- A100 40GB여유 있음
용량 40 GiB − 18.0 GiB → 여유 22.0 GiB
- A100 80GB여유 있음
용량 80 GiB − 18.0 GiB → 여유 62.0 GiB
- H100 SXM 80GB여유 있음
용량 80 GiB − 18.0 GiB → 여유 62.0 GiB
- H100 NVL 94GB여유 있음
용량 94 GiB − 18.0 GiB → 여유 76.0 GiB
- H200 141GB여유 있음
용량 141 GiB − 18.0 GiB → 여유 123.0 GiB
Apple 통합 메모리
용량 32 GiB − 18.0 GiB → 여유 14.0 GiB
M시리즈는 CPU와 메모리를 공유하므로 전체가 GPU에 쓰이지는 않습니다. GPU가 쓸 수 있는 비율은 OS·설정(iogpu wired limit 등)에 따라 달라서 여기서는 입력한 용량 그대로 비교만 합니다.
판정 기준(명시적 가정): 필요량 ≤ 용량×0.9 → 여유, ≤ 용량 → 빠듯, 초과 → 부족. GPU 표기 GB는 GiB로 취급합니다. (headroom 90%)
GPU 용량 출처 (제조사/공급사 페이지)
- RTX 3060 12GB — 12 GB · 출처 (구성 기준일: 2026-08-12)
- RTX 4080 16GB — 16 GB · 출처 (구성 기준일: 2026-08-12)
- RTX 3090 24GB — 24 GB · 출처 (구성 기준일: 2026-08-12)
- RTX 4090 24GB — 24 GB · 출처 (구성 기준일: 2026-08-12)
- RTX 5090 32GB — 32 GB · 출처 (구성 기준일: 2026-08-12)
- T4 16GB — 16 GB · 출처 (구성 기준일: 2026-08-12)
- L4 24GB — 24 GB · 출처 (구성 기준일: 2026-08-12)
- A10G 24GB — 24 GB · 출처 (구성 기준일: 2026-08-12)
- A100 40GB — 40 GB · 출처 (구성 기준일: 2026-08-12)
- A100 80GB — 80 GB · 출처 (구성 기준일: 2026-08-12)
- H100 SXM 80GB — 80 GB · 출처 (구성 기준일: 2026-08-12)
- H100 NVL 94GB — 94 GB · 출처 (구성 기준일: 2026-08-12)
- H200 141GB — 141 GB · 출처 (구성 기준일: 2026-08-12)
왜 이 숫자인가
가중치 메모리
모델의 모든 파라미터를 선택한 정밀도로 저장하는 비용입니다. 파라미터 수 × 가중치당 비트 ÷ 8이 바이트가 됩니다. 파라미터 수는 각 모델의 safetensors 메타데이터에서 읽은 정확한 값이고, FP16은 16비트, GGUF Q4_0은 32개 가중치 블록당 18바이트(= 4.5비트/가중치)처럼 양자화 포맷의 블록 구조에서 비트 수가 나옵니다.
KV 캐시
생성 중 각 레이어는 토큰마다 키와 값 벡터를 저장합니다. 토큰 하나의 비용은 레이어 × KV헤드 × 헤드차원 × 2(K와 V) × 원소 크기이고, 여기에 컨텍스트 길이와 배치를 곱합니다. GQA 모델은 KV헤드 수가 어텐션 헤드보다 적어서 그만큼 캐시가 작아집니다(예: Qwen2.5-7B는 28헤드 중 KV헤드 4개 → MHA 대비 1/7). KV 양자화(INT8/Q4)는 원소 크기를 2바이트에서 1/0.5바이트로 줄이는 것으로 근사했습니다.
오버헤드 슬라이더
가중치와 KV 캐시 외에도 CUDA 컨텍스트, 프레임워크 버퍼, 커널 워크스페이스, 디코딩 활성값이 메모리를 씁니다. 이 몫은 런타임 구현에 따라 달라 공식이 없습니다. 그래서 숨은 계수로 곱하는 대신, 눈에 보이는 슬라이더(기본 2 GiB)로 두고 직접 조정하게 했습니다.
파인튜닝 공식
풀 파인튜닝(혼합정밀 + AdamW)은 파라미터당 BF16 가중치 2바이트, FP32 그래디언트 4바이트, AdamW 모멘트 두 개 각 4바이트로 14바이트를 잡습니다. 구현에 따라 FP32 마스터 사본을 더 두면 +4바이트입니다. LoRA는 베이스를 동결한 채 각 타깃 선형층(입력→출력)에 r×(입력+출력) 파라미터를 더하고, 학습 상태(그래디언트+옵티마이저)는 어댑터에만 듭니다. QLoRA는 같은 구조에서 베이스를 4비트급으로 양자화한 경우입니다. 둘 다 거친 추정이며 활성값은 별도 슬라이더입니다.
판정 기준과 단위
메모리는 GiB(1024³바이트)로 계산·표시합니다. GPU 메모리 칩은 이진 용량이라 표기 24GB를 24GiB로 취급했습니다. 판정은 드라이버 예약·단편화를 감안한 10% 여유를 명시적 가정으로 둡니다: 필요량이 용량의 90% 이하면 "여유", 100% 이하면 "빠듯", 넘으면 "부족". 실제 한계는 런타임과 드라이버에 따라 다릅니다.
구성 기준일: 2026-08-12
이어서 해볼 도구
같은 흐름으로 이어지는 도구를 골라 두었습니다.
- LLM API 비용 계산기요청 수·입출력 토큰·캐시 적중률·배치 비율로 워크로드를 한 번 입력하면 Anthropic·OpenAI·Google·DeepSeek·Mistral 15개 모델의 월 비용과 요청당 비용을 나란히 비교합니다. 모든 단가는 2026-08-12에 각 공식 가격 페이지에서 직접 읽어 온 값이고, 행마다 출처 링크와 입력/캐시/출력/배치 상세 내역을 보여 줍니다. 챗봇 상담·RAG·코드 리뷰 봇·대량 요약(배치)·에이전트 루프 프리셋을 수정해 가며 쓸 수 있고, 캐시·배치 단가를 공개하지 않은 모델은 추정하는 대신 미공개로 표시합니다.
- ML 인프라 실전 퀴즈GPU·MIG, 쿠버네티스·KubeVirt, Slurm·Kubeflow 분산 학습, LLM 데이터까지 — 오답·즐겨찾기를 저장해 복습하는 ML 인프라 실전 퀴즈입니다.
- AI 벤치마크 모음AI 모델 벤치마크 및 리더보드 사이트를 한눈에 모아 정리했습니다.
- 브라우저 AI 실험실서버 없이 브라우저에서 돌아가는 진짜 AI — 감정 분석(별점 1~5), 임베딩 유사도 히트맵, 한↔영 번역, 제로샷 분류, 영어 요약을 Transformers.js(WebGPU/WASM)로 실행합니다. 모델은 브라우저에 캐시되고 입력 텍스트는 어디에도 전송되지 않습니다.