Skip to content
Tools/LLM GPU 메모리(VRAM) 계산기

LLM GPU 메모리(VRAM) 계산기

GPU VRAM Calculator for LLMs

이 모델, 내 GPU에서 돌아갈까? LLM 추론·파인튜닝에 필요한 메모리를 공식을 화면에 그대로 보여주며 계산합니다. 가중치 = 파라미터 × 비트 ÷ 8, GQA를 반영한 KV 캐시, 숨은 보정계수 대신 명시적 오버헤드 슬라이더, INT8/Q5/Q4 양자화(가중치당 비트 편집 가능), 풀 파인튜닝과 LoRA/QLoRA, 멀티 GPU와 Apple 통합 메모리까지. 모든 모델 구성과 GPU 용량은 1차 출처(HF config.json, 제조사 스펙 페이지)에서 검증했고 프리셋마다 출처 링크와 구성 기준일을 표시합니다. 모든 결과는 추정치로 표기되며 실제 사용량은 런타임(vLLM, llama.cpp 등)에 따라 다릅니다.

AI·데이터
추정치이 페이지의 모든 숫자는 공식으로 계산한 추정치입니다. 실제 사용량은 런타임(vLLM, llama.cpp, TensorRT-LLM 등)의 할당 방식, 커널, 페이징 전략에 따라 달라집니다. 이 도구는 어떤 제품도 비교·평가하지 않습니다.

모델

구성: 8,030,261,248 params · L=32 · d=4096 · heads=32 · kv=8 · head_dim=128

구성 기준일: 2026-08-12 · 아키텍처 출처 · 파라미터 수 출처

가중치 정밀도

INT8/Q5/Q4 기본값은 GGUF Q8_0·Q5_0·Q4_0 블록 구조에서 계산한 값(8.5/5.5/4.5비트)입니다. K-quant(Q4_K_M ≈ 4.8 등)를 쓰면 직접 입력하세요.

KV 캐시

KV 캐시 정밀도

오버헤드

숨은 보정계수 대신 명시적 가정으로 둡니다. CUDA 컨텍스트(≈0.3–1 GiB) + 프레임워크 버퍼·커널 워크스페이스 + 디코딩 활성값 몫이며, 런타임마다 다릅니다. 기본 2 GiB는 그 대역의 보수적 가운데 값입니다.

필요 VRAM (추정) — 17.96 GiB

  • 가중치: 8,030,261,248 × 16 ÷ 8 = 14.96 GiB
  • KV 캐시: 2 × 32 × 8 × 128 × 2B × 8,192 × 1 = 1.00 GiB
  • 오버헤드: 2.0 GiB
  • 합계: 17.96 GiB

가중치 = 파라미터 수 × 비트 ÷ 8 · KV 캐시 = 2 × 레이어 × KV헤드 × 헤드차원 × 바이트 × 컨텍스트 × 배치

GPU에 들어갈까?

컨슈머

  • RTX 3060 12GB부족함

    용량 12 GiB − 18.0 GiB 부족 6.0 GiB

  • RTX 4080 16GB부족함

    용량 16 GiB − 18.0 GiB 부족 2.0 GiB

  • RTX 3090 24GB여유 있음

    용량 24 GiB − 18.0 GiB 여유 6.0 GiB

  • RTX 4090 24GB여유 있음

    용량 24 GiB − 18.0 GiB 여유 6.0 GiB

  • RTX 5090 32GB여유 있음

    용량 32 GiB − 18.0 GiB 여유 14.0 GiB

데이터센터

  • T4 16GB부족함

    용량 16 GiB − 18.0 GiB 부족 2.0 GiB

  • L4 24GB여유 있음

    용량 24 GiB − 18.0 GiB 여유 6.0 GiB

  • A10G 24GB여유 있음

    용량 24 GiB − 18.0 GiB 여유 6.0 GiB

  • A100 40GB여유 있음

    용량 40 GiB − 18.0 GiB 여유 22.0 GiB

  • A100 80GB여유 있음

    용량 80 GiB − 18.0 GiB 여유 62.0 GiB

  • H100 SXM 80GB여유 있음

    용량 80 GiB − 18.0 GiB 여유 62.0 GiB

  • H100 NVL 94GB여유 있음

    용량 94 GiB − 18.0 GiB 여유 76.0 GiB

  • H200 141GB여유 있음

    용량 141 GiB − 18.0 GiB 여유 123.0 GiB

Apple 통합 메모리

여유 있음

용량 32 GiB − 18.0 GiB 여유 14.0 GiB

M시리즈는 CPU와 메모리를 공유하므로 전체가 GPU에 쓰이지는 않습니다. GPU가 쓸 수 있는 비율은 OS·설정(iogpu wired limit 등)에 따라 달라서 여기서는 입력한 용량 그대로 비교만 합니다.

판정 기준(명시적 가정): 필요량 ≤ 용량×0.9 → 여유, ≤ 용량 → 빠듯, 초과 → 부족. GPU 표기 GB는 GiB로 취급합니다. (headroom 90%)

GPU 용량 출처 (제조사/공급사 페이지)
  • RTX 3060 12GB12 GB · 출처 (구성 기준일: 2026-08-12)
  • RTX 4080 16GB16 GB · 출처 (구성 기준일: 2026-08-12)
  • RTX 3090 24GB24 GB · 출처 (구성 기준일: 2026-08-12)
  • RTX 4090 24GB24 GB · 출처 (구성 기준일: 2026-08-12)
  • RTX 5090 32GB32 GB · 출처 (구성 기준일: 2026-08-12)
  • T4 16GB16 GB · 출처 (구성 기준일: 2026-08-12)
  • L4 24GB24 GB · 출처 (구성 기준일: 2026-08-12)
  • A10G 24GB24 GB · 출처 (구성 기준일: 2026-08-12)
  • A100 40GB40 GB · 출처 (구성 기준일: 2026-08-12)
  • A100 80GB80 GB · 출처 (구성 기준일: 2026-08-12)
  • H100 SXM 80GB80 GB · 출처 (구성 기준일: 2026-08-12)
  • H100 NVL 94GB94 GB · 출처 (구성 기준일: 2026-08-12)
  • H200 141GB141 GB · 출처 (구성 기준일: 2026-08-12)

왜 이 숫자인가

가중치 메모리

모델의 모든 파라미터를 선택한 정밀도로 저장하는 비용입니다. 파라미터 수 × 가중치당 비트 ÷ 8이 바이트가 됩니다. 파라미터 수는 각 모델의 safetensors 메타데이터에서 읽은 정확한 값이고, FP16은 16비트, GGUF Q4_0은 32개 가중치 블록당 18바이트(= 4.5비트/가중치)처럼 양자화 포맷의 블록 구조에서 비트 수가 나옵니다.

KV 캐시

생성 중 각 레이어는 토큰마다 키와 값 벡터를 저장합니다. 토큰 하나의 비용은 레이어 × KV헤드 × 헤드차원 × 2(K와 V) × 원소 크기이고, 여기에 컨텍스트 길이와 배치를 곱합니다. GQA 모델은 KV헤드 수가 어텐션 헤드보다 적어서 그만큼 캐시가 작아집니다(예: Qwen2.5-7B는 28헤드 중 KV헤드 4개 → MHA 대비 1/7). KV 양자화(INT8/Q4)는 원소 크기를 2바이트에서 1/0.5바이트로 줄이는 것으로 근사했습니다.

오버헤드 슬라이더

가중치와 KV 캐시 외에도 CUDA 컨텍스트, 프레임워크 버퍼, 커널 워크스페이스, 디코딩 활성값이 메모리를 씁니다. 이 몫은 런타임 구현에 따라 달라 공식이 없습니다. 그래서 숨은 계수로 곱하는 대신, 눈에 보이는 슬라이더(기본 2 GiB)로 두고 직접 조정하게 했습니다.

파인튜닝 공식

풀 파인튜닝(혼합정밀 + AdamW)은 파라미터당 BF16 가중치 2바이트, FP32 그래디언트 4바이트, AdamW 모멘트 두 개 각 4바이트로 14바이트를 잡습니다. 구현에 따라 FP32 마스터 사본을 더 두면 +4바이트입니다. LoRA는 베이스를 동결한 채 각 타깃 선형층(입력→출력)에 r×(입력+출력) 파라미터를 더하고, 학습 상태(그래디언트+옵티마이저)는 어댑터에만 듭니다. QLoRA는 같은 구조에서 베이스를 4비트급으로 양자화한 경우입니다. 둘 다 거친 추정이며 활성값은 별도 슬라이더입니다.

판정 기준과 단위

메모리는 GiB(1024³바이트)로 계산·표시합니다. GPU 메모리 칩은 이진 용량이라 표기 24GB를 24GiB로 취급했습니다. 판정은 드라이버 예약·단편화를 감안한 10% 여유를 명시적 가정으로 둡니다: 필요량이 용량의 90% 이하면 "여유", 100% 이하면 "빠듯", 넘으면 "부족". 실제 한계는 런타임과 드라이버에 따라 다릅니다.

구성 기준일: 2026-08-12

같은 흐름으로 이어지는 도구를 골라 두었습니다.