LLM API 비용 계산기
LLM API Cost Calculator
요청 수·입출력 토큰·캐시 적중률·배치 비율로 워크로드를 한 번 입력하면 Anthropic·OpenAI·Google·DeepSeek·Mistral 15개 모델의 월 비용과 요청당 비용을 나란히 비교합니다. 모든 단가는 2026-08-12에 각 공식 가격 페이지에서 직접 읽어 온 값이고, 행마다 출처 링크와 입력/캐시/출력/배치 상세 내역을 보여 줍니다. 챗봇 상담·RAG·코드 리뷰 봇·대량 요약(배치)·에이전트 루프 프리셋을 수정해 가며 쓸 수 있고, 캐시·배치 단가를 공개하지 않은 모델은 추정하는 대신 미공개로 표시합니다.
가격 기준일 2026-08-12
모든 단가는 이 날짜에 각 제공사의 공식 가격 페이지에서 직접 읽어 온 값입니다. 가격은 수시로 바뀌며, 항상 공식 페이지가 우선합니다.
금액은 USD · 월 = 30일 기준 · 행마다 출처 링크가 있습니다.
워크로드 프리셋
시스템 프롬프트·FAQ 맥락이 매 요청 반복되어 캐시 적중이 높고, 답변은 짧습니다.
워크로드 입력
캐시 읽기 단가를 공개한 모델에만 적용됩니다. 미공개 모델은 "캐시 단가 미공개"로 표시됩니다.
배치 단가를 공개한 모델에만 적용됩니다. 배치 물량에는 캐시 할인을 적용하지 않습니다(보수적 추정).
월 60,000 요청 × (입력 1,200 + 출력 300 토큰)
토큰 어림 계산추정
어림 규칙: 영어 약 4자 ≈ 1토큰(Anthropic 문서 FAQ 기준) · 한국어 약 1자 ≈ 1.5토큰(경험적 추정)
정확한 토큰 수는 모델(토크나이저)마다 다릅니다 — 어디까지나 추정치입니다.
공식 가격 페이지에 따르면 Claude 4.7 이상 모델은 새 토크나이저를 써서 같은 텍스트에 약 30% 더 많은 토큰이 나옵니다(정확한 증가폭은 내용에 따라 다름). Sonnet 4.6 이하는 이전 토크나이저입니다. 아래 글자 수 추정은 이 차이를 반영하지 않으므로, 배지가 붙은 모델은 실제 비용이 추정보다 높게 나올 수 있습니다.
모델별 월 비용
월 비용이 낮은 순으로 정렬
- 1DeepSeekDeepSeek V4 Flash$9.19 / 월$0.000153 요청당입력(정가) $4.03캐시 읽기 $0.121출력 $5.04
공식 페이지에 전반적 가격 인상 예고 공지 있음
- 2GoogleGemini 2.5 Flash-Lite$14.40 / 월$0.00024 요청당입력(정가) $7.20출력 $7.20
- 3MistralMistral Small 4$21.60 / 월$0.00036 요청당입력(정가) $10.80출력 $10.80
- 4OpenAIGPT-5.6 Luna$28.22 / 월$0.00047 요청당입력(정가) $5.76캐시 읽기 $0.864출력 $21.60
- 5DeepSeekDeepSeek V4 Pro$28.34 / 월$0.000472 요청당입력(정가) $12.53캐시 읽기 $0.157출력 $15.66
공식 페이지에 전반적 가격 인상 예고 공지 있음
- 6MistralMistral Large 3$63.00 / 월$0.00105 요청당입력(정가) $36.00출력 $27.00
- 7AnthropicClaude Haiku 4.5$123.12 / 월$0.00205 요청당입력(정가) $28.80캐시 읽기 $4.32출력 $90.00
- 8GoogleGemini 3.6 Flash$184.68 / 월$0.00308 요청당입력(정가) $43.20캐시 읽기 $6.48출력 $135.00
캐시는 저장 비용 $1.00/1M토큰·시간이 별도(계산 미포함)
- 9MistralMistral Medium 3.5$243.00 / 월$0.00405 요청당입력(정가) $108.00출력 $135.00
- 10AnthropicClaude Sonnet 5$246.24 / 월$0.0041 요청당입력(정가) $57.60캐시 읽기 $8.64출력 $180.00
출시 때 한시 가격으로 발표됐던 $2/$10이 정식 가격으로 확정됨(공식 페이지 공지)
- 11OpenAIGPT-5.6 Terra$282.24 / 월$0.0047 요청당입력(정가) $57.60캐시 읽기 $8.64출력 $216.00
- 12GoogleGemini 3.1 Pro Preview$360.00 / 월$0.006 요청당입력(정가) $144.00출력 $216.00
Preview 모델 · 표시가는 ≤200K 토큰 기준, >200K는 입력 $4 / 출력 $18
- 13AnthropicClaude Opus 5$615.60 / 월$0.0103 요청당입력(정가) $144.00캐시 읽기 $21.60출력 $450.00
- 14OpenAIGPT-5.6 Sol$705.60 / 월$0.0118 요청당입력(정가) $144.00캐시 읽기 $21.60출력 $540.00
- 15AnthropicClaude Fable 5$1,231 / 월$0.0205 요청당입력(정가) $288.00캐시 읽기 $43.20출력 $900.00
계산 가정과 주의
- 월 비용은 30일 기준이며 모든 금액은 USD입니다.
- 캐시 적중률은 입력 토큰에만 적용하고, 캐시 쓰기 비용(예: Anthropic 5분 캐시 쓰기 1.25배)은 계산에 넣지 않습니다.
- 배치 물량에는 캐시 할인을 적용하지 않습니다 — 실제보다 약간 높게 나오는 보수적 추정입니다.
- OpenAI 배치 단가는 공식 페이지에 명시된 "표준가의 50%" 규칙으로 계산한 값입니다.
- Gemini 캐시는 저장 비용($/1M토큰·시간)이 별도로 붙지만 계산에 넣지 않습니다.
- Mistral은 "캐시 입력 90% 할인" 공지가 있으나 모델별 적용 여부가 페이지에 없어 캐시를 적용하지 않습니다.
- DeepSeek 공식 페이지에 전반적 가격 인상 예고가 있습니다.
- 컨텍스트 창은 출처 페이지에 명시된 경우에만 표시합니다.
이어서 해볼 도구
같은 흐름으로 이어지는 도구를 골라 두었습니다.
- LLM GPU 메모리(VRAM) 계산기이 모델, 내 GPU에서 돌아갈까? LLM 추론·파인튜닝에 필요한 메모리를 공식을 화면에 그대로 보여주며 계산합니다. 가중치 = 파라미터 × 비트 ÷ 8, GQA를 반영한 KV 캐시, 숨은 보정계수 대신 명시적 오버헤드 슬라이더, INT8/Q5/Q4 양자화(가중치당 비트 편집 가능), 풀 파인튜닝과 LoRA/QLoRA, 멀티 GPU와 Apple 통합 메모리까지. 모든 모델 구성과 GPU 용량은 1차 출처(HF config.json, 제조사 스펙 페이지)에서 검증했고 프리셋마다 출처 링크와 구성 기준일을 표시합니다. 모든 결과는 추정치로 표기되며 실제 사용량은 런타임(vLLM, llama.cpp 등)에 따라 다릅니다.
- ML 학습 데이터 탐색기LLM, 음성인식, TTS, Vision, 비디오 생성 모델의 학습 데이터 예시를 확인하세요.
- ML 인프라 실전 퀴즈GPU·MIG, 쿠버네티스·KubeVirt, Slurm·Kubeflow 분산 학습, LLM 데이터까지 — 오답·즐겨찾기를 저장해 복습하는 ML 인프라 실전 퀴즈입니다.
- 신경망 실습소딥러닝을 브라우저에서 직접 배우는 실습소 — 활성화 함수 시각화, MLP/RNN/CNN/Transformer 아키텍처, 실제 역전파로 학습하는 2층 신경망, 셀프 어텐션 히트맵까지. 외부 라이브러리 없이 순수 자바스크립트로 계산합니다.