- Published on
컨텍스트 윈도우와 max_tokens 차이가 헷갈린다면 이 글 하나로 정리됩니다. 모델의 컨텍스트 윈도우(구조적 한계), vLLM의 max_model_len(엔진 설정), 요청당 생성 상한인 max_tokens와 max_completion_tokens, 그리고 배치 한도인 max_num_batched_tokens와 max_num_seqs가 각각 무엇을 제한하는지 비교표와 실제 에러 메시지로 정리했습니다. 입력과 출력이 같은 한도를 나눠 쓴다는 사실, KV 캐시 메모리가 실질 한계를 정하는 구조까지 다룹니다. vLLM 내부 구조 시리즈 6편.