Skip to content

Dcgm

  • Published on
    DCGM Exporter는 GPU 텔레메트리를 프로메테우스 형식으로 노출하는 표준 경로지만, 가장 많이 대시보드에 올라가는 GPU 이용률 계열 메트릭은 사람들이 기대하는 것을 재지 않습니다. 이 글은 dcgm-exporter 저장소의 기본 카운터 CSV와 DCGM 공식 문서, NVML API 문서를 직접 읽고 기본으로 켜져 있는 메트릭 목록, 이용률 메트릭이 실제로 무엇을 뜻하는지, 함께 봐야 할 프로파일링 메트릭이 무엇인지, 커스텀 메트릭 CSV와 파드 라벨 설정을 어떻게 하는지를 정확한 필드 이름과 함께 정리합니다. 쿠버네티스 GPU 운영·관측 시리즈의 네 번째 글입니다.
  • Published on
    쿠버네티스에서 GPU를 쓰려면 드라이버, NVIDIA Container Toolkit, 디바이스 플러그인, DCGM, GPU Feature Discovery, Node Feature Discovery를 노드마다 손으로 맞춰야 했습니다. NVIDIA GPU Operator는 이 조각들을 하나의 오퍼레이터로 묶고 ClusterPolicy 하나로 상태를 관리합니다. 각 컴포넌트가 정확히 무엇을 하는지, Helm 차트의 어떤 값이 무엇을 켜고 끄는지, 설치 전에 확인해야 할 것이 무엇인지를 공식 문서와 저장소의 values.yaml을 직접 읽어 정리했습니다. 쿠버네티스 GPU 운영·관측 시리즈의 첫 번째 글입니다.
  • Published on
    쿠버네티스에서 GPU 문제를 진단할 때 가장 큰 낭비는 순서 없이 아무 데나 찔러 보는 것입니다. 파드가 스케줄되지 않는 것, 파드는 떴는데 GPU가 안 보이는 것, 드라이버와 툴킷 버전이 어긋난 것, 메모리가 부족한 것, 노드에서 GPU가 사라지는 것은 서로 다른 계층의 문제라 확인 순서가 다릅니다. 이 글은 NVIDIA GPU Operator 공식 트러블슈팅 문서와 dcgm-exporter 저장소를 근거로 다섯 계층의 확인 순서와 각 계층에서 실제로 실행할 명령, 그리고 어떤 메트릭이 그 계층의 증거인지를 정리합니다. 쿠버네티스 GPU 운영·관측 시리즈의 마지막 글입니다.