다크 모드
병목 리포트 해석하기
PRISM은 서버 운영 데이터를 기반으로 분석 리포트를 자동 생성합니다. 이 가이드에서는 리포트를 열고, 각 항목의 숫자가 무엇을 의미하는지, 어떻게 활용하면 좋은지를 안내합니다.
리포트 열기
- 관리자 메뉴에서 보고서를 클릭합니다.
- 리포트 생성 버튼을 클릭합니다.
- 리포트 종류와 기간을 선택합니다.
- 생성 버튼을 클릭하면 리포트가 만들어집니다.
- 생성된 리포트를 다운로드(PDF 또는 Excel)합니다.
정기 리포트 자동 생성
관리자가 정기 생성을 설정하면 매주/매월 자동으로 리포트가 생성됩니다. 보고서 목록에서 과거 리포트를 언제든 다시 다운로드할 수 있습니다.
리포트 종류
| 리포트 | 영문 코드 | 무엇을 알 수 있나요 |
|---|---|---|
| 자원 효율성 리포트 | resource-efficiency | 서버별 자원 활용 상태 (유휴/정상/과부하) 분류 |
| GPU 활용률 리포트 | gpu-utilization | GPU별 사용률 분포와 유휴 GPU 현황 |
| Slurm 사용량 리포트 | slurm-usage | 사용자별 GPU 사용 시간, 대기 시간, 실패율 |
| 알림 요약 리포트 | alert-summary | 기간 내 알림 발생 추이와 빈번 유형 |
자원 효율성 리포트 읽기
이 리포트는 전체 서버를 자원 활용도에 따라 3단계로 분류해줍니다.
서버 분류 기준
| 분류 | 의미 | 기준 |
|---|---|---|
| 유휴 | 자원을 거의 사용하지 않는 서버 | CPU + GPU 평균 사용률 10% 미만 |
| 정상 | 적절하게 활용되고 있는 서버 | CPU + GPU 평균 사용률 10~85% |
| 과부하 | 자원이 부족한 서버 | CPU 또는 GPU 평균 사용률 85% 이상 |
산점도(Scatter Plot) 읽는 법
리포트에 포함된 산점도는 서버별 CPU 사용률(가로축)과 GPU 사용률(세로축)을 한눈에 보여줍니다.
- 왼쪽 아래에 몰린 점 → 유휴 서버가 많다는 뜻입니다
- 가운데 분포 → 자원이 고르게 사용되고 있습니다
- 오른쪽 위에 몰린 점 → 과부하 서버가 있어 증설이 필요할 수 있습니다
이 숫자가 알려주는 것
| 이런 상태면 | 의미 | 해야 할 일 |
|---|---|---|
| 유휴 서버가 전체의 30% 이상 | 자원 낭비가 발생하고 있습니다 | 작업 분배 조정 또는 서버 통합 검토 |
| 과부하 서버가 있음 | 특정 서버에 부하가 집중됩니다 | 작업 분산 또는 서버 증설 검토 |
| 대부분 정상 범위 | 자원이 효율적으로 사용 중입니다 | 현재 상태 유지 |
GPU 활용률 리포트 읽기
GPU가 설치된 서버에서 GPU가 실제로 얼마나 사용되고 있는지를 분석합니다.
사용률 구간별 의미
| 사용률 구간 | 상태 | 의미 |
|---|---|---|
| 0~10% | 유휴 | GPU가 거의 사용되지 않고 있습니다 |
| 10~30% | 저활용 | 작업이 GPU를 충분히 활용하지 못하고 있습니다 |
| 30~70% | 정상 | GPU가 적절하게 활용되고 있습니다 |
| 70~95% | 고활용 | GPU가 잘 활용되고 있으나 여유가 적습니다 |
| 95% 이상 | 포화 | GPU가 한계에 도달했습니다 |
히트맵 패턴 읽기
리포트의 히트맵은 시간대별 GPU 사용률을 색상으로 보여줍니다.
| 패턴 | 의미 | 조치 |
|---|---|---|
| 특정 시간대만 진한색 | 해당 시간에 작업이 집중됨 | 작업 스케줄을 분산시키면 효율적 |
| 전체적으로 연한색 | GPU가 전반적으로 유휴 | 추가 작업 배정 검토 |
| 항상 진한색 | GPU가 항상 바쁨 | GPU 증설 검토 또는 작업 효율화 |
| 세로줄 패턴 (특정 GPU만 진함) | 작업이 특정 GPU에 편중 | 작업 스케줄러 설정 확인 |
이 숫자가 알려주는 것
| 이런 상태면 | 의미 | 해야 할 일 |
|---|---|---|
| 유휴 GPU가 50% 이상 | GPU 자원이 낭비되고 있습니다 | 사용자에게 GPU 작업 안내 또는 할당 재조정 |
| 포화 GPU가 있음 | 작업 대기가 길어질 수 있습니다 | 우선순위 조정 또는 GPU 추가 배정 |
| 평균 사용률 30~70% | GPU가 효율적으로 운영되고 있습니다 | 현재 운영 유지 |
Slurm 사용량 리포트 읽기
작업 스케줄러(Slurm)와 연동된 환경에서 사용자별 사용 현황을 분석합니다.
Slurm 연동 환경에서만 생성됩니다
이 리포트는 작업 스케줄러가 연동된 클러스터 환경에서만 생성됩니다.
주요 지표
| 지표 | 의미 |
|---|---|
| GPU-hours | 사용자가 GPU를 사용한 총 시간 (GPU 수 x 사용 시간) |
| 평균 대기 시간 | 작업 제출 후 실행까지 걸린 시간 |
| 실패율 | 제출한 작업 중 실패한 비율 |
이 숫자가 알려주는 것
| 이런 상태면 | 의미 | 해야 할 일 |
|---|---|---|
| 상위 1명이 전체의 50% 이상 사용 | 자원이 특정 사용자에게 편중됨 | 공정 배분 정책 검토 (fairshare 설정) |
| 평균 대기 시간이 1시간 이상 | 자원이 부족하거나 작업이 큼 | 클러스터 증설 또는 작업 크기 가이드 |
| 실패율이 10% 이상인 사용자 | 스크립트 오류 가능성 높음 | 해당 사용자에게 작업 스크립트 점검 안내 |
| 전체 대기 시간이 짧음 (5분 이내) | 자원에 여유가 있습니다 | 추가 사용자/작업을 수용할 수 있음 |
리포트 활용 팁
추천 확인 주기
| 리포트 | 추천 주기 | 이유 |
|---|---|---|
| 자원 효율성 | 월 1회 | 서버 증설/감축 계획 수립에 활용 |
| GPU 활용률 | 주 1회 | GPU 유휴 현황을 빠르게 파악하여 배분 조정 |
| Slurm 사용량 | 주 1회 | 사용자 간 형평성과 대기 시간 관리 |
| 알림 요약 | 주 1회 | 반복 알림 패턴 확인 및 근본 원인 해결 |
리포트로 의사결정하기
- 서버 증설이 필요한가? → 자원 효율성 리포트에서 과부하 비율 확인
- GPU를 추가해야 하는가? → GPU 활용률 리포트에서 포화 GPU 비율 확인
- 사용자 교육이 필요한가? → Slurm 리포트에서 실패율 높은 사용자 확인
- 특정 장비에 문제가 있는가? → 알림 요약에서 반복 알림 서버 확인
리포트를 팀과 공유하세요
PDF로 다운로드한 리포트는 경영진이나 팀원에게 공유하여 인프라 운영 현황을 투명하게 전달할 수 있습니다. Excel 형식은 추가 분석이 필요할 때 유용합니다.
