Cluster Resource Forecast
클러스터 CPU나 메모리가 바닥나는 것은 새벽 3시가 아니라 몇 주 앞서 미리 보고 싶은 문제입니다. Cluster Resource Forecast는 클러스터의 소비 추세를 학습해서 CPU와 메모리 사용률을 앞으로 투영하고, 7일과 30일 시점의 스냅샷 예측을 제공합니다. 그래서 용량 벽에 부딪혀 반응하는 대신, 미리 여유를 갖고 Node 추가나 워크로드 적정 사이징을 계획할 수 있습니다.
사이드바에서 Wave Diagnosis 아래 Cluster Resources를 여세요. 예측에는 최소 7일치 이력이 필요하며, 클러스터 선택기와 날짜 범위 선택기가 화면 범위를 정합니다.
한눈에 보는 예측
예측 배너. "이 클러스터가 CPU나 메모리를 다 쓰게 될까?"에 대한 한 줄 답변으로, 7일과 30일 시점의 예상 CPU, 메모리 사용률을 보여줍니다.
Cluster Capacity & Forecast 테이블. 배너 뒤에 있는 실제 수치입니다: Node CPU와 Node Memory(총 capacity), 현재 Pod CPU / Memory Request와 Pod CPU / Memory Limit, 사용률 바로 표시되는 Total Pod CPU / Memory Requested(예: Node CPU의 94%가 이미 request에 커밋됨), 7-day 예측 컬럼입니다.
Resource Trend Charts
Cluster Resource Details는 추세와 그 투영을 그래프로 보여줍니다. 시간 단위(All, Hourly, Daily, Weekly, Monthly)를 전환하고, Filter Group으로 클러스터 전체가 아니라 일부 워크로드만 좁혀서 예측할 수 있습니다.
- CPU 차트: Node CPU(capacity), Pod CPU Request, Pod CPU Limit, 그리고 request 추세를 투영하는 Pod CPU Request (Forecast).
- 메모리 차트: Node Memory(capacity), Pod Memory Request, Pod Memory Limit, Pod Memory Request (Forecast).
추세를 이렇게 읽으세요.
- 예측 선이 capacity 선 쪽으로 올라가는 지점이 대략 부족해지는 시점입니다.
- 기울기가 가파를수록 소비 속도가 빠르고, 평평한 선은 안정적인 사용량을 뜻합니다.
차트 아래의 Historical Data 테이블은 검증하거나 내보내고 싶을 때를 위한 타임스탬프별 원시 수치(Node CPU, Pod CPU Request와 Limit, 그리고 메모리 쪽 동일 항목)를 나열합니다.
카운트다운이 아니라 추세를 읽습니다. Cluster Resource Forecast는 투영과 7일, 30일 스냅샷을 보여줄 뿐, "며칠 남았다"는 단일 숫자를 찍거나 알림을 울리지 않습니다. 스냅샷 퍼센트와 예측 선이 얼마나 빠르게 올라가는지를 보고 "너무 가깝다"의 기준을 여러분 클러스터에 맞게 직접 판단하는 방식이며, 그래야 용량 결정이 고정된 임계값이 아니라 여러분 손에 남습니다.
활용 사례
선제적 용량 계획
부족해지기 전에 Node를 추가하세요. 7일, 30일 뷰가 있으면 예산 승인을 받고, 클라우드 quota를 올리고, 유지보수 시간대에 맞춰 변경을 예약할 시간이 생깁니다. Pod가 스케줄링을 멈춘 뒤 허둥대는 대신입니다.
인프라 예산 예측
한두 달 앞선 클라우드 지출을 예측하세요. 예측 추세를 근거로 예산 증액을 정당화하고, 인프라 비용을 예상 성장에 맞추고, 긴급 스케일링에서 나오는 예상치 못한 청구서를 피할 수 있습니다.
예측 추세에 따른 대응
예측이 용량 쪽으로 향한다면(높은 사용률 바, 또는 capacity 선에 가까워지는 예측 선), 문제를 해결하는 가장 저렴한 방법을 고르세요.
- 성장이 진짜라면 Node를 추가하세요. 예측 갭에서 추가 규모를 산정한 뒤, 새 capacity가 투영을 평평하게 만드는지 확인합니다.
- 클러스터가 낭비되고 있다면 먼저 과다 프로비저닝된 워크로드를 적정 사이징하세요. Smart Sizing 권고안을 적용해 부풀려진 request를 줄이면, 하드웨어를 사지 않고도 예측 압박이 내려가는 것을 볼 수 있습니다.
- 특정 서비스의 부풀려진 request를 줄이세요. Workload CPU Utilization으로 request보다 훨씬 낮게 도는 워크로드를 찾아 낮추세요.
- 부하가 들쭉날쭉한 워크로드는 Autopilot에 맡기세요. 한가한 시간대에는 Autopilot이 replica를 줄여서 나머지 워크로드를 위한 용량을 확보합니다.
관련 문서
- Wave Diagnosis 개요
- Smart Sizing: Node를 추가하기 전에 용량 압박이 성장 때문인지 낭비 때문인지 먼저 판단하세요.
- Workload CPU Utilization: 클러스터 request를 부풀리는 저사용률 워크로드를 찾습니다.
- Idle Node Detection: 이미 idle 상태인 Node를 되찾습니다.