korean-docs
레퍼런스
문제 해결

문제 해결

이 가이드는 앞으로 계속 채워질 예정입니다. 긴급한 문제는 고객 지원팀에 문의하거나 커뮤니티 Slack (opens in a new tab)에 참여해 주세요.

자주 발생하는 문제

Node CPU 사용률이 100%에 고정됩니다

증상. kubectl top node는 정상 수치를 보여주는데 콘솔에서는 해당 Node의 CPU 사용률이 100%로 표시됩니다.

원인. 이전에는 Wave가 에이전트가 직접 잰 전체 CPU 시간으로 Node CPU 사용률을 계산했습니다. nohz_full이나 isolcpus로 튜닝된 Node에서는 격리된 코어에 대해 /proc/stat이 idle 시간을 보고하지 않아, 그 전체 값이 busy 시간으로 수렴하면서 비율이 100%에서 포화됩니다.

해결. Wave 3.4.5 이상으로 업그레이드하세요. 이제 Node CPU 사용률은 Kubernetes API가 선언한 allocatable CPU(없으면 capacity)로 나눕니다. kubectl top이 쓰는 값과 같으므로 둘이 일치합니다.

OpenShift에서 설치 직후 Core나 Intelligence Pod가 crash loop에 빠집니다

증상. OpenShift에 설치한 직후 Core나 Intelligence Pod가 반복해서 재시작합니다. 로그에는 권한 오류가 아니라 DuckDB ICU 확장을 찾지 못했다거나 캐시 디렉터리를 만들지 못했다는 내용이 보입니다.

원인. OpenShift의 restricted-v2 SCC는 namespace마다 임의의 UID로 컨테이너를 실행하는데, 이 UID에는 대응하는 /etc/passwd 항목이 없습니다. 그래서 HOME/로 잡히고 프로세스가 원하는 위치에 쓰지 못합니다.

해결. Wave 3.4.4 이상으로 업그레이드하세요. HOME을 명시적으로 지정하고 home, cache, data 디렉터리를 그룹 0이 쓸 수 있게 만듭니다. 임의 UID 지원을 참고하세요. 우회책으로 SCC를 느슨하게 풀지 마세요.

Autopilot의 /predict 호출이 타임아웃됩니다

증상. Autopilot이 임계값 기반 스케일링으로 폴백하고, 로그에 intelligence 서비스에 대한 예측 타임아웃이 찍힙니다.

원인. 3.4.5 이전에는 cluster-status cron이 5분마다 도는 매 tick에서 예측 API를 호출해서, intelligence 서비스를 포화시키고 Autopilot의 예측 요청을 굶길 수 있었습니다.

해결. Wave 3.4.5 이상으로 업그레이드하세요. 예측 호출이 WA_CLUSTER_STATUS_FORECAST_INTERVAL_HOURS(기본 24시간)로 제한됩니다. 이 변수나 WA_PV_CAPACITY_FORECAST_TASK_INTERVAL_MINUTES를 기본값보다 낮춰 뒀다면 되돌리세요. 예측 주기를 참고하세요.

같은 idle Node가 나타났다 사라졌다 반복합니다

증상. 동일한 Node가 반복해서 idle로 잡혔다가 해제됩니다.

원인. 메트릭이나 에이전트 수집 공백으로 그 Node에 대한 Wave의 Pod 캐시가 비었고, Pod 수가 0으로 읽힌 것을 실제로 놀고 있는 Node로 해석했습니다.

해결. Wave 3.4.5 이상으로 업그레이드하세요. Pod 수 0을 판정 불가로 보고 기록 생성과 해제 모두에서 건너뜁니다. Idle Node Detection을 참고하세요.

Smart Sizing 탭에 "recommendation withheld"가 표시됩니다

문제가 아니라 정상 동작입니다. 그 추천은 CPU나 메모리 하한까지 끌어올려졌을 값이라, 적용하면 컨테이너의 request를 낮추는 게 아니라 올리게 됩니다. 그래서 Wave는 잘못된 절감액을 보고하는 대신 추천을 보류합니다. 기본 request가 몇 millicore인 OpenShift에서 흔합니다. 항상 적용되는 안전장치를 참고하세요.

기능 페이지에 "꺼져 있음" 패널이 뜹니다

해당 기능의 환경 변수 토글이나 그룹 게이트가 false입니다. 패널에 설정해야 할 변수 이름이 나옵니다. 기능 토글을 참고하세요. Diagnosis 하위 작업은 WA_DIAGNOSIS_ENABLED=true도, GPU 하위 작업은 WA_GPU_ENABLED=true도 함께 필요합니다.

도움 받기