korean-blog
AI 네이티브 컨트롤 플레인을 향하여: Wave Autoscale의 다음 챕터

AI 네이티브 컨트롤 플레인을 향하여: Wave Autoscale의 다음 챕터

저자: Wave Autoscale 팀

날짜: 2026년 3월 13일

Wave Autoscale의 AI 네이티브 컨트롤 플레인 비전

AI는 코드 작성 방식을 완전히 바꿔놓았습니다. 현재 코드의 70%가 AI로 생성되며, AI 네이티브 IDE가 표준이 되었습니다. 하지만 그 코드가 실행되는 인프라를 운영하는 데 있어서는 여전히 대부분의 팀이 터미널, 대시보드, 런북 사이를 오가고 있습니다. 개발 AI와 운영 AI 사이의 격차는 점점 벌어지고 있습니다.

Wave Autoscale은 ML 기반 오토스케일링 엔진으로 시작했습니다. 이제 우리는 더 큰 것을 만들고 있습니다: 자연어가 분산된 도구 체인을 대체하고, 지능형 에이전트가 24시간 운영 업무를 처리하는 Kubernetes를 위한 AI 네이티브 컨트롤 플레인입니다.

그 모습이 어떤 것인지, 그리고 왜 중요한지 살펴보겠습니다.


현재의 현실: 오늘날 AI 에이전트로 K8s를 운영하기

팀들은 이미 Kubernetes 운영을 위해 AI 에이전트를 실험적으로 활용하고 있습니다. Claude Code, ChatGPT, Copilot 같은 도구들은 MCP 서버나 CLI 래퍼를 통해 클러스터에 연결할 수 있습니다.

이론적으로는 LLM에게 "클러스터 상태를 확인해줘"라고 요청하면 답변을 받을 수 있습니다. MCP 서버를 활용한 Kubernetes 문제 해결 (opens in a new tab)이나 Claude Desktop + MCP를 활용한 클러스터 관리 (opens in a new tab)에 대한 블로그 글들이 그 과정을 자세히 설명하고 있으며, 실제로 얼마나 많은 구성 요소가 필요한지를 보여줍니다.

현재 Kubernetes 운영을 위한 AI 에이전트 워크플로우

실제로 워크플로우는 다음과 같습니다:

  1. 모든 시스템에 대한 인증을 설정합니다. 각 클러스터에 대해 kubectl 자격 증명을 구성합니다. Prometheus 엔드포인트 접근을 설정합니다. AWS CLI 자격 증명을 연결합니다. 각 도구 연결은 별도의 설정 단계이며, 자격 증명은 만료되거나 갱신됩니다. PerfectScale의 가이드 (opens in a new tab)에서 보여주듯이, K8s MCP 서버만 해도 Docker에 .kube/config를 마운트해야 하며, 추가 프로바이더(Prometheus, Grafana, AWS)마다 각각의 API 키 구성이 필요합니다.

  2. 원시 데이터를 수집하기 위해 여러 번의 호출이 필요합니다. 단일 워크로드의 리소스 상태를 파악하려면 에이전트가 kubectl MCP를 호출하여 노드 목록을 조회하고, 다시 호출하여 top nodes를 확인하고, PromQL로 Prometheus에 히스토리컬 메트릭을 쿼리하고, 파드 상태를 확인하고, AWS에서 EC2 비용 데이터를 가져와야 합니다. 컨텍스트를 구축하는 것만으로도 5~10회의 별도 도구 호출이 필요합니다.

  3. LLM이 원시 메트릭을 해석하는 데 의존합니다. 에이전트는 kubectl의 비정형 텍스트 출력과 Prometheus의 원시 시계열 데이터를 수신합니다. 도메인 특화 지능 없이 이 데이터를 파싱하고, 상관관계를 분석하고, 추론해야 합니다. 분석의 품질은 전적으로 사용자의 프롬프트와 LLM의 일반 지식에 의존하며, 이는 최신 Kubernetes 모범 사례를 반영하지 못할 수 있습니다. InfoWorld가 ChatGPT가 프로덕션 Kubernetes에 대해 말하지 않는 것 (opens in a new tab)에서 언급했듯이, 피상적인 조언을 넘어서면 LLM은 "부정확하거나, 오래되었거나, 관련 없는 정보를 포함할 수 있는 공개 지식에 의존"하며, 노드 사이징 트레이드오프나 컨트롤 플레인 한계와 같이 실전 운영 경험에서만 얻을 수 있는 프로덕션 뉘앙스를 놓칩니다.

  4. 조치를 취하기 위해 여러 라운드의 반복이 필요합니다. 에이전트가 분석을 완료한 후, 이를 실행하려면 더 많은 도구 호출이 필요합니다: 디플로이먼트 설정 업데이트, HPA 임계값 조정, 알림 생성. 각 작업은 별도의 kubectl 명령이며, 각각 잘못된 구성의 위험이 있습니다. 사용자는 종종 다음 단계로 진행하기 전에 중간 결과를 확인해야 하므로, "빠른 확인"이 15분간의 반복 작업으로 변합니다.

⚠️

결과: 쿼리당 10~20초, 설치 및 유지보수해야 할 6개 이상의 MCP 서버, 그리고 여전히 상당한 수준의 사람의 감독이 필요한 워크플로우. 80개 이상의 네임스페이스와 150개 이상의 파드가 있는 홈 랩 클러스터를 Claude로 관리하는 (opens in a new tab) 한 엔지니어의 표현이 정확합니다: Claude는 *"오토파일럿이 아닌 코파일럿"*으로 작동합니다. 수백 번 재시작된 오퍼레이터처럼 사람이 놓칠 수 있는 문제를 발견했지만, 모든 조치에는 여전히 사람의 판단과 승인이 필요했습니다. 순수한 수동 운영보다는 낫지만, 팀이 실제로 필요로 하는 자율적이고 지능적인 운영과는 거리가 멉니다.


Wave Autoscale 접근 방식: 단일 인텔리전스 창

우리는 그 전체 워크플로우를 근본적으로 더 단순한 것으로 통합하기 위해 Wave AI Agent를 구축하고 있습니다.

핵심 차이점은 다음과 같습니다: Wave Autoscale은 이미 클러스터 내부에 있습니다. 자격 증명이 이미 구성되어 있습니다. 메트릭을 이미 지속적으로 수집하고 있습니다. 워크로드를 이미 이해하고 있습니다. 따라서 AI 에이전트가 질문에 답하거나 조치를 취해야 할 때, 제로에서 시작하는 것이 아니라 사전 수집되고 사전 분석된 데이터의 기반 위에서 시작합니다.

Wave AI Agent의 Kubernetes 운영 워크플로우

동일한 "클러스터 상태 확인" 워크플로우가 Wave AI Agent에서는 어떻게 보이는지 살펴보겠습니다:

  1. 사용자가 웹 콘솔, 크론 스케줄, 또는 MCP 엔드포인트를 통해 프롬프트합니다. 자격 증명 설정이 필요 없습니다. 도구 연결이 필요 없습니다. 자연어 요청만 하면 됩니다.

  2. Wave AI Agent가 get_cluster_status()를 호출합니다. 단 한 번의 도구 호출입니다. ML 기반 이상 탐지, 용량 예측, 적정 사이징 권장 사항과 함께 사전 집계된 노드, 파드, 리소스 상태를 반환합니다. 기존에 5~10회의 별도 호출이 필요했던 데이터가 이미 계산되어 준비되어 있습니다.

  3. 내장된 에이전트 스킬이 모범 사례를 자동으로 적용합니다. 에이전트는 사용자가 올바른 PromQL 쿼리나 최적의 HPA 설정을 아는 것에 의존하지 않습니다. 클러스터 상태 점검부터 비용 최적화 감사, 인시던트 대응까지 8개 이상의 사전 구축된 스킬이 EKS 운영 전문 지식을 에이전트의 추론에 직접 내장합니다.

  4. 안전한 API 기반 제어를 통해 조치가 실행됩니다. 원시 kubectl 명령이 없습니다. Wave AI Agent는 내장된 확인 흐름과 시뮬레이션 모드가 있는 전용 도구를 사용하여 잘못된 구성의 위험을 줄입니다.

결과: 쿼리당 1~3초, 세션별 설정 제로, 그리고 범용 에이전트로는 제공할 수 없는 ML 기반 인사이트.

직접 체험해보세요 아래 프롬프트를 클릭하면 Wave AI Agent 상호작용이 어떤 모습인지 확인할 수 있습니다:

wave-agent — prod-cluster

wave-agent@prod-cluster ready

Connected to 12 nodes · 156 pods · 80 namespaces

Select a prompt:


세 가지 상호작용 방식

Wave AI Agent는 단순한 일회성 챗봇이 아닙니다. 다양한 운영 패턴에 맞는 세 가지 상호작용 모드를 설계하고 있습니다:

가장 직관적인 방법입니다. Wave Autoscale의 UI를 열고, 자연어로 프롬프트를 입력하면 즉시 결과를 받을 수 있습니다. 예시:

  • "프로덕션 클러스터의 상태가 어떤가요?"
  • "메모리 누수가 있는 워크로드를 찾아주세요"
  • "모든 네임스페이스에서 비용 최적화 기회를 보여주세요"

에이전트가 클러스터의 전체 컨텍스트를 가지고 있으므로, 연결 정보나 네임스페이스 필터를 지정할 필요 없이 이미 알고 있습니다.

Home > AI Agent
Agent Console
Connected
W

What can I help you with?

Ask the agent...

이것이 가능하게 하는 것: 실제 시나리오

구체적으로 보여드리기 위해, 우리가 목표로 하는 두 가지 시나리오를 소개합니다:

한 줄 명령으로 이벤트 대비

운영자가 다음과 같이 입력합니다: "내일 블랙프라이데이 프로모션이 있습니다. 트래픽에 대비해주세요." Wave AI Agent가 자동으로 5개의 도구를 호출합니다: 향후 24시간의 리소스 수요를 예측하고, 주요 서비스에 대한 레플리카 권장 사항을 생성하고, 프로모션 1시간 전에 사전 스케일링 크론 작업을 생성하고, 우선순위 기반 트래픽 정책을 설정하고(결제 = 크리티컬, 검색 = 베스트 에포트), 트래픽 급증 및 에러율 모니터링 알림을 구성합니다. 한 문장, 다섯 가지 자동화된 조치.

자동화된 비용 최적화 리포트

매주 Agent Cron이 비용 최적화 감사를 실행합니다. DaemonSet만 실행 중인 유휴 노드 3개, Released/Available 상태의 미사용 PV 12개, 과다 프로비저닝된 워크로드 23개를 탐지합니다. 경영진용 리포트를 생성합니다: 현재 월간 비용 $47,200, 최적화 후 예상 비용 $31,800, 예상 절감액 $15,400 (32.6%). 리포트에는 금액이 첨부된 구체적인 권장 조치가 포함됩니다. 의사결정자는 누구도 단 하나의 쿼리를 실행하지 않고도 실행 가능한 데이터를 받습니다.


비교: Wave AI Agent 유무에 따른 차이

항목WA 없이 (범용 AI + MCP)WA AI Agent 사용 시
설정클러스터별 kubectl, Prometheus, AWS CLI MCP 구성사전 연결됨; 세션별 설정 불필요
데이터 수집5~10회 도구 호출, 원시 데이터, LLM 파싱1~2회 호출, 사전 집계 + ML 인사이트
모범 사례사용자의 프롬프트 품질에 의존내장된 에이전트 스킬 (8가지 EKS 패턴)
야간 인시던트PagerDuty → 엔지니어 호출 → 수동 디버깅자동 탐지 → 자동 복구 → 리포트
스케줄링수동 또는 커스텀 스크립트자연어 스킬을 활용한 Agent Cron
통합6개 이상의 MCP 설치 및 관리2개의 MCP 서버로 50개 이상의 도구 노출
지연 시간쿼리당 10~20초쿼리당 1~3초
조치직접 kubectl (위험)확인 흐름이 포함된 안전한 API
지능원시 메트릭, ML 없음ML 이상 탐지, 용량 예측, 예측적 스케일링
유지보수각 MCP를 개별적으로 업데이트단일 플랫폼, 통합 업데이트

앞으로의 계획

이것이 Wave Autoscale의 다음 챕터입니다. 스케일링 엔진으로 시작하여 ML 기반 오토파일럿으로 진화했고, 이제 Kubernetes 운영을 위한 완전한 AI 네이티브 컨트롤 플레인을 구축하고 있습니다.

💡

엔터프라이즈급 AI 추론을 위한 Amazon Bedrock과 안정적인 에이전트 운영을 위한 Strands Agents 프레임워크를 기반으로, Wave AI Agent는 수동적이고 반응적인 운영에서 능동적이고 자율적인 인텔리전스로의 전환을 대표합니다. 플랫폼이 수집하는 모든 메트릭, 로그, 인사이트는 AI Agent의 기반 데이터가 되어 — 배포할 때마다 더 스마트하고 컨텍스트를 잘 이해하게 됩니다.

우리는 Kubernetes 운영의 미래가 더 많은 대시보드나 더 많은 알림 규칙이 아니라고 믿습니다. 클러스터를 이해하고, 문제를 예측하며, 사용자를 대신해 행동하면서도 제어권을 유지하게 해주는 지능형 레이어가 바로 그 미래입니다.

앞으로 몇 주 안에 더 많은 세부 사항, 데모, 그리고 얼리 액세스 기회를 공유할 예정입니다. 계속 지켜봐 주세요.


Wave Autoscale은 AWS EKS Service Ready 파트너입니다. wavek8s.com (opens in a new tab)에서 자세히 알아보세요.