メモリリーク、キャパシティ枯渇、PVフル、スケジューリング遅延 — Waveが数週間前にすべてを予測します。
Kubernetesは失敗したPodを再起動するのは得意です。失敗する前に警告するのは得意ではありません。メモリリークはOOMKillまで静かに成長します。クラスターキャパシティはPodがpending状態になるまで一杯になります。PVはサービスがクラッシュするまで100%に達します。Podスケジューリング遅延は誰かがスケジューラーキューを確認するまでレイテンシを低下させます。アラートが発動するころにはインシデントはすでに発生しています。
しきい値ベースのアラートは緩やかなメモリ増加を見逃します。PodがLimitに達してkillされるときにはすでにインシデントが発生しています。
成長トレンドはGrafanaで見られますが、誰も予測していません。クラスターが満杯になり、Podがpending状態になり、キャパシティリクエストが四半期計画でなく緊急事態になります。
永続ボリュームの成長はディスクが100%になるまで見えません。そうなると書き込みが失敗し、サービスがクラッシュし、チームは手動でリサイズに奔走します。
Waveがインシデント前に問題を発見する方法を見てみましょう
デモを予約