Аудит Kubernetes

Глубокий анализ кластеров: ноды, поды, workloads, storage, метрики. Находим переплаты и показываем, где сэкономить.

Обзор

Oopps.ai автоматически подключается к вашим Managed Kubernetes кластерам через kubeconfig и собирает полную картину: utilization нод, requests/limits подов, storage usage, metrics-server данные.

На основе собранных данных платформа формирует детальный отчёт с findings и рекомендациями по оптимизации. Каждый finding содержит приоритет, описание проблемы и расчётную экономию.

Что анализируется

Категория Что собирается Зачем
Nodes CPU/RAM capacity, allocatable, conditions Найти недогруженные ноды
Pods requests, limits, actual usage (metrics-server) Найти overrequested workloads
Workloads Deployments, StatefulSets, DaemonSets, Jobs Ранжировать по потреблению
Storage PVC, PV, StorageClasses, unbound volumes Найти неиспользуемые диски
Namespaces Суммарное потребление по namespace Top consumers

Как запустить аудит

Проверьте подключение

Убедитесь, что кластер подключён: перейдите в раздел Кластеры и проверьте, что статус кластера — «Connected».

Запустите аудит

Перейдите в Аудиты → Запустить аудит.

Выберите кластер

Выберите конкретный кластер или нажмите «Аудит всех кластеров», чтобы проверить все подключённые кластеры одновременно.

Дождитесь результатов

Аудит обычно занимает 30–60 секунд. По завершении вы увидите отчёт с findings и рекомендациями.

Отчёт аудита

После завершения аудита формируется структурированный отчёт, который включает следующие разделы:

Node Pool Analysis

Утилизация CPU и RAM по каждой ноде кластера. Платформа показывает текущую загрузку, allocatable ресурсы и даёт рекомендацию по right-sizing — уменьшить или увеличить пул нод.

Workload Rankings

Top-10 workloads по CPU и RAM consumption. Позволяет быстро понять, какие именно сервисы потребляют больше всего ресурсов и где стоит начать оптимизацию.

Namespace Totals

Расход ресурсов по namespace. Полезно для мультитенантных кластеров, где нужно понять, какой команде или проекту принадлежат основные затраты.

Storage Analysis

PVC usage, unbound volumes, неиспользуемые StorageClasses. Часто забытые PVC после удаления деплоев продолжают оплачиваться — платформа находит их.

Findings

Конкретные проблемы с приоритетом: critical, warning, info. Каждый finding содержит описание проблемы, затронутый ресурс и рекомендуемое действие.

Типы findings

Тип Описание Пример
Overrequested workload requests значительно больше actual usage Deployment nginx requests 4 CPU, uses 0.1
Underutilized node Нода загружена менее 30% Node pool с 8 CPU, используется 1.5
Idle workload Pods работают, но не обрабатывают трафик CronJob завершился, pods висят
Unbound PVC PersistentVolumeClaim не привязан к поду Забытый PVC после удаления деплоя
Missing limits Workload без resource limits Может забрать все ресурсы ноды

Требования

Примечание

Если metrics-server не установлен, аудит всё равно работает, но без данных actual usage. Рекомендации будут основаны только на requests/limits и будут менее точными.

Что дальше?