AirCloud ведёт мониторинг всех уровней инфраструктуры: агрегированно по кластеру и детально по каждому ресурсу. Метрики доступны в приложении и транслируются во внешние системы мониторинга.
Раздел «Мониторинг»: сводный дашборд с ключевыми показателями (состояние платформы, серверы и ВМ с ошибками, активные сессии, задачи и события) и панель здоровья кластеров, серверов и ВМ. Через «+ Добавить виджет» дашборд настраивается под себя.
Агрегированный мониторинг кластера
На уровне кластера собираются ключевые метрики: загрузка и гарантированные CPU и RAM, задержка, нагрузка и IOPS ввода-вывода, нагрузка на сеть и использование локального хранилища.
Дашборд кластера: CPU и RAM, задержка / нагрузка / IOPS ввода-вывода, сеть и использование локального хранилища.
Мониторинг по ресурсам
-
Серверы — CPU, RAM, сеть и локальные хранилища по каждому узлу.
-
Виртуальные машины — метрики по каждой ВМ.
-
Хранилища — Bandwidth, Latency и IOPS внешних СХД.
Почти у каждого ресурса есть собственная страница мониторинга с ключевыми показателями.
Настройки графиков
Графики на странице мониторинга гибко настраиваются:
-
Агрегация значений — среднее, минимум, максимум или сумма.
-
Разрешение (детализация) — от 30 секунд до 1 дня.
-
Период — относительный (последний час, день и т. д.) или абсолютный (точные даты).
-
Период обновления — live-режим, по умолчанию раз в 30 секунд.
-
Фильтрация по конкретным ресурсам и выбор единиц измерения для отдельных графиков.
Внешние системы и алерты
Метрики транслируются через внешний API в Zabbix, Prometheus и Grafana — с готовыми дашбордами и преднастроенными алертами, чтобы встроить мониторинг AirCloud в уже используемый у заказчика стек наблюдаемости.
Диагностика
Метрики собирает агент с prometheus-exporter на уровне гипервизора. Для обращений в поддержку встроен агент диагностики (по серверу или всему кластеру): он временно поднимает уровень логирования, собирает человекочитаемый отчёт для скачивания и затем отключается — чтобы не накапливать лишние данные. Многие проблемы решаются без поддержки: логи микросервисов Центрального сервера видны в интерфейсе, а любой служебный микросервис можно перезапустить из UI — без доступа по SSH (подробнее — раздел Серверы).