AI Observability
AI Observability расширяет Smart Monitor до полной наблюдаемости AI-инфраструктуры: её состояния, стоимости и надёжности. Он собирает телеметрию LLM-сервисов, GPU, AI-агентов и локальных AI-клиентов в единое окно состояния, расходов и производительности с готовыми сценариями для команд эксплуатации, ML и FinOps.
Для кого:
- ML/AI-платформенные инженеры и DevOps FinOps
- CTO и руководители AI-направления
Функциональные характеристики
Единое окно AI-инфраструктуры и состояние GPU
Сводная операционная картина всего AI-контура с переходом к состоянию GPU в один клик:
- живое состояние LLM-моделей и AI-сервисов: запросы, трейсы, события, токены и стоимость.
- состояние видеокарт: загрузка, видеопамять, температура, аппаратные ошибки.
Прозрачность расходов на LLM
Контроль потребления и стоимости LLM-запросов по моделям и провайдерам:
- токены и стоимость в разрезе моделей, провайдеров и динамики затрат выявление аномального роста расходов и самых дорогих запросов.
- сравнение эффективности моделей по объёму потребления.
Анализ AI-агентов и трассировок
Разбор поведения AI-агентов и структуры запросов на уровне отдельных спанов:
- запросы, ответы, вызовы инструментов, токены и латентность по диалогам.
- переход к трассировкам: детализация спанов, карта запроса, ошибки.
- поиск узких мест и причин отказов на уровне tool-вызовов.
Мониторинг локальных AI-клиентов
Наблюдаемость AI-инструментов разработчиков на примере Claude Code:
- диалоговая активность, потребление токенов, события и ошибки приложения.
- распределение использования по пользователям и проектам.
Метрики и производительность AI-сервисов
Наблюдение за производительностью inference и AI-сервисов на уровне runtime-метрик:
- очередь запросов, латентность и кэш inference-сервисов (vLLM).
- поток метрик по сервисам и матрица покрытия метриками.
- каталог метрик с типом, последним значением и графиком за период.
Здоровье AI-инфраструктуры в модуле МАЯК
6 готовых глобальных метрик, включающих AI-контур в ресурсно-сервисную модель здоровья:
- GPU (температура, загрузка, память), длительность запросов, ошибки в трассировках, доступность сервисов.
- ранние сигналы деградации до того, как её заметят пользователи.
- настраиваемые пороги критичности и связь техсостояния с влиянием на сервисы.