Перейти к содержимому
AI Observability

AI Observability

AI Observability расширяет Smart Monitor до полной наблюдаемости AI-инфраструктуры: её состояния, стоимости и надёжности. Он собирает телеметрию LLM-сервисов, GPU, AI-агентов и локальных AI-клиентов в единое окно состояния, расходов и производительности с готовыми сценариями для команд эксплуатации, ML и FinOps.

Для кого:

  • ML/AI-платформенные инженеры и DevOps FinOps
  • CTO и руководители AI-направления

Функциональные характеристики

Единое окно AI-инфраструктуры и состояние GPU

Сводная операционная картина всего AI-контура с переходом к состоянию GPU в один клик:

  • живое состояние LLM-моделей и AI-сервисов: запросы, трейсы, события, токены и стоимость.
  • состояние видеокарт: загрузка, видеопамять, температура, аппаратные ошибки.

Прозрачность расходов на LLM

Контроль потребления и стоимости LLM-запросов по моделям и провайдерам:

  • токены и стоимость в разрезе моделей, провайдеров и динамики затрат выявление аномального роста расходов и самых дорогих запросов.
  • сравнение эффективности моделей по объёму потребления.

Анализ AI-агентов и трассировок

Разбор поведения AI-агентов и структуры запросов на уровне отдельных спанов:

  • запросы, ответы, вызовы инструментов, токены и латентность по диалогам.
  • переход к трассировкам: детализация спанов, карта запроса, ошибки.
  • поиск узких мест и причин отказов на уровне tool-вызовов.

Мониторинг локальных AI-клиентов

Наблюдаемость AI-инструментов разработчиков на примере Claude Code:

  • диалоговая активность, потребление токенов, события и ошибки приложения.
  • распределение использования по пользователям и проектам.

Метрики и производительность AI-сервисов

Наблюдение за производительностью inference и AI-сервисов на уровне runtime-метрик:

  • очередь запросов, латентность и кэш inference-сервисов (vLLM).
  • поток метрик по сервисам и матрица покрытия метриками.
  • каталог метрик с типом, последним значением и графиком за период.

Здоровье AI-инфраструктуры в модуле МАЯК

6 готовых глобальных метрик, включающих AI-контур в ресурсно-сервисную модель здоровья:

  • GPU (температура, загрузка, память), длительность запросов, ошибки в трассировках, доступность сервисов.
  • ранние сигналы деградации до того, как её заметят пользователи.
  • настраиваемые пороги критичности и связь техсостояния с влиянием на сервисы.

Если вас заинтересовал модуль, вы можете рассчитать персонализированную стоимость с помощью нашего открытого калькулятора.

Модули