Перейти к содержимому

Мониторинг ИИ-моделей

Проверка доступности ИИ-эндпоинта и того, что модель действительно отвечает


Statuser следит не только за тем, что ваш ИИ-сервис отвечает, но и за тем, что модель за ним действительно работает. Обычной HTTP-проверки здесь часто недостаточно: гейтвей может отдавать 200 на любой запрос, пока модель недоступна, перегружена или упёрлась в лимит запросов.

Как включить

При добавлении сервера выберите тип мониторинга ИИ-модель и укажите:

  • Эндпоинт — адрес вашего API, например https://api.openai.com/v1 или адрес своего гейтвея. Путь до метода Statuser подставит сам.
  • Формат APIOpenAI-совместимый или Anthropic-совместимый, в зависимости от интерфейса вашего сервиса.

Адрес вы указываете сами, поэтому подходят и официальное API провайдера, и модель, развёрнутая у вас, и корпоративный прокси или гейтвей.

Чтобы проверять ещё и ответ модели, включите тумблер «Проверять ответ модели» и добавьте API-ключ и название модели.

Как работает проверка

Проверка доступности

Без API-ключа Statuser запрашивает у эндпоинта список моделей. Ответ с требованием авторизации тоже считается успехом: он означает, что сервис на месте. Токены не расходуются.

Проверка ответа модели Team

С API-ключом Statuser отправляет модели запрос на один токен и ждёт ответ. Если эндпоинт вернул 200, но ответа модели в нём нет, проверка помечается неудачной.

Ответ 429 (превышен лимит запросов) считается недоступностью: упёршийся в лимит эндпоинт непригоден для вашего приложения так же, как и лежащий. Код ошибки видно в карточке инцидента, поэтому лимит легко отличить от сбоя провайдера.

Причину Statuser называет так, чтобы было понятно, где чинить. Если на балансе провайдера закончились средства, инцидент скажет об этом прямо — этот случай не спутать с лимитом запросов, хотя некоторые провайдеры сообщают о нём тем же кодом 429. Отклонённый API-ключ тоже показывается отдельной причиной.

Название модели можно выбрать из списка — Statuser запросит его у провайдера по вашему ключу. Если список получить не удалось, введите название вручную: на работу проверок это не влияет.

Расход токенов

Проверка ответа модели обращается к платному API, и токены списываются с вашего ключа. Одна проверка расходует 1 исходящий токен и от 10 до 100 входящих — провайдеры добавляют к запросу служебную обвязку, и её объём у всех разный. Проверки идут из каждого выбранного региона, поэтому расход умножается на их количество: раз в 5 минут из трёх регионов — это около 26 тысяч проверок в месяц.

Оценить, во сколько это обойдётся по ценам вашего провайдера, можно прямо в форме мониторинга — кнопкой «Рассчитать примерный расход».

Для мониторинга лучше завести отдельный API-ключ с лимитом расходов на стороне провайдера. Так неожиданный счёт невозможен, а ключ можно отозвать, не затрагивая продакшн.

Statuser и сам следит за расходом: если запросов уходит заметно больше, чем предполагает расписание, проверка ответа модели отключается на 12 часов. Мониторинг при этом не прерывается — монитор продолжает следить за доступностью эндпоинта, ключ остаётся на месте, и через 12 часов проверка ответа включается сама.

Выбор регионов

Инцидент открывается, только когда сбой подтвердили все выбранные регионы — так Statuser защищает от ложных срабатываний.

Поэтому если провайдер недоступен из части регионов, эти регионы нужно убрать из проверки, а не добавлять к ним другие. Например, официальные API OpenAI и Anthropic не отвечают на запросы из России — для них оставьте только регионы вне РФ или укажите адрес своего прокси.

Что важно учитывать

  • Ключ хранится в зашифрованном виде и используется только для проверок этого монитора. Обратно он не выдаётся: в панели управления и в API видна только маска вида sk-…lyfQ, а в команде для воспроизведения запроса из инцидента ключ заменён заглушкой.
  • Удалить ключ можно в любой момент — выключите проверку ответа модели, и монитор вернётся к проверке доступности эндпоинта.
  • Некоторые провайдеры отвечают ошибкой на запрос без авторизации. Для таких сервисов проверка доступности будет считать эндпоинт недоступным — используйте проверку ответа модели, она обращается к API с ключом.
  • Доступны уведомления о медленном ответе — чтобы заметить деградацию модели до полного отказа. Подробнее в статье Мониторинг медленных ответов.