# Мониторинг ИИ-моделей

Проверка доступности ИИ-эндпоинта и того, что модель действительно отвечает

> Индекс всей документации в markdown: https://statuser.cloud/llms.txt — там перечислены остальные статьи. Всё одним файлом: https://statuser.cloud/llms-full.txt. Документация API: https://statuser.cloud/api-reference.md

## Доступность по тарифам

Доступно в тарифах Pro и Team

| Функция | Free | Pro | Team |
| --- | --- | --- | --- |
| Мониторинг ИИ-моделей | нет | да | да |
| Проверка ответа ИИ-модели | нет | нет | да |

Сам тип мониторинга доступен с тарифа Pro и проверяет доступность эндпоинта. Проверка ответа модели требует вашего API-ключа и подключается на тарифе Team.

Сравнение тарифов: https://statuser.cloud/pricing

## Через API и MCP

Описанное в статье можно сделать программно — запросом к публичному API или через MCP-сервер Statuser, который работает поверх того же API. Понадобится API-ключ, создать его можно на любом тарифе; ограничения тарифа в API те же, что в интерфейсе.

- Документация API: https://statuser.cloud/api-reference (машиночитаемо: https://statuser.cloud/api-reference.md)
- MCP-сервер: https://github.com/statuser-cloud/mcp

---

Statuser следит не только за тем, что ваш ИИ-сервис отвечает, но и за тем, что модель за ним действительно работает. Обычной HTTP-проверки здесь часто недостаточно: гейтвей может отдавать **200** на любой запрос, пока модель недоступна, перегружена или упёрлась в лимит запросов.

## Как включить

При добавлении сервера выберите тип мониторинга **ИИ-модель** и укажите:

- **Эндпоинт** — адрес вашего API, например `https://api.openai.com/v1` или адрес своего гейтвея. Путь до метода Statuser подставит сам.
- **Формат API** — **OpenAI-совместимый** или **Anthropic-совместимый**, в зависимости от интерфейса вашего сервиса.

Адрес вы указываете сами, поэтому подходят и официальное API провайдера, и модель, развёрнутая у вас, и корпоративный прокси или гейтвей.

Чтобы проверять ещё и ответ модели, включите тумблер **«Проверять ответ модели»** и добавьте API-ключ и название модели.

## Как работает проверка

### Проверка доступности

Без API-ключа Statuser запрашивает у эндпоинта список моделей. Ответ с требованием авторизации тоже считается успехом: он означает, что сервис на месте. Токены не расходуются.

### Проверка ответа модели

_Доступно в тарифе Team_

С API-ключом Statuser отправляет модели запрос на **один токен** и ждёт ответ. Если эндпоинт вернул **200**, но ответа модели в нём нет, проверка помечается неудачной.

Исключение — модели **o-серии и gpt-5**: их API не принимает лимит меньше **16 токенов**, потому что бюджет ответа тратится сначала на скрытые рассуждения. Для таких моделей проверка подтверждает, что гейтвей принял ключ и модель отработала запрос, но текст ответа при таком лимите остаётся пустым. Точный расход по вашей модели покажет калькулятор в форме монитора. Моделей других вендоров это не касается, даже рассуждающих: у них проверка стоит один токен.

Ответ **429** (превышен лимит запросов) считается недоступностью: упёршийся в лимит эндпоинт непригоден для вашего приложения так же, как и лежащий. Код ошибки видно в карточке инцидента, поэтому лимит легко отличить от сбоя провайдера.

Причину Statuser называет так, чтобы было понятно, где чинить. Если на балансе провайдера закончились средства, инцидент скажет об этом прямо — этот случай не спутать с лимитом запросов, хотя некоторые провайдеры сообщают о нём тем же кодом **429**. Отклонённый API-ключ тоже показывается отдельной причиной.

> Название модели можно выбрать из списка — Statuser запросит его у провайдера
> по вашему ключу. Если список получить не удалось, введите название вручную: на
> работу проверок это не влияет.

## Расход токенов

Проверка ответа модели обращается к платному API, и токены списываются с вашего ключа. Одна проверка расходует **1 исходящий токен** и **от 10 до 100 входящих** — провайдеры добавляют к запросу служебную обвязку, и её объём у всех разный. Проверки идут из каждого выбранного региона, поэтому расход умножается на их количество: раз в 5 минут из трёх регионов — это около **26 тысяч проверок в месяц**.

Оценить, во сколько это обойдётся по ценам вашего провайдера, можно прямо в форме мониторинга — кнопкой **«Рассчитать примерный расход»**.

> **Важно**
> Для мониторинга лучше завести **отдельный API-ключ с лимитом расходов** на
> стороне провайдера. Так неожиданный счёт невозможен, а ключ можно отозвать, не
> затрагивая продакшн.

Statuser и сам следит за расходом: если запросов уходит заметно больше, чем предполагает расписание, проверка ответа модели отключается на 12 часов. Мониторинг при этом не прерывается — монитор продолжает следить за доступностью эндпоинта, ключ остаётся на месте, и через 12 часов проверка ответа включается сама.

## Выбор регионов

Инцидент открывается, только когда сбой подтвердили все выбранные регионы — так Statuser защищает от [ложных срабатываний](/docs/false-positives).

Поэтому если провайдер недоступен из части регионов, эти регионы нужно **убрать** из проверки, а не добавлять к ним другие. Например, официальные API OpenAI и Anthropic не отвечают на запросы из России — для них оставьте только регионы вне РФ или укажите адрес своего прокси.

## Что важно учитывать

- **Ключ хранится в зашифрованном виде** и используется только для проверок этого монитора. Обратно он не выдаётся: в панели управления и в API видна только маска вида `sk-…lyfQ`, а в команде для воспроизведения запроса из инцидента ключ заменён заглушкой.
- **Удалить ключ можно в любой момент** — выключите проверку ответа модели, и монитор вернётся к проверке доступности эндпоинта.
- **Некоторые провайдеры отвечают ошибкой на запрос без авторизации.** Для таких сервисов проверка доступности будет считать эндпоинт недоступным — используйте проверку ответа модели, она обращается к API с ключом.
- **Доступны уведомления о медленном ответе** — чтобы заметить деградацию модели до полного отказа. Подробнее в статье [Мониторинг медленных ответов](/docs/slow-response-monitoring).

---

Источник: https://statuser.cloud/docs/llm-monitoring
