Квоты и лимиты
В сервисе действуют квоты — ограничения организационного характера, которые можно изменить через обращение в техническую поддержку.
В GPT по умолчанию установлены следующие квоты:
Ограничение | Значение |
|---|---|
| Количество развернутых моделей в одном проекте | 10 |
Лимиты на количество запросов и токенов в минуту
Заголовок раздела «Лимиты на количество запросов и токенов в минуту»Действуют два типа лимитов: на количество запросов в минуту и на суммарное количество входящих и исходящих токенов в минуту. Лимиты задаются глобально на модель и отдельно на деплоймент в проекте. Ограничения применяются по первому превышенному лимиту. При превышении лимита запрос возвращает HTTP код 429 (RATE_LIMITED). Вместе с успешными ответами и при ошибке превышения лимита приходят заголовки, описанные ниже.
| Заголовок | Описание |
|---|---|
x-ratelimit-limit-requests | Лимит запросов в минуту |
x-ratelimit-remaining-requests | Остаток лимита запросов |
x-ratelimit-reset-requests | Время до сброса лимита запросов |
x-ratelimit-limit-tokens | Лимит токенов в минуту |
x-ratelimit-remaining-tokens | Остаток лимита токенов |
x-ratelimit-reset-tokens | Время до сброса лимита токенов |