Перейти к содержимому

Квоты и лимиты

В сервисе действуют квоты — ограничения организационного характера, которые можно изменить через обращение в техническую поддержку.

В GPT по умолчанию установлены следующие квоты:

Ограничение
Значение
Количество развернутых моделей в одном проекте10

Лимиты на количество запросов и токенов в минуту

Заголовок раздела «Лимиты на количество запросов и токенов в минуту»

Действуют два типа лимитов: на количество запросов в минуту и на суммарное количество входящих и исходящих токенов в минуту. Лимиты задаются глобально на модель и отдельно на деплоймент в проекте. Ограничения применяются по первому превышенному лимиту. При превышении лимита запрос возвращает HTTP код 429 (RATE_LIMITED). Вместе с успешными ответами и при ошибке превышения лимита приходят заголовки, описанные ниже.

ЗаголовокОписание
x-ratelimit-limit-requestsЛимит запросов в минуту
x-ratelimit-remaining-requestsОстаток лимита запросов
x-ratelimit-reset-requestsВремя до сброса лимита запросов
x-ratelimit-limit-tokensЛимит токенов в минуту
x-ratelimit-remaining-tokensОстаток лимита токенов
x-ratelimit-reset-tokensВремя до сброса лимита токенов