Рассуждения
Некоторые модели поддерживают режим рассуждений (reasoning) — встроенный механизм пошагового обдумывания задачи перед формированием ответа. В процессе рассуждения модель генерирует дополнительные токены рассуждения (reasoning tokens), которые не входят в итоговый ответ, но повышают его качество при решении сложных задач: логического вывода, математики, программирования и анализа.
Уровни рассуждения
Заголовок раздела «Уровни рассуждения»Параметр reasoning_effort управляет количеством токенов рассуждения, которые модель сгенерирует перед ответом:
| Значение | Описание |
|---|---|
none | Полностью отключает процесс рассуждений. Модель с поддержкой рассуждений работает как обычная чат-модель — быстро и без генерации токенов рассуждений |
low, minimal | Краткая цепочка рассуждений. Модель генерирует минимум токенов рассуждений и быстро формирует ответ. Подходит для простых задач, где не требуется глубокий анализ |
medium | Сбалансированный уровень рассуждений. Базовый уровень критического мышления, часто используется по умолчанию |
high | Высокий бюджет токенов рассуждения для сложных многошаговых рассуждений: математика, аудит кода, сложная логика. Модель тратит больше времени и токенов на обдумывание |
max | Наибольший доступный бюджет токенов рассуждения. Поддерживается только отдельными моделями |
Чем выше уровень, тем больше токенов рассуждения сгенерирует модель и тем выше стоимость запроса. Уровень рассуждений можно задавать для каждого запроса независимо.
Поддержка моделями
Заголовок раздела «Поддержка моделями»Доступные значения reasoning_effort зависят от модели. В колонке «По умолчанию» указано значение, которое используется, если не передавать параметр.
| Модель | none | low | medium | high | max | По умолчанию |
|---|---|---|---|---|---|---|
qwen3-6-35b-a3b | ✓ | — | ✓ | — | — | medium |
glm-5.2 | ✓ | — | — | ✓ | ✓ | high |
kimi-k2.6 | ✓ | ✓ | — | ✓ | — | high |
gemma-4-31b-it | ✓ | — | ✓ | — | — | medium |
gpt-oss-120b | — | ✓ | ✓ | ✓ | — | medium |
Использование в Chat Completions API
Заголовок раздела «Использование в Chat Completions API»В Chat Completions API уровень рассуждений задается опциональным параметром reasoning_effort в теле запроса.
Запрос без streaming
Заголовок раздела «Запрос без streaming»curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/chat/completions \ -H 'Content-Type: application/json' \ -H "Authorization: Bearer <API-ключ сервисного аккаунта с ролью gpt.inferencer>" \ -d '{ "model": "gpt-oss-120b", "reasoning_effort": "high", "messages": [ { "role": "user", "content": "В коробке 5 красных шаров и 3 синих. Из коробки достают 2 шара без возвращения. Какова вероятность, что оба шара красные?" } ] }' | jq .Запрос со streaming
Заголовок раздела «Запрос со streaming»При включенном stream: true модель сначала передает токены рассуждений в поле reasoning_content каждого чанка, а затем — итоговый ответ в поле content.
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/chat/completions \ -H 'Content-Type: application/json' \ -H "Authorization: Bearer <API-ключ сервисного аккаунта с ролью gpt.inferencer>" \ -d '{ "model": "gpt-oss-120b", "reasoning_effort": "high", "stream": true, "stream_options": { "include_usage": true }, "messages": [ { "role": "user", "content": "В коробке 5 красных шаров и 3 синих. Из коробки достают 2 шара без возвращения. Какова вероятность, что оба шара красные?" } ] }'Использование в Responses API
Заголовок раздела «Использование в Responses API»В Responses API уровень рассуждений задается опциональным параметром reasoning.effort.
Пример запроса
Заголовок раздела «Пример запроса»curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/responses \ -H 'Content-Type: application/json' \ -H "Authorization: Bearer <API-ключ сервисного аккаунта с ролью gpt.inferencer>" \ -d '{ "model": "gpt-oss-120b", "reasoning": { "effort": "high" }, "store": false, "input": "В коробке 5 красных шаров и 3 синих. Из коробки достают 2 шара без возвращения. Какова вероятность, что оба шара красные?" }' | jq .Тарификация
Заголовок раздела «Тарификация»Токены рассуждений тарифицируются как исходящие токены. Они включаются в общий объем completion_tokens (для Chat Completions API) или output_tokens (для Responses API) и тарифицируются по тем же правилам, что и токены итогового ответа.
Количество токенов рассуждений зависит от уровня рассуждений и сложности задачи. Повышение уровня увеличивает количество токенов рассуждений, что приводит к более длительному времени ответа и большей стоимости запроса.
Рекомендации
Заголовок раздела «Рекомендации»- Используйте
none, чтобы полностью отключить рассуждения — модель будет работать как обычная чат-модель, без генерации токенов рассуждений. Это самый быстрый и дешевый режим. - Используйте
low(minimal) для простых задач — коротких ответов, перевода, перефразирования. Модель сгенерирует краткую цепочку рассуждений, что снизит время ответа и стоимость. - Используйте
mediumдля задач средней сложности или когда важно соблюсти баланс между качеством и стоимостью. - Используйте
highдля задач, требующих многошагового логического вывода — математики, программирования, аудита кода, анализа данных, решения нестандартных задач. - Если уровень рассуждений не указан, то модель использует значение по умолчанию.