Перейти к содержимому

Текстовые модели

Текстовые модели принимают и возвращают текст. К ним относятся:

Для работы с API модели используют базовый URL:

http
https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1

Авторизация выполняется API-ключом сервисного аккаунта с ролью gpt.inferencer.

Список поддерживаемых моделей и их возможности приведены в разделе Доступные модели.

Чат-модели (Chat Completions API) генерируют ответ на основе списка сообщений (диалога).

Эндпоинт:

http
POST https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/chat/completions

Доступно два режима ответа модели:

  • Опция streaming отключена — модель возвращает ответ одним сообщением в формате json, без разбиения на части.
  • Опция streaming включена — модель возвращает ответ частями по мере генерации в формате Server-Sent Events (SSE).
ПараметрТипОписание
modelstringИдентификатор деплоймента с чат-моделью
messagesarrayСписок сообщений диалога. Каждое сообщение содержит поля role (system, user, assistant) и content — строка с текстом
streamboolean(опционально) Включить потоковую передачу ответа в формате SSE. По умолчанию false
stream_optionsobject(опционально) Опции потоковой передачи. При include_usage: true в последнем чанке возвращается статистика использования токенов. Используется только вместе с stream: true
max_completion_tokensinteger(опционально) Максимальное количество токенов в ответе модели
temperaturenumber(опционально) Управляет случайностью ответа: чем выше значение, тем более вариативный ответ. По умолчанию 1
reasoning_effortstring(опционально) Уровень рассуждения. Поддерживаемые значения зависят от модели и указаны в разделе Рассуждения
bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/chat/completions \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{
"role": "user", "content": "Привет!"
}
]
}' | jq .
Пользователям Windows

В PowerShell используйте curl.exe вместо curl и передавайте JSON-тело через файл. Подробности — в разделе Быстрый старт.

bash
{
"choices": [
{
"finish_reason": "stop",
"index": 0,
"logprobs": null,
"message": {
"content": "\n\nПривет! Чем могу помочь? 😊",
"refusal": null,
"role": "assistant"
}
}
],
"created": 1788217761,
"id": "a9a237da19164305964123abaf31b943",
"model": "qwen3-6-35b-a3b",
"object": "chat.completion",
"usage": {
"completion_tokens": 230,
"completion_tokens_details": {
"reasoning_tokens": 217
},
"prompt_tokens": 14,
"total_tokens": 244
}
}

В этом примере в поле usage:

  • prompt_tokens — количество входящих токенов запроса (токенов промпта).
  • completion_tokens — количество исходящих токенов, сгенерированных моделью (токенов ответа).

Входящие и исходящие токены тарифицируются отдельно.

bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/chat/completions \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-d '{
"model": "qwen3-6-35b-a3b",
"stream": true,
"stream_options": {
"include_usage": true
},
"messages": [
{
"role": "user", "content": "Привет!"
}
]
}'
bash
{"id":"f3cf1ccb41ea48a1b153222eae5c0402","created":1788217586,"model":"qwen3-6-35b-a3b","choices":[{"delta":{"content":"","role":"assistant"},"finish_reason":null,"index":0}],"object":"chat.completion.chunk"}
{"id":"f3cf1ccb41ea48a1b153222eae5c0402","created":1788217586,"model":"qwen3-6-35b-a3b","choices":[{"delta":{"reasoning_content":"Here"},"finish_reason":null,"index":0}],"object":"chat.completion.chunk"}
{"id":"f3cf1ccb41ea48a1b153222eae5c0402","created":1788217586,"model":"qwen3-6-35b-a3b","choices":[{"delta":{"reasoning_content":"'s"},"finish_reason":null,"index":0}],"object":"chat.completion.chunk"}
{"id":"f3cf1ccb41ea48a1b153222eae5c0402","created":1788217586,"model":"qwen3-6-35b-a3b","choices":[{"delta":{"reasoning_content":" a"},"finish_reason":null,"index":0}],"object":"chat.completion.chunk"}
{"id":"f3cf1ccb41ea48a1b153222eae5c0402","created":1788217586,"model":"qwen3-6-35b-a3b","choices":[{"delta":{"reasoning_content":" thinking"},"finish_reason":null,"index":0}],"object":"chat.completion.chunk"}
...
{"id":"f3cf1ccb41ea48a1b153222eae5c0402","created":1788217587,"model":"qwen3-6-35b-a3b","choices":[{"delta":{},"finish_reason":"stop","index":0}],"object":"chat.completion.chunk"}
{"id":"f3cf1ccb41ea48a1b153222eae5c0402","created":1788217587,"model":"qwen3-6-35b-a3b","choices":[],"usage":{"completion_tokens":212,"prompt_tokens":14,"total_tokens":226},"object":"chat.completion.chunk"}

В этом примере в поле usage:

  • prompt_tokens — количество входящих токенов запроса (токенов промпта).
  • completion_tokens — количество исходящих токенов, сгенерированных моделью (токенов ответа).

Входящие и исходящие токены тарифицируются отдельно.

Примечание

В ответе также присутствуют поля reasoning_content и completion_tokens_details.reasoning_tokens — они относятся к режиму рассуждений. Подробнее — в разделе Рассуждения.

Модели с поддержкой изображений могут обрабатывать изображения, переданные в сообщении пользователя. Признак поддержки отображается в таблице доступных моделей.

bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/chat/completions \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-d '{
"model": "kimi-k2-instruct",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Что на картинке?" },
{ "type": "image_url", "image_url": { "url": "https://mws.ru/uploads/grant_promo_banner_3fdd0964ae_730f25981e.png" } }
]
}
]
}' | jq .
bash
{
"choices": [
{
"finish_reason": "stop",
"index": 0,
"logprobs": null,
"message": {
"audio": null,
"content": " На картинке изображена **3D-иллюстрация**, представляющая облачную платформу. Основные элементы:\n\n- **Серебристо-белая структура** в виде модульного блока или сервера с выдвижными секциями слева, похожими на жёсткие диски или хранилища данных\n- **Ярко-красный прямоугольный модуль** с надписью белым текстом: **«MWS Cloud Platform»**\n- **Серебряная наградная розетка** с лентой, прикреплённая к красному модулю — символизирует качество, надёжность или премиальный статус платформы\n- **Плоские серебристые панели** внизу, возможно, имитирующие интерфейс или дополнительные модули\n\nОбщий стиль — современный, минималистичный, с глянцевыми поверхностями и мягкими тенями. Изображение, вероятно, является частью корпоративного брендинга для облачной платформы MWS.",
"refusal": null,
"role": "assistant"
}
}
],
"created": 1777483458,
"id": "chatcmpl-be7b6c068b5c871d",
"model": "kimi-k2-instruct",
"object": "chat.completion",
"usage": {
"completion_tokens": 298,
"prompt_tokens": 1282,
"total_tokens": 1580
}
}

Модель принимает текст или список текстов и возвращает их векторные представления. Используется для семантического поиска, кластеризации и построения RAG-систем.

Эндпоинт:

http
POST https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/embeddings
ПараметрТипОписание
modelstringИдентификатор деплоймента с моделью эмбеддингов
inputstringarray<string>
bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/embeddings \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-d '{
"model": "bge-m3",
"input": "Привет!"
}' | jq .
bash
{
"data": [
{
"embedding": [0.0123, -0.0456, 0.0789, "..."],
"index": 0,
"object": "embedding"
}
],
"model": "bge-m3",
"object": "list",
"usage": {
"prompt_tokens": 5,
"total_tokens": 5
}
}

В этом примере:

  • data — массив векторных представлений. Каждый элемент содержит:
    • embedding — векторное представление текста;
    • index — индекс текста в исходном массиве input, которому соответствует вектор;
  • usage — статистика использования токенов: prompt_tokens — количество входящих токенов, total_tokens — общее количество токенов.

Входящие токены тарифицируются отдельно.