Аудио-модели (ASR/TTS)
Аудио-модели работают со звуком:
- ASR (Automatic Speech Recognition) — распознают речь и преобразуют ее в текст;
- TTS (Text-to-Speech) — синтезируют речь из текста.
Для работы с API модели используют базовый URL:
https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1Авторизация выполняется API-ключом сервисного аккаунта с ролью gpt.inferencer.
Список поддерживаемых моделей и их возможности приведены в разделе Доступные модели.
Распознавание речи (ASR)
Заголовок раздела «Распознавание речи (ASR)»Модели распознавания речи принимают аудиофайл и возвращают его текстовую расшифровку.
Эндпоинт принимает запрос в формате multipart/form-data:
POST https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/transcriptionsПараметры запроса
Заголовок раздела «Параметры запроса»| Параметр | Тип | Описание |
|---|---|---|
file | file | Аудиофайл в одном из поддерживаемых форматов: mp3, wav, flac, ogg |
model | string | Идентификатор деплоймента с ASR моделью |
language | string | (опционально) Код языка в формате ISO-639-1, например ru. Если не указан, язык определяется автоматически |
response_format | string | (опционально) Формат ответа: json (по умолчанию), text, verbose_json |
Пример запроса
Заголовок раздела «Пример запроса»curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/transcriptions \ -H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \ -H "Content-Type: multipart/form-data" \ -F file="@./sample.mp3" \ -F model="qwen3-asr-1-7b" \ -F language="ru" \ -F response_format="json" | jq .Чтобы сохранить результат в файл, укажите параметр -o:
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/transcriptions \ -H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \ -H "Content-Type: multipart/form-data" \ -F file="@./sample.mp3" \ -F model="whisper-large-v3" \ -F response_format="text" \ -o transcription.txtСинтез речи (TTS)
Заголовок раздела «Синтез речи (TTS)»Модели синтеза речи принимают текст и возвращают аудиофайл.
Эндпоинт для синтеза речи:
POST https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/speechПараметры запроса
Заголовок раздела «Параметры запроса»| Параметр | Тип | Описание |
|---|---|---|
model | string | Идентификатор деплоймента с TTS моделью |
input | string | Текст, который нужно озвучить. Максимальная длина — 4096 символов |
voice | string | Голос для озвучивания. Доступные варианты для каждой модели указаны в таблице ниже |
response_format | string | (опционально) Формат выходного аудио: mp3 (по умолчанию), wav, flac |
speed | number | (опционально) Скорость речи, от 0.25 до 4.0. Значение по умолчанию — 1.0 |
Голоса для озвучивания
Заголовок раздела «Голоса для озвучивания»| Модель | Голоса |
|---|---|
qwen3-tts-12hz-1.7b-custom-voice | aiden, dylan, eric, ono_anna, ryan, serena, sohee, uncle_fu, vivian |
Пример запроса
Заголовок раздела «Пример запроса»curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/speech \ -H 'Content-Type: application/json' \ -H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \ -d '{ "model": "qwen3-tts-12hz-1-7b-custom-voice", "input": "Привет! Это пример синтеза речи.", "voice": "aiden", "response_format": "mp3", "speed": 1.0 }' \ --output speech.mp3В результате выполнения команды будет создан файл speech.mp3 с озвученным текстом.