Перейти к содержимому

Аудио-модели (ASR/TTS)

Аудио-модели работают со звуком:

  • ASR (Automatic Speech Recognition) — распознают речь и преобразуют ее в текст;
  • TTS (Text-to-Speech) — синтезируют речь из текста.

Для работы с API модели используют базовый URL:

http
https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1

Авторизация выполняется API-ключом сервисного аккаунта с ролью gpt.inferencer.

Список поддерживаемых моделей и их возможности приведены в разделе Доступные модели.

Модели распознавания речи принимают аудиофайл и возвращают его текстовую расшифровку.

Эндпоинт принимает запрос в формате multipart/form-data:

http
POST https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/transcriptions
ПараметрТипОписание
filefileАудиофайл в одном из поддерживаемых форматов: mp3, wav, flac, ogg
modelstringИдентификатор деплоймента с ASR моделью
languagestring(опционально) Код языка в формате ISO-639-1, например ru. Если не указан, язык определяется автоматически
response_formatstring(опционально) Формат ответа: json (по умолчанию), text, verbose_json
bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/transcriptions \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-H "Content-Type: multipart/form-data" \
-F file="@./sample.mp3" \
-F model="qwen3-asr-1-7b" \
-F language="ru" \
-F response_format="json" | jq .
bash
{
"text": "Привет! Это пример расшифровки аудиофайла.",
"usage": {
"seconds": 5
}
}

Чтобы сохранить результат в файл, укажите параметр -o:

bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/transcriptions \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-H "Content-Type: multipart/form-data" \
-F file="@./sample.mp3" \
-F model="whisper-large-v3" \
-F response_format="text" \
-o transcription.txt

Модели синтеза речи принимают текст и возвращают аудиофайл.

Эндпоинт для синтеза речи:

http
POST https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/speech
ПараметрТипОписание
modelstringИдентификатор деплоймента с TTS моделью
inputstringТекст, который нужно озвучить. Максимальная длина — 4096 символов
voicestringГолос для озвучивания. Доступные варианты для каждой модели указаны в таблице ниже
response_formatstring(опционально) Формат выходного аудио: mp3 (по умолчанию), wav, flac
speednumber(опционально) Скорость речи, от 0.25 до 4.0. Значение по умолчанию — 1.0
МодельГолоса
qwen3-tts-12hz-1.7b-custom-voiceaiden, dylan, eric, ono_anna, ryan, serena, sohee, uncle_fu, vivian
bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1/audio/speech \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-d '{
"model": "qwen3-tts-12hz-1-7b-custom-voice",
"input": "Привет! Это пример синтеза речи.",
"voice": "aiden",
"response_format": "mp3",
"speed": 1.0
}' \
--output speech.mp3

В результате выполнения команды будет создан файл speech.mp3 с озвученным текстом.