Перейти к содержимому

Reranker-модели

Reranker-модели пересортировывают список документов по релевантности запросу. Используются в RAG-пайплайнах как второй шаг после первичного поиска (например, по эмбеддингам). Модель получает запрос и набор кандидатов, и возвращает тот же набор с оценками релевантности для каждого кандидата.

Для работы с API модели используют базовый URL:

http
https://gpt.mwsapis.ru/projects/<имя проекта>/cohere/v2

Авторизация выполняется API-ключом сервисного аккаунта с ролью gpt.inferencer.

Поддерживаемые модели и их характеристики приведены в разделе Доступные модели.

Эндпоинт принимает запрос пользователя с набором документов:

http
POST https://gpt.mwsapis.ru/projects/<имя проекта>/cohere/v2/rerank

Модель возвращает документы, упорядоченные по убыванию релевантности, вместе с оценкой relevance_score.

ПараметрТипОписание
modelstringИдентификатор деплоймента с Reranker-моделью
querystringЗапрос, относительно которого оценивается релевантность
documentsarray<string>Список документов-кандидатов. Максимальный суммарный объем зависит от контекстного окна модели
top_ninteger(опционально) Вернуть только top_n наиболее релевантных документов. Если не указан, возвращаются все документы
bash
curl https://gpt.mwsapis.ru/projects/<имя проекта>/cohere/v2/rerank \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer <API-ключ сервисного аккаунта sa-inferencer>" \
-d '{
"model": "bge-reranker-v2-m3",
"query": "Какие модели поддерживают изображения?",
"documents": [
"GPT Model Hub поддерживает чат-модели, эмбеддинги, ASR и TTS.",
"Модель kimi-k2-instruct умеет обрабатывать изображения, переданные в сообщении пользователя.",
"Для распознавания речи используется whisper-large-v3 и qwen3-asr-1.7b."
],
"top_n": 2
}' | jq .
bash
{
"id": "score-3437d19c-ef09-44cb-ab39-55523ff97d04",
"results": [
{
"index": 1,
"relevance_score": 0.17276334762573242
},
{
"index": 0,
"relevance_score": 0.036736227571964264
}
],
"meta": {
"api_version": {
"is_experimental": false,
"version": "2"
},
"tokens": {
"input_tokens": 99
}
}
}

В этом примере:

  • index — позиция документа в исходном массиве documents.
  • relevance_score — оценка релевантности документа запросу. Чем выше значение, тем релевантнее документ.

Документы в ответе уже отсортированы по убыванию relevance_score, поэтому для использования результата в RAG-пайплайне достаточно взять первые top_n элементов.