В анализ вошли популярные открытые модели, выпущенные весной и летом соответствующего года. Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 года — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.

Расчёт сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.

ГодНаиболее популярный GPUДругие GPU
2025H100 — для трёх из шести моделейH200 — для двух моделей; A100 — для одной
2026H200 — для трёх из семи моделейB300 — для двух моделей; H100 и A100 — ещё для двух

 

Рейтинг моделей по стоимости запуска в 2025 году

МестоМодельКоличество параметровМинимальная конфигурацияСтоимость
1Kimi K21 трлн (32 млрд активных)8 × H200 141 ГБпримерно 35 млн рублей
2Qwen3235 млрд (22 млрд активных)4 × H200 141 ГБпримерно 18 млн рублей
3GLM-4.5V106 млрд (12 млрд активных)минимум 4 × H100 80 ГБпримерно 15 млн рублей
4Gemma 327 млрд2 × H100 80 ГБпримерно 7,5 млн рублей
5gpt-oss117 млрд (5,1 млрд активных)1 × H100 80 ГБболее 3,5 млн рублей
6Cotype Pro 232 млрд1 × A100 80 ГБпримерно 3 млн рублей

 

Рейтинг моделей по стоимости запуска в 2026 году

МестоМодельКоличество параметровМинимальная конфигурацияСтоимость
1Kimi K32,8 трлн (104 млрд активных)8 × B300 288 ГБпримерно 80 млн рублей
2Qwen3.5397 млрд (17 млрд активных)8 × H200 141 ГБпримерно 55 млн рублей
2DeepSeek-V4-Pro1,6 трлн (49 млрд активных)8 × H200 141 ГБпримерно 55 млн рублей
2GLM-5.2744 млрд (около 40 млрд активных)8 × H200 141 ГБпримерно 55 млн рублей
5DeepSeek-V4-Flash284 млрд (13 млрд активных)1 × B300 288 ГБпримерно 10 млн рублей
6Gemma 431 млрд2 × H100 80 ГБпримерно 7,5 млн рублей
7Cotype Pro 327 млрд1 × A100 80 ГБпримерно 3 млн рублей

 

Новые LLM становятся более мощными: они лучше справляются со сложными задачами и могут учитывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже.

Отдельно MWS Cloud оценила возможные конфигурации на китайских ускорителях Huawei Ascend 910B. Возможность запуска на них подтверждена не для всех рассмотренных LLM: в выборке 2025 года подтверждение есть для трёх из шести моделей, в 2026 году — для пяти из семи.

Среди моделей с подтверждённой или экспериментально подтверждённой поддержкой Huawei в 2025 году в среднем требовалось 10,7 ускорителя Ascend 910B, а в 2026 году — 13,6. Официальной цены на данные GPU нет, но, по оценкам, она может составлять от половины до двух третей стоимости сопоставимых GPU Nvidia.

Цены на GPU в России во многом зависят от мирового рынка: глобальная гонка в области ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По данным исследования MWS Cloud, 47% респондентов ожидают удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет расти. Развёртывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования перестаёт окупаться, компании выбирают более компактные модели, оптимизируют вычисления или переходят в облако, где можно платить только за фактически используемые мощности. Один из индикаторов этого сдвига — рост облачного потребления ИИ-моделей: по оценке MWS Cloud, в первом полугодии 2026 года потребление китайских LLM российскими компаниями на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз превысило показатель за весь 2025 год
Павел Воронин
Павел Воронин
Генеральный директор МТС Web Services
Поделиться

Похожие новости

Напишите нам

Обсудим все детали и разработаем план действий по внедрению цифровых продуктов для вашего бизнеса

Ваше имя
name@yourcompany.com
+7 (999) 999-99-99
Компания
Москва