Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Купить втридорога. Стоимость запуска LLM в России поднялась за последний год в 2,8 раза

Дата публикации: 19-08-2026 23:30:00

СредСредняя стоимость минимального набора ускорителей Nvidia для запуска одной большой языковой модели (LLM) выросла в 2,8 раза - с 13,7 млн руб. в 2025 г. до 38,8 млн руб. в 2026 г. К таким выводам пришла MWS Cloud (входит в МТС Web Services), проанализировав требования ...

Основное содержимое страницы с новостью.

В анализ вошли популярные открытые модели, выпущенные весной и летом 2026 г. Для 2025 г. рассматривались такие LLM как Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 г. - Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.

Расчет сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.

Новые LLM становятся более мощными: они лучше справляются со сложными задачами и могут учитывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растет и стоимость самих видеокарт, поэтому развертывание моделей обходится дороже.

Рейтинг моделей по стоимости запуска в 2025 г.:

  • Kimi K2 (1 трлн параметров, 32 млрд активных) - 8 × H200 141 ГБ, ~35 млн руб.
  • Qwen3 (235 млрд, 22 млрд активных) - 4 × H200 141 ГБ, ~18 млн руб.
  • GLM-4.5V (106 млрд, 12 млрд активных) - 4 × H100 80 ГБ, ~15 млн руб.
  • Gemma 3 (27 млрд) - 2 × H100 80 ГБ, ~7,5 млн руб.
  • gpt-oss (117 млрд, 5,1 млрд активных) - 1 × H100 80 ГБ, >3,5 млн руб.
  • Cotype Pro 2 (32 млрд) - 1 × A100 80 ГБ, ~3 млн руб.

Рейтинг моделей по стоимости запуска в 2026 г.:

  • Kimi K3 (2,8 трлн, 104 млрд активных) - 8 × B300 288 ГБ, ~80 млн руб.
  • Qwen3.5 (397 млрд, 17 млрд активных) - 8 × H200 141 ГБ, ~55 млн руб.
  • DeepSeek-V4-Pro (1,6 трлн, 49 млрд активных) - 8 × H200 141 ГБ, ~55 млн руб.
  • GLM-5.2 (744 млрд, ~40 млрд активных) - 8 × H200 141 ГБ, ~55 млн руб.
  • DeepSeek-V4-Flash (284 млрд, 13 млрд активных) - 1 × B300 288 ГБ, ~10 млн руб.
  • Gemma 4 (31 млрд) - 2 × H100 80 ГБ, ~7,5 млн руб.
  • Cotype Pro 3 (27 млрд) - 1 × A100 80 ГБ, ~3 млн руб.

Во втором полугодии 2026 г. соучредитель и директор по закупкам ООО "Бергер" (бренды ServerICT, Bergerus) Сергей Миневич не ожидает возврата к прежним ценам: "В базовом сценарии стоимость доступных ускорителей может увеличиться еще на 10-25%. Для H200 диапазон $75-90 тыс., а для RTX PRO 6000 Server Edition - $28-35 тыс. выглядит реалистичным, особенно для срочных поставок и небольших партий".

Директор центра развития ИИ-продуктов ИТ-экосистемы "Лукоморье" (ООО "РТК ИТ Плюс") Денис Романов согласился с тем, что Cotype Pro 3 выделяется в приведенном рейтинге - и это одновременно и преимущество, и маркер текущего положения дел: "С одной стороны, возможность запускать модель за 3 млн руб. на одном A100 - это мощное конкурентное преимущество для российского бизнеса, которому не нужны сверхтяжелые архитектуры. Cotype Pro 3 - это 27 млрд параметров, мультимодальная модель, специализирующаяся на агентских сценариях. Она показывает 92,2% успешного выполнения задач в корпоративных бенчмарках - это очень достойный результат для инференса и промышленных ИИ-агентов".

Директор департамента прикладных решений ООО "Ланит-Терком" (входит в ГК "Ланит") Дмитрий Медведев предположил, что низкие требования Cotype Pro 3 к инфраструктуре сами по себе скорее являются преимуществом. "Качество модели необходимо оценивать на конкретных задачах, а не по количеству GPU или количеству параметров. Для бизнеса зачастую важнее получить необходимое качество при существенно меньшей стоимости развертывания и эксплуатации", - сказал Дмитрий Медведев.

Технический директор ООО "МД Аудит" (MD Audit, входит в ГК Softline) Юрий Тюрин рассказал, что низкая стоимость запуска не говорит ни о преимуществе, ни об отставании модели. В исследовании MWS Cloud сравнивается прежде всего инфраструктурная требовательность, а именно сколько ускорителей необходимо, чтобы загрузить модель и обработать запрос заданного размера. "Сравнивать нужно одновременно качество, размер модели, производительность, стоимость инференса и требования к инфраструктуре. Поэтому Cotype Pro 3 я бы рассматривал как пример оптимизации под доступные российскому бизнесу ресурсы. Если при меньшей стоимости модель обеспечивает нужное качество для корпоративных сценариев, то это большое преимущество. Если снижение требований к инфраструктуре достигнуто ценой существенного отставания по качеству, то это уже ограничивает ее применимость. Сам рейтинг MWS Cloud такого вывода сделать не позволяет", - пояснил Юрий Тюрин.

Генеральный директор MWS Павел Воронин отметил, что цены на GPU в России во многом зависят от мирового рынка: "Глобальная гонка в области ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По данным исследования MWS Cloud, 47% респондентов ожидают удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет расти, - сказал Павел Воронин. - Развертывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования перестает окупаться, компании выбирают более компактные модели, оптимизируют вычисления или переходят в облако. Один из индикаторов этого сдвига - рост облачного потребления ИИ-моделей".

Директор по развитию ООО "Ф-Лайн Софтвер" ("Формат кода") и руководитель направления ИИ Александр Жуков отметил, что для корпоративного сегмента РФ критичны on-premise развертывание, безопасность данных и предсказуемая стоимость владения (в отличие от западных моделей, ориентированных на облака и SaaS). "Компактная и дешевая в эксплуатации модель зачастую ценнее гигантской, требующей десятков GPU", - пояснил Александр Жуков.

Ведущий инженер-аналитик лаборатории технологий искусственного интеллекта аналитического центра кибербезопасности ООО "Газинформсервис" Ирина Меженева также отметила, что для подавляющего большинства задач, которые возникают у бизнеса, в том числе с точки зрения информационной безопасности, модель на сотни миллиардов параметров чаще всего избыточна: "Она требует дорогой и дефицитной инфраструктуры, медленнее отвечает, ее сложнее контролировать, а прирост качества на конкретной узкой задаче далеко не всегда оправдывает такие издержки. Для практического применения рациональнее компактная модель, которую можно развернуть в контуре, держать под контролем потоки данных и дообучать под свою специфику".

Директор ИИ-вертикали АО "Селектел" (Selectel) Александр Тугов отметил, что NVIDIA по-прежнему остается лидером по глубине интеграции и зрелости экосистемы: "Китайские и другие альтернативные платформы за последние годы совершили значительный рывок, однако по совокупности зрелости экосистемы они все еще немного отстают. Поэтому переход на новые альтернативные GPU требует дополнительных усилий: адаптации кода, отладки неочевидных проблем совместимости и переподготовки команды".

Коммерческий директор ООО "Рексофт" Антон Спирин считает, что китайские GPU определенно увеличивают доступность инфраструктуры, особенно с учетом стоимости и сложности в логистике до РФ серверов Nvidia: "В период дефицита важен любой дополнительный канал поставок. С точки зрения эксплуатации китайские GPU проигрывают Nvidia в скорости обработки информации и по ряду других параметров, следовательно, область их применения ограничена. Но ИИ-архитектура каждого крупного заказчика насчитывает от 30 до 300 инсталляций моделей, при этом задачи делятся как просто считывание данных (инференс), так и обучение моделей. Наша работа как профильных экспертов и консультантов в этой области заключается в анализе бизнес-задач клиента и выработке стратегии построения инфраструктуры, в которой возможен гибрид, состоящий из облачных ресурсов, китайских GPU и Nvidia GPU".

Заместитель руководителя направления "Т1 ИИ" (ИТ-холдинг Т1) Сергей Карпович поведал, что китайские GPU уже обеспечивают необходимую базу для развертывания ИИ-инфраструктуры: "Хотя экосистема программного обеспечения (аналоги CUDA) у них менее зрелая, мы активно занимаемся развитием ПО под подобные технологии. Краткосрочно переход может замедлить эксперименты из-за необходимости формирования специализированных команд и адаптации софта. Однако долгосрочно это стимулирует независимость и инновации".

Старший партнер ООО "ГК Энсайн" Алексей Постригайло видит, что с китайскими ускорителями простая замена производителя оборудования не получится: "Вокруг Nvidia за годы сформировалась большая программная среда, к которой привыкли разработчики. При переходе на другую платформу часть решений придется адаптировать. Затем потребуется заново проверить совместимость и производительность. На первом этапе это добавит работы и может замедлить внедрение. В перспективе появление нескольких доступных аппаратных платформ полезно для российского рынка. Зависимость от одного производителя снижается, а у разработчиков появляется больше вариантов для развития решений".

https://www.comnews.ru/content/246888/2026-08-14/2026-w33/1008/rossiyskie-kompanii-massovo-pereshli-kitayskie-llm

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1В России зафиксирован почти трехкратный рост стоимости внедрения ИИ115.1719-08-2026
2В России зафиксирован почти трехкратный рост стоимости внедрения ИИ115.1719-08-2026
3В России зафиксирован почти трехкратный рост стоимости внедрения ИИ115.1719-08-2026
4«М.Видео»: в России стали чаще покупать ноутбуки дороже 50 тыс. рублей0520-07-2026
5Минобрнауки: стоимость обучения в вузах РФ в 2025 году выросла на 12%0007-07-2025
6M1Cloud: какие специалисты востребованы на облачном рынке в 2026 году0519-06-2026
7Компании в США начали переходить на китайские модели ИИ08.2226-07-2026
8Аналитики прогнозируют рост рынка ИИ в России до 830 млрд рублей к 2030 году120.0110-08-2026
9Как оптимизировать расходы на инфраструктуру для искусственного интеллекта. Выбираем железо и модели под разные задачи013.0212-08-2026

Классификация: Экономика. Схожих патентов: 0. Схожих новостей: 9. Тональность: 0. Информативность: 13.97. Источник: www.comnews.ru.