«Рег.облако» запустил ИИ-инференс на видеокартах Nvidia B300
«Рег.облако», облачная платформа компании Рег.ру, запустило инференс ИИ-моделей на видеокартах Nvidia B300 поколения Blackwell Ultra и B200. Модели работают внутри российской инфраструктуры провайдера, оплата идёт токенами в рублях, а запросы не передаются внешним ИИ-сервисам.
Что произошло
«Рег.облако» развернуло в своём публичном облаке новые ускорители Nvidia B300 (поколение Blackwell Ultra) и B200. В конфигурации HGX B300 восемь ускорителей объединяют более 2 ТБ памяти HBM3E — такие системы рассчитаны на инференс больших языковых моделей, в том числе «рассуждающих» и агентных, с тяжёлой нагрузкой.
Доступ устроен как управляемый сервис: около 40 моделей подключаются через единый интерфейс и API, а оплата идёт токенами в рублях за фактическое потребление. Провайдер подчёркивает, что запросы к моделям не уходят за пределы его инфраструктуры и не передаются внешним ИИ-провайдерам; по данным компании, платформой уже воспользовались более тысячи клиентов. Это отдельная история от обычной аренды GPU-серверов и серверов под AI/ML: здесь вы платите за готовые модели, а не за видеокарту целиком.
Почему современные видеокарты в дефиците
Директор по информационным технологиям «Рег.облака» Евгений Мартынов отметил, что новые GPU сейчас трудно получить быстро: сроки поставок растут, оборудование дорожает, а доступность свежих поколений ограничена. Компания сообщила, что получила партии B200 и B300, которых хватает на расширение предложения клиентам.
Это тот же дефицит вычислительного «железа», о котором мы писали раньше: спрос со стороны ИИ оттягивает на себя и оперативную память, и ускорители, а цены идут вверх по всему рынку. Для провайдеров наличие актуальных карт становится конкурентным преимуществом, а для клиентов — поводом заранее уточнять, какое поколение GPU стоит за тарифом.
Что это значит, если вы выбираете сервер
Сначала определитесь с форматом. Управляемый инференс по токенам удобен, когда нужен быстрый доступ к готовым моделям без администрирования: вы платите за объём запросов и не занимаетесь настройкой. Если же вы запускаете собственную модель или нужен полный контроль над окружением, ближе аренда сервера с видеокартой с почасовой или помесячной оплатой.
Если инференс или обучение должны оставаться в российском контуре — например, из-за требований к данным — обращайте внимание на то, где физически стоят карты и куда уходят запросы. Вариант с оплатой в рублях и хранением данных внутри инфраструктуры РФ закрывает этот вопрос; сравнить такие предложения помогает подборка по серверам в России.
И смотрите на поколение GPU. Blackwell (B200/B300) — свежие карты для тяжёлого инференса, но из-за дефицита они есть не у всех и стоят дороже; для менее требовательных задач подойдут и прошлые поколения. Главное — сопоставлять конкретную модель видеокарты, объём видеопамяти и цену, а не ориентироваться только на слово «GPU» в названии тарифа. Как это делать, мы разбираем в подборке серверов под AI/ML.
Источник: CNews
Не уверены, какой сервер нужен
Пять параметров в калькуляторе — и провайдеры отсортированы под вашу задачу: ресурсы, география, бюджет.
Открыть калькулятор →