Как обучить крупную языковую модель без выгрузки на диск | HYPERPC | ПромоСтраницы
Добавить в корзинуПозвонить
Добавить в корзинуПозвонить
Как обучить крупную языковую модель без выгрузки на диск

564 ГБ видеопамяти HBM3e на четырёх NVIDIA H200. Это объём, на котором обучаются самые крупные открытые языковые модели целиком. Дальше — про вычислительный комплекс на 4U-платформе с NVLink-мостами и сетью на 25 Гбит/с.

Что было до: обучение крупных моделей упирается в видеопамять

Клиент работает с обучением больших языковых моделей и аналитикой больших данных. Профиль нагрузки — длительные циклы обучения и многомерные расчёты на больших наборах данных, которые требуют значительной совокупной видеопамяти.

На предыдущих поколениях видеокарт с памятью по 32–80 ГБ крупные модели приходилось разбивать на части и обучать по фрагментам с сохранением промежуточных состояний на диск. Это длинно и неэффективно — большая часть времени уходит на обмен с накопителями.

Требование к проекту — серверный комплекс на флагманских ускорителях, способный держать крупные модели целиком в совокупной видеопамяти и работать круглосуточно без перерывов.

Как обучить крупную языковую модель без выгрузки на диск
Как обучить крупную языковую модель без выгрузки на диск

Четыре NVIDIA H200: 564 ГБ HBM3e в едином пуле

В системе установлены четыре NVIDIA H200. У каждой по 141 ГБ памяти HBM3e — суммарно 564 ГБ совокупного объёма. На этом объёме большие языковые модели обучаются целиком, без выгрузки промежуточных весов на диск.

HBM3e — это память, физически распаянная на самом ускорителе с высокой пропускной способностью. Для обучения моделей это даёт быстрый доступ к параметрам в каждый момент времени и снимает узкое место, типичное для обычных видеокарт.

Как обучить крупную языковую модель без выгрузки на диск
Как обучить крупную языковую модель без выгрузки на диск

NVLink-мосты: обмен данными между ускорителями

При параллельном обучении модели на нескольких видеокартах критичен обмен данными между ними. Через стандартную шину PCIe такой обмен ограничен по пропускной способности и становится узким местом при сложных параллельных архитектурах обучения.

Решение — NVLink-мосты между ускорителями. Это выделенный высокоскоростной канал обмена данными между видеокартами, минующий PCIe. Параллельные эпохи обучения проходят без задержек на синхронизацию.

Как обучить крупную языковую модель без выгрузки на диск
Как обучить крупную языковую модель без выгрузки на диск

2× AMD EPYC 9374F: 64 ядра для подготовки данных

Четыре ускорителя обслуживаются двумя процессорами AMD EPYC 9374F — суммарно 64 высокочастотных ядра, частота до 4.1 ГГц. Процессоры отвечают за подготовку данных для подачи на ускорители, виртуализацию, обмен с накопителями и сетью.

Высокая частота EPYC 9374F принципиальна именно под подготовку обучающих данных — это типично однопоточная нагрузка, где количество ядер важно, но частота каждого критична.

1,5 ТБ ECC-памяти под промышленный масштаб

В системе установлено 1,5 ТБ серверной оперативной памяти Samsung DDR5 с коррекцией ошибок (ECC) — 24 модуля по 64 ГБ в полной 12-канальной конфигурации. Этот объём нужен для подготовки больших обучающих выборок и кэширования промежуточных результатов.

Как обучить крупную языковую модель без выгрузки на диск
Как обучить крупную языковую модель без выгрузки на диск

Хранилище на PCIe 5.0: 16 ТБ при скорости 12 000 МБ/с

Дисковая подсистема построена на накопителях Samsung PM9A3 поколения PCIe 5.0. В составе — два накопителя по 960 ГБ под систему и кэш плюс четыре по 3,84 ТБ под обучающие наборы данных, суммарно более 16 ТБ на быстрой шине.

Скорость чтения накопителей — до 12 000 МБ/с. На таком уровне дисковая подсистема не становится узким местом даже при подаче крупных наборов данных на четыре ускорителя одновременно.

Сеть Mellanox ConnectX-6 на 25 Гбит/с

Сетевой адаптер — Mellanox ConnectX-6 с двумя портами по 25 Гбит/с. Это решение под распределённое обучение в кластере и под быстрый обмен с внешними источниками данных без потерь на сетевой обмен.

Как обучить крупную языковую модель без выгрузки на диск
Как обучить крупную языковую модель без выгрузки на диск
564 ГБ совокупной видеопамяти и NVLink-мосты между ускорителями — конфигурация под обучение крупных языковых моделей целиком, без перекладывания на диск и без узкого места в обмене между видеокартами.

Масштабирование до восьми ускорителей H200

Платформа ASUS ESC8000A-E13P рассчитана на установку до восьми ускорителей H200. Текущая конфигурация с четырьмя — стартовая для клиента, с возможностью дополнительной установки ещё четырёх по мере роста нагрузки.

Перед передачей заказчику система прошла 48 часов стресс-теста на полной нагрузке — это обязательный этап под круглосуточную эксплуатацию.

Как обучить крупную языковую модель без выгрузки на диск
Как обучить крупную языковую модель без выгрузки на диск

Кому подходит такая конфигурация

Серверный комплекс на четырёх ускорителях H200 работает под:

  • обучение и дообучение больших языковых моделей в командах разработки нейросетей;
  • аналитику больших данных в финансовом, телекоммуникационном и научном секторах;
  • научно-исследовательские центры — моделирование, квантовая химия, генетика, медицина;
  • корпоративные платформы машинного обучения с требованием размещения данных в закрытом контуре организации.

HYPERPC AMPERE производится под задачу клиента. Количество ускорителей, объём оперативной памяти, конфигурация хранилища, сетевая обвязка — каждый параметр определяется по запросу.

Что делать, если у вас похожая задача

Если ваша команда обучает большие модели или работает с массивами данных, превышающими возможности существующей инфраструктуры — есть смысл начать с разговора.

Пришлите профиль задачи: какие модели обучаете, требования к видеопамяти, объём обучающих данных, требования к закрытому контуру. В ответ — конфигурация HYPERPC AMPERE под вашу задачу и срок развёртывания.

💬 Свяжитесь с нами:

📱 Telegram → t.me/hyperpc_ru_bot

📱 WhatsApp → wa.me/79255388341

📱 VK → vk.com

📱 MAX → max.ru

📧 Почта → sales@hyperpc.ru, server@hyperpc.ru

Листая дальше, вы попадёте на сайт HYPERPC — смотрите конфигурации серверов, оставляйте заявку на нестандартную конфигурацию. Проектируем то, чего нет в каталоге — просто опишите задачу.