564 ГБ видеопамяти HBM3e на четырёх NVIDIA H200. Это объём, на котором обучаются самые крупные открытые языковые модели целиком. Дальше — про вычислительный комплекс на 4U-платформе с NVLink-мостами и сетью на 25 Гбит/с.
Что было до: обучение крупных моделей упирается в видеопамять
Клиент работает с обучением больших языковых моделей и аналитикой больших данных. Профиль нагрузки — длительные циклы обучения и многомерные расчёты на больших наборах данных, которые требуют значительной совокупной видеопамяти.
На предыдущих поколениях видеокарт с памятью по 32–80 ГБ крупные модели приходилось разбивать на части и обучать по фрагментам с сохранением промежуточных состояний на диск. Это длинно и неэффективно — большая часть времени уходит на обмен с накопителями.
Требование к проекту — серверный комплекс на флагманских ускорителях, способный держать крупные модели целиком в совокупной видеопамяти и работать круглосуточно без перерывов.
Четыре NVIDIA H200: 564 ГБ HBM3e в едином пуле
В системе установлены четыре NVIDIA H200. У каждой по 141 ГБ памяти HBM3e — суммарно 564 ГБ совокупного объёма. На этом объёме большие языковые модели обучаются целиком, без выгрузки промежуточных весов на диск.
HBM3e — это память, физически распаянная на самом ускорителе с высокой пропускной способностью. Для обучения моделей это даёт быстрый доступ к параметрам в каждый момент времени и снимает узкое место, типичное для обычных видеокарт.
NVLink-мосты: обмен данными между ускорителями
При параллельном обучении модели на нескольких видеокартах критичен обмен данными между ними. Через стандартную шину PCIe такой обмен ограничен по пропускной способности и становится узким местом при сложных параллельных архитектурах обучения.
Решение — NVLink-мосты между ускорителями. Это выделенный высокоскоростной канал обмена данными между видеокартами, минующий PCIe. Параллельные эпохи обучения проходят без задержек на синхронизацию.
2× AMD EPYC 9374F: 64 ядра для подготовки данных
Четыре ускорителя обслуживаются двумя процессорами AMD EPYC 9374F — суммарно 64 высокочастотных ядра, частота до 4.1 ГГц. Процессоры отвечают за подготовку данных для подачи на ускорители, виртуализацию, обмен с накопителями и сетью.
Высокая частота EPYC 9374F принципиальна именно под подготовку обучающих данных — это типично однопоточная нагрузка, где количество ядер важно, но частота каждого критична.
1,5 ТБ ECC-памяти под промышленный масштаб
В системе установлено 1,5 ТБ серверной оперативной памяти Samsung DDR5 с коррекцией ошибок (ECC) — 24 модуля по 64 ГБ в полной 12-канальной конфигурации. Этот объём нужен для подготовки больших обучающих выборок и кэширования промежуточных результатов.
Хранилище на PCIe 5.0: 16 ТБ при скорости 12 000 МБ/с
Дисковая подсистема построена на накопителях Samsung PM9A3 поколения PCIe 5.0. В составе — два накопителя по 960 ГБ под систему и кэш плюс четыре по 3,84 ТБ под обучающие наборы данных, суммарно более 16 ТБ на быстрой шине.
Скорость чтения накопителей — до 12 000 МБ/с. На таком уровне дисковая подсистема не становится узким местом даже при подаче крупных наборов данных на четыре ускорителя одновременно.
Сеть Mellanox ConnectX-6 на 25 Гбит/с
Сетевой адаптер — Mellanox ConnectX-6 с двумя портами по 25 Гбит/с. Это решение под распределённое обучение в кластере и под быстрый обмен с внешними источниками данных без потерь на сетевой обмен.
564 ГБ совокупной видеопамяти и NVLink-мосты между ускорителями — конфигурация под обучение крупных языковых моделей целиком, без перекладывания на диск и без узкого места в обмене между видеокартами.
Масштабирование до восьми ускорителей H200
Платформа ASUS ESC8000A-E13P рассчитана на установку до восьми ускорителей H200. Текущая конфигурация с четырьмя — стартовая для клиента, с возможностью дополнительной установки ещё четырёх по мере роста нагрузки.
Перед передачей заказчику система прошла 48 часов стресс-теста на полной нагрузке — это обязательный этап под круглосуточную эксплуатацию.
Кому подходит такая конфигурация
Серверный комплекс на четырёх ускорителях H200 работает под:
- обучение и дообучение больших языковых моделей в командах разработки нейросетей;
- аналитику больших данных в финансовом, телекоммуникационном и научном секторах;
- научно-исследовательские центры — моделирование, квантовая химия, генетика, медицина;
- корпоративные платформы машинного обучения с требованием размещения данных в закрытом контуре организации.
HYPERPC AMPERE производится под задачу клиента. Количество ускорителей, объём оперативной памяти, конфигурация хранилища, сетевая обвязка — каждый параметр определяется по запросу.
Что делать, если у вас похожая задача
Если ваша команда обучает большие модели или работает с массивами данных, превышающими возможности существующей инфраструктуры — есть смысл начать с разговора.
Пришлите профиль задачи: какие модели обучаете, требования к видеопамяти, объём обучающих данных, требования к закрытому контуру. В ответ — конфигурация HYPERPC AMPERE под вашу задачу и срок развёртывания.
💬 Свяжитесь с нами:
📱 Telegram → t.me/hyperpc_ru_bot
📱 WhatsApp → wa.me/79255388341
📱 VK → vk.com
📱 MAX → max.ru
📧 Почта → sales@hyperpc.ru, server@hyperpc.ru
Листая дальше, вы попадёте на сайт HYPERPC — смотрите конфигурации серверов, оставляйте заявку на нестандартную конфигурацию. Проектируем то, чего нет в каталоге — просто опишите задачу.