Обучение языковых моделей на лабораторной станции занимало недели. Рендеринг физических симуляций перегревал систему. Дальше — про локальный кластер на двух RTX 5090 с внешним радиатором, который сократил обучение с недель до часов.
Что было до: недели на обучение, перегрев на симуляциях
Клиент — ведущий технический университет. Направления — обучение нейросетей, математическое моделирование, работа с большими наборами данных. Под такие задачи нужны вычислительные ресурсы, которых стандартные лабораторные станции не дают.
Цикл обучения большой языковой модели на имевшихся рабочих станциях мог занимать недели. Рендеринг физических симуляций — длинных расчётов с непрерывной нагрузкой на видеокарты — приводил к перегреву и принудительному снижению частот. Система переставала выдавать заявленную производительность через несколько часов работы.
Требование к проекту — локальный кластер, работающий круглосуточно под полной нагрузкой, не зависящий от облачных сервисов. Все данные и обученные модели должны оставаться внутри университета.
Две RTX 5090: 64 ГБ видеопамяти для тяжёлых моделей
В системе установлены две NVIDIA GeForce RTX 5090. У каждой по 32 ГБ видеопамяти — суммарно 64 ГБ единого пула. Для обучения больших языковых моделей критичен совокупный объём видеопамяти: когда модель целиком помещается в видеопамять, обучение идёт без обмена с накопителями и без потери времени на подкачку.
На 64 ГБ суммарного объёма помещаются модели среднего и крупного размера — те, на которых ведётся прикладная исследовательская работа в университетских лабораториях.
Threadripper PRO 7965WX — 24 ядра до 5.3 ГГц
Процессор отвечает за подготовку и подачу данных к двум видеокартам, виртуализацию, фоновые задачи. Для такой нагрузки нужен запас по ядрам и по частоте.
В системе установлен AMD Ryzen Threadripper PRO 7965WX — 24 физических ядра, 48 потоков, частота до 5.3 ГГц. Платформа WRX90 обеспечивает полные линии PCIe на обе видеокарты одновременно — без сужения шины.
256 ГБ ECC-памяти под научные задачи
В системе установлено 256 ГБ серверной оперативной памяти Samsung DDR5 с коррекцией ошибок (ECC). Для многочасового научного расчёта или длительного обучения модели коррекция ошибок принципиально важна — автоматическое исправление одиночных битовых сбоев исключает риск того, что случайный сбой обнулит результаты длинной задачи.
Жидкостное охлаждение с внешним радиатором
Под полной нагрузкой система выделяет почти 2 кВт тепла. Воздушное охлаждение в стоечном 4U-корпусе с такой задачей не справляется — горячий воздух не успевает выводиться из плотной компоновки.
Решение — индивидуальное жидкостное охлаждение с водоблоками на процессоре и на обеих видеокартах. Контур подключён к внешнему (выносному) радиатору, обслуживаемому шестью промышленными вентиляторами с частотой до 8000 оборотов в минуту. Такая компоновка снимает тепло с системы и переносит теплообмен за пределы основного корпуса — это особенно важно для университетской серверной с фиксированными воздушными потоками.
Совокупная видеопамять — основной параметр для обучения языковых моделей. 64 ГБ позволяют загружать тяжёлую модель целиком и обучать её без обмена с дисковыми накопителями.
Кому подходит такая конфигурация
Локальный кластер на двух флагманских видеокартах с большим объёмом памяти с коррекцией ошибок работает под:
- университетские лаборатории машинного обучения и аналитики данных;
- научно-исследовательские задачи в области моделирования физических процессов и трёхмерных симуляций;
- команды разработки и дообучения больших языковых моделей в закрытом контуре организации;
- прикладные исследования, требующие круглосуточной автономной вычислительной мощности без зависимости от облака.
HYPERPC AMPERE производится под задачу клиента. Количество видеокарт, объём оперативной памяти, конфигурация жидкостного контура, формат корпуса — каждый параметр определяется по запросу.
Что делать, если у вас похожая задача
Если ваша лаборатория или исследовательская группа упирается в облако или в производительность стандартных рабочих станций — есть смысл начать с разговора.
Пришлите профиль задачи: какие модели обучаете, размер выборок, текущее время прогона, требования к закрытому контуру. В ответ — конфигурация HYPERPC AMPERE под вашу задачу и срок развёртывания.
💬 Свяжитесь с нами:
📱 Telegram → t.me/hyperpc_ru_bot
📱 WhatsApp → wa.me/79255388341
📱 VK → vk.com
📱 MAX → max.ru
📧 Почта → sales@hyperpc.ru, server@hyperpc.ru
Листая дальше, вы попадёте на сайт HYPERPC — смотрите конфигурации серверов, оставляйте заявку на нестандартную конфигурацию. Проектируем то, чего нет в каталоге — просто опишите задачу.