Обычно вычислительный сервер и хранилище данных — две разные системы, связанные сетью. Видеокарты простаивают, пока данные пересылаются для расчёта или сохранения. Дальше — про гибридный узел: 256 ядер, 4 видеокарты и 120 ТБ в одной стойке.
Что было до: вычисления и хранение в разных системах
Клиент — научно-исследовательский центр. Профиль работы — обработка результатов исследований: моделирование, многомерные расчёты, финальная обработка данных и архив больших объёмов.
Обычная инфраструктура НИР-центра построена из двух разнотипных систем. Первая — вычислительный сервер с видеокартами и процессорами под расчёты. Вторая — система хранения с большой ёмкостью под архив и текущие данные. Между ними — сеть.
На длинных циклах обработки сеть становится узким местом. Видеокарты простаивают, пока данные доезжают с хранилища или возвращаются для сохранения. Чем больше объём данных, тем заметнее простой.
Гибридная архитектура: вычисления и хранение в одном узле
Решение — объединить вычислительный сервер и хранилище данных в одном узле. Данные обрабатываются и сразу сохраняются на локальный массив — без сетевого обмена между этапами.
Эта архитектура заменяет связку «отдельный сервер вычислений + отдельная система хранения» одной системой в стандартном стоечном формате. Цикл «расчёт → анализ → архивирование» проходит внутри одного корпуса, что снимает основную часть сетевых задержек.
Два AMD EPYC: 256 ядер суммарно
За вычислительную часть отвечают два процессора AMD EPYC — 256 физических ядер суммарно. Этого хватает на параллельную обработку нескольких потоков расчёта одновременно с обслуживанием дисковой подсистемы.
Многоканальная серверная оперативная память с коррекцией ошибок обеспечивает непрерывную подачу данных к процессорам и к видеокартам.
Четыре видеокарты с индивидуальным жидкостным охлаждением
За графическую составляющую вычислений отвечают четыре видеокарты с индивидуальным жидкостным охлаждением. Воздушное охлаждение четырёх флагманских видеокарт в плотной стоечной компоновке физически не справляется с тепловыделением — отсюда переход на индивидуальный жидкостной контур.
Жидкостное охлаждение даёт устойчивые рабочие частоты при длительных циклах обработки. На многочасовых расчётах нет теплового сброса и просадки частот — видеокарты держат заявленную производительность.
120 ТБ локального хранилища на 10 дисках
Локальная подсистема хранения — массив из 10 жёстких дисков по 12 ТБ корпоративного класса, итого 120 ТБ сырой ёмкости. Дисками управляет выделенный SAS-контроллер — он отвечает за организацию массива, контроль целостности и отказоустойчивость на уровне накопителей.
120 ТБ — это рабочий и архивный объём НИР-центра в одной системе. На таком объёме помещаются результаты длительных серий исследований без перекладывания между отдельными системами хранения.
1 ТБ оперативной памяти с коррекцией ошибок
В системе установлен 1 ТБ серверной оперативной памяти с коррекцией ошибок (ECC). На научных расчётах и длительной обработке коррекция ошибок принципиально важна: автоматическое исправление одиночных битовых сбоев исключает риск того, что случайный сбой обнулит результаты многочасовой задачи.
Локальное хранилище в том же корпусе, что и вычислитель, снимает сетевую задержку между этапами обработки и архивирования. Это меняет режим работы исследовательской команды — данные доступны сразу, а не через очередь сетевого обмена.
Отказоустойчивость: два идентичных узла
Архитектура спроектирована под отказоустойчивость. У клиента развёрнуты два идентичных узла в стоечной серверной. При отказе одного второй продолжает обслуживать вычислительную нагрузку и хранение — без потери данных и без простоя цикла исследования.
Кому подходит такая конфигурация
Гибридный узел с большим объёмом локального хранилища работает под:
- научно-исследовательские центры — обработка результатов экспериментов, моделирование, финальная обработка данных;
- исследовательские и опытно-конструкторские задачи в промышленности — где данные расчёта одновременно становятся архивом проекта;
- команды работы с большими массивами данных, где сетевой обмен с внешним хранилищем создаёт значимую задержку;
- лаборатории моделирования и физических симуляций с длительными циклами обработки.
HYPERPC AMPERE производится под задачу клиента. Количество видеокарт, объём оперативной памяти, ёмкость локального хранилища, конфигурация дисковой подсистемы — каждый параметр определяется по запросу.
Что делать, если у вас похожая задача
Если ваша лаборатория или научная группа упирается в сетевую задержку между вычислителем и хранилищем — есть смысл начать с разговора.
Пришлите профиль задачи: какие расчёты ведёте, объём обрабатываемых данных, требования к архиву, какие циклы должны проходить без сетевого обмена. В ответ — конфигурация HYPERPC AMPERE под вашу задачу и срок развёртывания.
💬 Свяжитесь с нами:
📱 Telegram → t.me/hyperpc_ru_bot
📱 WhatsApp → wa.me/79255388341
📱 VK → vk.com
📱 MAX → max.ru
📧 Почта → sales@hyperpc.ru, server@hyperpc.ru
Листая дальше, вы попадёте на сайт HYPERPC — смотрите конфигурации серверов, оставляйте заявку на нестандартную конфигурацию. Проектируем то, чего нет в каталоге — просто опишите задачу.