Каждый месяц деньги уходили в облако — за аренду видеокарт, за трафик, за хранение. Но дело было не только в деньгах: банк хранил веса собственных нейросетей и данные клиентов на чужих серверах. Дальше — про систему, которая закрыла обе задачи.
Что было до: облако и риск утечки
Банк работал с публичным облаком два направления вычислений. Первое — предиктивная аналитика на больших данных для оценки рисков и персонализации продуктов. Второе — собственные большие языковые модели для поддержки клиентов и сотрудников.
Каждое из направлений требует регулярного обучения и дообучения. На облачной инфраструктуре это означало два постоянных потока расходов и один постоянный риск.
Расходы — аренда видеокарт, входящий и исходящий трафик, плата за хранение растущих наборов данных. По мере роста нагрузки расходы кратно опережали стоимость собственного железа на горизонте трёх лет.
Риск — финансовые данные клиентов и веса обученных моделей физически жили на инфраструктуре стороннего поставщика. Утечка, инцидент или изменение условий обслуживания — и работа останавливается. Решение очевидно: уйти из облака насовсем.
Архитектура: 576 ГБ видеопамяти в едином пуле
В системе установлены шесть NVIDIA RTX PRO 6000 Blackwell. У каждой видеокарты 96 ГБ видеопамяти. В сумме — 576 ГБ единого пула, в который помещаются крупные наборы данных и веса языковых моделей целиком.
Когда модель целиком лежит в видеопамяти, исчезают медленные обращения к дисковым накопителям во время обучения. Каждая итерация — чистые вычисления без ожидания данных. Архитектура Blackwell ускоряет именно те операции, которые занимают подавляющую часть времени обучения нейросетей.
Процессоры не становятся узким местом
Шесть видеокарт — это шесть устройств, которые непрерывно требуют данных. Обеспечить их без задержек может только процессорный узел с большим запасом по пропускной способности.
В системе стоят два AMD EPYC 9755 — по 128 ядер на каждом, суммарно 256 физических ядер, частота до 4.1 ГГц. Предварительная обработка данных, виртуализация, параллельная подача порций на шесть видеокарт одновременно — процессорная подсистема справляется без признаков насыщения.
3 ТБ ECC-памяти под промышленный масштаб
В системе установлено 24 модуля по 128 ГБ серверной оперативной памяти Samsung DDR5-6400 с коррекцией ошибок — итого 3 ТБ. Модули с коррекцией ошибок принципиально важны для длительных вычислений: автоматическое исправление одиночных битовых сбоев исключает риск того, что случайный сбой обнулит результаты многочасового или многосуточного обучения.
Хранилище: накопители без задержек
Дисковая подсистема построена на промышленных накопителях Samsung PM9A3 Gen4, применяемых в центрах обработки данных в режиме постоянной перезаписи:
- 2 × 3.84 ТБ — системный раздел и кэш, скорость до 5500 МБ/с;
- 2 × 7.68 ТБ — хранилище наборов данных и моделей, скорость до 6700 МБ/с.
Контроллер Broadcom 9560-16i отвечает за подключение и обслуживает накопители без потери производительности на обмене.
Сервер, который не знает слов «очередь» или «недостаточно памяти». Когда задача упирается в инфраструктуру, инженеры тратят время не на постановку — на ожидание окна для запуска.
Три задачи бизнеса — одно решение
Собственный закрытый контур закрыл то, чего публичное облако в принципе не даёт: контроль над данными, предсказуемая экономика и гарантированная производительность под пиковую нагрузку.
Безопасность. Финансовые данные клиентов, веса обученных моделей и обучающие выборки никогда не покидают периметр. Сторонних поставщиков нет, юрисдикционных рисков нет, условия использования не меняются в одностороннем порядке.
Экономика. Аренда облачных видеокарт окупает стоимость собственного железа на горизонте нескольких лет. Точная окупаемость зависит от профиля нагрузки клиента — для банка с регулярным обучением моделей переход в собственный контур экономически оправдан.
Производительность. Своя инфраструктура не делит ресурсы с другими арендаторами. 576 ГБ видеопамяти, 128 ядер процессоров, 3 ТБ оперативной памяти — целиком под задачи банка, без очередей и лимитов.
Кому подходит такая конфигурация
Вычислительный узел на 576 ГБ видеопамяти, 3 ТБ оперативной памяти и 128 ядрах процессоров работает под:
- обучение и дообучение больших языковых моделей в закрытом контуре финансовой или страховой организации;
- предиктивную аналитику на больших данных — скоринг, антифрод, оценка рисков;
- корпоративные платформы машинного обучения, где данные не могут покидать периметр компании;
- научно-исследовательские задачи с тяжёлыми моделями, где модель должна целиком лежать в видеопамяти.
HYPERPC AMPERE производится под задачу клиента. Количество видеокарт, объём оперативной памяти, конфигурация хранилища, форматное исполнение корпуса — каждый параметр определяется по запросу.
Что делать, если у вас похожая задача
Если ваш ИИ-проект упирается в облако — по деньгам, по безопасности или по производительности — есть смысл начать с разговора.
Пришлите типовой профиль нагрузки: какие модели обучаете, размер выборок, текущие расходы на облако, что не устраивает. В ответ — конфигурация HYPERPC AMPERE под вашу задачу и срок развёртывания.
💬 Свяжитесь с нами:
📱 Telegram → t.me/hyperpc_ru_bot
📱 WhatsApp → wa.me/79255388341
📱 VK → vk.com
📱 MAX → max.ru
📧 Почта → sales@hyperpc.ru, server@hyperpc.ru
Листая дальше, вы попадёте на сайт HYPERPC — смотрите конфигурации серверов, оставляйте заявку на нестандартную конфигурацию. Проектируем то, чего нет в каталоге — просто опишите задачу.