Банк работал на одном сервере: один сбой — и банковская система останавливается. Дальше — про отказоустойчивый кластер из двух узлов с автоматическим переключением и менее 53 минут простоя в год.
Что было до: одиночный сервер и нормативы ЦБ РФ
Клиент — коммерческий банк. Автоматизированная банковская система (АБС) обеспечивает обработку клиентских счетов, расчёты, отчётность в ЦБ РФ. Любой простой АБС означает остановку операций и прямую потерю выручки за каждую минуту.
До проекта банк работал на архитектуре одиночного сервера. Один отказ оборудования — диск, материнская плата, блок питания — приводил к необходимости ремонта или замены с длительным простоем. По требованиям ЦБ РФ к непрерывности банковских операций такая архитектура неприемлема.
Цель проекта — отказоустойчивое решение с уровнем доступности 99.99%. В переводе на простой это менее 53 минут в год.
Архитектура отказоустойчивого кластера: два узла
Кластер с двумя узлами строится по схеме «активный + горячий резерв» (N+1). Оба узла работают одновременно, виртуальные машины распределены между ними. При отказе одного из узлов виртуальные машины автоматически перезапускаются на втором без участия инженера.
В системе исключена единая точка отказа — критичный компонент, выход которого из строя останавливает всю работу. Каждый элемент кластера — узлы, сеть, питание, хранилище — имеет резервный путь или дублирование.
Два узла HYPERPC AMPERE в формате FORCE 1U
Узлы кластера — HYPERPC AMPERE в формате FORCE 1U Compute Node. В каждом установлен процессор Intel Xeon Scalable и многоканальная серверная оперативная память DDR5 с коррекцией ошибок (ECC).
Формат 1U выбран как наиболее компактный для развёртывания в существующей серверной стойке банка. Два узла занимают всего две высоты юнита — это позволяет встроить кластер в готовую инфраструктуру без переоборудования стойки.
Сеть 10GbE для живой миграции виртуальных машин
Узлы связаны между собой выделенной сетью на двух портах 10GbE (LR-Link). Это нужно для двух процессов: синхронизации состояния виртуальных машин и живой миграции — переноса работающей виртуальной машины с одного узла на другой без разрыва сетевых соединений.
Живая миграция используется не только при отказе, но и в плановом режиме — для обновления операционной системы, обслуживания оборудования, перебалансировки нагрузки между узлами.
NVMe с защитой данных при сбое питания
Загрузочные накопители кластера — корпоративные NVMe SSD с технологией защиты данных при сбое питания (Power Loss Protection, PLP). На диске установлены конденсаторы, которые при внезапном отключении питания дают время дописать буферы кэша на постоянное хранилище.
Это исключает риск повреждения данных и состояния виртуальных машин при перебоях электропитания. Использованы накопители уровня Samsung PM9A3 / Kingston DC1000B — стандарт для центров обработки данных с режимом постоянной перезаписи.
Доступность 99.99%: менее 53 минут простоя в год
Соглашение об уровне услуг (SLA) 99.99% означает, что система гарантированно доступна 99.99% времени в году. В переводе на простой это менее 53 минут в год.
Раньше один отказ оборудования мог остановить АБС на часы, пока инженер на месте идентифицирует проблему, привезёт замену и проведёт обслуживание. Теперь автоматический перезапуск виртуальных машин на втором узле занимает считанные минуты — банковские операции продолжаются практически без перерыва.
Архитектура исключает единую точку отказа. Если один сервер выходит из строя, второй автоматически подхватывает нагрузку — время простоя переходит с часов на минуты.
Кому подходит такая конфигурация
Отказоустойчивый кластер из двух узлов с автоматическим переключением работает под:
- финансовые организации с требованиями к непрерывности операций — банки, страховые компании, биржевые системы;
- критичные процессы в розничной торговле — биллинг, кассовые системы, складские базы данных;
- инфраструктуру электронной коммерции, где простой означает прямую потерю выручки;
- информационные системы организаций с требованиями к доступности — телекоммуникации, медицина, государственные структуры.
Кластер совместим со стандартными гипервизорами — VMware, Proxmox, KVM, Hyper-V — и встраивается в существующие сетевые и системные политики организации.
HYPERPC AMPERE производится под задачу клиента. Архитектура кластера, конфигурация узлов, ёмкость хранилища, сетевая обвязка — каждый параметр определяется по запросу.
Что делать, если у вас похожая задача
Если ваша инфраструктура построена на одиночных серверах и любой отказ оборудования означает многочасовой простой — есть смысл начать с разговора.
Пришлите профиль задачи: какие сервисы работают на текущей инфраструктуре, требования к доступности, существующие политики обслуживания. В ответ — конфигурация HYPERPC AMPERE под вашу задачу и срок развёртывания.
💬 Свяжитесь с нами:
📱 Telegram → t.me/hyperpc_ru_bot
📱 WhatsApp → wa.me/79255388341
📱 VK → vk.com
📱 MAX → max.ru
📧 Почта → sales@hyperpc.ru, server@hyperpc.ru
Листая дальше, вы попадёте на сайт HYPERPC — смотрите конфигурации серверов, оставляйте заявку на нестандартную конфигурацию. Проектируем то, чего нет в каталоге — просто опишите задачу.