Поиск
Страница в разработке

Раздел находится в разработке

Реализация проекта по созданию вычислительного комплекса
Проекты 24.06.2026

Задача

Российскому банку ТОП-10 потребовалось развернуть вычислительный комплекс (ВК) для задач ИИ и HPC. Решение должно состоять из внутреннего и внешнего сегмента, физически изолированных друг от друга, с возможностью переключения узлов из одного сегмента в другой. Внутренний сегмент размещается внутри периметра информационной системы банка и подключается к внутреннему объектному хранилищу. Внешний сегмент должен быть вынесен за пределы ИТ инфраструктуры и включать выделенные узлы управления и систему хранения данных. Решение должно отвечать требованиям заказчика к информационной безопасности. Внутренний сегмент ориентирован исключительно на решения задач ИИ с использованием технологии контейнеризации, внешний сегмент универсальный, включающий поддержку HPC нагрузок. Конфигурация всех узлов должна быть идентичной. Архитектура вычислительного комплекса — гибридная кластерная с поддержкой гиперковергентной среды с возможностью дальнейшего расширения.

 

Решение

Совместная команда «Е-Флопс» и «АМДтехнологии» создали и сдали в эксплуатацию ВК, состоящий из 22 вычислительных узлов, в качестве которых были использованы двухпроцессорные серверы с процессорами архитектуры х86 с 96 ядрами на сокет, GPU-ускорители Nvidia H100 в количестве 8 шт. на сервер, SSD NVMe накопителями.

Сетевая инфраструктура построена на трёх физически разделённых сетях. Для высокоскоростного обмена между узлами и подключения системы хранения данных (СХД) внешнего сегмента используется InfiniBand HDR с общей пропускной способностью не менее 1600 Гбит/с на узел в одном направлении с неблокируемым доступом в топологии Fat Tree. Для связи с локальной сетью используется 25‑гигабитный Ethernet, а для управления – 10‑гигабитный Ethernet. Дополнительно во внутреннем сегменте развёрнута сеть хранения данных на базе Fibre Channel 32 Гбит/с для подключения к объектному хранилищу.

Подсистема хранения внешнего контура реализована с помощью выделенной СХД с поддержкой иерархического хранения. Во внутреннем сегменте используется распределённое гиперконвергентное хранилище.

Программное обеспечение включает средства мониторинга и управления (в том числе NVIDIA DCGM для контроля GPU), систему визуализации и анализа данных на базе открытых пакетов, а также платформу оркестрации Kubernetes (K8s) с модулями Multus и Cilium. Внешний сегмент дополнительно поддерживает планировщик задач Slurm. Управляющие серверы работают в виртуальной среде Proxmox.

 

Проект включал:

      Обследование площадки

      Проектирование архитектуры вычислительного комплекса

      Создание проекта законченного решения

      Поставка необходимого оборудования

      Внедрение ВК, включая монтажные и коммутационные работы

      Пуско-наладочные работы, включающие функциональное и нагрузочное тестирование

      Приемо-сдаточные испытания, отдельно ПСИ по информационной безопасности

      Обучение инженеров заказчика пользованию ВК

      Постановка на обслуживание

 

Результат

За 9 месяцев был создан вычислительный комплекс, отвечающий требованиям заказчика в отношении производительности, отказоустойчивости, функциональных возможностей, информационной безопасности. Вычислительный кластер позволил развернуть все необходимые сервисы главного подразделения банка, а также подключить к ВК филиалы, позволяя им использовать мощности суперкомпьютера для развертывания собственных высоконагруженных приложений.

 

ВК (суперкомпьютер) в цифрах


      700+ активных пользователей

      22 вычислительных узла

     11 792 Tflops (FP64)

     700 PFlops (FP8/INT8)

•     4224 процессорных ядер

•     33 792 ГБ оперативной памяти вычислительных узлов

•     14 080 ГБ оперативной памяти GPU

•     2 973 696 CUDA ядер

•     92 928 тензорных ядер

•     200 Гб/с сеть Infiniband HDR

•     61 ТБ объем СХД для горячих данных

•     2 ПБ объем СХД для холодных данных


ЦОД и суперкомпьютеры

Команда «Е-Флопс» имеет самый большой в России опыт (более 100 разработанных и более 25 реализованных проектов) создания суперкомпьютеров мирового уровня (в том числе входящих в лист Топ-500 самых мощных общественно известных вычислительных систем мира). Суперкомпьютеры были созданы для ВУЗов, научных институтов в области физики, химии, биологии, медицины, оборонных и промышленных предприятий, центров исследования погоды в России, Европе, США, Азии.

Большая часть проектов включала создание как вычислительной части, так и инженерной инфраструктуры. 


Наиболее известные и значимые проекты суперкомпьютеров:

1.   МГУ:

      •   Ломоносов-1 (12 место в ТОП-500), 0,9 петафлопс, пиковая производительность — 1,7 петафлопс;

      •   Ломоносов-2 (22 место в ТОП-500), производительность 2,478 петафлопс, пиковая производительность — 4,947 петафлопс.

2.   ФГБУ «ГВЦ Росгидромета» (№2 в России на 2010г.), производительность 1,3 петафлопс;

3.   АО «Центр Суперкомпьютерного Моделирования» (ранее АО «СПЗ»), пиковая производительность — 1,5 Пфлопс;

4.   НИЦ «Курчатовский институт», пиковая производительность — 1,4 петафлопс.

5.   Юлихский исследовательский центр (Германия) (29 место в ТОП-500), пиковая производительность — 2,2 петафлопс.


Последний проект суперкомпьютера 2025 г. для крупного банка включал создание 22 вычислительных узлов (1-й этап) производительностью более 11 Пфлопс (FP64) для научных расчетов и более 690 Пфлопс (FP8/INT8) для задач ИИ. Проект включал все этапы разработки: помощь в составлении ТЗ, проектирование, поставку оборудования, пусконаладочные работы, настройку ПО, ввод в эксплуатацию, и был выполнен с учетов особых требований заказчика.


Команда с опытом 15-20 лет создания суперкомпьютеров включает:

•    Главного конструктора;
•    Главного инженера проекта;
•    Главного инженера по настройке ПО;
•    Архитекторов и инженеров по вычислительной и инженерной инфраструктуре.


Создание суперкомпьютера – это всегда индивидуальный проект, имеющий многочисленные требования и ограничения. В первую очередь, проект ограничен бюджетом, во вторую очередь техническими и инфраструктурными ограничениями помещения для ЦОД и размещения внешних элементов системы охлаждения, энергетическими, экологическими и др. ограничениями. Ключевые требованиями являются производительность, отказоустойчивость, совместимость с требуемым ПО, обеспечение всех видов безопасности, масштабируемость, управляемость, энергоэффективность и т.д. Создание суперкомпьютера, это сложный инженерный процесс, включающий множество этапов: от постановки задач, проектирования и моделирования до внедрения, тестирования и осуществления поддержки.


Наша команда готова реализовать весь комплекс услуг по созданию суперкомпьютера, или отдельные его этапы.


Этап 0. Предпроектное обследование и сбор требований (Discovery)
  • Анализ задач заказчика: определение целевого назначения (научные расчеты, ИИ, инженерия, криптография и тд.).
  • Расчет производительности: Формулирование требований к пиковой (Rpeak) и реальной (Rmax) производительности (планка по FLOPS или TOPS).
  • Аудит ограничений: оценка бюджета, доступных площадей, лимитов по подводимой электрической мощности, санитарных норм по шуму и требований безопасности.
  • Оценка ресурсов: составление календарного плана поставок оборудования (с учетом логистических рисков).
Этап 1. Логическое и физическое архитектурное проектирование (Hardware & Network)
  • Выбор вычислительной подсистемы: определение гомогенной (CPU) или гетерогенной архитектуры (комбинация CPU + xPU), подбор процессорных ядер, разработка спецификаций на материнские платы и блоки питания для блейд-серверов.
  • Определение назначения суперкомпьютера (задачи AI/ML или HPC).
  • Определение архитектуры и подбор конкретных моделей CPU и xPU, определение их количества.
  • Определение требований информационной безопасности и проектирование подсистемы обеспечения информационной безопасности и защиты информации.
  • Проектирование интерконнекта (сети данных): разработка топологии высокоскоростной шины (выбор InfiniBand, расчет пропускной способности и задержек (латентности) для связи десятков/сотен/тысяч узлов).
  • Система хранения данных (СХД): выбор архитектуры хранения (NAS, параллельная файловая система, объектная система хранения типа S3 и др.), подбор программных и аппаратных компонентов, проектирование комплексного решения  и подсистемы резервного копирования.
Этап 2. Проектирование инженерной инфраструктуры (Facility)
  • Энергоснабжение: расчет энергопотребления, проектирование вводных распределительных устройств (ВРУ), систем бесперебойного питания с ИБП и дизель-генераторами.
  • Система охлаждения (СО): выбор типа— прецизионное воздушное (для стоек средней плотности) или жидкостное прямого действия / иммерсионное (для высокотепловыделяющих GPU-кластеров). Расчет тепловой нагрузки (сотни кВт/МВт). и вида охлаждения (фрикулинг или компрессорное).
  • Размещение: расчет несущей способности перекрытий машинного зала, зонирование «горячих/холодных» коридоров и составление карты размещения серверных шкафов (Rack-компоновка).
Этап 3. Проектирование программной экосистемы (System Software Stack)
  • Базовое ПО: выбор дистрибутива  Linux (сборка ядра с поддержкой NUMA, больших страниц памяти, элементов RTOS и др.).
  • Система управления ресурсами: утверждение планировщиков задач и систем очередей (например, Slurm как основного Open Source).
  • Платформы виртуализации, контейнеризации, оркестраторы (OpenStack, OpenNebula, Kubernetes и др.).
  • Параллельные среды: интеграция библиотек (например, Intel MPI, Open MPI, NCCL/RCCL, Gloo и др.) для запуска распределенных вычислений и фреймворков (PyTorch, TensorFlow, JAX и др.).
  • Управляющие сервисы: инструменты администрирования, системы мониторинга состояния узлов и инфраструктуры, настройка модулей авторизации/аутентификации, подсистемы входа пользователей и т.п.
Этап 4. Создание прототипа и программная симуляция (PoC)
  • Сборка мини-кластера: монтаж пилотного сегмента из нескольких эталонных узлов для проверки совместимости компонентов CPU/GPU с выбранным дистрибутивом Linux.
  • Профилирование и бенчмаркинг: запуск синтетических тестов (HPL, HPCG и др.) для выявления «бутылочных горлышек» в шинах данных и памяти.
  • Оптимизация ПО: отладка программной экосистемы (System Software Stack) и тонкая настройка компиляторов и сетевых драйверов под конкретное железо (калибровка параметров ядра).
Этап 5. Поставка оборудования и физический монтаж (Deployment)
  • Приемка и входной контроль: проверка поставленного серверного оборудования, коммутаторов и кабельной системы.
  • Подготовка площадки: модернизация помещения (строительные работы, монтаж инженерной инфраструктуры (Facility).
  • Сборка стоек (Rack integration): физическая установка вычислительных узлов, и управляющих и сервисных серверов, аппаратных компонентов СХД и т.п.
  • Кабельная коммутация: прокладка тысяч оптических/медных кабелей интерконнекта строго по утвержденной топологии (с маркировкой для последующего обслуживания)
Этап 6. Пусконаладочные работы и интеграция ПО (Integration)
  • Низкоуровневая отладка: прошивка BIOS/UEFI, настройка RAID-массивов, инициализация и тестирование сетей.
  • Развертывание и настройка системного софта: установка ОС на управляющие узлы, развертывание программной экосистемы (System Software Stack).
Этап 7. Приемочные испытания и калибровка (Verification & Validation)
  • Финальный бенчмаркинг: официальный замер производительности (Rmax) и энергоэффективности (GFlops/Ватт).
  • Стресс-тестирование: запуск системы на 100% мощности в течение 72+ часов для выявления скрытых дефектов чипов, перегрева или падений напряжения.
  • Калибровка под задачи: адаптация системных параметров под реальные научные/коммерческие нагрузки заказчика (балансировка загрузки между узлами).
Этап 8. Ввод в эксплуатацию, обучение и техническое сопровождение (Operations & Handover)
  • Ввод в промышленную эксплуатацию: переход системы в штатный режим, запуск пилотных проектов.
  • Обучение персонала заказчика:
           - Уровень администрирования: работа с планировщиком, мониторинг состояния узлов, обновление прошивок.
           - Уровень эксплуатации: инструктаж исполнителей по подаче задач в очереди и работе с программной экосистемой (System Software Stack).
  • Регламент обслуживания: передача руководства по эксплуатации, назначение системного администратора (шеф-инженера) для круглосуточной поддержки (SLA).
  • Гарантийный постинг: согласование графика планового ТО, регламента замены вышедших из строя компонентов (HDD/SSD/вентиляторы) и мониторинг эффективности охлаждения.