Задача
Российскому банку ТОП-10 потребовалось развернуть вычислительный комплекс (ВК) для задач ИИ и HPC. Решение должно состоять из внутреннего и внешнего сегмента, физически изолированных друг от друга, с возможностью переключения узлов из одного сегмента в другой. Внутренний сегмент размещается внутри периметра информационной системы банка и подключается к внутреннему объектному хранилищу. Внешний сегмент должен быть вынесен за пределы ИТ инфраструктуры и включать выделенные узлы управления и систему хранения данных. Решение должно отвечать требованиям заказчика к информационной безопасности. Внутренний сегмент ориентирован исключительно на решения задач ИИ с использованием технологии контейнеризации, внешний сегмент универсальный, включающий поддержку HPC нагрузок. Конфигурация всех узлов должна быть идентичной. Архитектура вычислительного комплекса — гибридная кластерная с поддержкой гиперковергентной среды с возможностью дальнейшего расширения.
Решение
Совместная команда «Е-Флопс» и «АМДтехнологии» создали и сдали в эксплуатацию ВК, состоящий из 22 вычислительных узлов, в качестве которых были использованы двухпроцессорные серверы с процессорами архитектуры х86 с 96 ядрами на сокет, GPU-ускорители Nvidia H100 в количестве 8 шт. на сервер, SSD NVMe накопителями.
Сетевая инфраструктура построена на трёх физически разделённых сетях. Для высокоскоростного обмена между узлами и подключения системы хранения данных (СХД) внешнего сегмента используется InfiniBand HDR с общей пропускной способностью не менее 1600 Гбит/с на узел в одном направлении с неблокируемым доступом в топологии Fat Tree. Для связи с локальной сетью используется 25‑гигабитный Ethernet, а для управления – 10‑гигабитный Ethernet. Дополнительно во внутреннем сегменте развёрнута сеть хранения данных на базе Fibre Channel 32 Гбит/с для подключения к объектному хранилищу.
Подсистема хранения внешнего контура реализована с помощью выделенной СХД с поддержкой иерархического хранения. Во внутреннем сегменте используется распределённое гиперконвергентное хранилище.
Программное обеспечение включает средства мониторинга и управления (в том числе NVIDIA DCGM для контроля GPU), систему визуализации и анализа данных на базе открытых пакетов, а также платформу оркестрации Kubernetes (K8s) с модулями Multus и Cilium. Внешний сегмент дополнительно поддерживает планировщик задач Slurm. Управляющие серверы работают в виртуальной среде Proxmox.
Проект включал:
• Обследование площадки
• Проектирование архитектуры вычислительного комплекса
• Создание проекта законченного решения
• Поставка необходимого оборудования
• Внедрение ВК, включая монтажные и коммутационные работы
• Пуско-наладочные работы, включающие функциональное и нагрузочное тестирование
• Приемо-сдаточные испытания, отдельно ПСИ по информационной безопасности
• Обучение инженеров заказчика пользованию ВК
• Постановка на обслуживание
Результат
За 9 месяцев был создан вычислительный комплекс, отвечающий требованиям заказчика в отношении производительности, отказоустойчивости, функциональных возможностей, информационной безопасности. Вычислительный кластер позволил развернуть все необходимые сервисы главного подразделения банка, а также подключить к ВК филиалы, позволяя им использовать мощности суперкомпьютера для развертывания собственных высоконагруженных приложений.
ВК (суперкомпьютер) в цифрах
• 700+ активных пользователей
• 22 вычислительных узла
• 11 792 Tflops (FP64)
• 700 PFlops (FP8/INT8)
• 4224 процессорных ядер
• 33 792 ГБ оперативной памяти вычислительных узлов
• 14 080 ГБ оперативной памяти GPU
• 2 973 696 CUDA ядер
• 92 928 тензорных ядер
• 200 Гб/с сеть Infiniband HDR
• 61 ТБ объем СХД для горячих данных
• 2 ПБ объем СХД для холодных данных