Поиск
Страница в разработке

Раздел находится в разработке

Проекты
Реализация проекта по созданию вычислительного комплекса

24.06.2026
подробнее

ЦОД и суперкомпьютеры

Команда «Е-Флопс» имеет самый большой в России опыт (более 100 разработанных и более 25 реализованных проектов) создания суперкомпьютеров мирового уровня (в том числе входящих в лист Топ-500 самых мощных общественно известных вычислительных систем мира). Суперкомпьютеры были созданы для ВУЗов, научных институтов в области физики, химии, биологии, медицины, оборонных и промышленных предприятий, центров исследования погоды в России, Европе, США, Азии.

Большая часть проектов включала создание как вычислительной части, так и инженерной инфраструктуры. 


Наиболее известные и значимые проекты суперкомпьютеров:

1.   МГУ:

      •   Ломоносов-1 (12 место в ТОП-500), 0,9 петафлопс, пиковая производительность — 1,7 петафлопс;

      •   Ломоносов-2 (22 место в ТОП-500), производительность 2,478 петафлопс, пиковая производительность — 4,947 петафлопс.

2.   ФГБУ «ГВЦ Росгидромета» (№2 в России на 2010г.), производительность 1,3 петафлопс;

3.   АО «Центр Суперкомпьютерного Моделирования» (ранее АО «СПЗ»), пиковая производительность — 1,5 Пфлопс;

4.   НИЦ «Курчатовский институт», пиковая производительность — 1,4 петафлопс.

5.   Юлихский исследовательский центр (Германия) (29 место в ТОП-500), пиковая производительность — 2,2 петафлопс.


Последний проект суперкомпьютера 2025 г. для крупного банка включал создание 22 вычислительных узлов (1-й этап) производительностью более 11 Пфлопс (FP64) для научных расчетов и более 690 Пфлопс (FP8/INT8) для задач ИИ. Проект включал все этапы разработки: помощь в составлении ТЗ, проектирование, поставку оборудования, пусконаладочные работы, настройку ПО, ввод в эксплуатацию, и был выполнен с учетов особых требований заказчика.


Команда с опытом 15-20 лет создания суперкомпьютеров включает:

•    Главного конструктора;
•    Главного инженера проекта;
•    Главного инженера по настройке ПО;
•    Архитекторов и инженеров по вычислительной и инженерной инфраструктуре.


Создание суперкомпьютера – это всегда индивидуальный проект, имеющий многочисленные требования и ограничения. В первую очередь, проект ограничен бюджетом, во вторую очередь техническими и инфраструктурными ограничениями помещения для ЦОД и размещения внешних элементов системы охлаждения, энергетическими, экологическими и др. ограничениями. Ключевые требованиями являются производительность, отказоустойчивость, совместимость с требуемым ПО, обеспечение всех видов безопасности, масштабируемость, управляемость, энергоэффективность и т.д. Создание суперкомпьютера, это сложный инженерный процесс, включающий множество этапов: от постановки задач, проектирования и моделирования до внедрения, тестирования и осуществления поддержки.


Наша команда готова реализовать весь комплекс услуг по созданию суперкомпьютера, или отдельные его этапы.


Этап 0. Предпроектное обследование и сбор требований (Discovery)
  • Анализ задач заказчика: определение целевого назначения (научные расчеты, ИИ, инженерия, криптография и тд.).
  • Расчет производительности: Формулирование требований к пиковой (Rpeak) и реальной (Rmax) производительности (планка по FLOPS или TOPS).
  • Аудит ограничений: оценка бюджета, доступных площадей, лимитов по подводимой электрической мощности, санитарных норм по шуму и требований безопасности.
  • Оценка ресурсов: составление календарного плана поставок оборудования (с учетом логистических рисков).
Этап 1. Логическое и физическое архитектурное проектирование (Hardware & Network)
  • Выбор вычислительной подсистемы: определение гомогенной (CPU) или гетерогенной архитектуры (комбинация CPU + xPU), подбор процессорных ядер, разработка спецификаций на материнские платы и блоки питания для блейд-серверов.
  • Определение назначения суперкомпьютера (задачи AI/ML или HPC).
  • Определение архитектуры и подбор конкретных моделей CPU и xPU, определение их количества.
  • Определение требований информационной безопасности и проектирование подсистемы обеспечения информационной безопасности и защиты информации.
  • Проектирование интерконнекта (сети данных): разработка топологии высокоскоростной шины (выбор InfiniBand, расчет пропускной способности и задержек (латентности) для связи десятков/сотен/тысяч узлов).
  • Система хранения данных (СХД): выбор архитектуры хранения (NAS, параллельная файловая система, объектная система хранения типа S3 и др.), подбор программных и аппаратных компонентов, проектирование комплексного решения  и подсистемы резервного копирования.
Этап 2. Проектирование инженерной инфраструктуры (Facility)
  • Энергоснабжение: расчет энергопотребления, проектирование вводных распределительных устройств (ВРУ), систем бесперебойного питания с ИБП и дизель-генераторами.
  • Система охлаждения (СО): выбор типа— прецизионное воздушное (для стоек средней плотности) или жидкостное прямого действия / иммерсионное (для высокотепловыделяющих GPU-кластеров). Расчет тепловой нагрузки (сотни кВт/МВт). и вида охлаждения (фрикулинг или компрессорное).
  • Размещение: расчет несущей способности перекрытий машинного зала, зонирование «горячих/холодных» коридоров и составление карты размещения серверных шкафов (Rack-компоновка).
Этап 3. Проектирование программной экосистемы (System Software Stack)
  • Базовое ПО: выбор дистрибутива  Linux (сборка ядра с поддержкой NUMA, больших страниц памяти, элементов RTOS и др.).
  • Система управления ресурсами: утверждение планировщиков задач и систем очередей (например, Slurm как основного Open Source).
  • Платформы виртуализации, контейнеризации, оркестраторы (OpenStack, OpenNebula, Kubernetes и др.).
  • Параллельные среды: интеграция библиотек (например, Intel MPI, Open MPI, NCCL/RCCL, Gloo и др.) для запуска распределенных вычислений и фреймворков (PyTorch, TensorFlow, JAX и др.).
  • Управляющие сервисы: инструменты администрирования, системы мониторинга состояния узлов и инфраструктуры, настройка модулей авторизации/аутентификации, подсистемы входа пользователей и т.п.
Этап 4. Создание прототипа и программная симуляция (PoC)
  • Сборка мини-кластера: монтаж пилотного сегмента из нескольких эталонных узлов для проверки совместимости компонентов CPU/GPU с выбранным дистрибутивом Linux.
  • Профилирование и бенчмаркинг: запуск синтетических тестов (HPL, HPCG и др.) для выявления «бутылочных горлышек» в шинах данных и памяти.
  • Оптимизация ПО: отладка программной экосистемы (System Software Stack) и тонкая настройка компиляторов и сетевых драйверов под конкретное железо (калибровка параметров ядра).
Этап 5. Поставка оборудования и физический монтаж (Deployment)
  • Приемка и входной контроль: проверка поставленного серверного оборудования, коммутаторов и кабельной системы.
  • Подготовка площадки: модернизация помещения (строительные работы, монтаж инженерной инфраструктуры (Facility).
  • Сборка стоек (Rack integration): физическая установка вычислительных узлов, и управляющих и сервисных серверов, аппаратных компонентов СХД и т.п.
  • Кабельная коммутация: прокладка тысяч оптических/медных кабелей интерконнекта строго по утвержденной топологии (с маркировкой для последующего обслуживания)
Этап 6. Пусконаладочные работы и интеграция ПО (Integration)
  • Низкоуровневая отладка: прошивка BIOS/UEFI, настройка RAID-массивов, инициализация и тестирование сетей.
  • Развертывание и настройка системного софта: установка ОС на управляющие узлы, развертывание программной экосистемы (System Software Stack).
Этап 7. Приемочные испытания и калибровка (Verification & Validation)
  • Финальный бенчмаркинг: официальный замер производительности (Rmax) и энергоэффективности (GFlops/Ватт).
  • Стресс-тестирование: запуск системы на 100% мощности в течение 72+ часов для выявления скрытых дефектов чипов, перегрева или падений напряжения.
  • Калибровка под задачи: адаптация системных параметров под реальные научные/коммерческие нагрузки заказчика (балансировка загрузки между узлами).
Этап 8. Ввод в эксплуатацию, обучение и техническое сопровождение (Operations & Handover)
  • Ввод в промышленную эксплуатацию: переход системы в штатный режим, запуск пилотных проектов.
  • Обучение персонала заказчика:
           - Уровень администрирования: работа с планировщиком, мониторинг состояния узлов, обновление прошивок.
           - Уровень эксплуатации: инструктаж исполнителей по подаче задач в очереди и работе с программной экосистемой (System Software Stack).
  • Регламент обслуживания: передача руководства по эксплуатации, назначение системного администратора (шеф-инженера) для круглосуточной поддержки (SLA).
  • Гарантийный постинг: согласование графика планового ТО, регламента замены вышедших из строя компонентов (HDD/SSD/вентиляторы) и мониторинг эффективности охлаждения.