Скорость суперкомпьютеров измеряется не в гигагерцах, а в FLOPS — операциях с плавающей запятой в секунду. Это фундаментальная метрика, показывающая, сколько математических вычислений машина способна выполнить за единицу времени. Современные лидеры рейтинга TOP500 преодолели рубеж в 1.102 эксафлопс, вступая в эру экзафлотных вычислений.
Понимание этих цифр критично для оценки возможностей науки, обороны и бизнеса. От моделирования ядерных реакций до обучения больших языковых моделей — производительность определяет горизонт решаемых задач.
Что такое FLOPS и как измеряют реальную мощность
FLOPS (Floating Point Operations Per Second) отражает производительность именно в задачах с плавающей запятой, что критично для научных расчётов. Целочисленная производительность (IOPS) для суперкомпьютеров второстепенна. Главный бенчмарк — LINPACK, решающий систему линейных уравнений.
Результаты теста дают значение Rmax — максимальная достигнутая производительность. Теоретический пик Rpeak считается по частотам и количеству ядер, но на практике недостижим из-за накладных расходов на связь и память.
Префиксы растут по степени 1000: тера (10¹²), пета (10¹⁵), экса (10¹⁸). Следующая цель — зеттафлопс (10²¹), но физические ограничения делают его далёкой перспективой.
⚠️ Внимание: Теоретический пик (Rpeak) значительно превышает реальную производительность (Rmax) в тесте LINPACK — разрыв часто составляет 20–30%.
FLOPS измеряет операции с плавающей запятой, а не целочисленные — это ключевой момент для научных задач.
История рекордов: от Крея к экзафлопсу
Эволюция производительности демонстрирует закон Мура в действии. Первый векторный Cray-1 (1976) выдавал ~160 мегафлопс. Прорыв терафлопса произошёл в 1997 году на ASCI Red (Intel/Sandia).
Барьер петафлопса упал в 2008 году благодаря Roadrunner (IBM/Los Alamos) — гибридной системе с Cell-процессорами. Дальнейший рост ускорился за счёт GPU-ускорения: Titan (2012), Summit (2018), Fugaku (2020).
Июнь 2022 года стал историческим: Frontier (HPE/AMD, ОРНЛ, США) официально вошёл в эксафлотный клуб, показав 1.102 эксафлопс по LINPACK.
- 🖥️ 1976: Cray-1 — 160 Мфлопс (векторная архитектура)
- 🚀 1997: ASCI Red — 1.3 Тфлопс (первый терафлопс)
- ☢️ 2008: Roadrunner — 1.026 Пфлопс (первый петафлопс, гибрид CPU+Cell)
- 🌋 2022: Frontier — 1.102 Эфлопс (первый эксафлопс, CPU+GPU AMD)
Текущие лидеры рейтинга TOP500 (ноябрь 2026)
Список TOP500 обновляется дважды в год. На ноябрь 2026 года доминируют американские системы, но Европа и Япония удерживают позиции в топ-10. Ключевой тренд — переход на гетерогенные архитектуры с GPU-ускорителями.
| Ранг | Система | Страна | Rmax (Пфлопс) | Rpeak (Пфлопс) |
|---|---|---|---|---|
| 1 | Frontier (HPE Cray EX, AMD) | США | 1 102 000 | 1 685 650 |
| 2 | Aurora (Intel Xeon + GPU Max) | США | 1 012 000 | 1 980 000 |
| 3 | Eagle (Microsoft NDv5, NDIA) | США | 561 200 | 846 800 |
| 4 | Fugaku (Fujitsu A64FX) | Япония | 442 010 | 537 212 |
| 5 | LUMI (HPE Cray EX, AMD) | Европа (Финляндия) | 380 000 | 531 500 |
Aurora стал второй экзафлотной системой, хотя и с задержкой относительно плана. Eagle — пример коммерческого облачного суперкомпьютера в топе. Fugaku уникален ARM-архитектурой (A64FX) и высокой энергоэффективностью.
⚠️ Внимание: Рейтинг TOP500 основан на LINPACK, но реальные научные коды (HPCG, AI) показывают иную картину эффективности — Fugaku часто опережает конкурентов по HPCG.
Детали архитектуры Frontier
Frontier состоит из 9 408 узлов. Каждый узел содержит 1 процессор AMD EPYC 64C и 4 ускорителя AMD Instinct MI250X (всего 8 GPU-дай на узел). Интерконнект HPE Slingshot 11 обеспечивает 12.8 Тбит/с на узел. Система потребляет ~21 МВт. Охлаждение — прямое жидкостное (теплосъемники на чипах).
Архитектура экзафлотных машин: CPU, GPU и интерконнекты
Современные суперкомпьютеры — это гетерогенные кластеры. Центральные процессоры (CPU) управляют потоком, а массивные ускорители (GPU) выполняют массивную параллельную математику. Соотношение вычислительной мощности GPU к CPU достигает 10:1 и выше.
Критический компонент — интерконнект. HPE Slingshot (Frontier, Aurora, LUMI), NVLink/NVSwitch (внутриузловые связи NVIDIA), InfiniBand (многие NVIDIA-кластеры). Пропускная способность межузловой сети составляет 100–400 Гбит/с и выше с минимальной задержкой.
Память становится «узким горлышком». HBM (High Bandwidth Memory) на GPU даёт 1–3 ТБ/с, но ёмкость ограничена (64–192 ГБ на GPU). Технологии CXL и пулы общей памяти пытаются решить проблему ёмкости.
- ⚙️ CPU: AMD EPYC (Zen 3/4/5), Intel Xeon Sapphire Rapids / Granite Rapids, Fujitsu A64FX (ARM SVE)
- 🎮 GPU/Ускорители: AMD Instinct MI250X/MI300A, NVIDIA Hopper H100/H200, Intel Xe GPU (Ponte Vecchio)
- 🔗 Интерконнект: HPE Slingshot, NVIDIA NVLink/NVSwitch, Intel Xe Link, InfiniBand NDR/NDR
- ❄️ Охлаждение: Прямое жидкостное (Direct Liquid Cooling) — стандарт для >50 кВт на стойку
☑️ Ключевые компоненты архитектуры экзафлотного класса
При проектировании кластера под AI/HPC закладывайте бюджет на интерконнект не менее 20–30% от стоимости вычислителей — сеть часто становится бутылочным горлышком раньше GPU.
Энергопотребление и «зелёные» суперкомпьютеры
Энергия — главное ограничение масштабирования. Frontier потребляет ~21 МВт (только вычислительная часть), Aurora — до 38 МВт. На уровне дата-центра с охлаждением цифры растут в 1.3–1.5 раза. Это эквивалентно потреблению небольшого города.
Рейтинг Green500 ранжирует системы по энергоэффективности (MFLOPS/Ватт). Лидерами часто становятся более компактные специализированные кластеры или системы на ARM (как Fugaku или европейские кластеры на Grace Hopper).
Технологии снижения: жидкостное охлаждение (снижает затраты на вентиляцию), динамическое управление питанием (P-states, C-states), низковольтная память (LPDDR5X, HBM3E). Перспектива — фотонические интерконнекты и 3D-стекинг для сокращения энергии на бит.
⚠️ Внимание: Потребление энергии экзафлотных систем превышает 20 МВт, что требует собственных подстанций и инженерной инфраструктуры уровня промышленного завода.
Зачем человечеству экзафлопс: ключевые сценарии использования
Эксафлотная мощность не ради рекордов. Основные драйверы — ядерная безопасность (моделирование взрыва без испытаний), климат (разрешение сетки <1 км для облаков), материаловедение (квантовая химия, DFT), биология (свёртывание белков, геномика).
Взрывной рост ИИ сместил фокус: обучение LLM (GPT-4 уровня) требует 10²⁵–10²⁶ FLOP. Суперкомпьютеры переориентируются на смешанную точность (FP8, BF16, FP4) для ИИ, сохраняя FP64 для классической симуляции. Aurora и El Capitan проектировались с учётом этого дуализма.
Коммерческий сектор арендует мощности (Eagle в Azure, Frontier через OLCF). Доступ к экзафлопсу становится услугой, а не только государственным активом.
- ☢️ Стюардство ядерного арсенала: 3D-гидродинамика, перенос излучения, старение материалов
- 🌍 Климатические модели: Разрешение ~1 км, явная конвекция, взаимодействие океан-лед-атмосфера
- 🧬 Биомедицина: Молекулярная динамика (миллионы атомов, микросекунды), крио-ЭМ реконструкция
- 🤖 Обучение ИИ: Тренировка фундаментальных моделей, мультимодальные LLM, научный ИИ (AI for Science)
Эксафлопс нужен не для рекордов, а для задач, где точность FP64 и масштаб параллелизма критичны: ядерная безопасность, климат, квантовая химия.
Будущее: путь к зеттафлопсу и квантовым ускорителям
Следующая веха — зеттафлопс (10²¹ FLOPS). Прогнозы: конец 2020-х — начало 2030-х. Главные вызовы: энергия (зеттафлопс на CMOS потребует ~500 МВт — нереально), память (Memory Wall), надежность (MTBF компонентов при миллионах чипов).
Решения: 3D-интеграция (чиплеты, HBM на логике), фотоника (оптические интерконнекты для снижения пДж/бит), нейроморфные и аналоговые вычисления для ИИ. Квантовые компьютеры не заменят суперкомпьютеры, а станут ускорителями для специфических подзадач (химия, оптимизация) в гибридных схемах HPC+QC.
Программные экосистемы (ROCm, CUDA, oneAPI, SYCL) решают проблему переносимости кода между архитектурами. Стандарт OpenMP / Kokkos / RAJA позволяет писать единый код для CPU/GPU разных вендоров.
⚠️ Внимание: Не все задачи масштабируются линейно — закон Амдала ограничивает выгоду от добавления ядер, если последовательная часть кода не оптимизирована.
Часто задаваемые вопросы
Какая разница между Rmax и Rpeak в рейтинге TOP500?
Rmax — реальная производительность, измеренная тестом LINPACK (решение СЛАУ). Rpeak — теоретический максимум, рассчитанный как частота × ядра × FLOP/цикл. Rmax всегда ниже Rpeak из-за накладных расходов на память, сеть и синхронизацию.
Почему суперкомпьютеры используют GPU, а не только CPU?
GPU имеют тысячи простых ядер, оптимизированных для массивной параллельной математики (матрицы, векторы). CPU лучше для сложной логики и ветвлений. Гетерогенность даёт лучшее соотношение FLOPS/Ватт и FLOPS/$ для научных нагрузок.
Что такое экзафлопс в простых терминах?
1 эксафлопс = 1 000 000 000 000 000 000 (квинтиллион) операций с плавающей запятой в секунду. Если каждый человек на Земле (8 млрд) считал на калькуляторе 1 операцию в секунду, понадобилось бы 125 000 лет, чтобы сделать то, что экзафлопс-машина делает за 1 секунду.
Какая самая энергоэффективная суперкомпьютерная архитектура сейчас?
Лидерам Green500 часто принадлежат кластеры на процессорах ARM (например, на базе Fujitsu A64FX или NVIDIA Grace) или специализированные ИИ-системы. Ключ — высокая интеграция (CPU+память в одном корпусе) и низковольтное питание.
Можно ли арендовать время на суперкомпьютере вроде Frontier?
Да, через программы распределения ресурсов (в США — INCITE, ALCC, DD в ОРНЛ/Аргунне). Коммерческий доступ предоставляется облачными провайдерами (Azure NDv5-series — аналог Eagle, AWS, Google Cloud с A100/H100). Для Frontier — в основном академические/государственные проекты по конкурсу.