Preskočiť na obsah

Výpočtové uzly

Perun je klaster výpočtových uzlov s názvami cn[001-060] a gn[001-076]. Uzly sú vybavené procesormi AMD EPYC architektúry x86-64 (univerzálna a cloudová partícia) a NVIDIA Grace Hopper Superchipmi (akcelerovaná partícia). Systém je postavený na architektúre BullSequana XH3000 a obsahuje tri typy výpočtových uzlov.

Uzly Moda / Počet Jadrá Pamäť Diskb GPU Sieť
cn[001-045] U / 45 320 1152 GB 3.8 TB žiadne NDR200
cn[046-060] C / 15 320 2304 GB 7.6 TB žiadne NDR200
gn[001-076] A / 76 288 1920 GB LPDDR5X + 384 GB HBM3 3.8 TB 4× GH200 4× NDR400

a U – univerzálny modul, C – cloudový modul, A – akcelerovaný modul.

b Hodnota udáva kapacitu lokálneho NVMe disku.

Uzly univerzálneho modulu

Obr. 1: Zadný pohľad na hornú a dolnú stranu blade BullSequana XH3000.

Univerzálna partícia pozostáva zo 45 výpočtových uzlov implementovaných ako blade moduly BullSequana XH3420. Každý blade je 1U hot-swap modul obsahujúci tri nezávislé uzly s dvoma CPU socketmi. Uzly sú založené na procesoroch AMD EPYC Turin 9845 (mikroarchitektúra Zen 5c) s platformou SP5 a 12 kanálmi pamäte DDR5 na socket. Chladenie zabezpečuje priame kvapalinové chladenie (DLC) pomocou chladiacich plôch (cold plate).

Vlastnosť cn[001-045]
Procesor 2× AMD EPYC Turin 9845 (160 jadier na CPU)
Architektúra Zen 5c, SP5
Pamäť 1152 GB DDR5 @ 5600 MT/s
Lokálny disk 3.8 TB NVMe
Interconnect 200 Gb/s InfiniBand NDR

Uzly cloudového modulu

Cloudová partícia pozostáva z 15 uzlov založených na rovnakej BullSequana XH3420 hardvérovej platforme a procesoroch AMD EPYC Turin 9845 ako univerzálne uzly. Hlavným rozdielom je dvojnásobná kapacita pamäte a lokálneho disku, vďaka čomu je partícia vhodná pre cloudovú infraštruktúru.

Vlastnosť cn[046-060]
Procesor 2× AMD EPYC Turin 9845 (160 jadier na CPU)
Architektúra Zen 5c, SP5
Pamäť 2304 GB DDR5 @ 5600 MT/s
Lokálny disk 7.6 TB NVMe
Interconnect 200 Gb/s InfiniBand NDR

Uzly akcelerovaného modulu

Obr. 2: Architektúra NVIDIA Grace.

Akcelerovaná partícia pozostáva zo 76 uzlov implementovaných ako BullSequana XH3515-H GPU blade (súčasť rodiny XH3500). Každý uzol integruje štyri NVIDIA Grace Hopper GH200 Superchips, ktoré kombinujú procesor Grace s GPU NVIDIA Hopper a pamäťou HBM3. Komunikáciu medzi CPU a GPU zabezpečuje NVLink-C2C a komunikáciu medzi GPU zabezpečuje NVLink.
Vlastnosť gn[001-076]
Superchips 4× NVIDIA Grace Hopper GH200
CPU 4× 72-jadrový Arm Neoverse V2 (Grace)
GPU 4× Hopper GPU, každé 96 GB HBM3
Pamäť 1920 GB LPDDR5X (CPU) + 384 GB HBM3 (GPU)
Lokálny disk 3.8 TB NVMe
Interconnect 4× 400 Gb/s InfiniBand NDR400

Procesory

AMD Turin 9845

AMD EPYC Turin 9845 je 64-bitový x86 serverový mikroprocesor z rodiny EPYC 5. generácie (kódové označenie Turin) optimalizovaný aj pre vysoko paralelné HPC záťaže. Každý procesor EPYC 9845 poskytuje 160 CPU jadier a 320 vlákien a podporuje 12 kanálov pamäte DDR5 s rýchlosťou až 6400 MT/s. Platforma podporuje PCIe 5.0 a CXL 2.0. Procesor implementuje plnoširoké 512-bitové vektorové jednotky AVX-512 a obsahuje 320 MB zdieľanej vyrovnávacej pamäte L3.

Obr. 3: Architektúra AMD Turin.

AMD EPYC Turin 9845
Architektúra x86-64 (Zen 5c) Proces 4 nm (TSMC)
Jadrá 160 Vlákna 320 (SMT2)
Základná frekvencia 2.10 GHz Max. boost frekvencia až 3.70 GHz
Pamäť až 9 TB DDR5-6400a TDP 390 W

a Maximálna kapacita závisí od konfigurácie pamäte.

Arm Neoverse V2

NVIDIA Grace Hopper Superchip

Obr. 4: NVIDIA Grace Hopper Superchip.

NVIDIA Grace je 64-bitový serverový procesor založený na architektúre Arm navrhnutý pre tesne prepojené HPC a AI systémy. Je založený na mikroarchitektúre Arm Neoverse V2, ktorá implementuje inštrukčnú sadu Armv9-A, a je integrovaný v Grace Hopper GH200 Superchipe.

Každý procesor Grace obsahuje 72 jadier Arm Neoverse V2 a je spárovaný s pamäťou LPDDR5X. V konfigurácii GH200 poskytuje CPU pamäť až 500 GB/s priepustnosť. Architektúra podporuje Scalable Vector Extension v2 (SVE2) a Advanced SIMD (NEON), čo umožňuje efektívne vykonávanie vektorizovaných vedeckých výpočtov.

Grace implementuje Large System Extensions (LSE) pre efektívne atomické operácie a podporuje hardvérovú virtualizáciu, šifrovanie pamäte a pokročilé funkcie spoľahlivosti. V rámci GH200 Superchipu je CPU Grace koherentne prepojený s GPU Hopper prostredníctvom NVLink-C2C s obojsmernou priepustnosťou až 900 GB/s. Toto prepojenie umožňuje koherentný prístup CPU a GPU k systémovej pamäti.

Procesor je optimalizovaný pre hybridné CPUGPU záťaže, trénovanie a inferenciu AI a rozsiahle HPC aplikácie vyžadujúce vysokú priepustnosť pamäte a vysokú energetickú efektívnosť.

Arm Neoverse V2
Architektúra Armv9-A Proces 4 nm (TSMC)
Jadrá 72 Vlákna 72 (bez SMT)
Základná frekvencia 2.60 GHz Max. boost frekvencia 3.50 GHz
Pamäť až 480 GB LPDDR5Xa Priepustnosť pamäte až 500 GB/s

a Maximálna kapacita pamäte na jeden GH200 Superchip je 480 GB.

Akcelerátory

NVIDIA Hopper GPU (GH200)

Použité NVIDIA Hopper GPU v akcelerovanej partícii sú súčasťou Grace Hopper GH200 Superchipu. Hopper je architektúra GPU pre dátové centrá navrhnutá pre veľkoškálové HPC a AI záťaže vyžadujúce vysoký výpočtový výkon a vysokú priepustnosť pamäte.

GPU integruje výkonné Streaming Multiprocessors (SM) s Tensor Cores 4. generácie, ktoré podporujú širokú škálu presností vrátane FP64, FP32, TF32, FP16, BF16, FP8 a INT8. To umožňuje efektívne vykonávanie tradičných vedeckých simulácií s dvojitou presnosťou aj moderných AI záťaží so zmiešanou presnosťou.

Každé GPU Hopper v konfigurácii GH200 je vybavené 96 GB pamäte HBM3 s priepustnosťou až približne 4 TB/s. Podsystém pamäte podporuje ochranu SECDED ECC a obsahuje mechanizmy na zvýšenie spoľahlivosti pamäte.

Hopper prináša oproti predchádzajúcej generácii Ampere viacero architektonických vylepšení:

Obr. 5: Interconnect Grace Hopper.

  • Zvýšená priepustnosť FP64 a FP32
  • Tensor Cores 4. generácie
  • Príkazy DPX urýchľujúce algoritmy dynamického programovania
  • 50 MB vyrovnávacej pamäte L2 pre lepšiu dátovú lokalitu
  • Asynchrónne výpočtové jednotky a Tensor Memory Accelerator (TMA)
  • Multi-Instance GPU (MIG) 2. generácie

V 4-cestnom uzle GH200 sú GPU Hopper prepojené vysokopriepustnými spojeniami NVLink. Priame prepojenie medzi GPU umožňuje efektívnu komunikáciu a vysokú agregovanú priepustnosť pri multi-GPU paralelných záťažiach.

GPU Hopper je optimalizované pre:

  • Trénovanie a inferenciu rozsiahlych AI modelov
  • Hybridné vedecké CPUGPU pracovné postupy
  • Dátovo náročné záťaže vyžadujúce vysokú priepustnosť pamäte

V konfigurácii Grace Hopper je GPU koherentne prepojené s CPU Grace prostredníctvom NVLink-C2C s priepustnosťou až 900 GB/s. Toto prepojenie umožňuje koherentný prístup CPU a GPU k pamäti a výrazne vyššiu priepustnosť než tradičné prepojenie pomocou PCIe.

NVIDIA Hopper GPU (GH200)
Architektúra NVIDIA Hopper Generácia GPU 9. (Data Center)
CUDA jadrá 16 896a Tensor Cores 4. generácia
Výkon FP64 až ~34 TFLOP/sa Výkon FP32 až ~67 TFLOP/sa
Pamäť GPU 96 GB HBM3 Priepustnosť pamäte až ~4 TB/s
NVLink-C2C až 900 GB/s TDP až 1000 W

a Presné hodnoty výkonu a počtu jadier závisia od konkrétneho GPU SKU použitého v konfigurácii GH200.

Created by: Marek Štekláč, Marek Štekláč