Výpočtové uzly¶
Perun je klaster výpočtových uzlov s názvami cn[001-060] a
gn[001-076]. Uzly sú vybavené procesormi AMD EPYC architektúry
x86-64 (univerzálna a cloudová partícia) a NVIDIA Grace Hopper
Superchipmi (akcelerovaná partícia). Systém je postavený na
architektúre BullSequana XH3000 a obsahuje tri typy výpočtových
uzlov.
| Uzly | Moda / Počet | Jadrá | Pamäť | Diskb | GPU | Sieť |
|---|---|---|---|---|---|---|
| cn[001-045] | U / 45 | 320 | 1152 GB | 3.8 TB | žiadne | NDR200 |
| cn[046-060] | C / 15 | 320 | 2304 GB | 7.6 TB | žiadne | NDR200 |
| gn[001-076] | A / 76 | 288 | 1920 GB LPDDR5X + 384 GB HBM3 | 3.8 TB | 4× GH200 | 4× NDR400 |
a U – univerzálny modul, C – cloudový modul, A – akcelerovaný modul.
b Hodnota udáva kapacitu lokálneho NVMe disku.
Uzly univerzálneho modulu¶
Univerzálna partícia pozostáva zo 45 výpočtových uzlov implementovaných ako blade moduly BullSequana XH3420. Každý blade je 1U hot-swap modul obsahujúci tri nezávislé uzly s dvoma CPU socketmi. Uzly sú založené na procesoroch AMD EPYC Turin 9845 (mikroarchitektúra Zen 5c) s platformou SP5 a 12 kanálmi pamäte DDR5 na socket. Chladenie zabezpečuje priame kvapalinové chladenie (DLC) pomocou chladiacich plôch (cold plate).
| Vlastnosť | cn[001-045] |
|---|---|
| Procesor | 2× AMD EPYC Turin 9845 (160 jadier na CPU) |
| Architektúra | Zen 5c, SP5 |
| Pamäť | 1152 GB DDR5 @ 5600 MT/s |
| Lokálny disk | 3.8 TB NVMe |
| Interconnect | 200 Gb/s InfiniBand NDR |
Uzly cloudového modulu¶
Cloudová partícia pozostáva z 15 uzlov založených na rovnakej BullSequana XH3420 hardvérovej platforme a procesoroch AMD EPYC Turin 9845 ako univerzálne uzly. Hlavným rozdielom je dvojnásobná kapacita pamäte a lokálneho disku, vďaka čomu je partícia vhodná pre cloudovú infraštruktúru.
| Vlastnosť | cn[046-060] |
|---|---|
| Procesor | 2× AMD EPYC Turin 9845 (160 jadier na CPU) |
| Architektúra | Zen 5c, SP5 |
| Pamäť | 2304 GB DDR5 @ 5600 MT/s |
| Lokálny disk | 7.6 TB NVMe |
| Interconnect | 200 Gb/s InfiniBand NDR |
Uzly akcelerovaného modulu¶
Obr. 2: Architektúra NVIDIA Grace.
| Vlastnosť | gn[001-076] |
|---|---|
| Superchips | 4× NVIDIA Grace Hopper GH200 |
| CPU | 4× 72-jadrový Arm Neoverse V2 (Grace) |
| GPU | 4× Hopper GPU, každé 96 GB HBM3 |
| Pamäť | 1920 GB LPDDR5X (CPU) + 384 GB HBM3 (GPU) |
| Lokálny disk | 3.8 TB NVMe |
| Interconnect | 4× 400 Gb/s InfiniBand NDR400 |
Procesory¶
AMD Turin 9845¶
Obr. 3: Architektúra AMD Turin.
| AMD EPYC Turin 9845 | |||
|---|---|---|---|
| Architektúra | x86-64 (Zen 5c) | Proces | 4 nm (TSMC) |
| Jadrá | 160 | Vlákna | 320 (SMT2) |
| Základná frekvencia | 2.10 GHz | Max. boost frekvencia | až 3.70 GHz |
| Pamäť | až 9 TB DDR5-6400a | TDP | 390 W |
a Maximálna kapacita závisí od konfigurácie pamäte.
Arm Neoverse V2¶
NVIDIA Grace je 64-bitový serverový procesor založený na architektúre Arm navrhnutý pre tesne prepojené HPC a AI systémy. Je založený na mikroarchitektúre Arm Neoverse V2, ktorá implementuje inštrukčnú sadu Armv9-A, a je integrovaný v Grace Hopper GH200 Superchipe.
Každý procesor Grace obsahuje 72 jadier Arm Neoverse V2 a je spárovaný s pamäťou LPDDR5X. V konfigurácii GH200 poskytuje CPU pamäť až 500 GB/s priepustnosť. Architektúra podporuje Scalable Vector Extension v2 (SVE2) a Advanced SIMD (NEON), čo umožňuje efektívne vykonávanie vektorizovaných vedeckých výpočtov.
Grace implementuje Large System Extensions (LSE) pre efektívne atomické operácie a podporuje hardvérovú virtualizáciu, šifrovanie pamäte a pokročilé funkcie spoľahlivosti. V rámci GH200 Superchipu je CPU Grace koherentne prepojený s GPU Hopper prostredníctvom NVLink-C2C s obojsmernou priepustnosťou až 900 GB/s. Toto prepojenie umožňuje koherentný prístup CPU a GPU k systémovej pamäti.
Procesor je optimalizovaný pre hybridné CPU–GPU záťaže, trénovanie a inferenciu AI a rozsiahle HPC aplikácie vyžadujúce vysokú priepustnosť pamäte a vysokú energetickú efektívnosť.
| Arm Neoverse V2 | |||
|---|---|---|---|
| Architektúra | Armv9-A | Proces | 4 nm (TSMC) |
| Jadrá | 72 | Vlákna | 72 (bez SMT) |
| Základná frekvencia | 2.60 GHz | Max. boost frekvencia | 3.50 GHz |
| Pamäť | až 480 GB LPDDR5Xa | Priepustnosť pamäte | až 500 GB/s |
a Maximálna kapacita pamäte na jeden GH200 Superchip je 480 GB.
Akcelerátory¶
NVIDIA Hopper GPU (GH200)¶
Použité NVIDIA Hopper GPU v akcelerovanej partícii sú súčasťou Grace Hopper GH200 Superchipu. Hopper je architektúra GPU pre dátové centrá navrhnutá pre veľkoškálové HPC a AI záťaže vyžadujúce vysoký výpočtový výkon a vysokú priepustnosť pamäte.
GPU integruje výkonné Streaming Multiprocessors (SM) s Tensor Cores 4. generácie, ktoré podporujú širokú škálu presností vrátane FP64, FP32, TF32, FP16, BF16, FP8 a INT8. To umožňuje efektívne vykonávanie tradičných vedeckých simulácií s dvojitou presnosťou aj moderných AI záťaží so zmiešanou presnosťou.
Každé GPU Hopper v konfigurácii GH200 je vybavené 96 GB pamäte HBM3 s priepustnosťou až približne 4 TB/s. Podsystém pamäte podporuje ochranu SECDED ECC a obsahuje mechanizmy na zvýšenie spoľahlivosti pamäte.
Hopper prináša oproti predchádzajúcej generácii Ampere viacero architektonických vylepšení:
Obr. 5: Interconnect Grace Hopper.
- Zvýšená priepustnosť FP64 a FP32
- Tensor Cores 4. generácie
- Príkazy DPX urýchľujúce algoritmy dynamického programovania
- 50 MB vyrovnávacej pamäte L2 pre lepšiu dátovú lokalitu
- Asynchrónne výpočtové jednotky a Tensor Memory Accelerator (TMA)
- Multi-Instance GPU (MIG) 2. generácie
V 4-cestnom uzle GH200 sú GPU Hopper prepojené vysokopriepustnými spojeniami NVLink. Priame prepojenie medzi GPU umožňuje efektívnu komunikáciu a vysokú agregovanú priepustnosť pri multi-GPU paralelných záťažiach.
GPU Hopper je optimalizované pre:
- Trénovanie a inferenciu rozsiahlych AI modelov
- Hybridné vedecké CPU–GPU pracovné postupy
- Dátovo náročné záťaže vyžadujúce vysokú priepustnosť pamäte
V konfigurácii Grace Hopper je GPU koherentne prepojené s CPU Grace prostredníctvom NVLink-C2C s priepustnosťou až 900 GB/s. Toto prepojenie umožňuje koherentný prístup CPU a GPU k pamäti a výrazne vyššiu priepustnosť než tradičné prepojenie pomocou PCIe.
| NVIDIA Hopper GPU (GH200) | |||
|---|---|---|---|
| Architektúra | NVIDIA Hopper | Generácia GPU | 9. (Data Center) |
| CUDA jadrá | 16 896a | Tensor Cores | 4. generácia |
| Výkon FP64 | až ~34 TFLOP/sa | Výkon FP32 | až ~67 TFLOP/sa |
| Pamäť GPU | 96 GB HBM3 | Priepustnosť pamäte | až ~4 TB/s |
| NVLink-C2C | až 900 GB/s | TDP | až 1000 W |
a Presné hodnoty výkonu a počtu jadier závisia od konkrétneho GPU SKU použitého v konfigurácii GH200.