SupermicroSYS-422GA-NRT-02-G2

Huit NVIDIA RTX PRO 6000 Blackwell avec 768 Go de mémoire GPU, deux Xeon de 72 cœurs, 1,5 To de DDR5 et un réseau 200 et 400 GbE, le tout en 4U et sans passer au format HGX.

Supermicro SYS-422GA-NRT-02-G2Rack 4U · Gold Series G2

La configuration exacte

Fiche technique officielle

Face avant schématique  survolez chaque composant.
Processeur2× Intel Xeon 6960P72 cœurs · 2,7 GHz
GPU8× NVIDIA RTX PRO 6000 Blackwell Server Edition
Mémoire1,5 ToDDR5-6400
Stockage1× 960 Go M.2 NVMe2× 3,84 To E1.S
Réseau1× dual 10 GbE RJ451× 2-port 200 GbE/NDR200 + 2× 1-port 400 GbE
FormatRack 4U
Garantie
3 ans pièces et main-d'œuvre
Intervention sur site
En option  le jour ouvré suivant, pendant 3 ans

Huit GPU pour de grands modèles sans passer à HGX

Avec 768 Go de mémoire GPU, on peut charger des modèles de plusieurs centaines de milliards de paramètres en 8 bits, ou plusieurs modèles moyens servis en parallèle, ce qui arrive souvent aux plateformes internes quand chaque département veut le sien. Contrairement à la -01, celle-ci arrive avec un réseau prêt à sortir du châssis : une carte 200 GbE et deux cartes 400 GbE qui servent à lire les modèles et les données depuis un stockage partagé et à relier deux nœuds ou plus quand le service doit être redondant.

La limite tient à la façon dont les GPU communiquent. Les huit sont rattachés à des commutateurs PCIe 5.0, sans le maillage NVLink d'une HGX B300 : pour l'inférence, cela pèse peu, mais dans un entraînement distribué ou avec un modèle énorme réparti sur les huit, la communication entre cartes devient le goulot d'étranglement. Si vous prévoyez d'entraîner vos propres modèles à partir de zéro, regardez d'abord la SYS-822GS-NB3RT-01-G2.

Ce que nous prenons en charge

Nous la montons avec RHEL ou Ubuntu, le GPU Operator et Kubernetes ou OpenShift AI, avec vLLM qui sert chaque modèle sur son groupe de GPU, et nous raccordons les ports 200 et 400 GbE à votre stockage ou à un cluster Ceph que nous pouvons aussi déployer. Si vous préférez ensuite ne pas dépendre du constructeur pour la maintenance, nous assurons un support indépendant avec astreinte 24×7 sous contrat.

Ce qu'il faut dans votre centre de données

Même châssis 4U et 737 mm de profondeur que la -01. Selon la fiche officielle, elle embarque quatre alimentations Titanium de 3 200 W en redondance 3+1 et, avec ses huit GPU installés, elle travaille beaucoup plus près de cette capacité que sa sœur : la répartition des circuits et la puissance par baie sont donc les premiers points que nous vérifions. Elle est refroidie par air avec dix ventilateurs de 8 cm, et une baie qui en accueille plusieurs a besoin d'une allée froide confinée.

Face au reste de la famille

ModèleCe qu'il embarqueQuand le choisir
SYS-822GS-NB3RT-01-G2HGX B300 8-GPU · 2 ToLa HGX B300 avec Intel ; le choix si votre standard est Xeon.
AS-8126GS-NB3RT-01-G2HGX B300 8-GPU · 3 ToMême HGX B300 avec AMD, 3 To et réseau de stockage séparé.
AS-5126GS-TNRT-01-G22x RTX PRO 6000 · 1,5 ToDeux GPU aujourd'hui, de la place pour huit et de la mémoire à revendre.
SYS-212GB-FNR-01-G22x RTX PRO 6000 · 512 GoLa plus compacte : 2U pour un service à deux GPU.
SYS-422GA-NRT-01-G24x RTX PRO 6000 · 1 ToQuatre GPU que MIG découpe en seize instances au plus pour plusieurs équipes.
SYS-C542i-11302UPrêt pour RTX 50 · 32 GoTour de développement sans GPU d'origine ; vous choisissez la carte.
ARS-511GD-NB-LCC-01-G2Grace + B300 · 748 GoUn nœud GB300 en tour pour l'équipe qui affine des modèles sans réserver de cluster.

Voir tous les serveurs IA et GPU

Ce que comprend la livraison

En usine

  • Configuration assemblée et testée par Supermicro
  • Garantie de 3 ans pièces et main-d'œuvre

De notre côté

  • Montage en rack
  • Gestion à distance (BMC) et firmware à jour
  • Système d'exploitation et pile logicielle installés
  • Tests avec votre charge avant la mise en production

Si vous en avez besoin

  • Astreinte 24×7 avec SLA
  • Intervention sur site le jour ouvré suivant pendant les 3 ans

Comment nous le mettons en place

Ce qui tourne sur ces serveurs, expliqué en détail 

Questions sur la SYS-422GA-NRT-02-G2

Quand une HGX B300 est-elle préférable à celle-ci ?

Quand vous allez entraîner de grands modèles ou en servir un qui ne tient pas dans 768 Go. La HGX B300 totalise environ 2,3 To de HBM3e et relie ses huit cartes par NVLink, bien plus rapide que le PCIe pour le trafic entre GPU, mais elle exige 8U et, selon sa fiche officielle, six alimentations de 6 600 W contre quatre de 3 200 W ici. Pour l'inférence de modèles allant jusqu'à quelques centaines de milliards de paramètres, celle-ci suffit généralement.

Quel modèle d'IA tient dans 768 Go ?

Avec la règle d'environ 2 Go par milliard de paramètres en 16 bits et 1 Go en 8 bits, on peut charger un modèle d'environ 300 milliards de paramètres en 16 bits, ou de plus de 500 milliards en 8 bits, en gardant de la place pour le cache de contexte. Nous affinons le calcul avec le modèle concret et le nombre d'utilisateurs que vous attendez.

À quoi servent les ports 200 et 400 GbE ?

À faire sortir les données du châssis. La carte 200 GbE a deux ports, compatibles aussi InfiniBand NDR (200 Gb/s), et les deux cartes 400 GbE un port chacune : ils servent à lire les poids et les données depuis un stockage partagé comme Ceph et à relier deux nœuds ou plus pour la redondance. Les deux ports 10 GbE restent dédiés à l'administration.

Le SYS-422GA-NRT-02-G2 convient-il à votre projet 

Décrivez-nous la charge et le centre de données qui l'accueillera  nous vous répondons avec le prix, le délai confirmé et ce qu'il faut pour le mettre en service.