SupermicroAS-8126GS-NB3RT-01-G2

La carte NVIDIA HGX B300 à huit GPU associée à deux AMD EPYC 9575F, 3 To de DDR5 et huit ports 800 GbE, dans la version que Supermicro prépare pour servir de grands modèles à de nombreux utilisateurs en même temps.

Supermicro AS-8126GS-NB3RT-01-G2Rack 8U · Gold Series G2

La configuration exacte

Fiche technique officielle

Face avant schématique  survolez chaque composant.
Processeur2× AMD EPYC 9575F64 cœurs · 3,3 GHz
GPUNVIDIA HGX B300 8-GPU
Mémoire3 ToDDR5-6400
Stockage2× 1,9 To M.2 NVMe
Réseau2× 2-port 200 GbE / NDR2008-port 800 GbE / XDR800
FormatRack 8U
Garantie
3 ans pièces et main-d'œuvre
Intervention sur site
En option  le jour ouvré suivant, pendant 3 ans
Logiciel
Supermicro Data Center Management Suite, licence par nœud

Servir de grands modèles à des centaines d'utilisateurs depuis un seul châssis

Supermicro la classe dans l'inférence à grande échelle, et la configuration va dans ce sens : les huit GPU Blackwell Ultra totalisent environ 2,3 To de HBM3e et communiquent par NVLink (la liaison directe de NVIDIA entre GPU) via un commutateur NVSwitch. Un modèle de plusieurs centaines de milliards de paramètres tient donc entièrement dans la machine, et il reste encore de la place pour le cache de contexte de nombreuses conversations simultanées. Les EPYC 9575F sont la variante d'AMD qui privilégie la fréquence plutôt que le nombre de cœurs, ce qui se ressent sur la part du travail qui reste côté CPU : mettre les requêtes en file d'attente, tokeniser et alimenter les GPU sans qu'ils attendent.

Avec un seul nœud, une intervention de maintenance met le modèle hors ligne. Si le service part en production, la conception commence donc avec deux machines reliées par les huit ports 800 GbE, les deux cartes 200 GbE restant réservées au stockage. Et si le modèle que vous allez servir tourne autour de 70 milliards de paramètres, deux RTX PRO 6000 suffisent : une SYS-212GB-FNR-01-G2 en 2U, ou une AS-5126GS-TNRT-01-G2 si vous prévoyez de grandir.

Ce que nous prenons en charge

Nous la livrons avec RHEL ou Ubuntu, les pilotes NVIDIA et le GPU Operator sur Kubernetes ou OpenShift AI, avec vLLM comme serveur d'inférence, testé avec le modèle que vous allez utiliser. Les deux cartes 200 GbE, à deux ports chacune, sont dédiées au stockage, en général un cluster Ceph qui héberge les poids des modèles et les données, afin que ce trafic ne concurrence jamais celui des GPU. Vous trouverez plus de détails sur notre façon de procéder dans inférence d'IA sur Kubernetes et Ceph.

Ce qu'il faut dans votre centre de données

Elle occupe 8U et son châssis mesure 950 mm de profondeur, plus que ce qu'acceptent beaucoup de baies de 1 000 mm une fois le câblage en place. Selon la fiche officielle, elle embarque six alimentations Titanium de 6 600 W en redondance 3+3, ce qui demande six prises réparties sur deux circuits indépendants pour que la redondance serve à quelque chose. Le refroidissement est à air, avec jusqu'à douze ventilateurs haute performance : c'est pourquoi nous vérifions avec vous la puissance disponible par baie, les PDU et le confinement de l'allée froide avant de valider quoi que ce soit.

Face au reste de la famille

ModèleCe qu'il embarqueQuand le choisir
SYS-822GS-NB3RT-01-G2HGX B300 8-GPU · 2 ToLa HGX B300 avec Intel ; le choix si votre standard est Xeon.
AS-5126GS-TNRT-01-G22x RTX PRO 6000 · 1,5 ToDeux GPU aujourd'hui, de la place pour huit et de la mémoire à revendre.
SYS-212GB-FNR-01-G22x RTX PRO 6000 · 512 GoLa plus compacte : 2U pour un service à deux GPU.
SYS-422GA-NRT-01-G24x RTX PRO 6000 · 1 ToQuatre GPU que MIG découpe en seize instances au plus pour plusieurs équipes.
SYS-422GA-NRT-02-G28x RTX PRO 6000 · 1,5 ToLe maximum en PCIe : huit GPU et réseau 400 GbE.
SYS-C542i-11302UPrêt pour RTX 50 · 32 GoTour de développement sans GPU d'origine ; vous choisissez la carte.
ARS-511GD-NB-LCC-01-G2Grace + B300 · 748 GoUn nœud GB300 en tour pour l'équipe qui affine des modèles sans réserver de cluster.

Voir tous les serveurs IA et GPU

Ce que comprend la livraison

En usine

  • Configuration assemblée et testée par Supermicro
  • Garantie de 3 ans pièces et main-d'œuvre

De notre côté

  • Montage en rack
  • Gestion à distance (BMC) et firmware à jour
  • Système d'exploitation et pile logicielle installés
  • Tests avec votre charge avant la mise en production

Si vous en avez besoin

  • Astreinte 24×7 avec SLA
  • Intervention sur site le jour ouvré suivant pendant les 3 ans

Comment nous le mettons en place

Ce qui tourne sur ces serveurs, expliqué en détail 

Questions sur la AS-8126GS-NB3RT-01-G2

Quelle différence avec la SYS-822GS-NB3RT-01-G2 ?

Les deux montent la même carte HGX B300 à huit GPU et le même châssis 8U. Celle-ci remplace les Xeon par deux AMD EPYC 9575F, porte la mémoire système de 2 à 3 To et ajoute deux cartes 200 GbE à deux ports chacune, en plus des huit ports 800 GbE. Si votre parc est AMD, ou si vous voulez un réseau de stockage séparé sans ajouter de cartes, c'est celle qui convient.

Quelle taille de modèle tient dans la HGX B300 ?

En règle approximative, chaque milliard de paramètres occupe environ 2 Go en 16 bits et 1 Go en 8 bits, et il faut en plus réserver de la mémoire pour le cache de contexte, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Avec environ 2,3 To répartis sur les huit GPU, un modèle d'environ 700 milliards de paramètres en 8 bits tient avec une large marge pour le servir à de nombreux utilisateurs.

À quoi sert chaque port réseau ?

Les huit ports 800 GbE, qui fonctionnent aussi en InfiniBand XDR (800 Gb/s), servent à relier plusieurs nœuds GPU en cluster. Les deux cartes 200 GbE, à deux ports chacune et compatibles InfiniBand NDR (200 Gb/s), sont en général dédiées au stockage, pour que la lecture des poids et des données ne concurrence pas le trafic entre GPU.

Le AS-8126GS-NB3RT-01-G2 convient-il à votre projet 

Décrivez-nous la charge et le centre de données qui l'accueillera  nous vous répondons avec le prix, le délai confirmé et ce qu'il faut pour le mettre en service.