Quel stockage pour l’IA et le HPC : Ceph, Lustre ou DAOS ?

Infrastructure · Stockage IA / HPC · Open Source

Stockage pour l'IA et le HPC en 2026 : Ceph, Storage Scale, Lustre, DAOS et BeeGFS.

Vous montez un cluster de GPU qui coûte le prix d'un immeuble, puis vous décidez où vivent les données. Cette décision — le système de fichiers — détermine si vos GPU calculent ou attendent. Nous cartographions les cinq grands, à quoi sert chacun et comment ne pas vous tromper.

12 min de lectureComparatif technique

Il y a une scène qui se répète chaque fois que nous auditons une plateforme d'IA ou de HPC. Le client nous montre, non sans fierté, son cluster de GPU flambant neuf. Des chiffres de TFLOPS impressionnants. Et là, nous posons la question ennuyeuse : « et d'où lisent-ils les données ? ». Trop souvent, la réponse est un partage NFS branché sur une machine dans un coin.

Acheter huit GPU qui coûtent le prix d'un appartement et les alimenter en NFS, c'est l'équivalent numérique de mettre le réservoir d'un scooter sur une Formule 1 : toute la puissance est là, mais elle passe la journée au stand. C'est le stockage qui décide si ces GPU travaillent ou attendent — et bien le choisir commence par savoir quelles options existent et à quoi sert chacune.

1 et 2
Places de DAOS sur la liste
de production IO500 (SC25)
×4
Leur score cumulé face
aux 30 systèmes suivants
#1
Lustre, le FS le plus répandu
en supercalcul
50+ Po
Ceph déployé
au CERN
01 · Le vocabulaire qui façonne l'architecture

Quatre notions avant de comparer quoi que ce soit

Le stockage distribué accumule vite le jargon, et les étiquettes marketing n'aident pas toujours. Avant d'entrer dans le vif, il vaut la peine de fixer quatre idées — ce sont elles qui séparent réellement un système d'un autre au moment de choisir.

POSIX parallèle vs. objet Un système de fichiers parallèle (chemins, permissions, open()/read()) répartit chaque fichier sur des centaines de serveurs qui le servent en même temps : c'est ce qu'attend le logiciel HPC classique. Le stockage objet n'a pas de répertoires, mais des clés et des objets via une API S3 : c'est le langage des data lakes et de l'IA moderne.
Bande passante vs. IOPS Le HPC classique veut des Go/s séquentiels pour écrire d'énormes checkpoints. L'entraînement d'IA veut souvent l'inverse : des millions de petits fichiers lus au hasard, où priment les IOPS et la performance des métadonnées. Presque aucun système n'est roi des deux.
Les métadonnées commandent Le serveur de métadonnées (MDS) est celui qui sait où se trouve chaque chose. Dans les charges d'IA avec des millions de petits fichiers, c'est souvent le premier goulot d'étranglement, avant le disque. Beaucoup de migrations échouent en dimensionnant bien le disque et en oubliant les métadonnées.
GPUDirect Storage Un chemin direct entre le stockage et la mémoire du GPU, sans passer par le CPU ni par un tampon intermédiaire en RAM. Moins de latence, moins de CPU consumé à déplacer des octets, et des GPU qui cessent d'attendre. C'est la pièce que l'IA moderne exige du stockage.
La distinction qui compte

Le meilleur stockage est celui qui correspond à votre charge de travail dominante. Si votre quotidien, ce sont des simulations qui écrivent des fichiers géants, vous cherchez de la bande passante séquentielle. Si c'est entraîner des modèles sur des millions d'images, vous cherchez des métadonnées rapides et des IOPS. Confondre les deux est l'erreur de conception la plus coûteuse que nous voyons.

02 · Les cinq prétendants

Qui joue dans quelle catégorie ?

Voici les cinq systèmes qui dominent le stockage sérieux pour l'IA et le HPC. Il n'y a pas de vainqueur unique : chacun a son point fort. Les barres comparent, à titre indicatif, deux axes presque toujours en tension : la performance de pointe qu'un système peut atteindre et la facilité d'exploitation au quotidien.

Ceph
Unifié · objet + bloc + fichier Performance de pointe Polyvalence / exploitation
Le couteau suisse
Storage Scale
POSIX parallèle · GPFS · IBM Performance de pointe Support / exploitation
Le cheval de trait entreprise
Lustre
POSIX parallèle · celui du TOP500 Performance de pointe Facilité d'exploitation
Le standard HPC
DAOS
Objet / KV sur NVMe Performance de pointe Facilité d'exploitation
La fusée de l'IO500
BeeGFS
POSIX parallèle · facile à déployer Performance de pointe Facilité d'exploitation
Le déploiement express
Barres indicatives · le meilleur système est celui qui correspond à votre charge, pas celui à la barre la plus longue
03 · Le tableau à montrer en réunion

Cinq systèmes en un coup d'œil

L'essentiel de chacun : quel type de stockage il est, où il brille, sous quelle licence il est distribué et quelle version est en production à la mi-2026.

SystèmeTypePoint fortLicenceVersion (2026)
CephUnifiéPlateformes hybrides IA + HPC, clouds privés, data lakes S3. Objet, bloc et fichier depuis un même cluster.Open source LGPL20.2.2 « Tentacle » (juin 2026)
IBM Storage ScalePOSIX parallèleHPC d'entreprise avec support et SLA, IA sur NVIDIA DGX BasePOD/SuperPOD, haute performance clé en main.Commercial IBM5.2.x
LustrePOSIX parallèleSupercalcul classique à bande passante maximale. Le standard du TOP500 quand une équipe sait l'exploiter.Open source GPLv22.17 (déc. 2025)
DAOSObjet / KVPerformance extrême sur NVMe pur. Le plus rapide de l'IO500, pour les charges où la latence est primordiale.Open source BSD2.6
BeeGFSPOSIX parallèleClusters HPC moyens à grands et groupes de recherche voulant de bonnes performances sans équipe de stockage dédiée.Community + Enterprise8.3.x
04 · Un par un

Ce que chacun fait bien (et ce qu'il ne fait pas)

Ceph — celui qui fait presque tout

Ceph est le couteau suisse du stockage distribué open source : il fournit de l'objet (S3 via RGW), du bloc (RBD) et du fichier (CephFS) depuis le même cluster, s'auto-répare et évolue en ajoutant des nœuds. Pour l'IA, cela donne RBD pour les machines d'entraînement, S3 pour le data lake et CephFS pour l'accès parallèle — avec une intégration native à OpenStack et Kubernetes. Ce n'est pas le roi de la performance de pointe en HPC extrême, mais sa polyvalence est sans rivale, et des déploiements comme les 50+ Po du CERN prouvent qu'il tient à grande échelle. La version 20.2.2 « Tentacle » (juin 2026) apporte Crimson pour les pools en erasure coding et des améliorations de chiffrement RGW. C'est aussi le gagnant naturel du vide laissé par MinIO, passé en « maintenance mode » fin 2025 — nous le détaillons dans notre guide Ceph vs MinIO 2026. Chez SIXE, nous le pratiquons au quotidien : Ceph pour l'IA & le HPC et formation officielle Ceph.

IBM Storage Scale (GPFS) — la performance avec un SLA

Jadis GPFS, puis Spectrum Scale, et aujourd'hui IBM Storage Scale : le même cheval de trait sous trois noms. C'est un système de fichiers parallèle POSIX mature, avec support entreprise, qui dans sa version 5.2.x intègre GPUDirect Storage de NVIDIA et la certification pour les plateformes DGX BasePOD/SuperPOD et Grace Blackwell. C'est le choix quand vous voulez la performance d'un FS parallèle sans dépendre de la capacité de votre équipe à reconstruire un Lustre à trois heures du matin : vous payez la licence, vous gagnez le SLA. Nous montons des infrastructures HPC avec Storage Scale + Spectrum LSF/SLURM et donnons la formation d'administration Storage Scale.

Lustre — le standard du TOP500

Lustre reste, et de loin, le système de fichiers le plus répandu en supercalcul : il fait tourner une part énorme des grands centres de calcul du monde. Il offre une bande passante séquentielle très élevée et évolue jusqu'à l'exaoctet. Le prix, c'est l'exploitation : ce n'est pas « installer et oublier », et il faut une vraie expertise pour le régler et le rétablir. La version 2.17 (décembre 2025) poursuit cette voie, avec la 2.18 qui prépare l'erasure coding au niveau du fichier (FLR-EC) et la compression côté client. Si vous venez de Lustre et cherchez du support commercial, nous avons écrit sur la migration de Lustre vers IBM Storage Scale.

DAOS — la fusée ressuscitée

DAOS est la réponse à « et si on jetait POSIX à la poubelle pour concevoir pour le NVMe à partir de zéro ? ». Résultat : il occupe les positions 1 et 2 de la liste de production IO500 (Argonne et LRZ, SC25), et 16 des 30 premiers du classement complet tournent sous DAOS. Il est né lié à la mémoire Optane d'Intel ; quand Intel a tué Optane, beaucoup l'ont enterré aussi. Mais depuis la version 2.6 (juillet 2024), il fonctionne uniquement avec des SSD NVMe et se porte très bien. Il est désormais gouverné par la DAOS Foundation sous l'égide de la Linux Foundation (Argonne, HPE, Google Cloud, Intel), après le transfert de l'équipe d'Intel à HPE en 2024. C'est l'option de performance maximale pour qui dispose de NVMe pur et d'une charge qui le justifie — pas un remplacement général.

BeeGFS — le facile à vivre

BeeGFS est le FS parallèle qui privilégie le fait de pouvoir le déployer un mardi après-midi sans doctorat en stockage. Il offre de très bonnes performances pour des clusters moyens et reste le favori de nombreux groupes de recherche pour sa simplicité. Attention à un changement important : depuis BeeGFS 8, l'édition Community reste gratuite mais exige de générer une licence communautaire (beegfs license), et les fonctions entreprise passent derrière une licence payante. La version stable en 2026 est la 8.3.x.

Le schéma qui revient

Remarquez la tension : Lustre et DAOS offrent la performance maximale mais exigent une équipe experte. Storage Scale achète cette performance avec une licence et du support. Ceph et BeeGFS renoncent à un peu de pointe en échange d'une vie plus simple. Aucune option n'est gratuite : chacune échange de la performance contre de la simplicité, ou du coût de licence contre du support.

05 · L'axe qui décide vraiment

Votre charge, c'est du HPC classique ou de l'IA ?

Avant de regarder les marques, regardez votre charge. La question qui ordonne la décision n'est pas « lequel est le meilleur ? » — c'est ce que vous allez demander au stockage. Voici les deux profils et ce dont chacun a besoin.

HPC classique
  • Simulation, CFD, dynamique moléculaire, météo
  • Écrit d'énormes checkpoints de façon séquentielle
  • Ce qu'il veut : des Go/s de bande passante soutenus
  • Gros fichiers, accès plus prévisible
  • Convient à : Lustre, Storage Scale, BeeGFS
Charge IA / ML
  • Entraînement et inférence sur des jeux de données massifs
  • Lit des millions de petits fichiers au hasard
  • Ce qu'il veut : IOPS, métadonnées rapides et GPUDirect
  • Doit alimenter les GPU sans les laisser inactifs
  • Convient à : DAOS, Storage Scale, Ceph (S3)

La plupart des plateformes modernes mêlent les deux, et c'est pourquoi le stockage open source pour l'IA et le HPC tend vers des architectures hybrides : un FS parallèle pour le calcul et du stockage objet S3 pour le data lake, cohabitant souvent sur Ceph + OpenStack + Kubernetes.

06 · Comment choisir sans regret

Quatre étapes avant de signer quoi que ce soit

Définissez votre charge dominante

Avant de regarder les produits, mesurez. Écrivez-vous quelques fichiers géants ou lisez-vous des millions de petits ? Est-ce la bande passante ou les métadonnées qui limitent ? Cette seule réponse élimine déjà la moitié des options. Et ne vous fiez pas qu'à l'aujourd'hui : dimensionnez pour la charge que vous aurez quand le projet d'IA grandira.

Décidez : open source avec équipe, ou support avec SLA

Lustre et DAOS sont gratuits en licence mais coûteux à exploiter : il faut des gens qui les connaissent. Storage Scale inverse l'équation : vous payez la licence et achetez la tranquillité. Ceph et BeeGFS se situent entre les deux. La vraie question est : avez-vous — ou voulez-vous — une équipe de stockage ?

Regardez l'écosystème que vous avez déjà

Vous faites déjà tourner OpenStack ou Kubernetes ? Ceph s'y intègre comme un gant. Vous avez des NVIDIA DGX / BasePOD ? Storage Scale est certifié. Du NVMe pur et soif de latence ? DAOS. Le meilleur stockage est souvent celui qui crée le moins de friction avec ce qui est déjà en production.

Testez à l'échelle avant de vous engager

Un benchmark sur quatre nœuds ne prédit pas le comportement à quarante. Testez avec votre charge réelle, pas celle, synthétique, de la fiche technique, et surveillez les métadonnées sous concurrence. Ici, l'expérience fait gagner des mois — et évite un achat à six chiffres mal orienté.

Là où SIXE intervient

Concevoir la couche de stockage d'une plateforme d'IA ou de HPC, comparer Ceph, Storage Scale, Lustre, DAOS ou BeeGFS pour votre cas, ou migrer de l'un à l'autre sans perdre de données ni de sommeil — chez SIXE, nous cumulons plus de 15 ans au croisement du stockage distribué, d'IBM Power et de l'open source. Voir support Ceph et IBM Storage.

Résumé

L'essentiel en 5 points

À retenir de cet article

Le stockage décide si vos GPU travaillent ou attendent. Il est aussi stratégique que le cluster de calcul lui-même.

→ Il n'y a pas de « meilleur » : il y a le meilleur pour votre charge. Le HPC classique veut de la bande passante ; l'IA veut des métadonnées, des IOPS et GPUDirect.

DAOS mène en performance (1er et 2e de l'IO500), Lustre en prévalence, Storage Scale en support entreprise.

Ceph est le choix polyvalent pour les architectures hybrides IA + HPC ; BeeGFS, le plus facile à déployer.

→ Avant de choisir : définissez la charge, tranchez open source vs. SLA, regardez votre écosystème et testez à l'échelle réelle.

FAQ

Questions fréquentes

Ceph ou Lustre : lequel est meilleur pour l'IA ?

Cela dépend de la charge. Lustre offre plus de bande passante séquentielle et reste la référence du supercalcul classique, mais il demande une vraie expertise pour être exploité. Ceph est plus polyvalent : il fournit de l'objet (S3), du bloc et du fichier à la fois, s'intègre à OpenStack et Kubernetes, et son stockage objet convient aux data lakes d'IA. Pour l'entraînement à grande échelle avec d'énormes checkpoints, Lustre ou Storage Scale ; pour les plateformes hybrides et les data lakes, Ceph.

DAOS est-il prêt pour la production ?

Oui, dans son créneau. Il occupe les positions 1 et 2 de la liste de production IO500 (SC25) et est gouverné par la DAOS Foundation sous l'égide de la Linux Foundation. Depuis la version 2.6 (juillet 2024), il fonctionne uniquement avec des SSD NVMe, sans Optane. C'est l'option de performance maximale, mais elle exige du matériel NVMe et une équipe spécialisée ; ce n'est pas un remplacement général de Lustre ou Ceph.

Storage Scale, c'est la même chose que GPFS ou Spectrum Scale ?

Oui. C'est le même produit IBM sous différents noms : GPFS, puis IBM Spectrum Scale, et aujourd'hui IBM Storage Scale. En 2026, il en est à la 5.2.x et prend en charge GPUDirect Storage de NVIDIA et la certification DGX BasePOD/SuperPOD.

BeeGFS est-il toujours gratuit ?

L'édition Community reste gratuite, mais depuis BeeGFS 8 il faut générer une licence communautaire avec beegfs license. Les fonctions entreprise passent derrière une licence payante. La version stable en 2026 est la 8.3.x.

Peut-on utiliser Ceph pour du HPC exigeant ?

Ceph figure sur la liste de production IO500 et il existe des déploiements massifs (le CERN dépasse 50 Po), mais pour du HPC à performance extrême il ne remplace généralement pas Lustre, Storage Scale ou DAOS. Sa force réside dans les architectures hybrides HPC + IA : objet, bloc et fichier depuis un même cluster, intégrés à OpenStack et Kubernetes.

Stockage IA / HPC · Open Source

Vos GPU calculent-ils ou attendent-ils ?

Dites-nous quelle charge vous allez déplacer, combien de GPU et ce que vous avez aujourd'hui en infrastructure. Nous vous répondons en moins de 24 heures avec une ébauche d'architecture de stockage et une idée réaliste de l'effort. Si Ceph convient, nous vous le disons. Si c'est plutôt Lustre, Storage Scale ou DAOS, aussi.

SIXE