Aller au contact
Formation HPC · 2 jours · ordonnanceur open source

SLURM
administration de base de cluster HPC

Deux jours pour déployer, exploiter et déboguer un cluster SLURM Workload Manager en production : installation de slurmctld, slurmd et slurmdbd, partitions et QoS, politiques fairshare et backfill, gestion de CPU, GPU et mémoire avec GRES, accounting et dépannage. L'ordonnanceur open source du MareNostrum et de la majorité du Top500 — le cousin libre d'IBM Spectrum LSF.

Durée 2 jours · 16 h
Niveau Intermédiaire · admin Linux
Pratique Cluster HPC réel
Format En ligne ou présentiel
slurm Workload Manager
SLURM Workload Manager Cluster HPC sbatch · srun · squeue Fairshare & backfill GPU avec GRES MUNGE auth slurmdbd accounting vs LSF · PBS · Torque slurmctld · slurmd SLURM Workload Manager Cluster HPC sbatch · srun · squeue Fairshare & backfill GPU avec GRES
[ 01 ]Pourquoi cette formation

De sbatch à l'exploitation
d'un cluster SLURM en production.

Deux jours avec un cluster SLURM réel dans nos laboratoires : contrôleur, backup et nœuds de calcul, partitions configurées, CPU et GPU partagés avec GRES, et charges de simulation réelles pour exercer l'exploitation quotidienne. Vous ressortez en exploitant le système, pas seulement avec des notes.

Nous couvrons ce qui apparaît chaque jour en production — soumission et contrôle des travaux avec sbatch, srun et squeue, conception des partitions et QoS, politiques fairshare et backfill, limites par utilisateur, compte et association, accounting avec slurmdbd et débogage quand quelque chose casse. Complément naturel de la formation IBM Spectrum LSF — vous couvrez les deux ordonnanceurs qui se partagent le marché HPC.

[ 02 ]Pour qui · ce que vous en retirez

Une formation pour les équipes qui administrent ou migrent du HPC sérieusement

C'est pour votre équipe si…

  • Vous êtes administrateurs Linux et vous allez déployer ou maintenir un cluster SLURM en production.
  • Vous venez de LSF, PBS ou Torque et devez passer à SLURM, ou faire cohabiter les deux pendant la migration.
  • Vous gérez des charges batch scientifiques — simulation, CFD, bio-informatique, ML, rendu — avec priorisation par projet.
  • Vous devez partager CPU, GPU et mémoire entre groupes avec des règles claires, des limites justes et un accounting auditable.

À la fin vous exploitez

  • Vous installez SLURM de zéro sur RHEL ou Debian avec slurmctld, slurmd, slurmdbd et MUNGE.
  • Vous soumettez et contrôlez les travaux avec sbatch, srun, squeue, scancel et sinfo.
  • Vous concevez des partitions et QoS avec fairshare, backfill, limites et priorité par projet.
  • Vous configurez les GPU via GRES, les limites par association et l'accounting réel avec slurmdbd.
  • Vous administrez et déboguez avec logs, sacct et scontrol quand un travail se bloque ou qu'un nœud tombe.
[ 03 ]Programme · 2 jours

De l'architecture SLURM à l'exploitation quotidienne

Deux jours qui construisent le même cluster couche par couche : nous partons des fondamentaux et du déploiement, puis montons jusqu'aux partitions, aux politiques fairshare, à l'accounting et au dépannage comme en production réelle.

01 Jour 1 · Fondamentaux et installation

Architecture, déploiement et première soumission

  • Ce que résout SLURM et comparaison avec LSF, PBS et Kubernetes pour le HPC.
  • Architecture : slurmctld, slurmd, slurmdbd et MUNGE ; contrôleur, backup et nœuds.
  • Installation pas à pas sur RHEL ou Debian et vérification du cluster.
  • Première soumission avec sbatch et srun ; consultation avec squeue, sinfo et scontrol.
Pratique sur cluster réel
02 Jour 2 · Partitions, politiques et exploitation

Ressources, QoS, accounting et dépannage

  • Conception des partitions et QoS ; limites par utilisateur, compte et association.
  • Politiques fairshare, backfill et préemption avec priorité multifactorielle.
  • GPU et ressources génériques (GRES) ; affectation par travail et par partition.
  • Accounting avec slurmdbd et sacct ; débogage avec logs, scontrol et sdiag.
Pratique sur cluster réel
[ 05 ]Questions fréquentes

Questions fréquentes

Quelle expérience préalable est nécessaire ?

Administration Linux de base — bash, permissions, réseau, systèmes de fichiers partagés (NFS ou équivalent). Aucune expérience préalable avec SLURM ni d'autres ordonnanceurs n'est requise. Si vous venez de LSF, PBS ou Torque, les concepts vous seront familiers.

Quand choisir SLURM plutôt qu'IBM Spectrum LSF ?

SLURM est le standard de facto dans le HPC académique et scientifique : open source, sans coût de licence, communauté immense et présence sur la majorité du Top500 — dont le MareNostrum du BSC. LSF reste le choix quand l'entreprise a besoin de SLA contractuels, du support officiel IBM et d'une gestion fine des licences onéreuses (EDA, CAE). Nous menons la comparaison pratique en cours.

Sur quelle infrastructure se déroulent les travaux pratiques ?

Sur un cluster HPC réel de nos laboratoires avec contrôleur, contrôleur de secours et plusieurs nœuds de calcul. Chaque participant travaille contre un environnement qui simule la production, pas une machine virtuelle isolée.

Les GPU et accélérateurs sont-ils couverts ?

Oui. La gestion des GPU via GRES est couverte dans le bloc ressources : comment les déclarer, les affecter par travail, les partager entre utilisateurs et les comptabiliser. Le même modèle s'applique aux autres accélérateurs.

Cette formation inclut-elle scripting avancé et tuning ?

C'est la formation d'administration de base — elle couvre le déploiement complet et l'exploitation quotidienne. Le tuning fin de l'ordonnanceur, les intégrations spécifiques (Lustre, GPFS, conteneurs) et les architectures multi-cluster sont dispensés en formations avancées intra-entreprise sur mesure une fois que l'équipe a une base solide.

Quelles modalités sont disponibles ?

Contactez-nous pour connaître les modalités et dates. Nous dispensons la formation en français, anglais et espagnol, en ligne en direct ou en présentiel, et nous préparons des sessions intra-entreprise sur mesure sur votre cluster réel.

Quel est le prix ?

Le prix est calculé par groupe et dépend du format, de la langue et de la modalité. Parlez-nous de votre projet — nombre de participants, lieu et dates cibles — et nous vous renvoyons une proposition concrète.

Peut-on la suivre avec la formation LSF ?

Oui — c'est courant pour les équipes qui exploitent du HPC mixte ou qui migrent entre ordonnanceurs. Nous pouvons enchaîner les deux formations (2+3 jours) ou concevoir un parcours intra-entreprise avec l'équilibre dont a besoin votre équipe. Écrivez-nous avec votre scénario.
[ 06 ]   Demander plus d'informations

Parlez-nous de votre cluster

Dites-nous combien vous êtes, en quelle langue, quelle version de SLURM vous utilisez (ou de quel ordonnanceur vous venez) et si c'est en ligne ou en présentiel. Nous vous renvoyons une proposition concrète — format, dates et équipe pédagogique — pas un devis générique.

Téléphone+34 91 198 02 43
PrixSur demande par groupe
LanguesFR · EN · ES
SIXE