HPC Advance SLURM Administration

SLURM Deployment & Administration Training Syllabus
Sr. No.SyllabusDuration40 Hours5 days x 8 Hours
1Foundations & InstallationDay 1  
 HPC concepts and workload management.   
 SLURM overview: architecture, components (slurmctld, slurmd, slurmdbd).   
 Comparison with other schedulers (PBS, LSF).   
 Environment preparation: OS installation, networking, NTP, kernel tuning, security basics.   
 Installing prerequisites: Munge authentication, development tools, Munge Key   
 Building/Installing SLURM from repositories.    
2Core ConfigurationDay 2  
 Understanding slurm.conf structure   
 Node definitions, partitions, parameters.   
 Configuring accounting database (slurmdbd).   
 Initial testing of SLURM setup.   
 Setting up job submission and queues.   
3Job Scheduling & Resource ManagementDay 3  
 Job submission scripts and resource requests (CPU, memory, GPU)   
 SLURM commands: srun, sbatch, squeue, scancel.   
 Advanced scheduling: reservations, priorities, fair‑share scheduling   
 Configuring QoS (Quality of Service).   
 Troubleshooting job failures.   
 Log Analysis   
     
4Advanced Features & MonitoringDay 4  
 SLURM accounting and reporting.   
 Integrating with MPI/OpenMP workloads.   
 GPU jobs scheduling   
 Monitoring tools: sacct, sstat, scontrol.   
 Performance tuning and scaling strategies.   
 IOR Benchmarking   
 Application Benchmarking   
5Administration & TroubleshootingDay 5  
 High availability (HA) setup for SLURM controllers   
 Backup and disaster recovery strategies.   
 Common troubleshooting scenarios.   
 Security hardening and best practices.   
 SLURM Upgrade   
 DB Restore Process   
6Hands‑on labs   
 Deploying a small SLURM cluster, running workloads.   
 Submitting jobs to SLURM scheduler   
 scontrol – job output  and logs anslysis   
 Final assessment and certification.    
     
8Workshop Format   
 Duration: 40 hours (5 days × 8 hours).   
 Frequency: 2 sessions per week (Thursdays & Fridays)   
 OR  Weekends – (Saturday & Sunday)   
 Mode: Online or onsite, theory + hands‑on labs   
 Audience:HPC admins, lab engineers, technical architects, DevOps professionals.   
 Ideal for beginners or those new to HPC clusters.