HPC SLURM Fast Track

SLURM Deployment & Administration Fast Track Syllabus

Sr. No.SyllabusDuration2 days16 hours (2 days × 8 hours).
1Installation & Core SetupDay 1  
 Introduction to HPC & SLURM   
 Role of workload managers in HPC clusters.   
 Linux prerequisites (Rocky 8.10/ALAMA 8.6)   
 Munge authentication setup.   
 Installing prerequisites: Munge authentication, development tools, Munge Key   
 Networking basics for cluster nodes.   
 SLURM Installation   
 Installing SLURM packages.   
 Initial configuration (slurm.conf basics).   
 Defining nodes and partitions.   
 Setting up job submission and queues.   
 Hands‑On Lab   
 Deploying a minimal SLURM cluster.   
 Testing node communication.   
 testing  srun jobs   
2Job Scheduling & AdministrationDay 2  
 Job Submission Basics   
 SLURM commands: srun, sbatch, squeue, scancel.   
 Writing simple job scripts.# sbatch job.sh   
 Monitoring & Troubleshooting   
 Checking job status and logs.   
 Common errors and fixes.   
 Troubleshooting job failures.   
 Log Analysis   
 Managing partitions and queues.   
 User access and limits.   
 Intro to accounting (sacct, scontrol).   
 Hands‑On Lab   
 Submitting jobs to the cluster.   
 Cancelling and rescheduling jobs.   
 Monitoring performance.   
     
     
8Workshop Format   
 Duration: 16 hours (2 days × 8 hours).   
 Frequency: 2 sessions per week (Thursdays & Fridays)   
 OR  Weekends – (Saturday & Sunday)   
 Mode: Online or onsite, theory + hands‑on labs   
 Audience:IT admins, HPC beginners, DevOps engineers.   
 Ideal for Quick deployment and basic management, not advanced scaling or HA setups    
 fast, practical exposure to SLURM for small clusters