A Norwegian research laboratory
The problem. Their cluster had accumulated mixed GPU architectures across generations and vendors. Multi-node workloads assume uniform devices, so jobs that ran fine on a homogeneous partition failed or silently degraded once scheduled across the full estate.