[2019 ATC] Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads
One-line Summary
Paper Structure Outline
Background & Motivation
Microsoft Philly


Impact of Locality Awareness
Queueing Delays


GPU Utilization




Training Progress and Completion

Training Iterations

Job Failures

Guidelines
Links
Previous[2018 NIPS] Dynamic Space-Time Scheduling for GPU InferenceNext[2019 NSDI] Tiresias: A GPU Cluster Manager for Distributed Deep Learning
Last updated