摘要

提出一种GPU集群下用户服务质量QoS感知的深度学习研发平台上的动态任务调度方法。采用离线评估模块对深度学习任务进行离线评测并构建计算性能预测模型。在线调度模块基于性能预测模型,结合任务的预期QoS,共同开展任务放置和任务执行顺序的调度。在一个分布式GPU集群实例上的实验表明,该方法相比其他基准策略能够实现更高的QoS保证率和集群资源利用率。