论文 FAASHARE:Enabling Generic Low-Latency and SLO-Aware GPU Sharing in Serverless Computing 被 IEEE Transactions on Parallel and Distributed Systems(CCF-A)接收,恭喜卓龙!
论文主题内容介绍
研究背景
Serverless Computing,也就是 Function as a Service(FaaS),已经成为云计算中的重要计算范式。它以函数作为最小执行单元,具有弹性伸缩、轻量部署和低运维成本等优势,适合支撑在线推理、视频处理、科学计算和大模型服务等计算密集型应用。然而,现有 Serverless 平台对 GPU 等高性能加速器的支持仍然不足,导致 GPU 函数在实际运行中容易出现冷启动延迟高、SLO 难以保证以及 GPU 利用率低等问题。
具体而言,GPU 函数的冷启动不仅包含容器启动开销,还包含 CUDA Context 初始化、PyTorch/TensorFlow/cuDNN 等依赖库加载开销。对于延迟敏感型任务,这些开销可能远高于任务本身的执行时间。同时,在多函数共置执行时,不同任务会竞争 SM、显存带宽和缓存等 GPU 资源,造成任务执行时间波动,进而导致 SLO 违约。虽然 NVIDIA MPS 能够支持多个进程共享 GPU,但它并不能自动为不同任务分配合适的资源比例,也难以缓解复杂共置场景下的资源竞争问题。
为解决上述问题,本文提出了面向 Serverless Computing 的低延迟、SLO 感知 GPU 共享框架——FAASHARE。该框架围绕 GPU Serverless 场景中的三个核心目标展开:降低冷启动延迟、保障函数 SLO、提升 GPU 共享效率。FAASHARE 通过 MSContainer 提供预热执行环境,利用 spatio-temporal priority queue scheduling 动态调整任务执行顺序,并结合 Bayesian Optimization 与 MPS 为共置任务搜索合适的 GPU 资源配置,从而实现面向多类型 GPU 函数的高效共享。
本文的核心贡献包括:
-
提出了一种面向 GPU Serverless 场景的低延迟、SLO 感知 GPU 共享框架 FAASHARE,在 Serverless 平台中同时优化冷启动、任务调度和 GPU 资源共享;
-
设计了一种新的容器抽象 MSContainer,通过 Prewarmer、Proxy、动态注入和 checkpoint 机制,为 GPU 函数提供预热执行环境,降低 CUDA 初始化和依赖库加载带来的冷启动开销;
-
设计了一种 spatio-temporal priority queue scheduling 机制,同时考虑任务的 SLO 紧急程度、显存占用和共置干扰,为不同类型的 Serverless 函数提供公平执行机会,并降低 SLO 违约风险;
-
构建了基于随机森林的性能预测模型,用于预测不同任务在 MPS 共置场景下的执行时间和性能退化,为调度决策和资源配置提供依据;
-
提出了一种结合 Bayesian Optimization 与 MPS 的 GPU 共享优化方法,通过离线 profiling、在线查表和异步 BO 更新,为共置任务快速选择合适的 MPS 配额,提升 GPU 利用率和系统吞吐。
实验结果
实验结果表明,FAASHARE 在 GPU Serverless 场景下显著优于现有系统。论文在包含 NVIDIA RTX 3090 和 RTX 4090 GPU 的测试环境中,使用原生 CUDA 应用、深度学习模型和大模型推理任务进行评估。结果显示,FAASHARE 能够有效降低冷启动开销,并在整体性能上优于 ElasticFlow、TGS、FluidFaaS 和 FaST-GShare 等方法。
相比当前最优方法,FAASHARE 将平均作业完成时间降低 23%,将 makespan 降低 33%,并将系统吞吐提升 18%。进一步地,在与多种 baseline 的整体对比中,FAASHARE 在平均 JCT、makespan 和 STP 三项指标上均取得最优结果,说明 MSContainer、spatio-temporal scheduling 和 BO-based GPU sharing 的协同设计能够有效提升 Serverless GPU 共享效率。
总体来看,FAASHARE 针对 GPU Serverless 中的冷启动、SLO 保障和 GPU 共享三个关键问题进行了系统性优化。该系统通过预热容器抽象降低函数启动延迟,通过时空优先级队列调度控制共置干扰,通过 BO 与 MPS 的结合提高资源配置效率,最终实现了低延迟、高吞吐和 SLO 感知的 GPU Serverless 执行框架,具有较强的系统实用性和通用性。
江卓龙个人介绍
- 研究方向:模型并行训练推理优化