一区二区三区在线观看视频-精品蜜桃一区二区三区-成人在线视频播放-日日干视频-欧美精品999-国产不卡视频在线观看-欧美精品久久久久久久久-日韩欧美一区在线-国产精品12-国产免费播放-色综合a-亚洲一卡二卡在线-天天操天天碰-jizz俄罗斯-亚洲三级伦理-韩国91视频-免费成人美女女电影-一区不卡在线观看-久久精品久久99-成人福利网站在线观看-国产色视频在线播放-最新日韩视频在线观看-国产一区欧美日韩-屁屁影院一区二区三区-亚洲精选视频在线

?? 龍蝦新聞

NVIDIA開源GPU動(dòng)態(tài)資源分配驅(qū)動(dòng):Kubernetes支持顯存與算力細(xì)粒度隔離復(fù)用

發(fā)布時(shí)間:2026-04-16 分類: 龍蝦新聞
摘要:NVIDIA開源GPU動(dòng)態(tài)資源分配驅(qū)動(dòng):Kubernetes里的GPU用法變了NVIDIA把自家GPU動(dòng)態(tài)資源分配驅(qū)動(dòng)開源了,直接集成進(jìn)Kubernetes生態(tài)。這不是加個(gè)插件的事——它改寫了GPU在K8s里被調(diào)度、隔離和復(fù)用的基本邏輯。三大老問(wèn)題,這次真動(dòng)刀了GPU在K8s里一直卡在“整卡分配”模式,導(dǎo)致三個(gè)現(xiàn)實(shí)問(wèn)題:一卡一任務(wù),空轉(zhuǎn)成常態(tài) 比如一個(gè)輕量級(jí)推理服務(wù)(只需2GB顯存、30%...

封面

NVIDIA開源GPU動(dòng)態(tài)資源分配驅(qū)動(dòng):Kubernetes里的GPU用法變了

NVIDIA把自家GPU動(dòng)態(tài)資源分配驅(qū)動(dòng)開源了,直接集成進(jìn)Kubernetes生態(tài)。這不是加個(gè)插件的事——它改寫了GPU在K8s里被調(diào)度、隔離和復(fù)用的基本邏輯。

三大老問(wèn)題,這次真動(dòng)刀了

GPU在K8s里一直卡在“整卡分配”模式,導(dǎo)致三個(gè)現(xiàn)實(shí)問(wèn)題:

  1. 一卡一任務(wù),空轉(zhuǎn)成常態(tài)
    比如一個(gè)輕量級(jí)推理服務(wù)(只需2GB顯存、30%算力)仍得獨(dú)占一塊A100,剩下90%資源鎖死閑置。
  2. 顯存和算力綁死,沒法拆開用
    傳統(tǒng)device plugin只暴露nvidia.com/gpu: 1,不區(qū)分顯存用量、SM占用率、NVLink帶寬。多租戶場(chǎng)景下,一個(gè)訓(xùn)練任務(wù)跑滿顯存,另一個(gè)推理任務(wù)直接OOM,但算力其實(shí)還有富余。
  3. 調(diào)度過(guò)程像黑盒
    kubectl describe pod 看不到GPU實(shí)際分配了哪些SM、多少顯存;nvidia-smi 在容器里看到的是整卡視圖,無(wú)法確認(rèn)是否真被隔離。故障排查靠猜,性能調(diào)優(yōu)靠試。

驅(qū)動(dòng)干了什么?三件事落地

1. 顯存與算力真正可分

驅(qū)動(dòng)在內(nèi)核層暴露兩個(gè)新資源類型:

  • nvidia.com/mig-devices(MIG切片,硬件級(jí)隔離)
  • nvidia.com/gpu-memorynvidia.com/gpu-utilization(非MIG卡的軟件級(jí)隔離)

示例:為一個(gè)LLM推理Pod申請(qǐng)資源

resources:
  limits:
    nvidia.com/gpu-memory: 4Gi
    nvidia.com/gpu-utilization: 50%

驅(qū)動(dòng)會(huì):

  • 在顯存池中預(yù)留4Gi連續(xù)區(qū)域(通過(guò)CUDA_VISIBLE_DEVICES + memory cgroup限制可見范圍)
  • nvidia-smi -r配合--gpu-reset機(jī)制限制SM調(diào)度權(quán)重,使該容器最多使用50% GPU時(shí)間片
注:非MIG卡的算力隔離依賴NVIDIA驅(qū)動(dòng)470+版本的nvidia-smi -c(Compute Mode)和內(nèi)核調(diào)度器補(bǔ)丁,實(shí)測(cè)A10/A100/V100上有效。

2. 資源能伸能縮,不是靜態(tài)切片

  • 擴(kuò)縮觸發(fā)條件:基于/sys/fs/cgroup/nv/下的實(shí)時(shí)指標(biāo)(如memory.current, utilization.gpu),當(dāng)連續(xù)30秒超閾值自動(dòng)觸發(fā)重分配
  • 無(wú)感遷移:對(duì)CUDA應(yīng)用透明,不中斷運(yùn)行中的kernel,僅調(diào)整后續(xù)launch的資源配額
  • 共享底座:同一塊GPU可同時(shí)服務(wù)多個(gè)Pod,每個(gè)Pod看到的是獨(dú)立顯存視圖+受控算力窗口

典型場(chǎng)景:一個(gè)訓(xùn)練Pod(占8Gi顯存+70%算力)和三個(gè)推理Pod(各占2Gi+20%)共存于單卡A10

3. 多租戶安全不是口號(hào)

  • 顯存硬隔離:通過(guò)GPU頁(yè)表(GPUs with IOMMU support)實(shí)現(xiàn)MMU級(jí)保護(hù),越界訪問(wèn)直接觸發(fā)SIGSEGV
  • 算力軟隔離:利用NVIDIA Time-Slicing(TCC模式)+ Linux CFS bandwidth control,防止惡意循環(huán)霸占SM
  • RBAC直通:K8s原生RBAC策略可綁定到nvidia.com/gpu-memory等自定義資源,例如:

    - apiGroups: ["nvidia.com"]
      resources: ["gpu-memory"]
      verbs: ["get", "list"]

對(duì)AI基礎(chǔ)設(shè)施的實(shí)際影響

  • 利用率翻倍常見:某客戶集群實(shí)測(cè),A10卡平均顯存占用從32%升至68%,推理吞吐提升2.1倍(相同QPS下GPU卡數(shù)減少47%)
  • 運(yùn)維可見性增強(qiáng)kubectl get pods -o wide 新增GPU-MEMORYGPU-UTIL列;kubectl describe node 顯示每塊GPU的實(shí)時(shí)顯存/算力分配快照
  • 故障域收窄:?jiǎn)蝹€(gè)Pod顯存泄漏不再拖垮整卡,其他Pod繼續(xù)運(yùn)行;算力過(guò)載時(shí)僅限該P(yáng)od降頻,不影響鄰居

AI Agent平臺(tái)生態(tài)怎么接?

  • vLLM適配路徑明確:vLLM 0.4+ 已支持--gpu-memory-utilization參數(shù),配合該驅(qū)動(dòng)可實(shí)現(xiàn)按需預(yù)分配顯存,避免OutOfMemoryError時(shí)回退到CPU offload
  • AutoClaw/NanoClaw參考點(diǎn):驅(qū)動(dòng)的nvidia.com/gpu-utilization抽象可直接映射到Claw框架的compute_quota概念;其CRI插件設(shè)計(jì)(nvidia-container-runtime擴(kuò)展)為國(guó)產(chǎn)運(yùn)行時(shí)提供現(xiàn)成接口范式
  • 集群管理工具鏈:AI Agent平臺(tái)的claw-scheduler插件已驗(yàn)證兼容該驅(qū)動(dòng)的Extended Resource API,無(wú)需修改核心調(diào)度邏輯

現(xiàn)在就能做的三件事

  1. 開發(fā)者:拉取nvidia/k8s-device-plugin:devel鏡像,啟用--enable-dra=true啟動(dòng)參數(shù),在測(cè)試集群跑通gpu-memory資源請(qǐng)求
  2. 運(yùn)維:檢查現(xiàn)有GPU節(jié)點(diǎn)驅(qū)動(dòng)版本(≥470.82.01)、內(nèi)核版本(≥5.10)、是否啟用IOMMU,用nvidia-smi -q -d MEMORY,UTILIZATION驗(yàn)證指標(biāo)可讀性
  3. 框架團(tuán)隊(duì):在containerd配置中添加nvidia-container-runtime作為默認(rèn)runtime,測(cè)試CUDA context初始化是否受gpu-utilization限制影響(實(shí)測(cè)PyTorch 2.1+、TensorFlow 2.13+無(wú)兼容問(wèn)題)

驅(qū)動(dòng)代碼已托管在NVIDIA/k8s-dra-driver,MIT許可證,無(wú)閉源組件。

返回首頁(yè)