顯卡VRAM不夠SSD來湊 NVIDIA發表cuFile API開源技術

ai-storage-fms-1920x1080-1

 

面對大型 AI 運算技術會大幅占用記憶體,導致顯示卡、AI 運算卡的 HBM、GDDR 記憶體需要面臨高昂的容量成本與效率瓶頸,NVIDIA 發表 cuFile API 開源技術,能 GPU 在必要時直接將資料存取於 SSD 中,減少記憶體溢出需要分段訓練的麻煩。

 

NVIDIA 在 FMS 未來記憶體與儲存展上 cuFile API 技術,開技術基於 NVIDIA GPUDirect Storage (GDS) 架構中的開源核心元件,用以解決 GPU 在 AI 訓練上的記憶體容量困境,實現 GPU 可對 SSD 進行直接讀寫的操作。

 

一般 AI 訓練時,如果 GPU 的 HBM/GDDR 不足,需要工程團隊預先設定分段式訓練的指令,將原有的大型數據分切成多個小段落,將每個訓練段落的資料重新組裝後,再重新跑一次。過程需要頻繁的資料搬遷,讓 AI 訓練的過程相當沒效率。

 

而 cuFile API 便是略過傳統 GPU 資料調取需要先向 CPU 申請,再從 SSD 搬到 RAM 系統記憶體、最後才進到 VRAM 顯示記憶體的過程,降低了 CPU 與 RAM 的占用。

 

同時, cuFile API 能夠以微秒級的速率,將 VRAM 與 SSD 之間的資料進行調換,實現串流的連續資料存取,解決傳統爆記憶體需要先排空 VRAM,再重新填入的過程,理論上,提升的不只是效率,還可提升穩定性。

 

不過這個方案也是有代價的,由於高頻率抽換 SSD 與 VRAM 之間的數據,SSD 的寫入壽命會大幅消耗,但這點在企業機房的架構上,通常可以透過指定特定 SSD 當作快取使用,避免主要檔案發生損壞。

 

最後,這項技術由於需要依賴 Peer-to-Peer (P2P) PCIe 傳輸功能,這在消費級的 GeForce 顯卡產品上是被拔掉的,因此不適用一般人在家中用 RTX 50 系列顯卡跑 AI ,也無法應用在改善遊戲爆 VRAM 的問題。

推薦電競新聞

繼續閱讀
Source 顯卡VRAM不夠SSD來湊 NVIDIA發表cuFile API開源技術 https://www.4gamers.com.tw/news/detail/81210/nvidia-launches-chfile-api……