Together GPU 叢集新功能:為生產環境帶來卓越可靠度與精準控制
Together AI Blog 介紹其 GPU 集群的可靠性與控制功能,偏向平台功能介紹。
Together GPU 叢集近期推出重大更新,旨在提升生產環境下大規模 GPU 訓練與推論作業的可靠性與控制力,以應對硬體故障、排程器問題等挑戰。更新主要聚焦於兩大核心主題:平台健康與操作控制。
• 在平台健康方面,Together 導入了: • 被動健康檢查,持續監測實際工作負載,即時發現異常。 • 自動節點修復功能,以「人機協作」模式推薦並執行修復動作。 • 重建的 Slurm-on-K8s 2.0 堆疊,實現了自我修復的 Worker 守護程式、耐用的作業記帳及可靠的程序清理,顯著提高 Slurm 叢集穩定性。
• 針對操作控制,新增功能包括: • 全新叢集詳情檢視,提供節點健康、即時使用情況及事件時間軸等全面資訊。 • Kubernetes RBAC 的外部 OIDC 支援,實現精細的權限管理、審計追蹤及使用者生命週期管理。
這些改進共同提供了更佳的叢集可視性、存取控制與客製化彈性,並將耗時的支援流程轉變為高效的產品內工作流程。
作者表示:「我們相信自動化結合人工參與:您的訓練檢查點和推論副本太寶貴,不能冒自動化清理的風險。」
來源:Together AI Blog
閱讀原文 ↗