多代理系統自主優化 NVIDIA GPU 核心,速度提升 38%

Cursor 分享使用多代理系統優化 GPU kernel 的實際案例,達到顯著效能提升,是高度實戰的應用分享。

Cursor 開發的多代理系統成功為 NVIDIA Blackwell 200 GPU 自主優化了 235 個 CUDA 核心。 該系統在僅三週內,相較於基準線實現了38% 的幾何平均速度提升,其中 19% 的問題更達到兩倍以上效能。 • 這些效能改進通常需經驗豐富的核心工程師數月或數年才能達成,而多代理系統以周為單位實現,解決了傳統方法難以觸及的長尾問題。 • NVIDIA 利用 SOL-ExecBench 從 124 個真實世界的開源模型中生成了 235 個優化問題,確保了測試的實用性與挑戰性。 • 該系統能夠在低階硬體層面(CUDA C with inline PTX)進行推理,並純粹從文檔中學習高階 API(CuTe DSL),展現了優異的適應性。 • 實例包括針對注意力機制運用特殊硬體指令、處理混合專家模型的量化瓶頸,以及從頭生成高效的矩陣乘法核心。

「這些優化層次通常僅透過經驗豐富的核心工程師數月或數年的工作才能找到。」這項成就大幅加速了 AI 模型訓練與推論,降低了成本與延遲。


來源:Cursor Blog

閱讀原文 ↗

標籤:#cursor

← 回首頁