使用 AIPerf 進行大規模 LLM 推論效能基準測試

NVIDIA 開發者部落格介紹使用 AIPerf 進行大規模 LLM 推理基準測試的方法。

• AIPerf 是 NVIDIA 針對大型語言模型推出的新一代基準測試工具,作為 GenAI-Perf 的全面改寫版本,旨在解決舊架構的效能瓶頸。 • 採用多行程架構(Multiprocessed System),透過工作行程產生負載、獨立服務處理結果並利用 ZMQ 進行協調,避免用戶端成為基準測試的效能瓶頸。 • 支援超過 15 種端點類型以及多種公開資料集與流量回放格式,並能靈活控制常態、卜瓦松(Poisson)與伽瑪等負載到達模式。 • 提供包含 TTFT(首字延遲)、ITL(token 間延遲)、請求延遲與輸出 token 產量在內的關鍵指標,並支援 DCGM 整合以同步追蹤 GPU 效能。

AIPerf 能透過精準的參數設定來模擬真實的流量特徵,幫助開發者在部署模型時取得可信賴的效能數據。


來源:NVIDIA Developer

閱讀原文 ↗
← 回首頁