讓煉丹更科學一些(十):單調性假設的拆與補

科學空間系列文章:探討最佳化演算法中單調性假設的拆解與補強,具深度的深度學習研究價值。

• 本文延續自適應梯度演算法的收斂框架,旨在移除過去理論中依賴的兩大「腳手架」:常數學習率與預條件矩陣的半正定單調性。 • 透過推導動態學習率的加權平均與終點收斂結論,成功將原本的標量學習率收斂性推廣至矩陣版,並從理論上肯定了線性衰減學習率排程的通用性。 • 針對非單調預條件矩陣(如 Adam、RMSProp 等演算法不滿足 $H_t \succeq H_{t-1}$ 的情形),作者探討了最小改動的修正方案。 • 透過將傳統 Trace 放縮改為利用最大特徵值 $\lambda_{\text{max}}$ 的精細放縮,成功在不依賴單調性假設的前提下,推導出更一般化的收斂新上界 $\Lambda_T$。 • 作者指出,雖然理論上 $\Lambda_T$ 的增長速度決定了收斂性,但實務中 Adam 等演算法的平穩性往往能帶來良好的表現。

能寫出收斂結論,不代表能完全保證收斂;關鍵在於 $\Lambda_T$ 關於 $T$ 的增長速度是否小於線性。


來源:科學空間

閱讀原文 ↗
← 回首頁