[Submitted on 3 Jun 2026 (v1), last revised 29 Jul 2026 (this version, v3)]
Abstract:消耗多通道純量訊號的轉換器必須在每個時間步將 $C$ 個同時出現的數值嵌入一個 $d_{\text{model}}$-維向量。我們審核了八種輸入編碼器——共享純量基準、每通道線性投影、正交正則化器、非線性 MLP、分區串接、通道獨立與通道作為 token 的架構,以及投影位置編碼——在通道身分具有資訊性的合成基準以及 ETTh1 上進行評測,評分依據為下一步負對數似然。重點發現是實務上在廣泛的「頂級層級」中近乎等價:標準的每通道線性投影在統計上確實但實際差異微小的情況下,與所有替代方案不相上下。直接的幾何探查將此歸因於每通道投影的自發正交化:即使沒有明確的正則化器,它們也會比隨機初始化的近正交性更緊密,讓標準線性投影能從加總的嵌入中恢復通道身分。有兩種編碼器明顯落敗:共享純量基準因我們明確陳述的資訊理論原因而崩壞,而遵循 PatchTST 精神的通道獨立基準則在合成基準上普遍過擬合,並在兩個資料集上表現不佳。配對檢定解決了兩個微小差距:將正弦位置編碼經由學習到的線性層投影,在小 $C$ 時透過將正交性延伸至位置子空間而略勝一籌;非線性 MLP 主幹則在大 $C$ 時略勝一籌,且差距在更多訓練資料下會縮小。實務建議:預設使用標準的每通道線性投影;僅在任務需要時才採用更複雜的方案。
Submission history
From: Ossi Lehtinen [view email]
[v1]
Wed, 3 Jun 2026 11:35:09 UTC (46 KB)
[v2]
Mon, 8 Jun 2026 08:15:04 UTC (46 KB)
[v3]
Wed, 29 Jul 2026 07:52:45 UTC (48 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.