[2026年6月3日提交 (v1),最后修订于2026年7月29日(此版本,v3)]
摘要:消费多通道标量信号的 Transformer 必须将 $C$ 个同时值嵌入每个时间步的一个 $d_{\text{model}}$ 维向量。我们审计了八种输入编码器——共享标量基线、每通道线性投影、正交性正则化器、非线性 MLP、分块连接、通道独立和通道作为 token 的架构,以及投影位置编码——在一个通道身份有信息量的合成基准和 ETTh1 上,以下一步负对数似然评分。标题是实际近似等效在一个宽泛的“顶层”内:标准的每通道线性投影在统计上真实但实际微小的差异内匹配所有替代方案。直接几何探针将其归因于每通道投影的自发正交化:没有显式正则化器,它们远超随机初始化的近正交性收紧,让标准线性从求和嵌入中恢复通道身份。两种编码器决定性失败:共享标量基线因我们明确的信息论原因崩溃,通道独立的 PatchTST 精神基线在合成基准上普遍过拟合,并在两者上表现不佳。配对测试解决了两个小差距:通过学习线性层投影正弦位置编码在小 $C$ 时通过将这种正交性扩展到位置子空间而领先;非线性 MLP 干在最大 $C$ 时领先,差距在更多训练数据下缩小。实际建议:默认使用标准的每通道线性投影;仅当任务需要时才采用更复杂的方案。
提交历史
来自:Ossi Lehtinen [查看邮件]
[v1]
2026年6月3日 星期三 11:35:09 UTC (46 KB)
[v2]
2026年6月8日 星期一 08:15:04 UTC (46 KB)
[v3]
2026年7月29日 星期三 07:52:45 UTC (48 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.