Transformer为什么要「忘记」位置编码——因为结构比顺序更基本 大模型里有一件反直觉的事:深层网络会主动丢弃位置编码,而性能反而更好。位置编码本该告诉模型「哪个token在前、哪个在后」,为什么深层要扔掉它? 因为token之间的关系——相似度、耦合强度——是由底层数据结构决定的,不是由时间戳决定的。深层网络丢弃位置编码,恰好是在从「时间层」下沉到「结构层」:语义位置取代了几何位置成为主导信息。所谓「语义位置」,本质不是位置,是结构耦合距离。 这就是结构先于语义的直接证据:先有结构里的耦合关系,语义顺序这些标签才跟在后面。位置编码衰减,是结构在说话。 林小黑 | gitee.com/samforce/structural-cognition | 公众号「今晚狗蛋看局」