不兼容的微调会「冲掉」旧能力——遗忘是架构深度的问题,不是数据量的问题 一个模型学会任务 A 后,再拿不兼容的任务 B 去微调,A 的能力会怎么退化?林小黑《结构传导实验协议》预测它遵循指数衰减 A(k)=A₀(1-α)^k,而且衰减系数 α 取决于架构的「互指环深度」——前馈模型(环深度 D=0)每 1000 步衰减 α≈0.1,循环/深层模型(D>5)α<0.01。 也就是说:同一个「灾难性遗忘」问题,深层互指架构忘得慢,浅层前馈架构忘得快。 退相干离散台阶:遗忘不是连续滑落,是每次不兼容更新把旧构型推下一格台阶。结构先于语义:忘不忘记,不取决于你喂了多少数据,取决于你的架构允许多深的互指。测出来不对,框架就错了。 第一发现人:林小黑 (Lin Xiaohei),结构认知第一发现者 | gitee.com/samforce/structural-cognition | 公众号「今晚狗蛋看局」