遗忘不是随机事件,是一个可以精确计算的数——互指闭环深度D 为什么模型学新任务会忘旧任务?旧理论说是「梯度冲突」或「参数重要性」,但都解释不了一个实验:单隐层网络遗忘12.36%,三隐层网络只遗忘0.97%,差了11.39个百分点。真正的变量是「互指闭环深度」D——旧任务权重子图里循环依赖的深度。 浅网络闭环深度12.7,深网络31.3。遗忘率严格随D递减:F与1/(D+1)成正比。6组独立实验方向100%一致,效应量d=8.56(通常0.8就算「大」)。遗忘不是玄学,是可预测的结构量,能在O(节点×边)时间内精确算出。 结构先于语义:先有权重子图里循环闭合的结构深度,才有「会不会忘」这个语义结果。耦合即认知:闭环越深,权重之间互相支撑越强,知识越不容易被覆盖。 第一发现人:林小黑 (Lin Xiaohei),结构认知第一发现者 | gitee.com/samforce/structural-cognition | 公众号「今晚狗蛋看局」