讲清楚这个工作的动机,最好的入口是两个对称的失败案例。
新奇性搜索(novelty search)的核心理念是:放弃目标,只奖励"没见过"的行为。这在一个欺骗性问题上碾压目标导向搜索,但它有一个致命弱点——一台雪花屏电视机。每一帧都是独立随机噪声,永远无法预测,因此永远新奇。一个最大化新奇性的 agent 会停在电视机前,什么也学不到。
自由能原理(free-energy principle)反过来,主张智能体应该最小化 surprise,维持对世界的压缩模型。它的失败是对称的:一个漆黑的房间。没有输入变化,surprise 为零,agent 躲在里面,同样什么也学不到。
两个失败有一个共同病因:它们把"总 surprise"当成一个不可分割的量,混淆了学习者能消化的结构和永远无法消化的噪声。
论文的核心洞察来自一个简单的分解。考虑一个计算能力有限的观察者,逐项接收数据,每次先预测再被 surprise,然后更新模型。全程累积的 surprise 恰好等于数据在该计算约束下的最小描述长度(MDL)。
关键是这个总 surprise 天然分成两块:
| 部分 | 含义 | 雪花屏 | 黑房间 |
|---|---|---|---|
| 可学习(epiplexity) | 观察者内化进模型的结构,等于压缩程序的描述长度 | ≈ 0 | 0 |
| 不可学习(残差) | 无论如何压缩不了的噪声 | 全部 | 0 |
Finzi et al. (2026) 把第一部分命名为 epiplexity,本文作者将其重新解读为"可学习的新奇性"。在这个分解下,只最大化可学习部分,两个病理同时消失。
定义了一个量,怎么算?原版 epiplexity 需要对每个被评估的系统训练一个神经网络——成本 prohibitive。
作者用了一个巧妙的替代:储层计算机(reservoir computer)。这是一个冻结的随机 RNN + 线性 readout。因为所有可学习参数都在 readout 里,而 readout 的最优解是岭回归的闭式解,整个估计器变得:廉价(不需要训练)、确定性(不依赖随机种子)、可微分(可以反向传播梯度到产生数据的系统)。
这就把一个只能"测量"的量变成了一个能直接"优化"的目标——梯度上升,系统自己去产生更多可学习的结构。
把 epiplexity 当作纯度量,不加任何训练信号,在初等元胞自动机(ECA)256 条规则上排序。结果:rule 110(图灵完备)排第一。这个排名与 Langton λ、Wuensche Z 参数以及数十年的定性分类高度吻合。而且对储层超参数(谱半径、稀疏度)相当鲁棒。
rule 124——rule 110 在不同边界条件下的等价形式——排在第二。这个度量捕捉的不是特定实现,而是更深层的计算能力。
把 epiplexity 的梯度反传到产生数据的系统——一个一维神经元胞自动机(NCA)。NCA 从简单的动力学出发,被 epiplexity 的梯度推着走,最终进入了一个孤子(soliton)主导的状态:局部化的行波结构,运动、碰撞、相互作用而不消散。
这恰好是 rule 110 执行通用计算的方式。epiplexity 最大化不被告知"找到孤子",优化过程中自己发现了这种支撑计算的动力学结构。
把同样的梯度反传到 MNIST 图像的随机编码器。没有任何标签进入训练。epiplexity 上升过程中,编码器的表征自发地按 0-9 十个数字类聚拢分离。
这不是对比学习,不是 VAE,不是任何有监督或自监督方法——纯靠"让观察者觉得学到了东西"这个信号,编码器发现了数据中的语义结构。
把 epiplexity 作为内在 reward 叠加在环境 reward 之上喂给 RL agent。在 10 个 MiniGrid 环境中,9 个取得了比纯任务 reward 更高的最终回报,没有一个环境崩塌。尤其在奖励稀疏、需要深度探索的任务上,epiplexity 提供的探索驱动力显著弥补了任务 reward 的不足。
这篇论文的价值不在 benchmark 上刷了多少点,而在它提出了一个跨领域统一框架的雏形。
目前 AI 各子领域的目标函数彼此隔绝:压缩用 MDL,探索用 novelty,表征学习用 InfoNCE,RL 用累计 reward。每一个都是"智能的某个投影",没有共同的底座。这篇论文说:它们可能是一个量的不同侧面,这个量就是可学习的新奇性。
如果这个统一是对的,未来不需要为每个任务单独设计奖励函数——设计一个"好的观察者"(储层),用同一个梯度去优化表征、探索、计算,一切自动发生。
当然,目前还是概念验证级别。几个明显的局限:
储层的能力边界决定了 epiplexity 的上限。太弱或太强的储层都会失准,如何选择"合适的计算约束"目前还是经验性的。
实验规模有限。MNIST 和 MiniGrid 是经典 toy benchmark,扩展到 CIFAR/ImageNet 或真实机器人任务的可行性未知。
RL 实验中 epiplexity 是辅助性的(叠加在环境 reward 上),纯 epiplexity-driven agent 在复杂任务上的表现尚不明确。
理论深度不够。"为什么 epiplexity 最大化会导致通用计算"目前只有直觉论证,缺严格理论支撑。
但这些问题不妨碍它的方向价值。把一个跨 AI、复杂系统、理论生物学的概念落地成可计算、可微分的量——这本身就是重要的一步。
论文原文:Intelligence from Learnable Novelty — arXiv: 2607.18433
作者:Yanbo Zhang, Michael Levin (Tufts Allen Discovery Center / Harvard Wyss Institute)
代码:github.com/Zhangyanbo/learnable-novelty
标签:Epiplexity · Novelty Search · MDL · Reservoir Computing · Neural Cellular Automata