可学习的新奇性:
一个公式打通智能的三个面孔

PaperDog · 2026-07-23
智能在不同学科里有不同的名字。统计学习叫它数据压缩,复杂系统叫它通用计算,强化学习叫它自适应探索。这篇来自 Tufts 大学 Michael Levin 组的论文用一个可微分的量——可学习的新奇性(learnable novelty)——把三种面孔统一到同一个数学框架下。不需要标签,不需要 reward shaping,不需要人为定义"有趣"。

两个经典失败,一个共同病因

讲清楚这个工作的动机,最好的入口是两个对称的失败案例。

新奇性搜索(novelty search)的核心理念是:放弃目标,只奖励"没见过"的行为。这在一个欺骗性问题上碾压目标导向搜索,但它有一个致命弱点——一台雪花屏电视机。每一帧都是独立随机噪声,永远无法预测,因此永远新奇。一个最大化新奇性的 agent 会停在电视机前,什么也学不到。

自由能原理(free-energy principle)反过来,主张智能体应该最小化 surprise,维持对世界的压缩模型。它的失败是对称的:一个漆黑的房间。没有输入变化,surprise 为零,agent 躲在里面,同样什么也学不到。

两个失败有一个共同病因:它们把"总 surprise"当成一个不可分割的量,混淆了学习者能消化的结构和永远无法消化的噪声。

Overview of learnable novelty framework
图1:可学习新奇性的框架。(a) 观察者逐项接收数据,每次先预测再被surprise,然后更新模型。总surprise分为可学习部分(蓝)和不可学习残差。雪花屏全是残差,黑房间两部分都为零。(b) 同样的量作为目标函数:系统产生数据,有界观察者将其浓缩为单一数字 Sϕ,梯度流回重塑系统。(c) Sϕ 背后的本质:每个独立方向的花费约等于其幅值的位数,因此 Sϕ 衡量的是学到了多少独立结构,而非结构有多大。

Epiplexity:只算学得会的那部分

论文的核心洞察来自一个简单的分解。考虑一个计算能力有限的观察者,逐项接收数据,每次先预测再被 surprise,然后更新模型。全程累积的 surprise 恰好等于数据在该计算约束下的最小描述长度(MDL)。

关键是这个总 surprise 天然分成两块:

部分含义雪花屏黑房间
可学习(epiplexity)观察者内化进模型的结构,等于压缩程序的描述长度≈ 00
不可学习(残差)无论如何压缩不了的噪声全部0

Finzi et al. (2026) 把第一部分命名为 epiplexity,本文作者将其重新解读为"可学习的新奇性"。在这个分解下,只最大化可学习部分,两个病理同时消失

极廉价的估计器:储层计算 + 岭回归

定义了一个量,怎么算?原版 epiplexity 需要对每个被评估的系统训练一个神经网络——成本 prohibitive。

作者用了一个巧妙的替代:储层计算机(reservoir computer)。这是一个冻结的随机 RNN + 线性 readout。因为所有可学习参数都在 readout 里,而 readout 的最优解是岭回归的闭式解,整个估计器变得:廉价(不需要训练)、确定性(不依赖随机种子)、可微分(可以反向传播梯度到产生数据的系统)。

这就把一个只能"测量"的量变成了一个能直接"优化"的目标——梯度上升,系统自己去产生更多可学习的结构。

Surrogate observer vs MDL
图2:储层观察者作为MDL代理的验证。用线性 readout 的 ridge regression 方案近似 epiplexity,与完整训练出的 MDL 高度一致,且速度提升数个数量级。

三个实验,一个量

作为度量:无需训练,重现数十年复杂度研究

把 epiplexity 当作纯度量,不加任何训练信号,在初等元胞自动机(ECA)256 条规则上排序。结果:rule 110(图灵完备)排第一。这个排名与 Langton λ、Wuensche Z 参数以及数十年的定性分类高度吻合。而且对储层超参数(谱半径、稀疏度)相当鲁棒。

rule 124——rule 110 在不同边界条件下的等价形式——排在第二。这个度量捕捉的不是特定实现,而是更深层的计算能力。

ECA complexity ranking by epiplexity
图3:256条ECA规则的epiplexity排名。Rule 110(图灵完备)位居第一,rule 124(rule 110的等价形式)第二。无需任何训练信号,单靠储层观察者的在线预测成本,就重现了数十年的复杂度分类研究。

作为目标:梯度把简单动力学推向孤子

把 epiplexity 的梯度反传到产生数据的系统——一个一维神经元胞自动机(NCA)。NCA 从简单的动力学出发,被 epiplexity 的梯度推着走,最终进入了一个孤子(soliton)主导的状态:局部化的行波结构,运动、碰撞、相互作用而不消散。

这恰好是 rule 110 执行通用计算的方式。epiplexity 最大化不被告知"找到孤子",优化过程中自己发现了这种支撑计算的动力学结构。

NCA soliton dynamics from epiplexity maximization
图4:epiplexity 梯度驱动 NCA 产生孤子。(a) 优化前的简单动力学;(b-d) epiplexity 逐渐上升,系统自发涌现出 traveling、colliding 孤子结构——无需任何监督信号,单靠"让观察者学到更多"这一个梯度。

作为无监督目标:MNIST 自动按类别分离

把同样的梯度反传到 MNIST 图像的随机编码器。没有任何标签进入训练。epiplexity 上升过程中,编码器的表征自发地按 0-9 十个数字类聚拢分离。

这不是对比学习,不是 VAE,不是任何有监督或自监督方法——纯靠"让观察者觉得学到了东西"这个信号,编码器发现了数据中的语义结构。

MNIST unsupervised clustering via epiplexity
图5:MNIST编码器在epiplexity最大化下的表征演化。(a) 随机初始化的表征一团乱麻;(b-e) 随着epiplexity上升,十个数字类自发分离成清晰的簇——零标签,零监督,纯靠"让观察者学到结构"这个信号。

作为内在奖励:10个RL环境,9个提升

把 epiplexity 作为内在 reward 叠加在环境 reward 之上喂给 RL agent。在 10 个 MiniGrid 环境中,9 个取得了比纯任务 reward 更高的最终回报,没有一个环境崩塌。尤其在奖励稀疏、需要深度探索的任务上,epiplexity 提供的探索驱动力显著弥补了任务 reward 的不足。

为什么这件事重要

这篇论文的价值不在 benchmark 上刷了多少点,而在它提出了一个跨领域统一框架的雏形

目前 AI 各子领域的目标函数彼此隔绝:压缩用 MDL,探索用 novelty,表征学习用 InfoNCE,RL 用累计 reward。每一个都是"智能的某个投影",没有共同的底座。这篇论文说:它们可能是一个量的不同侧面,这个量就是可学习的新奇性。

如果这个统一是对的,未来不需要为每个任务单独设计奖励函数——设计一个"好的观察者"(储层),用同一个梯度去优化表征、探索、计算,一切自动发生。

局限与未来

当然,目前还是概念验证级别。几个明显的局限:

储层的能力边界决定了 epiplexity 的上限。太弱或太强的储层都会失准,如何选择"合适的计算约束"目前还是经验性的。

实验规模有限。MNIST 和 MiniGrid 是经典 toy benchmark,扩展到 CIFAR/ImageNet 或真实机器人任务的可行性未知。

RL 实验中 epiplexity 是辅助性的(叠加在环境 reward 上),纯 epiplexity-driven agent 在复杂任务上的表现尚不明确。

理论深度不够。"为什么 epiplexity 最大化会导致通用计算"目前只有直觉论证,缺严格理论支撑。

但这些问题不妨碍它的方向价值。把一个跨 AI、复杂系统、理论生物学的概念落地成可计算、可微分的量——这本身就是重要的一步。

相关论文

论文原文:Intelligence from Learnable Novelty — arXiv: 2607.18433
作者:Yanbo Zhang, Michael Levin (Tufts Allen Discovery Center / Harvard Wyss Institute)
代码:github.com/Zhangyanbo/learnable-novelty
标签:Epiplexity · Novelty Search · MDL · Reservoir Computing · Neural Cellular Automata