OverLoCK:纯卷积网络第一次真正学会"先看全局再看细节"

ConvNetTop-Down AttentionDynamic ConvolutionVision Backbone
2025-02-27 · arXiv 2502.20087

ConvNet 在图像分类上已经能跟 Transformer 分庭抗礼,但一到目标检测和语义分割就明显掉队。为什么?OverLoCK 的答案很直接:卷积核尺寸固定,输入分辨率增大时感受场跟不上。这不是调大核就能解决的——大核卷积成本高,可变形卷积又丢了归纳偏置。

问题:金字塔架构的自上而下盲区

人类视觉系统有一个关键机制:自上而下注意力。大脑先快速形成对场景的整体感知(overview),再回到感官层面精确定位目标(look closely)。但现代 ConvNet 的金字塔架构是从底向上逐层编码——每一层的输入只依赖前面的层,中间层缺乏显式的全局语义引导。

论文用可视化揭示了这个问题:Swin-T、ConvNeXt-T、VMamba-T 在 Stage 3(离分类器远的层)的类激活图经常定位不准,甚至给出错误的类别标签。这些模型其实都能捕捉某种程度的长程依赖,但缺少从高层语义到低层特征的反馈通路

核心架构:三子网分工的 DDS 策略

OverLoCK 架构
图:OverLoCK 整体架构 — Base-Net、Overview-Net、Focus-Net 三子网分工

Base-Net 负责编码低/中层特征,将输入图像下采样到 H/16。然后兵分两路——

Overview-Net 是一个轻量网络,立即将 H/16 特征下采样到 H/32,快速生成一张语义丰富但分辨率粗糙的全局特征图。这就是人类"扫一眼"的产物,论文叫它 context prior(上下文先验)。

Focus-Net 在 context prior 的引导下精炼中层特征。context prior 既在特征层面调制 Focus-Net 的输出(通过 gate 机制),也在核权重层面注入全局信息(通过 ContMix)。

模块结构
图:Base-Net / Focus-Net / GDSA 模块结构
DDS 的精妙之处:Overview-Net 和 Focus-Net 共享同一个 Base-Net,不重复编码低/中层特征。预训练时两个子网各接一个分类头,迁移到下游任务时 Overview-Net 不再加辅助 loss。

Context Flow:context prior 在 Focus-Net 每一层被更新流动——进入 block 前与特征 concat,处理后拆分出更新的 prior 和新特征。同时初始先验 P₀ 通过残差连接参与更新(Pi+1 = αP′i + βP₀),防止信息在深层稀释。

ContMix:固定尺寸核也能捕捉长程依赖

ContMix
图:ContMix 的上下文混合动态卷积机制

思路:对每个 token,计算它和所有 区域中心(adaptive average pooling 得到的 S×S 个点)的亲和力,用可学习线性层 Wd 聚合成 K×K 动态卷积核。Q 来自当前特征 Zi,K 来自 context prior Pi——分别用不同信息计算亲和力。

多组设计:一半用大核捕捉长程依赖,一半用 5×5 小核捕捉局部细节。S=7,计算复杂度线性。

每个位置的卷积核都不同,且每个核都携带全局上下文。卷积核只有 K×K 大小,但每次卷积都在和全局信息交互——"固定尺寸核也能建模长程依赖"的关键。

实验:全面碾压

ImageNet-1K 上,OverLoCK-T 达到 84.2% Top-1,用约 1/3 计算量超过 ConvNeXt-B,超过 MogaNet-S 0.8%、UniRepLKNet-T 1.0%、VMamba-T 1.6%。

Backbone类型FLOPs(G)Params(M)Top-1(%)
ConvNeXt-BC15.48984.0
MogaNet-SC5.02583.4
UniRepLKNet-TC4.93183.2
VMamba-TM6.42582.6
BiFormer-TT5.32782.9
OverLoCK-TC5.53384.2
OverLoCK-BC16.79585.1
速度-精度
图:OverLoCK 在速度-精度 trade-off 上全面领先

下游任务更有说服力——论文揭示了 ConvNet 分类能打平 Transformer 但检测分割差距明显的根本原因:固定核尺寸导致大分辨率下感受场不够。

BackboneCOCO APb(Cascade 3×)ADE20K mIoU
MogaNet-B52.650.1
UniRepLKNet-S53.050.5
ConvNeXt-B52.750.0
OverLoCK-S53.651.3
OverLoCK-B53.951.7

消融:每一步都有收益

方法FLOPs(G)Top-1(%)mIoU(%)
PlainNet2.576.338.8
+ RepConv + SE + Local Conv2.577.139.6
→ ConvFFN2.678.541.1
→ DDS 分解(非循环)2.679.041.6
+ ContMix 动态卷积2.680.042.9
+ 初始先验 + Gate (完整 OverLoCK)2.680.843.8

循环模型反而比 DDS 分解差——显式分支设计比循环反馈更高效。

评价与工程意义

OverLoCK 指出了 ConvNet 骨干被忽视的根本问题:自上而下注意力的缺失。DDS 用最简洁的方式——三子网分支 + context prior 流动——解决了它。ContMix 作为通用 plug-and-play 模块,对视频理解、医学影像等需要强语义引导的场景都有潜力。

挑刺:三子网增加了工程复杂度(预训练双分类头),Overview-Net 下游仍占计算。但考虑到性能提升幅度,这个 trade-off 很划算。

ConvNet 不需要变成 Transformer 才能变强。正确的问题是:人类视觉的自上而下注意力,怎么用最纯的卷积来实现。OverLoCK 给了一个漂亮的答案。