冻结随机CNN特征提取器在深度强化学习中自发涌现稀疏性
现象:随机网络中的意外稀疏性
深度强化学习(DRL)中,一个常见的做法是使用预训练或可训练的卷积神经网络(CNN)作为特征提取器。然而,一篇来自arXiv的新研究(论文ID: 2607.26059)揭示了一个令人惊讶的现象:当使用完全冻结、随机初始化的CNN作为特征提取器时,训练后的全连接层会自发地变得极度稀疏,且无需任何显式的稀疏性诱导目标。
关键发现:稀疏性如何体现
研究者在Atari游戏(Pong、Breakout、Space Invaders)上进行了实验。在第一个全连接层(FC1,从3136维降至64维)中,对于确定性Pong任务,智能体仅使用1-3个神经元(共64个)来压缩任务相关信息;对于随机性Pong,这一数字为5-11个。相比之下,可训练的CNN在相同条件下会激活55-64个神经元。
稀疏性随任务复杂度变化:
- Pong:1-11个活跃神经元
- Breakout:19-26个
- Space Invaders:约42个
这表明稀疏模式反映了任务的内在结构,而非固定的容量比例。
更深入的洞察:随机投影的局限性
一个有趣的发现是,同一游戏的不同随机种子会导致不同的稀疏模式。例如,三个相同的Pong种子分别产生了5、7和11个活跃神经元。其中,5神经元的种子奖励停滞在+14,而其他两个种子达到了专家级表现(+18.4和+18.7)。这暗示了随机投影的可用维度限制了可达到的性能上限。
进一步的消融实验证实了这些活跃神经元的必要性:移除它们会导致性能崩溃,这一结果在两种PPO实现和四个游戏中均得到验证。
信息瓶颈的早期锁定
研究还发现,活跃神经元的集合在训练早期(15-30百万步)就已锁定,而奖励变为正值则是在35-105百万步之后。这意味着信息瓶颈在性能提升之前就已形成。
在Breakout游戏中,冻结CNN和可训练CNN通过结构不同的瓶颈达到了竞争性奖励:冻结网络使用17-25个活跃神经元(参与率约10-14),而可训练网络使用51个(参与率约3.6)。这说明冻结网络通过更窄但更高效的瓶颈来传递信息。
理论意义与实践启示
这项研究的核心启示是:当输入维度远超任务内在维度时,对冻结的随机投影进行梯度下降,可以无需显式稀疏化机制而揭示问题的有效秩。这为理解深度强化学习中的表示学习提供了新视角,也可能启发更高效的网络设计——例如,使用随机固定特征提取器配合稀疏可训练层,从而降低计算成本。
对于AI从业者而言,这一发现提示我们:在资源受限的场景下,或许不必执着于端到端训练,冻结的随机特征提取器+稀疏可训练层可能是一种被低估的实用方案。