SheepNav
新上线今天0 投票

循环Transformer中的自适应深度:诊断学习型停止门与轨迹读出机制

循环Transformer通过在测试时重复应用共享的循环块来增加计算量。传统上,学习型停止目标使用单一退出分布同时作为推理时的停止规则和训练时各深度损失的权重。这导致退出选择与轨迹形成相互纠缠:门控不仅选择使用哪个循环状态,还决定了每个中间状态受监督的强度。因此,自适应计算性能不佳可能源于读出机制、诱导轨迹或两者的交互。

本研究通过轨迹-读出视角,在受控合成任务(模算术和二进制奇偶校验)以及大规模Ouro-1.4B和2.6B检查点上,对循环Transformer的自适应深度进行了系统诊断。研究发现:固定先验深度监督(在无输入依赖停止策略下塑造轨迹)能产生难度感知轨迹,其中间状态暴露了有用的停止信号;简单的事后置信度读出往往能匹配或超越学习型线性门控和MLP门控。

在冻结轨迹上拟合门控可定位失败根源:问题主要源于联合门控训练诱导的轨迹,而非门控表达能力有限。这一模式在Ouro评估中也得到验证——预训练的暂停门控具有竞争力但并非统一帕累托最优,实测延迟表明平均退出深度的减少能转化为实际的推理时间节省。

该诊断将循环Transformer的自适应深度重新定义为轨迹形成与退出读出的联合问题,而非单纯的门控学习,揭示了先前学习型停止工作常隐含的关键区别。

延伸阅读

  1. PhantomFill:当表单要求答案,语言模型便自行编造
  2. 多模态CoLRAG-TF:三重过滤检索破解复杂PDF文档难题
  3. 生成式贝叶斯滤波:用条件变分自编码器突破状态估计瓶颈
查看原文