精选昨天0 投票
让无人机听懂人话:轨迹锚定指令翻译让冻结的空中VLN智能体成功率翻三倍
指令鸿沟:训练与使用之间的错位
在空中视觉语言导航(Aerial VLN)领域,一个长期被忽视的矛盾正在被放大:智能体在训练时接触的是细节丰富、与轨迹逐点对齐的长指令,而真实用户在部署时给出的却是简短、以意图为中心的口语化指令。这种错位带来的性能损失是惊人的——在一项基于冻结 OpenFly 导航器的测试中,指令鸿沟直接把成功率(SR)从 31.03% 拉低到 11.33%。
换句话说,模型本身没变,只是换了一种说话方式,它就从「基本能用」跌到了「几乎不可用」。
TGIT:不重训导航器,只翻译指令
来自 Xi Chen、Zhe Liu、Shouling Ji 等研究者的论文提出了一种名为 Trajectory-Grounded Instruction Translator(TGIT) 的前端方案。它的核心思路相当克制:
- 保持导航器冻结,不微调、不重训,避免高昂的算力成本与灾难性遗忘;
- 在导航器之前插入一个「翻译器」,负责把用户的弱指令(Weak inputs)转写为智能体能执行的可执行指令;
- 翻译器的训练信号并非来自人工标注,而是来自导航器实际走出的轨迹结果——走得好,说明翻译对了。
为了规模化训练数据,研究者先用语言模型参考人工风格示例,将原始指令改写为配对的、以意图为中心的弱指令。这批数据单独拿去训练,成功率只能到 15.27%,说明单纯的语言改写并不足够。
关键数字:从 11.33% 到 32.51%
真正起作用的是轨迹锚定机制。经弱指令训练的 TGIT 将弱输入下的成功率提升至 37.93%,并且能够零样本迁移到真实人类指令:
- 真实人类指令:11.33% → 32.51%
- 留出的 OpenFly 测试集:4.95% → 20.79%
- 在 CityNav 与 AirVLN 上也观察到性能恢复
为什么这件事值得关注
这项工作的价值不只是一组数字。它揭示了一个更普遍的问题:具身智能体的能力瓶颈,未必在感知或决策,而可能在「接口层」。当基础模型被冻结、无法再训练时,如何用轻量前端弥合人机表达差异,可能比继续堆参数更具性价比。
当然,TGIT 目前仍依赖导航器的轨迹反馈来训练翻译器,这意味着它并非完全免训练,而是把训练成本从「重训大模型」转移到了「训练小翻译器」上。这一权衡是否在所有场景下成立,还有待更多验证。