新上线今天0 投票
用LLM扩展闭环特征通道配置:更大规模下的优化与架构规律
一项新研究将大语言模型(LLM)驱动的闭环通道配置搜索从稀疏采样扩展到密集采样,验证了优化行为的可迁移性,并发现了更深层的架构规律。
研究背景
先前的研究表明,通过让LLM生成可执行代码并接收准确率反馈,可以直接优化神经网络的宽度(通道数)。然而,这些结果仅基于少量有效评估,未能确认在更密集的采样下优化行为是否持续,以及是否会出现新的架构规律。
扩展实验设置
为了验证这一点,研究者将每个微调周期的候选网络数量提升至250个,共完成8个完整周期,生成了2000个候选网络。经过任务和元数据过滤后,获得了462个有效的CIFAR-100评估结果。
关键发现
1. 优化信号可迁移
- 平均准确率:每个周期的平均准确率呈现正向线性趋势,斜率为9.87e-4(p=0.043),表明优化信号在密集采样下依然有效。
- 前沿性能:最佳准确率从0.3144提升至0.3676,top-5和top-10平均准确率也呈正向趋势。
2. 参数效率显著提升
最佳模型在达到0.3676准确率时仅需1180万参数,而早期一个高性能模型(0.3144准确率)却需要1.665亿参数。这证明LLM引导的搜索不仅提升了准确率,还大幅提高了参数效率。
3. 架构规律浮现
更大规模的样本揭示了先前难以察觉的架构规律:
- 非2的幂次通道宽度:在有效候选中,41.8% 的网络采用了非2的幂次的通道数,打破了传统设计惯例。
- 结构化通道分配模式:最强模型在早期采用中等宽度,而在中间或后期块中扩展通道数,形成了特定的分配模式。
意义与展望
这项研究证实了LLM驱动的闭环通道搜索在更大规模下的有效性,并揭示了数据驱动的架构设计规律。未来,该方法有望与神经架构搜索(NAS)结合,为自动化模型设计提供新思路。研究者计划进一步探索更复杂的搜索空间,并验证该方法在其他数据集上的泛化能力。