SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

多模态持续学习(MMCL)旨在从多模态数据中学习新知识,同时保留已学知识。然而,现有方法多聚焦于跨模态表示对齐或语义相似性,却忽视了各模态及其交互在增量任务中的相对贡献是否保持稳定。这种决策层面的偏移被研究者称为**模态贡献漂移(MCD)**。 ## MCD 的量化与成因 为量化 MCD,研究者提出了 **MCD 分数**,通过控制模态子集的干预,综合评估贡献强度与相对依赖度的变化。理论分析和实证表明,当前 MMCL 方法难以可靠地缓解这种漂移,原因在于它们未显式约束决策层面的贡献结构。 ## CMCDR 方法 针对上述问题,论文提出**持续模态贡献漂移正则化(CMCDR)**,旨在保留先前任务中学到的模态贡献结构。由于 MMCL 设置可能提供或不提供旧样本,CMCDR 包含两种版本: - **基于重放(Replay-based)**:利用存储的旧样本,通过模态子集干预作为诊断探针,比较当前模型与冻结的旧模型在旧样本上的贡献轮廓,并约束旧样本的模态特定及交互贡献的变化。 - **无重放(Replay-free)**:使用当前任务样本作为探针,蒸馏冻结模型在旧任务上的贡献响应,从而在无样本情况下正则化观测到的贡献轮廓。 ## 实验验证 在**多模态类增量学习**和**持续视觉问答**任务上的实验验证了 CMCDR 的通用性和有效性。结果表明,显式约束模态贡献结构能显著缓解遗忘,提升持续学习性能。 ## 意义与展望 该研究揭示了多模态持续学习中一个被忽视的关键维度——决策层面的模态贡献稳定性,为设计更鲁棒的 MMCL 算法提供了新思路。未来可进一步探索更细粒度的贡献度量及跨任务自适应机制。

HuggingFace1个月前原文

在医疗健康、政策评估和气候科学等关键领域,时间序列上的因果关系推断往往面临数据不足的困境。现有的基准数据集要么是观测性的,要么规模过小,要么局限于特定领域,难以支撑干预效应和反事实估计的研究。为此,研究者推出了 **DoTime**——一个开放、可扩展且具有理论基础的多元时间序列结构因果模型(TSCM)生成器,并已发布为 `dotime` PyPI 包,附带四个冻结的评估套件。 ## 超越现有生成器的核心能力 DoTime 引入了多项此前生成器不具备的功能,例如**连续时间干预窗口**、带**正性保障**的反事实采样模式,以及作为中断时间序列严格推广的**机制切换 SCM**。此外,它通过切换 SCM 参数构造非平稳动态,并支持确定性斜坡和正弦干预曲线,使得趋势和结构断裂能够被置于评估窗口之内,从而更贴近真实应用场景。 ## 大规模基准与验证 发布的数据集包含 **100,000 条轨迹**的训练规模快照,涵盖八种具名识别结构,每种结构都有精确的 ground truth:配对干预轨迹全程由同一 SCM 生成,连续时间套件中还包含共享噪声的反事实样本。研究者提供了参考基线实现和评估框架,并提出一个可证伪的主张:**干预训练相比同容量的观测模型,能带来可测量的方向准确性优势**。在三种训练种子下,针对保留片段的匹配结构评估中,干预先验拟合网络(PFN)的优势在所有结构、轨迹长度和种子上均为正。 ## 对因果推断研究的启示 DoTime 的出现填补了时间序列因果推断基准的空白,不仅为方法评估提供了标准化的测试平台,还展示了作为**因果基础模型先验**的潜力。对于研究者和工程师而言,这意味着可以在统一框架下比较不同算法的性能,并探索干预数据在模型训练中的价值。若要深入了解,可参考 arXiv:2607.27263 论文及配套代码。

HuggingFace1个月前原文

实时竞价(RTB)是计算广告的核心,涉及三个关键角色:供应方平台(SSP)出售广告库存,需求方平台(DSP)代表广告主出价,广告交易平台(Ad Exchange)负责撮合拍卖。传统的自动出价算法通常只关注DSP侧,即通过调整出价来最大化广告主的转化量,而忽略平台整体收益。然而,如今的大型广告平台(如社交媒体和电商公司)往往集成了SSP、DSP和Ad Exchange的功能,从平台的角度看,自动出价不仅要为广告主争取转化,还要为平台创造更多收入。 目前缺乏以平台为中心的评估框架,这限制了自动出价研究的发展。为此,研究者提出了PlatformBid——首个从统一广告平台视角设计的综合性基准。PlatformBid定义了三种具有代表性的场景:同质竞争(所有广告主使用相同算法)、异质竞争(广告主采用多样化算法策略)以及促销竞争(如黑色星期五期间广告主增加预算以提升销量)。基于这些场景,研究者系统评估了现有自动出价方法,包括经典控制方法、基于强化学习的方法以及最新的生成式方法。此外,他们还提出了一种基于流匹配(flow-matching)的新方法BidFlow,利用流匹配的表达能力来处理动态竞争环境。在快手平台上的在线实验显示,BidFlow在目标成本上提升了0.68%,验证了PlatformBid离线与在线结果的一致性。 这一基准的提出,为自动出价研究提供了更贴近实际应用的评估工具,有望推动该领域在统一平台视角下的进一步发展。

HuggingFace1个月前原文

## 背景:MLA与推测解码的碰撞 多潜变量注意力(MLA)正成为长上下文大语言模型推理的关键技术。它通过紧凑的潜状态替代不断增长的键值(KV)缓存,显著降低解码时的内存带宽压力。然而,目前最强大的开源模型大多采用多头注意力(MHA)或分组查询注意力(GQA),若想获得MLA的缓存效率,通常需要将MHA/GQA转换为MLA,而无需从头训练。 推测解码(Speculative Decoding)是另一种加速策略:先由草稿模型快速生成候选token,再由目标模型验证。其加速效果高度依赖于草稿与目标输出的一致性。 ## 核心问题:直接转换为何失效? 论文作者发现,直接将MHA/GQA转换为MLA会**大幅降低草稿token的接受率**。原因在于:低秩分解和旋转位置编码(RoPE)处理会引入注意力函数误差。这种误差在独立生成时或许可以容忍,但在推测解码中,却会显著削弱草稿与目标模型之间的对齐,导致验证频繁拒绝,加速效果大打折扣。 ## 新方法:功能重构而非缓存压缩 为此,研究者提出将MLA草稿构建视为**功能重构**问题,而非简单的缓存压缩。他们设计了一种端到端(E2E)方法:在转换后,针对每个MLA注意力模块,优化其输出,使其在**校准隐藏状态**上,能够再现原始MHA/GQA对应模块经过输出投影后的响应。 这一方法具有以下特点: - **转换器无关**:适用于任何MHA/GQA到MLA的转换方法(如TransMLA、MHA2MLA); - **无需验证器监督**:不需要验证器的logits或额外监督信号; - **保持推理图不变**:转换后的缓存和推理结构得以保留。 ## 实验效果:多数场景显著提升 研究团队在**192种模型-转换器-后端-任务组合**上进行了评估,涵盖Llama/Qwen草稿-目标对、HF和vLLM后端,以及4个200条提示的任务。在0.5个百分点的容差下,功能重构在**64个匹配任务单元中的37个**显著提升了接受率,26个基本不变,仅1个轻微下降。 ## 小结 这项研究揭示了推测解码中MLA转换的隐性瓶颈,并提供了实用的后处理优化方案。对于希望在长上下文场景中兼顾内存效率与解码速度的开发者而言,功能重构不失为一种值得尝试的轻量级增强手段。

HuggingFace1个月前原文

在代码生成领域,大多数训练信号只关注正确性,而忽略了性能。两个程序可能通过相同的测试,但运行时间却天差地别。对于系统级代码,效率至关重要。然而,将运行时间作为奖励信号面临挑战:它只在程序正确时才有意义,且因任务而异,当大多数样本无法编译或运行时,它几乎无法提供指导。 针对这一问题,研究者提出了**RLPF(Reinforcement Learning from Performance Feedback)**,一种从性能反馈中进行强化学习的方法。RLPF 将执行结果转化为**分阶段奖励**:对于失败的程序,按其执行进度排序;对于正确的程序,则根据其相对于基线和专家参考的改进程度进行排名。这样,在程序正确之前就能提供有用的反馈,在正确之后则提供性能敏感的反馈。 通过在 PerfCodeBench 上使用 RLPF 对 Qwen3-32B 进行微调,**正确且可运行的解决方案从 11.1% 提升到 54.6%**,相对效率从 8.1% 提升到 38.6%。训练后的模型与更强的开源模型相比具有竞争力,其优化行为也能适度迁移到 EffiBench-X。 进一步的研究表明,模型生成的参考提供了有用但较弱的监督,而完整的复合奖励比仅正确性或仅运行时间的基线更可靠。这些结果表明,代码智能体不仅可以被训练通过测试,还可以优化它们编写的程序。 ## 背景与挑战 当前代码模型的训练通常只关注生成代码的正确性,即能否通过测试用例。然而,在系统编程中,性能往往与正确性同等重要。例如,一个排序算法可能正确但效率极低,而另一个则高效。传统方法忽略了这一点,导致生成的代码虽然正确但运行缓慢。 直接使用运行时间作为奖励信号存在几个问题: - **脆弱性**:运行时间只有在程序正确时才有意义,对于错误的程序,运行时间可能毫无价值。 - **任务差异性**:不同任务的运行时间基准不同,难以统一比较。 - **稀疏性**:当大部分样本无法编译或运行时,运行时间奖励无法提供有效的梯度。 ## RLPF 的核心机制 RLPF 通过将执行结果分解为分阶段奖励来解决上述问题: 1. **对于失败的程序**:根据执行进度排序,例如,编译失败的样本比运行时崩溃的样本得分更低,运行时崩溃的样本又比输出错误的样本得分更低。这样,即使在程序不正确的情况下,也能提供有意义的反馈,引导模型逐步接近正确。 2. **对于正确的程序**:根据其相对于基线(如模型初始生成的平均性能)和专家参考(如人工编写的高效实现)的改进程度进行排名。这鼓励模型不仅生成正确的代码,还要生成更高效的代码。 ## 实验结果 在 PerfCodeBench 基准上,使用 RLPF 微调 Qwen3-32B 模型,取得了显著效果: - **正确且可运行的解决方案**从 11.1% 提升至 **54.6%**,提升近 5 倍。 - **相对效率**从 8.1% 提升至 **38.6%**,表明生成的代码在性能上也有大幅改善。 训练后的模型与更强的开源模型(如 Qwen3-72B)相比具有竞争力,同时其优化行为也能迁移到其他基准(EffiBench-X),显示出一定的泛化能力。 ## 分析与展望 该研究的意义在于,它打破了代码生成训练中“只求正确”的局限,将性能优化纳入训练目标。通过分阶段奖励,RLPF 既能处理早期探索阶段的稀疏反馈,又能在后期精细化性能。 然而,研究也指出,模型生成的参考虽然有用,但监督强度不如专家参考。此外,复合奖励比单一正确性或运行时间奖励更可靠,说明两者需要结合。 未来,这一方法有望应用于更广泛的代码优化场景,如编译器优化、算法设计等,让 AI 不仅能够编写正确的代码,还能编写高效的代码。

HuggingFace1个月前原文

脑电图(EEG)作为神经科学和临床医学中重要的非侵入性检测手段,其信号分析对神经系统疾病的诊断具有重要价值。然而,传统的EEG疾病诊断方法往往将长时程记录分割成短片段,并给每个片段赋予与受试者相同的标签,然后进行实例级别的分类训练。这种做法隐含了一个假设:所有实例都能提供同等可靠的诊断证据。但实际上,不同时间段、不同脑区的EEG信号可能包含不同的病理信息,这导致传统的监督学习方式可能引入噪声,影响诊断的准确性。 为了应对这一挑战,研究者提出了多实例学习(MIL)方法,将每个受试者视为一个“包”,避免直接继承标签。然而,EEG数据集中的受试者数量通常远少于实例数量,这限制了端到端MIL学习到的表示质量。为此,来自清华大学等机构的研究者提出了一种名为**BridgeMIL**的两阶段框架,旨在将实例表示学习与主体级监督解耦。 **BridgeMIL的核心思想**:第一阶段,在无监督条件下预训练编码器,通过对齐时间上邻近的窗口和独立采样的受试者内部子包,让模型学习到更具代表性的特征。同时,引入方差和协方差正则化,防止表示崩溃并减少冗余,且无需负样本对。第二阶段,将预训练好的编码器迁移到基于注意力的MIL聚合器中,仅对受试者预测施加监督,并通过特征保留机制限制表示漂移。这种方法既利用了丰富的EEG实例数据,又避免了将疾病标签错误地分配给单个实例。 **实验结果**:研究者在三个EEG疾病数据集和五种代表性骨干网络上进行了评估。结果显示,BridgeMIL在15个数据集-骨干设置中的14个中取得了最高平均准确率,总体平均准确率达到**76.57%**,比最强基线高出**4.28个百分点**。进一步分析发现,继承标签的可靠性在不同实例间存在显著差异,模型对受试者稀缺性的敏感度高于对实例稀缺性的敏感度,且BridgeMIL学习到的表示空间更具结构性,形成了清晰的受试者聚类,并改善了诊断类别间的分离度。 **意义与展望**:这项研究强调了监督信号与主体级预测目标对齐的重要性,为EEG疾病诊断提供了一种更合理的学习范式。BridgeMIL不仅提升了诊断准确率,还揭示了传统方法的潜在缺陷,为未来开发更鲁棒的生物信号分析模型提供了新思路。随着脑科学和医疗AI的快速发展,这种解耦学习策略有望在更多临床场景中发挥重要作用。

HuggingFace1个月前原文

大语言模型(LLM)的后训练阶段成本高昂,现有优化手段多聚焦于样本筛选与训练调度,却鲜有关注数据组织本身。传统做法通常将数据组织视为静态预处理:基于嵌入的分组方法在训练前构建固定分区,无法适应训练过程中样本暴露度的动态变化,导致部分样本被过度训练,而另一些则训练不足。针对这一痛点,来自高校与企业的研究团队提出 **SDO(Structure-Aware Data Organization,结构感知数据组织)**,一种即插即用的数据组织框架,通过暴露度反馈机制动态调整小批量构成与样本暴露度,在 **SFT、DPO、GRPO** 等主流后训练范式中均显著加速收敛,相关论文已发布于 arXiv(编号:2607.27273)。 ## 核心机制:从静态分区到动态调度 SDO 的核心创新在于将数据组织从“一次性预处理”转变为“逐轮动态调整”。具体而言,它采用**逐 epoch 运行**的方式,基于冻结的外部嵌入(无需模型预热),在**每个 epoch 内**通过 K 近邻(KNN)邻域遍历构建局部感知的小批量,确保语义相近的样本被分到同一批次;在**跨 epoch 间**,则通过暴露度均衡调度记录每个样本的参与次数,并降低过度暴露样本的采样概率,从而维持长期覆盖。 这一设计直击静态分组的痛点:静态方法无法感知样本在优化过程中的“真实需求”,而 SDO 通过反馈机制让数据组织随训练动态调整,使每个样本都能获得与其优化需求相匹配的暴露机会。 ## 实验效果与行业意义 论文报告,SDO 在 SFT、DPO、GRPO 三种后训练场景中均能加速收敛,且在**训练早中期**提升最为显著。此外,该方法还能产生更连贯的梯度,并在不同问题类型间实现更均衡的准确率,同时**不会永久排除任何训练样本**——这保证了数据利用的完整性。 从行业视角看,后训练是 LLM 落地应用的关键环节,其成本往往占整体训练开销的相当比例。SDO 提供了一种轻量级、与模型无关的优化思路,可无缝嵌入现有训练流程,对资源受限的团队尤其具有吸引力。未来,如何将 SDO 与课程学习、主动学习等策略进一步结合,或将其扩展至多模态大模型的后训练,将是值得期待的研究方向。

HuggingFace1个月前原文

在半导体封装设计中,热机械可靠性分析至关重要,传统上依赖昂贵的有限元分析(FEA)模拟。近年来,Transformer-based替代模型被引入以加速这一过程,但常规Transformer在小规模、低维度的工程数据集上往往参数过多,导致过拟合和计算资源浪费。为此,一篇新论文提出了递归Transformer架构,旨在通过增加计算而非参数来提升性能,并在实际任务中进行了硬件感知评估。 该研究对比了三种递归Transformer范式:Tiny Recursive Model、提出的Depth Recursive Transformer以及简单递归Transformer,并在两个低维工程预测任务上验证了其有效性:一是先进半导体封装的热机械可靠性分析,需在实验设计扫描中反复评估热循环下的应力和翘曲;二是用于电容场的Laplace PDE迭代数值求解。评估指标包括预测性能(Recall、Mean Reciprocal Rank)、参数数量和计算复杂度(FLOPs)。 结果表明,递归权重共享Transformer在预测精度、参数效率和计算成本之间提供了有效且可推广的平衡,特别适用于小数据工程替代建模场景。例如,在热机械可靠性任务中,递归模型在保持高精度的同时,显著减少了参数和计算开销,避免了过拟合。研究还提供了在资源受限情况下选择递归Transformer架构的实用设计指南。 这项工作为工程设计中替代模型的选择提供了新思路,尤其适合数据稀缺但需要反复评估的场景,有望加速半导体封装设计的迭代优化。

HuggingFace1个月前原文

## 现象:随机网络中的意外稀疏性 深度强化学习(DRL)中,一个常见的做法是使用预训练或可训练的卷积神经网络(CNN)作为特征提取器。然而,一篇来自arXiv的新研究(论文ID: 2607.26059)揭示了一个令人惊讶的现象:当使用**完全冻结、随机初始化的CNN**作为特征提取器时,训练后的全连接层会自发地变得极度稀疏,且无需任何显式的稀疏性诱导目标。 ## 关键发现:稀疏性如何体现 研究者在Atari游戏(Pong、Breakout、Space Invaders)上进行了实验。在第一个全连接层(FC1,从3136维降至64维)中,对于确定性Pong任务,智能体仅使用**1-3个神经元**(共64个)来压缩任务相关信息;对于随机性Pong,这一数字为5-11个。相比之下,可训练的CNN在相同条件下会激活55-64个神经元。 稀疏性随任务复杂度变化: - Pong:1-11个活跃神经元 - Breakout:19-26个 - Space Invaders:约42个 这表明稀疏模式反映了任务的内在结构,而非固定的容量比例。 ## 更深入的洞察:随机投影的局限性 一个有趣的发现是,**同一游戏的不同随机种子会导致不同的稀疏模式**。例如,三个相同的Pong种子分别产生了5、7和11个活跃神经元。其中,5神经元的种子奖励停滞在+14,而其他两个种子达到了专家级表现(+18.4和+18.7)。这暗示了随机投影的可用维度限制了可达到的性能上限。 进一步的消融实验证实了这些活跃神经元的必要性:移除它们会导致性能崩溃,这一结果在两种PPO实现和四个游戏中均得到验证。 ## 信息瓶颈的早期锁定 研究还发现,活跃神经元的集合在训练早期(15-30百万步)就已锁定,而奖励变为正值则是在35-105百万步之后。这意味着**信息瓶颈在性能提升之前就已形成**。 在Breakout游戏中,冻结CNN和可训练CNN通过结构不同的瓶颈达到了竞争性奖励:冻结网络使用17-25个活跃神经元(参与率约10-14),而可训练网络使用51个(参与率约3.6)。这说明冻结网络通过更窄但更高效的瓶颈来传递信息。 ## 理论意义与实践启示 这项研究的核心启示是:当输入维度远超任务内在维度时,对冻结的随机投影进行梯度下降,可以**无需显式稀疏化机制而揭示问题的有效秩**。这为理解深度强化学习中的表示学习提供了新视角,也可能启发更高效的网络设计——例如,使用随机固定特征提取器配合稀疏可训练层,从而降低计算成本。 对于AI从业者而言,这一发现提示我们:在资源受限的场景下,或许不必执着于端到端训练,**冻结的随机特征提取器+稀疏可训练层**可能是一种被低估的实用方案。

HuggingFace1个月前原文

## 足球预测的新范式:从“看队名”到“看打法” 在职业足球中,赛前战术决策长期依赖专家经验和基于球队身份的球探系统,这意味着面对从未交手过的陌生对手时,传统方法往往失效。近日,一篇发表于 arXiv 的论文提出了 **Sim2Win**——一个**去团队身份、基于事件**的赛前战术推荐框架,将比赛结果预测重新定义为战术决策支持问题。 ### 核心设计:不看队名,只看行为 Sim2Win 的核心创新在于完全摒弃球队名称或身份特征,仅通过比赛事件数据构建“战术画像”。研究团队使用 **StatsBomb** 提供的公开事件数据,覆盖 11 项赛事、178 支球队和 1,411 个球队-比赛记录。系统为每支球队构建**五场比赛滚动战术档案**,并设计了四个可解释的战术特征比率,例如控球倾向、进攻方式、防守密度等。 随后,通过 **K-Means 聚类**将球队行为归纳为**八种风格类型**,再训练 13 种分类器,基于战术匹配关系预测胜、平、负的概率。整个过程不依赖任何球队 ID,使得模型可以推广到训练中从未出现的球队。 ### 性能表现:超越传统基线 为了验证泛化能力,研究采用**留一赛事交叉验证(LOCO)**方式:每次用一个完整赛事的数据作为测试集,其余赛事用于训练。结果显示,Sim2Win 在完全未见过的球队上取得了**平均 ROC-AUC 0.704** 和**平均准确率 55.4%**,在全部 21 个 ROC-AUC 对比和 19 个准确率对比中,均优于 **ELO、Pi-Rating 和 GAP** 等传统基线。 在所有评估模型中,**CatBoost** 取得了最强的分布内性能,准确率达到 **60.90%**。 ### 行业意义:行为驱动的预测正在崛起 Sim2Win 的价值不仅在于预测精度,更在于其**可解释性和迁移性**。传统足球分析系统往往因数据来源不同、球队更迭频繁而难以跨赛事应用。而 Sim2Win 通过抽象出“战术行为”这一通用语言,证明了一件事:**球队的踢法模式比队名更能预测比赛结果**。 这一思路对于 AI 在体育分析中的应用具有启发意义——当身份信息不可靠或不可用时,行为特征仍能提供稳定的预测信号。未来,类似的“去身份”框架或许也能迁移到其他团队竞技项目,如篮球、电竞等。 > 论文代码已开源,感兴趣的读者可以进一步探索其技术细节。Sim2Win 是否真能改变教练团队赛前准备的方式?我们拭目以待。

HuggingFace1个月前原文

## 研究背景与挑战 红外(IR)光谱是分析化学中常用的分子结构表征工具,但传统上依赖人工解读。近年来,AI 在自动化分子结构解析方面取得进展,但现有方法大多**需要预先提供化学分子式**作为辅助输入,这限制了模型只能用于同分异构体识别,而非真正的无约束结构预测。尽管 Transformer 模型在同分异构体识别上表现出色,但在无约束场景下(即仅凭 IR 光谱预测完整分子结构)的可靠性较低,且其内在机制尚不明确。 ## 核心创新:MoE 解码器与对比对齐 来自密苏里大学等机构的研究者提出了一种改进的编码器-解码器 Transformer 架构,旨在解决上述问题。关键创新包括: - **Mixture-of-Experts (MoE) 解码器模块**:采用非加性聚合方法,利用线性阶统计量和 Choquet 积分,以更好地处理无约束化学空间中的复杂关系。 - **非加性光谱表示聚合**:同样将非加性算子应用于编码器端的光谱特征聚合,提升表征能力。 - **辅助对比对齐损失**:通过对比学习拉近同一分子不同光谱表征的距离,增强模型对关键化学信息的捕捉。 ## 性能提升与验证 实验表明,上述改进使 **Top-K 预测准确率相比基线 IR-only 模型提升了超过 10 个百分点**。此外,通过子结构片段分析,研究者确认**红外光谱本身编码了绝大部分相关化学信息**,这意味着同分异构体识别模型的高性能主要源于化学空间中分子吸收带的重叠或表征不足,而非模型本身更强大。 ## 意义与展望 该工作证明了**直接从实测红外光谱进行自动化分子结构解析的可行性**,显著拓宽了 AI 在分析化学中的应用范围。未来,该技术有望加速未知化合物的鉴定,在药物发现、材料科学和环境监测等领域发挥重要作用。研究者同时指出,当前方法仍面临化学空间覆盖度和吸收带重叠等挑战,需要进一步优化。

HuggingFace1个月前原文

arXiv:2607.26173v1 Announce Type: new Abstract: Alignment training, model organisms, and toy models are usually treated as separate research areas. But projects in all three frequently use supervised fine-tuning (SFT) to pursue the same underlying goals. When projects share a goal, we should test whether lessons learned from one area transfer to the other areas. We study three such transfers, each taking a lesson developed in one SFT setting and testing it in another. First, we port a lesson abo

HuggingFace1个月前原文

## 快讯:动态参数化不等于动态推理 一篇来自arXiv的最新论文(编号2607.26192)指出,AI社区中广泛存在一种概念混淆:将**输入依赖的控制器系数**当作动态推理或计算节省的证据。实际上,这一现象涉及三个不同性质:系数变化、冻结模型对系数分配方式的依赖、以及条件执行。研究团队聚焦于第二个性质,提出了**冻结控制器审计(FCA)** 原则与具体实现。 ## 核心发现 FCA通过缓存未扰动轨迹下的完整系数张量,禁用控制器,并在冻结模型上执行跨输入重分配、令牌洗牌和静态剖面分析。由于系数在干预前已缓存,性能变化直接反映分配依赖,而非因扰动隐藏状态重新计算控制器带来的反馈。 实验基于**7个独立训练的76M参数FeatureGate Transformer**和**3个504M模型**,结果显示: - 静态逐层剖面能保留**98.70%**(76M)和**99.43%**(504M)的Correct-to-GlobalMean性能差距。 - 层身份解释了**87%到96%**的系数方差。 - FeatureGate虽然采用动态参数化,但实际执行了每一个Transformer块,推理速度反而比Dense模型慢**30.8%**。 在公开的**MUDDPythia-1.4B**检查点上,跨输入重分配使NLL增加**1.9067**,令牌洗牌使NLL增加**2.9637**,表明模型强烈依赖基于内容的跨层分配。MUDDPythia同样执行了每一个Transformer块。 ## 行业启示 该研究提醒我们:动态参数化本身并不建立动态推理,功能动态也不等于计算节省。**评估动态模型时,应分别报告系数变化、冻结模型的功能依赖以及实际执行情况**,避免将参数层面的动态等同于推理层面的高效。这对于当前追求稀疏激活和条件计算的AI模型设计具有重要警示意义。

HuggingFace1个月前原文

## 弱到强在线蒸馏:让弱小模型教会强大模型的新范式 在大型语言模型(LLM)能力迁移领域,**在线蒸馏(On-Policy Distillation, OPD)** 一直被视为有效范式。它通过让学生模型在自己的生成序列上对齐教师模型的词元级分布,实现能力转移。然而,传统 OPD 方法存在一个隐含假设:**教师模型必须至少与学生模型同等或更强**。这导致两个困境:一是当学生模型已处于能力前沿、不存在更大教师时,蒸馏无法进行;二是若想通过合并多个领域专家来提升学生,则需在学生规模上进行昂贵训练。 近期,一篇来自微软研究团队的论文《Weak-to-Strong On-Policy Distillation》提出了一种颠覆性框架——**弱到强在线蒸馏(W2S-OPD)**,首次证明**多个弱模型可以共同教出一个更强的学生模型**,且无需大规模额外训练。 ### 核心方法:对比对构造代理教师 W2S-OPD 的关键在于构造一个“代理教师”。它并非真实存在的完整模型,而是在**logit 空间**中通过一对对比模型(正模型和负模型)的 logit 差构建而成。这对模型都比学生小,获取成本低。它们的 logit 差能够隔离出特定的能力方向(如推理技能、规模优势、实例级解题方向)。将这个方向向量加到学生自身的基础模型 logit 上,便得到一个既包含该能力方向、又在分布上与学生接近的代理教师。随后,学生通过最小化自身生成序列上的**逐词元反向 KL 散度**来蒸馏这一代理教师。 论文给出了三种对比对实例: - **后 RL 专家 vs. 前 RL 初始化**:隔离强化学习注入的技能; - **大基础模型 vs. 小基础模型**:隔离规模带来的能力; - **带正确提示的小模型 vs. 带错误提示的小模型**:隔离实例级的解题方向。 ### 实验结果:超越教师与持续进步 在 **4 个数学基准** 和 **3 个代码基准** 上,W2S-OPD 全面优于传统 OPD。更令人惊讶的是,学生模型不仅能超越领域专家(如后 RL 教师),**即使所有监督源都比学生弱,学生仍能持续提升**。分析表明,不同对比对提供了不同的信号:后 RL 对比和提示对比侧重于推理框架,而规模对比则强调解题过程。 ### 行业意义与未来展望 这项研究挑战了“强者为师”的固有认知,为 LLM 能力提升开辟了新路径。在模型规模竞赛日益激烈的当下,W2S-OPD 提供了一种**低成本、可扩展的持续改进方案**:无需等待更大模型出现,也无需重复大规模训练,只需利用已有的弱模型组合,即可推动前沿模型进一步进化。这或许意味着,未来 LLM 的进步不再单纯依赖算力堆砌,而是更依赖**智能的蒸馏策略与对比学习设计**。 论文代码将在 GitHub 公开,值得关注。

HuggingFace1个月前原文

低秩适配(LoRA)已成为大模型微调的主流方法,其性能高度依赖适配器的初始化策略。来自 arXiv 的最新论文《Between Gradient and Natural Gradient: A Continuum of LoRA Initializations》揭示了当前多种初始化方法本质上是同一连续族中的特例,并提出统一框架 **ULoRA**,通过调节两个关键参数即可覆盖从原始梯度到自然梯度的整个谱系。 ## 从离散到连续:ULoRA 的统一视角 论文指出,此前看似不同的初始化方案——例如将原始梯度投影到其主方向,或先用损失曲率估计对梯度进行白化——其实只是 **ULoRA** 这一两参数族中的两个端点。这两个参数分别是**谱白化指数**和**类 Adam 对角指数**,分别控制对梯度协方差矩阵的校正强度和对各维度步长的缩放程度。通过连续调节这两个指数,可以平滑地在“纯梯度”与“自然梯度”之间移动。 ## 任务依赖的最优点 研究团队在 **RoBERTa-base** 的 GLUE 五项任务和 **LLaMA-2-7B** 的 GSM8K 数学推理任务上进行了全面实验。结果显示,**没有单一固定的预条件强度能始终最优**,最佳配置因任务而异,且经常落在 ULoRA 族内部的非端点处。例如,在 GLUE 的 MRPC 任务上,偏向自然梯度的初始化表现更好;而在 RTE 任务上,接近原始梯度的设置反而更优。这意味着,将初始化策略视为可调维度而非固定选择,能显著提升 LoRA 微调的上限。 ## 自动选择:ULoRA-Auto 的实用方案 为避免繁琐的手动调参,论文进一步提出 **ULoRA-Auto**——一种无需搜索的变体。它根据每层适配器所处理的激活矩阵的谱统计量(如特征值分布),自动为两个指数选取合适数值。实验表明,ULoRA-Auto 的性能接近经过完整搜索的 ULoRA 最优配置,且在多个基准测试中排名前列,优于现有的可部署 LoRA 方法。 ## 行业启示 这项研究为 LoRA 初始化提供了理论统一视角,也带来了实践指导:**预条件梯度初始化不应被固化,而应作为一个可调节的超参数维度**。对于 AI 工程师而言,ULoRA-Auto 提供了一种即插即用且性能强劲的初始化方案;对于研究者,这项工作打开了探索梯度预条件与模型微调之间关系的新窗口。未来,类似思路或许能推广到其他参数高效微调方法(如 AdaLoRA、DoRA)中,进一步释放大模型在下游任务上的潜力。

HuggingFace1个月前原文

## 核心结论 强化学习从人类反馈(RLHF)是大语言模型对齐偏好的主流方法,但其质量受限于静态、任务无关的奖励模型。这种不匹配导致学习信号稀疏,对齐效果欠佳。最新研究提出 **MeRLa(Meta-Learned Reward Shaping)**,一种通过元学习任务感知塑形函数的框架,在 RLHF 训练前从辅助任务中学习奖励塑形,从而生成复合奖励,既保持策略最优性,又提供任务特定的学习信号。在 LLaMA-3-8B 上的实验表明,MeRLa 在 AlpacaEval 2.0 上达到 **90.8% 的长度控制胜率**,MT-Bench 得分 **9.14**,且训练不稳定性降低 **41%**,全面超越 PPO、DPO、GRPO 和 DAPO。 ## 方法亮点 MeRLa 的核心是学习一个塑形函数 Φ(x,y;φ),将其与原始奖励结合形成复合奖励。其元目标函数融合了**任务区分、熵正则化和基于势能的守恒**,确保收敛稳定。理论方面,论文提供了策略不变性的理论保证,分析了表征漂移敏感性,并正式解决了熵最大化带来的激励错位问题。 ## 实验结果 在 LLaMA-3-8B 上,MeRLa 在四个基准测试中一致优于现有方法。除了上述主要指标,MeRLa 还能与基于过程或基于规则的增强奖励相结合,保持其优势。这表明元学习奖励塑形是一种通用且有效的 RLHF 增强手段。 ## 行业意义 RLHF 是当前大模型对齐的核心技术,但奖励模型的设计一直是个难题。MeRLa 通过元学习自动生成任务感知的塑形函数,减少了人工设计奖励的负担,同时提升了训练稳定性和最终性能。这一工作为更高效、更可靠的模型对齐提供了新思路,有望推动 RLHF 在实际应用中的广泛部署。

HuggingFace1个月前原文

arXiv:2607.22720v1 Announce Type: new Abstract: Existing adaptive inference methods for Large Language Models rely on observational heuristics, such as hidden-state similarity or activation magnitudes, to drop redundant modules. However, these correlation-based metrics often fail to capture subtle, non-linear structural computations vital for semantic accuracy. We introduce CausalGate, an intervention-guided framework for compute-efficient transformer inference. During a calibration phase, Causa

HuggingFace1个月前原文

arXiv:2607.22724v1 Announce Type: new Abstract: Group-based policy optimization has been increasingly used to train large language model (LLM) agents from sparse outcome rewards by comparing trajectories or steps within a group. However, on difficult long-horizon tasks, this comparison can suffer from a sampling imbalance: repeated or low-effect actions dominate the high-probability region of the policy while useful state-changing actions remain under-sampled. This imbalance produces many all-fa

HuggingFace1个月前原文

arXiv:2607.22711v1 Announce Type: new Abstract: LLM coding agents operate by constructing trajectories that accumulate reasoning, tool calls, and results to enable multi-step decision-making. However, the conventional append-only trajectory architecture found in practice tightly couples file-read actions with their observations, capturing snapshots that become permanently fixed in the chronological history. As files change through agent edits or concurrent human modifications, these snapshots be

HuggingFace1个月前原文

arXiv:2607.22545v1 Announce Type: new Abstract: Deploying large language models in financial-services and agentic settings requires safety classifiers that simultaneously handle prompt injection, regulatory compliance, and general harm, a combination no existing open guardrail addresses in a single inference pass. Semalith v1.4 is a 184M-parameter DeBERTa-v3-base classifier performing simultaneous three-axis safety classification including prompt injection, general harm, and financial-services r

HuggingFace1个月前原文