**LoKiFormer 架构发布:预训练提速 1.33 倍,兼顾局部与全局知识** 近日,一项名为 LoKiFormer 的新研究在 arXiv 上公开,并被 ICML 2026 接收。该研究针对当前大语言模型(LLM)预训练效率低下的问题,提出了一种全新的架构设计,通过引入局部融合注意力(LFA)与知识记忆模块(KMM),在信息整合效率上实现了显著提升。实验显示,LoKiFormer 在预训练阶段的收敛速度比基线模型快 1.33 倍,为 LLM 的高效训练提供了新思路。 ## 现有 LLM 架构的两大瓶颈 尽管 LLM 在众多应用中表现卓越,但其预训练过程仍存在结构性缺陷。研究团队指出,两大问题尤为突出: - **自注意力缺乏局部归纳偏置**:自注意力机制在处理序列内部信息时,没有显式地偏向局部模式,导致对局部信息的冗余建模,浪费计算资源。 - **混合专家(MoE)中知识与计算耦合**:MoE 隐式地将知识存储与计算路径绑定,使得模型难以灵活访问序列外部的全局知识,限制了知识利用的灵活性。 ## LoKiFormer 的解决方案:双模块协同 针对上述问题,LoKiFormer 在标准解码器上增加了两个专用模块: - **局部融合注意力(LFA)**:该模块将卷积融合引入注意力机制,显式捕捉局部模式,使注意力能够作用于更具信息量的表示,从而减少对序列内部局部信息的冗余建模。 - **知识记忆模块(KMM)**:这是一个参数化的键值记忆系统,将全局知识显式存储在可寻址的槽位中,实现存储与计算解耦,支持直接的知识检索,增强了模型对全局知识的访问能力。 两个模块协同工作,使 LoKiFormer 能在局部与全局两个层面高效整合信息,兼顾效率与效果。 ## 实验验证与行业意义 研究团队在预训练任务上对 LoKiFormer 进行了评估,结果显示其收敛速度比基线模型快 1.33 倍,证实了架构设计的优越性。这一成果不仅为 LLM 预训练效率的提升提供了可行路径,也对当前追求更大规模模型与更低训练成本的行业趋势具有重要意义。随着模型规模持续扩大,训练效率成为关键瓶颈,LoKiFormer 的局部感知与知识解耦思路,或将为下一代高效 LLM 架构的设计提供重要参考。 不过,该研究目前仍处于论文阶段,其实际应用效果与扩展性尚待进一步验证。未来,团队或许会开源代码并公布更多实验细节,以推动该架构在业界的落地。
## 免费卫星数据如何预测喜马拉雅冰川湖溃决风险? 一项新研究利用免费卫星数据,尝试预测喜马拉雅冰川湖溃决、滑坡和冰川洪水等灾害风险。该研究已提交至 arXiv(编号:2608.12422),由 Matthew Kahn 等人完成。研究团队发现,雷达干涉测量技术能够捕捉到冰碛坝的缓慢变形,而卫星气象数据则能揭示湖泊处于压力的时期。这两类信号分别回答了“哪个地点有风险”和“何时有风险”的问题。 ### 核心发现 研究聚焦于三种相关灾害:大型冰碛坝和冰坝溃决、降雨引发的滑坡,以及冰川上或周边的池塘洪水。每种灾害都对应两个问题:地点和时间。利用 HMAGLOFDB 数据库中的 **589 起冰湖溃决事件** 和数千起滑坡记录,研究者将每个事件与相似但未发生灾害的地点进行匹配,并采用严格的空间交叉验证方法,确保模型不会因识别训练过的邻近区域而“作弊”。 结果显示,**前期天气状况** 在预测触发时间方面表现出色:大型溃决的 ROC 值为 **0.73**,滑坡为 **0.83**,小型洪水为 **0.82**。然而,地形在预测地点方面的能力有限:虽然简单评分看似接近 0.9,但考虑到已记录灾害多集中在湿润地区,与邻近相似地点对比后,真实值仅为 **0.76**(大型溃决)、**0.71**(滑坡)和 **0.54**(小型洪水,与随机猜测无异)。不过,在尼泊尔境内,大型溃决的预测准确率提升至 **0.89**。 ### 模型对比与局限 研究还比较了五种深度学习模型与简单梯度提升基线模型的表现。结果发现,深度学习模型并未显著优于基线,仅在滑坡预测上略有优势,但差异不足以确认。对于湖泊灾害,基线模型完全胜出,其决策规则可简化为基于地形粗糙度和季风降雨的三条规则。 研究团队强调,他们提供的是 **尼泊尔排名观察清单**,作为优先级排序的辅助工具,而非精确预测。同时,他们也指出了免费数据在预测中的局限性。 ### 意义与展望 这项研究展示了免费卫星数据在灾害预警中的潜力,尤其是在数据稀缺的喜马拉雅地区。尽管模型精度仍有提升空间,但该方法为资源有限地区的灾害风险管理提供了新思路。未来,结合更高分辨率的数据或更先进的模型,可能进一步提高预测能力。
Transformer 凭借随上下文长度增长的 token 级记忆,在长上下文检索任务中表现卓越,但代价是训练时的二次计算复杂度和推理时线性增长的 KV 缓存。循环神经网络(RNN)类模型通过将全部历史压缩为固定大小的状态来实现高效解码,却常在需要精确回忆的任务中败下阵来——早期信息往往被后续更新覆盖,模型只记得最近的内容。 针对这一矛盾,来自清华大学、上海交通大学等机构的研究者提出了 **MARCH(Memory-Anchor Routing across Context History)** 架构,在保持循环模型高效推理的同时,让记忆容量能随上下文长度灵活扩展。其核心思想是:**周期性将累积的循环状态检查点保存为“状态锚点”,并为每个锚点生成一个紧凑的内容相关键(anchor key)**。这样,模型就拥有一个可增长的内存库,用户可以在历史分辨率和内存开销之间进行可控的权衡。 具体而言,在每个时间步,MARCH 会生成一个锚点查询(anchor query),对所有因果可用的状态锚点进行注意力聚合,输出则是对所有历史锚点沿当前状态进行注意力式加权求和的结果。这种设计让模型在保留循环计算路径的同时,能够直接“回看”较早的状态锚点,从而缓解信息覆盖问题。 实验结果显示,在标准预训练后,MARCH 在常识推理、LongBench 和上下文检索等多个基准上**一致优于多种线性注意力变体**。这表明,内容路由的状态缓存能显著增强循环模型的长程记忆能力,同时不破坏其固有的高效计算路径。 这项研究的价值在于,它提供了一种新的思路来平衡效率与性能:既不像 Transformer 那样完全依赖随长度增长的显式记忆,也不像传统 RNN 那样将记忆压缩到固定大小,而是通过锚点机制实现一种“可扩展的循环记忆”。这对于长文本处理、多轮对话、代码生成等需要长程依赖的应用场景,可能带来更实用的解决方案。 当然,该工作目前仍处于 arXiv 预印本阶段,其实际效果和可扩展性尚需进一步验证。但 MARCH 所展示的方向——在循环架构中引入内容寻址的记忆缓存——无疑为高效长上下文建模提供了新的可能。
生成式AI领域近日出现一项颇具理论深度的新研究。来自意大利米兰大学的研究者Ramon Winterhalder在arXiv上发布论文,提出用**路径积分**(Path Integral)统一描述流模型、扩散模型、变分模型和对抗生成网络(GAN)等主流生成范式。这一框架不仅为理解现有模型提供了新视角,还带来了可操作的性能改进:在特定测试中,将确定性采样器的误差从53%大幅降至1.6%。 ## 核心思想:一个主作用量,多种评估原则 论文的核心在于,将生成建模视为一个路径积分问题,而流模型、扩散模型、变分模型和对抗模型,不过是同一个主作用量(master action)的不同评估方式。这一灵感源自物理学中的**马丁-西格亚-罗斯-詹森-德多米尼西斯(MSRJD)形式**,它原本用于描述随机系统的动力学。 借助MSRJD形式,研究者将概率流分解为“自由”与“相互作用”两部分,从而可以借用**费曼图**和微扰理论进行分析。这种处理方式在生成模型理论中相当新颖,它让原本看似不同的模型家族在数学上被统一起来。 ## 实际收益:无额外采样成本的一圈修正 论文最亮眼的成果之一,是推导出对确定性采样器的**一圈(one-loop)修正**,且不增加任何随机采样的计算开销。在可解漂移和非线性漂移的测试中,该修正将树级误差从53%降至1.6%,效果显著。这意味着,在现有采样器的基础上,只需添加一个解析修正项,就能大幅提升生成样本的准确性,而无需引入额外的随机性。 此外,论文还处理了**不完美学习分数**(imperfect learned scores)的情形。在真实场景中,模型学到的分数函数往往有误差,论文将这种误差视为“插入项”,并由此推导出一个**响应加权的分数匹配目标**,有望改进训练过程。 ## 理论延伸:对称性与EFT幂次计数 论文还探讨了对称性等变的漂移设计,将其表述为算符展开,并引入**有效场论(EFT)幂次计数**。这为设计具有特定对称性的生成模型提供了系统化方法,可能对物理、化学等领域中需要保持对称性的数据建模有重要价值。 ## 意义与展望 这项研究尚处于理论阶段,但为生成模型领域提供了一个统一的数学语言,有望促进不同子领域之间的交叉借鉴。例如,扩散模型的去噪技巧能否直接应用于流模型?GAN的对抗训练能否用路径积分重新解释?这些问题现在有了更清晰的思考框架。 当然,该框架的实际应用仍需进一步验证。论文中展示的数值实验相对简单,未来能否在图像、文本等高维复杂数据上复现类似收益,还有待探索。但无论如何,这一理论尝试为生成式AI的底层逻辑带来了新的洞见,值得关注。
动态图上的深度学习异常检测器已达到较高准确率,但当一条边被标记为异常时,分析人员只得到一个分数,却不知其所以然。这种“黑箱”在强调协作与合规的信息系统中难以被接受,因为自动化决策必须可审计、可信赖。针对这一痛点,一项新研究为经典的 GCN+GRU 框架 AddGraph 提出了首个严格的事后(post-hoc)可解释性方案——X-AddGraph,其核心是一种双时空归因(DSTA)机制,能够在不改动检测器的情况下,揭示异常评分背后的空间与时间线索。 ## 架构对齐的归因设计 X-AddGraph 的巧妙之处在于,其三个归因组件分别对应 AddGraph 的架构模块: - **空间归因**:基于梯度的相关性归因,作用于当前邻接结构,指出哪些节点连接对异常判定贡献最大; - **短期时间归因**:直接读取推理过程中已计算的上下文注意力权重,不增加任何额外计算成本; - **长期时间归因**:通过循环隐藏状态的梯度回滚,追溯历史快照的影响。 由于检测器被冻结,其检测性能完全保留,实验验证 ΔAUC 精确到小数点后十位均为 0。在 UCI Message 基准上,训练后的 AddGraph 基线平均每快照 AUC 达到 0.8705,优于原论文结果;X-AddGraph 在复现每个分数的基础上,补充了此前缺失的解释信息。 ## 长期归因的价值:反事实信号 研究在四类边样本(高置信度真阳性、低置信度真阳性、假阳性、随机样本)上评估了归因效果。结果显示,长期归因能够识别出携带显著更多反事实信号的历史快照(0.127 vs. 0.074),这一能力是任何仅关注空间结构的解释器都无法提供的。这意味着,当系统标记一条异常边时,X-AddGraph 不仅能告诉你“哪里异常”,还能告诉你“何时开始异常”,为分析人员提供了更完整的因果链条。 ## 应用前景与开源 该框架为动态图异常检测的落地提供了重要支撑,尤其是在金融反欺诈、网络安全监控、社交网络风险预警等对可解释性要求极高的场景中。研究人员已公开实现代码,以促进可复现性与后续研究。目前该论文正在投稿至 CoopIS 会议,其方法有望成为图异常检测可解释性研究的新基准。 对于 AI 从业者而言,X-AddGraph 展示了一条“架构对齐”的可解释性路径:不牺牲性能,不增加推理负担,却能显著提升模型透明度。这种思路或许也能迁移至其他循环图神经网络,值得关注。
**睡眠阶段自动分类**是睡眠障碍诊断与管理的核心环节,但长期以来,大多数自动分期研究都依赖单一参考睡眠图(hypnogram)作为金标准,忽略了不同评分者之间的主观差异。这种“单专家”评估模式可能掩盖模型在真实世界中的表现波动。 针对这一问题,一项来自伊朗研究团队的最新研究提出了一种**基于学习的个性化评分建模框架(LBH)**,旨在从多位专家的评分中聚合出更稳健的参考标签。该研究已在 arXiv 上发布(编号:2608.12446),并采用公开数据集 **DOD-H** 和 **DOD-O** 进行验证。 ### 核心方法:从“投票”到“概率聚合” 传统做法通常采用多数投票或选择“最佳评分者”作为参考,但这会丢失个体专家的独有信息。LBH 的思路截然不同:它为每位评分者建立**个性化混淆矩阵**,利用机器学习模型(随机森林、支持向量机、多层感知机)学习每位评分者对不同睡眠阶段的误判模式。 具体而言,研究团队从 EEG(C3-M2)和下颌肌电(chin EMG)信号中提取特征,每 30 秒为一个 epoch,共提取 60 个特征(EEG 与 EMG 各 30 个)。随后,通过列归一化后的混淆矩阵,估计“在评分者给出某标签时,真实睡眠阶段为各阶段的概率”。最后,将所有评分者的概率进行聚合,为每个 epoch 分配最终标签。 ### 结果:全面优于传统基线 实验在 EEG-only 和 EEG+EMG 两种设置下进行,并与数据集原始睡眠图(DH)及最佳评分者睡眠图(BSH)进行对比。结果显示,LBH 在所有分类器和特征组合下均取得了一致性提升。 最佳表现出现在**随机森林 + EEG+EMG** 组合:在 DOD-H 数据集上,准确率达到 **86.07%**,精确率 **85.46%**,F1 分数 **85.29%**;在 DOD-O 数据集上,准确率为 **86.04%**,精确率 **85.21%**,F1 分数 **84.70%**。 ### 意义与展望 这项研究的价值在于,它没有简单地将多专家评分压缩为单一“正确答案”,而是**保留了每位专家的判断特征**,通过概率建模实现了更可靠的参考标签生成。这种方法不仅适用于睡眠分期,也可能推广到其他依赖主观标注的医学影像、病理分析等领域。 当然,该框架仍处于验证阶段,其泛化性需在更多样化的数据集和临床环境中进一步检验。但至少,它为“如何从多个专家中学习”提供了一个值得借鉴的范式。
一项新研究揭示了Transformer模型内部的一种隐藏结构:预测方向(即模型当前预测token的反嵌入方向)在残差流中扮演着“特权锚点”的角色。该发现或有助于理解大语言模型如何在高维空间中组织信息并实现线性读取。 ## 研究发现 研究者Nelson Guda在论文《Geometric and Behavioral Stratification in Transformer Residual Streams》中,对18种不同规模(7B至120B)和架构(稠密及混合专家)的Transformer模型进行了系统性分析。结果发现,残差流中的变化可以依据与预测方向的接近程度进行几何和行为上的分层:靠近预测方向的区域高度结构化,能有效聚类相关提示;而远离预测方向的区域则相对平坦,对提示组的区分能力较弱。 ## 关键结论 - **预测方向作为特权锚点**:预测方向与主方差轴近乎正交,因此传统的方差分析方法只能部分捕捉这种组织,且随着提示异质性增加而失效。 - **窄而关键的预测接口**:靠近预测方向的区域虽然狭窄,但功能上至关重要。干扰这些方向会导致模型立即出现发散和任务框架转换;干扰次近方向则会延迟发散但保持框架。 - **方向而非幅度驱动行为**:研究指出,行为主要由方向而非幅度驱动,且远离预测方向的区域虽然与读取对齐较弱,但在因果和时间上承载着重要功能。 ## 意义与展望 这项研究首次将预测方向确立为一种独特的特权锚点,区别于先前描述的坐标轴,为高维计算与线性读取的共存提供了几何解释。该成果可能对模型可解释性、压缩和微调策略产生深远影响。不过,目前该研究尚未经过同行评审,其结论仍需进一步验证。
多自主水下机器人(AUV)自组网协同目标跟踪,是海洋探测与防御领域的关键技术。然而,在水下声学通信受限、网络拓扑动态变化以及海洋扰动不确定的环境下,实现高效协同面临巨大挑战。尽管多智能体强化学习(MARL)通过集中训练与分散执行展现潜力,但现有方法在高维联合状态-动作建模和策略生成方面存在噪声敏感、训练不稳定等问题。为此,研究者提出了一种名为**VGG-MADiffRL**的值梯度引导多智能体扩散强化学习算法,并配套设计了**MDCA**扩散分层控制架构,为动态水下环境中的协同跟踪提供了新思路。相关论文已提交至arXiv(编号2608.12436)。 ## 方法核心:扩散模型与值梯度结合 VGG-MADiffRL将扩散模型引入多智能体策略学习。扩散模型通过逐步去噪生成动作,天然具备处理高维连续动作空间的能力。但标准扩散策略可能生成低回报动作,为此,算法在逆向去噪过程中引入**值梯度**,引导动作生成朝向更高期望回报的方向。同时,采用**孪生价值网络**与软目标更新,抑制过估计与训练振荡,提升收敛稳定性。 ## 架构设计:三层闭环控制 MDCA架构分为**全局智能控制层**、**本地在线训练层**和**物理动作执行层**,形成三层闭环。全局层负责任务分配与全局优化,本地层基于VGG-MADiffRL进行策略学习,执行层将决策转化为物理动作。这种分层设计实现了任务、决策与执行的协同优化,尤其适应水下通信延迟与拓扑变化。 ## 实验验证与工程价值 实验表明,VGG-MADiffRL在协同跟踪场景中**收敛更快、跟踪精度更高、训练过程更平滑**。研究者还建模了声呐探测机制与海流扰动,使仿真更贴近实际。该方法不仅提升了算法性能,也为多AUV系统在动态水下环境中的实际部署提供了工程参考。 ## 局限与展望 尽管成果显著,但研究仍处于仿真阶段,真实海试尚待开展。未来,如何将算法迁移至真实AUV平台,并应对更复杂的水声信道与能耗约束,是后续研究的重要方向。
学术机构正广泛使用商业AI检测工具来维护学术诚信,但一项新研究揭示了这些工具的根本性缺陷:它们无法区分AI辅助编辑与完全由LLM生成的草稿,可能将合规的AI辅助行为误判为学术不端。研究团队在arXiv上发布的预印本中,通过对2013-2015年与2023-2025年四个领域的已发表英文摘要进行受控实验,量化了这一政策失效问题。结果显示,在tau=0.50的代理标签下,轻量级的“仅润色摘要”编辑(代表合规的AI辅助)被标记为AI生成的比例高达64%至80%(Pangram/GPTZero),而未经修改的近年原文被误标率仅为9%至15%,且非STEM领域远高于STEM领域(p<0.001)。研究还发现,检测得分与长token及学术词汇密度相关,而非仅与作者意图相关。更令人担忧的是,使用Undetectable AI等工具进行“人性化”改写后,AI标记率降至4%以下,即规避几乎完全成功,而诚实使用AI辅助的学者反而面临更高的制裁风险。该研究明确指出,检测器分数不应作为学术不端的唯一证据。
在金融预测领域,一项新研究提出了一个名为Forma的AI模型,能够对未来20个季度的完整财务报表进行预测,这在以往的研究中尚属首次。该研究由Travis L. Johnson等人完成,并发布了名为ProForma-20Q的基准数据集,为金融预测设立了新的标准。 传统上,财务报表预测通常局限于短期,而长期预测因数据稀疏和不确定性高而极具挑战。然而,Forma模型通过将财务报表视为(账户,季度,数值)元组的集合,并采用掩码元组高斯似然进行训练,成功实现了长周期预测。在ProForma-20Q基准上,Forma在78个报表行项目上,从1到20个季度的时间跨度内,均优于经典机器学习、梯度提升、零样本时间序列基础模型以及前沿的大语言模型。 ## 关键优势 - **长周期预测能力**:Forma的预测误差随着预测周期的延长而相对缩小,这正符合估值模型对远期现金流准确性的需求。 - **概率校准**:其高斯预测区间从未出现覆盖不足的情况,表明模型的不确定性估计是可靠的。 - **会计一致性**:尽管Forma的预测几乎满足会计恒等式,但研究发现,通过后处理可以完全恢复精确的一致性,而不会显著损失预测精度,这为实际应用提供了便利。 ## 场景分析支持 Forma的元组接口允许用户在不重新训练的情况下进行情景分析。例如,通过固定未来的收入路径,模型能够更准确地预测报表中的其他项目,这对于投资者和分析师评估不同商业情景下的财务影响具有重要意义。 ## 行业影响 这项研究不仅展示了专用模型在金融预测中的潜力,也为人工智能在金融领域的应用开辟了新方向。ProForma-20Q基准的发布,将促进该领域的可重复研究,推动更多创新方法的发展。 尽管Forma在测试中表现出色,但研究者也指出,其性能依赖于数据质量和行业代码的准确性。未来,他们计划扩展模型以处理更多类型的财务报表和更复杂的会计规则。 总之,Forma模型代表了金融预测领域的一次重大进步,其长期预测能力和灵活性为投资决策和财务分析提供了有力的工具。
在科学计算与机器学习领域,数值优化是连接理论与实践的桥梁。近日,arXiv 上发布了一篇题为《Basin: Efficient and Extensible Numerical Optimization in Rust》的论文,作者 Johan Larsson 介绍了这一专为 Rust 语言设计的数值优化库。 ## 什么是 Basin? Basin 的核心目标是为 Rust 开发者提供一套统一、一致的接口,用于描述和求解数值优化问题。数值优化任务——寻找使目标函数最小化的输入——广泛存在于模型拟合、仿真校准、机器学习训练以及工程参数优化等场景中。Basin 的出现,旨在让 Rust 开发者能够以更高效、更可靠的方式处理这类问题。 ## 主要特点 根据论文摘要,Basin 具备两大显著特点: - **广泛的求解器目录**:内置多种优化算法,满足不同问题的需求。 - **一流的约束支持**:将约束处理作为一等公民,简化了带约束优化问题的建模与求解。 此外,Basin 强调“高效”与“可扩展”,这意味着它不仅适用于常见问题,还能通过扩展机制适应特定领域的需求。 ## 行业背景与意义 Rust 语言以其内存安全和性能优势,正逐渐在系统编程、嵌入式开发等领域获得青睐。然而,在科学计算和机器学习生态中,Rust 相比 Python 等语言仍显薄弱。Basin 的发布,有望填补这一空白,为 Rust 社区提供强大的数值优化工具。 值得注意的是,该论文被归类于机器学习(cs.LG)和优化与控制(math.OC)两个学科,体现了其在理论与应用之间的桥梁作用。尽管目前论文尚未提供详细的基准测试或与现有库(如 Python 的 SciPy)的对比数据,但其设计理念——统一接口、多求解器、约束支持——已显示出巨大的潜力。 ## 展望 随着 Rust 在数据科学和 AI 领域的逐步渗透,像 Basin 这样的底层库将成为构建更复杂应用的基础。对于 Rust 开发者而言,Basin 可能成为解决优化问题的首选工具;对于整个行业而言,它也可能推动 Rust 在科学计算领域的生态繁荣。 当然,Basin 的实际性能、API 易用性以及社区支持仍需时间检验。我们期待后续的版本发布和更多使用案例。
## 背景与挑战 在热带地区,商业建筑的暖通空调系统能耗巨大,如何实现高效控制一直是建筑节能领域的关键难题。传统控制方法往往依赖固定规则,难以适应多变的气候和负载条件。近年来,强化学习(RL)被引入建筑控制,但多数方法倾向于收敛到单一策略,无法兼顾不同运行场景下的最优表现。 ## 创新方案:CQD-ERL 针对上述问题,研究者提出了一种名为 **CQD-ERL**(Contextual Quality-Diversity Evolutionary Reinforcement Learning)的新型控制器。其核心思想是**不再追求单一策略**,而是维护一个**产品档案库**,其中包含多个特化策略,每个策略针对特定的运行环境而优化。 具体而言,这些策略通过两个维度进行索引: - **数据驱动的运行情境**:由每日天气和负荷模式的聚类结果定义,能够捕捉不同季节和天气条件下的运行特点。 - **情境不变的行为描述符**:描述策略的控制行为特征,确保策略的多样性。 这种设计使得控制器能够在面对不同环境时,快速选择最合适的策略,从而实现更精细的控制。 ## 技术实现 CQD-ERL的构建融合了两种优化算子: - **梯度无关的进化算子**:用于探索新的策略行为,增加策略多样性。 - **软演员-评论家(SAC)策略梯度算子**:用于精细调整策略,提升控制性能。 两者共享一个**经验回放缓冲区**,以提高样本效率。此外,所有动作在执行前都会经过一个**确定性安全屏障**的过滤,确保控制操作的安全性。 ## 实验验证 研究者在一个代表新加坡商业建筑的两层降阶环境中训练该控制器,该环境模拟了潜在负荷、冷却塔逼近度和湿度约束。经过全年回测,与 **ASHRAE Guideline 36** 基线相比,CQD-ERL表现出色,证明了其在真实工况下的潜力。 ## 意义与展望 这项研究为暖通空调控制提供了一种新的思路:通过**质量-多样性(Quality-Diversity)** 优化,而非单一策略优化,来应对复杂多变的建筑环境。这不仅有助于提升能源效率,也为其他领域的控制问题提供了借鉴。未来,该框架可进一步扩展至更多建筑类型和气候区域,推动智能建筑控制的发展。
**无权重微调(Weightless Fine-Tuning, WFT)** 是一种无需更新模型权重即可实现大语言模型(LLM)个性化的新方法。该方法由Bohan Zhang等人提出,旨在解决传统监督微调(SFT)在个性化场景中成本高昂的问题。WFT通过计算作者训练序列上的监督残差,并利用从dropout诱导的交叉协方差估计的跨前缀传输算子,将残差传输到当前提示,从而在解码时近似SFT的分布效果。在三个LaMP个性化基准测试中,WFT取得了最佳平均性能,在个别任务上匹配或超过SFT,并优于其他轻量级基线。在预算控制比较中,WFT使用不到7%的有效计算量接近SFT性能。逻辑级分析显示,WFT和SFT诱导的逻辑位移在95%的下一个标记概率质量上余弦相似度为0.875,表明WFT无需修改模型权重即可捕捉监督适应的分布效果。该研究为个性化LLM提供了一种高效、低成本的替代方案,尤其适用于需要为每个用户单独适配的场景。
在许多顺序构建任务中,最终完成时往往呈现精确的对称性,但执行过程却是有方向的且依赖历史。如何利用这种终端对称性来优化决策过程,成为一项值得探索的资源。近期,一篇题为《Terminal Symmetry as a Decision Resource: Statewise Refinement for Anytime Verified Construction》的论文提出了一种新颖的视角,将终端对称性视为一种可复用的决策资源,并开发了相应的算法框架。 该研究由Yi Liu完成,发表于arXiv,编号为2608.11318。作者指出,许多顺序构建任务在完成时表现出精确的对称性,但执行过程却是定向且依赖历史的。他们提出了一种决策资源视角,将过程证据用于提供方向性,终端对应关系将结构传递到等价结果,实现状态证据在转换后细化当前决策相关性,并由固定验证器认证执行。这种分解产生了传输-细化-认证(transport-refine-certify)的框架。 具体而言,该算法实例化这一原理,采用一个情节固定的传输过程结构、其状态受限的过程排名、在接受的转换后更新的状态依赖残差排名,以及一个序数排名交集,其前k个集合恰好是两个提议前缀的并集。该交集在前缀覆盖下提供完成保证,并在相应前缀信息模型下达到最紧的最坏情况验证器查询界限。一个两状态构造预测了转换后动态与静态分离的严格差异。 实验方面,在CAD装配、小程序和精确填充任务中,状态细化分别将任意时间AUC提升了6.77、21.75和8.68个百分点。在来自官方GRN OOD场景的1135个目标移除情节中,该方法在三个尺度上均实现了最低的平均封顶验证器成本,优于GRN和CDGS风格规划器。此外,状态信号在聚合和调度器组织之间也具有可转移性。 这一研究为构建任务中的决策优化提供了新思路,使得终端对称性成为一种可复用的决策资源,有望在机器人装配、程序合成、物流装箱等实际应用场景中发挥价值。未来,该框架或可进一步拓展至更广泛的序列决策问题,推动人工智能在复杂构建任务中的效率与可靠性提升。
随着光伏发电在电网中的占比不断提升,精准的太阳辐照度预测已成为保障电网稳定运行的关键环节。传统数值天气预报在分钟级尺度上精度有限,而全天空成像仪(ASI)能够捕捉云层的高分辨率动态,为短临预报提供了新的可能。然而,现有深度学习方法多为确定性预测,难以刻画云层变化的随机性,尤其在云团快速移动导致的功率陡增陡降(ramp事件)时表现不佳。 针对这一痛点,来自德国航空航天中心等机构的研究团队提出了 **FarSky** 框架,将生成式模型与任务感知的潜空间耦合相结合,实现概率性的分钟级辐照度预测。该研究发表于 arXiv(编号 2608.11254)。 ## 方法核心:两步走,先理解再生成 FarSky 的架构包含两个关键阶段: 1. **多任务自编码器**:同时学习图像重建与辐照度估计两个任务,从而在潜空间中提取既保留云图结构信息、又对辐照度敏感的紧凑表征。这种任务感知的设计,使得潜变量更具物理意义,也为后续生成提供了更有效的条件。 2. **潜扩散模型**:基于历史观测的潜状态,通过扩散过程生成未来时刻的潜变量,再解码为辐照度预测。由于扩散模型的随机采样特性,FarSky 天然支持概率预测,能够输出预测区间而非单一数值。 ## 实测表现:技能分数提升 11 个百分点 研究团队利用西班牙 Almería 太阳能平台(Plataforma Solar de Almería)多年的 ASI 数据进行训练,并在两个独立测试集上对比了持久性模型、当前最优的端到端模型以及其他生成式方法。结果显示,FarSky 在 **确定性预测和概率预测** 两个维度上均取得最佳成绩,**预测技能分数最高提升 11 个百分点**。在 ramp 事件检测方面,FarSky 的 **F1 分数超过 60%**,显著优于现有方法——这意味着它能更及时地捕捉到云层遮挡或散开引起的功率剧烈波动,为电网调度提供更可靠的预警。 ## 意义与展望 这项研究的价值不仅在于性能提升,更在于验证了 **生成式模型与任务感知潜空间耦合** 的结合潜力。传统生成式预测往往只关注图像生成,而 FarSky 通过多任务学习将下游预测目标融入表征学习,使模型能更聚焦于对辐照度变化敏感的特征。 尽管该方法目前基于单一站点数据,但框架本身具有较好的泛化潜力。未来若能结合多站点数据、卫星云图等多模态输入,并进一步优化扩散模型的采样效率,有望在更多地区的光伏电站中实现落地应用。随着可再生能源占比持续上升,类似 FarSky 的智能预测工具将成为电网安全运行的重要技术支撑。
在数控加工中,刀具磨损预测对于保障产品质量和工艺可靠性至关重要。然而,工业环境中的数据往往分散于不同机床、工厂或组织之间,且出于安全与合规考量,原始数据难以集中共享,这为传统机器学习方法的应用带来了挑战。近期,一项发表于 arXiv 的研究提出利用**联邦学习**框架,在不转移原始数据的前提下,实现跨客户端的协作模型训练,从而为分布式环境下的刀具磨损预测提供了新思路。 ## 研究核心:联邦学习如何应对数据孤岛 该研究模拟了典型的联邦学习场景:将刀具轨迹数据分散至多个客户端,每个客户端代表一台机床或一个生产站点,并基于这些本地数据独立训练模型。随后,通过联邦聚合算法更新全局模型,整个过程无需上传原始数据,仅交换模型参数。研究团队将联邦学习模型与集中式训练(所有数据集中处理)及本地独立训练(每个客户端仅用自身数据)进行了对比。 ## 关键发现:性能逼近集中式,远超本地模型 实验结果显示,联邦学习模型的预测精度**接近集中式训练**的水平,同时显著优于各客户端的本地模型。这意味着,在数据隐私保护的前提下,联邦学习能够有效利用跨设备的数据分布特征,提升模型泛化能力,尤其适用于那些数据量有限或分布不均的工业场景。 ## 行业意义:从数据共享到知识共享 这项研究的价值不仅在于技术验证,更在于其产业落地潜力。在真实的制造环境中,企业往往因商业机密或合规要求而无法共享生产数据,而联邦学习提供了一种“数据不动模型动”的协作范式,使得多个工厂或合作伙伴能够在保护各自数据主权的同时,共同训练出更强大的预测模型。这对于推动智能制造中的预测性维护、工艺优化等应用具有重要意义。 ## 局限与展望 尽管结果积极,但研究仍处于模拟阶段,尚未在真实工业环境中验证通信成本、客户端异构性等现实挑战。未来工作可能包括在真实数控机床上部署测试,以及探索更高效的聚合策略以应对非独立同分布数据。无论如何,这项研究为联邦学习在工业制造领域的落地迈出了坚实一步。
arXiv:2608.09997v1 Announce Type: new Abstract: Transformers have had a profound impact on the world of language processing and computer vision. As efforts to answer the million-dollar question of ``How does a Transformer learn?" have been increasing, existing interpretability studies primarily analyze representations at isolated layers or the network as a whole, while the developmental evolution of individual representations and its manifolds across transformer layers remains underexplored. Wit
深度随机神经网络(如深度随机向量函数连接网络 dRVFL 及其集成版本 edRVFL)在分类任务中表现出色,但现有模型对所有训练样本一视同仁,这限制了它们在含有噪声和异常值的真实世界数据集上的鲁棒性。此外,污染特征在隐藏层间的传播会损害模型的决策能力。针对这些问题,研究人员提出了一种基于直觉模糊集理论的新框架,通过区分干净样本、噪声和异常值,显著提升了模型性能。 ## 核心思路:从均匀对待到自适应加权 传统 dRVFL 和 edRVFL 模型在训练时对所有样本赋予相同的权重,这导致模型容易受到噪声和异常值的干扰。新提出的 **IF-dRVFL** 和 **IF-edRVFL** 框架引入直觉模糊集理论,利用样本的邻域信息,在核空间中为每个样本计算隶属度(membership degree)和非隶属度(non-membership degree)。 - **隶属度**:基于样本到其所属类别质心的距离计算,距离越近,隶属度越高,表示该样本越能代表其类别。 - **非隶属度**:衡量样本在局部邻域内的异质性,非隶属度高的样本更可能是噪声或异常值。 通过综合考虑这两个指标,模型能够为训练样本分配自适应权重,从而有效区分干净样本、噪声和异常值。 ## 实验验证:在噪声环境下表现优异 研究团队在 **UCI** 和 **KEEL** 基准数据集上进行了大量实验,包括在有无高斯噪声的情况下。实验结果表明,**IF-dRVFL** 和 **IF-edRVFL** 在分类准确性和鲁棒性上均优于现有的模糊和非模糊方法。特别是在噪声环境下,新模型的优势更加明显,这得益于其对样本质量的精确感知。 ## 意义与展望 这项研究为深度随机神经网络提供了一种新的鲁棒性增强策略。通过引入直觉模糊集理论,模型不仅能够处理噪声和异常值,还保持了较高的计算效率。此外,该框架的代码已公开,便于其他研究者复现和进一步探索。 未来,该工作可能扩展到更复杂的任务,如回归、聚类,以及与其他深度学习架构的结合。同时,如何进一步优化非隶属度的计算效率,也是值得研究的方向。
在追求大语言模型推理效率的过程中,低精度数据类型已成为降低计算与存储成本的关键手段。然而,现有大多数格式仅优化了标量数值的保真度,却未充分考虑乘积运算带来的数值偏差。为此,研究者提出了一种名为 **CurveFP** 的新型数据类型家族,通过代数设计实现乘积封闭性,在保持数值精度的同时简化了硬件实现路径。 ## 设计思路:从标量优化到算术协同设计 CurveFP 的核心创新在于**封闭乘积码本**。它将量化后的数值幅度分布在一系列交错的对数曲线上,并采用紧凑的块缩放因子。通过引入**有理基数**,CurveFP 能够在动态范围与局部分辨率之间灵活调节,而统一的曲线索引则保证了任何非零乘积在代数上都是封闭的——即乘积结果仍落在同一码本中。这一特性使得乘积运算简化为精确的符号异或(XOR)与整数索引更新,大幅简化了浮点乘法的复杂度。 ## 量化配置与性能表现 CurveFP 提供了两种实例化配置:**CurveFP8(E4C3/E5C2)** 用于训练阶段,**CurveFP7(E3C3)** 用于紧凑部署。实验结果显示: - **推理质量**:在 4 个 7B~9B 参数模型上,CurveFP7 使用比 FP8 少一位的位宽,困惑度(perplexity)仍优于张量级 FP8,且与原生精度差距保持在 1.32% 以内。 - **数值精度**:在 36 组前向与反向 GEMM 对比中,CurveFP8 的操作数 NMSE(归一化均方误差)均低于 FP8。 - **预训练效果**:在 3 个 128.3M 参数的对照实验中,所有模式均完成 3B token 的预训练。CurveFP8 的平均 BF16 推理困惑度为 22.5366,优于 FP8 的 22.5407,且在所有种子中格式引入的惩罚更低。 - **下游任务**:在 36 组 WikiText-103 困惑度比较中,CurveFP8 训练的检查点在全部 12 组种子-格式对比中表现更优,PG-19 与任务级指标则各有胜负。 ## 意义与展望 CurveFP 的价值不仅在于数值效率,更在于**算术协同设计**的视角:它不再将数据类型视为静态的存储格式,而是将其与运算逻辑深度融合。这种设计有望为未来低精度推理芯片提供更简洁的乘法路径,减少硬件开销,同时保持接近 FP8 的数值行为。尽管目前结果基于中等规模模型,但其在 7B~9B 模型上的优势暗示了在更大规模上的潜力。后续研究可探索其与剪枝、蒸馏等技术的结合,进一步释放效率红利。
随着大语言模型(LLM)在现实世界任务中的广泛应用,外部工具的调用已成为其能力扩展的关键一环,而工具文档的质量直接影响智能体的任务执行效果。然而,现有研究大多将工具文档视为固定输入,鲜有深入探讨不同信息字段对智能体性能的影响。针对这一空白,来自复旦大学等机构的研究团队提出了一种自适应工具文档优化框架 **DocsChisel**,通过动态调整文档内容,显著提升了 LLM 智能体的任务成功率。相关论文已发表于 arXiv(编号:2608.10037)。 ## 研究背景:工具文档为何重要? LLM 智能体在执行复杂任务时,往往需要调用外部 API 或工具,而工具文档作为连接模型与工具的桥梁,其信息完整性、准确性和可读性直接影响模型对工具功能的理解与使用。以往研究多聚焦于改进智能体的工具选择与调用策略,却忽视了文档本身的可优化空间。尽管已有如 EasyTool、DRAFT 等工作尝试通过重写或压缩来优化文档,但关于不同信息字段在不同场景下的实际效用,仍缺乏系统性认识。 ## 核心发现:文档信息字段的异质性 研究团队首先进行了一项大规模实证研究,分析了现有工具文档中信息字段的分布情况,发现不同文档在字段类型和内容上存在显著差异。更为关键的是,**信息字段的有效性高度依赖于具体任务领域、LLM 基础模型以及智能体范式**。例如,某些字段在代码生成任务中至关重要,但在问答任务中可能冗余;同一字段在不同 LLM 上的表现也可能截然相反。这意味着,不存在一种通用的固定文档模板能够适配所有智能体设置。 ## DocsChisel:从失败中学习,迭代优化 基于上述发现,研究者设计了 **DocsChisel** 框架,其核心思想是“从失败中学习”。具体而言,DocsChisel 会分析目标智能体在任务执行过程中的失败轨迹,识别由文档问题引发的错误,进而针对每个工具动态地添加、删除或修改信息字段。这种迭代优化机制使得文档能够适应特定智能体的需求,而非一刀切。 ## 实验表现:性能大幅提升,开销可控 在多项基准测试中,DocsChisel 与现有最优方法(如 EasyTool、DRAFT)进行了对比。结果显示,**DocsChisel 将智能体的任务成功率平均提升了 95.89%**(相对于原始文档),并且比现有基线方法**平均高出 75.15%**。同时,其优化过程所需的时间和 Token 开销均处于可接受范围,展示了良好的实用性与扩展性。 ## 总结与展望 DocsChisel 的提出为 LLM 智能体的工具文档优化提供了新思路,强调文档的“个性化”与“动态性”。未来,随着智能体应用场景的不断丰富,这种自适应文档优化机制有望成为提升 LLM 系统整体性能的重要一环。研究者也指出,当前框架主要针对单轮优化,未来可探索多智能体协作场景下的文档协同优化。