在组织文档管理中,自动敏感度分类是一项关键但常被忽视的任务。分类错误可能导致监管违规或安全漏洞。尽管基于AI的方法为人工审查提供了可扩展的替代方案,但其可靠性高度依赖于训练数据的完整性。然而,该领域普遍存在一个被低估的问题——标签泄漏:文档中残留的分类标记使得模型能够利用表面捷径而非学习真正的内容信号,从而产生虚高且不可靠的性能评估。 针对这一问题,研究人员提出了**Strategic 16K**,一个精心构建的、控制泄漏的语料库,包含来自维基解密美国外交电文库(PlusD)的**16,000份外交电文**。他们系统性地评估了六种模型架构,涵盖经典机器学习和基于Transformer的方法。通过扩展的泄漏移除协议,他们识别并消除了三类残留分类标记。在干净的基准测试上,**BERT表现最佳**(准确率89.14%,F1分数89.33%),其次是**ELECTRA**(准确率88.57%,F1分数88.90%)。在经典模型中,**TF-IDF结合逻辑回归**以显著更低的计算成本取得了最强性能。 这些结果构成了首个在明确泄漏控制条件下从WikiLeaks PlusD构建的可完全复现的敏感度分类基准。 ## 背景与挑战 组织文档的敏感度分类是信息安全的重要防线,但传统人工审查成本高昂且效率低下。AI模型的应用虽能提供规模化解决方案,却面临一个隐蔽的陷阱:训练数据中的标签泄漏。如果文档中残留了分类标记(如“机密”字样),模型可能会依赖这些表面线索,而非学习文档内容的语义特征,导致在真实场景中性能大幅下降。 ## 研究方法 研究团队从WikiLeaks PlusD中选取了16,000份外交电文,构建了Strategic 16K语料库。他们设计了一套严格的泄漏移除协议,系统性地识别并清除了三类标记:格式标记、元数据标记和内容中的分类词汇。随后,他们对比了六种模型:经典方法包括TF-IDF与逻辑回归、朴素贝叶斯和支持向量机;深度学习方法包括BERT、ELECTRA和RoBERTa。 ## 主要发现 在清理后的基准上,BERT和ELECTRA展现了优越性,但经典模型也表现出色。TF-IDF与逻辑回归的组合在准确率和F1分数上接近最佳深度模型,却无需GPU训练,推理速度更快,资源消耗更低。这提示我们,在资源受限的场景下,经典模型仍具竞争力。 ## 意义与展望 这项研究不仅提供了首个可复现的泄漏控制基准,还强调了数据质量在AI系统中的重要性。它提醒我们,模型性能的评估必须建立在干净的数据之上,否则可能会误导实际部署决策。未来,如何将泄漏检测自动化,以及如何在更广泛的文档类型上验证这些发现,将是值得探索的方向。
## 日级建模:从静态快照到动态轨迹 医院再入院率是衡量医疗质量与资源调配效率的关键指标。传统预测模型通常将住院期间的复杂病史压缩为固定表征,忽视了反映患者生理状态演变的日级临床信号。针对这一局限,来自韩国的研究团队在 MICCAI 2026 MultiTab Workshop 上提出了 **Mr.Dec**(Multimodal Readmission-risk prediction Decoder),一种以日为单位、融合多模态数据的再入院风险预测模型。 ## 核心设计:时间对齐的多模态事件流 Mr.Dec 的核心创新在于将每次住院视为一个**按时间顺序排列的日级多模态事件序列**。模型通过 Transformer 解码器架构,将电子健康记录(EHR)的每日更新与间歇性胸部 X 光片(CXR)发现整合到同一时间对齐的数据流中,模拟真实临床工作流程。这种设计避免了传统方法中因固定时间窗口压缩而丢失的细节,使模型能够捕捉患者每日的病情变化轨迹。 ## 技术亮点:对比学习增强稳健性 为了提升模型的鲁棒性,Mr.Dec 引入了**疾病特异性监督对比学习**作为辅助正则化手段。该机制在潜在空间中诱导出诊断感知的结构,帮助模型更好地区分不同疾病类型的再入院风险模式,从而增强泛化能力。 ## 实验结果与临床价值 在 MIMIC-IV 和 MIMIC-CXR 数据集上的评估显示,Mr.Dec 达到了**最先进的性能**,验证了保留临床序列完整性的有效性。此外,模型还能识别住院期间的“**关键日**”,为实时风险分层提供可操作的临床解释。这一功能有望帮助医护人员在患者住院过程中及时干预,降低再入院风险。 ## 展望 Mr.Dec 为医疗 AI 提供了一个新思路:**从静态快照转向动态轨迹建模**。未来,该框架或可扩展至其他时间敏感型临床预测任务,如脓毒症早期预警或术后并发症监测。不过,当前研究仍基于公开数据集,实际临床部署还需考虑多中心验证与模型可解释性等挑战。
多任务学习(MTL)旨在通过共享表示同时解决多个相关任务,以提升效率和泛化能力。然而,现有方法在模型容量调整上存在局限:要么依赖硬共享或固定结构,要么需要预设多个路径或专家,要么根据任务边界或冲突信号进行动态扩展。这些方法往往受限于预定义结构,或需要人工干预,无法真正实现按需生长。 针对这一痛点,来自北京农业信息技术研究中心、西北工业大学等机构的研究者提出了**EMAN**(Emergent Modular Atomic Network,涌现模块化原子网络)框架,探索一个根本性问题:**网络能否从单路径计算出发,仅在出现持续优化证据时,才生长出新的独立路径?** EMAN 的核心创新在于,它通过潜在相对相位(latent relative phases)暴露了一个反对称生长方向(antisymmetric growth direction),从而在不实例化第二条路径的情况下,持续监测多个决策信号,将局部的优化证据转化为结构决策。只有当证据充分(即通过认证)后,EMAN 才会实际物化出两条等容量的独立路径,并自适应地分配共享与任务专属的表示容量。 实验方面,研究团队在受控秩设置、**PASCAL-Context** 和 **NYUv2** 数据集上进行了广泛验证。结果显示,EMAN 能以具有竞争力的计算成本取得更优性能,证明了其有效性。 这项工作的意义不仅在于提出了一种新的 MTL 架构,更在于提供了一种**优化驱动的容量增长范式**:容量变化不再依赖人工预设,而是由训练过程中的优化信号自然触发。这为多任务学习乃至更广泛的动态神经网络设计提供了新思路。 当然,EMAN 仍面临一些挑战,例如如何准确判断“持续优化证据”,以及如何避免过早或过晚地生长路径。未来,这一框架有望与神经架构搜索、持续学习等方向结合,推动模型向更自主、更高效的方向演进。
脑电图(EEG)基础模型通过在大规模异质神经记录上学习可复用表示,已成为EEG解码的一种有前景的范式。然而,公开释放EEG基础编码器虽促进了下游开发,却也引入了此前未被探索的安全风险:公开可用的表示可能使私有下游模型变得脆弱。本文研究在公共编码器和私有下游设置下的对抗迁移攻击,其中攻击者可白盒访问已发布的编码器和小型任务匹配的标记参考集,但无法访问或查询受害者的参数、输出或梯度。 我们提出了收缩-白化代理交叉熵(SW-ProxyCE),一种免查询的任务感知攻击框架,通过收缩-白化的类原型从小型标记参考集中恢复任务级决策几何,从而无需训练额外代理分类器即可生成可迁移的对抗样本。我们在三个EEG任务上评估了SW-ProxyCE,使用三个通用基础编码器和一个范式特定预训练编码器,覆盖了跨受试者和受试者内场景下的线性探测和全微调下游模型。结果表明,从公共编码器和有限标记参考生成的对抗样本能有效迁移至不可访问的下游模型。SW-ProxyCE始终优于任务无关的表示偏移攻击,揭示EEG基础模型的强迁移性并不必然带来对抗鲁棒性。代码将在GitHub上提供。 ## 背景与动机 EEG基础模型的开放发布促进了社区发展,但也引入了新的攻击面。攻击者可能利用公开编码器生成对抗样本,攻击下游私有模型,而无需任何查询。这种攻击方式在现实场景中具有可行性,因为许多部署模型基于公开编码器进行微调。 ## 方法:SW-ProxyCE SW-ProxyCE的核心创新在于利用收缩-白化类原型来近似任务决策边界,从而在无查询条件下生成可迁移的对抗扰动。该方法无需训练额外的代理分类器,降低了攻击成本,同时保持了攻击有效性。 ## 实验与结果 实验覆盖多个EEG任务和多种编码器架构,结果一致表明SW-ProxyCE生成的对抗样本能有效攻击私有下游模型,且性能优于现有方法。这提示基础模型的迁移性可能被恶意利用,需引起重视。 ## 总结与展望 本研究首次系统探讨了EEG基础模型的安全风险,提出了高效的攻击方法,并呼吁社区关注模型的鲁棒性。未来工作可探索防御策略,如对抗训练或模型净化,以增强EEG基础模型部署的安全性。
随着AI数据中心不断淘汰旧款GPU,大量仍具计算能力的加速器流入二手市场。这些退役GPU能否重获新生,形成所谓的“垃圾集群”(DumpsterCluster),并为现代LLM推理提供算力?最近一篇arXiv论文对此进行了深入探讨,并给出了令人惊讶的答案。 ## 从“捡垃圾”到构建集群 研究人员从零开始,仅使用二手组件,搭建了一个包含**128块GPU**的DumpsterCluster,并持续运行了一年。他们发现,在当前的硬件价格下,这套系统的成本仅为**2.2万美元**,而一台8卡B200系统的价格高达**60万美元**,经济优势不言而喻。更令人惊讶的是,通过流水线并行优化,这个基于V100的集群在运行LLaMA-70B时,吞吐量竟然可以媲美现代系统,证明了其生产级应用的潜力。 ## 隐藏的代价:能耗与碳排放 然而,研究也揭示了关键的环境制约因素。旧款GPU在生成每个token时消耗的能源显著更多,因此,只有当地电力价格低廉时,总拥有成本才具有优势。更严峻的是,在电网平均碳强度下,二手系统处理8B模型时,每个token的碳排放量约为当前一代硬件的**4倍**;而对于70B模型,这一数字更是飙升至**40倍**以上。这意味着,GPU的“第二春”并非普遍适用——硬件再利用必须与低碳能源战略性地结合。 ## 绿色AI的可行路径 尽管存在诸多挑战,研究人员指出,在能源成本低且电力清洁的地区,二手GPU为扩大AI算力提供了一条可行途径,同时兼顾了经济性、能源安全与环境责任。这项研究不仅为硬件回收提供了新思路,也提醒我们,在追求AI性能的同时,必须将可持续性纳入考量。未来,或许“垃圾集群”将成为绿色AI的重要一环。
在人工智能与法律交叉领域,一个反复出现的构想是:将多种不确定性工具融合进一个流程,以提升案件结果预测的准确性。然而,一项针对欧洲人权法院真实案例的实证研究却给出了耐人寻味的结论——这类融合的真正价值不在于让预测更准,而在于建立一种“校准后的信任”。 这项研究由 Surya Saka 完成,论文发表于 arXiv(编号:2608.14617)。研究者从 LexGLUE 和 FairLex 数据集中选取了 **1,000 个真实案例**,利用事实段落预测法院是否认定存在《欧洲人权公约》违反行为。实验对比了三种证据评估方式:直接使用前沿大语言模型(LLM)、将 LLM 接入融合流程、以及基于词频的基线模型接入同一流程。测试在两个顶尖模型(Claude Opus 4.8 和 GPT-5.5)上进行了约 **4,750 次**测试。 结果出乎意料:在歧视类案件(AUROC 约 0.83)上,融合流程并未带来任何改进,直接使用前沿 LLM 反而是最强的单一判别器。更严重的是,天真地将 LLM 与贝叶斯赔率更新和 Dempster-Shafer 组合融合,会使校准误差(ECE)从约 0.16 翻倍至 0.46,且这种“先验失配”机制在两个模型上均重现。Dempster-Shafer 融合在长链条场景下甚至表现出“不安全”的行为——以低于随机水平的准确率自信地给出错误标签,因此论文建议直接移除该组件。 不过,融合流程并非一无是处。其真正的价值体现在**操作层面**:通过保形选择性预测层,系统可以决定哪些案件自动处理、哪些需要人工复审。在移除 Dempster-Shafer、重新校准并应用类别条件风险控制后,优化后的引擎在自动放行案件上达到了 **96.8% 的准确率**,仅 0.5% 的错误逃逸,96.3% 的错误被拦截送审;而未调优的基线则分别为 85.9%、3.8% 和 72.1%。 这项研究的核心启示是:在司法 AI 中,融合不确定性工具的目标不应是追求“更锋利的预测”,而是建立一种“校准后的信任”——让系统在不确定时懂得求助人类,在确定时敢于放手。这种思路或许比单纯追求准确率更具现实意义,也为法律 AI 的落地提供了新的视角。
近年来,神经算子(Neural Operator)在求解偏微分方程(PDE)和科学计算领域展现出巨大潜力,但传统模型如DeepONet依赖深度网络隐式学习基函数,其内部机理难以解释,且在数据有限时泛化能力受限。针对这一痛点,一项新研究提出了**PIKFNO(Physics Informed Kernel Function Neural Operator)**,将物理信息核函数显式嵌入神经算子架构,在保持高精度的同时显著提升可解释性。该论文已发表于arXiv(编号:2608.14619),由Yuan Guo、Hanshu Chen和Zhuojia Fu等人完成。 ## 核心创新:从隐式学习到物理约束 传统神经算子(如DeepONet)通过深度网络隐式学习基函数,而PIKFNO则从控制方程出发,推导出**物理信息核函数**,并将其作为主干网络的约束条件。这使得算子结构与无网格配点法(meshless collocation)中的核扩展形式对齐,从而在架构层面注入物理先验。 研究提出了两种构建策略: - **数据驱动核学习**:直接从数据中学习核函数,所得核可视为非奇异基本解(nonsingular fundamental solution); - **解析变换构建**:通过解析基本解的变换来构建核函数,确保物理一致性。 ## 实验表现:小数据下的高精度与强泛化 数值实验表明,PIKFNO在多种PDE问题上取得了高预测精度,同时大幅提升了模型的可解释性。更值得关注的是,在**有限训练数据**条件下,PIKFNO展现出优于传统神经算子的泛化能力。这意味着在实际工程中,当数据获取成本高昂时,PIKFNO可能成为更可靠的选择。 ## 行业意义与未来展望 PIKFNO的提出为科学计算领域提供了新的思路:将物理规律显式嵌入模型,而非完全依赖数据驱动。这种方法不仅有助于提升模型在物理一致性和外推能力上的表现,也为构建**高效、物理一致且可解释**的神经算子开辟了新路径。未来,该框架有望在流体力学、材料科学、气候模拟等复杂系统建模中发挥重要作用。 不过,论文目前仍处于预印本阶段,尚未经过同行评审,其实际应用效果还需进一步验证。但无论如何,PIKFNO代表了神经算子研究从“黑箱”走向“白箱”的一种积极探索,值得AI与科学计算交叉领域的研究者关注。
强化学习(RL)在自主系统和自适应性系统中应用广泛,但深度RL策略依赖神经网络,其决策过程缺乏透明度,难以理解,这可能导致用户信任度下降,并增加系统验证难度。为解决这一问题,一篇新论文提出了**EARL(Explanations using Alternative Realities for Reinforcement Learning)**,这是一个Python库,用于在RL环境中生成反事实解释。 ## 什么是反事实解释? 反事实解释通过探索“如果……会怎样”的场景,比较不同可能结果,来阐明智能体的行为。心理学研究表明,这种解释方式直观且用户友好,但在RL领域,相关研究近期才起步,且现有实现多局限于玩具示例和基准测试。EARL则支持在现实RL自适应性系统中生成反事实解释。 ## EARL的实际应用 为了展示其适用性,研究者们在**CitiBikes**模拟环境中进行了演示,这是一个自适应性共享单车系统。他们还提供了在真实应用中的性能评估。论文已被**第20届哥伦比亚计算大会**接收,共13页,含2张图和3张表格。 ## 为何重要? 随着RL在自动驾驶、智能推荐、资源调度等领域的部署,可解释性成为关键。EARL提供了一种实用工具,帮助开发者、用户和监管者理解RL决策,增强信任,简化验证流程。 ## 未来展望 尽管EARL目前聚焦于自适应性系统,但其方法有望扩展到更广泛的RL应用。研究者计划进一步优化库的性能,并探索更多解释类型。 该研究由Jasmina Gajcin、Juan C. Rosero和Ivana Dusparic共同完成,论文以arXiv预印本形式发布(编号2608.14620),并附有PDF和HTML版本。
在物理场模拟与机器学习交叉领域,如何让神经网络既尊重物理定律又灵活适应复杂几何,一直是核心挑战。来自普林斯顿大学的研究者 Dongzhe Zheng 与 Christine Allen-Blanchette 近期提出了一种名为 **Riemannian Hodge Message Passing (RHMP)** 的新架构,为这一难题提供了优雅的解决方案。相关论文已提交至 arXiv(编号:2608.14556)。 传统方法中,物理场在网格上的离散化常面临拓扑与几何的纠缠:守恒律要求精确的拓扑结构,而材料属性、几何形变等则需从数据中学习。现有神经代理模型往往通过无约束的消息传递混合这两类信息,导致物理一致性受损。RHMP 的核心创新在于**将这一分离上升为架构设计原则**——固定由定向关联决定的细胞上边界算子($d_k$),同时学习对称正定的上链度量($H_k$),用于几何相关的信息传播。 这一设计带来了多重理论优势:通过度量加权的 Hodge 模块($d_k^\top H_{k+1}d_k$),RHMP 保证了**精确的复形恒等式**($d_{k+1}d_k=0$)、非负的 Hodge 能量、半正定算子,以及严格的阿贝尔曲率不变性。更重要的是,将 $H_k$ 视为学习度量,自然引出了**上链框架等变性**:物理传播应不依赖于隐藏特征基的旋转选择,这增强了模型的泛化能力。 实验部分,研究者在涵盖流体、电磁学、规范场及变网格 CFD 的**七个物理基准**上评估了 RHMP。结果显示,RHMP 在整体性能上取得最优,尤其是在拓扑、学习几何与场结构相互作用的复杂场景中,性能提升最为显著。这表明,显式区分拓扑与几何不仅提升了物理一致性,也带来了实际精度收益。 该工作为物理信息机器学习提供了新思路:与其让网络隐式学习一切,不如将物理先验(如守恒律)作为刚性骨架,而将数据驱动的部分限制在几何度量上。这一范式有望在计算力学、电磁仿真、以及更广泛的科学计算领域产生深远影响。未来,团队计划探索 RHMP 在更复杂物理系统中的应用,并进一步优化其计算效率。
城市是人类活动最密集的场所,理解人的移动规律对交通管理、疫情防控、城市规划等至关重要。然而,大规模轨迹数据因隐私问题难以公开,这限制了相关研究。现有合成轨迹生成方法多聚焦全局分布相似性,却忽略了不同时空分辨率下的移动模式。近日,一篇被 KDD 2026 接收的论文提出 **MR-Traj** 框架,通过粗到细的多分辨率扩散模型,在保持全局分布的同时,显著提升细粒度移动模式建模能力,并增强轨迹多样性以降低隐私泄露风险。 ## 核心挑战:隐私与效用的两难 轨迹数据包含个人时空足迹,直接公开会带来严重隐私风险。因此,研究人员常采用合成数据生成技术,模拟真实轨迹分布,供下游任务使用。但现有方法,如基于 GAN 或 VAE 的模型,往往只追求整体统计特征相似,导致生成的轨迹在局部时段、特定区域的行为模式失真。例如,在早高峰的 CBD 区域,真实轨迹表现出高度聚集和规律性,而合成数据可能过于平滑,无法反映这种细粒度动态。 ## MR-Traj:多分辨率建模新思路 该研究提出 **MR-Traj**,将轨迹视为**粗粒度里程碑**(如主要停留点、换乘站)和**细粒度路段**(如具体路径、速度变化)的组合。通过扩散模型在不同分辨率级别逐步生成,从整体到局部,捕捉多尺度时空依赖。 实验表明,MR-Traj 在全局分布相似性上与最先进方法相当,但在细粒度移动模式(如小时级流量变化、区域间转移概率)上**持续领先**。下游任务如流量预测、疫情传播模拟中,MR-Traj 生成的数据也带来更优性能。 ## 隐私与多样性的双赢 值得关注的是,MR-Traj 在多个分辨率级别引入随机性,生成轨迹的多样性显著提升。在种子引导的数据发布场景下,这种多样性有效降低了轨迹链接攻击的风险,即攻击者难以将合成轨迹与真实个体关联。这为隐私保护数据发布提供了新思路,平衡了数据效用与隐私安全。 ## 展望 MR-Traj 为城市轨迹生成提供了新范式,但仍有挑战。论文未提及计算效率,多分辨率扩散模型可能带来更高开销。未来可探索更高效的采样策略,或将其扩展到更多城市场景。总体而言,这项研究为隐私约束下的城市计算提供了有力工具,值得关注。
在对抗性机器学习领域,投影梯度下降(PGD)攻击是评估模型鲁棒性的标准方法。然而,传统上仅依赖最终对抗精度来评判模型,忽略了攻击过程中模型行为的动态变化。近期研究提出轨迹级诊断指标,如损失演化、梯度对齐和失败步数,旨在提供更深入的优化动力学洞察。但这些指标是否可靠地反映鲁棒性强度,尚不明确。 一篇新论文对Fashion-MNIST上的卷积神经网络进行了PGD攻击的轨迹级研究,比较了干净训练和对抗训练模型在不同鲁棒性水平下的表现。研究发现,尽管不同模型的鲁棒性层级清晰,但轨迹指标并未同等贡献于这一识别。平均损失轨迹和梯度对齐模式在对抗训练模型中表现相似,即使它们的鲁棒精度差异显著。相比之下,失败步数分布能更清晰地区分鲁棒性级别,直接反映模型对对抗扰动的功能性抵抗。 这一结果表明,轨迹级诊断更多描述了优化几何特性,而非独立衡量鲁棒性。其可解释性依赖于鲁棒性级别、攻击强度和多种指标的综合评估。因此,轨迹级分析应作为补充诊断工具,结合上下文解读,而非替代标准鲁棒性测量。
近期,一项来自 arXiv 的新研究提出了一种名为 **前向传播仅 MLP 训练(Forward-Pass-Only MLP training, FPO)** 的方法,旨在在不通过模型主体进行反向传播的情况下适配大型语言模型(LLM)。该方法宣称能实现 **2.7 至 3.2 倍**的标准微调吞吐量,同时峰值训练内存减少约 **40%**,并在领域外基准测试中保持与基线相当的种子噪声水平,这一特性是完整网络微调所无法可靠复现的。 ## 核心观察:输出层误差近似真实梯度 FPO 方法建立在一个经验观察之上:在 Transformer 的后期层中,输出层的预测误差与真实梯度的余弦相似度在 0.47 至 0.59 之间(基于六个公开模型的调查)。这意味着,模型后期层的梯度可以通过输出层的误差信号来近似,而无需进行完整的反向传播。 为了利用这一特性,研究者引入了一个 **两分钟的诊断工具**,可以量化每一层的这种近似程度,从而确定哪些层适合进行后期层适配。基于该诊断,FPO 仅计算一次输出误差信号,并将其应用于每个目标层,不进行层间信号传播,也不构建任何自动微分图。 ## 实验评估:性能与效率的平衡 研究者在三个模型家族上评估了 FPO:**OLMo-2-7B、Qwen3-8B 和 Falcon3-7B**。实验结果显示,FPO 在领域内困惑度上均有改善,同时在 **MMLU、ARC-Challenge、HellaSwag 和 Winogrande** 等基准测试中保持与基线相当的种子噪声水平。此外,将标准监督微调(SFT)定位到 FPO 的目标层也能达到类似效果,但墙钟时间成本是 FPO 的 **2.2 倍**。 ## 意义与展望 这项研究为大模型的高效适配提供了新的思路。传统的全网络微调计算成本高昂,而 FPO 通过避免反向传播,显著降低了计算和内存开销,同时保持模型性能。这对于资源受限的场景尤为重要,例如在边缘设备上部署或快速迭代模型。 然而,该方法的适用性可能局限于后期层,对于需要深层特征调整的任务,其效果仍需进一步验证。此外,诊断工具的实用性也依赖于模型架构的多样性。未来,研究者可以探索将 FPO 与其他参数高效微调技术(如 LoRA)相结合,以进一步提升效率。 总体而言,FPO 展示了在保持模型性能的同时大幅提升训练效率的可能性,为大模型的应用开辟了新的路径。
随机向量功能链接(RVFL)网络以其轻量级和快速训练的特性,在机器学习领域占有一席之地。然而,传统RVFL模型在面对噪声标签、异常值和不平衡数据时表现脆弱,这限制了其在真实世界应用中的性能。为了应对这些挑战,研究人员提出了一种新的模型——基于核风险敏感均值p次幂的RVFL(KRPRVFL),该模型将RVFL的计算效率与核风险敏感均值p次幂(KRP)准则的鲁棒性相结合,通过用KRP损失替代标准的最小二乘目标,自适应地降低训练过程中受损或不可靠样本的影响,从而提升模型的稳定性和泛化能力。此外,该框架还引入了协作学习机制,使模型组件之间能够自适应交互,进一步增强在复杂和噪声环境中的鲁棒性。借助核诱导的特征映射,KRPRVFL无需显式选择隐藏层即可捕获非线性关系,保持了高效性和可扩展性。在UCI和KEEL基准数据集上的大量实验表明,KRPRVFL在准确性、鲁棒性和统计显著性方面均优于基线模型,为具有挑战性的分类任务提供了一种快速、可扩展且可靠的解决方案。
主动学习(Active Learning)通过挑选最具信息量的样本,能有效降低标注成本。但一个直觉上的矛盾是:模型最不确定的样本,往往也是最难被正确标注的。那么,不确定性采样(Uncertainty Sampling)的失败,究竟是因为它选到了更多错误标签,还是因为错误集中在困难区域而格外有害? 近期一篇来自 arXiv 的论文(编号 2608.13601)针对这一问题展开了系统测试。研究者 John Myron Uy 在三个公开的二分类表格数据集上,对比了基于边际(margin)的不确定性采样与随机采样,在三种标签噪声条件下的表现:干净标签、随机分类噪声(RCN)以及有界难度依赖噪声(难度越高的样本,噪声越大)。 实验设计相当严谨:使用 100 对配对随机种子、9 个期望噪声率(从 0 到 0.30)、标注预算从 20 到 120(干净标签延伸至 400),并采用逻辑回归作为基学习器,在每个预算下通过交叉验证重新选择正则化参数。 **核心结果**显示:在干净标签下,不确定性采样在所有数据集上均提升了归一化平衡准确率曲线下面积(AUC),提升幅度在 1.09 到 1.77 个百分点之间。然而,当引入难度依赖噪声后,情况变得复杂:在 Breast Cancer Wisconsin 数据集上,难度依赖噪声在 8 个噪声率中的 6 个上比 RCN 更削弱不确定性采样的优势;但在 Banknote Authentication 和 MAGIC Gamma Telescope 数据集上,这一现象并未出现。 进一步的“暴露匹配”(exposure-matched)分析发现,没有证据表明结构化错误位置会带来额外的普遍惩罚。换句话说,不确定性采样获取更多错误标签这一点,并不能完全解释其性能下降;错误的具体位置(是否集中在困难区域)的影响因数据集而异。 有趣的是,在干净的 MAGIC 数据上,不确定性采样在提升平衡准确率的同时,却降低了平均精度(average precision)和固定假阳性率下的真正例率。这说明,评估指标的选择会显著影响对采样策略优劣的判断。 **结论**:不确定性采样在标签效率上确实有优势,但其鲁棒性高度依赖数据集、预算、噪声结构以及评估指标。该研究提醒我们,在实际应用中,不能盲目信任不确定性采样,尤其是在标签质量参差不齐的场景下。 该论文共 14 页,包含 5 张图和 4 张表,并提供了代码和可复现材料。对于从事主动学习研究和应用的开发者而言,这项研究提供了一个重要的视角:在考虑标注成本的同时,必须将标签噪声的分布特性纳入考量。
XGBoost 作为机器学习领域的热门算法,凭借其高效、可扩展的特性,在各类预测任务中表现出色。然而,一项最新研究揭示了其在面对数据异常时的脆弱性,并提出了一种名为 **MM-XGBoost** 的改进方案,在保持预测精度的同时显著增强了模型的稳健性。该研究由 Iris Aragón Mladosich 与 Christophe Croux 合作完成,相关论文已提交至 arXiv(编号:2608.13590)。 ## 从残差拟合到稳健性挑战 XGBoost 的核心机制是迭代地拟合决策树,以捕捉前一步预测的残差。其默认的损失函数为二次损失(即均方误差),虽然计算简便,但对异常值极为敏感。即便引入了 Huber 损失作为替代,研究指出,**垂直异常值(vertical outliers)** 和 **高杠杆点(leverage points)** 依然能显著影响模型性能。垂直异常值指目标变量中的极端值,而高杠杆点则指特征空间中偏离主体分布的样本点,两者都可能导致模型过拟合或偏差。 ## 探索替代损失函数:M、S 与 τ 估计 为了应对这一挑战,研究者将目光投向了稳健回归领域的经典方法。他们系统评估了基于 **M 估计器**、**S 估计器** 以及 **τ 估计器** 的替代损失函数在 XGBoost 框架中的表现。这些估计器通过不同的方式降低异常值对模型拟合的影响,例如 M 估计器通过迭代加权最小二乘,S 估计器则基于残差尺度的高断点估计。 实验结果显示,单一的稳健损失函数虽然提升了抗异常能力,但往往以牺牲预测精度为代价。而将两种估计器结合的两步法——**MM-XGBoost**——在两者之间达到了最佳平衡。MM 估计器通常先使用高断点的 S 估计器获得初始稳健拟合,再通过 M 估计步骤优化效率,这一策略在 XGBoost 中同样奏效。 ## 稳健与精度的权衡之道 MM-XGBoost 的提出,为在真实世界数据中应用 XGBoost 提供了更可靠的选项。在金融、医疗、工业等常含噪声和异常值的领域,该方法的实用价值尤为突出。研究团队通过大量实验验证了其有效性,并提供了详尽的补充材料(30 页正文加 15 页附录),为后续研究提供了坚实基础。 尽管 MM-XGBoost 展现出显著优势,研究者也提醒,其计算成本可能略高于标准 XGBoost,且参数调优需要更多考量。未来,如何进一步降低计算开销,并将该方法扩展到分类任务,将是值得探索的方向。 这项研究不仅深化了我们对 XGBoost 鲁棒性的理解,也为稳健机器学习提供了新的工具。对于数据科学家而言,当面对可能包含异常值的数据集时,MM-XGBoost 无疑是一个值得尝试的选项。
在AI领域,模型规模的差异往往成为知识迁移的障碍。通常,将大型模型的能力迁移到小型模型需要复杂的对齐或训练过程。然而,一项新研究提出了一种无需训练的跨规模融合方法,通过激活引导的剪枝技术,在保持性能的同时实现知识的高效转移。 ## 创新方法:Activation-Prune-Merge (APM) 来自研究者的一项新工作提出了 **Activation-Prune-Merge (APM)** 框架,旨在解决异构模型融合中的跨规模问题。传统方法通常需要神经元级别的语义对齐,而APM则另辟蹊径。它通过构建任务条件下的激活图,识别大型模型(供体)中与任务相关的关键部分,然后进行剪枝以匹配小型模型(受体)的架构。具体来说,APM会剪枝供体的层、隐藏维度、注意力头和MLP神经元,使其与受体的结构对齐,最后通过微小的插值系数将剪枝后的供体部分注入受体。 这种方法的核心思想是,将供体视为功能组件的集中来源,而非要求精确的结构移植。这种设计使得跨规模融合无需显式的语义对齐,就能实现知识转移。 ## 显著性能提升 研究者在16个基准测试上进行了评估,涵盖推理、数学、代码生成、指令遵循和分类等任务。结果显示,APM将3B规模受体的平均准确率从 **55.5%** 提升至 **60.6%**。在具体任务上,RTE准确率从64.3%大幅提升至82.3%,QNLI从52.3%提升至65.7%,BoolQ从70.8%提升至79.2%。这些数据表明,激活引导的剪枝能够有效提取供体中的可迁移能力。 ## 分析与未来方向 研究还分析了注入比例的影响,并探索了多阶段顺序融合的可能性。结果表明,激活引导的提取能够提高可迁移供体切片的质量,同时保持小比例融合的机制。这为跨规模模型融合提供了新的思路,尤其是在无需额外训练的情况下,为资源受限场景下的模型增强提供了可能。 尽管结果令人鼓舞,但研究者也指出,当前方法依赖于任务条件激活图,可能需要对每个任务进行适配。未来的工作可以探索更通用的激活引导策略,以及在不同模型家族上的适用性。 这项研究为模型融合领域带来了新的视角,证明了在无需语义对齐的情况下,跨规模知识迁移是可行的,且效果显著。随着进一步的研究,这种方法有望在模型压缩和高效部署中发挥重要作用。
现代运营系统即使在常规条件下也面临不确定性,其中罕见、突发且自激的事件既源于外生协变量,也源于内生事件动力学。标准的神经算子通常被训练为回归式的函数到函数模型,而非条件强度估计器,这限制了它们在稀疏事件场景中的适用性。为此,我们引入了洛伦兹傅里叶神经算子(L-FNO),这是一种随机神经算子,它结合了FNO风格的协变量路径、用于历史依赖激发的洛伦兹谱核以及基于似然的训练目标。我们在八个合成点过程基准和三个真实世界数据集(涵盖疾病暴发预测和半导体故障或缺陷检测)上评估了L-FNO。与回归和基于似然的神经算子基线相比,L-FNO在事件似然、校准诊断和罕见事件检测方面均有提升。这些结果表明,结构化的谱记忆和基于似然的学习为随机事件动力学的神经算子模型提供了有效的归纳偏置。 ## 背景与挑战 在金融、医疗、制造等许多领域,系统面临的核心挑战之一是如何准确预测罕见但关键的事件,例如疾病暴发或半导体制造中的故障。这些事件往往表现出突发性和自激性,即一个事件的发生可能增加后续事件发生的概率。传统的神经算子模型通常以回归方式训练,直接学习输入到输出的映射,忽略了事件时间序列的随机性质,导致在稀疏事件场景下性能不佳。 ## L-FNO的核心设计 L-FNO的设计旨在克服上述局限。它结合了三个关键要素: - **FNO风格的协变量路径**:利用傅里叶神经算子高效处理函数型协变量,捕捉输入与事件之间的复杂关系。 - **洛伦兹谱核**:借鉴洛伦兹函数(即柯西分布)的谱形式,用于建模历史事件的激发效应。这种核函数能够有效捕捉事件的自激和互激特性,尤其适合描述突发和衰减过程。 - **基于似然的训练目标**:通过最大化事件序列的似然函数来训练模型,使其直接优化条件强度估计,而非简单的回归误差。 这种设计使得L-FNO能够更好地处理事件数据的随机性,并提高对罕见事件的预测能力。 ## 实验与性能 研究团队在八个合成点过程基准和三个真实数据集上进行了广泛实验。结果显示,L-FNO在事件似然、校准诊断和罕见事件检测方面均优于现有的回归和基于似然的神经算子基线。这表明,结构化的谱记忆和似然学习为神经算子模型提供了有效的归纳偏置,使其更适合于随机事件动力学建模。 ## 意义与展望 L-FNO的提出为神经算子家族增添了新的工具,特别是在处理随机事件序列时。其成功表明,将领域知识(如自激过程的谱特性)融入模型架构,并结合适当的训练目标,可以显著提升模型的实用价值。未来,该模型有望在更多需要实时预测和风险管理的领域中得到应用,例如金融风险管理、流行病学监控和工业质量控制等。 尽管L-FNO表现出色,但仍有改进空间。例如,如何扩展到更高维的事件类型、如何处理非平稳的协变量,以及如何进一步提高计算效率,都是值得探索的方向。
高能物理对撞机实验中,寻找超出标准模型的新物理信号是核心目标之一。然而,传统的事件级异常检测方法长期面临两大痛点:异常分数难以解释,以及异常分数与能量尺度、粒子多重性等变量强相关,导致误报率偏高。近期,一篇发表在arXiv上的论文提出了名为**ORCA**(Organized Representation via Contrastive learning for Anomaly detection)的两阶段框架,旨在解决上述问题,为对撞机物理中的异常检测提供更可靠且可解释的工具。 ORCA的核心思路是:首先,利用**监督对比学习**在涵盖多种已知物理过程的模拟数据上训练一个嵌入空间,使得不同物理过程在该空间中被清晰地分离;随后,在该嵌入空间上运行一个标准自编码器,生成事件级的异常分数。这种设计不仅提升了异常检测的灵敏度,更重要的是,嵌入空间的几何结构携带了高维的物理信息,使得异常样本的**可解释性**成为可能。 在模拟数据上(与高亮度大型强子对撞机(HL-LHC)条件一致),ORCA相比基线自编码器架构,在**灵敏度的广度和深度**上均取得了显著提升。更值得关注的是,研究团队开发了一种基于最大似然估计的模板拟合方法,能够将异常样本中的事件归因到已知的物理过程模板,并给出量化的不确定性。实验表明,该拟合方法能准确恢复注入的信号产额,即使这些信号在训练嵌入时未被包含;对于模板库中缺失的信号,也能通过其最相似的已知过程进行特征描述。 这一成果为对撞机实验中的异常检测搜索开辟了新的路径。传统方法通常输出一维的分数,而ORCA利用嵌入空间的几何结构,保留了更丰富的物理信息,有助于下游的统计分析。尽管该研究仍处于模拟验证阶段,但其提出的可解释异常检测框架,对于未来高能物理实验的数据分析具有重要的潜在应用价值。 值得注意的是,论文作者来自上海交通大学、印度科学研究院等机构,研究聚焦于机器学习与高能物理的交叉领域。随着HL-LHC等高精度实验的推进,这种结合对比学习与自编码器的方法,或将成为物理学家探索新物理的有力助手。
在 AI 领域,**SWE-bench** 和 **LiveCodeBench** 等编码基准已成为衡量大模型编程能力的重要标尺。然而,一项最新研究指出,过度依赖这些基准进行优化,可能会误导我们对模型通用编码能力的判断。该研究已收录于 **ICLR 2026** 的 DL4Code 研讨会,并提出了更全面的评估框架。 ## 基准分数的“意义鸿沟” 研究团队认为,当前许多论文、模型卡和博客将模型在少数基准上的高分,直接等同于其具备广泛的编码能力。但实际上,**针对特定基准的优化往往只能提升任务特定性能**,而非通用能力。这种“意义鸿沟”导致开发者难以依据现有指标做出可靠的决策。 ## 案例研究:Django 基准套件 为了验证这一观点,研究者构建了一个基于 **Django 框架**的基准套件,并评估了多个基础模型及经过 SWE-bench 轨迹后训练的检查点。结果显示: - **基准排名普遍无法泛化**:在 SWE-bench 上表现优异的模型,在 Django 任务上并未展现同等优势。 - **跨任务迁移有限**:后训练模型在不同任务间的能力迁移微乎其微,SWE-bench 优化对 Django 任务及 LiveCodeBench 的增益几乎为零。 - **模态微调不通用**:针对 Django 单个模态的微调,同样无法迁移到其他模态。 ## 评估策略建议 面对这一挑战,研究者提出分层评估策略: - **前沿模型**:采用整体性评估,全面考察各项能力。 - **研究模型**:使用多任务套件,覆盖更广泛的应用场景。 - **特定任务应用**:引入人工评估,确保实际场景中的有效性。 此外,他们呼吁社区**构建能力分类体系**,并持续维护基准,而非一次性发布。唯有如此,才能为 LLM 和智能体的开发与部署提供可靠依据。 ## 结语 这项研究提醒我们,**基准分数的提升并不等于通用能力的增强**。在 AI 技术快速迭代的今天,多样化的评估体系是确保技术健康发展的基石。
线性注意力模型因其固定大小的状态表示,在长上下文场景下面临着信息干扰的挑战。近日,Dhruman Gupta等人提出了一种名为QED的新方法,通过引入查询衍生的擦除方向,显著提升了模型的检索能力,甚至将有效上下文长度翻倍。 ## 背景:线性注意力的困境 传统的Softmax注意力机制虽然效果出众,但其计算复杂度随序列长度呈二次方增长,难以应对超长上下文。线性注意力通过固定大小的状态来近似全局信息,将复杂度降至线性。然而,这种压缩也带来了问题:当上下文极长时,大量信息被挤压在有限的状态中,相互干扰,导致检索准确率急剧下降。 ## QED:从查询中寻找擦除方向 现有方法(如Gated DeltaNet-2)在进行状态更新时,擦除向量仅由当前token的键(key)决定。但研究者发现,读取时干扰的度量依赖于查询(query),而键导向的擦除无法触及查询方向上的干扰。QED的灵感正是来源于此:既然查询能感知干扰,那么它也应该指导擦除。 QED在原有键导向擦除的基础上,增加了一个与键正交的、由查询衍生的第二擦除方向。在快速权重视角下,这种设计使得模型能够利用可编辑的部分,沿查询方向抵消旧状态中的干扰内容,从而更精准地更新记忆。 ## 性能提升:不止一点 实验表明,QED在多种长度超出训练窗口的测试中均提升了检索性能,尤其在S-NIAH-1任务上,有效上下文长度几乎翻倍。这意味着,在不改变模型架构的前提下,仅通过修改擦除机制,就能显著扩展线性注意力的可用范围。 ## 未来展望 QED为线性注意力模型的优化提供了新思路:擦除不应仅依赖键,查询中的信息同样重要。这一发现或许能启发更多关于注意力机制内部信息流的研究,推动高效长上下文模型的进一步发展。