SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

随着机器学习模型规模的不断扩大,模型参数、梯度和KV缓存等数据的存储与传输已成为系统性能的关键瓶颈。量化技术通过降低数据精度来缓解这一问题,但传统方法往往在精度和压缩率之间难以两全。近日,来自哈佛大学、VMware Research等机构的研究者提出了一种名为**熵约束自适应随机量化(ECASQ)**的新方法,在保持无偏性的同时,显著提升了量化压缩的效率。相关论文已提交至arXiv(编号:2608.18147)。 ### 从ASQ到ECASQ:为何需要熵约束? 自适应随机量化(ASQ)是一种先进的量化方法,它针对给定输入优化均方误差(MSE),同时保证无偏性,适用于模型、梯度、KV缓存压缩以及最近邻搜索等场景。然而,ASQ在选取量化值时并未考虑后续的无损熵编码阶段,导致压缩率仍有提升空间。ECASQ正是为了解决这一缺陷而设计:它在熵预算和无偏性约束下,联合选择自适应量化值,以最小化MSE,从而在压缩率和精度之间找到更优的平衡点。 ### 算法创新:动态规划与近似求解 研究团队将ECASQ问题形式化,并提出了两种求解算法: - **最优动态规划算法**:时间复杂度为O(sd²),空间复杂度为O(d²),适用于长度为d的向量,最多支持s个量化值。 - **GPU友好的近似动态规划算法**:时间复杂度同样为O(sd²),但空间复杂度降至O(d),更适合大规模并行计算。 近似算法有个重要保证:其解对应的MSE不会超过使用每条目少一位熵的最优解。此外,研究者还提供了一种迭代细化过程,在实验中能够获得接近最优的结果,同时保持显著的速度优势。 ### 实验与前景 在实验中,ECASQ在多种数据压缩任务中均表现出色,尤其在高压缩率场景下,其精度损失远小于传统方法。这一进展对于分布式训练、边缘推理以及大模型部署等场景具有重要意义。未来,ECASQ有望成为AI基础设施中的标准工具,帮助开发者在不牺牲模型质量的前提下,大幅降低存储和带宽成本。 值得注意的是,该论文目前仅为预印本,尚未经过同行评审,但其提出的思路和算法已引发学界关注。随着后续研究的深入,ECASQ或将在实际系统中得到广泛应用。

HuggingFace10天前原文

**企业AI智能体在持续学习时,遗忘通常被视为一种失败。** 然而,一篇最新研究论文提出了不同观点:在客户、政策、工具、工作流、法规和市场条件不断变化的非平稳环境中,一味地保留旧知识可能适得其反,导致过时信息影响决策,造成负迁移和运营风险。为此,研究者提出“可逆遗忘”框架,为AI智能体提供更精细的知识管理方案。 ## 从“不可遗忘”到“可逆遗忘” 传统持续学习强调保留所有已学知识,以应对环境变化。但该论文指出,这种目标对企业AI智能体并不完整。例如,金融领域,某种市场制度下的有效知识,在另一种制度下可能有害,而当相似条件重现时又可能重新有用。因此,简单的永久删除或无限保留都非最优解。 ## 三种记忆状态与迟滞控制器 论文提出的“可逆遗忘”框架包含三种操作状态:**活跃(active)**、**休眠(dormant)**和**退休(retired)**。活跃知识用于当前决策;休眠知识暂时不参与,但可被重新激活;退休知识则被永久移除。框架的核心是一个**迟滞可逆记忆控制器(Hysteretic Reversible Memory Controller)**,它通过累积相关性证据,利用不对称阈值防止状态振荡,在影子模式下测试重新激活,并通过策略控制退休过程。 这种设计旨在减少过时信息的影响,同时不将暂时性抑制与永久性擦除混为一谈。 ## 现实意义与挑战 该框架为企业AI智能体提供了一种更安全的知识管理方式。例如,在法规更新或市场突变时,AI可以暂时休眠旧规则,待新规则稳定后再决定是否恢复。然而,论文目前仅提出概念框架,尚未给出具体实现细节或实验验证。如何准确评估知识相关性、如何设置阈值,仍有待探索。 尽管如此,这一思路为持续学习领域提供了新视角:**遗忘并非缺陷,而是智能系统适应变化的重要能力**。未来,企业AI或能更灵活地管理知识生命周期,平衡稳定与适应。

HuggingFace10天前原文

视觉自回归模型的训练常依赖在线策略蒸馏(OPD),即让学生模型从自身生成的轨迹中学习,以提升其性能。然而,传统的自回归解码逐token生成,导致每次在线训练步骤的开销巨大。最新研究提出了一种名为HB-SJD的批量推测雅可比解码后端,旨在显著加速这一过程,同时保持生成质量。 ## 背景:在线策略蒸馏的瓶颈 在线策略蒸馏通过让学生模型在训练过程中不断生成新数据,再基于这些数据优化自身,实现更高效的模型压缩。但问题在于,学生模型的每次前向传播只能生成一个token,这种序列化的解码方式使得整个训练过程耗时严重。尽管已有推测解码等方法尝试并行生成,但它们通常依赖于额外的草稿模型,增加了系统的复杂性。 ## HB-SJD:无需辅助模型的并行解码 HB-SJD基于推测雅可比解码(SJD),它利用雅可比迭代的原理,允许在不借助辅助模型的情况下并行处理多个token。HB-SJD将其扩展至批量场景,支持多个图像样本同时解码,每个图像根据其自身的生成进度独立推进,同时在不同序列位置进行批量验证。当某个图像完成生成后,HB-SJD会自动切换至更紧凑的执行模式,以降低后续迭代的计算成本。 ## 实验验证与优势 在LlamaGen模型上的实验表明,HB-SJD显著减少了回放生成和端到端训练的时间,同时保持了蒸馏后学生模型的生成质量。该方法仅替换了学生模型的回放后端,不改变教师模型、蒸馏目标或优化过程,因此可以轻松集成到现有的OPD流程中。 ## 意义与展望 HB-SJD为视觉自回归模型的高效训练提供了新思路,尤其适用于对实时性要求较高的应用场景。未来,该技术有望进一步扩展到其他模态或更复杂的模型结构,推动AI模型压缩与部署的实用化进程。

HuggingFace10天前原文

在细粒度图像识别任务中,类别标签往往具有层级结构。例如,识别一种鸟类时,模型可能对“鹰”这一粗粒度概念很有把握,但在区分金雕、白头鹰等具体物种时却犹豫不决。这种结构化的不确定性,要求模型不仅能表达对细粒度类别的置信度,还需刻画对中间层级概念的认知状态。然而,现有方法各有短板:平面证据分类器只能在叶子类别上用一个“空值”表示整体无知,而层次分类器虽能传递点概率,却缺乏对证据量的刻画。 针对这一痛点,复旦大学的研究团队提出了一种名为 **H²EDL(Hyper Evidential Deep Learning for Hierarchical Classification)** 的新框架。其核心洞察在于:**类别树本身就是一个天然的“超域”**。树中的每个子树和叶子节点构成一个线性大小的焦点族,而每个分支节点上的一个局部狄利克雷意见,就能以闭式解推导出所有复合类别的质量分布。 H²EDL 的巧妙之处在于,它用同一组参数提供了两种互补的视角。从预测角度看,它是一个保持跨层级一致性的层次分类器;从概率角度看,它定义了一个有效的树结构超意见——每个节点上的质量代表“信念到达该节点,但不足以进一步细分为子类”的程度。这种设计让模型既能表达“知道是鹰,但不清楚具体种类”的中间状态,又避免了传统超证据网络需要人工标注复合标签或依赖非结构化权重模式的局限。 在 **FGVC-Aircraft** 和 **DERM12345** 两个数据集上的实验表明,与交叉熵基线相比,H²EDL 将校准误差降低了约一半,且层级越深、训练预算越大,改进越明显。这意味着模型不仅能做出准确预测,其置信度也更可靠,对于医疗影像诊断、自动驾驶等高风险场景尤为重要。 H²EDL 的提出,为层级分类中的不确定性建模提供了一个优雅而高效的解决方案。它首次将超证据学习与树结构结合,无需额外标注即可捕获结构化的认知不确定性,有望推动细粒度识别系统在实际应用中更安全、更可信。

HuggingFace10天前原文

近年来,机器学习在医学领域的应用日益广泛,并取得了一定成功。然而,围绕机器学习的诸多不确定性,使其认识论和方法论基础难以确立。学术界常将医学与机器学习进行类比,主张以后者的标准来规范前者的认识论和方法论。但这一类比往往流于表面,缺乏深入剖析。 来自意大利和英国的研究者Emanuele Ratti与Lena Zuchowski在发表于《Studies in History and Philosophy of Science》的论文中,借助哲学家Mary Hesse的工具,将这一类比刻画为**临床转化过程与机器学习系统构建过程之间的生成性类比**。他们不仅明确了临床转化中通常被隐含提及的认识论和方法论依据,还展示了这些依据如何类推到机器学习语境中。 研究者将临床转化中的依据解释为**可靠主义**(reliabilist)意义上的,并由此提出一种新的机器学习可靠主义(ML reliabilism)。这种新观点与现有的AI哲学中的可靠主义既有区别又相互兼容。 这一研究的意义在于,它并非简单地套用医学标准,而是通过严谨的哲学分析,为机器学习系统的可靠性提供了新的理论支撑。在AI信任危机频发的当下,这一视角有助于我们重新思考如何构建值得信赖的AI系统,也为AI方法论的研究开辟了新的方向。

HuggingFace10天前原文

自闭症谱系障碍(ASD)是一种以社交互动和沟通障碍为特征的发育性疾病,其病因目前尚不明确。近年来,机器学习(ML)技术在自闭症早期诊断和治疗中展现出巨大潜力。一篇发表于arXiv的综述文章系统评估了2017至2023年间55项相关研究,揭示了该领域的技术趋势、关键挑战与未来方向。 ## 技术趋势:监督学习主导,深度学习崛起 综述指出,**监督学习方法**在自闭症诊断中占据主导地位,这与ASD诊断需求高度契合——诊断通常需要明确的标签(如患病与否)。然而,随着数据可用性的增加,**深度学习**的应用正在迅速扩展。未来,结合无监督学习、深度学习和模糊逻辑的**混合方法**可能成为研究热点,有望处理更复杂的数据模式。 ## 关键挑战:数据整合与多模态融合 当前模型面临的核心挑战在于**整合复杂数据**,如遗传信息和临床数据,以提升诊断准确性和治疗效果。传统单一数据源(如行为问卷)难以全面捕捉ASD的复杂性。为此,综述强调,引入**可穿戴设备和生物传感器**等创新数据源,能够实现连续、非侵入式的监测,为理解ASD提供更全面的视角。 ## 未来方向:跨学科合作与多模态数据 综述认为,解决现有挑战需要**跨学科合作**,包括计算机科学、医学、心理学等领域专家的共同努力。同时,扩大针对ASD的**专用数据集**至关重要,这将使未来的ML模型能够整合更广泛的多模态数据,从而更全面地应对ASD的复杂性。 ## 小结 机器学习在自闭症诊疗中的应用正处于快速发展阶段,尽管面临数据整合等挑战,但技术创新与跨学科协作有望带来突破。对于研究者而言,关注混合方法、多模态数据融合以及新型数据采集技术,将是推动该领域前进的关键。

HuggingFace10天前原文

在科学发现中,模拟数据与实验数据之间的鸿沟一直是机器学习应用的难题。领域自适应(Domain Adaptation)技术为此而生,其核心假设是:模拟与实验两个域仅在“干扰”(nuisance)上存在差异,而目标量的分布保持一致。然而,在物理学中,这一假设往往不成立:模拟可能对物理本身存在错误描述,而目标量(如能谱、红移分布)的分布恰恰是实验要测量的对象。 最近,来自俄罗斯科学院核研究所与莫斯科物理技术学院的 Ivan Kharuk 在 arXiv 上提交了一篇题为《Safe Domain Adaptation for Physics: Overcoming Nuisances, Label Shifts, and Simulation Priors》的论文,系统性地探讨了这些失配带来的后果,并提出了一种新的自适应方法。 研究团队以一个玩具空气簇射基准(toy air-shower benchmark)为实验平台,该基准可以独立或组合地开启三种失配:探测器响应干扰、物理模拟偏移、以及能谱偏移。他们发现,标准的对抗性域自适应(adversarial adaptation)能够有效处理条件偏移,但当两个域的能谱分布不同时,标准方法会将它们“对齐”,从而将原本不可控的偏差替换为锚定在模拟先验上的偏差。换句话说,模型会错误地将模拟的能谱分布强加给实验数据,掩盖真实的物理差异。 为解决这一问题,作者提出了“自适应域自适应”(adaptive domain adaptation)方法。该方法通过重新加权模拟事件,使域自适应仅聚焦于真正的物理失配,而避免将模拟先验的错误信息传递到目标域。此外,由于预测的能谱依赖于模型训练配置,论文还提供了一种无标签的模型选择规则,帮助用户在不依赖真实标签的情况下,选择接近最优操作点的配置。 这一工作对高能物理、天体物理等领域具有重要意义。在这些领域,模拟是理解探测器响应和物理过程的关键工具,但模拟与真实数据之间的差异常常被低估。该研究不仅揭示了标准域自适应方法在物理场景中的局限性,还提供了一种更为安全、可靠的替代方案。未来,这一方法有望应用于更复杂的物理实验数据分析,如宇宙射线观测、暗物质搜索等,帮助研究者更准确地从数据中提取物理规律。

HuggingFace10天前原文

蝙蝠作为生态系统健康的关键指示物种,在欧洲受到广泛保护,因此可靠的数量监测是保护工作的优先事项。然而,蝙蝠隐秘的夜行性生活使得被动声学监测成为必要,但自动识别面临挑战:回声定位叫声因行为和环境而异,且物种间存在重叠。为此,研究人员提出了一个深度学习框架 ChiroEcho,该框架联合预测物种和属,并在推理时将属的预测与地理物种分布相结合。当预测的属在某一区域只有一种物种时,该框架能够解析出训练分类中未出现的物种,从而将地理信息视为扩展分类器有效分类的手段,而非限制。研究使用了涵盖 35 种欧洲蝙蝠的录音,评估了封闭集分类,检验了稀疏物种性能估计的不稳定性,并进行了受控的留出验证实验。稀有物种分析显示,有限的评估数据可能掩盖物种级性能;而留出实验表明,属的预测和位置信息可以恢复物种头无法获得的标签。地理分辨将操作覆盖范围从 35 种扩展到 48 种欧洲本土蝙蝠中的 41 种,覆盖率从 73% 提升至 85%。据作者所知,这是报道的欧洲蝙蝠自动分类中最广泛的操作覆盖。更广泛地说,该框架为通过结合粗粒度预测和透明外部约束来解析未见过的细粒度类别提供了原理验证。

HuggingFace10天前原文

道路安全管理长期以来处于被动状态,通常依赖事故记录,在伤亡发生后才进行分析。然而,在事故发生前主动识别高风险路段和危险驾驶行为,是亟待解决的关键挑战。近期,一篇提交至ATRF 2026会议的论文,探讨了如何利用澳大利亚悉尼大都会区的联网车辆遥测数据,检测并预测接近事故的危险驾驶事件,为主动干预提供了新思路。 ## 研究核心:量化危险驾驶与构建热点图 研究团队通过**g力阈值**来量化危险驾驶行为,包括急刹车(>0.6g)、急转弯(>0.47g)和急加速(>0.5g)。他们基于这些事件构建了**时空热力图**,以识别高风险区域。研究以地方政府区域(LGA)为粒度,聚焦于悉尼内城区和西部的CBD、Parramatta、Bankstown等地区,这些区域被持续标记为高风险区,需要针对性的政策干预。 ## 模型对比:简单时间序列模型胜出 为了预测高风险驾驶事件,研究者比较了八个预测模型,涵盖三大类:集成学习(随机森林、XGBoost、LightGBM)、深度学习(LSTM、N-BEATS)和经典时间序列方法(ARIMA、指数平滑、Prophet)。结果显示,**ARIMA模型表现最佳,平均绝对误差(MAE)为162.21**,与LSTM(MAE 163.92)接近,且优于所有集成方法。N-BEATS的MAE为180.75。这表明,在训练数据量有限的情况下,**简约的时间序列模型能够与深度学习模型相抗衡**,甚至更优。 ## 意义与展望:物联网数据驱动的主动安全 该研究凸显了基于物联网的联网车辆数据在支持**主动道路安全干预**方面的潜力。通过实时监测和预测高风险驾驶事件,交通管理部门可以提前部署资源,如加强巡逻或调整信号灯配时,从而减少事故发生率。未来,随着联网车辆数据的普及和模型的优化,这种主动安全策略有望在更广泛的区域推广,真正实现从“事后应对”到“事前预防”的转变。 尽管研究尚处于初步阶段,但它为道路安全监测提供了新的视角,证明了数据驱动方法在公共安全领域的应用价值。

HuggingFace11天前原文

在物理信息机器学习(PIML)领域,一个长期困扰研究者的问题是:当混合偏微分方程(PDE)参数估计器假设的算子不正确时,我们能否仅从一次拟合中检测出来,并进一步将其与参数不可识别性区分开?最新研究提出了一种无需参考(reference-free)的检测工具,仅凭单次拟合即可实现这一目标,为模型验证提供了新思路。 该工具的核心是一个基于信息矩阵的统计量,它利用插件尺度和每种子参数,在正确设定的情况下,其中位数仅为0.19,拒绝率为0.033,远低于预注册的0.10阈值。然而,在两种误设情形下,该统计量分别飙升至224和85,并在所有重复试验中触发警报。更关键的是,在正确设定但参数不可识别的设计中,该统计量保持沉默(n=200时为0.050,Clopper-Pearson置信区间[0.024, 0.090]),而秩统计量则在预注册边界c5*=2.15×10^-3处崩溃为零。因此,通过一次拟合的两种读数,研究者能够在三种设计中区分误设与不可识别性,这正是该工作的核心贡献。 作者强调,检测本身并非新鲜事物,但区分两种失败模式才是关键。在样本内,该工具提供的是界限;在样本外,则指示方向。研究指出,常用的精度检查往往对误设视而不见:误设估计器的域内均方根误差(RMSE)为2.7×10^-2,低于σ≥0.05时的观测噪声,而系数在零噪声时误差达29.7%,在最大噪声时达31.2%。这表明,仅凭预测精度无法捕捉模型错误。 此外,研究排除了架构因素:单参数曲线拟合、裸参数以及49和241参数的多层感知机均收敛到相同的伪真值(闭合形式匹配度达0.07%),而物理信息网络因其复合目标函数,收敛到不同的解。这进一步说明误设是本质性的,而非网络容量不足。 作者还报告了工具的盲区,包括一个预注册的负面结果:在恢复任务中,神经网络估计器败给了Tikhonov正则化反演。同时,他们给出了保证成立但训练网络违反该保证的假设条件。 这项研究为混合PDE参数学习提供了实用的诊断工具,有助于提高模型的可信度,并可能推动PIML在科学计算中的更广泛应用。

HuggingFace11天前原文

在大语言模型(LLM)的后训练阶段,监督微调(SFT)是提升模型任务能力的关键环节。然而,面对海量的候选数据,如何筛选出少量高质量样本,在降低训练成本的同时保持甚至提升模型性能,一直是业界关注的焦点。传统的做法往往将数据价值视为静态属性,忽略了数据与目标模型能力分布之间的兼容性。针对这一痛点,来自多所高校和科研机构的研究团队提出了一种名为 **Data-DPO** 的新方法,旨在实现面向目标模型的数据选择,相关论文已提交至 arXiv(编号:2608.16926)。 ## 核心思路:从静态评估到动态适配 Data-DPO 的核心理念是:**数据价值并非一成不变,而是相对于特定模型而存在**。同一份数据,对于能力较强的模型可能价值有限,但对于能力较弱的模型则可能是宝贵的训练素材。因此,数据选择应当充分考虑目标模型的当前能力状态。 具体而言,Data-DPO 通过**一步探针**(one-step probing)机制,观察目标模型在不同样本上的局部训练反馈,将样本间的激活差异转化为成对的数据偏好(pairwise data preferences)。随后,训练一个轻量级的奖励模型,来学习这种“目标模型感知”的数据偏好。在最终选择阶段,Data-DPO 综合了目标模型偏好、外部质量评分以及边际多样性(marginal diversity),构建出更为稳定且有效的训练子集。 ## 实验验证:超越现有基线 研究团队在 **Vision-Flan** 和 **LLaVA-CoT** 两个数据集上进行了实验,结果显示 Data-DPO 在多种数据预算下均一致优于现有的数据选择基线,并且能够稳定超越使用全部数据进行训练的性能。这意味着 Data-DPO 不仅能够降低训练成本,还能带来性能上的提升,为 LLM 后训练的数据工程提供了新的思路。 ## 行业意义:从“数据越多越好”到“精准匹配” 这一研究的价值在于,它打破了传统“数据越多越好”的直觉,强调了数据与模型之间的动态匹配关系。在实际应用中,不同厂商的模型架构、预训练数据分布各不相同,对微调数据的需求也存在差异。Data-DPO 提供了一种可定制的数据选择方案,有望帮助企业更高效地利用数据资源,加速模型迭代。 ## 局限与展望 尽管实验结果令人鼓舞,但该研究仍处于预印本阶段,尚未经过同行评审。此外,方法的计算开销(如探针训练和奖励模型训练)以及在不同规模模型上的泛化能力,仍需进一步验证。未来,团队计划探索如何将 Data-DPO 扩展到更大规模的模型和更多样的任务场景,并尝试与数据合成技术结合,进一步提升数据利用效率。 总之,Data-DPO 为 LLM 后训练中的数据选择问题提供了一个新颖的视角,其“目标模型导向”的设计理念值得关注。随着大模型应用日益普及,数据工程的精细化将成为决定模型性能的关键因素之一。

HuggingFace11天前原文

随着监督微调数据规模的不断扩大,如何从庞大的候选池中筛选出高价值子集,已成为降低训练成本、提升模型性能的关键挑战。现有的数据选择方法通常直接在原始嵌入空间中度量数据多样性,但这种方式容易将主导语义方向、细粒度监督差异和局部噪声纠缠在一起,导致选择结果不够精准。 针对这一问题,来自上海交通大学等机构的研究团队提出了一种名为 **MASS** 的新方法,将数据选择形式化为**从粗到细的分层覆盖问题**。MASS 首先利用密集自编码器学习低维主流形坐标,实现粗粒度的语义分组;随后在每个组内,借助 TopK 稀疏自编码器进行质量感知的稀疏特征覆盖。这种设计既保留了全局语义结构,又兼顾了局部细节特征,从而更有效地挑选出代表性数据。 在 **Vision Flan** 和 **LLaVA-CoT** 两个基准上的实验表明,MASS 在多种数据预算下均稳定优于现有的强基线方法,并且在某些设置下,仅使用少量数据子集就能达到甚至超越全量数据训练的效果。这一结果意味着,MASS 有望显著降低 LLM 后训练的数据需求,为高效微调提供新的思路。 ## 方法核心 MASS 的流程分为两个阶段: 1. **粗粒度语义分组**:通过密集自编码器将高维嵌入压缩到低维主流形空间,利用几何结构进行语义聚类,避免原始空间中噪声的干扰。 2. **细粒度稀疏覆盖**:在每个语义组内,使用 TopK 稀疏自编码器提取稀疏特征,并基于质量感知的覆盖策略选择数据点,确保所选子集能充分代表组内的多样性。 这种分层设计使得 MASS 既能把握全局语义,又能捕捉局部关键特征,从而在数据选择上实现更好的平衡。 ## 实验亮点 在 Vision Flan 数据集上,MASS 在 10%、25%、50% 等不同数据预算下,均取得了比随机选择、核心集选择等基线更高的下游任务准确率。在 LLaVA-CoT 上,MASS 同样表现出色,甚至在 25% 数据预算下就超过了全量微调的效果。这些结果凸显了 MASS 在数据效率上的巨大潜力。 ## 意义与展望 这项研究为 LLM 后训练的数据选择提供了新的视角。通过引入分层覆盖和稀疏特征,MASS 有效解决了传统方法在嵌入空间中度量多样性的局限。未来,该方法有望扩展到更多模态和更大规模的数据集,进一步推动高效训练的发展。

HuggingFace11天前原文

在组织文档管理中,自动敏感度分类是一项关键但常被忽视的任务。分类错误可能导致监管违规或安全漏洞。尽管基于AI的方法为人工审查提供了可扩展的替代方案,但其可靠性高度依赖于训练数据的完整性。然而,该领域普遍存在一个被低估的问题——标签泄漏:文档中残留的分类标记使得模型能够利用表面捷径而非学习真正的内容信号,从而产生虚高且不可靠的性能评估。 针对这一问题,研究人员提出了**Strategic 16K**,一个精心构建的、控制泄漏的语料库,包含来自维基解密美国外交电文库(PlusD)的**16,000份外交电文**。他们系统性地评估了六种模型架构,涵盖经典机器学习和基于Transformer的方法。通过扩展的泄漏移除协议,他们识别并消除了三类残留分类标记。在干净的基准测试上,**BERT表现最佳**(准确率89.14%,F1分数89.33%),其次是**ELECTRA**(准确率88.57%,F1分数88.90%)。在经典模型中,**TF-IDF结合逻辑回归**以显著更低的计算成本取得了最强性能。 这些结果构成了首个在明确泄漏控制条件下从WikiLeaks PlusD构建的可完全复现的敏感度分类基准。 ## 背景与挑战 组织文档的敏感度分类是信息安全的重要防线,但传统人工审查成本高昂且效率低下。AI模型的应用虽能提供规模化解决方案,却面临一个隐蔽的陷阱:训练数据中的标签泄漏。如果文档中残留了分类标记(如“机密”字样),模型可能会依赖这些表面线索,而非学习文档内容的语义特征,导致在真实场景中性能大幅下降。 ## 研究方法 研究团队从WikiLeaks PlusD中选取了16,000份外交电文,构建了Strategic 16K语料库。他们设计了一套严格的泄漏移除协议,系统性地识别并清除了三类标记:格式标记、元数据标记和内容中的分类词汇。随后,他们对比了六种模型:经典方法包括TF-IDF与逻辑回归、朴素贝叶斯和支持向量机;深度学习方法包括BERT、ELECTRA和RoBERTa。 ## 主要发现 在清理后的基准上,BERT和ELECTRA展现了优越性,但经典模型也表现出色。TF-IDF与逻辑回归的组合在准确率和F1分数上接近最佳深度模型,却无需GPU训练,推理速度更快,资源消耗更低。这提示我们,在资源受限的场景下,经典模型仍具竞争力。 ## 意义与展望 这项研究不仅提供了首个可复现的泄漏控制基准,还强调了数据质量在AI系统中的重要性。它提醒我们,模型性能的评估必须建立在干净的数据之上,否则可能会误导实际部署决策。未来,如何将泄漏检测自动化,以及如何在更广泛的文档类型上验证这些发现,将是值得探索的方向。

HuggingFace11天前原文

## 日级建模:从静态快照到动态轨迹 医院再入院率是衡量医疗质量与资源调配效率的关键指标。传统预测模型通常将住院期间的复杂病史压缩为固定表征,忽视了反映患者生理状态演变的日级临床信号。针对这一局限,来自韩国的研究团队在 MICCAI 2026 MultiTab Workshop 上提出了 **Mr.Dec**(Multimodal Readmission-risk prediction Decoder),一种以日为单位、融合多模态数据的再入院风险预测模型。 ## 核心设计:时间对齐的多模态事件流 Mr.Dec 的核心创新在于将每次住院视为一个**按时间顺序排列的日级多模态事件序列**。模型通过 Transformer 解码器架构,将电子健康记录(EHR)的每日更新与间歇性胸部 X 光片(CXR)发现整合到同一时间对齐的数据流中,模拟真实临床工作流程。这种设计避免了传统方法中因固定时间窗口压缩而丢失的细节,使模型能够捕捉患者每日的病情变化轨迹。 ## 技术亮点:对比学习增强稳健性 为了提升模型的鲁棒性,Mr.Dec 引入了**疾病特异性监督对比学习**作为辅助正则化手段。该机制在潜在空间中诱导出诊断感知的结构,帮助模型更好地区分不同疾病类型的再入院风险模式,从而增强泛化能力。 ## 实验结果与临床价值 在 MIMIC-IV 和 MIMIC-CXR 数据集上的评估显示,Mr.Dec 达到了**最先进的性能**,验证了保留临床序列完整性的有效性。此外,模型还能识别住院期间的“**关键日**”,为实时风险分层提供可操作的临床解释。这一功能有望帮助医护人员在患者住院过程中及时干预,降低再入院风险。 ## 展望 Mr.Dec 为医疗 AI 提供了一个新思路:**从静态快照转向动态轨迹建模**。未来,该框架或可扩展至其他时间敏感型临床预测任务,如脓毒症早期预警或术后并发症监测。不过,当前研究仍基于公开数据集,实际临床部署还需考虑多中心验证与模型可解释性等挑战。

HuggingFace11天前原文

多任务学习(MTL)旨在通过共享表示同时解决多个相关任务,以提升效率和泛化能力。然而,现有方法在模型容量调整上存在局限:要么依赖硬共享或固定结构,要么需要预设多个路径或专家,要么根据任务边界或冲突信号进行动态扩展。这些方法往往受限于预定义结构,或需要人工干预,无法真正实现按需生长。 针对这一痛点,来自北京农业信息技术研究中心、西北工业大学等机构的研究者提出了**EMAN**(Emergent Modular Atomic Network,涌现模块化原子网络)框架,探索一个根本性问题:**网络能否从单路径计算出发,仅在出现持续优化证据时,才生长出新的独立路径?** EMAN 的核心创新在于,它通过潜在相对相位(latent relative phases)暴露了一个反对称生长方向(antisymmetric growth direction),从而在不实例化第二条路径的情况下,持续监测多个决策信号,将局部的优化证据转化为结构决策。只有当证据充分(即通过认证)后,EMAN 才会实际物化出两条等容量的独立路径,并自适应地分配共享与任务专属的表示容量。 实验方面,研究团队在受控秩设置、**PASCAL-Context** 和 **NYUv2** 数据集上进行了广泛验证。结果显示,EMAN 能以具有竞争力的计算成本取得更优性能,证明了其有效性。 这项工作的意义不仅在于提出了一种新的 MTL 架构,更在于提供了一种**优化驱动的容量增长范式**:容量变化不再依赖人工预设,而是由训练过程中的优化信号自然触发。这为多任务学习乃至更广泛的动态神经网络设计提供了新思路。 当然,EMAN 仍面临一些挑战,例如如何准确判断“持续优化证据”,以及如何避免过早或过晚地生长路径。未来,这一框架有望与神经架构搜索、持续学习等方向结合,推动模型向更自主、更高效的方向演进。

HuggingFace11天前原文

脑电图(EEG)基础模型通过在大规模异质神经记录上学习可复用表示,已成为EEG解码的一种有前景的范式。然而,公开释放EEG基础编码器虽促进了下游开发,却也引入了此前未被探索的安全风险:公开可用的表示可能使私有下游模型变得脆弱。本文研究在公共编码器和私有下游设置下的对抗迁移攻击,其中攻击者可白盒访问已发布的编码器和小型任务匹配的标记参考集,但无法访问或查询受害者的参数、输出或梯度。 我们提出了收缩-白化代理交叉熵(SW-ProxyCE),一种免查询的任务感知攻击框架,通过收缩-白化的类原型从小型标记参考集中恢复任务级决策几何,从而无需训练额外代理分类器即可生成可迁移的对抗样本。我们在三个EEG任务上评估了SW-ProxyCE,使用三个通用基础编码器和一个范式特定预训练编码器,覆盖了跨受试者和受试者内场景下的线性探测和全微调下游模型。结果表明,从公共编码器和有限标记参考生成的对抗样本能有效迁移至不可访问的下游模型。SW-ProxyCE始终优于任务无关的表示偏移攻击,揭示EEG基础模型的强迁移性并不必然带来对抗鲁棒性。代码将在GitHub上提供。 ## 背景与动机 EEG基础模型的开放发布促进了社区发展,但也引入了新的攻击面。攻击者可能利用公开编码器生成对抗样本,攻击下游私有模型,而无需任何查询。这种攻击方式在现实场景中具有可行性,因为许多部署模型基于公开编码器进行微调。 ## 方法:SW-ProxyCE SW-ProxyCE的核心创新在于利用收缩-白化类原型来近似任务决策边界,从而在无查询条件下生成可迁移的对抗扰动。该方法无需训练额外的代理分类器,降低了攻击成本,同时保持了攻击有效性。 ## 实验与结果 实验覆盖多个EEG任务和多种编码器架构,结果一致表明SW-ProxyCE生成的对抗样本能有效攻击私有下游模型,且性能优于现有方法。这提示基础模型的迁移性可能被恶意利用,需引起重视。 ## 总结与展望 本研究首次系统探讨了EEG基础模型的安全风险,提出了高效的攻击方法,并呼吁社区关注模型的鲁棒性。未来工作可探索防御策略,如对抗训练或模型净化,以增强EEG基础模型部署的安全性。

HuggingFace11天前原文

随着AI数据中心不断淘汰旧款GPU,大量仍具计算能力的加速器流入二手市场。这些退役GPU能否重获新生,形成所谓的“垃圾集群”(DumpsterCluster),并为现代LLM推理提供算力?最近一篇arXiv论文对此进行了深入探讨,并给出了令人惊讶的答案。 ## 从“捡垃圾”到构建集群 研究人员从零开始,仅使用二手组件,搭建了一个包含**128块GPU**的DumpsterCluster,并持续运行了一年。他们发现,在当前的硬件价格下,这套系统的成本仅为**2.2万美元**,而一台8卡B200系统的价格高达**60万美元**,经济优势不言而喻。更令人惊讶的是,通过流水线并行优化,这个基于V100的集群在运行LLaMA-70B时,吞吐量竟然可以媲美现代系统,证明了其生产级应用的潜力。 ## 隐藏的代价:能耗与碳排放 然而,研究也揭示了关键的环境制约因素。旧款GPU在生成每个token时消耗的能源显著更多,因此,只有当地电力价格低廉时,总拥有成本才具有优势。更严峻的是,在电网平均碳强度下,二手系统处理8B模型时,每个token的碳排放量约为当前一代硬件的**4倍**;而对于70B模型,这一数字更是飙升至**40倍**以上。这意味着,GPU的“第二春”并非普遍适用——硬件再利用必须与低碳能源战略性地结合。 ## 绿色AI的可行路径 尽管存在诸多挑战,研究人员指出,在能源成本低且电力清洁的地区,二手GPU为扩大AI算力提供了一条可行途径,同时兼顾了经济性、能源安全与环境责任。这项研究不仅为硬件回收提供了新思路,也提醒我们,在追求AI性能的同时,必须将可持续性纳入考量。未来,或许“垃圾集群”将成为绿色AI的重要一环。

HuggingFace12天前原文

在人工智能与法律交叉领域,一个反复出现的构想是:将多种不确定性工具融合进一个流程,以提升案件结果预测的准确性。然而,一项针对欧洲人权法院真实案例的实证研究却给出了耐人寻味的结论——这类融合的真正价值不在于让预测更准,而在于建立一种“校准后的信任”。 这项研究由 Surya Saka 完成,论文发表于 arXiv(编号:2608.14617)。研究者从 LexGLUE 和 FairLex 数据集中选取了 **1,000 个真实案例**,利用事实段落预测法院是否认定存在《欧洲人权公约》违反行为。实验对比了三种证据评估方式:直接使用前沿大语言模型(LLM)、将 LLM 接入融合流程、以及基于词频的基线模型接入同一流程。测试在两个顶尖模型(Claude Opus 4.8 和 GPT-5.5)上进行了约 **4,750 次**测试。 结果出乎意料:在歧视类案件(AUROC 约 0.83)上,融合流程并未带来任何改进,直接使用前沿 LLM 反而是最强的单一判别器。更严重的是,天真地将 LLM 与贝叶斯赔率更新和 Dempster-Shafer 组合融合,会使校准误差(ECE)从约 0.16 翻倍至 0.46,且这种“先验失配”机制在两个模型上均重现。Dempster-Shafer 融合在长链条场景下甚至表现出“不安全”的行为——以低于随机水平的准确率自信地给出错误标签,因此论文建议直接移除该组件。 不过,融合流程并非一无是处。其真正的价值体现在**操作层面**:通过保形选择性预测层,系统可以决定哪些案件自动处理、哪些需要人工复审。在移除 Dempster-Shafer、重新校准并应用类别条件风险控制后,优化后的引擎在自动放行案件上达到了 **96.8% 的准确率**,仅 0.5% 的错误逃逸,96.3% 的错误被拦截送审;而未调优的基线则分别为 85.9%、3.8% 和 72.1%。 这项研究的核心启示是:在司法 AI 中,融合不确定性工具的目标不应是追求“更锋利的预测”,而是建立一种“校准后的信任”——让系统在不确定时懂得求助人类,在确定时敢于放手。这种思路或许比单纯追求准确率更具现实意义,也为法律 AI 的落地提供了新的视角。

HuggingFace12天前原文

近年来,神经算子(Neural Operator)在求解偏微分方程(PDE)和科学计算领域展现出巨大潜力,但传统模型如DeepONet依赖深度网络隐式学习基函数,其内部机理难以解释,且在数据有限时泛化能力受限。针对这一痛点,一项新研究提出了**PIKFNO(Physics Informed Kernel Function Neural Operator)**,将物理信息核函数显式嵌入神经算子架构,在保持高精度的同时显著提升可解释性。该论文已发表于arXiv(编号:2608.14619),由Yuan Guo、Hanshu Chen和Zhuojia Fu等人完成。 ## 核心创新:从隐式学习到物理约束 传统神经算子(如DeepONet)通过深度网络隐式学习基函数,而PIKFNO则从控制方程出发,推导出**物理信息核函数**,并将其作为主干网络的约束条件。这使得算子结构与无网格配点法(meshless collocation)中的核扩展形式对齐,从而在架构层面注入物理先验。 研究提出了两种构建策略: - **数据驱动核学习**:直接从数据中学习核函数,所得核可视为非奇异基本解(nonsingular fundamental solution); - **解析变换构建**:通过解析基本解的变换来构建核函数,确保物理一致性。 ## 实验表现:小数据下的高精度与强泛化 数值实验表明,PIKFNO在多种PDE问题上取得了高预测精度,同时大幅提升了模型的可解释性。更值得关注的是,在**有限训练数据**条件下,PIKFNO展现出优于传统神经算子的泛化能力。这意味着在实际工程中,当数据获取成本高昂时,PIKFNO可能成为更可靠的选择。 ## 行业意义与未来展望 PIKFNO的提出为科学计算领域提供了新的思路:将物理规律显式嵌入模型,而非完全依赖数据驱动。这种方法不仅有助于提升模型在物理一致性和外推能力上的表现,也为构建**高效、物理一致且可解释**的神经算子开辟了新路径。未来,该框架有望在流体力学、材料科学、气候模拟等复杂系统建模中发挥重要作用。 不过,论文目前仍处于预印本阶段,尚未经过同行评审,其实际应用效果还需进一步验证。但无论如何,PIKFNO代表了神经算子研究从“黑箱”走向“白箱”的一种积极探索,值得AI与科学计算交叉领域的研究者关注。

HuggingFace12天前原文

强化学习(RL)在自主系统和自适应性系统中应用广泛,但深度RL策略依赖神经网络,其决策过程缺乏透明度,难以理解,这可能导致用户信任度下降,并增加系统验证难度。为解决这一问题,一篇新论文提出了**EARL(Explanations using Alternative Realities for Reinforcement Learning)**,这是一个Python库,用于在RL环境中生成反事实解释。 ## 什么是反事实解释? 反事实解释通过探索“如果……会怎样”的场景,比较不同可能结果,来阐明智能体的行为。心理学研究表明,这种解释方式直观且用户友好,但在RL领域,相关研究近期才起步,且现有实现多局限于玩具示例和基准测试。EARL则支持在现实RL自适应性系统中生成反事实解释。 ## EARL的实际应用 为了展示其适用性,研究者们在**CitiBikes**模拟环境中进行了演示,这是一个自适应性共享单车系统。他们还提供了在真实应用中的性能评估。论文已被**第20届哥伦比亚计算大会**接收,共13页,含2张图和3张表格。 ## 为何重要? 随着RL在自动驾驶、智能推荐、资源调度等领域的部署,可解释性成为关键。EARL提供了一种实用工具,帮助开发者、用户和监管者理解RL决策,增强信任,简化验证流程。 ## 未来展望 尽管EARL目前聚焦于自适应性系统,但其方法有望扩展到更广泛的RL应用。研究者计划进一步优化库的性能,并探索更多解释类型。 该研究由Jasmina Gajcin、Juan C. Rosero和Ivana Dusparic共同完成,论文以arXiv预印本形式发布(编号2608.14620),并附有PDF和HTML版本。

HuggingFace12天前原文