SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

## 概述 联邦类增量学习(Federated Class Incremental Learning, FCIL)旨在结合联邦学习(FL)与持续学习(CL),使分布式智能系统能够在数据孤岛间协作,并持续适应新任务。然而,这一组合引入了两种相互耦合的干扰源:来自异构客户端的**空间干扰**和来自顺序任务的**时间干扰**,共同导致**时空灾难性遗忘(ST-CF)**。现有方法通常采用分离机制分别处理空间和时间干扰,往往带来额外的客户端计算或通信开销,且在聚合过程中未对更新之间的方向交互进行有效调控。 ## 核心方法 在本文中,作者将FCIL重新解释为一个统一的多任务学习问题,其中客户端和任务更新均表示为共享参数空间中的**适配向量**。基于这一视角,他们提出了**SUM**(Unified Geometric Surgery on Spatio-Temporal Adaptation Vectors),一个纯服务器端框架,在聚合过程中对适配向量进行几何手术。具体而言: - **空间SUM**:在每个通信轮次内缓解客户端级别的干扰; - **因果在线时间SUM**:随时间推移消除跨任务干扰,且无需额外的客户端计算、通信或内存开销,仅依赖标准联邦训练流程。 ## 实验结果 在多种视觉和语言基准测试上,SUM相比现有FCIL方法取得了**最高22%的性能提升**,同时保持对不可靠客户端的鲁棒性并维持计算效率。该论文已被**ECCV 2026**接收。 ## 技术亮点 SUM的核心创新在于将联邦聚合视为一个几何操作问题,通过调整适配向量的方向和幅度来抑制干扰,而不是简单地对参数求平均。这种方法不仅简洁高效,而且完全在服务器端执行,避免了增加客户端的负担,这对于资源受限的边缘设备尤为重要。 ## 行业意义 随着AI系统越来越多地部署在分布式和动态环境中,FCIL成为解决数据隐私和模型持续演进的关键技术。SUM提供了一种轻量级且有效的解决方案,有望推动联邦学习在自动驾驶、个性化推荐、医疗诊断等领域的实际应用。 ## 小结 SUM通过统一几何手术有效解决了FCIL中的时空灾难性遗忘问题,在性能、鲁棒性和效率之间取得了良好平衡。这一工作为未来分布式持续学习系统的设计提供了新的思路。

HuggingFace1个月前原文

深度学习模型在时间序列预测中展现出强大潜力,但部署于环境监测等真实场景时,非平稳动态与模型可解释性不足成为主要瓶颈。近日,来自法国多所研究机构(RFAI、BDTLN、LIFAT)的团队在一项新研究中,将可解释性作为理解持续学习(Continual Learning)机制的核心工具,系统分析了经验回放(Experience Replay)策略下神经预测模型的行为变化。该工作已被 **EDBT/ICDT 2026** 联合会议接收。 ## 研究背景与动机 现实环境中的时间序列(如地下水位数据)常呈现**非平稳性**——分布随时间漂移、出现 regime shift(机制转换),传统静态模型难以适应。持续学习通过让模型在流式数据上增量更新来应对这一挑战,但“模型为何遗忘”“哪些数据对适应最有用”等问题仍缺乏透明解释。研究者认为,可解释性不仅能诊断预测错误,更能揭示持续学习本身的动态规律。 ## 方法与实验设计 团队选取了三种代表性神经架构:**PatchMixer**、**PatchTST** 和 **DLinear**,并为其配备基于注意力机制的采样策略(attention-based sampling)以实现选择性经验回放。在可解释性方法上,他们采用了两种主流技术: - **Attention Rollout**:追踪注意力权重传播路径,理解模型关注的时间步; - **Grad-CAM**:基于梯度的归因方法,定位对预测贡献最大的输入区域。 实验数据为真实的地下水位(piezometric)时间序列,包含**异质性模式**和**多次机制转换**,非常考验模型的持续适应能力。 ## 关键发现 1. **归因模式随时间演化**:随着新数据流入,Grad-CAM 热图显示模型关注的输入区域发生显著偏移——从历史模式逐渐转向近期异常值,说明模型在主动调整“注意力焦点”。 2. **采样策略的可解释性**:Attention-based 采样并非均匀选择回放样本,而是倾向于保留那些在归因图上**引起高梯度响应的“困难样本”**,这恰好与主动学习(active learning)的直觉一致。 3. **性能与可解释性的权衡**:虽然持续学习能维持预测精度,但归因稳定性的下降(即模型解释的波动)可能成为新问题——尤其当数据分布突变时,梯度归因会出现剧烈跳跃,影响用户信任。 ## 行业意义与挑战 该研究首次将可解释性从“事后解释”提升为**持续学习框架的元分析工具**。传统上,可解释性只用于回答“为什么预测这个值”,而现在它能帮助回答“为什么选择这些数据来更新模型”。这为自适应预测系统的调试与审计提供了新路径。 然而,挑战依然存在: - **计算开销**:每次更新都计算 Attention Rollout 或 Grad-CAM 在实时场景中可能过于昂贵; - **归因方法的选择**:不同归因方法(如梯度 vs. 扰动)可能给出不一致的结论,如何选择或融合仍需探索; - **从观察到干预**:当前研究停留在“从归因理解行为”,未来需要验证能否**利用归因信号主动指导采样**,形成闭环优化。 ## 小结 这项工作为时间序列持续学习领域提供了一个新视角:可解释性不仅是模型透明的保障,更是理解学习动态的窗口。随着环境监测、金融预测等非平稳场景的需求增长,将可解释性深度嵌入持续学习流程,或将成为下一代自适应预测系统的标配。

HuggingFace1个月前原文

在量化投资领域,股票排序与投资组合构建始终是核心挑战——既要捕捉时间序列上的长期趋势,又要理解股票间的动态关联。近日,来自中国的研究团队提出了一种名为 **STN-TGAT**(Soft-Threshold NMI-prior Transformer Graph Attention Network)的新型深度学习框架,旨在更贴近真实交易场景下实现Top-K投资组合的构建。 ## 方法核心:融合时序与图结构的双重视角 STN-TGAT 的核心架构由两部分组成: - **时序Transformer**:用于捕捉股票价格等序列数据中的长期依赖模式。 - **图注意力网络(GAT)**:建模股票之间的动态关联关系,例如行业联动或资金流动。 两者的结合使得模型能够同时利用历史趋势和横截面信息,提升预测的全面性。 ## 创新点:先验图引导与软阈值稀疏化 研究的一个关键创新在于引入 **基于归一化互信息(NMI)的先验图**,该图通过统计股票间收益率的非线性相关性,为模型提供初始的关联结构。在此基础上,**可学习的软阈值稀疏化机制** 被用于过滤噪声连接,同时保留有信息量的边。这种设计增强了模型对市场噪声的鲁棒性,避免了过度拟合虚假的相关性。 ## 贴近实战:Top-5选股与交易成本调整 与许多仅在理论层面验证的模型不同,STN-TGAT 在投资组合构建过程中考虑了多项实际约束: - 从标普500指数成分股中选出 **Top-50** 候选池,再从中精选 **Top-5** 股票; - 明确分配权重,并纳入 **交易成本调整**,使评估结果更贴近真实交易表现。 ## 实验结果:盈利性与准确性双重领先 在真实市场数据上的实证结果显示,STN-TGAT 在预测准确性和投资组合收益率方面均持续优于多个基准模型。这一结果表明,将 **决策对齐训练**(即模型训练目标与最终投资目标一致)与 **自适应关系建模** 相结合,能够为数据驱动的投资组合构建提供一套连贯且实用的框架。 ## 行业意义与展望 STN-TGAT 的出现反映了当前AI+金融领域的一个重要趋势:模型设计不再单纯追求预测精度,而是更加注重 **端到端的决策优化** 和 **交易成本敏感性**。随着大语言模型和图神经网络在量化投资中的进一步融合,类似STN-TGAT这样的框架有望推动智能投顾和算法交易向更成熟的方向发展。

HuggingFace1个月前原文

## 背景:从C-MAPSS到N-CMAPSS的演进 航空发动机的**剩余寿命(RUL)预测**是预测性维护的核心任务。经典基准C-MAPSS提供简化的仿真数据,而N-CMAPSS则通过引入真实飞行剖面和完整航段时间序列,大幅提升了数据真实度。然而,这种真实感也带来了代价:全飞行记录数据量大,且退化信号与运行工况变化相互纠缠,导致预处理选择复杂化,不同模型的性能难以直接比较。 ## CruiseBench:标准化巡航阶段子基准 为解决上述问题,来自四川大学的研究团队提出了**CruiseBench**——一个基于N-CMAPSS的巡航阶段RUL基准。核心创新包括: - **CPM-N-CMAPSS**:一种掩码工具,通过“共同高度法”自动识别每个飞行循环中的巡航区间,并针对9个可访问子数据集生成循环级巡航掩码。 - **固定协议**:仅使用场景描述符和实测传感器作为输入,排除虚拟传感器、健康参数和辅助元数据;保留原始分辨率窗口,并应用数据集级RUL上限。 ## 基线实验与关键发现 研究者在CruiseBench上评估了LSTM、GRU、TCN和TSMixer四种模型。在默认配置(CruiseBench-eta5-W256-S10)下: - **TSMixer**表现最优,平均RMSE为**3.4±1.71**,Saxena评分为**(2.50±2.99)×10⁴**。 - 消融实验表明,**飞行阶段选择**、**时间降采样方法**和**RUL上限阈值**均会显著影响结果,凸显标准化协议的必要性。 ## 意义与未来方向 CruiseBench通过固定巡航阶段协议,为RUL模型提供了**可复现的受控比较平台**。CPM-N-CMAPSS则为迁移学习和领域自适应研究提供了阶段特定的数据基础。该工作有望推动航空发动机预测性维护从“能跑”向“可比、可信”迈进。

HuggingFace1个月前原文

## 告别一维“扫描”暴力:HyenaND 直接在高维空间做全局建模 Transformer 中的注意力机制虽然强大,但其二次方复杂度在处理长序列时成为瓶颈。近年来涌现出许多亚二次复杂度(subquadratic)的替代方案,但这些方案在处理图像、三维体积、偏微分方程(PDE)等多维数据时往往需要“妥协”:要么使用标准卷积,牺牲全局感受野和输入依赖性;要么将多维数据强行“拉平”成一维序列,再用循环模型(如 Mamba)扫描——这种一维光栅化顺序破坏了数据的空间结构。 **HyenaND 的核心理念:让算子直接“理解”数据的原生几何结构。** 它通过隐式参数化的全局、输入依赖的多维卷积核,直接在多维空间上执行操作,无需任何维度转换。这意味着图像仍是图像,体积仍是体积,它们的空间关系被完整保留。 ## 技术亮点:隐式卷积核 + CUDA 优化 HyenaND 继承并扩展了 Hyena 家族的设计思路。其关键创新在于: - **原生多维卷积**:卷积核的尺寸覆盖整个输入域(全局),且其权重由输入数据动态生成(输入依赖),兼具注意力的灵活性和卷积的高效性。 - **亚二次复杂度**:通过将卷积操作映射到频域(FFT),HyenaND 实现了 **O(L log L)** 的计算复杂度,L 为序列长度(多维数据展平后的总元素数)。 - **nSubQ CUDA 实现**:作者团队开发了名为 **nSubQ** 的 CUDA 内核,融合了 FFT 卷积路径,将理论复杂度转化为实际加速。 ## 实验结果:纯 HyenaND 匹敌注意力,混合架构更胜一筹 论文在四个领域进行了广泛评测: 1. **长上下文基因组学**:DNA 序列建模,HyenaND 在准确率上媲美标准注意力。 2. **计算机视觉**:图像分类任务,纯 HyenaND 堆叠达到与强注意力基线(如 ViT)相当的结果。 3. **医学影像**:三维体积分割,HyenaND 原生处理 3D 数据的能力优于光栅化方案。 4. **PDE 建模**:物理方程求解,HyenaND 展现了良好的全局建模能力。 **混合配置**:将 HyenaND 层与注意力层交错堆叠,效果超过纯注意力模型和基于循环的混合模型(如 Mamba-注意力混合)。这表明 HyenaND 不仅能单独使用,还能与 Transformer 互补,在效率与精度之间取得更优平衡。 ## 行业意义:多维数据建模的“架构新选择” HyenaND 的出现为处理高维、长序列数据提供了一种无需牺牲空间结构的高效方案。对于需要同时处理时间、空间、通道等多维信息的应用(如视频理解、气象模拟、科学计算),它可能成为 Transformer 的有力替代或补充。尤其是其 CUDA 优化实现 nSubQ 已开源,有望推动社区在医学影像、自动驾驶感知、数字孪生等领域的落地探索。 不过,HyenaND 目前仍处于 arXiv 预印本阶段,其在大规模多模态场景下的泛化能力、训练稳定性以及硬件适配性尚需进一步验证。但无论如何,这项研究为“后注意力时代”的架构设计提供了新的思路:与其强行将多维数据塞进一维管道,不如让模型学会在高维空间中“自然生长”。

HuggingFace1个月前原文

## 研究背景:从贝叶斯滤波到模型选择 先前研究已证明,Transformer能在固定假设类内精确执行贝叶斯滤波。但一个更根本的问题是:模型能否从数据中**识别出正确的假设类**?这正是贝叶斯模型选择的核心。近日,arXiv上的一篇新论文《Bayesian Wind Tunnels for Model Selection》提出了“模型选择贝叶斯风洞”——一种受控实验环境,其中假设类上的真实后验分布可解析计算。 ## 核心方法:固定点自由对合与三类实验 研究者利用**固定点自由对合**(满足 f(f(x))=x 的纯关系变换)设计任务。一个仅**280万参数**的Transformer在整数token和每轮含义变化的**不透明符号**上,均能达到与贝叶斯最优解仅**0.01比特**的熵一致(3个随机种子)。实验进一步扩展到非嵌套比较:对合 vs. 3-循环(两者互不为子集),模型在类后验上的平均绝对误差(MAE)低于**0.001**,证明其具备真正的模型选择能力,而非仅依赖简单性或子集偏差。 ## 关键发现:算术推理的感知壁垒 研究揭示了一个尖锐的**感知访问条件**:当判别统计量需要算术运算时——如模加法(旋转)或模乘法(f(x)=cx mod p)——模型选择在整数token下成功,但在不透明符号下**完全失败**。即使将参数从280万扩展到**3.16亿**(112倍),这一界限依然存在。 通过**平稳性控制实验**发现:使用固定重标号的不透明token时,模型成功(MAE仅0.009比特),说明**稳定的语义**(而非整数身份)才是电路编译的关键。头部子任务诊断将失败定位在“头部反转与算术的组合”环节,而非头部解析本身。 ## 前沿大模型对比:定性相似,定量差距 在相同任务上测试前沿大语言模型(LLM),结果显示它们表现出**定性上的贝叶斯行为**,但校准差距巨大(约**55倍**),该测量基于有损探测器,因此结果仅具方向性而非精确。 ## 意义与展望 这项研究为理解Transformer的模型选择能力提供了受控实验框架,尤其揭示了**算术推理对符号语义稳定性的依赖**。这一发现对设计能进行因果推断和科学发现的AI系统具有指导意义——未来的模型可能需要结合符号与连续表示,或通过元学习适应动态语义环境。

HuggingFace1个月前原文

## 背景与挑战 空气污染每年导致约 **790 万** 人过早死亡,准确预测空气质量已成为关键的公共卫生议题。然而,现有基准数据集在地理覆盖和污染物种类上均存在局限,且未能评估最新一代时间序列基础模型(TSFM)在真实大规模数据上的表现。 ## Air Quality Arena 的诞生 为填补这一空白,研究团队推出了 **Air Quality Arena(AQA)**,包含大规模多国多污染物数据集 **AQA-Data** 和配套基准 **AQA-Bench**。该数据集覆盖 **7 个国家、4 个大洲**,涵盖 **6 种主要污染物**,时间跨度 **三年**,共包含 **超过 14,000 条站点-污染物序列**,旨在为空气质量任务提供全面基准。 ## 模型评估与发现 研究团队对 **11 个领先的时间序列基础模型** 和传统基线进行了基准测试,评估它们在短期空气质量预测上的表现。结果表明: - **TSFM 作为零样本预测器表现优异**,持续优于传统基线。 - 表现最佳的模型采用了 **跨模态架构**,利用视觉基础模型进行时间序列预测。 ## 开放与影响 AQA 数据集已公开发布,为空气质量预测研究提供了大规模、多区域、多污染物的标准化测试平台。该工作不仅推动了时间序列基础模型在环境领域的应用,也为公共卫生决策提供了更可靠的预测工具。

HuggingFace1个月前原文

稀疏自编码器(SAE)的可解释性评估正面临一场信任危机。一篇来自 arXiv 的新研究(论文编号:2607.19386)通过系统性实验揭示:当前广泛使用的自动可解释性分数,其方差主要来源于评估管线的选择,而非 SAE 架构本身的差异。这一发现对跨论文比较 SAE 可解释性的有效性提出了严峻挑战。 ## 核心发现:管线方差压倒架构方差 研究团队在四个指标(**simulation、detection、fuzzing、purity**)、两个模型(**Pythia-160M、Apertus-8B**)以及四个方法论变化维度上进行了大规模实验。结果清晰显示:**方法学方差在所有指标和模型上均集体超过架构方差**。这意味着,当不同论文报告 SAE 可解释性分数差异时,这些差异很可能源于评估流程的不同(例如提示词设计、评分模型选择、特征采样方式等),而非 SAE 结构本身的优劣。 ## 指标的稳定性差异 不同指标的稳定性表现各异:**detection 指标最为稳定**,在不同管线条件下结果波动较小;而 **fuzzing 指标在所有条件下均不可靠**,其分数几乎完全被管线噪声主导。simulation 和 purity 指标则处于中间状态。这一发现提醒研究者:并非所有可解释性指标都适合用于跨论文比较,选择不当可能导致误导性结论。 ## 掩盖的“假稳定性”风险 更值得警惕的是,研究还发现一个“假稳定性”陷阱:**top-k 特征排名在不同语料库和采样条件下并不一致**,但平均分数却可能保持稳定。这意味着即使论文报告的平均分数看起来可复现,单个特征的实际可解释性可能已发生剧烈变化。单纯监控解释文本的相似性(如 BERTScore)无法检测到这种失败模式。 ## 对 SAE 研究的影响 该发现直接关联到当前关于 SAE 实用性的争论。如果评估分数主要反映管线差异而非架构差异,那么基于这些分数的结论——例如“某种 SAE 架构更可解释”——可能站不住脚。在 AI 安全和对齐研究日益依赖 SAE 进行模型理解的背景下,不可靠的评估工具会拖慢整个领域的进展。 ## 贡献与建议 为改善现状,论文贡献了三项实用工具: - **方差分解方法**:帮助研究者量化评估管线中各环节的方差贡献; - **稳定性检查(Stability Check)**:快速判断分数是否对管线变化敏感; - **最低报告清单(Minimum Reporting Checklist)**:规范跨论文比较所需的关键实验细节。 ## 小结 这篇研究为 SAE 可解释性评估敲响了警钟。它呼吁领域内建立更标准化的评估协议,并提醒我们在解读自动可解释性分数时保持谨慎。对于致力于模型可解释性的研究者而言,**理解评估管线的方差来源** 或许比优化架构本身更为紧迫。

HuggingFace1个月前原文

## 研究背景与挑战 胎儿超声检查中,胼胝体(Corpus Callosum, CC)的准确定位对早期发现神经发育异常至关重要。然而,超声图像固有的低对比度、斑点噪声以及胼胝体显著的解剖变异,使得这一任务极具挑战性。传统深度学习方法依赖集中式数据训练,但在多中心临床场景中,数据隐私、通信开销和计算资源限制成为主要瓶颈。 ## FedCC 框架设计 针对上述问题,来自意大利多所机构的研究团队提出了 **FedCC**,一种基于联邦学习的低资源自适应框架。其核心创新在于: - **基础模型冻结 + 轻量检测头**:采用冻结的 **DINOv2** 作为视觉特征提取骨干,搭配基于 **YOLO** 的轻量检测头,既利用了大模型的强大表征能力,又避免了全模型微调的高昂成本。 - **低秩适配(LoRA)**:在骨干网络中引入 LoRA 模块,仅优化和交换少量参数(**约 2.9M**,仅为全微调 24.4M 的 11.8%),通信开销降低约 **8.5 倍**。 - **联邦平均(FedAvg)**:客户端在本地更新 LoRA 参数后,仅上传低维适配器至中心服务器聚合,无需共享原始数据。 ## 实验与结果 研究团队在 **3 个临床中心** 收集了来自 **58 名孕妇** 的 **10,970 帧** 超声图像,使用不同成像设备,模拟真实多中心环境。实验表明: - **FedCC 在联邦设置下性能强劲**:结合 DINOv2 与 LoRA 的 FedAvg 策略达到 **平均 mAP@50 为 0.857**,**F1 分数为 0.803**,优于全微调(0.841 mAP)和编码器冻结(0.812 mAP)基线。 - **资源效率显著**:可训练参数减少 **88%**,通信成本降低近一个数量级,适合低资源临床场景。 ## 行业意义与展望 FedCC 展示了 **联邦学习 + 基础模型适配** 在医疗影像领域的巨大潜力。其核心价值在于: 1. **隐私保护**:数据不出本地,符合医疗数据合规要求。 2. **多中心泛化**:通过联邦协作提升模型对异质设备和人群的鲁棒性。 3. **临床可部署性**:低计算和通信开销使得在资源受限的医院部署成为可能。 未来,该框架可扩展至其他胎儿解剖结构(如小脑、透明隔腔)的定位,并探索更高效的适配策略(如 Adapter、Prompt Tuning)。研究团队指出,下一步将开展前瞻性临床验证,以评估其在真实筛查流程中的实际效益。 ## 小结 FedCC 为胎儿神经超声的自动化分析提供了一条 **隐私友好、资源高效** 的技术路径,有望加速 AI 在产前诊断中的落地应用。其“冻结大模型 + 轻量适配”的设计思路,对医疗 AI 领域的其他低资源任务也具有重要参考价值。

HuggingFace1个月前原文

大语言模型(LLM)凭借数十亿参数在众多领域表现出色,但巨大的内存需求也限制了其在资源受限环境中的部署。模型压缩技术,尤其是奇异值分解(SVD),一直是解决这一问题的核心方法。然而,如何在压缩误差最小化与下游任务性能最大化之间取得平衡,仍是研究难点。近期,一篇发表于《IEEE Access》的研究提出了一种融合神经元重要性与数据感知低秩近似的创新压缩框架,并引入动态压缩率分配算法,在高压缩比下取得了显著效果。 **现有方法的局限** 传统SVD压缩主要从两个独立视角出发:一是基于参数重要性(如神经元贡献度)裁剪冗余权重;二是保持每层功能等价性,通过低秩近似减少矩阵维度。但这两类方法各有短板:重要性视角可能忽略层间交互效应,而功能等价视角则缺乏对具体数据分布的适应性。此外,以往的压缩率分配多采用均匀策略或依赖昂贵的启发式搜索,难以实现全局最优。 **融合策略:两全其美** 该研究首次将神经元重要性与数据感知低秩近似纳入统一目标函数。具体而言,算法首先通过前向传播计算每个神经元对最终输出的贡献度,作为重要性权重;然后在SVD分解过程中,结合输入数据的分布特征(即数据感知)对权重矩阵进行加权低秩近似。这种设计使得压缩过程能优先保留对任务关键的信息通道,同时自适应地调整各层的压缩强度。 **动态压缩率分配** 针对压缩率分配问题,研究团队提出了一种高效的动态分配算法。不同于传统方法的手动调参或穷举搜索,该算法利用梯度信息快速估算每层对整体损失的敏感度,并据此非均匀地分配压缩率。实验表明,在50%以上的高压缩比下,该方法的性能损失较均匀分配降低约30%,且计算开销仅为启发式搜索的千分之一。 **实验验证与行业意义** 在多个基准模型(如BERT、GPT-2)和下游任务(文本分类、问答)上的测试显示,该方法在同等压缩比下优于此前最先进的SVD压缩方案(如SVD-LLM、AdaSVD)。例如,在70%压缩率时,模型在GLUE基准上的准确率仅下降1.2%,而对比方法下降超过3%。 这一工作为LLM在边缘设备、移动端等资源受限场景的落地提供了新思路。随着模型规模持续膨胀,结合数据感知与重要性引导的压缩策略有望成为主流方向。未来,研究者可进一步探索该方法与量化、剪枝等其他压缩技术的协同效应。

HuggingFace1个月前原文

## 核心亮点 一项来自 arXiv 的新研究提出了 **E-SpecFormer**(Edge Spectrum monitoring Transformer),这是一种专为端到端自动调制识别和隐蔽信道(CC)识别设计的边缘高效 Transformer 模型。其核心创新在于 **LiTAN(Linear Tanh Attention Network)** 注意力机制,该机制去除了 Softmax 和 LayerNorm,在降低计算复杂度的同时提升了射频任务的准确率。 ## 模型架构与性能 E-SpecFormer 提供了四种可扩展的变体(**Nano、Small、Medium、Large**),以适应从微控制器到 FPGA 等不同的硬件约束。实验结果表明,最小的 Nano 变体在 **RadioML2018 数据集**上进行调制识别时,信噪比(SNR)>0 dB 条件下的平均准确率达到 **86.5%**;在基于硬件木马(HT)的隐蔽信道数据集上,准确率高达 **94.2%**。更令人印象深刻的是,该模型参数量不到 **10k**,在 FPGA/CPU 协同执行下每帧处理速度仅为 **92 微秒**,以极低的成本超越了现有的边缘端 SOTA 模型。 ## 技术细节与行业意义 LiTAN 的设计思路在于:传统 Transformer 中的 Softmax 操作会引入指数运算,在边缘设备上计算开销较大;而 LayerNorm 则增加了推理延迟。E-SpecFormer 通过线性 tanh 激活函数替代 Softmax,并移除 LayerNorm,使得模型在保持甚至提高精度的同时,显著减少了计算和存储需求。这对于资源受限的物联网(IoT)设备而言意义重大,因为实时频谱监测往往需要快速响应和低功耗。 ## 应用前景 E-SpecFormer 为 **实时频谱智能** 在 IoT 设备上的部署铺平了道路。例如,在认知无线电、无线安全监测和频谱管理等领域,该模型能够以极低的资源消耗实现高精度的信号分类。研究者已在 GitHub 上公开了代码,方便社区复现和进一步优化。 ## 小结 E-SpecFormer 证明了通过精心设计的轻量级注意力机制,Transformer 可以在边缘端高效运行。它的出现不仅推动了射频智能领域的发展,也为其他需要边缘推理的时序或信号处理任务提供了新的思路。

HuggingFace1个月前原文

## 校准的盲区:全局指标掩盖了局部危险 当AI模型高置信度地给出错误预测时,其危害往往远超普通错误。然而,传统校准评估通常只关注全局平均指标,这可能会掩盖局部区域的集中性高置信错误。近日,一篇题为《FALCON-Discover: Discovering Concentrated False-Confidence Regions for Calibration》的论文(arXiv:2607.18278)提出了一种新框架,旨在系统地发现这些危险区域。 ## 核心问题:高置信错误的“聚集”效应 论文将这种失败模式称为**假置信集中(False-Confidence Concentration)**,即错误预测中那些高置信度的样本往往聚集在预测空间的紧凑区域内。这些区域难以通过全局校准指标识别,但却是模型部署中最危险的隐患。 ## FALCON-Discover 框架:多维不一致性信号 为了检测这种集中性,研究者提出了**FALCON-Discover**——一个后处理、模型无关的框架。它利用四个维度的**不一致性信号**对预测进行排序: 1. **置信度**:模型输出的概率值本身。 2. **局部支持**:样本周围训练数据的密度。 3. **邻域一致性**:近邻样本的预测是否一致。 4. **扰动稳定性**:输入微小扰动下预测是否变化。 ## 实验验证:集中模式普遍存在,但依赖情境 在**7个二分类表格数据集**上,使用XGBoost和CatBoost等强学习器,并通过4个随机种子和5折交叉拟合进行验证,结果发现: - **假置信集中现象普遍存在**,但具体模式随数据集和阈值变化。 - 在主要置信阈值下,基于不一致性信号的排序方法在**最强集中情境**中显著优于最佳验证集校准或信任评分基线。而原始置信度几乎无法捕获危险错误。 - **最佳检测器因数据集而异**:当需要组合多个线索时,学习到的不一致性信号最强;当局部决策脆弱性主导时,基于稳定性的排序表现最佳。 ## 启示:从校准到发现 论文结论指出,危险的过度置信更适合作为“家族级发现问题”而非“单分数校准问题”。这启示未来的校准策略应**明确瞄准那些置信度、支持度和稳定性相背离的区域**,而非仅优化全局指标。 ## 行业意义 随着AI在医疗、金融、自动驾驶等高风险领域的应用加深,局部高置信错误可能带来灾难性后果。FALCON-Discover提供了一种可操作的诊断工具,帮助开发者识别模型脆弱点,从而设计更有针对性的安全措施。 论文作者来自澳大利亚悉尼科技大学等单位,目前论文已在arXiv上公开,并提供了PDF和HTML版本。

HuggingFace1个月前原文

贝叶斯优化(Bayesian Optimization)是处理昂贵黑箱优化问题的常用方法,但它的表现很大程度上取决于所选核函数是否匹配目标函数的未知结构。传统的核函数(如RBF或Matérn)通常假设固定的平滑性,难以同时捕捉光滑趋势和陡峭突变。 近日,黄伟波与华程在提交至arXiv的论文中提出了**ALAS(Additive Learnable Alpha-Stable Kernels)**,一种基于对称α-稳定谱成分构建的灵活高斯过程核家族。其核心创新在于**通过学习稳定参数α,让核函数能自适应地调整有效平滑性**,从而从数据中同时捕捉光滑趋势和尖锐不规则性。 论文给出了两种参数化方案: - **ALAS**:单稳态成分,通过联合谱调制实现整体自适应; - **ALAS-Sep**:可分离变体,为每个维度学习独立的尾部行为,对近似可分解的目标函数更具鲁棒性。 在标准基准测试和真实世界代理模型上的实验表明,ALAS系列核在多种设置下均表现出**强劲且稳定的性能**。 ### 技术背景与意义 贝叶斯优化的核心是高斯过程代理模型,核函数决定了模型对函数平滑性的假设。传统核(如RBF)对应固定平滑度,而实际目标函数往往在不同区域具有不同平滑特性。ALAS通过将核函数表示为α-稳定分布的谱混合,α值控制尾部厚度:α=2时退化为高斯核(光滑),α<1时呈现重尾特性(允许突变)。这种可学习性使得ALAS能自动权衡偏差与方差。 ### 实验亮点 在多个合成函数和实际工程优化任务中,ALAS和ALAS-Sep均优于固定核方法(如RBF、Matérn5/2)以及自适应核方法(如SM-AGP)。特别是在含有不连续或突变区域的函数优化上,ALAS的收敛速度和最终解的质量均有显著提升。 ### 总结 ALAS为贝叶斯优化提供了一种灵活、自适应的核选择机制,降低了用户对先验知识的依赖。未来可进一步探索其在高维优化、多任务学习等场景的应用。

HuggingFace1个月前原文

公交信号优先(TSP)需要在多个相互竞争的目标之间取得平衡:减少公交延误的同时,限制对非公交交通的不利影响,并避免部分车辆出现极端等待。现有的基于强化学习(RL)的TSP方法通常编码公交感知特征(如载客量和时刻表偏差),但优化的是固定奖励或固定标量化,这限制了当机构优先级随一天中的时间或中断条件变化时的操作灵活性。 本研究提出了一种**偏好条件化TSP控制器**(π(a|s,w)),它能在最小/最大绿灯时间和过渡可行性约束下选择下一个信号相位,并可通过运行时偏好参数w进行调优,以权衡公交优先重点与整体交通延误,而无需重新训练。该控制器基于IntersectionZoo实现,引入了约束信号控制/TSP封装,并通过公交普及增强和基于时刻表的公交插入扩展了场景生成,以解决训练期间稀疏的公交优先事件。 实验对比了固定时间控制、基于规则的TSP覆盖和固定权重的PPO专家系统。结果表明,单个学习到的条件化策略在运行时偏好范围内形成了平滑的经验权衡前沿,**优于固定时间和基于规则的基线**,并保持了约束可行性。尾端延误诊断显示,**非公交外部性在中等偏好设置下仍然有限**,但在高公交优先权重下会显著增加。该研究已被第29届IEEE国际智能交通系统会议(ITSC 2026)接收,代码已开源。

HuggingFace1个月前原文

时间序列分类模型在部署时常常面临一个关键问题:模型输出的置信度分数是否真正反映了预测的可靠性?传统的事后校准方法通常只对输出分数进行重新映射,却忽略了输入信号本身的结构信息。一篇发表于 arXiv 的新论文《Beyond Output-Space Calibration: Spectral Evidence Bundling for Selective Reliability Estimation in Time-Series Classification》提出了一种名为 **频谱证据捆绑(Spectral Evidence Bundling)** 的方法,通过结合输出置信度与输入信号的频谱特征,更准确地估计模型预测的可靠性。 ### 三大可靠性缺口 研究者指出了当前时间序列分类可靠性估计的三个主要缺陷: 1. **相同置信度,不同支撑**:两个预测可能输出相同的置信度分数,但一个基于清晰的时间模式,另一个则来自噪声或异常信号,传统校准无法区分。 2. **平均校准掩盖高风险错误**:整体校准误差低并不意味着没有高置信度的错误预测,这类错误在关键应用中可能造成严重后果。 3. **输出空间校准缺乏输入可审计性**:仅对输出分数校准,无法追溯预测是否真正由输入信号中的有效特征支持。 ### 方法:频谱证据捆绑 + 验证门控 论文提出一种 **固定标签可靠性策略**:保持模型原始预测不变,但额外估计该预测是否可信。具体做法是: - **频谱描述符提取**:从整个时间序列样本中提取多维度频谱特征,包括**频带能量**、**谱熵**、**峰值主导度**、**周期支撑**和**相位稳定性**,形成一组“频谱证据”。 - **捆绑输出与频谱信息**:将输出置信度与频谱描述符合并,生成一个标量可靠性估计值,同时提供频带级别的诊断证据。 - **验证门控**:设置一个验证阶段,仅当频谱条件能提升正确性排名且不违反 **FalseConf@0.9**(高置信度错误率)或 **AURC**(风险覆盖曲线下面积)容忍度时,才启用频谱捆绑;否则回退到更安全的输出空间基线方法。 ### 实验表现 在 **8 个 UCR/UEA 数据集**、**8 种时间序列骨干网络**(如 ResNet、LSTM、Transformer 等)以及多种标准校准器上进行的实验表明: - **无约束的频谱捆绑方法**在匹配评估子集上,将 **Corr-AURC**(正确性排序风险覆盖)从 0.693 提升至 0.779。 - **验证门控策略**进一步将 Corr-AURC 提升至 **0.786**,并将 FalseConf@0.9 降低至 **0.094**,显著减少了高置信度错误。 ### 行业意义 这项研究为时间序列分类的可靠性估计提供了新思路。在医疗诊断、金融预测、工业监控等高风险场景中,模型不仅需要做出预测,更需要知道何时该信任自己、何时应请求人工复核。频谱证据捆绑方法通过引入输入信号的物理结构信息,弥补了纯输出校准的盲区,而验证门控机制则防止了过度依赖频谱特征的潜在风险。 论文作者来自悉尼科技大学,研究代码已公开,为后续在时间序列可靠性领域的探索奠定了基础。

HuggingFace1个月前原文

大语言模型(LLM)的压缩通常依赖静态参数剪枝或动态令牌级计算,但过度稀疏化会导致性能急剧下降。最新研究提出了一种**复合稀疏性框架**,通过结合低秩近似、通道剪枝与逐令牌动态层跳过,将压缩负担分散到多个维度,从而延缓性能衰减。 ## 研究背景与动机 现有LLM压缩方法主要分为两类:静态压缩(如参数剪枝、低秩近似)和动态压缩(如条件计算、令牌级层跳过)。然而,单一维度的稀疏化在达到某个临界点后,性能会迅速恶化。研究者猜想,**将两种机制结合**可能通过分担压缩压力来推迟这一衰减点。 ## 复合稀疏性框架 该框架分两步实施: 1. **静态压缩**:先通过低秩近似和通道剪枝获得一个静态压缩的骨干网络。 2. **动态压缩**:引入轻量级路由器,为每个令牌动态决定是否跳过某些层。 这种设计使得参数稀疏性和令牌级计算稀疏性可以**独立控制**,从而探索更优的压缩组合。 ## 实验结果 在语言理解和建模基准测试中,复合稀疏性在**相同总稀疏度**下始终优于单一机制压缩: - 在理解任务上,性能衰减点明显推迟。 - 在建模任务上,保持了更强的性能。 进一步分析揭示: - **跨维度干扰**:参数剪枝与令牌跳过之间存在相互影响。 - **最优分配**:在固定稀疏预算下,**接近平衡的分配**最为有效。 ## 结论与意义 这项工作证明了复合压缩是提升LLM压缩效率的实用路径,同时揭示了更广泛的**跨维度稀疏性边界**,该边界最终限制了进一步压缩的可能性。代码将在论文链接中开源。

HuggingFace1个月前原文

在文档理解任务中,如何从众多OCR引擎和多模态大语言模型(MLLM)中选出最合适的工具,一直是个难题,尤其是当标注数据稀缺时。近日,一篇发表于arXiv的论文提出了**DocOCR-Eval**,一种无需真实标注的评估框架,通过“校正与排序”策略自动评估OCR工具性能,为文档解析系统的部署提供了实用指南。 ## 背景与挑战 文档解析是视觉问答、关键信息提取等任务的基础,它把非结构化的扫描图像转化为包含文本、视觉和布局信息的结构化表示。当前,虽然OCR引擎和MLLM层出不穷,但如何针对特定文档集合选择最优方案仍缺乏系统方法。传统做法依赖人工标注来评估工具,成本高且难以规模化。此外,许多OCR引擎在上下文推理方面能力有限,而MLLM虽有潜力,但评估其文本识别性能同样需要标注数据。 ## DocOCR-Eval 的核心思路 DocOCR-Eval 的核心创新在于**无需人工标注**即可近似真实标注下的工具排序。其流程分为三个阶段: 1. **候选工具生成**:使用多个OCR引擎和MLLM对文档进行初步识别,得到多个识别结果。 2. **校正阶段**:利用一个或多个MLLM对识别结果进行校正,即对比原始图像与识别文本,输出修正后的文本。校正过程相当于提供了一种自动化的“近似真实值”。 3. **排序与选择**:基于校正后的文本与原始识别结果的差异(如编辑距离),对工具进行排序。差异越小,说明该工具性能越优。 实验表明,**聚合多个MLLM的校正结果可以逐步提升与真实标注排序的一致性**。这意味着,即使没有人工标注,DocOCR-Eval 也能可靠地识别出最适合当前文档集的OCR工具。 ## 实验验证与意义 研究者在多个跨领域、跨语言的扫描文档基准上进行了系统评估,涵盖不同类型OCR引擎和当前最先进的MLLM。结果显示,DocOCR-Eval 在标注稀缺的实际场景中能够实现可靠的工具选择,其排序与基于真实标注的排序高度相关。 这项工作的意义在于: - **降低评估门槛**:用户无需耗费大量人力进行标注,即可快速为特定文档集选择最优OCR方案。 - **提升部署效率**:对于企业级文档处理系统,DocOCR-Eval 提供了一种自动化的工具选型流程,减少试错成本。 - **推动研究进展**:为OCR和MLLM的对比研究提供了可扩展的评估范式,尤其适用于新模型快速迭代的场景。 ## 总结与展望 DocOCR-Eval 提出了一种实用且创新的框架,解决了OCR工具选择中的“无标注”困境。未来,该框架可能进一步扩展到其他文档理解任务(如布局分析、表格识别),并探索更高效的校正聚合策略。对于AI从业者而言,这无疑是一个值得关注的方向,尤其是在需要快速部署文档解析系统的实际业务中。

HuggingFace1个月前原文

## 快讯:ARGO智能眼镜——边缘AI的里程碑 近日,一项发表在arXiv上的研究介绍了ARGO,一个集成了多传感器、完全在设备端运行机器学习的智能眼镜平台。该平台由EssilorLuxottica与米兰理工大学联合研发,旨在解决智能可穿戴设备在舒适性、计算性能与能效之间的平衡难题。 ### 核心突破:本地化AI处理 ARGO的核心创新在于使用**STM32N6微控制器**及其集成的**神经处理单元(NPU)**,实现了完全本地化的机器学习推理。这意味着所有数据——包括视觉、音频和传感器信息——都在眼镜上处理,无需依赖云端。这不仅将延迟降至最低,更重要的是**保障了用户隐私**,因为敏感数据不会离开设备。 ### 硬件与算法的协同设计 研究团队采用了硬件-固件-人工智能的协同设计方法。他们部署了一个经过优化的**YOLOv11模型**用于实时城市障碍物识别。为了适配NPU架构,团队提出了**头级并行注意力(HPA)**机制,这是一种架构优化,使得注意力机制能够在加速器上高效执行,同时保持原始计算逻辑。 模型在专门收集的**WOTR(Walking On The Road)数据集**上训练,最终在严格的内存限制下实现了**mAP50-95为24**(平均精度均值),而模型大小仅为**2.483 MB**。 ### 多模态传感器与续航表现 ARGO配备了一套完整的传感器组合: - **RGB摄像头**:用于视觉识别 - **飞行时间(ToF)传感器**:用于深度感知 - **麦克风**:用于音频输入 - **环境传感器**:监测光照、温度等 在200毫安时电池供电下,眼镜能以**10 FPS**的帧率连续运行约**113分钟**,展示了高效的能耗管理。 ### 行业意义与未来展望 ARGO的成果表明,高性能、隐私保护且社会可接受的辅助设备是可行的。它特别适合视障人士导航、工业巡检、增强现实等场景。随着边缘AI芯片的进步,这种**高度集成、多学科协同设计**的方法将成为未来智能可穿戴设备的主流。 研究者强调,ARGO不仅是一个原型,更代表了一种范式转变:将AI能力从云端下沉到终端,在保护隐私的同时实现实时响应。

HuggingFace1个月前原文

## 从“拍脑袋”到数据驱动:张量核测试的容差校准新思路 在深度学习模型的开发与部署中,**张量核(Tensor Kernel)**的正确性测试是保障模型可靠性的关键一环。然而,当前主流做法是使用固定的“all close”检查,搭配人工指定的绝对和相对容差(atol/rtol)。这些阈值往往在不同测试间直接复制,很少根据实际算子行为进行动态调整。 近日,一篇 arXiv 论文(arXiv:2607.16228)提出了一种**算子感知的混合精度容差校准方法**,通过挖掘大规模云 GPU 运行数据,为每个测试用例自动确定更合理的容差阈值。 ### 核心发现:手工容差过于宽松 研究团队基于 **gpuemu 语料库**中的 26 个测试条目和 2 种数据类型,收集了累计 8,076 行结果数据。他们分析每个测试用例的元素级误差分布,并提出一个关键问题:**在正确实现下,内核本身能证明多大的绝对容差?** 答案令人惊讶:**自动校准的容差比手工设定的要严格得多**。例如,`attention_triton` 在 fp16 精度下的容差可收紧 **2,184 倍**。这意味着很多原本通过测试的代码可能实际上存在细微错误。 ### 实战效果:Bug 检测率提升 9.3 个百分点 为了验证方法的实用性,论文聚焦于语料库中 **7 个 LLM 风格的错误变体**(每个都有对应的正确实现)。使用校准后的 per-(op, dtype) 容差,**Bug 检测召回率从 73.2%(1,805/2,467)提升至 82.4%(2,034/2,467)**,绝对提升了 9.3 个百分点,多检测出 **229 个新错误**。 副作用是**误报率略有上升**:在 1,882 个正确控制案例中,误报从 0 增加到 20 个(+1.1 个百分点)。但考虑到检测收益,这一权衡是值得的。 ### 行业意义:通向更可靠的 AI 基础设施 这项工作对 AI 工程化实践有直接启示: - **告别“一刀切”**:不同算子、不同数据类型有独特的误差分布,统一容差会掩盖真实问题。 - **数据驱动校准**:利用云 GPU 运行积累的误差数据,可以自动生成更精准的测试标准。 - **LLM 场景尤其受益**:大型语言模型依赖大量张量运算,更严格的测试有助于提前发现数值不稳定或实现错误。 该方法已作为 8 页短文以 LNCS 格式发表,并有一系列配套论文(如 arXiv:2606.20128)进一步探讨相关主题。 ### 小结 这项研究提醒我们,在快速迭代的 AI 框架和硬件中,**测试本身也需要持续优化**。算子感知的容差校准不仅提升了测试的敏感性,也为混合精度训练和推理的可靠性提供了新工具。未来,随着更多 GPU 运行数据的积累,这种数据驱动的方法有望成为行业标准。

HuggingFace1个月前原文

现代神经网络能够拟合被破坏的训练标签,这使得噪声标签学习成为研究记忆驱动过拟合的有用场景。大多数正则化方法修改目标函数、架构或数据分布;而本文研究了一种对优化器更新本身的几何干预。我们评估了 OrthoGrad,该方法移除每个权重梯度中平行于当前权重向量的分量,并在噪声标签图像分类中进行测试。在 MNIST 小数据场景下,OrthoGrad 对 CNN 的测试准确率提升最为明显,同时减少了对损坏标签的拟合。基于权重范数和梯度-权重余弦相似度的机制诊断表明,当原始梯度包含显著的径向分量时,该投影效果最强;而在大数据场景下,梯度已经几乎与权重正交,效果减弱。额外的 CIFAR-10 ResNet-18 实验显示,该方法可以改变记忆轨迹,但无法完全阻止最终的噪声标签记忆。这些结果支持正交更新约束作为研究学习动态的有用诊断工具,同时表明 OrthoGrad 的效果具有场景依赖性,而非普遍正则化。 本文已被 ICML HiLD 2026 研讨会(首尔)接收。

HuggingFace1个月前原文