SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

联邦学习(FL)中,标签分布倾斜(label skew)是导致客户端漂移(client drift)和全局模型准确率下降的顽疾。合成数据增强是一种有效的缓解手段,但若追求完全的类平衡,其计算成本往往高得难以承受。来自韩国研究团队的最新论文提出 **FedEAS**(Federated Entropy-Adaptive Synthesis),巧用“预算”思维,在近乎不增加额外开销的前提下,显著提升了模型性能。 ## 核心问题:合成数据该“给谁用”和“用多少”? 传统方法要么对所有客户端一视同仁地分配生成预算(Uniform allocation),要么不顾成本地追求全局类平衡。前者无视了不同客户端本地分布差异,后者则因高昂的计算代价而不具备实际部署可行性。FedEAS 的切入点非常直接:**预算必须根据每个客户端的本地标签分布动态调整**,并且要同时回答两个问题——生成多少(how much)以及生成的样本送往哪里(where)。 ## FedEAS 机制:熵自适应预算与生成位置决策 FedEAS 的核心是一个 **熵自适应(entropy-adaptive)的每类生成预算** 计算策略。具体来说,系统根据每个客户端本地标签分布的熵值,为每个类别分配一个生成预算。分布越不平衡(熵越低),该客户端获得的生成预算就越高,从而有针对性地补足稀缺类别。同时,生成的合成样本并非“自产自销”,而是根据全局需求被分配到最需要它们的客户端(或保留在本地)。这种“生成+分发”的双重决策机制,使得总生成预算不再是一个预先设定的固定值,而是由所有客户端的预算之和自然确定。 ## 实验结果:94.1% 的预算削减与 18.82% 的性能提升 在 CIFAR-10 和 CIFAR-100 数据集上的实验表明,FedEAS 能够恢复完全类平衡带来的绝大部分准确率增益,同时将生成预算削减了 **94.1%**。换言之,它用不到 6% 的计算成本,就实现了接近最优的效果。与统一预算分配相比,在相同总预算下,FedEAS 的性能提升最高达 **18.82%**。这一结果充分说明了“把钱花在刀刃上”的重要性——不是生成更多的数据,而是生成对的地方、对的数量。 ## 行业启示:效率优先的联邦增强新范式 FedEAS 的提出,为联邦学习中数据增强的实用化提供了新思路。在现实场景中,客户端(如手机、医院)的计算和存储资源往往有限,不可能承担大规模合成数据生成。FedEAS 的预算感知机制,使得资源可以精准投放到最需要的数据类别上,尤其适用于医疗影像、金融风控等标签分布天然倾斜的领域。未来,结合更先进的生成模型(如扩散模型),这一框架有望进一步降低合成成本,推动联邦学习走向更广泛的落地应用。

HuggingFace1个月前原文

## 高效建模新突破:STAGformer 如何用线性复杂度解决共享单车需求预测难题? 共享单车系统的运营效率高度依赖于精准的站点级需求预测。然而,城市网络规模庞大,时空依赖关系复杂,传统模型往往难以兼顾精度与计算效率。近日,一篇发表于 arXiv 的论文提出了 **STAGformer(Spatio-Temporal Agent Graph Transformer)**,通过创新的**智能体注意力机制**,将标准自注意力的二次复杂度降至 **O(NT)** 线性级别,为大规模时空预测开辟了新路径。 ### 核心创新:两步式智能体注意力 STAGformer 的核心在于其**两步式智能体注意力机制**。模型引入少量可学习的**空间智能体令牌**和**时间智能体令牌**,首先由这些智能体从所有站点和时间步中聚合全局信息,再将其广播回各个站点和时间步。这一设计有效捕捉了长距离交互,同时避免了标准 Transformer 中随节点数平方增长的计算开销。 ### 四大模块协同工作 STAGformer 由四个核心模块构成: - **时空编码器**:融合动态节点特征与外部上下文因素(如天气、时间、兴趣点); - **图传播模块**:用于空间邻居聚合,捕捉局部空间相关性; - **时间卷积模块**:提取局部时间模式; - **智能体注意力模块**:负责全局依赖建模,是模型性能的关键。 ### 实验表现:全面超越基线 研究团队在 **纽约 Citi-Bike** 和 **芝加哥 Divvy-Bike** 两个真实数据集上进行了广泛实验。结果显示,STAGformer 在多个预测时长(如 15 分钟、30 分钟、1 小时等)上,均以显著优势超越了当前最先进的基线模型,在 **RMSE** 和 **MAE** 两项指标上均取得最优。消融研究进一步验证了每个组件的贡献,其中智能体注意力机制被证实是捕捉全局时空依赖的关键。 ### 行业意义与展望 随着城市微出行(如共享单车、电动滑板车)的普及,精准的需求预测对车辆调度、站点管理及用户体验优化至关重要。STAGformer 提供了一种**兼顾效率与精度**的解决方案,其线性复杂度使其具备部署于大规模城市网络的潜力。未来,该框架有望推广至其他时空预测任务,如交通流量预测、人群密度估计等,推动智能交通系统向更高效、更智能的方向发展。

HuggingFace1个月前原文

## 当运动数据遇上大模型:Inertia-1 开启可穿戴AI新篇章 可穿戴设备(如智能手表、健身手环)每天都在产生海量的运动数据,这些数据能否像文本、图像一样,训练出通用的“基础模型”?来自加州大学洛杉矶分校等机构的研究团队近期发布了 **Inertia-1**,一项针对可穿戴运动传感数据基础模型的系统性开源探索。 ### 数据规模:1800万小时的加速度计数据 研究团队构建了包含 **超过1820万小时** 的全球来源加速度计数据语料库。这相当于一个人连续佩戴设备超过2000年才能产生的数据量。如此庞大的规模,为研究预训练和缩放规律提供了坚实基础。 ### 系统化研究框架 不同于以往仅聚焦单一设计选择(如传感器位置或采样频率)的工作,Inertia-1 构建了一个 **全生命周期控制框架**,涵盖三大维度: - **数据选择**:传感器模态、设备佩戴位置、采样率、窗口长度等。 - **模型选择**:不同架构(如Transformer、CNN)和模型尺寸。 - **训练选择**:预训练目标、数据规模等。 ### 跨任务评估:从活动识别到疾病预测 研究在 **15个数据集** 上进行了广泛评估,覆盖三类典型下游任务: - **人体活动识别**:如走路、跑步、上下楼等。 - **步态冻结检测**:用于帕金森病患者的运动障碍监测。 - **疾病预测**:通过运动模式推断健康状况。 结果揭示了构建泛化性运动基础模型的关键因素,例如: > 使用多位置数据预训练能显著提升模型在不同佩戴场景下的表现; > 更大模型尺寸在足够数据支持下持续带来收益,但存在边际递减。 ### 开源“菜谱”:加速可穿戴AI落地 Inertia-1 不仅提供了 **当前最优的配方**(state-of-the-art recipes),更被设计为一本 **实用、开放的可穿戴运动表征学习指南**(cookbook)。所有代码、模型和实验配置均开源,旨在降低该领域的研究门槛。 ### 意义与展望 可穿戴运动传感数据具有连续、低成本、高生态效度等优势,非常适合作为基础模型的训练原料。Inertia-1 的工作填补了该领域系统性研究的空白,为后续研究提供了: - 可复现的基线 - 数据与模型缩放的经验规律 - 跨任务迁移的可行路径 未来,随着更多传感器(如心率、皮肤电活动)的融合,可穿戴基础模型有望在 **个性化健康管理、老年照护、运动科学** 等领域发挥更大作用。 --- > 论文链接:arXiv:2607.06617

HuggingFace1个月前原文

大型语言模型(LLM)的推理成本一直是部署中的核心挑战。业界已探索多种条件计算技术来解耦模型质量与每token推理成本,但现有方法大多各自为政:混合专家(MoE)稀疏化前馈网络,混合深度(MoD)跳过整个Transformer块,KV缓存量化压缩注意力内存。然而,这些决策实际上高度耦合——一个需要全注意力的罕见token,很可能也需要高精度缓存,无论由哪个专家处理。 近期一篇论文提出 **TriRoute**,一个轻量级统一控制器,为每个token的每一层联合输出三项决策:注意力模式(跳过/局部/全局)、稀疏专家集合(含空专家以恢复MoD功能)以及KV缓存位宽。该控制器通过异构松弛技术(Gumbel-Softmax结合直通估计处理分类决策,负载均衡top-k门控处理专家选择)进行端到端训练,并引入拉格朗日预算约束,将平均计算和内存成本转化为可控旋钮。 研究团队发现,朴素联合训练会导致跨轴路由崩溃级联——某一轴的崩塌会传播至其他轴。为此,他们提出 **每轴归一化** 和 **耦合感知平衡损失** 加以解决。在160M至1.3B参数的解码器模型上,TriRoute在匹配推理FLOPs和内存的条件下,**帕累托优于** 独立MoD+MoE+KV量化组合的最佳效果,同时在罕见实体、代码和算术等尾部案例上展现出更强的鲁棒性。 后验分析揭示了可解释的结构:控制器倾向于为句子起始位置、罕见子词和命名实体分配全注意力与高精度缓存,而对功能词则采用廉价路由。这一工作为LLM推理优化提供了新视角:**联合决策比孤立优化更有效**,有望推动更高效、更智能的模型部署方案。

HuggingFace1个月前原文

共形预测(Conformal Prediction)正被引入药物发现领域,以提供模型可靠性的量化保证:设定错误率α,该方法返回的预测集以至少1-α的概率包含真实标签。然而,一项新研究揭示了这一保证在不平衡数据集上的潜在危险。 来自Champions College Prep的研究团队在arXiv预印本(2607.06605)中指出,标准(边际)共形预测在四个真实药物发现数据集上实现了全局90%的覆盖率目标,但对少数类的覆盖严重不足。例如,在血脑屏障穿透数据集中,少数类覆盖率仅64.8%;而在临床试验毒性数据集中,这一数字骤降至4.2%,几乎完全忽略了罕见类别。 这种失败并非特定模型所致:随机森林、图神经网络和冻结化学语言模型均复现了该现象(p<0.001),且严重程度与模型在罕见标签上的基线校准相关,而非架构差异。研究团队通过守恒恒等式解释了这一效应:少数类的覆盖缺口等于多数类的覆盖盈余乘以不平衡比率,该公式预测的差距与实际测量值误差在1个百分点以内,并能跨数据集排序严重程度。 值得注意的是,这种失败在现实场景中极易被忽视:聚合准确率和总体覆盖率保持高位,但少数类却被系统性地遗漏。即便采用真实的骨架划分和第二种共形评分,问题依然存在。 作为解决方案,研究团队提出采用类别条件(Mondrian)共形预测,该方法在每个数据集上均恢复了目标覆盖率,仅以预测集大小适度增加为代价。进一步分析将失败定位到通用分子骨架(如苯和吡啶核心),并提出了单数值诊断指标。通过成本模型模拟,研究者表明,对受影响化合物进行弃权(abstention)可将筛选活动从净负效用转为净正效用。 该研究的核心贡献在于:用真实化学数据证明了已知的共形理论缺口在不平衡数据下变得多么严重且隐蔽,并为药物发现中的可靠虚拟筛选提供了实用修复方案。对于AI驱动的药物研发而言,这项工作敲响了警钟:仅仅追求全局指标可能会掩盖关键少数类别的性能崩溃,而类别条件共形预测或将成为标准实践的必要补充。

HuggingFace1个月前原文

## 当时间序列预测遭遇“体制切换”:NEST 的解题思路 在金融、气象、网络运维等复杂系统中,长期预测的准确性经常被**数据集级别的分布漂移**(dataset-level distribution shift)所困扰。这种漂移并非简单的局部时序变化,而是源于系统内部多种潜在行为模式(即“体制”)的切换与组合。例如,网络流量可能在工作日、节假日、攻击事件下呈现截然不同的特征;物理系统的动力学状态也会随外部条件发生结构性改变。 现有方法大多聚焦于局部的时序偏移,例如通过自适应归一化或在线学习应对短期波动,却忽视了更根本的挑战:一个数据集本身可能就是多个不同“体制”的复合体。正因如此,当模型面对未曾见过的体制组合时,泛化能力急剧下降。 针对这一痛点,来自北航等机构的团队在最新论文中提出了 **NEST(Regime-Oriented Mixture-of-Experts)** 框架。其核心思想是:**先识别出数据中的不同“体制”,再让专门的专家模块学习每个体制的独特动态,最后通过路由机制将专家输出重组为全局预测。** ### 两阶段 MoE 架构:先分后合 NEST 采用了一种**两阶段密集混合专家(dense MoE)** 架构。第一阶段是**结构专业化**:通过无监督聚类,在精心设计的**矩-熵空间**(moment-entropy space)中将数据集划分为若干不同的运行体制。这个空间能够捕捉时间序列的高阶统计特征与信息复杂度,比直接在原始时序上聚类更具区分力。 第二阶段是**专家路由与调制**。NEST 引入了一个**体制导向路由器**:它首先根据输入序列的时序内容生成初始专家权重,再通过**几何调制**(geometric modulation)将这些权重向体制质心(regime centroids)靠拢。这样一来,路由器不仅能感知当前输入属于哪个体制,还能利用体制质心作为先验知识,增强路由的鲁棒性。 值得注意的是,NEST 中的每个专家并非一个黑盒预测器,而是充当**专用核函数**:它们通过演化出独特的变量注意力模式(variate-attention patterns),来捕捉对应体制下的变量间依赖关系。例如,在网络流量中,一个专家可能专门学习“突发流量”下的端口关联,而另一个专家则学习“平稳期”的周期性模式。 ### 实验表现与行业意义 论文在异构网络流量、物理现象等多个基准上进行了评估,结果显示 NEST 持续取得**最先进(SOTA)** 的性能。特别是在长期预测任务中,其对体制切换的显式建模带来了显著的提升。 这项工作的意义不仅在于一个更优的预测模型,更在于它为处理“数据集级分布漂移”提供了一种全新的视角。在 AI 落地过程中,真实世界的数据往往由多个隐含状态混合而成——比如自动驾驶中的不同路况、工业传感器中的不同工况。NEST 的“先识别体制、再分而治之”的思路,有望成为这类问题的一个通用范式。 目前,NEST 的代码和数据集已开源,感兴趣的读者可以前往 arXiv 获取更多细节。

HuggingFace1个月前原文

扩散模型在图像生成领域已大放异彩,但一个长期存在的痛点始终困扰着研究者与实践者:**如何在减少采样步数(low-NFE)的同时,保留高频纹理细节?** 传统的“学生-教师”回归框架试图让低步数学生采样器模仿高步数教师,结果往往是保留了全局结构,却丢失了细腻纹理,生成结果“看起来像,但经不起细看”。 来自韩国首尔大学的研究团队在 ECCV 2026 论文中提出了 **D2PO(Dynamic Direct Preference Optimization)**,将采样器优化问题重新定义为偏好对齐问题,而非简单的模仿学习。核心思路是:**与其让学生“复制”教师,不如让学生学会判断“哪种采样结果更好”。** ### 从模仿到偏好:D2PO 的三大创新 1. **能量基模型(EBM)视角**:D2PO 将扩散采样策略建模为一种能量基模型,使得偏好比较可以转化为可计算的能量差异。这意味着模型不再需要显式的“正确答案”,而是通过对比不同采样结果的能量高低来学习。 2. **源自预训练分数网络的能量函数**:研究团队从预训练扩散模型的分数网络中直接推导出新的能量公式,从而在扰动空间中同时评估结构一致性与细粒度细节。这使得偏好评估更贴近人类感知。 3. **动态偏好机制**:这是 D2PO 的精髓所在。传统方法依赖固定的教师模型,而 D2PO 中的“偏好样本”会随着采样策略的改进而动态更新。这种自我改进机制让模型在迭代中不断获得更强的对齐信号,而非被静态教师限制上限。 ### 实验验证:低步数下全面超越 论文在多个数据集和采样器配置下进行了实验,结果显示: - 在 **NFE=4** 等极低步数设定下,D2PO 生成的图像在感知质量指标(如 FID、CLIP score)上显著优于传统回归方法。 - 尤其在高频纹理保留方面,D2PO 能够恢复出更锐利的边缘和更自然的细节,而传统方法则容易产生模糊或伪影。 - 动态偏好机制带来的增益是持续的——随着训练进行,偏好样本质量提升,模型性能也同步增长,没有出现饱和或退化。 ### 行业意义:让扩散模型更“实用” 对于 AI 生成内容(AIGC)的落地应用而言,低步数采样意味着更快的推理速度和更低的计算成本。D2PO 提出的偏好对齐思路,打破了“低步数 = 低质量”的固有印象。未来,动态偏好机制或许还能推广到其他生成模型的蒸馏与优化中,成为提升效率与质量平衡的通用范式。 当然,D2PO 目前仍依赖于预训练分数网络,且动态偏好的稳定性需要更多理论分析。但无论如何,这项研究为扩散模型采样器的优化开辟了一条新路:**与其模仿,不如学会偏好。**

HuggingFace1个月前原文

金融投资组合优化本质上是一个多目标决策问题,需要在收益、风险、市场动态和实际约束之间寻求平衡。传统基于可靠性的方法多依赖静态优化框架,难以捕捉序列决策、尾部风险以及交易成本等市场摩擦。针对这一局限,一篇发表于arXiv的最新论文提出了**MORP-DRL**——一种基于深度强化学习的多目标可靠性投资组合优化框架。 ## 核心创新:三管齐下的风险度量 MORP-DRL同时优化期望收益和下行风险,并引入三种互补的风险指标: - **方差**:度量整体波动性 - **条件风险价值(CVaR)**:关注极端损失的平均水平 - **熵风险价值(EVaR)**:基于尾部概率的熵度量,对厚尾分布更敏感 这种设计使模型能够更全面地评估风险,尤其是在市场剧烈波动时。 ## 建模与算法:应对市场复杂性 为了刻画市场的不确定性和厚尾行为,资产收益采用**GARCH(1,1)**、**极值理论**以及**t-copula**依赖结构进行建模,并通过拟蒙特卡洛模拟生成逼真的市场情景。算法层面,研究团队选用**近端策略优化(PPO)**作为强化学习基础,同时纳入了交易成本和投资组合权重上下限等实际约束,并与经典多目标进化算法**NSGA-II**进行对比。 ## 实验验证:穿越市场周期 实验覆盖了全球十个股票指数,时间跨度包含**疫情前、疫情期间和疫情后**三种市场状态。结果显示,MORP-DRL在风险-收益表现上具有竞争力,在市场压力时期能有效降低下行风险,并且具备扩展到高维投资组合的能力。 ## 行业视角:强化学习赋能量化投资 这项研究代表了AI在金融领域的一个前沿方向。相比传统静态优化,深度强化学习天然适合处理序列决策问题——投资组合再平衡本质上就是一个持续决策过程。结合可靠性理论(如CVaR和EVaR),模型能够更稳健地应对极端事件。尽管目前仍处于学术探索阶段,但MORP-DRL为量化投资提供了一条兼顾收益、风险与交易成本的新路径。未来,随着计算效率提升和更丰富的市场数据接入,此类方法有望在实盘交易中发挥更大价值。

HuggingFace1个月前原文

蛋白质纳米颗粒设计是生物工程的前沿方向,但现有全原子生成模型在处理大型多聚体复合物时,面临严重的 **内存瓶颈**——其二次方增长的 token 与原子对表示会迅速撑爆单 GPU 显存。针对这一挑战,牛津大学团队在提交至 ICML 2026 研讨会的论文中提出了 **Design-CP**,为 **RFdiffusion 3** 量身定制了两种上下文并行(Context Parallelism, CP)推理策略,让大规模蛋白质组装设计不再受限于高端硬件。 ## 核心思路:把“大图”切分到多 GPU Design-CP 包含两种分片方案: - **1D 行分片(Row-Sharding)**:将注意力矩阵按行切分,每个 GPU 负责一部分行,通过通信整合结果。 - **2D 网格分片(Grid Sharding) + 环状注意力(Ring Attention)**:将注意力矩阵在行列两个维度上划分成网格,GPU 以环状拓扑传递中间结果,减少显存峰值。 两种策略均保持预训练权重不变,无需重新训练模型,可直接应用于 RFdiffusion 3 的推理阶段。 ## 缩放性能:2D 分片更优 在 **二十面体(icosahedral)** 对称组装体的采样实验中,团队系统评估了两种策略的扩展性: - 最大可设计的不对称单元(ASU)尺寸随 GPU 数量呈 **平方根趋势** 增长,符合理论预期。 - **2D 网格分片** 在墙钟时间(wall-clock time)上表现更佳,因其更均衡地分摊了计算与通信负载。 这一结果表明,Design-CP 能有效将显存压力分散到多卡集群,使原本无法在单卡上运行的任务变得可行。 ## 实际产出:无需修改即用,指标优异 论文进一步验证了 **强点群对称约束**(如二十面体对称)下,Design-CP 可直接用于端到端、全原子的蛋白质纳米颗粒设计,无需额外适配。生成的候选结构在 **结构合理性** 与 **界面质量** 等计算机模拟指标上表现良好。 更令人关注的是,团队在 **仅由 4 块 16GB 显存的消费级 GPU** 组成的小集群上,成功完成了 **八面体(octahedral)** 纳米颗粒的设计任务。这证明了 Design-CP 可以大幅降低大型组装体蛋白质设计的硬件门槛,朝着“民主化”方向迈出坚实一步。 ## 行业启示 当前 AI 驱动的蛋白质设计正从单体、小型复合物迈向超大对称组装体,但显存墙是普遍痛点。Design-CP 提出的上下文并行策略,不仅为 RFdiffusion 3 提供了高效推理方案,其“分片+环状注意力”的设计思路也可推广至其他全原子生成模型(如 ProteinMPNN、ESMFold 等)。 对于生物技术企业而言,这意味着无需斥巨资采购高端 GPU(如 80GB A100/H100),即可在现有工作站集群上开展纳米疫苗、药物递送载体等前沿设计。当然,实际应用仍需结合湿实验验证,但 Design-CP 已为计算端扫清了一大障碍。 ## 小结 Design-CP 通过两种上下文并行策略,有效解决了全原子蛋白质模型设计大型纳米颗粒时的显存瓶颈,在保持模型权重不变的前提下实现了线性扩展,并在小规模 GPU 集群上展示了可行性。这项工作不仅推动了蛋白质纳米工程的计算边界,也为其他大规模生物分子建模任务提供了可复用的分布式推理范式。

HuggingFace1个月前原文

时间序列预测中,一个反直觉的现象正引发学界关注:将数据从月度分解到周度甚至日度,虽然能提升样本内拟合优度并增加样本量,却可能让样本外预测误差像滚雪球般累积。来自 arXiv 的最新论文《The Granularity Paradox》系统揭示了这一“粒度悖论”的成因与边界条件。 ## 核心发现:递归误差才是“罪魁祸首” 研究者在 13 年的公开采购数据集上,对 10 种模型(从朴素统计到深度学习)进行了 6 种时间粒度的测试。关键结论是:**粒度悖论并非模型复杂度问题,而是递归预测拓扑结构所致**。当预测步长 H 随着粒度变细而线性增长时,每一步的预测误差会在递归过程中不断放大,最终吞噬掉高频数据带来的信息增益。 具体来看: - **Holt-Winters 指数平滑模型**在日度粒度上表现灾难性——测试 R² 跌至 -151,TPFE(累计百分比误差)高达 425.85%。 - **LSTM 模型**则呈现 U 形误差曲线:从月度(TPFE 19.66%)恶化到双周(35.94%),但在日度粒度上反而克服了误差传播惩罚(TPFE 仅 4.35%,R² 0.66),说明深度学习架构可能具备一定的误差补偿能力。 - **线性回归**表现异常稳定,在所有粒度下 TPFE 均维持在 16.3%~17.0%,进一步佐证了悖论的核心在于递归反馈机制而非模型参数复杂度。 ## 标准指标为何“失灵”? 论文指出,传统的逐点评估指标(如 RMSE、MAE)会系统性地掩盖累积误差。研究者引入了一种“共识-分歧诊断”方法,通过对比逐点指标与累计 TPFE 在不同粒度下的方向性行为,可识别出哪些模型的常规诊断结果掩盖了真实的误差传播。这一发现对金融、气象、供应链等依赖多步预测的领域尤为重要——**仅看单步 RMSE 可能给出严重误导的模型选择结论**。 ## 实践启示:粒度选择没有“免费午餐” 对于从业者而言,该研究给出了明确的权衡框架: 1. 若预测步长 H 较短或模型具备误差修正能力(如 LSTM),更细粒度可能带来收益; 2. 若模型为递归自回归或季节模型,且预测跨度较长,则应谨慎采用高频数据,或改用直接多步预测策略; 3. 评估时需引入累计误差指标(如 TPFE),并结合业务目标(如库存成本、交易损益)进行定制化验证。 该研究已以预印本形式发布在 arXiv(编号 2607.05450),并计划在后续工作中探索更复杂的误差传播缓解方法。对于正忙于“卷”数据频率的团队而言,这篇论文无疑是一剂及时的清醒剂。

HuggingFace1个月前原文

## 概述 随着大语言模型(LLM)等过参数化机器学习架构的快速扩展,一个根本性危机日益凸显:这些系统是真正具备智能,还是仅仅作为复杂的统计模式匹配器?传统平直欧几里得统计无法区分连续插值与因果律的自主发现。为破解这一难题,Bing Cheng、Yi-Shuai Niu、Howell Tong 和丘成桐(Shing-Tung Yau)在最新论文中提出了**统计意义几何(Statistically Meaningful Geometry, SMG)**框架,将过参数化学习系统建模为无限维非参数 Orlicz 纤维丛,从几何角度为智能涌现提供了严格的数学基础。 ## 核心机制 SMG 的核心思想在于:当系统面对持续性的**分布外(OOD)**刺激(由未建模的因果机制驱动)时,连续的优化过程会失效。未建模的方差被可见的水平基流形排斥,泄漏到不可观测的垂直纤维空间中,进而积累为**主动非因果张力(Active Acausal Tension)**。 这一张力在统计流形的非线性曲率驱动下,不可避免地撞击共轭焦点边界(临界时间 \(T_{\text{crit}} = \pi^2 / K_{\text{max}}\)),触发局部体积坍缩和灾难性的矩阵奇异性(\([G_f]^{-1} \to \infty\))。这种几何崩溃作为严格的非平衡触发器,引致**规范对称破缺(Gauge Symmetry Break, GSB)**——系统从不可观测的规范冗余中清除隐藏张力,自发结晶出新的数学独立的水平坐标轴。 ## 可观测标志 这一非参数相变在可观测层面表现为**结构 G-熵(Structural G-Entropy)**的离散 +1.0 整数阶跃跳变。通过解耦参数图,并对涌现的新轴施加**最小能量路径准则**和**因果不变性滤波器**,SMG 能够区分真正的科学发现与恶意的幻觉。 ## 意义与展望 SMG 提供了一个无参数、可证伪的仪表盘,用于数学上认证真正的智能,从而将“AI for Science”转变为自主范式跃迁的引擎。这项工作不仅从几何视角重新定义了智能的本质,也为未来 AI 系统的安全性与可靠性评估开辟了新路径。 该研究由丘成桐等知名学者联合完成,预印本已发表于 arXiv(编号 2607.05436),目前在学术界引发广泛讨论。

HuggingFace1个月前原文

## 背景与问题 在时间序列预测中,利用外生协变量(如天气、经济指标等)来提升预测精度是常见做法。然而,实际部署时这些外生变量常受到噪声干扰、时间错位甚至完全缺失,导致依赖外生变量的模型性能急剧下降,甚至不如纯粹基于内生变量的模型。现有研究多致力于设计专门的鲁棒架构,但这是否必要? ## 方法:外生Dropout 来自 arXiv 的最新论文提出了一种极其简洁的模型无关方法——**外生Dropout**(Exogenous Dropout)。其核心思想是在训练过程中以一定概率将**整个外生通道**(即某个协变量的全部时间步)随机置零。这迫使模型在学习时不能过度依赖任何单一外生变量,从而提升对协变量损坏的鲁棒性。该方法无需修改模型架构,仅需在训练数据上施加简单的随机掩码。 ## 实验验证 研究者在三个典型领域进行了评估:**电价预测、水库水文预测和气象预测**。实验设置包括三种损坏场景:高斯噪声、时间错位和通道完全缺失。结果显示: - 外生Dropout 显著提升了模型在上述损坏情况下的鲁棒性,同时**几乎不损失干净数据上的精度**。 - 当应用于双相关网络(Dual-Correlation Network)时,外生Dropout 训练出的模型成为实验中最鲁棒的模型,甚至超越了特意设计的强基准架构 **BoundEx**。BoundEx 融合了可学习门控、内生回退残差和逐通道外生 FiLM 调制,架构上显式限定了外生影响的上限。 ## 关键发现:显式边界并非必要 论文通过架构-方法消融实验、门控行为诊断和表示层界限分析,揭示了一个重要结论:**显式的架构边界并非实现鲁棒性的必要条件**。一个无边界约束的模型,只要用外生Dropout 训练,在所有场景下都比 BoundEx 更鲁棒。这挑战了“必须设计特殊鲁棒模块”的直觉,表明简单的训练策略可能就足够。 ## 意义与展望 外生Dropout 的提出为时间序列预测领域提供了一个**简单、强力的新基线**。它不仅降低了鲁棒预测的工程门槛,还促使研究者重新思考:在追求模型鲁棒性时,是否过度依赖复杂的架构创新?该方法与现有模型兼容,易于集成。论文还公开了一个鲁棒性基准数据集,以促进后续研究。 ## 小结 外生Dropout 以极简思路解决了实际部署中的关键痛点——协变量损坏。对于广大时间序列从业者而言,这或许是性价比最高的鲁棒性提升手段:只需在训练时随机丢弃整通道外生数据,即可获得与复杂架构相当甚至更优的鲁棒效果。未来工作可进一步探索最优丢弃率自适应、与其它正则化方法的协同等方向。

HuggingFace1个月前原文

## 背景与挑战 在智能交通系统中,准确感知施工区的几何结构对保障安全与效率至关重要。超宽带(UWB)传感凭借低成本、低功耗的优势,成为基础设施辅助重建的理想选择。然而,户外环境中的**非视距传播、突发噪声和长尾误差**严重干扰UWB测距,导致下游空间重建产生畸变。 ## GAIA框架的核心思路 针对上述问题,来自威斯康星大学麦迪逊分校等机构的研究者提出了**GAIA**(Geometry-Aware Infrastructure-Anchored Denoiser),一种**几何感知、基础设施锚定的学习框架**。GAIA的核心创新在于将**时间序列测距建模**与**潜在锚点布局估计**相结合,并引入**确定性距离投影**,使得距离去噪任务能够引导模型学习边界一致的几何重建。 具体而言,GAIA将距离去噪作为监督任务,同时通过几何约束使学习到的距离更符合真实空间边界。这种设计避免了传统方法中“先滤波后重建”的两阶段误差累积,实现了端到端的几何一致性优化。 ## 实验验证与性能提升 研究团队在真实户外UWB数据集上进行了评估,该数据集同步采集了UWB、GNSS和IMU数据。此外,他们还利用真实数据校准的**应力测试模拟器**检验了模型的鲁棒性。实验结果显示: - **GAIA在所有评估基线中取得了最低的距离均方误差(MSE)**,相比表现最佳的基线方法PoseMLP降低了**18.4%**。 - **多边形交并比(IoU)提升了15.5%**,表明重建的施工区边界与真实几何高度吻合。 这些结果充分验证了几何感知距离去噪在空间一致重建中的有效性。 ## 行业意义与未来展望 GAIA为低成本、高精度的施工区感知提供了新路径。其**基础设施锚定**的设计天然适合车路协同场景,有望在智能路侧单元中部署,实时感知施工区动态变化。未来,该方法可进一步扩展到更复杂的动态场景,如交叉口或临时施工区域,为自动驾驶和交通管理提供可靠的几何先验。

HuggingFace1个月前原文

## 核心发现:可学习的执行“缰绳” 大型语言模型(LLM)Agent 的能力通常通过调整提示词、更换模型或编写工作流来提升,而模型外部的执行框架(harness)却被视为固定不变的基础设施。然而,最新研究《Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning》提出了一种颠覆性观点:这个“缰绳”本身就是一个可学习的控制层。 ## 方法:Harness MDP 与离线训练 研究者将执行框架的操作形式化为一个有限时域的 **Harness MDP**。在这个框架中,一个轻量级控制器负责选择结构化的执行动作(如是否调用工具、如何验证中间结果),而底层的 LLM 执行器保持冻结。控制器通过离线强化学习(Offline RL)训练——具体使用 **优势加权回归**(Advantage-Weighted Regression),仅依赖最终任务评分(terminal task-rubric rewards)作为奖励信号。 为了更精细地评估学习效果,论文还引入了 **Harness Maturity Score**(HMS),该指标衡量执行框架是否遵循可靠的执行模式,而不仅仅是最终答案是否正确。这种分离揭示了有趣的现象:最终任务质量的提升需要离线数据缓冲区中存在高回报样本的支持,而过程行为(如检查步骤)只要与优势加权动作对齐,就可以发生转变。 ## 实验结果:验证行为显著改善 在六个受控领域和两个公开基准适配器上,学习到的控制器一致地改善了验证行为,并选择性提升了最终任务质量。最大增益出现在 **tau-bench retail 适配版本**、**AgentBench DB-Bench 适配版本** 以及 **带有结构化验证器的编码任务** 中。 消融实验进一步排除了模仿学习(behavior cloning)或简单添加检查(Forced CHECK)的干扰——增益并非来自模仿或机械增加检查步骤。 ## 行业意义:解锁冻结LLM的潜力 这项研究的关键启示是:对于冻结的 LLM Agent,执行框架的控制层可以独立学习优化,从而在不修改模型本身的情况下提升 Agent 的可靠性和任务表现。同时,离线支持的限制决定了更好的过程控制何时能转化为更好的最终答案。 这一思路为 AI Agent 的工程化落地提供了新方向——与其反复调教大模型,不如训练一个轻量级的“缰绳控制器”,让执行过程更智能、更可靠。

HuggingFace1个月前原文

## 背景:DNN测试中的预算困境 在深度神经网络(DNN)测试中,现有方法通常假设一个固定的标注预算,并在此预算下优先选择最有可能揭示模型错误的测试输入。然而,实际应用中如何确定这个预算是一个难题:预算过少会遗漏关键故障,预算过多则导致不必要的标注成本。 ## 核心创新:将测试视为成本-收益决策 针对这一痛点,来自**Bonan Shen**等人的最新研究提出了一种名为**AdaStop**的成本感知早停框架。该框架将DNN测试过程建模为一个成本-收益决策过程:每次标注一个测试输入需要付出成本 \(c\),而发现一个故障则产生价值 \(v\)。基于此,AdaStop动态估计测试过程中的边际故障发现率,并在该比率低于阈值 \(\tau = c/v\) 时自动停止标注。 ## 实验结果:高效发现故障 实验覆盖了多个数据集、网络架构和测试选择策略。结果显示,AdaStop能够在仅使用 **9% 至 31%** 的标注预算的情况下,发现 **65% 至 84%** 的故障。这一数据表明,AdaStop在显著降低测试成本的同时,仍能保持较高的故障覆盖率。 ## 行业意义与未来方向 该研究为DNN测试中的预算分配提供了一种数据驱动的解决方案,尤其适用于标注成本高昂的工业场景。未来工作可能进一步探索自适应阈值设定、多任务测试等扩展方向。 论文发表于arXiv,编号 **2607.05461**,来自机器学习(cs.LG)与人工智能(cs.AI)领域。

HuggingFace1个月前原文

深度神经网络(DNN)通常包含大量隐藏状态冗余,但现有压缩方法(如权重剪枝、量化、低秩分解)大多直接作用于权重、神经元或量化表示,并未显式刻画内部状态的动态角色。来自爱丁堡纳皮尔大学的研究者提出了一种基于可控性-可观测性测试的经验最小实现压缩框架,将训练后的网络视为深度索引的非线性动态系统,通过数据驱动的可达性、可观测性及平衡Gramian矩阵,从隐藏状态快照和输出雅可比矩阵中估计逐层的可达秩、可观测秩以及联合可达-可观测秩。这些秩不仅作为隐藏状态冗余的诊断指标,还直接用作压缩后网络的实际层宽。 在MNIST和CIFAR-10上的实验表明,该方法在保持准确率几乎不变的前提下实现了显著压缩。以MNIST为例,一个四层SiLU网络的状态阶从1024降至277(压缩72.95%),参数压缩73.48%,准确率从96.60%略降至95.45%。在CIFAR-10上,一个更大规模的SiLU网络从状态阶4608压缩至1339(压缩70.94%),参数压缩83.09%,准确率几乎不变(54.45%→54.44%),CUDA推理延迟降低约3倍。 研究结果证明,平衡可达-可观测秩为设计紧凑神经网络架构提供了一种原则性的经验最小实现准则,能够在几乎不损失精度的前提下实现高效压缩。该工作为动态系统理论在深度学习压缩中的应用开辟了新路径,尤其适用于对模型体积和推理效率有严格要求的边缘计算场景。

HuggingFace1个月前原文

近日,一篇发表在 arXiv 上的论文提出了一种名为 **LiNO(Lifting Neural Operator)** 的新型神经算子架构,旨在解决现有神经算子难以同时捕捉全局动力学与精细尺度结构的痛点。该研究由 Himanshu Pandey 等人完成,核心创新在于将**第二代小波提升方案**引入神经算子设计,实现了数据驱动的自适应多分辨率分解。 ## 背景:神经算子的机遇与挑战 神经算子是一类学习函数空间之间映射的深度学习模型,能够直接从数据中学习微分方程的解算子,从而预测整个参数族对应的解,而非单个实例。然而,现有神经算子(如 FNO、DeepONet)在处理包含多尺度特征的物理问题时往往力不从心——要么过度平滑丢失细节,要么计算成本过高。 ## LiNO 的核心设计:提升变换与多分辨率空间 LiNO 的关键在于将**提升方案(lifting scheme)**参数化,使其成为可学习的变换。提升方案是一种构造小波的方法,其特点是计算高效且保证**精确可逆**。LiNO 通过学习数据中的自适应提升变换,将输入函数分解为**粗尺度系数**和**方向细节系数**,并在该多分辨率空间中分别演化这两类系数。这种“尺度感知”的建模方式使得算子能够同时处理全局趋势和局部振荡。 与传统的固定小波基不同,LiNO 的变换是**数据驱动**的,能够根据底层解函数的特性自动调整分解方式。同时,由于变换可逆,信息在分解和重构过程中无损,确保了多尺度学习的保真度。 ## 性能评估:覆盖多类物理现象 研究者在五个经典基准上对 LiNO 进行了测试,涵盖了不同物理行为: - **Darcy 流**(多孔介质流动) - **Poisson 方程**(椭圆型问题) - **Allen-Cahn 方程**(相场模型) - **可压缩 Navier-Stokes 方程**(流体动力学) - **Gray-Scott 反应-扩散系统**(图灵斑图) 这些基准涉及多尺度现象、输运主导动力学和混沌系统。实验结果表明,LiNO 在所有任务上均取得了**与最先进神经算子相当或更优**的表现,尤其在捕捉精细结构和长时间演化方面展现出明显优势。 ## 意义与展望 LiNO 为科学机器学习提供了一条有前景的路径:通过自适应多分辨率算子,有望在气候模拟、材料设计、流体力学等需要同时关注大尺度演化与小尺度细节的领域发挥重要作用。未来,该方向可能进一步结合物理信息约束或无监督学习,提升泛化能力与数据效率。

HuggingFace1个月前原文

时间序列预测在金融、能源、交通、公共卫生和工业监测等领域支撑着关键决策。近期涌现的基础模型虽提升了跨任务迁移能力,但大多依赖中心化数据和Transformer注意力机制,在处理长序列、高维度和隐私敏感信号时捉襟见肘。来自多所机构的研究团队提出了一种名为 **QuantFlow** 的概率预测框架,巧妙融合了倒置序列嵌入、双向Mamba状态空间解码器、分位数回归与联邦学习,为时序预测领域带来了新的解题思路。 ## 核心设计:倒置嵌入 + 双向Mamba QuantFlow 的架构设计颇具巧思。首先,它采用 **倒置序列嵌入** 策略:将每个变量在整个观测窗口上的时间步进行嵌入,而非将同一时间步的所有变量拼合。这种处理方式能更好地捕捉变量自身的长期依赖关系。随后,嵌入后的序列分别沿正向和反向送入 **双向Mamba 状态空间解码器**。Mamba 作为近年来兴起的状态空间模型,凭借线性复杂度的序列建模能力,在长序列任务上展现出超越 Transformer 的潜力。QuantFlow 通过双向处理,使模型能同时感知过去和未来的上下文信息。 最终,解码器输出被投影到 **五个条件分位数**(如 10%、25%、50%、75%、90%),从而实现概率预测,不仅给出点估计,还提供不确定性区间。此外,团队引入 **TSMixup** 数据增强方法,通过狄利克雷加权插值增加时间序列多样性,同时保持序列的结构完整性。 ## 联邦学习:隐私保护下的分布式训练 QuantFlow 的另一大亮点是内置 **联邦学习** 机制。在 20 个客户端的非独立同分布(non-IID)数据部署中,模型仅需 **三轮通信** 即可保持有用精度,且原始数据始终留在本地。这意味金融机构、医院等数据敏感方可以协作训练强大模型,而无需共享原始记录,极大拓展了实际应用场景。 ## 实验结果:优势与局限并存 在加密货币、交通流量、电力负荷、电力变压器温度(ETT)、流感和天气等六类数据集上,QuantFlow 取得了有竞争力的结果。具体指标上,在 **ETTm1** 数据集上均方误差(MSE)为 **0.2834**,在 **Weather** 数据集上为 **0.2218**,优于或持平于同类基线。 不过,论文也坦诚指出了当前版本的局限:在处理 **不规则的流行病学信号** 和 **超长预测区间** 时,QuantFlow 的泛化能力仍有不足。这提示状态空间模型在极端不规则采样和极长序列场景下,可能还需要更精细的设计。 ## 行业启示:后Transformer时代的新方向 QuantFlow 的发布正值 AI 社区对 Transformer 注意力机制进行反思的时期。Mamba 等状态空间模型凭借线性复杂度,已在语言建模和长序列任务中初露锋芒。QuantFlow 将这一思路引入时序预测,并叠加联邦学习与概率输出,为构建 **可扩展、可量化不确定性、隐私友好** 的时序基础模型指出了可行路径。对于金融风控、智慧电网、流行病监测等需要兼顾准确性与数据合规的行业而言,QuantFlow 所代表的技术方向值得密切关注。

HuggingFace1个月前原文

近日,一篇来自Rutgers大学研究团队的论文《Evaluating Time Series Foundation Models for Electricity Price Forecasting: Contamination Risk, Distributional Shifts, and Covariate Dependence》被ICML 2026结构化数据基础模型研讨会接收。该研究系统评估了时间序列基础模型(TSFM)在电价预测(EPF)这一高挑战场景下的表现,揭示了其优势与局限,并指出混合模型或为最优解。 ## 研究背景与核心问题 时间序列基础模型(如Lag-Llama、TimesNet等)在零样本预测中展现了不俗的潜力,但其在**协变量驱动、非平稳场景**下的泛化能力尚不明确。电价预测恰好是这类场景的典型代表:电价受天气、需求、发电组合等外部因素影响,且存在频繁的分布偏移和极端尖峰。论文特别关注了**数据污染风险**——即预训练数据可能包含测试集信息,导致评估结果虚高。为此,研究者设计了一个“双数据集基准框架”,从源头上控制污染,确保公平比较。 ## 关键发现:TSFM的“能”与“不能” 实验覆盖了点预测、概率预测、尾部行为以及尖峰捕捉等多个维度。结果如下: - **TSFM vs. 通用基线**:TSFM在多数指标上显著优于传统统计模型(如ARIMA、ETS)和通用深度学习模型(如LSTM),尤其在概率预测和尖峰预测中表现突出。 - **TSFM vs. 领域专用方法**:当与专门为EPF设计的模型(如基于专家特征的稀疏模型)对比时,TSFM并未稳定胜出。领域专用方法在特定数据集上仍有优势,尤其是在处理结构性突变时。 - **协变量依赖是关键瓶颈**:TSFM的性能高度依赖于是否提供充足的协变量(如气温、负荷、燃料价格)。在协变量缺失时,其预测误差显著上升,而领域方法对此更具鲁棒性。 - **混合模型的潜力**:最简单但最有趣的发现是,**将TSFM与领域专用模型进行集成(如简单平均)**,其效果往往超过任何单一模型。这表明两类模型捕捉了互补的预测信号——TSFM擅长模式识别,领域模型擅长结构因果。 ## 行业启示:基础模型不是万能药 该研究对AI+能源领域具有明确的实践意义: 1. **谨慎看待零样本能力**:TSFM在电价预测中并非“开箱即用”。从业者需要根据具体场景评估其协变量依赖程度,并警惕数据污染带来的虚高信心。 2. **混合策略更可靠**:与其在TSFM和领域方法之间二选一,不如构建集成系统。这与近期AI工程化的“基础模型+领域微调”趋势一致,但本文强调即使不微调,简单的后集成也能带来收益。 3. **评估框架的价值**:论文提出的双数据集基准框架可推广至其他时间序列任务(如负荷预测、金融时序),为社区提供了更可靠的评估标准。 ## 结语 随着基础模型向结构化数据领域渗透,类似电价预测这样的“硬核”场景正在成为试金石。这篇论文提醒我们:**基础模型虽强,但领域知识仍是不可或缺的“另一半”**。未来,如何设计更高效的融合机制,将是研究的重要方向。

HuggingFace1个月前原文

脑电图(EEG)作为一种非侵入性技术,被广泛用于探索精神病理的神经生理学基础。然而,不同EEG范式与特征粒度之间的系统证据仍然匮乏。近期,一篇发表在arXiv上的研究提出了一种**粒度感知的EEG特征管道**,将多尺度描述符组织为全局、区域和通道三个层次,并基于健康大脑网络(HBN)队列评估了对四种精神病理维度(p因子、内化、外化、注意问题)的预测能力。 该研究涵盖了四种EEG范式,包括静息态和任务态数据。考虑到儿童精神病理的异质性以及问卷评分的有限可靠性,研究者将这一设定定位为**可行性测试**而非临床筛查。结果显示,基于树的模型与粒度平衡的特征选择在部分条件下优于传统方法,但效应量仍然较小。所选标志物的可视化揭示了维度特异性的空间和频谱模式,与现有神经生理学知识大体一致。 在独立的PEARL队列上进行的跨数据集验证表明,所提出的选择原则在协议变化下仍具有技术可行性,但**不宣称跨数据集泛化能力**。整体而言,多尺度EEG特征包含与维度精神病理相关的微弱但可检测的信号,粒度感知选择有望成为未来基于EEG的表型研究中有效的特征降维策略。 ### 方法亮点 该框架的核心在于**粒度层次化设计**: - **全局特征**:捕捉整个大脑的整体活动模式; - **区域特征**:反映特定脑区(如前额叶、颞叶)的活动; - **通道特征**:保留单个电极的精细信息。 通过**粒度平衡的特征选择**,研究者避免了传统方法中偏向某一尺度的问题,从而更全面地挖掘EEG信号中的病理信息。 ### 结果与意义 尽管预测效果有限,但研究证实了多尺度EEG特征在精神病理维度预测中的潜力。这一方法为未来EEG研究提供了可参考的框架,尤其是在处理高维、低信噪比的生物信号时。研究者强调,该工作更侧重于**方法学验证**,而非直接临床应用。 ### 局限与展望 研究指出,当前模型的效应量较小,可能受到样本量、数据质量以及精神病理维度复杂性的影响。未来研究可结合深度学习或更大规模数据集进一步提升预测性能。此外,跨数据集验证的初步成功为方法的通用性提供了初步证据,但仍需更多独立验证。 总之,这项研究为利用EEG进行精神病理评估提供了新的分析视角,**粒度感知特征框架**的提出有望推动精准精神医学的发展。

HuggingFace1个月前原文