SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

金融投资组合优化本质上是一个多目标决策问题,需要在收益、风险、市场动态和实际约束之间寻求平衡。传统基于可靠性的方法多依赖静态优化框架,难以捕捉序列决策、尾部风险以及交易成本等市场摩擦。针对这一局限,一篇发表于arXiv的最新论文提出了**MORP-DRL**——一种基于深度强化学习的多目标可靠性投资组合优化框架。 ## 核心创新:三管齐下的风险度量 MORP-DRL同时优化期望收益和下行风险,并引入三种互补的风险指标: - **方差**:度量整体波动性 - **条件风险价值(CVaR)**:关注极端损失的平均水平 - **熵风险价值(EVaR)**:基于尾部概率的熵度量,对厚尾分布更敏感 这种设计使模型能够更全面地评估风险,尤其是在市场剧烈波动时。 ## 建模与算法:应对市场复杂性 为了刻画市场的不确定性和厚尾行为,资产收益采用**GARCH(1,1)**、**极值理论**以及**t-copula**依赖结构进行建模,并通过拟蒙特卡洛模拟生成逼真的市场情景。算法层面,研究团队选用**近端策略优化(PPO)**作为强化学习基础,同时纳入了交易成本和投资组合权重上下限等实际约束,并与经典多目标进化算法**NSGA-II**进行对比。 ## 实验验证:穿越市场周期 实验覆盖了全球十个股票指数,时间跨度包含**疫情前、疫情期间和疫情后**三种市场状态。结果显示,MORP-DRL在风险-收益表现上具有竞争力,在市场压力时期能有效降低下行风险,并且具备扩展到高维投资组合的能力。 ## 行业视角:强化学习赋能量化投资 这项研究代表了AI在金融领域的一个前沿方向。相比传统静态优化,深度强化学习天然适合处理序列决策问题——投资组合再平衡本质上就是一个持续决策过程。结合可靠性理论(如CVaR和EVaR),模型能够更稳健地应对极端事件。尽管目前仍处于学术探索阶段,但MORP-DRL为量化投资提供了一条兼顾收益、风险与交易成本的新路径。未来,随着计算效率提升和更丰富的市场数据接入,此类方法有望在实盘交易中发挥更大价值。

HuggingFace1个月前原文

## 当运动数据遇上大模型:Inertia-1 开启可穿戴AI新篇章 可穿戴设备(如智能手表、健身手环)每天都在产生海量的运动数据,这些数据能否像文本、图像一样,训练出通用的“基础模型”?来自加州大学洛杉矶分校等机构的研究团队近期发布了 **Inertia-1**,一项针对可穿戴运动传感数据基础模型的系统性开源探索。 ### 数据规模:1800万小时的加速度计数据 研究团队构建了包含 **超过1820万小时** 的全球来源加速度计数据语料库。这相当于一个人连续佩戴设备超过2000年才能产生的数据量。如此庞大的规模,为研究预训练和缩放规律提供了坚实基础。 ### 系统化研究框架 不同于以往仅聚焦单一设计选择(如传感器位置或采样频率)的工作,Inertia-1 构建了一个 **全生命周期控制框架**,涵盖三大维度: - **数据选择**:传感器模态、设备佩戴位置、采样率、窗口长度等。 - **模型选择**:不同架构(如Transformer、CNN)和模型尺寸。 - **训练选择**:预训练目标、数据规模等。 ### 跨任务评估:从活动识别到疾病预测 研究在 **15个数据集** 上进行了广泛评估,覆盖三类典型下游任务: - **人体活动识别**:如走路、跑步、上下楼等。 - **步态冻结检测**:用于帕金森病患者的运动障碍监测。 - **疾病预测**:通过运动模式推断健康状况。 结果揭示了构建泛化性运动基础模型的关键因素,例如: > 使用多位置数据预训练能显著提升模型在不同佩戴场景下的表现; > 更大模型尺寸在足够数据支持下持续带来收益,但存在边际递减。 ### 开源“菜谱”:加速可穿戴AI落地 Inertia-1 不仅提供了 **当前最优的配方**(state-of-the-art recipes),更被设计为一本 **实用、开放的可穿戴运动表征学习指南**(cookbook)。所有代码、模型和实验配置均开源,旨在降低该领域的研究门槛。 ### 意义与展望 可穿戴运动传感数据具有连续、低成本、高生态效度等优势,非常适合作为基础模型的训练原料。Inertia-1 的工作填补了该领域系统性研究的空白,为后续研究提供了: - 可复现的基线 - 数据与模型缩放的经验规律 - 跨任务迁移的可行路径 未来,随着更多传感器(如心率、皮肤电活动)的融合,可穿戴基础模型有望在 **个性化健康管理、老年照护、运动科学** 等领域发挥更大作用。 --- > 论文链接:arXiv:2607.06617

HuggingFace1个月前原文

## 高效建模新突破:STAGformer 如何用线性复杂度解决共享单车需求预测难题? 共享单车系统的运营效率高度依赖于精准的站点级需求预测。然而,城市网络规模庞大,时空依赖关系复杂,传统模型往往难以兼顾精度与计算效率。近日,一篇发表于 arXiv 的论文提出了 **STAGformer(Spatio-Temporal Agent Graph Transformer)**,通过创新的**智能体注意力机制**,将标准自注意力的二次复杂度降至 **O(NT)** 线性级别,为大规模时空预测开辟了新路径。 ### 核心创新:两步式智能体注意力 STAGformer 的核心在于其**两步式智能体注意力机制**。模型引入少量可学习的**空间智能体令牌**和**时间智能体令牌**,首先由这些智能体从所有站点和时间步中聚合全局信息,再将其广播回各个站点和时间步。这一设计有效捕捉了长距离交互,同时避免了标准 Transformer 中随节点数平方增长的计算开销。 ### 四大模块协同工作 STAGformer 由四个核心模块构成: - **时空编码器**:融合动态节点特征与外部上下文因素(如天气、时间、兴趣点); - **图传播模块**:用于空间邻居聚合,捕捉局部空间相关性; - **时间卷积模块**:提取局部时间模式; - **智能体注意力模块**:负责全局依赖建模,是模型性能的关键。 ### 实验表现:全面超越基线 研究团队在 **纽约 Citi-Bike** 和 **芝加哥 Divvy-Bike** 两个真实数据集上进行了广泛实验。结果显示,STAGformer 在多个预测时长(如 15 分钟、30 分钟、1 小时等)上,均以显著优势超越了当前最先进的基线模型,在 **RMSE** 和 **MAE** 两项指标上均取得最优。消融研究进一步验证了每个组件的贡献,其中智能体注意力机制被证实是捕捉全局时空依赖的关键。 ### 行业意义与展望 随着城市微出行(如共享单车、电动滑板车)的普及,精准的需求预测对车辆调度、站点管理及用户体验优化至关重要。STAGformer 提供了一种**兼顾效率与精度**的解决方案,其线性复杂度使其具备部署于大规模城市网络的潜力。未来,该框架有望推广至其他时空预测任务,如交通流量预测、人群密度估计等,推动智能交通系统向更高效、更智能的方向发展。

HuggingFace1个月前原文

联邦学习(FL)中,标签分布倾斜(label skew)是导致客户端漂移(client drift)和全局模型准确率下降的顽疾。合成数据增强是一种有效的缓解手段,但若追求完全的类平衡,其计算成本往往高得难以承受。来自韩国研究团队的最新论文提出 **FedEAS**(Federated Entropy-Adaptive Synthesis),巧用“预算”思维,在近乎不增加额外开销的前提下,显著提升了模型性能。 ## 核心问题:合成数据该“给谁用”和“用多少”? 传统方法要么对所有客户端一视同仁地分配生成预算(Uniform allocation),要么不顾成本地追求全局类平衡。前者无视了不同客户端本地分布差异,后者则因高昂的计算代价而不具备实际部署可行性。FedEAS 的切入点非常直接:**预算必须根据每个客户端的本地标签分布动态调整**,并且要同时回答两个问题——生成多少(how much)以及生成的样本送往哪里(where)。 ## FedEAS 机制:熵自适应预算与生成位置决策 FedEAS 的核心是一个 **熵自适应(entropy-adaptive)的每类生成预算** 计算策略。具体来说,系统根据每个客户端本地标签分布的熵值,为每个类别分配一个生成预算。分布越不平衡(熵越低),该客户端获得的生成预算就越高,从而有针对性地补足稀缺类别。同时,生成的合成样本并非“自产自销”,而是根据全局需求被分配到最需要它们的客户端(或保留在本地)。这种“生成+分发”的双重决策机制,使得总生成预算不再是一个预先设定的固定值,而是由所有客户端的预算之和自然确定。 ## 实验结果:94.1% 的预算削减与 18.82% 的性能提升 在 CIFAR-10 和 CIFAR-100 数据集上的实验表明,FedEAS 能够恢复完全类平衡带来的绝大部分准确率增益,同时将生成预算削减了 **94.1%**。换言之,它用不到 6% 的计算成本,就实现了接近最优的效果。与统一预算分配相比,在相同总预算下,FedEAS 的性能提升最高达 **18.82%**。这一结果充分说明了“把钱花在刀刃上”的重要性——不是生成更多的数据,而是生成对的地方、对的数量。 ## 行业启示:效率优先的联邦增强新范式 FedEAS 的提出,为联邦学习中数据增强的实用化提供了新思路。在现实场景中,客户端(如手机、医院)的计算和存储资源往往有限,不可能承担大规模合成数据生成。FedEAS 的预算感知机制,使得资源可以精准投放到最需要的数据类别上,尤其适用于医疗影像、金融风控等标签分布天然倾斜的领域。未来,结合更先进的生成模型(如扩散模型),这一框架有望进一步降低合成成本,推动联邦学习走向更广泛的落地应用。

HuggingFace1个月前原文

## 概述 随着大语言模型(LLM)等过参数化机器学习架构的快速扩展,一个根本性危机日益凸显:这些系统是真正具备智能,还是仅仅作为复杂的统计模式匹配器?传统平直欧几里得统计无法区分连续插值与因果律的自主发现。为破解这一难题,Bing Cheng、Yi-Shuai Niu、Howell Tong 和丘成桐(Shing-Tung Yau)在最新论文中提出了**统计意义几何(Statistically Meaningful Geometry, SMG)**框架,将过参数化学习系统建模为无限维非参数 Orlicz 纤维丛,从几何角度为智能涌现提供了严格的数学基础。 ## 核心机制 SMG 的核心思想在于:当系统面对持续性的**分布外(OOD)**刺激(由未建模的因果机制驱动)时,连续的优化过程会失效。未建模的方差被可见的水平基流形排斥,泄漏到不可观测的垂直纤维空间中,进而积累为**主动非因果张力(Active Acausal Tension)**。 这一张力在统计流形的非线性曲率驱动下,不可避免地撞击共轭焦点边界(临界时间 \(T_{\text{crit}} = \pi^2 / K_{\text{max}}\)),触发局部体积坍缩和灾难性的矩阵奇异性(\([G_f]^{-1} \to \infty\))。这种几何崩溃作为严格的非平衡触发器,引致**规范对称破缺(Gauge Symmetry Break, GSB)**——系统从不可观测的规范冗余中清除隐藏张力,自发结晶出新的数学独立的水平坐标轴。 ## 可观测标志 这一非参数相变在可观测层面表现为**结构 G-熵(Structural G-Entropy)**的离散 +1.0 整数阶跃跳变。通过解耦参数图,并对涌现的新轴施加**最小能量路径准则**和**因果不变性滤波器**,SMG 能够区分真正的科学发现与恶意的幻觉。 ## 意义与展望 SMG 提供了一个无参数、可证伪的仪表盘,用于数学上认证真正的智能,从而将“AI for Science”转变为自主范式跃迁的引擎。这项工作不仅从几何视角重新定义了智能的本质,也为未来 AI 系统的安全性与可靠性评估开辟了新路径。 该研究由丘成桐等知名学者联合完成,预印本已发表于 arXiv(编号 2607.05436),目前在学术界引发广泛讨论。

HuggingFace1个月前原文

蛋白质纳米颗粒设计是生物工程的前沿方向,但现有全原子生成模型在处理大型多聚体复合物时,面临严重的 **内存瓶颈**——其二次方增长的 token 与原子对表示会迅速撑爆单 GPU 显存。针对这一挑战,牛津大学团队在提交至 ICML 2026 研讨会的论文中提出了 **Design-CP**,为 **RFdiffusion 3** 量身定制了两种上下文并行(Context Parallelism, CP)推理策略,让大规模蛋白质组装设计不再受限于高端硬件。 ## 核心思路:把“大图”切分到多 GPU Design-CP 包含两种分片方案: - **1D 行分片(Row-Sharding)**:将注意力矩阵按行切分,每个 GPU 负责一部分行,通过通信整合结果。 - **2D 网格分片(Grid Sharding) + 环状注意力(Ring Attention)**:将注意力矩阵在行列两个维度上划分成网格,GPU 以环状拓扑传递中间结果,减少显存峰值。 两种策略均保持预训练权重不变,无需重新训练模型,可直接应用于 RFdiffusion 3 的推理阶段。 ## 缩放性能:2D 分片更优 在 **二十面体(icosahedral)** 对称组装体的采样实验中,团队系统评估了两种策略的扩展性: - 最大可设计的不对称单元(ASU)尺寸随 GPU 数量呈 **平方根趋势** 增长,符合理论预期。 - **2D 网格分片** 在墙钟时间(wall-clock time)上表现更佳,因其更均衡地分摊了计算与通信负载。 这一结果表明,Design-CP 能有效将显存压力分散到多卡集群,使原本无法在单卡上运行的任务变得可行。 ## 实际产出:无需修改即用,指标优异 论文进一步验证了 **强点群对称约束**(如二十面体对称)下,Design-CP 可直接用于端到端、全原子的蛋白质纳米颗粒设计,无需额外适配。生成的候选结构在 **结构合理性** 与 **界面质量** 等计算机模拟指标上表现良好。 更令人关注的是,团队在 **仅由 4 块 16GB 显存的消费级 GPU** 组成的小集群上,成功完成了 **八面体(octahedral)** 纳米颗粒的设计任务。这证明了 Design-CP 可以大幅降低大型组装体蛋白质设计的硬件门槛,朝着“民主化”方向迈出坚实一步。 ## 行业启示 当前 AI 驱动的蛋白质设计正从单体、小型复合物迈向超大对称组装体,但显存墙是普遍痛点。Design-CP 提出的上下文并行策略,不仅为 RFdiffusion 3 提供了高效推理方案,其“分片+环状注意力”的设计思路也可推广至其他全原子生成模型(如 ProteinMPNN、ESMFold 等)。 对于生物技术企业而言,这意味着无需斥巨资采购高端 GPU(如 80GB A100/H100),即可在现有工作站集群上开展纳米疫苗、药物递送载体等前沿设计。当然,实际应用仍需结合湿实验验证,但 Design-CP 已为计算端扫清了一大障碍。 ## 小结 Design-CP 通过两种上下文并行策略,有效解决了全原子蛋白质模型设计大型纳米颗粒时的显存瓶颈,在保持模型权重不变的前提下实现了线性扩展,并在小规模 GPU 集群上展示了可行性。这项工作不仅推动了蛋白质纳米工程的计算边界,也为其他大规模生物分子建模任务提供了可复用的分布式推理范式。

HuggingFace1个月前原文

时间序列预测中,一个反直觉的现象正引发学界关注:将数据从月度分解到周度甚至日度,虽然能提升样本内拟合优度并增加样本量,却可能让样本外预测误差像滚雪球般累积。来自 arXiv 的最新论文《The Granularity Paradox》系统揭示了这一“粒度悖论”的成因与边界条件。 ## 核心发现:递归误差才是“罪魁祸首” 研究者在 13 年的公开采购数据集上,对 10 种模型(从朴素统计到深度学习)进行了 6 种时间粒度的测试。关键结论是:**粒度悖论并非模型复杂度问题,而是递归预测拓扑结构所致**。当预测步长 H 随着粒度变细而线性增长时,每一步的预测误差会在递归过程中不断放大,最终吞噬掉高频数据带来的信息增益。 具体来看: - **Holt-Winters 指数平滑模型**在日度粒度上表现灾难性——测试 R² 跌至 -151,TPFE(累计百分比误差)高达 425.85%。 - **LSTM 模型**则呈现 U 形误差曲线:从月度(TPFE 19.66%)恶化到双周(35.94%),但在日度粒度上反而克服了误差传播惩罚(TPFE 仅 4.35%,R² 0.66),说明深度学习架构可能具备一定的误差补偿能力。 - **线性回归**表现异常稳定,在所有粒度下 TPFE 均维持在 16.3%~17.0%,进一步佐证了悖论的核心在于递归反馈机制而非模型参数复杂度。 ## 标准指标为何“失灵”? 论文指出,传统的逐点评估指标(如 RMSE、MAE)会系统性地掩盖累积误差。研究者引入了一种“共识-分歧诊断”方法,通过对比逐点指标与累计 TPFE 在不同粒度下的方向性行为,可识别出哪些模型的常规诊断结果掩盖了真实的误差传播。这一发现对金融、气象、供应链等依赖多步预测的领域尤为重要——**仅看单步 RMSE 可能给出严重误导的模型选择结论**。 ## 实践启示:粒度选择没有“免费午餐” 对于从业者而言,该研究给出了明确的权衡框架: 1. 若预测步长 H 较短或模型具备误差修正能力(如 LSTM),更细粒度可能带来收益; 2. 若模型为递归自回归或季节模型,且预测跨度较长,则应谨慎采用高频数据,或改用直接多步预测策略; 3. 评估时需引入累计误差指标(如 TPFE),并结合业务目标(如库存成本、交易损益)进行定制化验证。 该研究已以预印本形式发布在 arXiv(编号 2607.05450),并计划在后续工作中探索更复杂的误差传播缓解方法。对于正忙于“卷”数据频率的团队而言,这篇论文无疑是一剂及时的清醒剂。

HuggingFace1个月前原文

## 背景与问题 在时间序列预测中,利用外生协变量(如天气、经济指标等)来提升预测精度是常见做法。然而,实际部署时这些外生变量常受到噪声干扰、时间错位甚至完全缺失,导致依赖外生变量的模型性能急剧下降,甚至不如纯粹基于内生变量的模型。现有研究多致力于设计专门的鲁棒架构,但这是否必要? ## 方法:外生Dropout 来自 arXiv 的最新论文提出了一种极其简洁的模型无关方法——**外生Dropout**(Exogenous Dropout)。其核心思想是在训练过程中以一定概率将**整个外生通道**(即某个协变量的全部时间步)随机置零。这迫使模型在学习时不能过度依赖任何单一外生变量,从而提升对协变量损坏的鲁棒性。该方法无需修改模型架构,仅需在训练数据上施加简单的随机掩码。 ## 实验验证 研究者在三个典型领域进行了评估:**电价预测、水库水文预测和气象预测**。实验设置包括三种损坏场景:高斯噪声、时间错位和通道完全缺失。结果显示: - 外生Dropout 显著提升了模型在上述损坏情况下的鲁棒性,同时**几乎不损失干净数据上的精度**。 - 当应用于双相关网络(Dual-Correlation Network)时,外生Dropout 训练出的模型成为实验中最鲁棒的模型,甚至超越了特意设计的强基准架构 **BoundEx**。BoundEx 融合了可学习门控、内生回退残差和逐通道外生 FiLM 调制,架构上显式限定了外生影响的上限。 ## 关键发现:显式边界并非必要 论文通过架构-方法消融实验、门控行为诊断和表示层界限分析,揭示了一个重要结论:**显式的架构边界并非实现鲁棒性的必要条件**。一个无边界约束的模型,只要用外生Dropout 训练,在所有场景下都比 BoundEx 更鲁棒。这挑战了“必须设计特殊鲁棒模块”的直觉,表明简单的训练策略可能就足够。 ## 意义与展望 外生Dropout 的提出为时间序列预测领域提供了一个**简单、强力的新基线**。它不仅降低了鲁棒预测的工程门槛,还促使研究者重新思考:在追求模型鲁棒性时,是否过度依赖复杂的架构创新?该方法与现有模型兼容,易于集成。论文还公开了一个鲁棒性基准数据集,以促进后续研究。 ## 小结 外生Dropout 以极简思路解决了实际部署中的关键痛点——协变量损坏。对于广大时间序列从业者而言,这或许是性价比最高的鲁棒性提升手段:只需在训练时随机丢弃整通道外生数据,即可获得与复杂架构相当甚至更优的鲁棒效果。未来工作可进一步探索最优丢弃率自适应、与其它正则化方法的协同等方向。

HuggingFace1个月前原文

深度神经网络(DNN)通常包含大量隐藏状态冗余,但现有压缩方法(如权重剪枝、量化、低秩分解)大多直接作用于权重、神经元或量化表示,并未显式刻画内部状态的动态角色。来自爱丁堡纳皮尔大学的研究者提出了一种基于可控性-可观测性测试的经验最小实现压缩框架,将训练后的网络视为深度索引的非线性动态系统,通过数据驱动的可达性、可观测性及平衡Gramian矩阵,从隐藏状态快照和输出雅可比矩阵中估计逐层的可达秩、可观测秩以及联合可达-可观测秩。这些秩不仅作为隐藏状态冗余的诊断指标,还直接用作压缩后网络的实际层宽。 在MNIST和CIFAR-10上的实验表明,该方法在保持准确率几乎不变的前提下实现了显著压缩。以MNIST为例,一个四层SiLU网络的状态阶从1024降至277(压缩72.95%),参数压缩73.48%,准确率从96.60%略降至95.45%。在CIFAR-10上,一个更大规模的SiLU网络从状态阶4608压缩至1339(压缩70.94%),参数压缩83.09%,准确率几乎不变(54.45%→54.44%),CUDA推理延迟降低约3倍。 研究结果证明,平衡可达-可观测秩为设计紧凑神经网络架构提供了一种原则性的经验最小实现准则,能够在几乎不损失精度的前提下实现高效压缩。该工作为动态系统理论在深度学习压缩中的应用开辟了新路径,尤其适用于对模型体积和推理效率有严格要求的边缘计算场景。

HuggingFace1个月前原文

## 核心发现:可学习的执行“缰绳” 大型语言模型(LLM)Agent 的能力通常通过调整提示词、更换模型或编写工作流来提升,而模型外部的执行框架(harness)却被视为固定不变的基础设施。然而,最新研究《Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning》提出了一种颠覆性观点:这个“缰绳”本身就是一个可学习的控制层。 ## 方法:Harness MDP 与离线训练 研究者将执行框架的操作形式化为一个有限时域的 **Harness MDP**。在这个框架中,一个轻量级控制器负责选择结构化的执行动作(如是否调用工具、如何验证中间结果),而底层的 LLM 执行器保持冻结。控制器通过离线强化学习(Offline RL)训练——具体使用 **优势加权回归**(Advantage-Weighted Regression),仅依赖最终任务评分(terminal task-rubric rewards)作为奖励信号。 为了更精细地评估学习效果,论文还引入了 **Harness Maturity Score**(HMS),该指标衡量执行框架是否遵循可靠的执行模式,而不仅仅是最终答案是否正确。这种分离揭示了有趣的现象:最终任务质量的提升需要离线数据缓冲区中存在高回报样本的支持,而过程行为(如检查步骤)只要与优势加权动作对齐,就可以发生转变。 ## 实验结果:验证行为显著改善 在六个受控领域和两个公开基准适配器上,学习到的控制器一致地改善了验证行为,并选择性提升了最终任务质量。最大增益出现在 **tau-bench retail 适配版本**、**AgentBench DB-Bench 适配版本** 以及 **带有结构化验证器的编码任务** 中。 消融实验进一步排除了模仿学习(behavior cloning)或简单添加检查(Forced CHECK)的干扰——增益并非来自模仿或机械增加检查步骤。 ## 行业意义:解锁冻结LLM的潜力 这项研究的关键启示是:对于冻结的 LLM Agent,执行框架的控制层可以独立学习优化,从而在不修改模型本身的情况下提升 Agent 的可靠性和任务表现。同时,离线支持的限制决定了更好的过程控制何时能转化为更好的最终答案。 这一思路为 AI Agent 的工程化落地提供了新方向——与其反复调教大模型,不如训练一个轻量级的“缰绳控制器”,让执行过程更智能、更可靠。

HuggingFace1个月前原文

## 背景:DNN测试中的预算困境 在深度神经网络(DNN)测试中,现有方法通常假设一个固定的标注预算,并在此预算下优先选择最有可能揭示模型错误的测试输入。然而,实际应用中如何确定这个预算是一个难题:预算过少会遗漏关键故障,预算过多则导致不必要的标注成本。 ## 核心创新:将测试视为成本-收益决策 针对这一痛点,来自**Bonan Shen**等人的最新研究提出了一种名为**AdaStop**的成本感知早停框架。该框架将DNN测试过程建模为一个成本-收益决策过程:每次标注一个测试输入需要付出成本 \(c\),而发现一个故障则产生价值 \(v\)。基于此,AdaStop动态估计测试过程中的边际故障发现率,并在该比率低于阈值 \(\tau = c/v\) 时自动停止标注。 ## 实验结果:高效发现故障 实验覆盖了多个数据集、网络架构和测试选择策略。结果显示,AdaStop能够在仅使用 **9% 至 31%** 的标注预算的情况下,发现 **65% 至 84%** 的故障。这一数据表明,AdaStop在显著降低测试成本的同时,仍能保持较高的故障覆盖率。 ## 行业意义与未来方向 该研究为DNN测试中的预算分配提供了一种数据驱动的解决方案,尤其适用于标注成本高昂的工业场景。未来工作可能进一步探索自适应阈值设定、多任务测试等扩展方向。 论文发表于arXiv,编号 **2607.05461**,来自机器学习(cs.LG)与人工智能(cs.AI)领域。

HuggingFace1个月前原文

## 背景与挑战 在智能交通系统中,准确感知施工区的几何结构对保障安全与效率至关重要。超宽带(UWB)传感凭借低成本、低功耗的优势,成为基础设施辅助重建的理想选择。然而,户外环境中的**非视距传播、突发噪声和长尾误差**严重干扰UWB测距,导致下游空间重建产生畸变。 ## GAIA框架的核心思路 针对上述问题,来自威斯康星大学麦迪逊分校等机构的研究者提出了**GAIA**(Geometry-Aware Infrastructure-Anchored Denoiser),一种**几何感知、基础设施锚定的学习框架**。GAIA的核心创新在于将**时间序列测距建模**与**潜在锚点布局估计**相结合,并引入**确定性距离投影**,使得距离去噪任务能够引导模型学习边界一致的几何重建。 具体而言,GAIA将距离去噪作为监督任务,同时通过几何约束使学习到的距离更符合真实空间边界。这种设计避免了传统方法中“先滤波后重建”的两阶段误差累积,实现了端到端的几何一致性优化。 ## 实验验证与性能提升 研究团队在真实户外UWB数据集上进行了评估,该数据集同步采集了UWB、GNSS和IMU数据。此外,他们还利用真实数据校准的**应力测试模拟器**检验了模型的鲁棒性。实验结果显示: - **GAIA在所有评估基线中取得了最低的距离均方误差(MSE)**,相比表现最佳的基线方法PoseMLP降低了**18.4%**。 - **多边形交并比(IoU)提升了15.5%**,表明重建的施工区边界与真实几何高度吻合。 这些结果充分验证了几何感知距离去噪在空间一致重建中的有效性。 ## 行业意义与未来展望 GAIA为低成本、高精度的施工区感知提供了新路径。其**基础设施锚定**的设计天然适合车路协同场景,有望在智能路侧单元中部署,实时感知施工区动态变化。未来,该方法可进一步扩展到更复杂的动态场景,如交叉口或临时施工区域,为自动驾驶和交通管理提供可靠的几何先验。

HuggingFace1个月前原文

随着AI治理框架要求提供者和审计师提供可记录的评价证据,基于扰动的构念有效性审计成为常见形式。但一项最新研究指出,这些审计本身存在脆弱性——其结论可能被实现细节悄然操控,而读者仅凭报告数字难以察觉。 来自研究者Yanhang Li、Zhichao Fan和Zexin Zhuang的论文《Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits》提出了五种管道失败模式(F1–F5),并在安全基准和开放权重指令微调模型上进行了自我审计验证。研究采用统一的六点尽职调查门控,结果显示所有测试单元均落入非确认性区间,无一达到确认性标准。 ## 五种失败模式 - **F1: 扰动选择偏差**:扰动类型或强度的选择可能无意中偏向特定结果,导致审计结论不具代表性。 - **F2: 基准污染**:模型可能已在训练或微调中接触过基准数据,使审计结果虚高。 - **F3: 度量不匹配**:使用的评价指标与构念定义不一致,例如用准确率衡量稳健性。 - **F4: 统计效力不足**:样本量或重复次数过少,无法可靠检测真实差异。 - **F5: 报告选择性**:仅报告有利结果,忽略失败或边缘案例。 ## 关键发现 在案例分析中,研究团队对两个模型、五个基准进行了审计,所有单元格均被六点门控判定为“非确认性”。这表明,即使看似严谨的审计,也可能因实现细节而失效。研究者强调,该分类是启发性的、非穷尽的,旨在作为保证级证据的扣留与披露协议,而非替代传统构念有效性证据。 ## 行业意义 这项研究对当前AI审计实践提出警示:仅依赖基准数字可能产生虚假信心。随着监管机构要求更多审计证据,确保审计本身的可信度至关重要。六点门控协议可帮助识别审计中的潜在缺陷,但研究者明确表示,它并非通往基准有效性判决的路径,而是对现有证据体系的补充。 该论文已被ICML 2026的TAIGR Workshop接收,全文可在arXiv获取。对于AI安全与治理领域而言,这项工作是重要的自我反思——审计者也需要被审计。

HuggingFace1个月前原文

近日,一篇来自Rutgers大学研究团队的论文《Evaluating Time Series Foundation Models for Electricity Price Forecasting: Contamination Risk, Distributional Shifts, and Covariate Dependence》被ICML 2026结构化数据基础模型研讨会接收。该研究系统评估了时间序列基础模型(TSFM)在电价预测(EPF)这一高挑战场景下的表现,揭示了其优势与局限,并指出混合模型或为最优解。 ## 研究背景与核心问题 时间序列基础模型(如Lag-Llama、TimesNet等)在零样本预测中展现了不俗的潜力,但其在**协变量驱动、非平稳场景**下的泛化能力尚不明确。电价预测恰好是这类场景的典型代表:电价受天气、需求、发电组合等外部因素影响,且存在频繁的分布偏移和极端尖峰。论文特别关注了**数据污染风险**——即预训练数据可能包含测试集信息,导致评估结果虚高。为此,研究者设计了一个“双数据集基准框架”,从源头上控制污染,确保公平比较。 ## 关键发现:TSFM的“能”与“不能” 实验覆盖了点预测、概率预测、尾部行为以及尖峰捕捉等多个维度。结果如下: - **TSFM vs. 通用基线**:TSFM在多数指标上显著优于传统统计模型(如ARIMA、ETS)和通用深度学习模型(如LSTM),尤其在概率预测和尖峰预测中表现突出。 - **TSFM vs. 领域专用方法**:当与专门为EPF设计的模型(如基于专家特征的稀疏模型)对比时,TSFM并未稳定胜出。领域专用方法在特定数据集上仍有优势,尤其是在处理结构性突变时。 - **协变量依赖是关键瓶颈**:TSFM的性能高度依赖于是否提供充足的协变量(如气温、负荷、燃料价格)。在协变量缺失时,其预测误差显著上升,而领域方法对此更具鲁棒性。 - **混合模型的潜力**:最简单但最有趣的发现是,**将TSFM与领域专用模型进行集成(如简单平均)**,其效果往往超过任何单一模型。这表明两类模型捕捉了互补的预测信号——TSFM擅长模式识别,领域模型擅长结构因果。 ## 行业启示:基础模型不是万能药 该研究对AI+能源领域具有明确的实践意义: 1. **谨慎看待零样本能力**:TSFM在电价预测中并非“开箱即用”。从业者需要根据具体场景评估其协变量依赖程度,并警惕数据污染带来的虚高信心。 2. **混合策略更可靠**:与其在TSFM和领域方法之间二选一,不如构建集成系统。这与近期AI工程化的“基础模型+领域微调”趋势一致,但本文强调即使不微调,简单的后集成也能带来收益。 3. **评估框架的价值**:论文提出的双数据集基准框架可推广至其他时间序列任务(如负荷预测、金融时序),为社区提供了更可靠的评估标准。 ## 结语 随着基础模型向结构化数据领域渗透,类似电价预测这样的“硬核”场景正在成为试金石。这篇论文提醒我们:**基础模型虽强,但领域知识仍是不可或缺的“另一半”**。未来,如何设计更高效的融合机制,将是研究的重要方向。

HuggingFace1个月前原文

## 概述 零样本文本转语音(TTS)技术近年来取得了显著进步,在自然度和可懂度上表现优异。然而,现有系统在处理罕见专有名词、外来词和技术术语时,常因文本本身的歧义性而导致发音错误。即使是基于音素(phoneme)条件控制的模型,也无法对每个单词的发音进行精细的声学调控。 针对这一痛点,来自多家机构的研究者联合提出了一种名为 **GRAFT** 的全新方法。相关论文已提交至 arXiv 预印本平台。GRAFT 全称为“Grafted Reference Audio for Fine-grained Pronunciation”,其核心思想是利用一个简短的语音样本作为“提示”,精准控制目标单词在合成语音中的发音,同时保持目标说话人的音色不变。 ## 技术原理 GRAFT 的工作流程可以概括为“嫁接”: 1. **提示音编码**:用户提供某个单词的简短发音片段(可来自任意说话人),该片段经过模型自身的语音分词器(speech tokenizer)编码,形成声学表示。 2. **位置绑定**:将编码后的提示音信息与目标单词在输入文本中的位置进行绑定,确保模型在合成时将该声学特征“植入”到对应位置。 3. **说话人解耦**:在训练阶段,通过语音转换(voice conversion)技术构建数据对,将提示音中的说话人特征与目标说话人特征分离。这样,无论提示音来自谁,模型都能在输出中保持目标说话人的音色,实现“用别人的发音说自己的话”。 整个机制基于神经编解码语言模型(neural codec language modeling),在保持原有文本到语音生成框架的基础上,额外引入了单词级别的发音控制流。 ## 实验结果 研究者在英语和五种语言的客观基准上对 GRAFT 进行了全面评估: - **主观听感测试**:在盲听实验中,人类评分员一致将 GRAFT 排在首位,认为其对困难单词的发音最接近真实参考录音。 - **客观指标**:在五语言基准测试中,GRAFT 将目标单词的音素错误率(PER)降低了 **22% 至 39%**,显著优于仅使用文本的基线模型以及当前主流的开源零样本 TTS 系统(包括基于音素和基于文本的条件模型)。 - **保真度**:在提升发音准确性的同时,GRAFT 在说话人相似度和整体自然度方面与现有系统持平,未出现明显的性能折损。 ## 行业意义 GRAFT 的出现为 TTS 在专业领域的落地扫清了一个关键障碍。例如,在语音助手、有声书朗读、多语言内容生成等场景中,准确发音人名、地名和行业术语是用户体验的核心。GRAFT 提供了一种轻量级、可插拔的解决方案,无需重新训练整个模型,仅需一段简短的参考音频即可修正特定单词的发音。 未来,研究者可进一步探索如何将 GRAFT 扩展到更细粒度的韵律控制(如重音、语调),以及如何在低资源语言上保持效果。总体而言,这项工作为精细化的语音合成控制开辟了新的方向。

HuggingFace1个月前原文

**联邦学习(Federated Learning, FL)正为无人机群的目标检测任务带来隐私与性能的双赢。** 最新研究《Federated Learning for Object Detection: Enabling Collaborative Drone Learning Without Centralizing Data》表明,通过联邦学习,多架无人机可以在不共享原始航拍图像的前提下协同训练高性能目标检测模型,其表现接近集中式训练,而远超单机训练。 ### 背景:集中式数据的困境 在灾害响应、基础设施监控、国防等安全攸关场景中,无人机搭载的AI视觉系统需要持续更新目标检测模型。传统做法是将所有航拍数据集中到中央服务器进行训练。然而,这面临多重挑战: - **隐私与合规**:航拍图像可能包含敏感信息,集中存储违反数据最小化原则。 - **带宽与存储**:高分辨率图像传输占用大量带宽,边缘设备存储容量有限。 - **实时性**:数据上传延迟影响模型快速迭代。 ### 联邦学习方案:本地训练,全局共享 研究团队基于**Flower联邦学习框架**,在**KIIT-MiTA无人机数据集**上实现了目标检测的联邦学习管道。核心流程如下: 1. 每架无人机在本地保存图像数据,使用本地数据训练模型(如YOLO)。 2. 仅将模型参数(梯度或权重)上传至中央服务器。 3. 服务器聚合参数,生成全局模型,再分发回各无人机。 4. 重复迭代,直至模型收敛。 对比基线包括: - **单机训练**:仅用单架无人机数据训练。 - **集中式训练**:所有数据集中到一处训练。 ### 关键结果:轻量模型表现突出 实验采用**mAP@0.50**和**mAP@0.50:0.95**作为评估指标。最轻量的模型**YOLO26 nano**——专为边缘设备设计——在联邦学习设置下取得了: - **mAP@0.50提升52.89%**(相对单机训练) - **mAP@0.50:0.95提升67.80%** 联邦学习模型的性能与集中式训练非常接近,同时完全避免了数据集中化。这意味着无人机群可以在不牺牲检测精度的前提下,保护数据隐私并降低通信开销。 ### 行业意义与展望 这项研究对AI与边缘计算领域具有重要意义: - **赋能分布式系统**:联邦学习让无人机、IoT设备等边缘节点能够协作学习,突破数据孤岛。 - **推动隐私保护AI**:在监管趋严的背景下(如GDPR),联邦学习提供了一条合规的技术路径。 - **降低部署成本**:轻量模型(如YOLO26 nano)可直接运行在有限算力的边缘设备上,无需昂贵硬件。 未来,研究可进一步探索异构无人机群(不同传感器、算力)下的联邦学习优化,以及应对通信中断、非独立同分布数据等实际挑战。 **一句话总结**:联邦学习让无人机群“数据不动模型动”,在保护隐私的同时实现接近集中式训练的目标检测性能,为分布式AI落地提供了有力方案。

HuggingFace1个月前原文

## 摘要 近期,生成式模型在合成高质量图像方面取得了显著进展,为数据饥渴型模型提供了可扩展的训练数据。然而,现有方法往往需要训练或微调生成器,或依赖提示工程等后处理技巧,这不仅要求专业知识,还限制了通用性。针对这一问题,一篇发表于 arXiv 的新研究提出了一种生成器无关的**后生成筛选**方法:通过将真实类别划分为**同质(Homogeneous, HO)** 和**异质(Heterogeneous, HE)** 子集,并基于保真度-多样性准则对合成图像评分,从而在不重新训练的前提下有效提升下游任务性能。 ## 核心思路:对抗生成器的结构偏差 研究团队观察到,现代生成器存在一种结构性偏差:它们倾向于过度生成每个类别的**典型模式**(即同质样本),而低估类内变异(即异质样本)。这种偏差导致合成数据集在分布上过于集中,缺乏多样性,进而影响下游模型的泛化能力。 为了解决这一问题,作者提出将每个真实类别拆分为两个子集: - **同质子集**:包含该类别的典型、重复度高的样本; - **异质子集**:包含非冗余、能体现类内差异的样本。 随后,对合成图像采用**保真度-多样性准则**进行评分:奖励与真实类别语义对齐的样本,同时惩罚与同质子集过于相似的冗余样本。这样,筛选出的子集既能保持语义真实性,又能最大化类内多样性。 ## 方法优势:生成器无关且无需重训 该方法的突出优势在于**生成器无关性**:它无需访问生成器的内部参数,也无需针对特定生成器进行微调或提示工程。只需给定一个固定的合成图像池,即可通过纯后处理方式筛选出信息量最大的子集。这意味着该方法可以无缝应用于任何现有生成模型生成的图像集合,大大降低了应用门槛。 此外,该方法**不需要重新训练**任何模型,计算成本极低,适合大规模部署。 ## 实验结果:性能提升显著,数据效率更高 在多个基准测试上,该方法一致优于现有的最先进数据筛选方法。更令人印象深刻的是,它仅使用**比真实数据少 40% 的合成样本**,即可达到与真实数据训练相当的性能。 进一步实验表明,即使将该方法应用于更强的**任务微调生成器**(即专门为特定任务优化的生成器),它依然能在分类和分割任务上带来性能提升。这表明后生成筛选并非替代更优生成器的方案,而是一种**互补机制**——无论生成器多强,合理的筛选都能进一步释放合成数据的潜力。 ## 总结与展望 这项研究为合成数据的利用提供了新视角:与其投入资源改进生成器或设计复杂的后处理策略,不如直接在生成的图像池中进行智能筛选。通过简单的同质-异质分裂和保真度-多样性评分,即可显著提升下游任务性能,且不依赖特定生成器。这为数据匮乏场景(如医疗影像、自动驾驶)提供了一种低成本、高效率的解决方案。未来,该方法有望扩展到视频、3D 数据等其他模态。

HuggingFace1个月前原文

脑电图(EEG)作为一种非侵入性技术,被广泛用于探索精神病理的神经生理学基础。然而,不同EEG范式与特征粒度之间的系统证据仍然匮乏。近期,一篇发表在arXiv上的研究提出了一种**粒度感知的EEG特征管道**,将多尺度描述符组织为全局、区域和通道三个层次,并基于健康大脑网络(HBN)队列评估了对四种精神病理维度(p因子、内化、外化、注意问题)的预测能力。 该研究涵盖了四种EEG范式,包括静息态和任务态数据。考虑到儿童精神病理的异质性以及问卷评分的有限可靠性,研究者将这一设定定位为**可行性测试**而非临床筛查。结果显示,基于树的模型与粒度平衡的特征选择在部分条件下优于传统方法,但效应量仍然较小。所选标志物的可视化揭示了维度特异性的空间和频谱模式,与现有神经生理学知识大体一致。 在独立的PEARL队列上进行的跨数据集验证表明,所提出的选择原则在协议变化下仍具有技术可行性,但**不宣称跨数据集泛化能力**。整体而言,多尺度EEG特征包含与维度精神病理相关的微弱但可检测的信号,粒度感知选择有望成为未来基于EEG的表型研究中有效的特征降维策略。 ### 方法亮点 该框架的核心在于**粒度层次化设计**: - **全局特征**:捕捉整个大脑的整体活动模式; - **区域特征**:反映特定脑区(如前额叶、颞叶)的活动; - **通道特征**:保留单个电极的精细信息。 通过**粒度平衡的特征选择**,研究者避免了传统方法中偏向某一尺度的问题,从而更全面地挖掘EEG信号中的病理信息。 ### 结果与意义 尽管预测效果有限,但研究证实了多尺度EEG特征在精神病理维度预测中的潜力。这一方法为未来EEG研究提供了可参考的框架,尤其是在处理高维、低信噪比的生物信号时。研究者强调,该工作更侧重于**方法学验证**,而非直接临床应用。 ### 局限与展望 研究指出,当前模型的效应量较小,可能受到样本量、数据质量以及精神病理维度复杂性的影响。未来研究可结合深度学习或更大规模数据集进一步提升预测性能。此外,跨数据集验证的初步成功为方法的通用性提供了初步证据,但仍需更多独立验证。 总之,这项研究为利用EEG进行精神病理评估提供了新的分析视角,**粒度感知特征框架**的提出有望推动精准精神医学的发展。

HuggingFace1个月前原文

近日,一篇发表在 arXiv 上的论文提出了一种名为 **LiNO(Lifting Neural Operator)** 的新型神经算子架构,旨在解决现有神经算子难以同时捕捉全局动力学与精细尺度结构的痛点。该研究由 Himanshu Pandey 等人完成,核心创新在于将**第二代小波提升方案**引入神经算子设计,实现了数据驱动的自适应多分辨率分解。 ## 背景:神经算子的机遇与挑战 神经算子是一类学习函数空间之间映射的深度学习模型,能够直接从数据中学习微分方程的解算子,从而预测整个参数族对应的解,而非单个实例。然而,现有神经算子(如 FNO、DeepONet)在处理包含多尺度特征的物理问题时往往力不从心——要么过度平滑丢失细节,要么计算成本过高。 ## LiNO 的核心设计:提升变换与多分辨率空间 LiNO 的关键在于将**提升方案(lifting scheme)**参数化,使其成为可学习的变换。提升方案是一种构造小波的方法,其特点是计算高效且保证**精确可逆**。LiNO 通过学习数据中的自适应提升变换,将输入函数分解为**粗尺度系数**和**方向细节系数**,并在该多分辨率空间中分别演化这两类系数。这种“尺度感知”的建模方式使得算子能够同时处理全局趋势和局部振荡。 与传统的固定小波基不同,LiNO 的变换是**数据驱动**的,能够根据底层解函数的特性自动调整分解方式。同时,由于变换可逆,信息在分解和重构过程中无损,确保了多尺度学习的保真度。 ## 性能评估:覆盖多类物理现象 研究者在五个经典基准上对 LiNO 进行了测试,涵盖了不同物理行为: - **Darcy 流**(多孔介质流动) - **Poisson 方程**(椭圆型问题) - **Allen-Cahn 方程**(相场模型) - **可压缩 Navier-Stokes 方程**(流体动力学) - **Gray-Scott 反应-扩散系统**(图灵斑图) 这些基准涉及多尺度现象、输运主导动力学和混沌系统。实验结果表明,LiNO 在所有任务上均取得了**与最先进神经算子相当或更优**的表现,尤其在捕捉精细结构和长时间演化方面展现出明显优势。 ## 意义与展望 LiNO 为科学机器学习提供了一条有前景的路径:通过自适应多分辨率算子,有望在气候模拟、材料设计、流体力学等需要同时关注大尺度演化与小尺度细节的领域发挥重要作用。未来,该方向可能进一步结合物理信息约束或无监督学习,提升泛化能力与数据效率。

HuggingFace1个月前原文

时间序列预测在金融、能源、交通、公共卫生和工业监测等领域支撑着关键决策。近期涌现的基础模型虽提升了跨任务迁移能力,但大多依赖中心化数据和Transformer注意力机制,在处理长序列、高维度和隐私敏感信号时捉襟见肘。来自多所机构的研究团队提出了一种名为 **QuantFlow** 的概率预测框架,巧妙融合了倒置序列嵌入、双向Mamba状态空间解码器、分位数回归与联邦学习,为时序预测领域带来了新的解题思路。 ## 核心设计:倒置嵌入 + 双向Mamba QuantFlow 的架构设计颇具巧思。首先,它采用 **倒置序列嵌入** 策略:将每个变量在整个观测窗口上的时间步进行嵌入,而非将同一时间步的所有变量拼合。这种处理方式能更好地捕捉变量自身的长期依赖关系。随后,嵌入后的序列分别沿正向和反向送入 **双向Mamba 状态空间解码器**。Mamba 作为近年来兴起的状态空间模型,凭借线性复杂度的序列建模能力,在长序列任务上展现出超越 Transformer 的潜力。QuantFlow 通过双向处理,使模型能同时感知过去和未来的上下文信息。 最终,解码器输出被投影到 **五个条件分位数**(如 10%、25%、50%、75%、90%),从而实现概率预测,不仅给出点估计,还提供不确定性区间。此外,团队引入 **TSMixup** 数据增强方法,通过狄利克雷加权插值增加时间序列多样性,同时保持序列的结构完整性。 ## 联邦学习:隐私保护下的分布式训练 QuantFlow 的另一大亮点是内置 **联邦学习** 机制。在 20 个客户端的非独立同分布(non-IID)数据部署中,模型仅需 **三轮通信** 即可保持有用精度,且原始数据始终留在本地。这意味金融机构、医院等数据敏感方可以协作训练强大模型,而无需共享原始记录,极大拓展了实际应用场景。 ## 实验结果:优势与局限并存 在加密货币、交通流量、电力负荷、电力变压器温度(ETT)、流感和天气等六类数据集上,QuantFlow 取得了有竞争力的结果。具体指标上,在 **ETTm1** 数据集上均方误差(MSE)为 **0.2834**,在 **Weather** 数据集上为 **0.2218**,优于或持平于同类基线。 不过,论文也坦诚指出了当前版本的局限:在处理 **不规则的流行病学信号** 和 **超长预测区间** 时,QuantFlow 的泛化能力仍有不足。这提示状态空间模型在极端不规则采样和极长序列场景下,可能还需要更精细的设计。 ## 行业启示:后Transformer时代的新方向 QuantFlow 的发布正值 AI 社区对 Transformer 注意力机制进行反思的时期。Mamba 等状态空间模型凭借线性复杂度,已在语言建模和长序列任务中初露锋芒。QuantFlow 将这一思路引入时序预测,并叠加联邦学习与概率输出,为构建 **可扩展、可量化不确定性、隐私友好** 的时序基础模型指出了可行路径。对于金融风控、智慧电网、流行病监测等需要兼顾准确性与数据合规的行业而言,QuantFlow 所代表的技术方向值得密切关注。

HuggingFace1个月前原文