贝叶斯优化(Bayesian Optimization)是处理昂贵黑箱优化问题的常用方法,但它的表现很大程度上取决于所选核函数是否匹配目标函数的未知结构。传统的核函数(如RBF或Matérn)通常假设固定的平滑性,难以同时捕捉光滑趋势和陡峭突变。 近日,黄伟波与华程在提交至arXiv的论文中提出了**ALAS(Additive Learnable Alpha-Stable Kernels)**,一种基于对称α-稳定谱成分构建的灵活高斯过程核家族。其核心创新在于**通过学习稳定参数α,让核函数能自适应地调整有效平滑性**,从而从数据中同时捕捉光滑趋势和尖锐不规则性。 论文给出了两种参数化方案: - **ALAS**:单稳态成分,通过联合谱调制实现整体自适应; - **ALAS-Sep**:可分离变体,为每个维度学习独立的尾部行为,对近似可分解的目标函数更具鲁棒性。 在标准基准测试和真实世界代理模型上的实验表明,ALAS系列核在多种设置下均表现出**强劲且稳定的性能**。 ### 技术背景与意义 贝叶斯优化的核心是高斯过程代理模型,核函数决定了模型对函数平滑性的假设。传统核(如RBF)对应固定平滑度,而实际目标函数往往在不同区域具有不同平滑特性。ALAS通过将核函数表示为α-稳定分布的谱混合,α值控制尾部厚度:α=2时退化为高斯核(光滑),α<1时呈现重尾特性(允许突变)。这种可学习性使得ALAS能自动权衡偏差与方差。 ### 实验亮点 在多个合成函数和实际工程优化任务中,ALAS和ALAS-Sep均优于固定核方法(如RBF、Matérn5/2)以及自适应核方法(如SM-AGP)。特别是在含有不连续或突变区域的函数优化上,ALAS的收敛速度和最终解的质量均有显著提升。 ### 总结 ALAS为贝叶斯优化提供了一种灵活、自适应的核选择机制,降低了用户对先验知识的依赖。未来可进一步探索其在高维优化、多任务学习等场景的应用。
公交信号优先(TSP)需要在多个相互竞争的目标之间取得平衡:减少公交延误的同时,限制对非公交交通的不利影响,并避免部分车辆出现极端等待。现有的基于强化学习(RL)的TSP方法通常编码公交感知特征(如载客量和时刻表偏差),但优化的是固定奖励或固定标量化,这限制了当机构优先级随一天中的时间或中断条件变化时的操作灵活性。 本研究提出了一种**偏好条件化TSP控制器**(π(a|s,w)),它能在最小/最大绿灯时间和过渡可行性约束下选择下一个信号相位,并可通过运行时偏好参数w进行调优,以权衡公交优先重点与整体交通延误,而无需重新训练。该控制器基于IntersectionZoo实现,引入了约束信号控制/TSP封装,并通过公交普及增强和基于时刻表的公交插入扩展了场景生成,以解决训练期间稀疏的公交优先事件。 实验对比了固定时间控制、基于规则的TSP覆盖和固定权重的PPO专家系统。结果表明,单个学习到的条件化策略在运行时偏好范围内形成了平滑的经验权衡前沿,**优于固定时间和基于规则的基线**,并保持了约束可行性。尾端延误诊断显示,**非公交外部性在中等偏好设置下仍然有限**,但在高公交优先权重下会显著增加。该研究已被第29届IEEE国际智能交通系统会议(ITSC 2026)接收,代码已开源。
时间序列分类模型在部署时常常面临一个关键问题:模型输出的置信度分数是否真正反映了预测的可靠性?传统的事后校准方法通常只对输出分数进行重新映射,却忽略了输入信号本身的结构信息。一篇发表于 arXiv 的新论文《Beyond Output-Space Calibration: Spectral Evidence Bundling for Selective Reliability Estimation in Time-Series Classification》提出了一种名为 **频谱证据捆绑(Spectral Evidence Bundling)** 的方法,通过结合输出置信度与输入信号的频谱特征,更准确地估计模型预测的可靠性。 ### 三大可靠性缺口 研究者指出了当前时间序列分类可靠性估计的三个主要缺陷: 1. **相同置信度,不同支撑**:两个预测可能输出相同的置信度分数,但一个基于清晰的时间模式,另一个则来自噪声或异常信号,传统校准无法区分。 2. **平均校准掩盖高风险错误**:整体校准误差低并不意味着没有高置信度的错误预测,这类错误在关键应用中可能造成严重后果。 3. **输出空间校准缺乏输入可审计性**:仅对输出分数校准,无法追溯预测是否真正由输入信号中的有效特征支持。 ### 方法:频谱证据捆绑 + 验证门控 论文提出一种 **固定标签可靠性策略**:保持模型原始预测不变,但额外估计该预测是否可信。具体做法是: - **频谱描述符提取**:从整个时间序列样本中提取多维度频谱特征,包括**频带能量**、**谱熵**、**峰值主导度**、**周期支撑**和**相位稳定性**,形成一组“频谱证据”。 - **捆绑输出与频谱信息**:将输出置信度与频谱描述符合并,生成一个标量可靠性估计值,同时提供频带级别的诊断证据。 - **验证门控**:设置一个验证阶段,仅当频谱条件能提升正确性排名且不违反 **FalseConf@0.9**(高置信度错误率)或 **AURC**(风险覆盖曲线下面积)容忍度时,才启用频谱捆绑;否则回退到更安全的输出空间基线方法。 ### 实验表现 在 **8 个 UCR/UEA 数据集**、**8 种时间序列骨干网络**(如 ResNet、LSTM、Transformer 等)以及多种标准校准器上进行的实验表明: - **无约束的频谱捆绑方法**在匹配评估子集上,将 **Corr-AURC**(正确性排序风险覆盖)从 0.693 提升至 0.779。 - **验证门控策略**进一步将 Corr-AURC 提升至 **0.786**,并将 FalseConf@0.9 降低至 **0.094**,显著减少了高置信度错误。 ### 行业意义 这项研究为时间序列分类的可靠性估计提供了新思路。在医疗诊断、金融预测、工业监控等高风险场景中,模型不仅需要做出预测,更需要知道何时该信任自己、何时应请求人工复核。频谱证据捆绑方法通过引入输入信号的物理结构信息,弥补了纯输出校准的盲区,而验证门控机制则防止了过度依赖频谱特征的潜在风险。 论文作者来自悉尼科技大学,研究代码已公开,为后续在时间序列可靠性领域的探索奠定了基础。
大语言模型(LLM)的压缩通常依赖静态参数剪枝或动态令牌级计算,但过度稀疏化会导致性能急剧下降。最新研究提出了一种**复合稀疏性框架**,通过结合低秩近似、通道剪枝与逐令牌动态层跳过,将压缩负担分散到多个维度,从而延缓性能衰减。 ## 研究背景与动机 现有LLM压缩方法主要分为两类:静态压缩(如参数剪枝、低秩近似)和动态压缩(如条件计算、令牌级层跳过)。然而,单一维度的稀疏化在达到某个临界点后,性能会迅速恶化。研究者猜想,**将两种机制结合**可能通过分担压缩压力来推迟这一衰减点。 ## 复合稀疏性框架 该框架分两步实施: 1. **静态压缩**:先通过低秩近似和通道剪枝获得一个静态压缩的骨干网络。 2. **动态压缩**:引入轻量级路由器,为每个令牌动态决定是否跳过某些层。 这种设计使得参数稀疏性和令牌级计算稀疏性可以**独立控制**,从而探索更优的压缩组合。 ## 实验结果 在语言理解和建模基准测试中,复合稀疏性在**相同总稀疏度**下始终优于单一机制压缩: - 在理解任务上,性能衰减点明显推迟。 - 在建模任务上,保持了更强的性能。 进一步分析揭示: - **跨维度干扰**:参数剪枝与令牌跳过之间存在相互影响。 - **最优分配**:在固定稀疏预算下,**接近平衡的分配**最为有效。 ## 结论与意义 这项工作证明了复合压缩是提升LLM压缩效率的实用路径,同时揭示了更广泛的**跨维度稀疏性边界**,该边界最终限制了进一步压缩的可能性。代码将在论文链接中开源。
在文档理解任务中,如何从众多OCR引擎和多模态大语言模型(MLLM)中选出最合适的工具,一直是个难题,尤其是当标注数据稀缺时。近日,一篇发表于arXiv的论文提出了**DocOCR-Eval**,一种无需真实标注的评估框架,通过“校正与排序”策略自动评估OCR工具性能,为文档解析系统的部署提供了实用指南。 ## 背景与挑战 文档解析是视觉问答、关键信息提取等任务的基础,它把非结构化的扫描图像转化为包含文本、视觉和布局信息的结构化表示。当前,虽然OCR引擎和MLLM层出不穷,但如何针对特定文档集合选择最优方案仍缺乏系统方法。传统做法依赖人工标注来评估工具,成本高且难以规模化。此外,许多OCR引擎在上下文推理方面能力有限,而MLLM虽有潜力,但评估其文本识别性能同样需要标注数据。 ## DocOCR-Eval 的核心思路 DocOCR-Eval 的核心创新在于**无需人工标注**即可近似真实标注下的工具排序。其流程分为三个阶段: 1. **候选工具生成**:使用多个OCR引擎和MLLM对文档进行初步识别,得到多个识别结果。 2. **校正阶段**:利用一个或多个MLLM对识别结果进行校正,即对比原始图像与识别文本,输出修正后的文本。校正过程相当于提供了一种自动化的“近似真实值”。 3. **排序与选择**:基于校正后的文本与原始识别结果的差异(如编辑距离),对工具进行排序。差异越小,说明该工具性能越优。 实验表明,**聚合多个MLLM的校正结果可以逐步提升与真实标注排序的一致性**。这意味着,即使没有人工标注,DocOCR-Eval 也能可靠地识别出最适合当前文档集的OCR工具。 ## 实验验证与意义 研究者在多个跨领域、跨语言的扫描文档基准上进行了系统评估,涵盖不同类型OCR引擎和当前最先进的MLLM。结果显示,DocOCR-Eval 在标注稀缺的实际场景中能够实现可靠的工具选择,其排序与基于真实标注的排序高度相关。 这项工作的意义在于: - **降低评估门槛**:用户无需耗费大量人力进行标注,即可快速为特定文档集选择最优OCR方案。 - **提升部署效率**:对于企业级文档处理系统,DocOCR-Eval 提供了一种自动化的工具选型流程,减少试错成本。 - **推动研究进展**:为OCR和MLLM的对比研究提供了可扩展的评估范式,尤其适用于新模型快速迭代的场景。 ## 总结与展望 DocOCR-Eval 提出了一种实用且创新的框架,解决了OCR工具选择中的“无标注”困境。未来,该框架可能进一步扩展到其他文档理解任务(如布局分析、表格识别),并探索更高效的校正聚合策略。对于AI从业者而言,这无疑是一个值得关注的方向,尤其是在需要快速部署文档解析系统的实际业务中。
## 快讯:ARGO智能眼镜——边缘AI的里程碑 近日,一项发表在arXiv上的研究介绍了ARGO,一个集成了多传感器、完全在设备端运行机器学习的智能眼镜平台。该平台由EssilorLuxottica与米兰理工大学联合研发,旨在解决智能可穿戴设备在舒适性、计算性能与能效之间的平衡难题。 ### 核心突破:本地化AI处理 ARGO的核心创新在于使用**STM32N6微控制器**及其集成的**神经处理单元(NPU)**,实现了完全本地化的机器学习推理。这意味着所有数据——包括视觉、音频和传感器信息——都在眼镜上处理,无需依赖云端。这不仅将延迟降至最低,更重要的是**保障了用户隐私**,因为敏感数据不会离开设备。 ### 硬件与算法的协同设计 研究团队采用了硬件-固件-人工智能的协同设计方法。他们部署了一个经过优化的**YOLOv11模型**用于实时城市障碍物识别。为了适配NPU架构,团队提出了**头级并行注意力(HPA)**机制,这是一种架构优化,使得注意力机制能够在加速器上高效执行,同时保持原始计算逻辑。 模型在专门收集的**WOTR(Walking On The Road)数据集**上训练,最终在严格的内存限制下实现了**mAP50-95为24**(平均精度均值),而模型大小仅为**2.483 MB**。 ### 多模态传感器与续航表现 ARGO配备了一套完整的传感器组合: - **RGB摄像头**:用于视觉识别 - **飞行时间(ToF)传感器**:用于深度感知 - **麦克风**:用于音频输入 - **环境传感器**:监测光照、温度等 在200毫安时电池供电下,眼镜能以**10 FPS**的帧率连续运行约**113分钟**,展示了高效的能耗管理。 ### 行业意义与未来展望 ARGO的成果表明,高性能、隐私保护且社会可接受的辅助设备是可行的。它特别适合视障人士导航、工业巡检、增强现实等场景。随着边缘AI芯片的进步,这种**高度集成、多学科协同设计**的方法将成为未来智能可穿戴设备的主流。 研究者强调,ARGO不仅是一个原型,更代表了一种范式转变:将AI能力从云端下沉到终端,在保护隐私的同时实现实时响应。
## 从“拍脑袋”到数据驱动:张量核测试的容差校准新思路 在深度学习模型的开发与部署中,**张量核(Tensor Kernel)**的正确性测试是保障模型可靠性的关键一环。然而,当前主流做法是使用固定的“all close”检查,搭配人工指定的绝对和相对容差(atol/rtol)。这些阈值往往在不同测试间直接复制,很少根据实际算子行为进行动态调整。 近日,一篇 arXiv 论文(arXiv:2607.16228)提出了一种**算子感知的混合精度容差校准方法**,通过挖掘大规模云 GPU 运行数据,为每个测试用例自动确定更合理的容差阈值。 ### 核心发现:手工容差过于宽松 研究团队基于 **gpuemu 语料库**中的 26 个测试条目和 2 种数据类型,收集了累计 8,076 行结果数据。他们分析每个测试用例的元素级误差分布,并提出一个关键问题:**在正确实现下,内核本身能证明多大的绝对容差?** 答案令人惊讶:**自动校准的容差比手工设定的要严格得多**。例如,`attention_triton` 在 fp16 精度下的容差可收紧 **2,184 倍**。这意味着很多原本通过测试的代码可能实际上存在细微错误。 ### 实战效果:Bug 检测率提升 9.3 个百分点 为了验证方法的实用性,论文聚焦于语料库中 **7 个 LLM 风格的错误变体**(每个都有对应的正确实现)。使用校准后的 per-(op, dtype) 容差,**Bug 检测召回率从 73.2%(1,805/2,467)提升至 82.4%(2,034/2,467)**,绝对提升了 9.3 个百分点,多检测出 **229 个新错误**。 副作用是**误报率略有上升**:在 1,882 个正确控制案例中,误报从 0 增加到 20 个(+1.1 个百分点)。但考虑到检测收益,这一权衡是值得的。 ### 行业意义:通向更可靠的 AI 基础设施 这项工作对 AI 工程化实践有直接启示: - **告别“一刀切”**:不同算子、不同数据类型有独特的误差分布,统一容差会掩盖真实问题。 - **数据驱动校准**:利用云 GPU 运行积累的误差数据,可以自动生成更精准的测试标准。 - **LLM 场景尤其受益**:大型语言模型依赖大量张量运算,更严格的测试有助于提前发现数值不稳定或实现错误。 该方法已作为 8 页短文以 LNCS 格式发表,并有一系列配套论文(如 arXiv:2606.20128)进一步探讨相关主题。 ### 小结 这项研究提醒我们,在快速迭代的 AI 框架和硬件中,**测试本身也需要持续优化**。算子感知的容差校准不仅提升了测试的敏感性,也为混合精度训练和推理的可靠性提供了新工具。未来,随着更多 GPU 运行数据的积累,这种数据驱动的方法有望成为行业标准。
现代神经网络能够拟合被破坏的训练标签,这使得噪声标签学习成为研究记忆驱动过拟合的有用场景。大多数正则化方法修改目标函数、架构或数据分布;而本文研究了一种对优化器更新本身的几何干预。我们评估了 OrthoGrad,该方法移除每个权重梯度中平行于当前权重向量的分量,并在噪声标签图像分类中进行测试。在 MNIST 小数据场景下,OrthoGrad 对 CNN 的测试准确率提升最为明显,同时减少了对损坏标签的拟合。基于权重范数和梯度-权重余弦相似度的机制诊断表明,当原始梯度包含显著的径向分量时,该投影效果最强;而在大数据场景下,梯度已经几乎与权重正交,效果减弱。额外的 CIFAR-10 ResNet-18 实验显示,该方法可以改变记忆轨迹,但无法完全阻止最终的噪声标签记忆。这些结果支持正交更新约束作为研究学习动态的有用诊断工具,同时表明 OrthoGrad 的效果具有场景依赖性,而非普遍正则化。 本文已被 ICML HiLD 2026 研讨会(首尔)接收。
## 让黑箱偏好模型“开口说话”:语言驱动的偏好解释与编辑 随着机器学习在人类偏好建模中的广泛应用,一个根本性挑战日益凸显:当选择项在多个维度上存在差异时,究竟哪些因素驱动了决策?传统方法往往给出一个“黑箱”评分,用户无法检查、质疑或纠正模型。对此,麻省理工学院等机构的研究者提出了一种名为 **“weights to words”(权重到文字)** 的新方法,旨在将模型内部的数值推理转化为可读、可编辑的自然语言描述。 ### 核心思路:自动发现偏好维度 该方法的核心是:给定一组选择数据(例如用户对道德困境、电影或红酒的偏好),算法自动发现一组与领域相关的**偏好维度**,每个维度都用自然语言标签(如“道德重要性”“电影剧情深度”)表示,并对应模型表征空间中的一个向量。这些维度不仅解决了**欠确定性**(将归因集中在少数有意义因素上),还通过**外化**模型推理,让用户能够实时检查和编辑。 ### 实验验证:提升预测准确性与用户满意度 研究者在四个领域进行了定性展示:道德困境、电影、红酒和自由形式的大语言模型(LLM)响应。随后,他们开展了两个预注册的受试者实验: - **道德困境实验(N=450)**:参与者面对一系列道德两难选择。使用“权重到文字”方法提取的偏好维度(如“伤害避免”“公平性”),将模型向该基正则化后,在留出数据上的预测准确率**显著提升**。进一步,允许参与者编辑这些维度(例如调整“公平性”的权重),准确率再次提高。 - **电影选择实验(N=449)**:类似流程,参与者偏好电影类型、演员等维度。与基线模型相比,参与者更偏好该方法生成的偏好画像,并认为其预测更准确。 ### 意义与展望 这项工作的价值在于**将偏好建模从纯粹统计推断扩展为可交互的认知工具**。它使非专家用户能够理解模型为何推荐某个选项,并在发现错误时进行修正——例如,当模型错误地将“动作场面”归因于用户偏好时,用户可以直接降低该维度的权重。这种可解释性对于高风险领域(如医疗、法律、推荐系统)尤为重要。未来,该方法有望与LLM结合,实现更动态的偏好学习。 论文发表于arXiv(arXiv:2607.16232),并提供了42页的完整附录,包括22张图和14张表。
大型语言模型(LLM)正被广泛应用于医疗、金融、教育等安全关键系统,但其“无法遗忘”的特性带来了严重的网络安全、隐私与合规风险。近期一份由多所高校研究者联合发表的综述(arXiv:2607.16227)系统梳理了LLM遗忘技术(LLM Unlearning)在网络安全防御中的现状、挑战与新兴威胁,指出当前方法可能只是“抑制表达”而非“真正删除知识”。 ## 核心痛点:模型为何需要“遗忘”? LLM在训练过程中会记忆大量敏感信息——个人隐私数据、受版权保护的文本、危险领域知识等。这些信息在模型部署后仍编码在数十亿参数中,极易被提取攻击(Extraction Attacks)、越狱提示(Jailbreak)或成员推断(Membership Inference)所利用。实际案例已屡见不鲜:聊天机器人意外泄露用户隐私,或模型生成虚假法律引用导致真实财务损失。 传统解决方案如重新训练模型需要消耗巨大算力,且知识在参数中高度纠缠,无法精准定位。因此,**LLM遗忘技术**应运而生,旨在不重新训练的前提下,移除或抑制模型中特定知识,同时保持其余能力的完整性。 ## 方法之争:梯度方法主导,但有效性存疑 综述聚焦于**基于梯度的方法(Gradient-based Methods)**,这类方法因与现有训练管线兼容、可扩展至千亿参数模型而成为主流。其核心思路是通过反向传播调整参数,使模型在特定输入上“忘记”目标知识。 然而,研究提出了一个关键问题:**当前方法真的实现了“遗忘”,还是仅仅让模型在常规提示下不再输出那些信息?** 如果攻击者采用对抗性提示或模型逆向技术,被“遗忘”的知识可能再次浮现。这种“表面遗忘”现象使得现有方法在安全防御中的可靠性大打折扣。 ## 挑战与未来方向 综述指出了多项未解挑战: - **可验证遗忘(Verifiable Forgetting)**:缺乏统一标准来衡量遗忘的彻底性,现有评估指标多依赖行为测试,难以证明知识已被永久移除。 - **泛化与副作用**:遗忘特定知识可能无意中损害模型在其他相关任务上的表现,例如移除医疗数据可能导致诊断能力下降。 - **对抗鲁棒性**:攻击者可能利用遗忘过程中的漏洞,设计特殊输入来恢复被删除的知识。 - **监管合规**:欧盟《人工智能法案》等法规要求模型具备“被遗忘权”,但技术实现与法律要求之间仍有鸿沟。 ## 行业启示:遗忘是AI安全的必要防线 随着LLM深入关键领域,遗忘技术不再是学术好奇,而是**安全防御的核心组件**。类似数据脱敏,模型层面的“认知脱敏”将成为标准流程。未来研究需从三个方向突破:设计可证明的遗忘算法、建立公开的遗忘基准测试、以及探索硬件辅助的遗忘方案。 该综述为AI安全从业者提供了全景式参考,也提醒我们:在追求模型能力的同时,必须同步构建“遗忘”的能力——**能记住,更要能忘记**。
## 概述 在电商场景中,预订单运费估算的准确性直接影响价格展示、利润规划和转化率。然而,实际运费不仅取决于距离,还受到目的地需求组合、计费重量、体积定价、附加费触发条件以及合并发货等潜在运营因素的影响。传统的静态查询方法无法捕捉这些变化,而单一回归模型则可能利用强但非因果的相关性。为此,研究者提出了 **RouteCost**,一个受生产启发的多阶段框架,将问题分解为多个可解释的子任务。 ## 框架设计 RouteCost 包含四个核心阶段: 1. **时间感知需求预测**:预测未来各目的地的订单量分布,为后续运费计算提供基础。 2. **费率卡基础定价**:基于承运商费率卡计算基准运费。 3. **残差修正**:使用机器学习模型对基准运费与实际运费的偏差进行修正,捕捉非线性和隐性因素。 4. **代理合并发货推断**:通过代理变量推断发货合并效应,进一步调整成本。 最终,通过**路线加权期望公式**将路线级成本聚合为产品级运费预测。 ## 实验与效果 研究基于超过 **250,000 个订单**、**260 种产品**和 **18 个月**的订单历史数据进行了验证。结果显示,RouteCost 在预测质量和整体校准方面均有提升,同时保持了路线级别的可解释性。这证明了多阶段分解策略在复杂运费估算任务中的有效性。 ## 行业意义 该工作为电商物流成本预测提供了新思路:通过将问题分解为多个可解释的子模块,既提高了准确性,又便于业务理解和调试。未来可进一步探索与其他预测任务的联合建模,或引入更丰富的特征工程。
在当今复杂的金融市场中,投资者常常需要在多个相互冲突的目标间做出权衡,例如如何在最小化风险的同时最大化收益。传统多目标优化算法(如NSGA-II)虽被广泛使用,但在收敛性和解集多样性方面仍有提升空间。近期,一篇发表在arXiv上的论文提出了一种融合强化学习(RL)与灰色关联度系数(GRC)的增强型NSGA-II算法——**RL-NSGA-II-GRC**,旨在更高效地解决多目标优化问题,并在纳斯达克投资组合优化中取得了亮眼表现。 ## 算法核心创新 该算法的核心在于将**强化学习智能体**嵌入进化框架,通过每一代种群的**超体积、可行性和多样性**等指标,在线自适应调整进化参数,从而引导搜索走向更优的帕累托前沿。此外,论文设计了一种**基于GRC的二元锦标赛选择算子**,该算子综合考虑支配等级、拥挤距离以及与理想参考点的接近程度,计算出一个统一分数来筛选父代,有效提升了收敛速度和前沿的分布均匀性。 ## 实验验证与性能提升 研究团队首先在Kursawe和CONSTR两个标准多目标优化基准问题上进行测试。结果显示,RL-NSGA-II-GRC相比经典NSGA-II,收敛性分别提升了约**5.8%**和**4.4%**,同时保持了良好的解集分布。在更贴近实际的应用场景中,该算法被用于优化包含纳斯达克成分股的投资组合,目标是最小化风险并最大化收益。 ## 纳斯达克组合优化实证 在纳斯达克组合优化案例中,RL-NSGA-II-GRC生成了一个**平滑且密集的有效前沿**,为投资者提供了丰富的候选方案。基于该前沿,研究者识别出了**最大夏普比率组合**(年化夏普比率为**1.92**)以及针对不同风险厌恶水平的效用最优组合。这表明该算法不仅能输出理论上的帕累托最优解,还能直接支撑投资决策中的实际选择。 ## 行业意义与未来方向 这一研究为多目标优化领域提供了新的思路。将强化学习与进化算法结合,实现参数的自适应调节,有望在其他复杂优化问题(如工程参数调优、资源调度等)中得到推广。同时,GRC选择算子的引入也为处理高维目标空间提供了参考。未来,研究者可以进一步探索RL智能体的网络结构优化,以及将算法应用于更多金融产品(如期权、债券)的动态再平衡场景。 总体而言,RL-NSGA-II-GRC通过强化学习赋能传统进化算法,在收敛性和解集多样性上取得了显著进步,并在金融量化领域展现了强大的落地潜力。
## 研究背景:两种快速卷积方法的碰撞 在信号处理与机器学习领域,**循环卷积**与**二元卷积**是两种基础运算。循环卷积可通过快速傅里叶变换(FFT)在 \(O(N\log N)\) 时间内完成,而二元卷积则依赖 **Hadamard 变换**,后者因仅涉及实数值的符号翻转(±1),在计算效率和硬件友好性上更具优势。然而,若直接使用 Hadamard 变换替代 FFT 来计算循环卷积,会引入**代数误差**——这正是本篇论文的核心研究对象。 ## 三大核心发现:误差的结构化特征 来自 arXiv 的最新论文(编号 2607.15293)系统性地刻画了这种替代误差,并给出了三个互补的理论结果: ### 1. 精确误差抵消:存在零误差位置 研究发现,无论输入数据如何,**两个输入位置和两个输出位置**的误差始终为零。这意味着误差并非随机分布,而是存在固定的“安全点”。更重要的是,任何对输出顺序的重排都无法消除这些误差——它们源于代数结构的本质。 ### 2. 误差算子的秩特性:近乎满秩,零空间仅对数维度 误差算子(描述从输入到误差的映射)的秩接近满秩,但其**零空间维度仅为 \(O(\log N)\)**。这意味着绝大多数输入向量都会产生误差,但存在一个低维子空间(零空间)内的输入完全不受影响。这一发现为设计“零误差滤波器”提供了理论依据。 ### 3. 期望误差的闭式表达:对齐标量主导 通过随机滤波器平均,作者推导出期望误差的**闭式表达式**,由一个简单的“对齐标量”控制。实验表明,除零误差子空间内的滤波器外,**替代误差会使输出能量翻倍**(即能量增长因子渐近为 2)。这为误差的量化预测提供了简洁工具。 ## 行业意义:从理论到实践的桥梁 ### 对模型加速的启示 在深度学习推理中,卷积层常通过 FFT 或 Winograd 算法加速,但 Hadamard 变换的纯实数运算天然适合 FPGA 或 ASIC 实现。本文揭示的误差结构意味着: - 若能将模型权重约束在**零误差子空间**内,可无代价地使用 Hadamard 替换。 - 对于一般权重,误差的**可预测性**使得后处理补偿成为可能,例如通过微调模型参数来抵消能量翻倍效应。 ### 与 Transformer 架构的潜在关联 近年来,**多项式注意力**等变体尝试用快速变换替代 softmax 注意力中的矩阵乘法。Hadamard 变换的低复杂度使其成为候选之一,但误差问题始终是阻碍。本研究的误差结构分析或为这类架构的优化提供理论指导。 ## 小结:误差不是噪声,而是结构 这篇论文的核心贡献在于:**将“替换误差”从经验现象提升为可解析的结构问题**。误差不再是需要被“消除”的随机扰动,而是具有明确代数根源、可预测、可分类的系统性偏差。对于追求高效计算与理论严谨性的 AI 研究者而言,这无疑是一份值得深入研读的理论工具。 论文链接:arXiv:2607.15293
arXiv:2607.15412v1 Announce Type: new Abstract: Multi-objective learning (MOL) aims to optimize multiple objectives simultaneously. The multi-gradient descent algorithm (MGDA) is a workhorse that iteratively updates along a common descent or conflict-avoidant (CA) direction across objectives. In stochastic settings, however, the vanilla stochastic MGDA method, SMG, lacks a fast convergence rate because mini-batch sampling introduces noise in the gradients. This causes bias in the update directio
一项发表于 arXiv 的新研究(arXiv:2607.15433)系统比较了传统线性模型与单量子比特混合态模型在监督二分类任务中的内在可解释性。研究指出,单量子比特混合态模型本质上是线性模型的“椭球版本”——不是学习一个超平面,而是学习一个超椭球来划分数据。 ## 核心发现:从几何偏见到特征重要性 论文作者 Kaitlin Gili 通过并排对比揭示了两类模型在几何归纳偏置上的本质差异: - **线性模型**:学习一个超平面(决策边界为线性),将特征空间分为两个半空间。其决策边界由权重向量和偏置唯一确定,特征重要性直接由权重绝对值反映。 - **单量子比特混合态模型**:学习一个超椭球(决策边界为二次曲面),分类依据是数据点是否落在椭球内部或外部。该模型通过量子态的密度矩阵参数化,几何上对应一个椭球体,其形状、方向和位置由混合态参数决定。 这种几何差异带来了不同的**特征重要性归纳偏置**。在线性模型中,每个特征的贡献是独立且加性的;而在量子模型中,特征之间的交互作用内嵌于椭球的旋转和拉伸中,因此特征重要性以非线性方式耦合。 ## 可解释性的权衡 论文强调,两种模型各有优势:线性模型的超平面直观且易于解释,特征重要性可直接读取;而量子模型的超椭球能捕捉数据中的非线性结构(如聚类形状),但解释性更复杂——需要理解椭球的几何参数如何对应特征关系。 值得注意的是,单量子比特混合态模型仅使用一个量子比特,其量子态是经典混合态(非纠缠),因此其计算本质上仍可在经典计算机上高效模拟。这降低了入门门槛,但保留了量子模型中“态空间几何”的独特视角。 ## 教学价值与量子机器学习入门 作者特别指出,该对比为**量子机器学习(QML)教学**提供了平缓的切入点。对于只熟悉线性分类的读者,从“超平面”到“超椭球”的类比能自然过渡到量子模型的核心概念:量子态对应数据点,密度矩阵对应分类边界。论文鼓励高校教师在本科机器学习课程中引入这一案例,帮助学生直观理解量子模型如何以不同几何方式处理数据。 ## 行业背景 当前量子机器学习领域面临两大挑战:一是模型可解释性普遍较弱,二是与传统基线方法的对比不够清晰。本研究直接回应了这两个痛点: - **可解释性**:明确定义了“内在可解释性”的几何来源,而非仅依赖事后解释工具。 - **对比基线**:将量子模型严格对应到经典线性模型的“扩展版本”,避免了过度声称量子优势。 对于从业者而言,这一结论意味着:在数据具有椭球状分布或特征间存在非线性交互时,单量子比特模型可能比线性模型更高效;但在解释需求优先的场景中,线性模型仍是更安全的选择。 ## 小结 这项研究以简洁的几何语言连接了经典与量子分类模型,为可解释性研究提供了新视角。随着量子计算硬件的进步,理解量子模型何时真正优于经典模型将变得至关重要,而本工作正是朝着这个方向迈出的扎实一步。
## 研究背景与问题定义 在量子中继网络、闪电网络支付路由以及不可靠网格网络中的投递等场景中,智能体常需在已知有向图上寻找从源点到目标点的可靠路径,但每条边的成功概率未知且固定。每次执行路径时,若某条边失败,智能体将立即被重置回起点,并需重新开始新一轮尝试。这种“随机重置”问题被研究者称为 **Stochastic Reset Pathfinding (SRP)**,并首次被形式化为一个**情节式学习问题**。 ## 核心发现:最优策略是开环的 SRP 的关键特性在于**全局重置结构**:任何边失败都会将智能体完全重置到源点,这意味着历史信息(已成功经过的边)对后续选择没有帮助。因此,最优策略并非依赖状态的自适应策略,而是**开环策略**——即智能体在每轮开始时固定一条路径,然后整条路径执行。这一性质将 SRP 问题归入**组合级联赌博机**框架,为后续算法设计提供了理论基础。 ## 算法设计:Log-Dijkstra 元算法 研究者提出了一个名为 **Log-Dijkstra** 的元算法,其核心思想是利用对数变换将边成功概率转换为权重,再通过 Dijkstra 算法寻找最优路径。具体实现包括两种变体: - **PathUCB**:基于上置信界算法,为每条边维护一个置信区间,选择对数权重下界最小的路径。 - **PathTS**:基于**汤普森采样**,从每条边成功概率的后验分布中采样,再选择对数权重最小的路径。 ## 理论贡献:路径级遗憾界 主要理论成果是 **PathUCB** 的**路径级遗憾界**。不同于传统级联赌博机中基于单边遗憾的边界,该界将遗憾分解为每条次优路径的复杂度 \(C(\pi)\),该复杂度综合了路径中每条边的**前缀可靠性和后缀可靠性**。当图中源点到目标点路径数量为多项式级时,该边界比边级边界更紧,且能更好解释结构化图上的学习行为。 ## 实验验证与建议 在**量子网络、分层有向无环图、网格世界和随机图**等多种域上的实验表明,**PathTS 通常在实证表现上最优**。然而,研究者也构造了一个对抗性实例,在该实例中 PathTS 无法收敛,这与已知的“组合汤普森采样在乘性奖励问题上的指数级障碍”一致。因此,作者推荐 **PathTS 作为实践中的默认算法**,同时提醒用户注意对抗性实例的存在。 ## 总结与展望 SRP 问题的提出为处理重置型路径选择提供了严谨的数学框架,其算法可直接应用于量子密钥分发网络中的纠缠分发路线选择、闪电网络中的支付通道选择,以及灾难场景下不可靠通信网络的报文投递。未来工作可探索更复杂的重置模式(如部分重置)、边概率随时间变化的环境,以及与其他组合学习问题的交叉。
## 当“越大越好”遇上量子计算:为何概率扩展策略在量子程序生成中失效? 在AI领域,“缩放假说”(scaling hypothesis)占据主导地位——模型参数越多,涌现的推理能力就越强。然而,一篇被ICML 2026接收的立场论文却对此提出尖锐质疑:将这种概率范式应用于通用量子电路合成,是一个方向性错误。 ### 量子电路的语言鸿沟:语法与语义的断裂 与自然语言不同,量子电路必须严格遵守数学约束。论文作者指出,量子程序存在显著的**语法-语义差距**:模型通过训练可以学会生成“看起来像”量子电路的语法结构,却无法捕捉希尔伯特空间中的物理语义。例如,一个电路可能在语法上有效(门操作排列正确),但在物理上却毫无意义(违反酉性、纠缠限制等)。 更棘手的是,随着量子比特数增加,有效电路设计空间呈指数级衰减。这意味着,试图通过**事后过滤**来剔除无效电路在数学上是不可行的——穷举验证本身就是一个指数级难题。 ### 从“人类中心”到“验证中心”:架构层面的范式转移 论文提出了一个关键转向:放弃以人类为中心的“副驾驶”模式,转而构建**以验证器为中心的智能体**。具体方案包括: - **层次化约束**:将量子力学的层级规则(如酉性、可逆性)直接编码进生成过程。 - **拓扑掩码**:限制电路拓扑结构,确保生成路径符合物理可实现性。 - **符号代理**:使用符号推理模块替代部分概率采样,确保每一步都满足数学正确性。 这些机制的本质是**在生成过程中嵌入领域知识**,而非依赖模型在事后“纠正”错误。 ### 规模无法弥合的有效性鸿沟 核心论点非常明确:**仅靠扩大模型规模无法弥合量子程序生成中的有效性鸿沟**。即使参数达到万亿级别,如果模型学习的只是语法模式而非物理语义,生成的电路依然大概率无效。这与其他AI领域(如代码生成、自然语言)的情况形成鲜明对比——在这些领域,缩放确实提升了语法和语义的准确性,因为自然语言和通用编程语言的约束相对宽松。 ### 对AI与量子计算交叉领域的启示 这项研究对当前AI+量子计算的探索具有警示意义。许多工作试图用大模型直接生成量子电路,但往往忽略了量子信息领域特有的“规则优先”特性。论文呼吁:生成方法应**编码任务特定的量子信息规则**,而非单纯模仿人类设计的电路样本。 对于研究人员而言,这意味着需要重新思考模型架构:是否应该引入可微分验证器?是否需要在潜在空间中强制施加酉性约束?这些问题的答案,可能决定了AI能否真正成为量子程序合成的有效工具。 ### 小结 在量子计算领域,“更大”并不总是“更好”。这篇立场论文提醒我们:当目标领域存在严格的数学约束时,**有效性必须优先于概率扩展**。未来的量子程序生成,或许将走上一条融合符号推理与神经网络的“验证优先”之路。
大语言模型(LLM)正逐步渗透金融领域,但它们真的能胜任技术分析吗?一篇来自佐治亚理工学院的最新研究论文对此进行了系统评估,对比了 **GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 70B** 以及金融专用模型 **FinGPT** 在四项任务中的表现:K线形态识别、方向信号生成(买入/卖出/持有)、信号回测和财报理解。 ### 核心发现:谁更胜一筹? 在模拟回测中,**GPT-4 Turbo** 在通用模型中取得了最高的年化收益率和夏普比率,表现亮眼。而 **FinGPT** 凭借领域微调,在风险调整后收益上展现出竞争力——两者在测试条件下均跑赢了被动标普500基准。 ### 不可忽视的“暗面” 尽管成绩不俗,研究也揭示了所有模型的 **共性缺陷**: - **数字幻觉**:模型会生成不存在的数值,这在金融交易中可能造成灾难性后果。 - **上下文窗口限制**:处理长序列历史数据时,模型容易“忘记”早期信息。 - **横盘市场表现不稳**:在趋势不明显时,模型信号一致性下降。 ### 结论:潜力与现实之间 研究指出,LLM 在 AI 交易系统中确实具备潜力,但稳健部署需要 **任务分解、严格回测和领域微调**。简单拿通用模型直接“炒股”并不可取——专业金融场景仍需针对性优化。 ### 简要小结 该研究为 LLM 在量化交易中的实用性提供了宝贵基准,既展示了头部模型的能力边界,也敲响了安全与可靠性的警钟。对于从业者而言,这意味着:**模型选型需谨慎,回测流程不可少,领域知识是关键**。
## 当黑箱模型遇到医学:透明性为何如此重要? 人工智能在医疗领域的落地面临一个核心矛盾:**最先进的模型往往是“黑箱”**,其决策过程难以解释,医生和患者难以信任,且在不同数据集间难以复现。这种不透明性直接限制了AI在临床中的大规模应用。 ## 新框架:基于统计的阈值二值化 针对这一问题,一篇新论文提出了一种**基于统计的、完全可解释的分类框架**,核心思想是:**让模型简单到只需一张参考表和基础算术就能复现推理过程**。 该框架的核心组件是**伯努利朴素贝叶斯(BNB)模型**。为了让BNB能处理连续型医疗数据(如血糖、肿瘤尺寸),研究者引入了一种**监督式χ²引导的统计二值化方法**: - 对每个连续变量,自动寻找最佳切分阈值,使该变量与临床结局的关联性最大; - 将连续值转化为“高/低”或“阳性/阴性”等二元特征。 这样一来,BNB模型就能在保持其天然透明性的同时,有效处理连续数据,生成**可解释的“if-then”规则**,例如“如果血糖 > 126 mg/dL 且 年龄 > 50,则风险增加”。 ## 性能验证:不输复杂模型 研究者在三个经典医疗数据集上验证了该框架: - **Pima印第安人糖尿病数据集**:AUC = 0.800 - **威斯康星乳腺癌数据集**:AUC = 0.984 - **心力衰竭预测数据集**:AUC = 0.919 这些结果与随机森林、支持向量机等复杂模型相当,甚至更优。更重要的是,模型还通过了**泄漏安全的交叉验证校准分析**(包括Brier分数、校准截距/斜率、事后Beta校准),确保了概率输出的可靠性。 ## 透明性的极致:一张纸就能复现的推理 论文最引人注目的地方在于,作者给出了一个**完整的工作示例**:仅凭一张包含阈值和权重的参考表,加上四则运算,任何临床医生都可以手动复现模型对单个患者的预测结果——无需任何软件或专有工具。 这意味着: - **审计和验证**变得极其简单; - **监管审批**路径更清晰; - **临床采纳**的门槛大幅降低。 ## 意义与展望 这项工作的价值不仅在于提出了一个高性能的可解释模型,更在于它**重新定义了“可解释性”的实践标准**——不是提供特征重要性排名或局部解释,而是让整个决策过程完全透明、可手动复现。 对于医疗AI领域,这种“白箱”方法可能比追求更复杂的模型更有实际意义。未来,该框架有望扩展到更多临床场景,成为连接AI能力与临床信任的桥梁。
## 引言 在医学影像分析领域,紧凑型分类器往往需要在**效率**与**可解释性**之间做出权衡。传统方法通常将两者分开处理,导致模型要么轻量但缺乏透明度,要么可解释却计算开销大。近期,一篇发表于 arXiv 的论文提出了 **qZACH-ViT**,一种量化感知的视觉 Transformer 变体,旨在同时实现高效部署与内在可解释性。 ## 核心方法 qZACH-ViT 基于 **ZACH-ViT** 骨干网络进行扩展,摒弃了传统的 CLS token 和位置编码,转而通过递归方式生成**内在的块级类别证据**。其关键创新在于引入了 **递归归因稳定优化(RASO)**:该方法通过范数匹配分类梯度与归因梯度,并移除与分类目标冲突的归因分量,从而在训练过程中稳定归因图的质量。 此外,qZACH-ViT 支持**混合精度 INT8 量化**,可将模型转换为可执行的 ONNX 格式。论文在 **7 个 MedMNIST 数据集**上进行了严格评估,每个类别仅使用 50 张训练图像,通过 10 个固定随机种子完成 280 次实验,共生成 210 个检查点并全部转换为 INT8 图。 ## 实验结果 结果令人印象深刻: - **性能提升**:混合精度 INT8 的 qZACH-ViT(使用 Adam 优化器)在所有 7 个数据集上的平均主要指标比 FP32 的 ZACH-ViT 基线提高了 **0.0313**;若结合 RASO,平均增益进一步升至 **0.0368**。 - **量化保真度**:在 964,920 次源模型与 INT8 模型的对比中,预测一致率高达 **99.9751%**,主要指标的平均绝对变化仅为 **0.000133**,最大值也仅 0.004386。 - **归因稳定性**:在 3,600 组匹配的内在归因图中,平均余弦相似度为 **0.999955**,平均秩相关系数为 **0.9944**,平均 top-10% 重叠率达到 **0.9692**。 - **部署效率**:ONNX 工件比源检查点体积缩小 **70.0%**,在 CPU 上使用单线程和四线程时,端到端速度分别提升 **1.41 倍** 和 **2.39 倍**。 RASO 还显著降低了充分性误差,并提高了输入噪声稳定性,尽管并非在所有可解释 AI 指标上都占据绝对优势。 ## 结论与意义 qZACH-ViT 的成功表明,**量化感知训练与内在可解释性可以协同工作**,而无需牺牲模型性能或解释质量。该研究为在资源受限的医疗场景中部署可信赖的 AI 系统提供了实用路径——模型不仅更小更快,还能提供稳定、一致的块级证据,有助于临床决策的验证。 RASO 作为一种面向稳定性的优化方法,也为后续研究提供了新思路:通过显式约束归因梯度,可使解释更加鲁棒。未来,这一框架有望扩展到更复杂的医学影像任务,并推动边缘设备上的实时可解释诊断。