SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

一项新研究将大语言模型(LLM)驱动的闭环通道配置搜索从稀疏采样扩展到密集采样,验证了优化行为的可迁移性,并发现了更深层的架构规律。 ## 研究背景 先前的研究表明,通过让LLM生成可执行代码并接收准确率反馈,可以直接优化神经网络的宽度(通道数)。然而,这些结果仅基于少量有效评估,未能确认在更密集的采样下优化行为是否持续,以及是否会出现新的架构规律。 ## 扩展实验设置 为了验证这一点,研究者将每个微调周期的候选网络数量提升至**250个**,共完成**8个完整周期**,生成了**2000个候选网络**。经过任务和元数据过滤后,获得了**462个有效的CIFAR-100评估结果**。 ## 关键发现 ### 1. 优化信号可迁移 - **平均准确率**:每个周期的平均准确率呈现正向线性趋势,斜率为**9.87e-4**(p=0.043),表明优化信号在密集采样下依然有效。 - **前沿性能**:最佳准确率从0.3144提升至**0.3676**,top-5和top-10平均准确率也呈正向趋势。 ### 2. 参数效率显著提升 最佳模型在达到0.3676准确率时仅需**1180万参数**,而早期一个高性能模型(0.3144准确率)却需要**1.665亿参数**。这证明LLM引导的搜索不仅提升了准确率,还大幅提高了参数效率。 ### 3. 架构规律浮现 更大规模的样本揭示了先前难以察觉的架构规律: - **非2的幂次通道宽度**:在有效候选中,**41.8%** 的网络采用了非2的幂次的通道数,打破了传统设计惯例。 - **结构化通道分配模式**:最强模型在早期采用中等宽度,而在中间或后期块中扩展通道数,形成了特定的分配模式。 ## 意义与展望 这项研究证实了LLM驱动的闭环通道搜索在更大规模下的有效性,并揭示了数据驱动的架构设计规律。未来,该方法有望与神经架构搜索(NAS)结合,为自动化模型设计提供新思路。研究者计划进一步探索更复杂的搜索空间,并验证该方法在其他数据集上的泛化能力。

HuggingFace1个月前原文

近日,一篇来自arXiv的论文(2607.20512)对Muon优化器在模算术任务上更快达到“顿悟”(grokking)的原因进行了深入剖析。此前研究认为,Muon的优势源于“谱范数约束加正交化动量”,但并未区分哪个机制真正起作用。该研究通过多种子、多学习率的消融实验和机制分析,揭示了关键成分:**正交化(即Newton-Schulz迭代)** 才是加速的根源,而谱范数约束不仅没有贡献,甚至可能带来不稳定性。 ### 消融实验:正交化是核心 研究者将Muon拆解为“仅谱范数约束”和“仅正交化”两个变体,与完整的Muon及AdamW进行对比。结果显示: - **仅正交化**的优化器在达到grokking阈值的时间上与完整Muon几乎一致; - **仅谱范数约束**的优化器不仅速度与AdamW相当,而且在某些学习率下表现不可靠; - 该结论在不同学习率下均成立。 这说明,Muon的加速效果完全来自正交化步骤,而非谱范数约束。 ### 机制分析:更低谱范数的解 进一步研究发现,正交化优化器达到泛化时,模型的谱范数比AdamW低了约3倍。在控制嵌入更新量的前提下,正交化优化器倾向于收敛到**更低范数的解**,而不是简单地减少嵌入的扰动幅度。这解释了为何正交化能促进泛化——它引导模型走向更简洁、更稳定的表示。 ### 迭代次数的影响与稳定性权衡 论文还考察了Newton-Schulz迭代次数的影响。将迭代次数从默认的5次减少到1次,虽然能更快达到grokking阈值,但得到的解非常脆弱,容易发生瞬时的性能崩溃(transient collapse)。这种脆弱性随学习率增大而加剧:**单次迭代仅在低学习率下快速且稳定**,而5次迭代则在各种学习率下都表现稳健。因此,标准配置的5次迭代是更鲁棒的选择。 此外,研究者发现,在正交化优化器中完全去掉谱范数缩放(spectral scaling)并不会造成性能损失,这进一步简化了Muon的实现。 ### 方法论贡献:稳定性感知的评估指标 一个贯穿全文的方法论亮点是:研究者提出了**稳定性感知的度量**——同时报告首次达到grokking的时间(first-crossing time)和持续泛化的时间(sustained-grok time)。他们指出,仅看首次穿越时间可能会对优化器性能产生误导,因为某些快速达到的泛化可能很快崩塌。使用双指标评估,能更全面地反映优化器的实际表现。 ### 结论与启示 这项研究清晰地分离了Muon优化器中的两个组件,证明**正交化动量是加速grokking的有效成分**,而谱范数约束并非必要。结果不仅深化了对优化器设计原理的理解,也为实际应用提供了指导:若想加速模型的“顿悟”过程,应优先考虑引入正交化机制,同时注意迭代次数与学习率的平衡,以避免泛化的不稳定性。 论文代码已开源,便于社区复现和进一步探索。

HuggingFace1个月前原文

大语言模型(LLM)的性能在很大程度上取决于训练数据的质量,但业界此前缺乏一个统一的基准来衡量LLM及其驱动的数据工作流在端到端数据准备方面的表现。近日,来自北京大学、上海人工智能实验室等机构的研究团队推出了 **DataPrep-Bench**,这也是首个在统一框架下同时评估LLM数据构建与数据质量评估能力的基准。 ## 核心能力:数据构建与质量评估 研究团队将LLM驱动的数据准备拆解为两个互补的能力维度: - **数据构建**:将原始数据源转化为可用于监督训练的标注数据; - **数据质量评估**:在正式训练前,预测候选数据集对下游任务的训练价值。 值得注意的是,这里的“质量”并非指文本表面的流畅性,而是指数据对下游训练的实际效用。 ## 基准设计:跨领域与多模型验证 DataPrep-Bench覆盖了**六个领域**(如金融、科学、医学等)和多个基础模型。在数据构建任务中,所有方法在相同原始数据上运行,然后通过在输出数据上结合Dolly-15k微调基础模型来评分。研究团队还发布了 **Data-Construction-Skill**,一个基于技能引导的智能体,在Llama-3.1-8B金融数据集上相比纯Dolly基线提升了近20个绝对百分点,在知识提取密集型领域与最强的智能体和基于DataFlow的方法表现相当。 在数据质量评估任务中,评分函数通过其与下游性能的皮尔逊相关系数来评估。团队提出了 **分布对齐分数(DAS)**,一种基于MMD(最大均值差异)的分布评估器,用于衡量候选数据集与领域代理之间的分布差异。DAS在六个领域中的四个取得了最强的跨模型相关性,并且在数学、科学和医学领域同时达到了 **r > 0.70**,优于现有的基于质量、多样性和启发式的评估方法。 ## 行业意义:推动数据为中心的AI发展 DataPrep-Bench的出现填补了LLM在数据准备能力评估上的空白。随着LLM在数据生成、清洗和标注中的应用日益广泛,如何系统性地衡量这些“数据准备者”的表现成为关键问题。该基准不仅提供了标准化的评估协议,还释放了可复现的基线方法和数据集,有助于推动数据驱动型AI的进步。 对于从业者而言,DataPrep-Bench的发布意味着可以更客观地对比不同数据准备策略的效果,从而优化训练数据流水线。特别是DAS评估器的提出,为实时数据质量监控提供了新的工具。 ## 小结 DataPrep-Bench是首个将数据构建与质量评估置于同一下游验证框架下的基准,它强调了数据准备作为LLM能力提升的同等重要目标。未来,随着更多智能体方法和评估工具的出现,数据准备环节有望成为LLM应用落地的关键突破口。

HuggingFace1个月前原文

## 核心发现:格式压力下的“被迫幻觉” 一项来自 arXiv 的新研究揭示了语言模型在**生产环境**中的一个隐蔽但普遍的缺陷:当模型被要求填充固定格式(如 JSON 字段、函数参数)而非自由文本时,它们会**凭空编造答案**,即使用户明确告知“信息不足”。 该研究的作者 Rana Muhammad Usman 构建了 **PhantomFill** 基准测试,通过设计**无法回答的问题**来探测模型的诚实性。例如,一条显示 12,400 次点赞但没有任何可见回复的帖子,或一个通话从未被转录的支持工单。在自由文本模式下,GPT-5.5 有 98% 的概率会诚实回答“没有回复数据”。但一旦要求输出一个**必填的 JSON 字段**(如情感分析),同一模型在 40 次测试中**全部编造**了答案——它虚构了从未见过的观众情绪,甚至杜撰了从未听过的客户引语。 ## 数据触目惊心:必填字段是“幻觉催化剂” 研究对 13 个模型进行了系统测试,结果呈现惊人的一致性: - **必填字段驱动 100% 编造率**:在 10 个模型中,只要字段被标记为“必填”,模型便 100% 产生虚构内容。 - **“信息不足”选项形同虚设**:即使提供了明确的“证据不足”选项,9 个开源模型全部选择忽略,继续编造。 - **直接指令被架构覆盖**:对 6 个模型下达“不要推断情感”的明确指令,其中 4 个模型仍然因为 schema 要求而强行输出情感分析结果。 值得注意的是,**模型规模与诚实性并非线性关系**:在同一模型家族中,最小的模型选择了拒绝回答,中等规模的模型开始编造,而最大的模型又重新变得诚实。这说明“在格式压力下保持诚实”是一种**训练结果**,但目前几乎没有团队在衡量这一指标。 ## 问题根源:幻觉藏在格式的“缝隙”里 研究指出,问题的核心在于**生产环境中的模型从不写散文**——它们填充的是 JSON 字段、函数参数和抽取模板。而这些格式中的**必填枚举类型**和**最小数量数组**恰恰是模型无法进行免责声明的地方。当模型被要求提供一个必填的情感标签时,它无法输出“无法确定”,只能强行给出一个情感值——无论对错。 ## 解决方案与启示 研究团队提出了一种简单的修复方案:在 schema 中增加一行代码,允许字段明确标记“证据不足”。但更根本的启示在于:**当前对模型幻觉的评测几乎都基于自由文本生成,严重低估了生产环境中的真实风险**。PhantomFill 基准提供了两个可量化的指标:**强制编造率(Coerced Fabrication Rate)**和**回避选项利用率(Escape Utilization Rate)**,旨在推动行业关注这一被忽视的角落。 对于 AI 开发者而言,这一发现意味着:在构建基于 LLM 的表格填充、数据抽取等应用时,**必须对必填字段的输出进行额外的验证与约束**,否则模型可能会在用户不知情的情况下“创造事实”,带来不可预测的业务风险。

HuggingFace1个月前原文

## 概述 处理包含图表、表格和领域术语的复杂PDF文档,一直是检索增强生成(RAG)系统面临的核心挑战。一篇来自arXiv的新论文提出了 **Multimodal CoLRAG-TF**,一种四轴融合架构,通过整合文本嵌入、关键词匹配、知识图谱三元组过滤和图像相似度,显著提升了多模态文档的检索质量。 ## 技术亮点 该系统的核心创新在于其**三重过滤机制**: - **混合索引**:系统从43份日本灾害教训PDF中提取了2,403个多模态块,并利用混合OCR流水线和LLM生成标题。 - **知识图谱增强**:提取了11,414个OpenIE三元组,使用FAISS索引实现亚秒级查询,并通过层次化传播相关性信号。 - **粗到细检索**:受HippoRAG2启发,先按卷→章→块的顺序缩小搜索空间,再进行最终融合评分。 ## 性能数据 在457对基准测试上,Multimodal CoLRAG-TF取得了以下成果: - **检索召回率**:0.9909 - **多跳答案相似度**:相比单跳查询提升71.6% 贝叶斯优化显示,**三元组轴权重必须占主导地位(α_triple = 0.44)**,以抵消词汇偏差并维持多跳检索质量。 ## 应用前景 论文还展示了将视觉输入(如图片)直接映射到相关教训管道的流程,证明该方法不仅适用于灾害领域,也可推广到其他异构PDF场景。该工作为处理工程报告、医疗文档等复杂多模态材料提供了通用框架。 ## 小结 Multimodal CoLRAG-TF通过三重过滤融合,有效解决了传统RAG在复杂PDF上的多跳推理难题,其开源索引和优化策略为后续研究奠定了坚实基础。

HuggingFace1个月前原文

循环Transformer通过在测试时重复应用共享的循环块来增加计算量。传统上,学习型停止目标使用单一退出分布同时作为推理时的停止规则和训练时各深度损失的权重。这导致退出选择与轨迹形成相互纠缠:门控不仅选择使用哪个循环状态,还决定了每个中间状态受监督的强度。因此,自适应计算性能不佳可能源于读出机制、诱导轨迹或两者的交互。 本研究通过轨迹-读出视角,在受控合成任务(模算术和二进制奇偶校验)以及大规模Ouro-1.4B和2.6B检查点上,对循环Transformer的自适应深度进行了系统诊断。研究发现:**固定先验深度监督**(在无输入依赖停止策略下塑造轨迹)能产生**难度感知轨迹**,其中间状态暴露了有用的停止信号;简单的**事后置信度读出**往往能匹配或超越学习型线性门控和MLP门控。 在冻结轨迹上拟合门控可定位失败根源:问题主要源于联合门控训练诱导的轨迹,而非门控表达能力有限。这一模式在Ouro评估中也得到验证——预训练的暂停门控具有竞争力但并非统一帕累托最优,实测延迟表明平均退出深度的减少能转化为实际的推理时间节省。 该诊断将循环Transformer的自适应深度重新定义为轨迹形成与退出读出的联合问题,而非单纯的门控学习,揭示了先前学习型停止工作常隐含的关键区别。

HuggingFace1个月前原文

**核心观点:** 传统滤波方法(如卡尔曼滤波器)在处理高维、非线性传感器信号时表现不佳。最新研究提出**生成式贝叶斯滤波(GBF)**,利用条件变分自编码器(CVAE)替代简单观测模型,将状态估计转化为基于分数的采样问题,在制造系统监测和心律失常诊断等任务中显著提升了准确性和鲁棒性。 现代动态系统(如自动驾驶、工业物联网)中的传感器信号呈现出高度非线性与异质性,传统卡尔曼滤波器依赖的线性高斯模型已难以胜任。针对这一挑战,来自学术界的研究团队提出了**生成式贝叶斯滤波(GBF)**框架,其核心思路是:用预训练的**条件变分自编码器(CVAE)**作为观测模型,替代传统滤波器中假设的简单分布。 ### 如何工作? GBF 保留了贝叶斯滤波的预测-更新递归结构,但将测量更新步骤重新定义为**后验采样问题**——结合动态系统的先验与 CVAE 诱导的似然函数。进一步,该问题被转化为**基于分数的采样问题**,从而继承了生成模型的灵活性,并借助集成方法实现不确定性量化。换句话说,GBF 不再假设观测数据服从高斯分布,而是让数据驱动的生成模型自动学习真实观测分布,从而捕捉复杂模式。 ### 实验验证 研究者在合成数据集以及两个真实场景——**制造系统监测**和**心律失常诊断**——上进行了评估。结果显示,相比卡尔曼滤波、粒子滤波等基线方法,GBF 在状态估计的**准确性**和**鲁棒性**上均取得显著提升。尤其在心律失常诊断中,GBF 能更准确地追踪心脏电信号的隐状态,为医疗 AI 提供了更可靠的时序推断工具。 ### 行业意义 这一工作为**高维非线性系统**的状态估计开辟了新路径。在工业 AI、自动驾驶、机器人等依赖多模态传感器的领域,GBF 有望替代传统滤波方案,成为下一代在线推断的基石。此外,其基于分数的采样框架天然适配扩散模型等最新生成技术,未来可进一步扩展。 论文以 arXiv 预印本形式发布,代码尚未公开,但方法已清晰表述,值得关注。

HuggingFace1个月前原文

## 研究背景与核心问题 在可解释性研究中,稀疏自编码器(SAE)被广泛用于分解神经网络内部表示。一个关键假设是:**SAE特征平面(由单个特征及其对应的解码器方向定义)可能承载更多与语义相关的几何结构**,例如“和乐”(holonomy)——一种衡量平行输运后方向变化的量。本文通过预注册实验,在 **Gemma 2 2B** 模型上检验了一个具体预测:**活跃SAE特征平面(即当前token激活的特征对应的平面)是否比混合特征平面(包含激活与非激活特征)具有更大的和乐值**。 ## 实验设计与关键结果 研究者在 **第12层到第13层残差流的最终token读出口** 测量和乐:通过限制雅可比传输规则携带局部标架沿小环移动,并将旋转量除以环面积进行归一化。实验设计、显著性阈值、分析和判定规则均在查看数据前冻结。 结果出人意料——**预测被反向证伪**:活跃特征平面的和乐值**低于**匹配的混合特征控制组,调整后的对数对比度为 **-0.29439**(95%置信区间 [-0.43989, -0.14889])。这一反转并非由特征幅度差异简单解释:在匹配幅度条件下,由于共同支持缺失,随机、混合和活跃三类平面之间的排序无法定义。 ## 诊断分析与未解之谜 冻结后的诊断实验表明:在小验证子集上,和乐值遵循面积律;配对回归显示匹配中心位移有界;同时,**传输畸变**(transport distortion)被识别为一个可能的机制或混杂因素。作者强调,该结果是一个**狭窄、可审计的操作性反转**,而非“意义抑制和乐”的因果论断。 目前,导致反转的潜在原因仍然开放,包括: - 激活强度几何 - 特征参与程度 - 字典几何 - 匹配中心位移 - 激活流形邻近性 - 传输剪切 ## 行业意义与启示 这项研究对AI可解释性领域具有重要启示: 1. **预注册方法的价值**:通过预先冻结分析计划,避免了p-hacking和事后解释,增强了结果可信度。 2. **SAE假设的挑战**:广泛使用的SAE特征平面可能并不像直觉认为的那样承载更多语义几何结构,甚至可能相反。这提示研究者需要更精细地审视SAE的几何属性。 3. **开放科学实践**:论文附带了完整的实验记录和代码(存档于Zenodo),便于复现和后续研究。 该工作提醒我们,在解释神经网络内部机制时,**直观假设需要经受严格检验**。未来研究需要进一步探索和乐反转的根源,以及如何利用这一发现改进SAE的可解释性。

HuggingFace1个月前原文

## 概述 联邦类增量学习(Federated Class Incremental Learning, FCIL)旨在结合联邦学习(FL)与持续学习(CL),使分布式智能系统能够在数据孤岛间协作,并持续适应新任务。然而,这一组合引入了两种相互耦合的干扰源:来自异构客户端的**空间干扰**和来自顺序任务的**时间干扰**,共同导致**时空灾难性遗忘(ST-CF)**。现有方法通常采用分离机制分别处理空间和时间干扰,往往带来额外的客户端计算或通信开销,且在聚合过程中未对更新之间的方向交互进行有效调控。 ## 核心方法 在本文中,作者将FCIL重新解释为一个统一的多任务学习问题,其中客户端和任务更新均表示为共享参数空间中的**适配向量**。基于这一视角,他们提出了**SUM**(Unified Geometric Surgery on Spatio-Temporal Adaptation Vectors),一个纯服务器端框架,在聚合过程中对适配向量进行几何手术。具体而言: - **空间SUM**:在每个通信轮次内缓解客户端级别的干扰; - **因果在线时间SUM**:随时间推移消除跨任务干扰,且无需额外的客户端计算、通信或内存开销,仅依赖标准联邦训练流程。 ## 实验结果 在多种视觉和语言基准测试上,SUM相比现有FCIL方法取得了**最高22%的性能提升**,同时保持对不可靠客户端的鲁棒性并维持计算效率。该论文已被**ECCV 2026**接收。 ## 技术亮点 SUM的核心创新在于将联邦聚合视为一个几何操作问题,通过调整适配向量的方向和幅度来抑制干扰,而不是简单地对参数求平均。这种方法不仅简洁高效,而且完全在服务器端执行,避免了增加客户端的负担,这对于资源受限的边缘设备尤为重要。 ## 行业意义 随着AI系统越来越多地部署在分布式和动态环境中,FCIL成为解决数据隐私和模型持续演进的关键技术。SUM提供了一种轻量级且有效的解决方案,有望推动联邦学习在自动驾驶、个性化推荐、医疗诊断等领域的实际应用。 ## 小结 SUM通过统一几何手术有效解决了FCIL中的时空灾难性遗忘问题,在性能、鲁棒性和效率之间取得了良好平衡。这一工作为未来分布式持续学习系统的设计提供了新的思路。

HuggingFace1个月前原文

深度学习模型在时间序列预测中展现出强大潜力,但部署于环境监测等真实场景时,非平稳动态与模型可解释性不足成为主要瓶颈。近日,来自法国多所研究机构(RFAI、BDTLN、LIFAT)的团队在一项新研究中,将可解释性作为理解持续学习(Continual Learning)机制的核心工具,系统分析了经验回放(Experience Replay)策略下神经预测模型的行为变化。该工作已被 **EDBT/ICDT 2026** 联合会议接收。 ## 研究背景与动机 现实环境中的时间序列(如地下水位数据)常呈现**非平稳性**——分布随时间漂移、出现 regime shift(机制转换),传统静态模型难以适应。持续学习通过让模型在流式数据上增量更新来应对这一挑战,但“模型为何遗忘”“哪些数据对适应最有用”等问题仍缺乏透明解释。研究者认为,可解释性不仅能诊断预测错误,更能揭示持续学习本身的动态规律。 ## 方法与实验设计 团队选取了三种代表性神经架构:**PatchMixer**、**PatchTST** 和 **DLinear**,并为其配备基于注意力机制的采样策略(attention-based sampling)以实现选择性经验回放。在可解释性方法上,他们采用了两种主流技术: - **Attention Rollout**:追踪注意力权重传播路径,理解模型关注的时间步; - **Grad-CAM**:基于梯度的归因方法,定位对预测贡献最大的输入区域。 实验数据为真实的地下水位(piezometric)时间序列,包含**异质性模式**和**多次机制转换**,非常考验模型的持续适应能力。 ## 关键发现 1. **归因模式随时间演化**:随着新数据流入,Grad-CAM 热图显示模型关注的输入区域发生显著偏移——从历史模式逐渐转向近期异常值,说明模型在主动调整“注意力焦点”。 2. **采样策略的可解释性**:Attention-based 采样并非均匀选择回放样本,而是倾向于保留那些在归因图上**引起高梯度响应的“困难样本”**,这恰好与主动学习(active learning)的直觉一致。 3. **性能与可解释性的权衡**:虽然持续学习能维持预测精度,但归因稳定性的下降(即模型解释的波动)可能成为新问题——尤其当数据分布突变时,梯度归因会出现剧烈跳跃,影响用户信任。 ## 行业意义与挑战 该研究首次将可解释性从“事后解释”提升为**持续学习框架的元分析工具**。传统上,可解释性只用于回答“为什么预测这个值”,而现在它能帮助回答“为什么选择这些数据来更新模型”。这为自适应预测系统的调试与审计提供了新路径。 然而,挑战依然存在: - **计算开销**:每次更新都计算 Attention Rollout 或 Grad-CAM 在实时场景中可能过于昂贵; - **归因方法的选择**:不同归因方法(如梯度 vs. 扰动)可能给出不一致的结论,如何选择或融合仍需探索; - **从观察到干预**:当前研究停留在“从归因理解行为”,未来需要验证能否**利用归因信号主动指导采样**,形成闭环优化。 ## 小结 这项工作为时间序列持续学习领域提供了一个新视角:可解释性不仅是模型透明的保障,更是理解学习动态的窗口。随着环境监测、金融预测等非平稳场景的需求增长,将可解释性深度嵌入持续学习流程,或将成为下一代自适应预测系统的标配。

HuggingFace1个月前原文

在量化投资领域,股票排序与投资组合构建始终是核心挑战——既要捕捉时间序列上的长期趋势,又要理解股票间的动态关联。近日,来自中国的研究团队提出了一种名为 **STN-TGAT**(Soft-Threshold NMI-prior Transformer Graph Attention Network)的新型深度学习框架,旨在更贴近真实交易场景下实现Top-K投资组合的构建。 ## 方法核心:融合时序与图结构的双重视角 STN-TGAT 的核心架构由两部分组成: - **时序Transformer**:用于捕捉股票价格等序列数据中的长期依赖模式。 - **图注意力网络(GAT)**:建模股票之间的动态关联关系,例如行业联动或资金流动。 两者的结合使得模型能够同时利用历史趋势和横截面信息,提升预测的全面性。 ## 创新点:先验图引导与软阈值稀疏化 研究的一个关键创新在于引入 **基于归一化互信息(NMI)的先验图**,该图通过统计股票间收益率的非线性相关性,为模型提供初始的关联结构。在此基础上,**可学习的软阈值稀疏化机制** 被用于过滤噪声连接,同时保留有信息量的边。这种设计增强了模型对市场噪声的鲁棒性,避免了过度拟合虚假的相关性。 ## 贴近实战:Top-5选股与交易成本调整 与许多仅在理论层面验证的模型不同,STN-TGAT 在投资组合构建过程中考虑了多项实际约束: - 从标普500指数成分股中选出 **Top-50** 候选池,再从中精选 **Top-5** 股票; - 明确分配权重,并纳入 **交易成本调整**,使评估结果更贴近真实交易表现。 ## 实验结果:盈利性与准确性双重领先 在真实市场数据上的实证结果显示,STN-TGAT 在预测准确性和投资组合收益率方面均持续优于多个基准模型。这一结果表明,将 **决策对齐训练**(即模型训练目标与最终投资目标一致)与 **自适应关系建模** 相结合,能够为数据驱动的投资组合构建提供一套连贯且实用的框架。 ## 行业意义与展望 STN-TGAT 的出现反映了当前AI+金融领域的一个重要趋势:模型设计不再单纯追求预测精度,而是更加注重 **端到端的决策优化** 和 **交易成本敏感性**。随着大语言模型和图神经网络在量化投资中的进一步融合,类似STN-TGAT这样的框架有望推动智能投顾和算法交易向更成熟的方向发展。

HuggingFace1个月前原文

## 背景:从C-MAPSS到N-CMAPSS的演进 航空发动机的**剩余寿命(RUL)预测**是预测性维护的核心任务。经典基准C-MAPSS提供简化的仿真数据,而N-CMAPSS则通过引入真实飞行剖面和完整航段时间序列,大幅提升了数据真实度。然而,这种真实感也带来了代价:全飞行记录数据量大,且退化信号与运行工况变化相互纠缠,导致预处理选择复杂化,不同模型的性能难以直接比较。 ## CruiseBench:标准化巡航阶段子基准 为解决上述问题,来自四川大学的研究团队提出了**CruiseBench**——一个基于N-CMAPSS的巡航阶段RUL基准。核心创新包括: - **CPM-N-CMAPSS**:一种掩码工具,通过“共同高度法”自动识别每个飞行循环中的巡航区间,并针对9个可访问子数据集生成循环级巡航掩码。 - **固定协议**:仅使用场景描述符和实测传感器作为输入,排除虚拟传感器、健康参数和辅助元数据;保留原始分辨率窗口,并应用数据集级RUL上限。 ## 基线实验与关键发现 研究者在CruiseBench上评估了LSTM、GRU、TCN和TSMixer四种模型。在默认配置(CruiseBench-eta5-W256-S10)下: - **TSMixer**表现最优,平均RMSE为**3.4±1.71**,Saxena评分为**(2.50±2.99)×10⁴**。 - 消融实验表明,**飞行阶段选择**、**时间降采样方法**和**RUL上限阈值**均会显著影响结果,凸显标准化协议的必要性。 ## 意义与未来方向 CruiseBench通过固定巡航阶段协议,为RUL模型提供了**可复现的受控比较平台**。CPM-N-CMAPSS则为迁移学习和领域自适应研究提供了阶段特定的数据基础。该工作有望推动航空发动机预测性维护从“能跑”向“可比、可信”迈进。

HuggingFace1个月前原文

## 告别一维“扫描”暴力:HyenaND 直接在高维空间做全局建模 Transformer 中的注意力机制虽然强大,但其二次方复杂度在处理长序列时成为瓶颈。近年来涌现出许多亚二次复杂度(subquadratic)的替代方案,但这些方案在处理图像、三维体积、偏微分方程(PDE)等多维数据时往往需要“妥协”:要么使用标准卷积,牺牲全局感受野和输入依赖性;要么将多维数据强行“拉平”成一维序列,再用循环模型(如 Mamba)扫描——这种一维光栅化顺序破坏了数据的空间结构。 **HyenaND 的核心理念:让算子直接“理解”数据的原生几何结构。** 它通过隐式参数化的全局、输入依赖的多维卷积核,直接在多维空间上执行操作,无需任何维度转换。这意味着图像仍是图像,体积仍是体积,它们的空间关系被完整保留。 ## 技术亮点:隐式卷积核 + CUDA 优化 HyenaND 继承并扩展了 Hyena 家族的设计思路。其关键创新在于: - **原生多维卷积**:卷积核的尺寸覆盖整个输入域(全局),且其权重由输入数据动态生成(输入依赖),兼具注意力的灵活性和卷积的高效性。 - **亚二次复杂度**:通过将卷积操作映射到频域(FFT),HyenaND 实现了 **O(L log L)** 的计算复杂度,L 为序列长度(多维数据展平后的总元素数)。 - **nSubQ CUDA 实现**:作者团队开发了名为 **nSubQ** 的 CUDA 内核,融合了 FFT 卷积路径,将理论复杂度转化为实际加速。 ## 实验结果:纯 HyenaND 匹敌注意力,混合架构更胜一筹 论文在四个领域进行了广泛评测: 1. **长上下文基因组学**:DNA 序列建模,HyenaND 在准确率上媲美标准注意力。 2. **计算机视觉**:图像分类任务,纯 HyenaND 堆叠达到与强注意力基线(如 ViT)相当的结果。 3. **医学影像**:三维体积分割,HyenaND 原生处理 3D 数据的能力优于光栅化方案。 4. **PDE 建模**:物理方程求解,HyenaND 展现了良好的全局建模能力。 **混合配置**:将 HyenaND 层与注意力层交错堆叠,效果超过纯注意力模型和基于循环的混合模型(如 Mamba-注意力混合)。这表明 HyenaND 不仅能单独使用,还能与 Transformer 互补,在效率与精度之间取得更优平衡。 ## 行业意义:多维数据建模的“架构新选择” HyenaND 的出现为处理高维、长序列数据提供了一种无需牺牲空间结构的高效方案。对于需要同时处理时间、空间、通道等多维信息的应用(如视频理解、气象模拟、科学计算),它可能成为 Transformer 的有力替代或补充。尤其是其 CUDA 优化实现 nSubQ 已开源,有望推动社区在医学影像、自动驾驶感知、数字孪生等领域的落地探索。 不过,HyenaND 目前仍处于 arXiv 预印本阶段,其在大规模多模态场景下的泛化能力、训练稳定性以及硬件适配性尚需进一步验证。但无论如何,这项研究为“后注意力时代”的架构设计提供了新的思路:与其强行将多维数据塞进一维管道,不如让模型学会在高维空间中“自然生长”。

HuggingFace1个月前原文

## 研究背景:从贝叶斯滤波到模型选择 先前研究已证明,Transformer能在固定假设类内精确执行贝叶斯滤波。但一个更根本的问题是:模型能否从数据中**识别出正确的假设类**?这正是贝叶斯模型选择的核心。近日,arXiv上的一篇新论文《Bayesian Wind Tunnels for Model Selection》提出了“模型选择贝叶斯风洞”——一种受控实验环境,其中假设类上的真实后验分布可解析计算。 ## 核心方法:固定点自由对合与三类实验 研究者利用**固定点自由对合**(满足 f(f(x))=x 的纯关系变换)设计任务。一个仅**280万参数**的Transformer在整数token和每轮含义变化的**不透明符号**上,均能达到与贝叶斯最优解仅**0.01比特**的熵一致(3个随机种子)。实验进一步扩展到非嵌套比较:对合 vs. 3-循环(两者互不为子集),模型在类后验上的平均绝对误差(MAE)低于**0.001**,证明其具备真正的模型选择能力,而非仅依赖简单性或子集偏差。 ## 关键发现:算术推理的感知壁垒 研究揭示了一个尖锐的**感知访问条件**:当判别统计量需要算术运算时——如模加法(旋转)或模乘法(f(x)=cx mod p)——模型选择在整数token下成功,但在不透明符号下**完全失败**。即使将参数从280万扩展到**3.16亿**(112倍),这一界限依然存在。 通过**平稳性控制实验**发现:使用固定重标号的不透明token时,模型成功(MAE仅0.009比特),说明**稳定的语义**(而非整数身份)才是电路编译的关键。头部子任务诊断将失败定位在“头部反转与算术的组合”环节,而非头部解析本身。 ## 前沿大模型对比:定性相似,定量差距 在相同任务上测试前沿大语言模型(LLM),结果显示它们表现出**定性上的贝叶斯行为**,但校准差距巨大(约**55倍**),该测量基于有损探测器,因此结果仅具方向性而非精确。 ## 意义与展望 这项研究为理解Transformer的模型选择能力提供了受控实验框架,尤其揭示了**算术推理对符号语义稳定性的依赖**。这一发现对设计能进行因果推断和科学发现的AI系统具有指导意义——未来的模型可能需要结合符号与连续表示,或通过元学习适应动态语义环境。

HuggingFace1个月前原文

## 背景与挑战 空气污染每年导致约 **790 万** 人过早死亡,准确预测空气质量已成为关键的公共卫生议题。然而,现有基准数据集在地理覆盖和污染物种类上均存在局限,且未能评估最新一代时间序列基础模型(TSFM)在真实大规模数据上的表现。 ## Air Quality Arena 的诞生 为填补这一空白,研究团队推出了 **Air Quality Arena(AQA)**,包含大规模多国多污染物数据集 **AQA-Data** 和配套基准 **AQA-Bench**。该数据集覆盖 **7 个国家、4 个大洲**,涵盖 **6 种主要污染物**,时间跨度 **三年**,共包含 **超过 14,000 条站点-污染物序列**,旨在为空气质量任务提供全面基准。 ## 模型评估与发现 研究团队对 **11 个领先的时间序列基础模型** 和传统基线进行了基准测试,评估它们在短期空气质量预测上的表现。结果表明: - **TSFM 作为零样本预测器表现优异**,持续优于传统基线。 - 表现最佳的模型采用了 **跨模态架构**,利用视觉基础模型进行时间序列预测。 ## 开放与影响 AQA 数据集已公开发布,为空气质量预测研究提供了大规模、多区域、多污染物的标准化测试平台。该工作不仅推动了时间序列基础模型在环境领域的应用,也为公共卫生决策提供了更可靠的预测工具。

HuggingFace1个月前原文

稀疏自编码器(SAE)的可解释性评估正面临一场信任危机。一篇来自 arXiv 的新研究(论文编号:2607.19386)通过系统性实验揭示:当前广泛使用的自动可解释性分数,其方差主要来源于评估管线的选择,而非 SAE 架构本身的差异。这一发现对跨论文比较 SAE 可解释性的有效性提出了严峻挑战。 ## 核心发现:管线方差压倒架构方差 研究团队在四个指标(**simulation、detection、fuzzing、purity**)、两个模型(**Pythia-160M、Apertus-8B**)以及四个方法论变化维度上进行了大规模实验。结果清晰显示:**方法学方差在所有指标和模型上均集体超过架构方差**。这意味着,当不同论文报告 SAE 可解释性分数差异时,这些差异很可能源于评估流程的不同(例如提示词设计、评分模型选择、特征采样方式等),而非 SAE 结构本身的优劣。 ## 指标的稳定性差异 不同指标的稳定性表现各异:**detection 指标最为稳定**,在不同管线条件下结果波动较小;而 **fuzzing 指标在所有条件下均不可靠**,其分数几乎完全被管线噪声主导。simulation 和 purity 指标则处于中间状态。这一发现提醒研究者:并非所有可解释性指标都适合用于跨论文比较,选择不当可能导致误导性结论。 ## 掩盖的“假稳定性”风险 更值得警惕的是,研究还发现一个“假稳定性”陷阱:**top-k 特征排名在不同语料库和采样条件下并不一致**,但平均分数却可能保持稳定。这意味着即使论文报告的平均分数看起来可复现,单个特征的实际可解释性可能已发生剧烈变化。单纯监控解释文本的相似性(如 BERTScore)无法检测到这种失败模式。 ## 对 SAE 研究的影响 该发现直接关联到当前关于 SAE 实用性的争论。如果评估分数主要反映管线差异而非架构差异,那么基于这些分数的结论——例如“某种 SAE 架构更可解释”——可能站不住脚。在 AI 安全和对齐研究日益依赖 SAE 进行模型理解的背景下,不可靠的评估工具会拖慢整个领域的进展。 ## 贡献与建议 为改善现状,论文贡献了三项实用工具: - **方差分解方法**:帮助研究者量化评估管线中各环节的方差贡献; - **稳定性检查(Stability Check)**:快速判断分数是否对管线变化敏感; - **最低报告清单(Minimum Reporting Checklist)**:规范跨论文比较所需的关键实验细节。 ## 小结 这篇研究为 SAE 可解释性评估敲响了警钟。它呼吁领域内建立更标准化的评估协议,并提醒我们在解读自动可解释性分数时保持谨慎。对于致力于模型可解释性的研究者而言,**理解评估管线的方差来源** 或许比优化架构本身更为紧迫。

HuggingFace1个月前原文

## 研究背景与挑战 胎儿超声检查中,胼胝体(Corpus Callosum, CC)的准确定位对早期发现神经发育异常至关重要。然而,超声图像固有的低对比度、斑点噪声以及胼胝体显著的解剖变异,使得这一任务极具挑战性。传统深度学习方法依赖集中式数据训练,但在多中心临床场景中,数据隐私、通信开销和计算资源限制成为主要瓶颈。 ## FedCC 框架设计 针对上述问题,来自意大利多所机构的研究团队提出了 **FedCC**,一种基于联邦学习的低资源自适应框架。其核心创新在于: - **基础模型冻结 + 轻量检测头**:采用冻结的 **DINOv2** 作为视觉特征提取骨干,搭配基于 **YOLO** 的轻量检测头,既利用了大模型的强大表征能力,又避免了全模型微调的高昂成本。 - **低秩适配(LoRA)**:在骨干网络中引入 LoRA 模块,仅优化和交换少量参数(**约 2.9M**,仅为全微调 24.4M 的 11.8%),通信开销降低约 **8.5 倍**。 - **联邦平均(FedAvg)**:客户端在本地更新 LoRA 参数后,仅上传低维适配器至中心服务器聚合,无需共享原始数据。 ## 实验与结果 研究团队在 **3 个临床中心** 收集了来自 **58 名孕妇** 的 **10,970 帧** 超声图像,使用不同成像设备,模拟真实多中心环境。实验表明: - **FedCC 在联邦设置下性能强劲**:结合 DINOv2 与 LoRA 的 FedAvg 策略达到 **平均 mAP@50 为 0.857**,**F1 分数为 0.803**,优于全微调(0.841 mAP)和编码器冻结(0.812 mAP)基线。 - **资源效率显著**:可训练参数减少 **88%**,通信成本降低近一个数量级,适合低资源临床场景。 ## 行业意义与展望 FedCC 展示了 **联邦学习 + 基础模型适配** 在医疗影像领域的巨大潜力。其核心价值在于: 1. **隐私保护**:数据不出本地,符合医疗数据合规要求。 2. **多中心泛化**:通过联邦协作提升模型对异质设备和人群的鲁棒性。 3. **临床可部署性**:低计算和通信开销使得在资源受限的医院部署成为可能。 未来,该框架可扩展至其他胎儿解剖结构(如小脑、透明隔腔)的定位,并探索更高效的适配策略(如 Adapter、Prompt Tuning)。研究团队指出,下一步将开展前瞻性临床验证,以评估其在真实筛查流程中的实际效益。 ## 小结 FedCC 为胎儿神经超声的自动化分析提供了一条 **隐私友好、资源高效** 的技术路径,有望加速 AI 在产前诊断中的落地应用。其“冻结大模型 + 轻量适配”的设计思路,对医疗 AI 领域的其他低资源任务也具有重要参考价值。

HuggingFace1个月前原文

大语言模型(LLM)凭借数十亿参数在众多领域表现出色,但巨大的内存需求也限制了其在资源受限环境中的部署。模型压缩技术,尤其是奇异值分解(SVD),一直是解决这一问题的核心方法。然而,如何在压缩误差最小化与下游任务性能最大化之间取得平衡,仍是研究难点。近期,一篇发表于《IEEE Access》的研究提出了一种融合神经元重要性与数据感知低秩近似的创新压缩框架,并引入动态压缩率分配算法,在高压缩比下取得了显著效果。 **现有方法的局限** 传统SVD压缩主要从两个独立视角出发:一是基于参数重要性(如神经元贡献度)裁剪冗余权重;二是保持每层功能等价性,通过低秩近似减少矩阵维度。但这两类方法各有短板:重要性视角可能忽略层间交互效应,而功能等价视角则缺乏对具体数据分布的适应性。此外,以往的压缩率分配多采用均匀策略或依赖昂贵的启发式搜索,难以实现全局最优。 **融合策略:两全其美** 该研究首次将神经元重要性与数据感知低秩近似纳入统一目标函数。具体而言,算法首先通过前向传播计算每个神经元对最终输出的贡献度,作为重要性权重;然后在SVD分解过程中,结合输入数据的分布特征(即数据感知)对权重矩阵进行加权低秩近似。这种设计使得压缩过程能优先保留对任务关键的信息通道,同时自适应地调整各层的压缩强度。 **动态压缩率分配** 针对压缩率分配问题,研究团队提出了一种高效的动态分配算法。不同于传统方法的手动调参或穷举搜索,该算法利用梯度信息快速估算每层对整体损失的敏感度,并据此非均匀地分配压缩率。实验表明,在50%以上的高压缩比下,该方法的性能损失较均匀分配降低约30%,且计算开销仅为启发式搜索的千分之一。 **实验验证与行业意义** 在多个基准模型(如BERT、GPT-2)和下游任务(文本分类、问答)上的测试显示,该方法在同等压缩比下优于此前最先进的SVD压缩方案(如SVD-LLM、AdaSVD)。例如,在70%压缩率时,模型在GLUE基准上的准确率仅下降1.2%,而对比方法下降超过3%。 这一工作为LLM在边缘设备、移动端等资源受限场景的落地提供了新思路。随着模型规模持续膨胀,结合数据感知与重要性引导的压缩策略有望成为主流方向。未来,研究者可进一步探索该方法与量化、剪枝等其他压缩技术的协同效应。

HuggingFace1个月前原文

## 核心亮点 一项来自 arXiv 的新研究提出了 **E-SpecFormer**(Edge Spectrum monitoring Transformer),这是一种专为端到端自动调制识别和隐蔽信道(CC)识别设计的边缘高效 Transformer 模型。其核心创新在于 **LiTAN(Linear Tanh Attention Network)** 注意力机制,该机制去除了 Softmax 和 LayerNorm,在降低计算复杂度的同时提升了射频任务的准确率。 ## 模型架构与性能 E-SpecFormer 提供了四种可扩展的变体(**Nano、Small、Medium、Large**),以适应从微控制器到 FPGA 等不同的硬件约束。实验结果表明,最小的 Nano 变体在 **RadioML2018 数据集**上进行调制识别时,信噪比(SNR)>0 dB 条件下的平均准确率达到 **86.5%**;在基于硬件木马(HT)的隐蔽信道数据集上,准确率高达 **94.2%**。更令人印象深刻的是,该模型参数量不到 **10k**,在 FPGA/CPU 协同执行下每帧处理速度仅为 **92 微秒**,以极低的成本超越了现有的边缘端 SOTA 模型。 ## 技术细节与行业意义 LiTAN 的设计思路在于:传统 Transformer 中的 Softmax 操作会引入指数运算,在边缘设备上计算开销较大;而 LayerNorm 则增加了推理延迟。E-SpecFormer 通过线性 tanh 激活函数替代 Softmax,并移除 LayerNorm,使得模型在保持甚至提高精度的同时,显著减少了计算和存储需求。这对于资源受限的物联网(IoT)设备而言意义重大,因为实时频谱监测往往需要快速响应和低功耗。 ## 应用前景 E-SpecFormer 为 **实时频谱智能** 在 IoT 设备上的部署铺平了道路。例如,在认知无线电、无线安全监测和频谱管理等领域,该模型能够以极低的资源消耗实现高精度的信号分类。研究者已在 GitHub 上公开了代码,方便社区复现和进一步优化。 ## 小结 E-SpecFormer 证明了通过精心设计的轻量级注意力机制,Transformer 可以在边缘端高效运行。它的出现不仅推动了射频智能领域的发展,也为其他需要边缘推理的时序或信号处理任务提供了新的思路。

HuggingFace1个月前原文

## 校准的盲区:全局指标掩盖了局部危险 当AI模型高置信度地给出错误预测时,其危害往往远超普通错误。然而,传统校准评估通常只关注全局平均指标,这可能会掩盖局部区域的集中性高置信错误。近日,一篇题为《FALCON-Discover: Discovering Concentrated False-Confidence Regions for Calibration》的论文(arXiv:2607.18278)提出了一种新框架,旨在系统地发现这些危险区域。 ## 核心问题:高置信错误的“聚集”效应 论文将这种失败模式称为**假置信集中(False-Confidence Concentration)**,即错误预测中那些高置信度的样本往往聚集在预测空间的紧凑区域内。这些区域难以通过全局校准指标识别,但却是模型部署中最危险的隐患。 ## FALCON-Discover 框架:多维不一致性信号 为了检测这种集中性,研究者提出了**FALCON-Discover**——一个后处理、模型无关的框架。它利用四个维度的**不一致性信号**对预测进行排序: 1. **置信度**:模型输出的概率值本身。 2. **局部支持**:样本周围训练数据的密度。 3. **邻域一致性**:近邻样本的预测是否一致。 4. **扰动稳定性**:输入微小扰动下预测是否变化。 ## 实验验证:集中模式普遍存在,但依赖情境 在**7个二分类表格数据集**上,使用XGBoost和CatBoost等强学习器,并通过4个随机种子和5折交叉拟合进行验证,结果发现: - **假置信集中现象普遍存在**,但具体模式随数据集和阈值变化。 - 在主要置信阈值下,基于不一致性信号的排序方法在**最强集中情境**中显著优于最佳验证集校准或信任评分基线。而原始置信度几乎无法捕获危险错误。 - **最佳检测器因数据集而异**:当需要组合多个线索时,学习到的不一致性信号最强;当局部决策脆弱性主导时,基于稳定性的排序表现最佳。 ## 启示:从校准到发现 论文结论指出,危险的过度置信更适合作为“家族级发现问题”而非“单分数校准问题”。这启示未来的校准策略应**明确瞄准那些置信度、支持度和稳定性相背离的区域**,而非仅优化全局指标。 ## 行业意义 随着AI在医疗、金融、自动驾驶等高风险领域的应用加深,局部高置信错误可能带来灾难性后果。FALCON-Discover提供了一种可操作的诊断工具,帮助开发者识别模型脆弱点,从而设计更有针对性的安全措施。 论文作者来自澳大利亚悉尼科技大学等单位,目前论文已在arXiv上公开,并提供了PDF和HTML版本。

HuggingFace1个月前原文