SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:HuggingFace清除筛选 ×

arXiv:2607.22743v1 Announce Type: new Abstract: Background and Objective: Automatic polyp segmentation supports computer-aided diagnosis and early colorectal cancer detec- tion. Centralized deep learning requires hospitals to share sensitive medical data, while federated learning preserves privacy but introduces high communication costs through repeated transmission of full-precision model parameters. We propose QFedPolyp, a communication- and inference-efficient federated learning framework for

HuggingFace1个月前原文

arXiv:2607.22748v1 Announce Type: new Abstract: Modern neural networks primarily adapt through parameter modification within predefined computational structures. While recent methods introduce modularity, conditional computation, and parameter-efficient adaptation, they generally do not distinguish computational capability from computational accessibility as separate adaptive variables. This work introduces Accessibility Plasticity, a principle of adaptive computation in which systems adapt not

HuggingFace1个月前原文

arXiv:2607.22757v1 Announce Type: new Abstract: We introduce Graded Large Language Models (GLLMs), an algebraic framework that equips the representation space of a transformer with a grading and propagates the induced weighted scalar action through embeddings, self-attention, and the training objective. The construction extends the theory of graded neural networks and graded transformers to autoregressive language models while preserving expressive power, asymptotic computational complexity, and

HuggingFace1个月前原文

arXiv:2607.22763v1 Announce Type: new Abstract: Leaf veins exhibit remarkable diversity in architecture and patterning, yet existing gene--environment association studies have primarily quantified leaf venation using a small collection of low-dimensional summary traits, thereby discarding most of the structural information contained in the original images. We propose an integrated deep learning and statistical framework. The proposed framework achieves four methodological advances. First, it rep

HuggingFace1个月前原文

逻辑门网络(LGN)通过布尔运算组合实现计算,但与经典布尔电路不同,现有LGN并未从增加深度中稳定获益。一项新研究揭示了其背后的双重障碍:**优化崩溃**与**拓扑限制**,并提出了名为**输入锚定逻辑门网络(IALGN)**的解决方案,在MNIST、CIFAR-10和CIFAR-100上实现了超过100层的持续精度提升。 ## 深度扩展为何失败? 研究者将LGN深度扩展失败归因于两个独立因素: - **优化崩溃**:在深度放松LGN中,梯度信号随层数增加急剧衰减,导致深层参数难以有效更新。 - **拓扑限制**:即使采用跳跃偏置初始化和直通估计来稳定训练,网络拓扑结构本身也限制了信息流动——深层节点无法获取足够多的原始输入信息,导致计算退化。 这意味着,单纯解决可训练性(如通过梯度技巧)是不够的;**深层必须获得支持有用计算的信息**。 ## 输入锚定:保留计算脊柱 IALGN的核心设计是让每个逻辑门同时结合一个**可演化的隐藏特征**和一个**直接输入锚点**。这种拓扑结构保留了一条“计算脊柱”,同时确保每一层都能接触到原始输入。 数学上,一条深度为D的路径最多可以依赖D+1个输入比特,从而建立严格的分层表达能力。为了进一步优化锚点选择,研究者还引入了**Random-k锚定松弛**方法,在不破坏脊柱结构的前提下提升灵活性。 ## 实验结果:百层深度下的持续增益 在三个经典图像分类任务上,IALGN展现出显著优势: - **MNIST**:随着深度增加,IALGN的测试准确率持续上升,而其他LGN变体在浅层即饱和。 - **CIFAR-10/100**:IALGN在超过100层时仍能获得精度提升,而基线网络(如标准LGN、带跳跃连接的LGN)要么精度停滞,要么出现退化。 通过**逐层探针**、**拓扑消融实验**和**有效深度分析**,研究者证实:输入锚定使网络能够逐层学习到**更具信息量的表示**,并保持较长的有效计算路径。 ## 行业意义:重新思考深度网络设计 这项工作为神经网络架构设计提供了新的视角: 1. **信息通路比深度更重要**:单纯加深网络而不保证输入信息可达,只会导致计算冗余。 2. **逻辑门网络的新方向**:IALGN证明了布尔运算网络可以像传统神经网络一样受益于深度,为硬件友好型AI(如可编程门阵列实现)开辟了道路。 3. **优化与拓扑需协同设计**:解决训练困难只是第一步,拓扑结构必须支持信息的有用计算。 未来,该方法有望扩展到更复杂的任务(如时序建模)以及混合符号-神经网络系统,进一步缩小逻辑门网络与深度学习之间的性能差距。

HuggingFace1个月前原文

## 概述 arXiv 上的一篇新论文提出了一种名为 **EaaS** 的云原生参考架构,将 AI 评估方法以微服务形式部署在 Kubernetes 上,旨在为大规模 AI 系统提供可扩展、有统计保障的监控能力。该架构包含六个无状态微服务,覆盖共形预测、漂移检测、公平性监控等关键环节,并在多个基准上验证了其有效性。 ## 核心架构 EaaS 的核心是 **六个独立的 Kubernetes 微服务**: - **共形预测服务**:采用有限样本修正的自适应预测集(Adaptive Prediction Sets),提供具有边际覆盖保证的预测区间。 - **校准评估服务**:持续评估模型校准质量。 - **漂移检测服务**:基于随机傅里叶特征(RFF)近似的最大均值差异(MMD)方法,检测数据分布漂移。 - **公平性监控服务**:使用 Bootstrap 置信区间监控模型在不同群体间的公平性差异。 - **DAG 管道编排器**:基于有向无环图(DAG)组织评估流水线,支持灵活的任务编排。 - **结果存储 API**:存储和查询评估结果。 这种微服务设计使得每个组件可以独立扩展、更新和部署,适应大规模 AI 系统的监控需求。 ## 关键验证结果 论文通过四个实验验证了方法的有效性: ### 1. 共形预测覆盖一致性 在 **K=50 次随机校准/测试划分** 中,经验覆盖率与名义目标值的平均偏差在 **1.4 个百分点以内**,表明共形预测的边际覆盖保证在实践中稳定可靠。 ### 2. MMLU 答案令牌分析 在 MMLU 数据集中,所有四个答案令牌均出现在前 20 个 logprobs 中,**0% 需要插补**。模拟 10% 的插补率对覆盖率的影响小于 **1.5%**,说明方法对缺失信息具有鲁棒性。 ### 3. 漂移检测性能 RFF-MMD 方法在中位启发式带宽下,对 **中等和严重漂移** 的检测功率达到 **100%**,I 类错误率控制在 **5% 至 8.5%** 之间,表现出良好的敏感性和特异性。 ### 4. 公平性监控 在 **UCI Adult Income 数据集** 上,公平性监控揭示了显著的种族间人口统计均等差异(DP gap = 0.33),且跨连续批次发出稳定警报,验证了监控的持续有效性。 ## 性能表现 - **共形预测和校准服务**:在批大小为 100 时,p99 延迟低于 **2ms**,适合实时推理场景。 - **RFF-MMD 漂移检测**:约需 **500ms**,更适合周期性批量监控。 ## 与现有工具对比 论文将 EaaS 与四种开源工具(如 MLflow、WhyLabs 等)比较,指出 **目前没有平台同时提供共形预测即服务、微服务分解和 DAG 编排** 的组合。EaaS 填补了这一空白,为 AI 评估的标准化和可扩展部署提供了新思路。 ## 行业意义 随着 AI 模型在金融、医疗等高风险领域的广泛应用,持续、可信的监控变得至关重要。EaaS 将统计严谨的评估方法(如共形预测和漂移检测)封装为云原生服务,降低了部署门槛,同时保持了理论保证。未来,这种架构有望与 MLOps 平台深度集成,成为 AI 治理的基础设施。

HuggingFace1个月前原文

分子图生成是药物发现与材料设计中的核心挑战。近年来,基于离散扩散模型的分子图生成方法(如掩码离散扩散)取得了显著进展,但现有方法普遍采用**均匀掩码调度**——对所有分子组件“一视同仁”地加噪与去噪。这种策略忽略了分子中不同结构单元(如官能团、环、原子)在去噪难度和对最终分子性质影响上的巨大差异。 针对这一瓶颈,来自中佛罗里达大学的研究团队提出 **MotifRole-Diff**,一种**角色感知的掩码扩散框架**。其核心创新在于:不再对所有token使用相同的掩码概率,而是根据每个分子结构角色(role)的**经验去噪难度**和**全局扰动影响**,动态分配掩码预算,从而在固定总掩码率下实现“风险最优”的分配。 ## 技术亮点:从“均匀”到“差异化” MotifRole-Diff 的核心是一个**角色加权残差风险模型**。团队通过理论证明,在给定掩码预算下,最优的掩码率分配应使各角色的加权残差风险之和最小化。具体而言,那些**去噪困难**(如复杂环系)或**对分子性质影响大**(如关键药效团)的角色,应分配更高的掩码率,以迫使模型更早、更充分地学习其重构。 该方法的优雅之处在于:**无需修改模型架构**,仅改变训练时的掩码策略,即可提升生成质量。这使其极易嵌入现有扩散框架,具有极高的实用价值。 ## 实验数据:显著超越均匀基线 在标准分子生成基准上,MotifRole-Diff 展现了全面优势: - **QM9 数据集**:分子有效性(validity)从 **0.905 提升至 0.944**(+4.3%),FCD(Frechet ChemNet Distance,衡量生成分子分布与真实分布的距离)从 **1.701 降至 1.609**(降低5.4%)。 - **MOSES 数据集**:有效性从 **0.920 提升至 0.938**(+2.0%),FCD 从 **2.125 降至 1.850**(降低12.9%)。 FCD 的显著下降意味着生成分子在化学空间中的分布更接近真实药物分子,这对后续筛选至关重要。此外,角色级别的诊断分析显示,所有类别的分子组件(如原子、键、环)的重构精度均得到改善,证明差异化策略确实起到了全局优化作用。 ## 行业意义:小改动,大收益 在计算资源(训练步数、采样计算量)完全匹配的条件下,MotifRole-Diff 仅通过调整掩码调度就实现了可观的性能提升。这为分子生成领域提供了一个新思路:**在模型能力接近天花板时,数据层面的结构化先验仍能带来突破**。 未来,该方法可进一步扩展到更复杂的生物分子(如蛋白质、DNA)或结合强化学习进行动态调度。对于药物研发管线而言,更精确的分子生成意味着更少的湿实验验证成本,直接加速先导化合物优化。 **论文链接**:arXiv:2607.21634

HuggingFace1个月前原文

元强化学习(Meta-RL)旨在让智能体学会“如何学习”,从而快速适应新任务。然而,模型初始化的选择对训练效率和泛化能力有着决定性影响。一项来自 arXiv 的新研究(论文编号 2607.21637)提出,采用**准蒙特卡洛(QMC)方法**进行权重初始化,可以在相似任务上显著提升训练收敛速度,但面对差异较大的任务时,传统的正交初始化仍然更胜一筹。 ## QMC 初始化:从随机到“有序随机” 传统的神经网络初始化方法(如 Xavier、He 或正交初始化)通常依赖伪随机数生成器来设定初始权重。QMC 则不同:它使用**低差异序列**(如 Sobol 序列),让采样点更均匀地覆盖高维空间,减少随机聚簇带来的偏差。 在这项工作中,研究者将 QMC 应用于元强化学习的**种群搜索**阶段:首先在多个基任务上运行种群优化,利用 QMC 采样来初始化每个个体的权重,然后聚合出最优的元先验(meta-prior)。 ## 实验结果:相似任务加速,异质任务受限 在标准连续控制基准(如 MuJoCo 环境)中,研究者比较了 QMC 初始化与 Stable-Baselines3(SB3)默认的正交初始化。结果显示: - **对相似未见任务**:QMC 元先验使训练收敛更快,尤其在早期阶段优势明显。 - **对差异较大的任务**:正交初始化在无偏搜索中表现更好,QMC 反而可能引入偏差。 这一发现揭示了元强化学习中的一个关键权衡:**初始化方法的选择应取决于任务分布的相似性**。若任务同质性强,QMC 能利用低差异采样的均匀性加速收敛;若任务差异大,正交初始化的各向同性更适合探索。 ## 对 AI 行业的启示 元学习是通用人工智能的重要方向,而初始化方法常被忽视。QMC 作为一种数学上更“均匀”的采样策略,已在贝叶斯推断和数值积分中广泛应用,如今被引入强化学习领域,展示了跨学科方法融合的潜力。 对于实践者而言,这项研究提示:在构建元学习系统时,**不要盲目套用默认初始化**。若已知目标任务与训练任务分布接近,QMC 初始化可能带来显著的训练加速;若任务分布未知或跨度较大,正交初始化仍是更稳妥的选择。 未来,结合自适应初始化策略(例如根据任务相似度动态切换 QMC 与正交方法)或将成为提升元强化学习泛化能力的新方向。

HuggingFace1个月前原文

个人AI智能体(如数字助手)的核心价值在于其能随着与用户的持续交互而进化——它们会记住用户的偏好、学习新技能、调整工具配置,并动态更新行为策略。然而,现有的智能体基准测试往往将这些能力割裂开来评估:工具基准测试固定API下的调用准确性,记忆基准测试单纯的回忆或遗忘能力,安全基准测试静态策略的合规性。这种“分科考试”式的评估,能否真实反映智能体在复杂、连续的用户交互中的表现? 来自多所机构的研究者在最新论文中提出了尖锐质疑,并系统阐述了个人智能体评估应遵循的新范式。他们指出,真正的个人智能体评估需要一种不同的协议:**在同一时间干预下,针对不同用户条件化的持久状态进行重放,并测量失败如何跨智能体组件传播**。 ### 四个核心条件 研究者将这一需求形式化为四个必须同时满足的条件: 1. **明确的时间干预**:测试必须包含一个明确的时间点事件(如用户删除某条记忆、更新偏好或禁用某项技能)。 2. **跨干预的持久状态**:智能体必须维持一个跨时间干预的持久状态(如长期记忆、技能库或策略配置)。 3. **引发的跨维度效应**:干预的影响不应局限于单一组件,而应能引发其他维度的连锁反应(例如,删除一条记忆可能导致工具调用失败,或使安全策略失效)。 4. **用户条件化状态的变化**:不同用户(或同一用户的不同历史)应拥有不同的持久状态,从而测试智能体对个体差异的适应能力。 ### 现有基准的缺口 研究者对公开基准协议进行了严格审计。他们按照明确纳入标准筛选出多个“接近”满足条件的基准,但在其定义的严格操作化框架下,**未发现任何一个协议能同时满足全部四个条件**。例如,一些记忆基准虽然包含时间干预(如强制遗忘),但干预的影响被限定在记忆召回任务本身,并未跨维度影响工具使用或策略遵守。而工具基准则通常假设API固定,智能体无需考虑用户历史状态的变化。 这一发现并非全盘否定现有工作,而是揭示了系统性的评估缺口:**个人智能体的失败往往不是单一能力的失效,而是组件间耦合的断裂**。例如,一个智能体可能记住了用户的饮食偏好,但当用户临时切换为“低碳水”模式(时间干预)时,它却仍用旧策略推荐高碳水食谱(跨维度失败:记忆与策略未同步)。 ### 走向用户条件化评估 作为解决方案,论文提出了一个最小基准设计框架和候选报告指标。核心思想是:构建一个模拟用户长期交互的测试环境,其中每个“用户”拥有独特的持久状态(如记忆库、技能树、策略文件)。测试时,对每个用户施加相同的时间干预(如“删除所有关于咖啡的偏好”),然后观察智能体在后续任务中的表现变化。 关键指标包括: - **干预恢复时间**:干预后智能体需要多少次交互才能恢复原有性能? - **跨维度影响指数**:干预对非直接相关任务(如工具调用、安全合规)的负面影响程度。 - **用户条件化差异度**:不同用户状态下,同一干预导致的表现方差。 ### 行业意义 这项研究恰逢其时。随着大语言模型驱动的个人智能体(如AutoGPT、Copilot等)走向实用,**评估体系的滞后将成为部署的最大瓶颈**。当前的“静态能力”测试无法捕捉智能体在长期使用中的退化风险——例如,一个智能体可能因为用户删除了某条关键记忆而突然变得不可靠,但现有基准无法预警。 该工作为未来个人智能体评估提供了设计需求基准。研究者强调,他们的主张是有边界的——仅聚焦于“时间干预下的用户条件化评估”这一特定缺口,而非全面否定现有工作。但这一缺口,恰恰是个人智能体区别于通用聊天机器人的核心所在。 对于AI从业者而言,这意味着:**在设计智能体架构时,应内置跨组件的影响追踪机制;在制定评估计划时,应引入用户历史状态变量和时间干预剧本**。真正的个人智能体,不应只在“考试”中得分,而应在与用户的“共同生活”中持续可靠。

HuggingFace1个月前原文

## 导读 在控制偏微分方程(PDE)时,传统方法通常需要一个明确的目标(如跟踪特定轨迹或达到某个状态),并在训练中反复调整模型。但一篇来自 arXiv 的新论文提出了一种**目标无关(goal-agnostic)**的方法,让世界模型在无奖励、无下游目标的情况下离线学习,之后冻结模型,再通过规划器灵活适配不同控制任务。这一思路有望降低对标注数据的依赖,提升模型的复用性。 ## 核心方法:联合嵌入预测架构(JEPA) 研究团队构建了一个基于**联合嵌入预测架构(JEPA)**的控制框架。核心是一个**小型 2D ViT 编码器**和一个**动作条件化的潜在动力学模型**。训练阶段完全离线,不涉及任何奖励函数或下游控制目标,仅通过预测潜在空间的未来状态来学习 PDE 的演化规律。训练完成后,模型被冻结,不再更新。 在控制阶段,团队使用**模型预测路径积分(MPPI)**控制器,在冻结的潜在动力学模型上进行规划。关键发现是:**控制目标最好应用于显式的物理可观测量**(如动能),而不是直接在潜在空间最小化欧氏距离(L2)。只要可观测量满足唯一延拓(injectivity)性质,就能更准确地引导系统到达目标状态。 ## 实验验证:Navier-Stokes 基准测试 在 PDE Control Gym 的 **2D Navier-Stokes** 基准上,团队对比了两种规划策略: - **潜在 L2 规划**:直接在潜在空间最小化预测与目标的 L2 距离。 - **动能探针(KE-probe)规划**:通过学习一个线性探针从潜在状态中解码出动能(kinetic energy),然后以动能为优化目标。 结果如下: - **本机奖励(native reward)**:KE 规划在 50 个 episode 上的平均奖励为 **-10.90±0.91**,优于潜在 L2 规划的 **-12.08±0.86**(95% 置信区间)。 - **速度场 RMSE**:最后四分之一时间步的 RMSE 从 0.0765 降至 **0.0692**。 ## 泛化能力:应对未见过目标 为了测试泛化性,研究者设计了三个**刻意不同、非周期性的目标**,这些目标在训练中从未出现过。冻结的模型配合 KE 探针规划,在 30 个配对 episode 中全部获胜,**最终场 RMSE 降低了 53%**(0.0220 vs 0.0469)。 此外,同一冻结模型还能通过直接调节动能来实现**稳定控制**:围绕稳态配置进行调节,达到 **2.7% 的平均相对误差**。 ## 局限与展望 论文也指出,潜在探针(KE 探针)对**测量噪声和缺失像素**较为敏感。尽管如此,研究者认为结果支持一个观点:**潜在动力学可以保持动态且目标无关**,而经过标定的可观测量(只要保证唯一延拓)可能是状态控制的更好目标。 ## 小结 这项研究展示了**目标无关的联合嵌入预测控制**在 PDE 上的可行性。通过离线训练一个冻结的世界模型,再配合合适的物理探针,模型能够灵活适应多种控制任务,包括轨迹跟踪和稳定控制。对于机器人、流体控制等连续物理系统的控制问题,这种范式或许能提供更高效、更通用的解决方案。

HuggingFace1个月前原文

表格数据合成技术旨在保留单列边际分布的同时,更关键的是保留列间依赖关系——这种结构承载了不平衡领域(如欺诈检测和临床风险)中少数类的大部分判别信号。然而,最新研究揭示了一个令人担忧的现象:当前最常用的合成数据认证指标在很大程度上对列间依赖关系“视而不见”。 来自 arXiv 的最新论文(2607.21636)通过实验证明,一个完全独立建模每一列(从而破坏所有依赖关系)的基线模型,在使用逻辑回归分类器进行两样本测试(C2ST)时,竟被判断为与真实数据无异;而常用的成对趋势评分(Trend score)也仅部分敏感。这种“依赖盲区”意味着,即使合成数据完全丢失了列间结构,现有指标仍可能给出虚假的保真度评分。 ### 依赖感知诊断框架 为解决这一问题,研究者提出了一种依赖感知的保真度诊断方法。该方法将强分类器两样本测试(XGB-C2ST)分解为**边际、依赖和数值-类别交叉**三个组件,并以两个极端为锚点:最坏情况是完全因子化参考(所有依赖被破坏),最佳情况是真实数据。通过将这一框架应用于最先进的流匹配生成器(TabbyFlow/EF-VFM),研究者发现了一个**真实存在的依赖缺口**,而标准指标完全遗漏了它。 ### 依赖缺口的实际影响 研究进一步量化了依赖缺口的后果:**彻底破坏依赖关系会导致少数类效用急剧下降**,而生成器残留的依赖缺口虽然较小,但仍会造成一致的效用损失。这意味着,即使合成数据的边际分布完美,如果列间依赖关系失真,其在少数类识别等下游任务中的价值将大打折扣。 ### 缺口根源探析 那么,这个依赖缺口是否反映了平均场生成目标的结构性局限?答案是否定的。根据变分流匹配的最新恢复结果,该目标在渐近意义上是精确的。然而,缺口却异常顽固:**将模型容量扩大16倍也无法关闭它**。这指向了问题的核心——**缺乏直接的依赖监督**,而非容量或结构限制。 更令人警醒的是,由于残留缺口属于高阶依赖,任何简单的干预措施均告无效:无论是模型内部的依赖机制、事后copula修正,还是16倍的容量扩展,都无法弥补这一缺口。这一结论对业界普遍假设的“修复手段有效”提出了严肃警告。 ### 行业启示 对于依赖合成数据做模型训练、数据增强或隐私保护的应用方,这项研究提供了一个重要提醒:**仅依赖传统指标(如C2ST、趋势评分)来评估合成数据质量是远远不够的**。在欺诈检测、临床风险建模等高度依赖列间关联的场景中,必须引入依赖感知的评估工具,否则合成数据可能“形似而神不似”,导致下游模型性能严重退化。 论文提出的诊断框架有望成为业界新的评估标准,推动表格生成模型从“拟合边际分布”向“真正理解数据依赖结构”演进。

HuggingFace1个月前原文

世界模型的训练中,多步长潜变量一致性(multi-horizon latent consistency)是一项常见技术,但它的实际效果往往被低估或误解。近日,Kavya Bhand 与 Aadi Joshi 在预印本《Multi-Horizon Consistency as Geometry: When Latent Dynamics Contract, and When They Do Not》中,系统性地揭示了这一训练信号如何影响潜空间的“几何”结构——即状态转移的收缩或扩张行为。 ## 核心发现:一致性权重可压缩潜空间 研究团队将超参数 λ(多步潜变量一致性的权重)作为诊断工具,设计了一个扩张代理指标 **L20,q95**(简称 L20),并观测 horizon-20 的预测误差 E20。在 **Moving-MNIST** 数据集上(n=6 个种子),当 λ 从 0 提升至 0.8 时,L20 从 4.96 ± 2.01 骤降至 1.01 ± 0.06(配对 t 检验 p=0.005,Wilcoxon p=0.031),E20 也近乎减半(0.365 → 0.177,p=1.1e-13)。更值得注意的是,6 个种子中有 4 个在 λ=0.8 时 L20 低于 1,意味着潜空间进入了一个**近似收缩的带状区域**。 ## 领域限制:并非所有环境都适用 然而,这一收缩效应并非普遍成立。在**动作条件型**环境(如 Pendulum-v1、CartPole-v1)以及 KTH Actions 视频数据上,即使 E20 有所改善,L20 并未出现群体性下降。这表明:**软一致性损失对被动视频(passive video)的潜空间收缩效果显著,但对主动控制或复杂动态场景的约束力有限**。 ## 随机强迫定律:统一不同领域的解释 为解释这一差异,作者提出了一个“随机强迫定律”(stochastic-forcing law):L20 ~ 1.23 + 1.82η(λ=0.8 时,bootstrap 斜率 CI [1.73, 1.92],R²=0.96)。通过校准有效噪声强度 η_eff,不同控制域的数据点落在同一条曲线上。进一步,在 λ=0.4 和 1.2 的完整联合切片中(30/30 单元格,5 个 η × 3 个种子),L20(η) 的线性斜率相近(约 1.69 和 2.00),但团队未拟合连续的 (λ, η) 曲面。 ## 行业启示:从“调参”到“理解几何” 这项研究对世界模型的设计者具有直接意义: - **诊断工具**:L20 可作为一种简单的几何诊断指标,帮助判断潜空间是否过度扩张。 - **领域敏感性**:在被动视频预测任务中,适当提高一致性权重能有效压缩潜空间,降低 long-horizon 误差;但在交互式或复杂动态场景中,需谨慎使用。 - **未来方向**:研究未报告 DreamerV3 或 TD-MPC2 的回报指标,也未拟合完整的 (λ, η) 曲面,这为后续工作留下了空间。 总体而言,这项工作将多步长一致性从“训练技巧”提升为**几何控制的科学工具**。对于追求稳健长期预测的世界模型而言,理解潜空间的收缩边界,或许比单纯追求低误差更为根本。

HuggingFace1个月前原文

一项新研究将大语言模型(LLM)驱动的闭环通道配置搜索从稀疏采样扩展到密集采样,验证了优化行为的可迁移性,并发现了更深层的架构规律。 ## 研究背景 先前的研究表明,通过让LLM生成可执行代码并接收准确率反馈,可以直接优化神经网络的宽度(通道数)。然而,这些结果仅基于少量有效评估,未能确认在更密集的采样下优化行为是否持续,以及是否会出现新的架构规律。 ## 扩展实验设置 为了验证这一点,研究者将每个微调周期的候选网络数量提升至**250个**,共完成**8个完整周期**,生成了**2000个候选网络**。经过任务和元数据过滤后,获得了**462个有效的CIFAR-100评估结果**。 ## 关键发现 ### 1. 优化信号可迁移 - **平均准确率**:每个周期的平均准确率呈现正向线性趋势,斜率为**9.87e-4**(p=0.043),表明优化信号在密集采样下依然有效。 - **前沿性能**:最佳准确率从0.3144提升至**0.3676**,top-5和top-10平均准确率也呈正向趋势。 ### 2. 参数效率显著提升 最佳模型在达到0.3676准确率时仅需**1180万参数**,而早期一个高性能模型(0.3144准确率)却需要**1.665亿参数**。这证明LLM引导的搜索不仅提升了准确率,还大幅提高了参数效率。 ### 3. 架构规律浮现 更大规模的样本揭示了先前难以察觉的架构规律: - **非2的幂次通道宽度**:在有效候选中,**41.8%** 的网络采用了非2的幂次的通道数,打破了传统设计惯例。 - **结构化通道分配模式**:最强模型在早期采用中等宽度,而在中间或后期块中扩展通道数,形成了特定的分配模式。 ## 意义与展望 这项研究证实了LLM驱动的闭环通道搜索在更大规模下的有效性,并揭示了数据驱动的架构设计规律。未来,该方法有望与神经架构搜索(NAS)结合,为自动化模型设计提供新思路。研究者计划进一步探索更复杂的搜索空间,并验证该方法在其他数据集上的泛化能力。

HuggingFace1个月前原文

近日,一篇来自arXiv的论文(2607.20512)对Muon优化器在模算术任务上更快达到“顿悟”(grokking)的原因进行了深入剖析。此前研究认为,Muon的优势源于“谱范数约束加正交化动量”,但并未区分哪个机制真正起作用。该研究通过多种子、多学习率的消融实验和机制分析,揭示了关键成分:**正交化(即Newton-Schulz迭代)** 才是加速的根源,而谱范数约束不仅没有贡献,甚至可能带来不稳定性。 ### 消融实验:正交化是核心 研究者将Muon拆解为“仅谱范数约束”和“仅正交化”两个变体,与完整的Muon及AdamW进行对比。结果显示: - **仅正交化**的优化器在达到grokking阈值的时间上与完整Muon几乎一致; - **仅谱范数约束**的优化器不仅速度与AdamW相当,而且在某些学习率下表现不可靠; - 该结论在不同学习率下均成立。 这说明,Muon的加速效果完全来自正交化步骤,而非谱范数约束。 ### 机制分析:更低谱范数的解 进一步研究发现,正交化优化器达到泛化时,模型的谱范数比AdamW低了约3倍。在控制嵌入更新量的前提下,正交化优化器倾向于收敛到**更低范数的解**,而不是简单地减少嵌入的扰动幅度。这解释了为何正交化能促进泛化——它引导模型走向更简洁、更稳定的表示。 ### 迭代次数的影响与稳定性权衡 论文还考察了Newton-Schulz迭代次数的影响。将迭代次数从默认的5次减少到1次,虽然能更快达到grokking阈值,但得到的解非常脆弱,容易发生瞬时的性能崩溃(transient collapse)。这种脆弱性随学习率增大而加剧:**单次迭代仅在低学习率下快速且稳定**,而5次迭代则在各种学习率下都表现稳健。因此,标准配置的5次迭代是更鲁棒的选择。 此外,研究者发现,在正交化优化器中完全去掉谱范数缩放(spectral scaling)并不会造成性能损失,这进一步简化了Muon的实现。 ### 方法论贡献:稳定性感知的评估指标 一个贯穿全文的方法论亮点是:研究者提出了**稳定性感知的度量**——同时报告首次达到grokking的时间(first-crossing time)和持续泛化的时间(sustained-grok time)。他们指出,仅看首次穿越时间可能会对优化器性能产生误导,因为某些快速达到的泛化可能很快崩塌。使用双指标评估,能更全面地反映优化器的实际表现。 ### 结论与启示 这项研究清晰地分离了Muon优化器中的两个组件,证明**正交化动量是加速grokking的有效成分**,而谱范数约束并非必要。结果不仅深化了对优化器设计原理的理解,也为实际应用提供了指导:若想加速模型的“顿悟”过程,应优先考虑引入正交化机制,同时注意迭代次数与学习率的平衡,以避免泛化的不稳定性。 论文代码已开源,便于社区复现和进一步探索。

HuggingFace1个月前原文

大语言模型(LLM)的性能在很大程度上取决于训练数据的质量,但业界此前缺乏一个统一的基准来衡量LLM及其驱动的数据工作流在端到端数据准备方面的表现。近日,来自北京大学、上海人工智能实验室等机构的研究团队推出了 **DataPrep-Bench**,这也是首个在统一框架下同时评估LLM数据构建与数据质量评估能力的基准。 ## 核心能力:数据构建与质量评估 研究团队将LLM驱动的数据准备拆解为两个互补的能力维度: - **数据构建**:将原始数据源转化为可用于监督训练的标注数据; - **数据质量评估**:在正式训练前,预测候选数据集对下游任务的训练价值。 值得注意的是,这里的“质量”并非指文本表面的流畅性,而是指数据对下游训练的实际效用。 ## 基准设计:跨领域与多模型验证 DataPrep-Bench覆盖了**六个领域**(如金融、科学、医学等)和多个基础模型。在数据构建任务中,所有方法在相同原始数据上运行,然后通过在输出数据上结合Dolly-15k微调基础模型来评分。研究团队还发布了 **Data-Construction-Skill**,一个基于技能引导的智能体,在Llama-3.1-8B金融数据集上相比纯Dolly基线提升了近20个绝对百分点,在知识提取密集型领域与最强的智能体和基于DataFlow的方法表现相当。 在数据质量评估任务中,评分函数通过其与下游性能的皮尔逊相关系数来评估。团队提出了 **分布对齐分数(DAS)**,一种基于MMD(最大均值差异)的分布评估器,用于衡量候选数据集与领域代理之间的分布差异。DAS在六个领域中的四个取得了最强的跨模型相关性,并且在数学、科学和医学领域同时达到了 **r > 0.70**,优于现有的基于质量、多样性和启发式的评估方法。 ## 行业意义:推动数据为中心的AI发展 DataPrep-Bench的出现填补了LLM在数据准备能力评估上的空白。随着LLM在数据生成、清洗和标注中的应用日益广泛,如何系统性地衡量这些“数据准备者”的表现成为关键问题。该基准不仅提供了标准化的评估协议,还释放了可复现的基线方法和数据集,有助于推动数据驱动型AI的进步。 对于从业者而言,DataPrep-Bench的发布意味着可以更客观地对比不同数据准备策略的效果,从而优化训练数据流水线。特别是DAS评估器的提出,为实时数据质量监控提供了新的工具。 ## 小结 DataPrep-Bench是首个将数据构建与质量评估置于同一下游验证框架下的基准,它强调了数据准备作为LLM能力提升的同等重要目标。未来,随着更多智能体方法和评估工具的出现,数据准备环节有望成为LLM应用落地的关键突破口。

HuggingFace1个月前原文

## 核心发现:格式压力下的“被迫幻觉” 一项来自 arXiv 的新研究揭示了语言模型在**生产环境**中的一个隐蔽但普遍的缺陷:当模型被要求填充固定格式(如 JSON 字段、函数参数)而非自由文本时,它们会**凭空编造答案**,即使用户明确告知“信息不足”。 该研究的作者 Rana Muhammad Usman 构建了 **PhantomFill** 基准测试,通过设计**无法回答的问题**来探测模型的诚实性。例如,一条显示 12,400 次点赞但没有任何可见回复的帖子,或一个通话从未被转录的支持工单。在自由文本模式下,GPT-5.5 有 98% 的概率会诚实回答“没有回复数据”。但一旦要求输出一个**必填的 JSON 字段**(如情感分析),同一模型在 40 次测试中**全部编造**了答案——它虚构了从未见过的观众情绪,甚至杜撰了从未听过的客户引语。 ## 数据触目惊心:必填字段是“幻觉催化剂” 研究对 13 个模型进行了系统测试,结果呈现惊人的一致性: - **必填字段驱动 100% 编造率**:在 10 个模型中,只要字段被标记为“必填”,模型便 100% 产生虚构内容。 - **“信息不足”选项形同虚设**:即使提供了明确的“证据不足”选项,9 个开源模型全部选择忽略,继续编造。 - **直接指令被架构覆盖**:对 6 个模型下达“不要推断情感”的明确指令,其中 4 个模型仍然因为 schema 要求而强行输出情感分析结果。 值得注意的是,**模型规模与诚实性并非线性关系**:在同一模型家族中,最小的模型选择了拒绝回答,中等规模的模型开始编造,而最大的模型又重新变得诚实。这说明“在格式压力下保持诚实”是一种**训练结果**,但目前几乎没有团队在衡量这一指标。 ## 问题根源:幻觉藏在格式的“缝隙”里 研究指出,问题的核心在于**生产环境中的模型从不写散文**——它们填充的是 JSON 字段、函数参数和抽取模板。而这些格式中的**必填枚举类型**和**最小数量数组**恰恰是模型无法进行免责声明的地方。当模型被要求提供一个必填的情感标签时,它无法输出“无法确定”,只能强行给出一个情感值——无论对错。 ## 解决方案与启示 研究团队提出了一种简单的修复方案:在 schema 中增加一行代码,允许字段明确标记“证据不足”。但更根本的启示在于:**当前对模型幻觉的评测几乎都基于自由文本生成,严重低估了生产环境中的真实风险**。PhantomFill 基准提供了两个可量化的指标:**强制编造率(Coerced Fabrication Rate)**和**回避选项利用率(Escape Utilization Rate)**,旨在推动行业关注这一被忽视的角落。 对于 AI 开发者而言,这一发现意味着:在构建基于 LLM 的表格填充、数据抽取等应用时,**必须对必填字段的输出进行额外的验证与约束**,否则模型可能会在用户不知情的情况下“创造事实”,带来不可预测的业务风险。

HuggingFace1个月前原文

## 概述 处理包含图表、表格和领域术语的复杂PDF文档,一直是检索增强生成(RAG)系统面临的核心挑战。一篇来自arXiv的新论文提出了 **Multimodal CoLRAG-TF**,一种四轴融合架构,通过整合文本嵌入、关键词匹配、知识图谱三元组过滤和图像相似度,显著提升了多模态文档的检索质量。 ## 技术亮点 该系统的核心创新在于其**三重过滤机制**: - **混合索引**:系统从43份日本灾害教训PDF中提取了2,403个多模态块,并利用混合OCR流水线和LLM生成标题。 - **知识图谱增强**:提取了11,414个OpenIE三元组,使用FAISS索引实现亚秒级查询,并通过层次化传播相关性信号。 - **粗到细检索**:受HippoRAG2启发,先按卷→章→块的顺序缩小搜索空间,再进行最终融合评分。 ## 性能数据 在457对基准测试上,Multimodal CoLRAG-TF取得了以下成果: - **检索召回率**:0.9909 - **多跳答案相似度**:相比单跳查询提升71.6% 贝叶斯优化显示,**三元组轴权重必须占主导地位(α_triple = 0.44)**,以抵消词汇偏差并维持多跳检索质量。 ## 应用前景 论文还展示了将视觉输入(如图片)直接映射到相关教训管道的流程,证明该方法不仅适用于灾害领域,也可推广到其他异构PDF场景。该工作为处理工程报告、医疗文档等复杂多模态材料提供了通用框架。 ## 小结 Multimodal CoLRAG-TF通过三重过滤融合,有效解决了传统RAG在复杂PDF上的多跳推理难题,其开源索引和优化策略为后续研究奠定了坚实基础。

HuggingFace1个月前原文

循环Transformer通过在测试时重复应用共享的循环块来增加计算量。传统上,学习型停止目标使用单一退出分布同时作为推理时的停止规则和训练时各深度损失的权重。这导致退出选择与轨迹形成相互纠缠:门控不仅选择使用哪个循环状态,还决定了每个中间状态受监督的强度。因此,自适应计算性能不佳可能源于读出机制、诱导轨迹或两者的交互。 本研究通过轨迹-读出视角,在受控合成任务(模算术和二进制奇偶校验)以及大规模Ouro-1.4B和2.6B检查点上,对循环Transformer的自适应深度进行了系统诊断。研究发现:**固定先验深度监督**(在无输入依赖停止策略下塑造轨迹)能产生**难度感知轨迹**,其中间状态暴露了有用的停止信号;简单的**事后置信度读出**往往能匹配或超越学习型线性门控和MLP门控。 在冻结轨迹上拟合门控可定位失败根源:问题主要源于联合门控训练诱导的轨迹,而非门控表达能力有限。这一模式在Ouro评估中也得到验证——预训练的暂停门控具有竞争力但并非统一帕累托最优,实测延迟表明平均退出深度的减少能转化为实际的推理时间节省。 该诊断将循环Transformer的自适应深度重新定义为轨迹形成与退出读出的联合问题,而非单纯的门控学习,揭示了先前学习型停止工作常隐含的关键区别。

HuggingFace1个月前原文

**核心观点:** 传统滤波方法(如卡尔曼滤波器)在处理高维、非线性传感器信号时表现不佳。最新研究提出**生成式贝叶斯滤波(GBF)**,利用条件变分自编码器(CVAE)替代简单观测模型,将状态估计转化为基于分数的采样问题,在制造系统监测和心律失常诊断等任务中显著提升了准确性和鲁棒性。 现代动态系统(如自动驾驶、工业物联网)中的传感器信号呈现出高度非线性与异质性,传统卡尔曼滤波器依赖的线性高斯模型已难以胜任。针对这一挑战,来自学术界的研究团队提出了**生成式贝叶斯滤波(GBF)**框架,其核心思路是:用预训练的**条件变分自编码器(CVAE)**作为观测模型,替代传统滤波器中假设的简单分布。 ### 如何工作? GBF 保留了贝叶斯滤波的预测-更新递归结构,但将测量更新步骤重新定义为**后验采样问题**——结合动态系统的先验与 CVAE 诱导的似然函数。进一步,该问题被转化为**基于分数的采样问题**,从而继承了生成模型的灵活性,并借助集成方法实现不确定性量化。换句话说,GBF 不再假设观测数据服从高斯分布,而是让数据驱动的生成模型自动学习真实观测分布,从而捕捉复杂模式。 ### 实验验证 研究者在合成数据集以及两个真实场景——**制造系统监测**和**心律失常诊断**——上进行了评估。结果显示,相比卡尔曼滤波、粒子滤波等基线方法,GBF 在状态估计的**准确性**和**鲁棒性**上均取得显著提升。尤其在心律失常诊断中,GBF 能更准确地追踪心脏电信号的隐状态,为医疗 AI 提供了更可靠的时序推断工具。 ### 行业意义 这一工作为**高维非线性系统**的状态估计开辟了新路径。在工业 AI、自动驾驶、机器人等依赖多模态传感器的领域,GBF 有望替代传统滤波方案,成为下一代在线推断的基石。此外,其基于分数的采样框架天然适配扩散模型等最新生成技术,未来可进一步扩展。 论文以 arXiv 预印本形式发布,代码尚未公开,但方法已清晰表述,值得关注。

HuggingFace1个月前原文

## 研究背景与核心问题 在可解释性研究中,稀疏自编码器(SAE)被广泛用于分解神经网络内部表示。一个关键假设是:**SAE特征平面(由单个特征及其对应的解码器方向定义)可能承载更多与语义相关的几何结构**,例如“和乐”(holonomy)——一种衡量平行输运后方向变化的量。本文通过预注册实验,在 **Gemma 2 2B** 模型上检验了一个具体预测:**活跃SAE特征平面(即当前token激活的特征对应的平面)是否比混合特征平面(包含激活与非激活特征)具有更大的和乐值**。 ## 实验设计与关键结果 研究者在 **第12层到第13层残差流的最终token读出口** 测量和乐:通过限制雅可比传输规则携带局部标架沿小环移动,并将旋转量除以环面积进行归一化。实验设计、显著性阈值、分析和判定规则均在查看数据前冻结。 结果出人意料——**预测被反向证伪**:活跃特征平面的和乐值**低于**匹配的混合特征控制组,调整后的对数对比度为 **-0.29439**(95%置信区间 [-0.43989, -0.14889])。这一反转并非由特征幅度差异简单解释:在匹配幅度条件下,由于共同支持缺失,随机、混合和活跃三类平面之间的排序无法定义。 ## 诊断分析与未解之谜 冻结后的诊断实验表明:在小验证子集上,和乐值遵循面积律;配对回归显示匹配中心位移有界;同时,**传输畸变**(transport distortion)被识别为一个可能的机制或混杂因素。作者强调,该结果是一个**狭窄、可审计的操作性反转**,而非“意义抑制和乐”的因果论断。 目前,导致反转的潜在原因仍然开放,包括: - 激活强度几何 - 特征参与程度 - 字典几何 - 匹配中心位移 - 激活流形邻近性 - 传输剪切 ## 行业意义与启示 这项研究对AI可解释性领域具有重要启示: 1. **预注册方法的价值**:通过预先冻结分析计划,避免了p-hacking和事后解释,增强了结果可信度。 2. **SAE假设的挑战**:广泛使用的SAE特征平面可能并不像直觉认为的那样承载更多语义几何结构,甚至可能相反。这提示研究者需要更精细地审视SAE的几何属性。 3. **开放科学实践**:论文附带了完整的实验记录和代码(存档于Zenodo),便于复现和后续研究。 该工作提醒我们,在解释神经网络内部机制时,**直观假设需要经受严格检验**。未来研究需要进一步探索和乐反转的根源,以及如何利用这一发现改进SAE的可解释性。

HuggingFace1个月前原文