近年来,基于大语言模型(LLM)的智能体工作流(Agentic Workflows)逐渐成为构建可靠自动化系统的关键抽象。然而,设计高质量的工作流仍然高度依赖人工经验和领域知识,这成为该技术大规模落地的瓶颈。针对这一问题,复旦大学的研究团队提出了**FlowScout**,一种从历史任务记录中自动生成工具集成型代理工作流的执行引导框架。相关论文已提交至arXiv(编号:2608.10039)。 ## 现有方法的局限 目前,已有研究尝试从历史任务解决记录中自动生成代理工作流,但这些方法主要生成**以LLM为中心**的工作流,即真实工具的执行被抽象并由LLM节点模拟。这种方式虽然降低了建模难度,却导致生成的工作流在实际运行中稳定性和可用性不足。工具调用的真实反馈缺失,使得工作流难以适应真实环境中的不确定性和错误。 ## FlowScout的核心设计 FlowScout将代理工作流表示为有向图,包含LLM节点、工具调用节点以及依赖边。其构建过程分为两个阶段: - **初始骨架挖掘**:从历史记录中提取常见的工具协调模式,构建初始工作流。 - **拓扑优化**:基于蒙特卡洛树搜索(MCTS),利用执行反馈不断调整工作流拓扑,以提升整体性能。 这种设计使得生成的流程不仅包含LLM的决策,还真实地集成了工具调用,从而更贴近实际应用场景。 ## 实验结果:显著提升 研究团队在四个代表性任务域上对比了FlowScout与三个基线方法(PM4Py、ReAct和AFlow)。实验结果显示: - **工具调用正确性**提升至少**92.69%**; - **执行质量**提升至少**17.66%**; - 多次运行之间的性能波动也更低,说明FlowScout生成的流程具有更好的稳定性。 这些数据表明,FlowScout在生成可靠、稳定的工具使用流程方面具有显著优势。 ## 意义与展望 FlowScout的提出,为自动构建高质量代理工作流提供了一条新路径。它通过引入执行反馈机制,弥补了以往方法中工具执行被抽象化的缺陷,使得生成的工作流更贴近实际部署需求。未来,该方法有望在RPA、智能客服、数据分析等需要复杂工具调用的场景中发挥重要作用。不过,论文目前尚未公开代码,实际应用效果仍需进一步验证。
随着大语言模型(LLM)越来越多地被用于代表用户执行任务,如何确保模型真正理解并遵循用户的潜在偏好,已成为一个关键挑战。然而,现有的评估基准大多聚焦于风格模仿或通用工具调用,很少触及决策层面的个性化。为此,研究人员推出了 **UserToolBench**,一个专门测试工具使用型 LLM 在个性化决策能力上的新基准。 ## 核心设计:隐藏用户画像,考验真实决策 UserToolBench 的独特之处在于“用户画像隐藏”设计。模型在测试时无法直接看到用户的显式画像,而必须从多轮交互历史中**推断用户的潜在偏好**,并在信息不完整时主动判断是否需要澄清,最终生成符合用户意图的工具调用轨迹。这种设计更贴近真实应用场景——用户不会总是清楚地表达自己的全部需求。 该基准基于隐私清洗后的真实交互轨迹构建,融合了结构化人物画像、公共 API 风格的工具生态以及长周期多轮对话。具体数据规模包括:**10 个用户画像、36 个工具集、1,065 轮对话、170 个独立工具**,并覆盖三类任务:信息缺失场景、单工具调用、多工具协调。 ## 实验结果:现有模型仍有明显短板 研究团队对当前主流的工具使用型 LLM 进行了测试,结果显示,这些模型在个性化委托任务上仍存在显著困难。主要瓶颈集中在三个方面: - **多工具协调**:在需要调用多个工具并协调其顺序和参数时,模型表现不佳。 - **缺失约束推断**:当用户没有明确给出某些条件时,模型难以从上下文中推断出隐含约束。 - **长周期行为一致性**:在多轮对话中,模型容易偏离用户偏好,无法保持行为的一致性。 这些发现表明,仅让模型输出听起来像特定用户的文本是远远不够的,真正的个性化要求模型能够**为用户做出正确的决策**。 ## 意义与启示 UserToolBench 的提出为个性化评估提供了新思路:从“风格模仿”转向“决策正确性”。这对于 AI 助手、智能代理等应用的发展具有重要意义。未来,工具使用型 LLM 需要在理解用户深层需求、主动澄清歧义以及跨任务保持一致性方面做出更多改进。 该研究由多所机构的研究人员合作完成,论文已提交至 arXiv(编号:2608.10042),目前正在同行评审阶段。
在机器学习领域,从成对比较中学习物品奖励是一个基础且广泛研究的问题,其应用涵盖推荐系统、社会选择以及大型语言模型的微调等。然而,当这些比较数据来自众包平台(如Amazon Mechanical Turk、Scale AI)时,一个现实挑战是工人可能因领域知识有限或追求利益最大化而提供不可靠的标注,甚至故意“灌水”。传统方法往往假设工人具有一致的可靠性,但现实中并非如此。针对这一问题,一篇被UAI 2026接收的论文提出了一种联合学习框架,旨在同时估计物品奖励和工人可靠性,从而在噪声数据中提取真实信号。 ## 核心思想:引入工人能力参数 该研究采用**Boltzmann-rational模型**,它是Bradley-Terry-Luce模型的扩展,通过引入工人能力参数来刻画不同工人的可靠性。在这个模型下,每个工人的比较结果不仅取决于物品之间的真实差异,还受到其自身能力的影响。作者的目标是设计一种算法,能够从这些带有噪声的成对比较中,同时推断出物品的潜在奖励值和每个工人的可靠性水平。 ## 技术亮点:Polya-Gamma变量与EM算法 为了实现这一目标,研究者提出了一种基于**EM(期望最大化)算法**的解决方案。关键创新在于引入**Polya-Gamma潜变量**,将逻辑似然函数转换为条件高斯形式,从而简化了优化过程,并在E-step中得到一个简洁的Q函数。这一技巧将问题转化为一个**矩阵感知(Matrix Sensing)问题**,使得算法能够利用成熟的优化理论,并提供了**理论收敛保证**。这意味着,在合理条件下,算法能够稳定地收敛到最优解,为实际应用提供了可靠性。 ## 实验验证:鲁棒性与实用性 论文在真实世界和合成数据集上进行了大量实验,结果表明所提算法在多个基线上具有显著优势,并且对**垃圾信息(spammers)和对抗性工人**表现出很强的鲁棒性。即使在工人故意提供错误比较的情况下,算法仍能准确估计物品奖励,这在实际众包场景中尤为重要。实验还验证了算法在奖励学习任务中的有效性,例如在偏好排序和模型微调中的应用。 ## 行业意义与未来方向 这项研究对于依赖众包数据的人工智能应用具有重要价值。在大型语言模型的强化学习微调(如RLHF)中,人类反馈的质量直接影响模型性能。通过联合建模工人可靠性,可以更有效地筛选高质量反馈,减少噪声干扰,从而提升模型的对齐效果。此外,该方法的矩阵感知形式也为其他类似问题提供了新思路。未来,研究者可以探索更复杂的模型,如考虑工人偏好的动态变化,或将其扩展到更广泛的反馈类型。 总之,这项研究为解决众包比较数据中的可靠性问题提供了一套优雅且实用的解决方案,有望在推荐系统、人机协同和AI对齐等领域产生深远影响。
联邦学习(Federated Learning)面临的核心挑战之一是如何在数据分布、感知模态、模型架构、潜在空间维度乃至本地学习目标各异的异构系统中,让各智能体有效学习并交换信息丰富的表示。传统方法往往假设存在一个共享的全局潜在空间,但在现实场景中这一假设往往不成立。近期,arXiv 上发布的一项研究提出了一种名为 **Sheaf-based Federated Representation Learning(SFRL)** 的新框架,通过引入可学习的层(sheaf)限制映射,以几何对齐的方式实现全局一致性,无需共享潜在空间。该研究由 Gabriele D'Acunto 等多位学者合作完成,论文编号为 arXiv:2608.10016。 ## 核心思想:用层结构对齐潜在表示 SFRL 的灵感来源于数学中的层论(sheaf theory),它不要求所有智能体拥有相同的潜在空间,而是通过**正交变换和等距嵌入**来对齐相邻智能体的潜在表示。具体来说,每个智能体维护自己的本地模型,同时通过一个基于**层拉普拉斯算子(sheaf Laplacian)的二次粘合正则项**来约束相邻表示的一致性。该正则项的权重由可学习的限制映射决定,这些映射能够根据观测数据自适应调整几何结构,从而适应异构环境。 ## 算法设计:Sheaf-FRL 的交替优化 为了高效求解 SFRL,研究者提出了 **Sheaf-FRL 算法**,该算法在本地模型的梯度更新与边限制映射的闭式 Procrustes 更新之间交替进行。Procrustes 分析是一种经典的正交对齐技术,这里用于调整限制映射以最小化对齐误差。此外,正则项的评估仅基于一小部分共享的 pilot 样本,从而保证了可扩展性和通信效率。理论分析表明,Sheaf-FRL 在确定性和随机设置下均能收敛到一阶稳定点。 ## 应用验证:语义通信中的协作分类 在实验部分,研究者将 SFRL 应用于**语义通信**场景下的协作分类任务,并考虑了模型和数据异构性。结果表明,与基线方法相比,Sheaf-FRL 在不同程度的本地分布偏移下均能取得更高的本地及通信后分类精度,并且对潜在空间维度压缩表现出更强的鲁棒性。这意味着 SFRL 不仅提升了异构环境下的学习性能,还为带宽受限的通信系统提供了更高效的表示传输方式。 ## 意义与展望 这项研究为异构联邦学习提供了一种新的几何视角,突破了传统方法对共享潜在空间的依赖。通过层结构自适应地建模数据几何,SFRL 有望在分布式感知、边缘智能、多机器人协作等领域发挥重要作用。未来,研究者计划探索更复杂的层结构以及动态网络拓扑下的扩展,进一步推动该框架在实际系统中的应用。 对于关注联邦学习、多智能体系统或表示学习的读者而言,这篇论文提供了一个值得深入研究的理论工具和算法框架。
近年来,随着新冠疫情加速金融业务线上化,银行欺诈案件频发,利用AI识别欺诈交易成为数字社会的重要课题。一项新提交至arXiv的研究(编号2608.07471)系统比较了多种机器学习算法在银行欺诈检测中的表现,并提出了基于人工神经网络的有效模型,其中逻辑回归和堆叠泛化方法表现出色。 ## 研究背景与挑战 疫情催生了大量线上交易和慈善捐款活动,也为不法分子提供了可乘之机。传统规则-based风控系统难以应对日益复杂的欺诈模式,而机器学习凭借其模式识别能力,成为分析海量交易数据、识别异常行为的利器。然而,欺诈检测面临一个核心挑战:**数据高度不平衡**——欺诈交易占比极低,导致模型偏向多数类,漏报率居高不下。 ## 方法与创新 研究团队开发了专门的数据预处理流程,包括特征变换和特征工程,以提升模型对欺诈信号的敏感度。他们对比了多种算法,包括逻辑回归、神经网络等,并引入了**堆叠泛化(stacked generalization)**技术,将多个基学习器的预测结果作为新特征训练元模型,以集成优势。 ## 关键结果 实验结果显示,**逻辑回归算法的AUC值约为0.946**,表现优于其他单一算法;而采用堆叠泛化后,**AUC进一步提升至0.954**。AUC(ROC曲线下面积)是衡量分类模型性能的重要指标,越接近1说明模型区分欺诈与正常交易的能力越强。研究还通过可视化直观展示了各算法性能差异,并验证了人工神经网络在提升检测准确率方面的有效性。 ## 行业意义与展望 这项研究为银行风控系统提供了可落地的技术参考。在实际部署中,除了算法选择,还需考虑实时性、可解释性等因素。值得注意的是,该论文尚未经过同行评审,结论需谨慎看待。未来,随着联邦学习、图神经网络等技术的发展,欺诈检测有望在保护隐私的同时实现更精准的识别。 总之,AI在金融安全领域的应用正从概念走向实践,而此类研究为构建更可靠的数字金融环境奠定了基础。
野火预测模型通常将研究区域划分为均匀网格,忽视了火点空间分布的不均匀性。近期,一项发表于 arXiv 的研究挑战了这一传统范式,提出数据驱动的火灾分区方法,显著提升了短期预测性能。 ## 核心发现:分区方式比模型选择更重要 该研究由 Nicolas Caron 等人完成,论文标题为《Data-Driven Fire-Zone Segmentation for Improved Short-Term Wildfire Prediction》。研究团队指出,**空间离散化方式对预测结果的影响甚至超过模型本身**。传统网格划分虽简单,却无法反映火点聚集的真实格局,导致预测偏差。 ## 方法:无监督火灾分区算法 研究者提出一种结合**分水岭检测与 K-means 聚类**的无监督算法,直接从历史火灾模式中定义预测单元,而非依赖固定网格。该方法计算开销极低(**每次配置不到 10 秒**),且完全可并行化,适合大规模应用。 ## 实验结果:跨区域与模型的稳健提升 研究在**法国六个省份**和**六种预测模型**上进行了验证。结果显示,火灾分区方法在所有测试中均优于网格方法,**平均 IoU 提升 3% 至 6%**,且提升幅度随空间尺度变化。这表明优化空间离散化能带来显著且可复现的性能增益,为短期野火预报提供了新思路。 ## 行业背景与意义 当前,AI 在环境监测中的应用日益广泛,但多数模型仍沿用传统数据预处理方式。该研究提醒我们,**数据表征的合理性往往被忽视**,而它可能成为性能瓶颈。未来,类似的“数据驱动分区”思路有望推广至其他空间预测任务,如洪水、滑坡等灾害预警。不过,该研究目前仅基于法国数据,**其通用性仍需在其他地区验证**。
随着多模态大语言模型(MLLMs)通过模态对齐与融合实现更强的理解与推理能力,其安全性也面临全新挑战。近日,一篇发表于 ICLR 2026 研讨会的综述论文系统梳理了 MLLMs 的安全威胁与防护策略,指出传统单模态安全框架已难以覆盖多模态交互带来的新型风险。 ## 威胁模型的转变 论文提出了一种基于多模态的威胁分类法,将新兴威胁归纳为三类:**受损的模态整合**、**模态错位**以及**融合安全风险**。这些威胁反映了从单模态假设向多模态交互的转变,例如对抗攻击、数据投毒、越狱攻击和幻觉等问题在多模态环境下呈现出新的表现形式。 ## 安全策略的更新 作者总结了更新后的安全假设,并据此整理了近期 MLLMs 安全策略的进展。这些策略需要应对跨模态交互带来的复杂性,例如如何确保不同模态间的对齐不会引入新的漏洞,以及如何设计更稳健的防御机制来抵御融合层面的攻击。 ## 开放挑战与未来方向 论文最后讨论了开放挑战与未来研究方向,强调需要开发更具原则性和可扩展性的安全机制,以支撑多模态系统的可信赖部署。 这项研究为理解 MLLMs 的安全格局提供了系统性框架,对研究人员和开发者而言具有重要参考价值。随着多模态模型在现实场景中的广泛应用,建立完善的安全防护体系将成为关键议题。
在深度学习模型的部署中,不确定性量化是提升系统可靠性的关键环节。然而,传统方法往往难以区分不确定性的来源,这限制了模型在关键领域的应用。近期,一篇由Pierre Nodet和Thomas George提交的论文(arXiv:2608.07630)提出了一种新的方法,旨在更清晰地追溯预测中的认知不确定性,并将其归因于数据稀缺性或内在噪声。 ## 方法核心 该研究将两种经典统计估计器——同方差(homo-scedastic)和异方差(hetero-scedastic)线性化估计器——适配到现代深度学习框架中。通过利用近似Fisher信息矩阵的最新进展,这些估计器能够扩展到实际规模的神经网络架构,从而在保持计算可行性的同时,提供对不确定性的细粒度分析。 ## 实验发现 实验结果表明,不同的测试点受到不确定性来源的影响程度各异。有些预测可能主要受限于局部数据稀缺,而另一些则更多受到数据噪声的干扰。这种差异化的影响凸显了所提估计器在实际应用中的价值,有助于开发者针对性地改进模型鲁棒性。 ## 行业意义 在医疗诊断、自动驾驶等高风险场景中,理解模型何时“不确定”以及为何不确定,对于建立信任和避免错误决策至关重要。该研究为不确定性量化提供了更细致的工具,或将成为模型可解释性研究的重要补充。尽管论文尚处于预印本阶段,但其方法论为未来探索开辟了新的方向。
在工业制造与天体物理等涉及物理过程的场景中,时间序列预测的准确性至关重要。然而,传统卷积神经网络(CNN)虽然计算高效,却常常产生不稳定或物理上不一致的注意力模式,影响模型的鲁棒性和可解释性。为此,研究者提出了 **PhysAttNet**,一种融合物理信息的注意力框架,通过在训练中引入三项正则化约束,引导模型关注符合物理规律的时序结构,显著提升了预测性能。 ## 物理信息如何嵌入注意力机制? PhysAttNet 的核心思路是在轻量级 CNN 预测器上增加一个注意力头,并施加三类可微正则项: - **对齐正则化**:鼓励注意力与输入信号中的平滑、峰中心结构对齐,确保关注点落在物理上有意义的峰值附近。 - **平滑正则化**:约束注意力随时间连续演化,避免突变,符合物理过程的渐进性。 - **稀疏正则化**:促使模型只关注信息量高的时间区间,减少噪声干扰。 这些正则项无需人工标注或额外监督,仅依靠物理信号的固有属性即可引入归纳偏置,既保持模型轻量,又增强了可解释性。 ## 实验验证:从铣削力到耀变体耀发 研究团队在两个截然不同的任务上评估了 PhysAttNet: 1. **工业场景**:预测铣削过程中的切削力。此类信号受刀具磨损、振动等影响,噪声大且具有突发性,传统模型难以稳定捕捉关键事件。 2. **天体物理场景**:预测耀变体(一种活跃星系核)的光变曲线耀发。耀发事件具有非线性、多尺度特征,且观测数据存在不确定性。 实验结果显示,PhysAttNet 在预测准确性、泛化能力以及对结构性重要事件的预测表现上均优于基线模型,验证了物理信息约束的有效性。 ## 为什么这项研究值得关注? 当前,深度学习模型在科学领域的应用日益广泛,但“黑箱”特性常被诟病。PhysAttNet 提供了一条可行的路径:**将领域知识以正则化形式嵌入神经网络,而非简单堆叠数据**。这种做法不仅提升了性能,还让模型决策更可解释,有助于建立用户信任。 此外,该方法的设计具有通用性,可推广到其他物理信号预测任务,如地震预警、天气预测或能源负荷预测。随着物理信息机器学习(PIML)的兴起,类似思路或将成为科学AI的主流范式。 ## 小结 PhysAttNet 通过三项精心设计的正则化约束,在不增加模型复杂度的前提下,显著提高了时间序列预测的鲁棒性和解释性。这项研究为工业与天体物理领域提供了一种可靠的预测工具,也为物理信息神经网络的发展提供了新的思路。未来,如何进一步拓展到更复杂的多维信号以及实时应用,值得期待。
随着大语言模型(LLM)智能体的广泛应用,Agent技能(Agent Skills)作为可复用的能力模块,其一致性问题日益凸显。技能的不一致可能隐藏未声明的危险行为,或导致智能体选择错误的技能,从而引发安全风险。然而,现有的一致性检测方法多依赖预定义类别或声明范围,难以应对声明与实现之间复杂的对应关系。为此,研究者提出了SkillConsist,一种基于双向图对齐的新方法,旨在精准识别技能声明与实现之间的不一致性。 ## 技术核心:双向图对齐 SkillConsist的核心创新在于**双向图对齐**机制。首先,它利用大语言模型将技能中的声明部分和实现部分分离,形成行为记录,并分别构建声明行为图和实现行为图。然后,从任一行为记录出发,在另一侧图中搜索候选子图,并沿着行为关系逐步扩展,直至完整表达源端行为。最后,通过图差异分析识别对齐子图之间的冲突,输出不一致性检测结果。 这种方法有效解决了两个关键挑战:一是声明与实现行为可能混合在文本和代码中,难以直接比较;二是简洁的声明可能对应多个相互关联的实现步骤,传统方法难以捕捉这种多对一或一对多的映射关系。 ## 基准测试与性能表现 为评估SkillConsist的有效性,研究者构建了一个包含**633个技能**的基准测试集,来源于ClawHub上最受欢迎的500个公共技能和133个技能注入包。该基准包含319个不一致技能、314个一致技能,以及442处局部不一致标注。实验结果显示,SkillConsist在包级检测上达到了**86.85%的精确率、89.03%的召回率和87.93%的F1分数**,相比最佳基线,F1分数提升了**20.43个百分点**。在局部不一致定位方面,其精确率为67.60%,召回率为58.14%,F1分数为62.52%。 ## 行业意义与展望 Agent技能的一致性是保障智能体安全可靠运行的关键环节。SkillConsist通过引入图对齐技术,提供了一种更精细、更准确的检测手段,有助于开发者及时发现并修复潜在风险。尽管局部定位的准确率仍有提升空间,但包级检测的显著优势已表明该方法在实际应用中的巨大潜力。未来,随着智能体技术的普及,此类一致性检测工具将成为安全生态中不可或缺的一环。
离线强化学习(Offline RL)通常依赖一个固定的转移池来反复训练策略,这导致冗余数据在不同随机种子和超参数下产生高昂的计算成本。然而,简单的随机子采样可能会移除那些对长时程信用分配至关重要的稀有转移样本。针对这一矛盾,一项新研究提出了 **CODS**(Critic-guided Online Data Selection),一种由 critic 引导的迭代数据选择方法,旨在高效地筛选出可复用的高质量数据子集。 ## 核心机制:迭代与匹配 CODS 的核心在于其**交替迭代**的过程:首先拟合一个与目标算法匹配的 critic,然后基于该 critic 的贝尔曼残差(Bellman residual)来获取高残差转移样本,最后冻结这些样本形成可复用的子集。与优先经验回放(Prioritized Replay)不同,CODS 生成的是静态数据产物,而非动态采样策略;与一次性残差选择相比,CODS 会随着 critic 的更新不断刷新残差分数,从而更精准地捕捉数据价值。 ## 实验表现:显著优于基线 在 **D4RL** 基准的 20 个任务-算法组合上,CODS 在仅使用 **10% 数据预算**的情况下,保留了完整数据池性能的 **96.6%**。具体来看,CODS 在 **19/20** 个组合上超越了 ReDOR 和 OPER,并在所有 20 个组合上胜过其他所有子集选择基线。即使采用预先声明的分层推断并进行 Holm 校正,这六项优势依然显著。 ## 效率与可扩展性 研究还发现,在保持总选择器更新次数固定的前提下,**五轮获取**比单轮获取在四个代表性任务上平均提升 **11.23 个点**,之后趋于饱和。通过等次数和等时间评估,研究者确认计算优势来源于数据复用,而非单次运行的加速。此外,机制分析和干扰实验揭示了 CODS 既能有效富集稀疏奖励,又对异常值敏感。 ## 跨域泛化与结论 将 CODS 扩展到完整轨迹层面,在 **ALFWorld** 和 **GSM8K** 数据集上分别保留了 **95.4%** 和 **96.5%** 的池化成功率/精确匹配率,展示了其跨任务域的泛化能力。研究者强调,CODS 是一种可复用的选择流程,而非形式化的核心集保证。这一工作为离线强化学习中的数据处理提供了新思路,尤其适用于多任务、多超参数调优的场景,有望显著降低重复训练的计算开销。
高保真浸没边界模拟能够精确解析变形游泳者与其周围流体的耦合运动,但高昂的计算成本限制了其在工程设计、参数研究和控制中的重复评估。为了突破这一瓶颈,研究人员开发了神经算子代理模型,用于时间维度上预测平面和体积鳗鱼游泳者产生的流体动力学场。这些代理模型基于自适应流固耦合模拟导出的规则网格场进行训练,并以游泳者几何形状和雷诺数为条件。 在平面模型中,模型联合预测两个速度分量、标量涡量和压力。在五个留出的高雷诺数轨迹上,其全域相对L2误差为3.51%。对于体积公式,研究采用了三个特定目标的模型,共享多通道输入:一个预测三维速度,一个预测涡量,一个预测压力。在五个留出的范围内轨迹上,它们的全域相对L2误差分别为3.44%、5.58%和19.2%。 这些结果表明,对于移动边界游泳者流场,场分辨神经代理模型是可行的,同时也指出了压力精度和物理一致性是进一步发展的优先方向。该研究为流体力学中的复杂动态系统提供了新的建模思路,有望加速游泳机器人设计和水下航行器的优化。
在材料科学领域,确定晶体的三维结构是理解其性质、设计新材料的关键步骤。然而,从实验数据中解析晶体结构往往充满挑战,尤其是当数据来自稀疏、未索引的电子衍射(ED)观测时。传统方法要么预测晶体学标签,要么从索引反射中重建结构,要么在有限的结构库中检索候选,这些方法各有局限。 近日,一项发表于 arXiv 的研究提出了 **ED-CSP**,一个旨在直接从化学成分、原子数目和多视角电子衍射斑点集合预测晶体结构的机器学习框架。该框架的核心创新在于其模型架构:它结合了**关系集合编码器**、**排列不变的多视角聚合**以及**周期性流生成器**,能够联合预测晶格参数和分数原子坐标。这种设计使得模型能够处理稀疏且未索引的衍射数据,并生成完整的周期性结构。 为了训练和评估模型,研究团队构建了名为 **ED-CS** 的大型数据集,包含 **485 万**个模拟的多视角 ED 晶体结构,这些结构来自七个材料数据库,并经过去重和过滤以避免与 CHILI-100K 重叠。在 2,075 个留出的 CHILI-100K 材料上,仅使用 CHILI 训练的 ED-CSP 实现了 **57.49% 的 MR@5**(前五匹配率),优于当前最先进的基于粉末 X 射线衍射的晶体结构预测模型 PXRDGen(52.92%)。 值得注意的是,扩大训练数据规模能进一步提升性能:从一百万个结构的预训练模型初始化后,MR@5 提高到 **66.27%**。更令人印象深刻的是,在训练库中不存在的 1,024 种化学成分上,模型仍能实现 **53.52% 的 MR@5**,这表明 ED-CSP 具备真正的生成能力,而非简单的公式检索。 为了验证模型是否真正依赖于衍射图案而非仅依赖化学成分,研究者进行了对照实验:将目标 ED 观测替换为相同成分但非同构结构的衍射数据,结果 MR@5 下降了 **22.09 个百分点**,这证实了预测确实基于输入衍射图案。 ED-CSP 和 ED-CS 为从稀疏 ED 观测进行生成式晶体结构预测建立了基准,并为未来迁移到实验数据奠定了基础。尽管当前模型在模拟数据上表现优异,但实际实验数据中存在的噪声和系统性偏差仍需进一步研究。这项工作是机器学习在材料科学中应用的重要进展,有望加速新材料的发现过程。
电子健康记录(EHR)是临床预测的重要数据源,但因其包含异构实体、时序轨迹和任务间依赖,学习难度颇高。近期,来自亚利桑那州立大学的研究团队提出了一种名为 **MiGHT-EHR** 的统一表示学习方法,通过多任务图变换器同时建模EHR中的三类复杂特性,并在MIMIC-III和MIMIC-IV数据集上取得了优于现有方法的预测性能。 ## 电子健康记录的三重挑战 EHR数据中蕴含的临床交互并非简单表格,而是**异构、时序、多任务**的复杂网络。具体而言,它包含: - **异构临床实体**:患者、就诊、诊断、处方、手术等,以及它们之间的多种交互关系; - **纵向患者轨迹**:患者多次就诊的时间序列信息,反映病情演变; - **共享统计依赖**:不同临床预测任务(如死亡风险、再入院率)之间存在内在关联,可互相增强。 传统的EHR学习方法往往只捕捉其中部分特性,难以全面利用数据中的信息。 ## MiGHT-EHR:统一建模方案 MiGHT-EHR的核心思路是**构建一个异构信息图**,将EHR中的实体映射为节点,并通过归一化点互信息(PMI)识别实体间的统计关联,形成边。随后,利用**图变换器(Graph Transformer)** 架构,在多任务学习框架下同时优化多个临床预测目标,从而让模型学习到共享的、可迁移的表示。 这种设计使得模型能够: - 捕捉实体间的复杂交互,而非孤立看待; - 利用时间信息建模患者轨迹的演变; - 通过多任务学习共享统计强度,提升各任务的泛化能力。 ## 实验表现与可解释性 研究团队在MIMIC-III和MIMIC-IV两个公开数据集上进行了评估,覆盖**药物推荐、住院时长预测、死亡预测、再入院预测**四项任务。结果显示,MiGHT-EHR在平均性能上超越了当前最先进的方法,尤其在**死亡预测和再入院预测**上提升显著。 更值得关注的是,作者对学习到的表示进行了事后分析,发现: - 患者邻居在表示空间中按**临床结局**聚集,即相似预后的患者彼此靠近; - 重要的医学概念(如特定诊断)可作为表示空间中的**线性方向**被恢复,表明模型内化了临床语义; - 模型输出的**概率校准良好**,可靠性高。 这些发现表明,MiGHT-EHR不仅预测准确,还保留了**可解释的临床结构**,这对于临床决策支持系统的实际应用至关重要。 ## 展望 MiGHT-EHR为EHR表示学习提供了一种新思路,其统一建模框架有望在更广泛的医疗场景中落地,例如个性化治疗推荐、风险分层等。未来工作可能包括扩展到更多样化的EHR数据源,或探索在联邦学习环境下的应用,以保护患者隐私。
随着在线虚假信息的泛滥,开发可扩展的检测系统成为当务之急。传统方法多依赖表面语言特征或外部知识检索,但最新研究提出了一种全新视角:将真实性视为语言模型表征空间中的几何属性。来自巴西的研究团队在arXiv上发表的论文《Latent Fact-Checking: Detecting Misinformation through Activation Engineering》中,提出了一种基于激活工程的虚假信息检测框架,无需微调模型,也无需外部证据,仅通过分析模型内部的激活模式即可判断陈述的真伪。 ## 核心方法:对比激活加法(CAA) 该方法基于**对比激活加法(Contrastive Activation Addition, CAA)** 原理,通过配对的真假陈述激活差异,在残差流中提取一个"虚假方向"。具体而言,研究团队利用配对数据,计算模型在处理真实与虚假陈述时最后一层token激活的均值差异,从而得到这一方向向量。在推理阶段,将待检测陈述的最后一层token激活投影到该方向上,再将投影后的表征输入一个多层感知机(MLP)进行分类。整个过程无需微调骨干模型,无需外部知识检索,也无需任务特定的监督信号,仅依赖用于估计方向的对比对。 ## 实验结果:跨模型与基准的验证 研究团队在**Gemma、Llama和Qwen**三个系列的**11个模型**上进行了评估,参数规模从**2.7亿到120亿**不等,并在**AVeriTeC、LIAR和FACTors**三个事实核查基准上测试了方法。实验结果显示,虚假方向在不同模型规模和架构中均可恢复,且最后一层token的投影在LIAR和FACTors上匹配或超越了零样本和少样本提示基线,尤其是在较小模型上提升显著。然而,在AVeriTeC上的表现较为有限,研究团队将其归因于该基准基于证据的标注方案。 ## 意义与展望 这项研究为**可解释性驱动的虚假信息检测**提供了有力证据,表明真实性在预训练语言模型的潜在空间中是一个结构化的、线性可分的概念。该方法有望成为基于检索的检测管道的实用补充,尤其在资源受限或需要快速部署的场景下。未来,该技术或可集成到社交媒体平台的内容审核系统中,实现实时、低成本的虚假信息识别。不过,研究团队也指出,当前方法在需要外部证据的复杂情境中仍有局限,未来工作将探索如何将激活工程与检索增强相结合,以进一步提升检测的鲁棒性。
## 噪声感知下的智能体风险感知决策策略:从生物到人工智能的启示 在真实世界中,感知系统不可避免地受到噪声干扰。无论是生物体还是人工智能系统,都需要在不完美的信息下做出关键决策。一项提交至2026年人工生命会议(ALIFE 2026)的最新研究,通过构建人工生命中的捕食者-猎物模型,系统探讨了智能体在面对噪声感知时的最优决策策略,揭示了盲目信任感知标签的潜在风险,并强调了不确定性感知在决策中的核心价值。 ### 研究核心:噪声感知下的决策策略对比 该研究由David Szczecina独立完成,论文预印本已发布在arXiv上(编号:arXiv:2608.06420)。研究团队构建了一个基于人工生命的捕食者-猎物模型,模拟了生物在噪声环境中觅食的场景。在这个模型中,智能体需要根据对环境的感知(如猎物或捕食者的位置)做出行动选择,而感知结果受到不同程度噪声的干扰。 研究者对比了多种决策策略,包括**盲目信任感知标签**的策略,以及**考虑预测不确定性**的策略。实验在**对称与不对称感知噪声**两种条件下进行,以全面评估不同策略的鲁棒性。 ### 关键发现:盲目信任是灾难的根源 实验结果显示,随着噪声水平的增加,**盲目信任感知标签的智能体会遭遇灾难性失败**,生存率急剧下降,致命错误频发。相反,那些**采用不确定性感知策略**的智能体,能够显著提升生存概率,并有效减少致命错误的发生。 更引人注目的是,研究观察到智能体行为存在**定性上的相变**:随着不确定性的增加,智能体的行为从**探索性**转向**保守性**。这一现象与生态学中风险敏感觅食理论相呼应,表明在不确定环境中,个体倾向于规避风险,减少不必要的冒险。 ### 理论意义与人工智能关联 这项研究将**风险敏感的觅食行为**、**生态信息利用**与**人工生命**领域联系起来,通过显式信息收集机制,证明了在感知不可靠时,主动获取信息可以显著增强系统的鲁棒性。 更重要的是,该模型为**噪声标签下的鲁棒学习**提供了一个可解释的人工生命类比。在现实世界的机器学习应用中,训练数据往往包含错误标签,而如何设计对噪声鲁棒的算法是一个长期挑战。这项研究表明,借鉴生物系统的决策策略——即意识到感知的不确定性并据此调整行为——可能为改进人工智能系统提供新的思路。 ### 结语 这项研究不仅加深了我们对生物决策机制的理解,也为设计更加稳健的人工智能系统提供了启示。在日益复杂的应用场景中,让智能体学会“承认自己不知道”并采取相应策略,或许比追求完美的感知更为重要。随着人工生命与机器学习领域的交叉融合,我们有望看到更多这样的跨学科研究,为解决现实问题提供新视角。
在 AI 安全与对齐研究的前沿,一个反直觉的发现正引发关注:**给大模型裁判更多算力,并不等于让它检查更多要求**。来自卡内基梅隆大学等机构的研究者(Victor Akinwande、J. Zico Kolter、Aran Nayebi)在最新论文中揭示了这一现象,并提出了一种简单而有效的干预手段——**分片(Sharding)**。 ## 从“多任务裁判”到“分片小组” 论文指出,当单个 LLM 调用需要同时返回多个裁决时,部分决策会变得缺乏证据支撑,即便该调用获得了与多个独立调用相同甚至更多的 token 或工具预算。在专家评分的研究复现、法律文书审查和临床试验评估中,**单次调用裁决数量越多,与专家的一致性就越低**。 分片策略将要求拆分成更小的组,每组分配给独立的调用,最后汇总裁决。实验表明,与使用完整预算的单次调用相比,分片在保持模型、证据、总预算和每项决策预算不变的前提下,显著提升了与专家的一致性。更值得注意的是,**一个分片的较弱裁判,能够超越一个能力更强但采用整体判断的裁判**,甚至在后者获得完整预算时也能与之匹敌。 ## 对抗性鲁棒性:分片的另一重价值 除了提升监督准确性,分片还展现出对抗性鲁棒性。研究者设计了一种“最佳 N 选一”(best-of-N)对抗策略:攻击者保持底层工作不变,仅改变呈现方式,就能让过载的裁判对未真正满足的标准的接受度提高数倍。而分片在降低基线错误的同时,**有效消除了这种对抗优势**,即使攻击者的搜索范围扩大,过度接受率也保持在较低水平。 不过,分片并非万能。它无法防御针对每个标准分别说服裁判的攻击。论文发现,在这种情况下,**在分片之上叠加辩论式对立(debate-style opposition)** 能够抵御这种自适应重新优化。 ## 对 AI 对齐的启示 这项研究为 AI 监督机制的设计提供了重要洞见。在依赖 LLM 进行自动评估和审核的场景中,简单的任务拆分可能比堆砌算力更有效。它提示我们,**监督的质量不仅取决于模型能力,还取决于任务的结构化方式**。未来,分片或成为模型对齐工具箱中的标准组件,尤其在法律、医疗、科研等高风险领域,其价值尤为突出。 当然,研究仍处于 arXiv 预印本阶段,尚未经过同行评审,但其方法和结论为后续探索奠定了基础。如何在更复杂的任务中动态确定分片粒度,以及分片与辩论机制的结合如何扩展,都是值得关注的方向。
生成模型能够完美复现观测数据的分布,但这并不意味着它真正理解了数据背后的因果机制。一篇来自 arXiv 的新论文提出了一个发人深省的问题:当生成模型编码了错误的因果结构时,我们如何通过干预实验来揭露它?答案或许在于一场精心设计的“猫鼠游戏”。 ## 游戏规则:当生成器遇上对抗实验者 论文作者 Mojtaba Eslami 引入了一个**对抗式因果干预验证(ACIF)**框架。在这个框架中,一个结构因果生成器不断提出观测分布和干预分布,而一个对抗性的实验者则选择特定的干预手段,旨在最大程度地“证伪”生成器。这里的判别器不再是简单的“真实 vs 合成”分类器,而是由干预索引,专门检验生成器能否复现干预后的分布。 这个框架的核心洞见在于,**仅仅匹配观测分布是不够的**。一个生成模型可能完美拟合数据,但其内部因果结构却与实际不符。ACIF 通过引入对抗性干预,迫使生成器在更严苛的检验下暴露其因果假设的缺陷。 ## 理论突破:从可辨识性到均衡策略 对于有限的模型和干预类别,论文证明了几个关键结果: - **目标函数化简**:对抗性目标可精确简化为最坏干预下的积分概率度量(IPM),这为优化提供了清晰的数学基础。 - **干预等价识别**:模型可以被识别到干预等价类,而在分离干预族下可实现点识别。这意味着,通过精心设计的干预,我们不仅能判断模型对错,还能逐步逼近真实因果结构。 - **均衡存在性**:在混合策略下,对抗博弈存在纳什均衡,这为理论分析提供了稳定性保障。 - **有限样本保证**:论文给出了均匀收敛和基于间隔的模型选择保证,以及在对数级别上消除不一致模型的序贯设计策略。 这些理论结果并非纸上谈兵。论文展示了一个完整的线性高斯示例,其中两个观测上不可区分的因果方向,仅凭一个精心选择的干预就能被清晰分离。这直观地说明了**干预实验在因果发现中的不可替代性**。 ## 实践意义:连接生成建模与实验设计 ACIF 框架的意义不仅在于理论层面。它为因果生成建模、主动因果发现和实验设计之间搭建了一座桥梁。在实际应用中,研究人员可以利用这一框架来评估生成模型的因果可靠性,并指导实验设计,以最少的干预次数获得最大的因果信息。 当然,当前工作主要聚焦于理论证明和有限场景。未来,将 ACIF 扩展到更复杂的模型(如深度生成模型)和更大规模的干预空间,将是极具挑战且充满潜力的方向。 ## 结语 这篇论文提醒我们,生成模型的“强大”可能只是表象。在 AI 系统日益依赖因果推理的今天,确保模型不仅“知其然”,更“知其所以然”,变得愈发重要。ACIF 提供了一种对抗性的视角,帮助我们审视和验证模型的因果理解,从而推动更可靠、更可信的 AI 系统发展。
**固定与自适应拓扑深度算子网络:在Hausdorff局部凸空间上的函数测量** 深度算子网络(DeepONet)是学习函数到函数映射的强大工具,但传统方法通常依赖固定离散化上的点值采样,这限制了其泛化能力和对非标准输入空间的适应性。近期,来自布朗大学的Khemraj Shukla和George Em Karniadakis提出了一种新框架——**固定与自适应拓扑DeepONet**,通过引入连续线性泛函测量,将算子学习推广到更一般的Hausdorff局部凸空间。 该工作基于Ismailov提出的拓扑DeepONet框架,将点采样替换为从连续对偶空间$V'$中选取的连续线性泛函。这里,$V$的拓扑由一族点分离的半范数生成,而非单一范数,这使得框架能够处理非赋范空间,例如某些函数空间。研究者设计了固定和自适应两种测量系统,并结合Lee和Shin提出的系数空间两步法,同时引入仅训练解码器和正则化以稳定自适应坐标。 理论上,他们推导了离散误差分解,将误差分为测量误差、输出基误差和神经逼近误差,并给出了Barron率改进。实验评估覆盖了多个基准问题,包括反导数算子、非赋范局部凸输入空间、非均匀达西流、受控算子以及固定时间和时间演化的Navier-Stokes涡量算子。 在非均匀达西流问题中,功能模型在未见网格上保持了近分辨率无关的误差(5.5%-5.6%);在受控问题中,自适应测量将平均误差降至1.2%以下。对于固定时间Navier-Stokes问题,自适应拓扑DeepONet以128个功能坐标实现了1.685% ± 0.017%的平均相对$L^2$误差,成为基于DeepONet的最准确模型。而同等规模的傅里叶神经算子(FNO)虽然误差更低(0.832% ± 0.172%),但需要完整的64x64输入场,训练时间翻倍,峰值GPU内存高出10.7倍。 该框架提供了紧凑、可解释且可移植的坐标表示,适用于连续对偶空间,包括非赋范输入空间,为算子学习开辟了新的可能性。这一进展有望推动科学计算和机器学习在更复杂函数空间中的应用。
图神经网络(GNN)在推荐系统、药物发现和社交网络分析等领域表现卓越,而全图训练模式因其高精度备受青睐。然而,当扩展到多服务器集群时,全图训练面临严峻的通信瓶颈:节点间需要频繁交换嵌入向量,这种交换不规则且数据量大,严重制约了训练效率。 针对这一难题,来自香港科技大学(广州)等机构的研究者提出了 **SNI-GNN** 系统,其核心思路是**将部分计算任务卸载到智能网卡(SmartNIC)上,在网络中直接预测远程节点的嵌入**,从而大幅减少跨节点的数据传输。该研究成果已被数据工程领域顶级会议 **ICDE 2026** 接收。 ## 工作原理:让网络参与计算 SNI-GNN 的关键创新在于,它不再被动地等待远程节点发送嵌入,而是利用 SmartNIC 上的轻量级**线性趋势预测器**,基于缓存的历史嵌入来推断当前时刻的嵌入值。这种预测机制配合**基于重要性的边界节点采样策略**,能够优先处理对模型收敛影响更大的节点,从而在保证精度的同时显著降低通信量。 此外,系统还设计了**异步 DPU-GPU 数据流水线**和中间结果复用机制,进一步提升了整体吞吐量。研究者提供了严格的误差和收敛性分析,证明在二阶动态有界的情况下,预测器的偏差可控,且算法仍能保证标准的非凸收敛性(允许不精确梯度)。 ## 实测表现:通信削减近半,训练加速显著 研究团队在 **NVIDIA BlueField-3** SmartNIC 上实现了 SNI-GNN,并集成到当前先进的全图训练系统中。实验结果显示: - **通信量减少 21%–45%**; - 相比 BNS-GCN,端到端训练速度提升 **1.3–3.6 倍**; - 相比基线 SANCUS,速度提升最高达 **1.29 倍**; - 精度损失不超过 **0.01**; - 在拥有数千万条边的图上可高效扩展至 **16 块 GPU**。 ## 意义与展望 SNI-GNN 表明,基于 SmartNIC 的网络内预测技术并非要取代现有的图分区或压缩方法,而是可以作为它们的**有效补充**,共同构建通信高效的全图 GNN 训练方案。这一思路为未来在更大规模集群上训练超大规模图模型提供了新的可能性。 随着数据中心网络硬件的不断升级,将部分智能融入网络基础设施,或许会成为分布式深度学习的一种重要范式。SNI-GNN 的发布,无疑为这一方向迈出了坚实的一步。