SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Anthropic清除筛选 ×

arXiv:2607.22556v1 Announce Type: new Abstract: Continual learning (CL) is essential for small language models (SLMs) to adapt to evolving real-world needs in resource-constrained deployments. However, directly updating their limited parameter space causes catastrophic forgetting. While memory-based methods naturally address this by decoupling knowledge retention from parameters, existing approaches designed for large language models (LLMs) rely on abundant storage and strong in-context reasonin

Anthropic1个月前原文

arXiv:2607.22555v1 Announce Type: new Abstract: Medical diagnosis is a multi-stage process: extract facts, consult knowledge, generate a differential analysis, and select the best diagnosis with explanations. Frontier LLMs are strong generalists, but single-shot prompting often yields brittle diagnostic reasoning. We present the DeepLens Diagnosis Agent, a five-stage harnessing pipeline (combining model capabilities with disciplined process constraints) centered on a small medical reasoning mode

Anthropic1个月前原文

arXiv:2607.22549v1 Announce Type: new Abstract: Hybrid quantum-classical protein structure prediction depends strongly on Hamiltonian penalty weights, yet existing lattice-based workflows typically fix these coefficients by hand and evaluate only very short fragments in simulation. We present QFoldAgent, a closed-loop multi-agent framework for 5-residue tetrahedral-lattice folding in which a design agent proposes sequence-conditioned penalties, a VQE-based quantum-classical pipeline optimizes th

Anthropic1个月前原文

arXiv:2607.22562v1 Announce Type: new Abstract: Managing long-context dependencies remains a primary bottleneck in LLM agents, as redundant and irrelevant information can degrade multi-step reasoning. Strategic Forgetting for Agent Memory Systems (SF-AMS) is proposed as a framework for maintaining compact high-utility memory by modeling the long-term importance of memory units. SF-AMS replaces static retrieval and heuristic decay with a utility-driven survival mechanism that updates memory impor

Anthropic1个月前原文

arXiv:2607.22544v1 Announce Type: new Abstract: Visual counterfactual explanations aim to answer "what minimal change to this image would flip the model's prediction?", and are increasingly important as vision models are deployed in safety-critical domains (e.g., medicine). Existing diffusion-based methods can produce realistic edits, but they rely on external classifiers that must work reliably on noisy images, which makes them fragile and hard to deploy for robust explanations. We introduce C-

Anthropic1个月前原文

arXiv:2607.22554v1 Announce Type: new Abstract: Large language models (LLMs) often achieve strong accuracy on benchmarks, yet it remains unclear how reliably they apply this knowledge when the same question is phrased in different but equivalent ways. In this work, we study how model answers change under meaning-preserving paraphrases across factual question answering and mathematical reasoning tasks. Across four benchmarks and 13 models, we find that model outputs frequently depend on the exact

Anthropic1个月前原文

arXiv:2607.22561v1 Announce Type: new Abstract: LLM-as-a-judge has become the standard for automated evaluation, but it suffers from high cost, significant latency, and opaque decisions -- limitations that undermine its scalability and reliability. We address these with a simple, efficient alternative: program distillation. Instead of prompting an LLM at the evaluation time, we distill its decision logic into a committee of programs that score candidates directly. These programmatic judges offer

Anthropic1个月前原文

arXiv:2607.22548v1 Announce Type: new Abstract: Data centers and their compute nodes require accurate and flexible digital twins capable of modeling the complex interplay of workloads, environmental parameters, and physical metrics. Current machine learning approaches for HPC and its telemetry typically rely on a static subset of anonymous, fixed-position sensor variables tailored to single tasks. Consequently, these models become obsolete when target tasks change or sensor metrics vary. We prop

Anthropic1个月前原文

GPU领域的自动内核优化得益于像KernelBench这样的基准测试套件,它们为算法提供了一个共同的优化目标。然而,TPU(张量处理单元)领域却长期缺乏类似的标准化评估工具。近日,一篇发表于arXiv的论文(编号2607.20466)介绍了**JAXBench**——一个专为Google Cloud TPU设计的AI生成内核优化基准套件,旨在填补这一空白。 JAXBench包含**50个JAX工作负载**,这些负载既具有实际相关性,又为优化留出了充分的改进空间。其中,**17个生产级ML算子**直接提取自MaxText公共库中的主流架构,包括**Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2和AlphaFold2**。另外**33个算子**来自KernelBench的移植版本,经过正确性验证并重新设定了问题规模,以确保在TPU v6e上实现高MXU利用率。此外,8个生产算子还附带了来自Tokamax公共库的手工优化Pallas内核,并经过块大小调优,作为专家级的上限基线。 论文评估了四种基于反馈的方法,用于为JAXBench生成候选Pallas内核。实验结果表明,在像Pallas这样文档稀疏的DSL(领域特定语言)中,**目标特定的上下文比模型规模更重要**。使用Gemini 3 Flash模型时,通过引入经过整理的TPU文档,单样本正确率从**5.8%提升至37.3%**,成功解决了50个基准中的48个,并实现了**1.28倍的几何平均加速**。一旦正确性得到保证,搜索结构能带来显著收益。例如,Autocomp的束搜索流水线相比XLA实现了**1.36倍的几何平均加速**。在8个手工调优内核上,Autocomp达到**1.60倍**的几何平均加速,接近Tokamax提供的2.08倍上限,但在专门的分页和稀疏注意力算子方面仍有差距。 JAXBench的发布为TPU内核优化社区提供了一个标准化的评估平台。研究团队公开了基准套件、评估工具和基线结果,以促进开源贡献。这一工作不仅展示了自动优化在TPU上的潜力,也揭示了当前方法的局限性——尤其是在处理复杂注意力机制时。随着TPU在AI训练和推理中的广泛应用,JAXBench有望成为推动硬件与软件协同设计的关键工具。

Anthropic1个月前原文

## 快讯:一款能“剧透”点击诱饵的浏览器扩展问世 来自波兰华沙理工大学的研究团队近日在 arXiv 上发布论文,介绍了一款名为 **ClickGuard** 的 AI 驱动浏览器扩展。该工具不仅能检测点击诱饵文章,还能在用户点击前后发出警告,甚至提供一句“剧透”摘要,让用户无需阅读全文即可了解文章核心内容。 ## 混合架构:从词嵌入到“诱饵分数” ClickGuard 的核心是一个混合机器学习架构,它结合了 **Transformer 嵌入**、语言特征和自定义的 **“诱饵分数”**。研究团队评估了从传统向量化器到大语言模型(LLM)嵌入等多种 NLP 技术,最终基于 XGBoost 构建的模型在公开数据集上达到了 **91% 的 F1 分数**。 ## 使用体验:事前警告 + 事后分析 + 自动剧透 该扩展的工作流程分为三步: 1. **事前警告**:当用户即将访问疑似点击诱饵的链接时,扩展会发出提示。 2. **事后分析**:用户打开文章后,扩展会给出一个百分比分数,表示文章属于点击诱饵的可能性,并基于分析指标(包括系统专门开发的指标)解释预测依据。 3. **自动剧透**:扩展会生成一句到两句的 **文章摘要**,直接揭示文章的核心信息——用研究人员的话说,就是“剧透”掉点击诱饵的悬念,让用户无需浪费时间阅读。 ## 意义与局限 点击诱饵是互联网信息生态中的顽疾,传统检测方法往往依赖关键词匹配或简单规则。ClickGuard 的创新在于: - 将 **LLM 的信息度量能力** 与可解释的机器学习模型相结合,在准确率上取得突破。 - 提供“剧透”功能,从被动检测转向主动信息净化。 不过,该工具目前仍处于研究阶段,实际效果取决于模型对真实世界多样化点击诱饵的泛化能力。此外,如何平衡“剧透”与用户自主阅读意愿,也是一个值得探讨的问题。 ## 结语 ClickGuard 展示了 AI 在信息质量治理中的新可能性。随着大语言模型的理解能力不断增强,未来我们或许能拥有更智能的“新闻过滤器”,帮助我们在信息洪流中快速锁定真正有价值的内容。

Anthropic1个月前原文

大语言模型(LLM)凭借一组参数处理多种任务,但在KV缓存推理中,解码阶段是否利用了任务通用结构尚不明确。arXiv上最新论文《DecodeShare: Tracing the Shared Subspace of LLM Decode-Time Decisions》提出了一种新方法,通过识别解码时隐藏状态中跨任务共享的低维子空间,并测试其因果作用。 ### 核心发现 研究人员发现,在解码阶段,LLM的隐藏状态中存在一个**任务共享的低维子空间**。通过移除该子空间,模型的决策性能下降幅度远大于移除预填充阶段或随机子空间。这表明该子空间在解码时扮演着关键因果角色。 ### 对激活引导的影响 该共享子空间对**激活引导(activation steering)**具有实际意义:常见的引导方向可能重叠任务通用解码通道。通过投影去除共享子空间,可以分离两种组件的功能角色,而基于解码阶段的引导向量比预填充阶段的代理信号更可靠,更适合下游部署。 ### 实践价值 尽管共享子空间维度低,但它可作为解码时的高杠杆因果通道。这一发现为理解LLM推理机制提供了新视角,并可能优化模型效率与可控性。 ### 实验验证 实验在多种任务上进行,通过对比干扰不同子空间(共享、预填充、随机)的效果,验证了共享子空间的独特重要性。代码已开源。 ### 总结 DecodeShare不仅揭示了LLM解码时隐藏状态的结构特性,还为激活引导等应用提供了优化方向。未来工作可进一步探索子空间的动态特性及其与模型规模的关系。

Anthropic1个月前原文

## 概述 大模型时代的AI智能体,究竟是在真正解决问题,还是只是背下了标准答案?一篇来自arXiv的新论文提出了一个名为**InferenceBench**的基准测试,试图回答这个关键问题。该测试要求智能体在仅有两小时和一块H100 GPU的条件下,优化一个LLM推理服务的速度,且任务本身没有预设的固定路径。 ## 测试设计:四维优化挑战 InferenceBench设计了四个优化场景,分别对应推理的不同瓶颈: - **预填充延迟**:处理输入token的速度 - **解码延迟**:生成输出token的速度 - **并发请求吞吐量**:同时服务多个请求的能力 - **综合平衡**:同时优化以上三个指标 每个智能体需要部署一个兼容OpenAI接口的推理服务器,并在规定时间内尽可能提升性能。这种设计排除了“背公式”的可能性,因为最优策略会因场景而异。 ## 实验结果:进步显著,但天花板明显 研究团队测试了15种前沿智能体配置。结果显示: - 智能体相比朴素的PyTorch基线,**最高加速8.08倍** - 与默认设置的vLLM引擎相比,**最高加速4.05倍** - 然而,在相同时间预算下,简单的超参数搜索就能达到**最高11.53倍**的加速 这意味着智能体虽然能超越基础方案,但尚未达到简单搜索的上限。 ## 行为分析:为何智能体“不够聪明”? 通过对智能体运行轨迹的定性分析,作者发现了两个关键问题: 1. **策略同质化**:几乎所有智能体最终都收敛到同一个推理框架(如vLLM),缺乏多样性尝试。 2. **时间分配失衡**:智能体花费大量时间在重复测量、修复错误或微调超参数上,而非探索截然不同的优化策略。 这揭示了一个核心矛盾:智能体**并非缺乏领域知识**——它们能列出许多相关优化技术——但**缺乏提出多样化方案、系统评估并提交最佳结果的能力**。换句话说,智能体更像是“勤奋但缺乏创造力的实习生”,而不是“经验丰富的架构师”。 ## 行业意义:从“记忆”到“创新”的鸿沟 InferenceBench的价值在于它触及了AI智能体发展的核心瓶颈。当前很多基准测试存在“数据泄露”风险——智能体可能通过记忆已知解法获得高分。而InferenceBench的开放式设计迫使智能体必须实时探索和决策,这更接近真实的研发场景。 对于AI工程化领域,这项研究提示我们:**未来的智能体需要更强的探索能力和系统化实验设计能力**,而不仅仅是更大的知识库或更快的推理速度。如何让智能体在有限时间内更智能地分配资源、提出多样假设并高效验证,将是下一阶段的关键挑战。 ## 小结 InferenceBench不仅是一个新的基准,更是一面镜子,照出了当前AI智能体的真实水平:它们能完成基础优化,但距离真正的自动化研发还有一段距离。对于关注AI代理和LLM部署的从业者,这项研究提供了重要的参考坐标。

Anthropic1个月前原文

扩散大语言模型(dLLMs)正成为生成式AI领域的新焦点,但推理速度慢始终是制约其落地的瓶颈。近期,来自中国多所高校的研究团队提出了一种名为 **DC-Leap** 的训练无关加速框架,在标准基准测试中实现了最高 **105.02倍** 的推理加速,且生成质量基本不变。 ## 痛点:保守阈值与冗余迭代 dLLMs 的核心优势在于其并行解码能力,但现有加速策略普遍存在一个问题:**置信度阈值设置过于保守**。这背后是所谓的“联合概率依赖误差”(JPDE)——由于并行解码时无法准确捕捉token间的因果依赖关系,模型不得不采用更严格的阈值来保证生成质量,结果导致大量去噪迭代变得冗余,推理效率大打折扣。 ## DC-Leap 的创新:两步走破解依赖难题 DC-Leap 框架包含两大核心机制,旨在安全地突破保守阈值限制: 1. **动态连续验证(Dynamic Contiguous Verification)**:该方法将严格有序的因果约束直接融入并行解码过程。通过逐步验证token之间的依赖关系,DC-Leap 能够有效消除 JPDE 带来的不确定性,从而在中等置信度区间内实现可靠加速,同时保持与原始模型相当的性能。 2. **草稿引导解码(Draft-Guided Decoding)**:借助一个“草稿”模型先行生成多个连续token,为后续解码提供“前瞻上下文”。这种机制不仅扩展了上下文窗口,还能保留双向注意力在推理时的结构优势,进一步提升长序列生成场景下的效率。 ## 实测表现:长序列生成尤为亮眼 实验在多个标准基准上进行。在短序列任务中,DC-Leap 的加速比相对温和;但在**长序列生成任务**上,优势极为突出: - 在 **MBPP**(代码生成)任务中,加速比达到 **53.19倍**; - 若结合 KV-Cache 优化,整体加速比可飙升至 **105.02倍**。 值得注意的是,这些加速是在**不牺牲生成质量**的前提下实现的——论文指出,DC-Leap 在多个评测指标上与原始 dLLM 表现相当,甚至在某些场景下略有提升。 ## 行业意义:dLLM 实用化的关键一步 dLLMs 凭借其独特的反向扩散过程,在**可控生成、多模态融合、逆向推理**等任务上展现出传统自回归模型难以比拟的优势。然而,推理效率一直是其走向工业级应用的“阿喀琉斯之踵”。DC-Leap 提供了一种**无需额外训练**、即插即用的加速方案,意味着现有 dLLM 模型可以直接受益,无需重新训练或大幅改动架构。 ## 局限与展望 目前 DC-Leap 的加速效果在长序列场景下最为显著,短序列或小批量任务中的收益相对有限。此外,草稿模型的质量直接影响最终加速比,如何自适应地调整草稿策略,可能是后续优化的方向。 论文及代码已公开,研究团队表示将继续探索 DC-Leap 在更大规模 dLLM 及多模态扩散模型上的应用。对于 AI 基础设施团队而言,这无疑是一个值得关注的效率提升工具。

Anthropic1个月前原文

大型语言模型(LLM)在重复运行时给出不同答案,这种随机性是否揭示了模型不知道什么?一项新研究给出了否定的答案。来自arXiv的论文《随机采样在认知上是浅薄的:LLM中温度变化与模型多样性之间的维度差距》指出,仅通过调整温度参数(如τ=1)获得的随机采样,虽然能通过多数投票提供每个问题的不确定性估计,但无法揭示跨问题的结构——即相关问题是否同时出现错误,而这正是多样化模型集成所能做到的。 ### 方法对比 研究者比较了两种方案在同一组问题上的表现: - **单模型多次采样**:一个LLM在温度τ=1下运行100次 - **多模型集成**:24个不同LLM各运行一次,温度τ=0 使用Marchenko-Pastur随机矩阵检验来区分信号与采样噪声。结果发现: - 在五个模型家族和三个基准测试(MMLU、HellaSwag、GSM8K)上,单模型内部最多只有一个维度高于噪声水平。 - 而集成方案中,有四个特征值显著高于噪声阈值;相比之下,匹配难度的伯努利零模型在500次蒙特卡洛模拟中最多出现一个。 ### 核心结论 **自一致性(Self-consistency)** 能够提供准确的每个问题的不确定性,但无法检测到跨问题结构;**只有多样化集成才能揭示模型真正不知道什么**。 ### 行业启示 这项研究对当前LLM应用有重要影响: - 许多生产系统依赖温度采样来获取多样性,但论文表明这种多样性是“认知浅薄”的——它只是表面波动,没有反映模型知识的深层结构。 - 相比之下,使用多个不同模型集成虽然计算成本更高,但能提供更丰富的不确定性信号,尤其在需要跨问题一致性评估的场景(如考试、医疗诊断)中更有价值。 论文已被EIML@ICML 2026接收,作者为Izhar Ali。该工作提醒社区:随机采样并非万能,模型多样性才是关键。

Anthropic1个月前原文

随着大语言模型(LLM)在临床工作流中的广泛应用,如何可靠追溯模型生成内容成为关键需求,水印技术因此受到关注。然而,现有水印评估多基于通用基准,忽视了医学领域文本的特殊性——即使是微小的词级扰动也可能导致严重的语义变化。 近日,一篇题为《Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts》的论文(arXiv:2607.20462)首次系统研究了水印对医学文本性能的影响。研究团队对5种水印方案在11个LLM和7个视觉语言模型(VLM)上进行了全面基准测试,涵盖单模态和多模态临床推理任务。更重要的是,他们引入了一个经人类专家验证的流程,用于审计医学推理质量、术语精确性以及水印引发的幻觉。 ## 关键发现:水印带来的“副作用” 研究揭示了水印在医学场景中的多个失败模式: - **词汇损坏**:水印可能改变关键医学术语,导致输出丧失专业性。 - **幻觉术语**:模型可能凭空生成不存在的医学概念,误导诊断。 - **误诊或遗漏影像发现**:在多模态任务中,水印可能放大对影像结果的错误归因或遗漏重要发现。 这些退化在通用基准测试中往往被聚合指标掩盖,因为后者无法捕捉临床文本特有的失败模式。例如,一个在通用任务上表现良好的水印方案,可能在医学文本中导致显著的语义偏差。 ## 为什么通用评估不够? 论文指出,当前水印评估的“通用基准依赖”在医学领域存在根本缺陷。通用任务(如新闻摘要、对话生成)对精确性的容忍度较高,而医学文本要求严格的术语准确性和逻辑一致性。水印的扰动可能不改变整体流畅度,但会扭曲关键诊断信息,这种“隐形退化”正是现有评估体系的盲区。 研究团队强调,领域特定的评估是水印模型安全部署的前提。没有针对医学的专项测试,当前基准可能掩盖临床后果严重的退化。 ## 行业影响与未来方向 这项研究为AI在医疗领域的可信应用敲响警钟。随着LLM辅助诊断、病历生成等场景的普及,水印技术必须在保证可追溯性的同时,不损害输出质量。研究者呼吁,未来水印方案的设计和评估应纳入领域专家审核,并开发针对医学语义的细粒度指标。 该工作由Melanie Rieff、Robin Staab等多位学者共同完成,相关代码和数据已公开,为后续研究提供了重要基础。

Anthropic1个月前原文

## 概览 软件质量保障正从被动执行转向主动智能。最新研究论文提出 **AINTMA(Agentic Intelligent Test Management Architecture)**——一种基于多智能体AI的自主测试管理架构,将传统测试流程重塑为“质量智能生态系统”。该系统由六个专业AI智能体协同工作,覆盖测试发现、风险评估、执行编排到安全通信等全环节,并在18个月、12个异构软件项目的评估中展现出显著效果。 ## 核心组件:六位一体的智能体协作 AINTMA的核心是六个专门化AI智能体,通过安全的云原生微服务基础设施协调运作: - **测试发现智能体**:自动识别待测范围和测试用例 - **风险评估智能体**:基于历史数据和代码变更评估缺陷风险 - **强化学习优先级排序智能体**:将测试选择建模为**马尔可夫决策过程**,利用47维特征和滚动36个月的历史数据学习最优策略 - **执行编排智能体**:动态调度测试执行资源 - **生成式质量智能体**:利用大语言模型生成自然语言的质量报告、缺陷风险摘要和数据增强的测试建议 - **云安全监控智能体**:通过零信任API网关、OAuth2/JWT认证和加密通信保障安全性 ## 关键成果与数据亮点 在12个软件项目上持续18个月的评估中,AINTMA交出了令人瞩目的成绩单: - **测试优先级排序准确率**(APFD)达到 **88.4%**,远超随机排序的51.2%和最佳商业基线的82.1% - **测试周期缩短43%**,缺陷逃逸率从 **8.3% 降至 2.1%** - 投资回报率 **340%**,投资回收期仅 **9个月** - 架构可扩展至 **50,000+** 测试用例,响应时间低于 **400毫秒** - 开发者对生成式质量智能体的实用性评分为 **4.3/5.0** ## 行业意义与趋势 AINTMA的出现标志着软件测试正从“自动化执行”迈向“自主化决策”。传统测试管理依赖人工编写用例、手动排期和事后分析,而多智能体架构实现了: 1. **闭环自适应**:RL智能体根据历史执行结果持续优化测试策略 2. **生成式洞察**:LLM将海量测试数据转化为可理解的业务语言 3. **安全原生**:零信任设计使系统适用于多云和跨组织协作场景 这种“智能体+云原生+生成式AI”的组合,正在定义下一代QA平台的技术栈。对于需要管理大规模测试资产的企业(如金融、电商、SaaS),AINTMA提供了一个可量化ROI的参考路径。 ## 局限性 目前该架构仍处于论文验证阶段,实际落地需考虑与现有CI/CD管道的集成成本,以及多智能体协调带来的复杂性。此外,RL模型的训练依赖高质量历史数据,对于新项目可能面临冷启动问题。 ## 结语 AINTMA证明了:当AI不再是单一工具,而是以“智能体团队”的形式嵌入工程流程时,软件质量管理可以从“成本中心”转变为“价值引擎”。对于技术决策者,值得关注其后续开源计划或商业化产品进展。

Anthropic1个月前原文

金融欺诈检测正面临前所未有的挑战。传统的基于规则或单一机器学习模型的方法,在面对洗钱活动中常见的“化整为零”(smurfing)和“分层交易”(layering)等复杂模式时,往往力不从心。这些问题因极度不平衡的数据(欺诈率低至0.13%)和对手不断进化的对抗性规避策略而雪上加霜。近日,一篇发表在arXiv上的论文提出了名为 **FraudShield AI** 的混合框架,旨在通过融合时间序列与网络结构信息,实现更鲁棒、更具弹性的欺诈检测。 ## 核心思路:从孤立交易到网络级取证 FraudShield AI 的核心创新在于,它不再将每笔交易视为独立事件,而是将其置于一个交易关系网络中进行分析。该框架结合了两大组件: - **长短期记忆网络(LSTM)**:用于捕获交易序列中的时间依赖模式,例如资金流入流出的节奏变化。 - **手工设计的图拓扑特征**:包括 **PageRank 中心性**、**入度动态** 以及自定义的 **Flow Ratio**(流量比)。这些特征能够揭示账户在网络中的角色(例如,是否存在大量分散的小额转入后集中转出),从而将检测视角从单点提升至网络层级。 这种混合设计使得模型既能理解“钱是怎么来的”,又能分析“钱流向了哪里”,以及“谁在中间扮演了关键节点”。 ## 应对不平衡与对抗攻击 针对数据极度不平衡的问题,论文引入了 **Focal Loss** 损失函数,该函数能自动降低易分类样本的权重,迫使模型更关注那些难以识别的欺诈样本。此外,框架还设计了一种 **动态阈值机制**,用于提高对低价值 smurfing 攻击的检测能力——这类攻击通常通过大量小额交易来规避传统阈值规则。 ## 实验表现与消融研究 在公开的 **PaySim** 数据集上,FraudShield AI 与逻辑回归和 XGBoost 等基线模型进行了对比。结果显示,该混合模型在 **精确率(Precision)**、**召回率(Recall)** 和 **F1 分数** 上均显著领先,尤其是在检测难以捕捉的微小交易欺诈模式时表现突出。 通过 **消融研究**,论文进一步验证了时间组件(LSTM)与拓扑组件(图特征)的互补性:单独使用任一部分都会导致性能下降,而两者的结合则产生了协同效应。 ## 行业启示 FraudShield AI 的提出,反映了金融 AI 领域的一个重要趋势:**从单一模态的模型向多模态、多视角的融合模型演进**。在反洗钱场景中,交易的时间序列模式和行为者的网络结构是两种互补的信息源。纯时序模型可能忽略群体性欺诈的关联,而纯图模型又难以捕捉资金流动的节奏变化。FraudShield AI 的混合架构为这一难题提供了一个可行的解决方案。 不过,该研究仍处于学术验证阶段,距离大规模产业落地还有一段距离。例如,PaySim 数据集是模拟生成的,真实世界中的欺诈网络更为复杂和隐蔽。此外,图特征的工程化计算在超大规模交易网络中的实时性也是一个待解决的问题。 尽管如此,FraudShield AI 的思路——**以网络级视角对抗网络级欺诈**——无疑为金融安全领域提供了一把新的利器。

Anthropic1个月前原文

随着AI推理任务处理敏感数据或保护专有模型资产的需求日益增长,机密计算正成为实际部署中的一项关键要求。然而,启用机密执行模式对GPU加速的大语言模型服务带来的性能代价,仍然高度依赖具体工作负载,且在运维层面至关重要。 一篇发表于arXiv的新论文(arXiv:2607.19353)对NVIDIA H100 80GB GPU在Intel TDX机密实例上的推理性能进行了基准测试。研究对比了标准非机密执行与机密计算模式,使用了**Mistral-7B v0.1**和**Qwen3-30B-A3B**两个代表性模型,测量了首Token延迟、端到端请求延迟、单请求Token生成吞吐量、全局Token吞吐量以及闭环请求吞吐量等关键指标。 ### 主要发现 测试结果显示,机密模式会带来一致的性能损失,但整体仍能维持可用吞吐量。具体数据如下: - **首Token延迟(TTFT)**:在固定请求速率实验中,机密模式使Mistral-7B的平均TTFT增加**21.8%**,Qwen3-30B-A3B增加**27.8%**。 - **全局Token吞吐量**:机密模式下,Mistral-7B下降**17.7%**,Qwen3-30B-A3B下降**21.1%**。 - **闭环并发实验**:吞吐量差距保持在**11.5%至20.2%**之间,但更大的模型(Qwen3-30B-A3B)在机密模式下更早达到饱和拐点。 ### 行业背景与解读 机密计算通过硬件级隔离(如Intel TDX、AMD SEV-SNP、NVIDIA CC)保护数据和使用中的模型权重,对于金融、医疗、法律等合规严苛的行业尤为重要。随着大语言模型部署从实验走向生产,**如何在安全与性能之间取得平衡**成为关键决策点。 本研究的价值在于提供了**量化参考**:虽然机密模式会引入约20%左右的吞吐量下降,但并非不可接受。不过,容量规划必须考虑双重影响——稳态吞吐量损失和较大模型更早的饱和行为。这意味着运维团队需要预留额外的计算资源,或在调度策略上做出调整。 ### 小结 对于计划采用机密GPU推理的团队,建议: 1. **进行实测**:不同模型和框架的表现可能差异显著。 2. **关注饱和点**:大模型在机密模式下并发能力下降更快,需重新评估最大并发数。 3. **成本权衡**:机密实例通常更昂贵,需将性能折扣纳入总拥有成本计算。 该研究为机密AI推理的性能建模提供了宝贵数据,也提示业界:安全与性能的取舍并非零和博弈,而是需要精细化的工程调优。

Anthropic1个月前原文

## 研究背景与挑战 基于大语言模型的多智能体系统(LLM-MAS)正被部署于安全关键型应用中,但智能体间的通信链路也为攻击者提供了可乘之机。攻击者通过注入恶意指令,使恶意行为在智能体网络中扩散。与传统静态威胁不同,LLM-MAS 面临的是**双重动态攻击**:一方面,攻击者会根据部署的防御策略不断调整注入手法;另一方面,正常智能体的行为模式也会随着系统扩展而发生漂移。 现有防御方法大多将部署视为封闭世界问题,一旦数据分布偏离训练覆盖范围,防御性能便会迅速下降。这促使研究者探索能同时应对攻击策略演变与正常行为漂移的持续防御方案。 ## OpenEvoShield 框架核心 针对上述挑战,研究团队提出了 **OpenEvoShield**,一个面向 LLM-MAS 的**协同进化持续防御框架**。其核心组件包括: 1. **非对称速率控制器(M1)**:从双重漂移信号中解耦出攻击侧快速学习速率和正常侧慢速学习速率,实现差异化的更新节奏。 2. **正常边界更新器(M2)**:以慢速速率维护一个动态的行为边界,用于区分正常与异常交互。 3. **EWC 正则化策略集成(M3)**:采用弹性权重巩固(EWC)技术,使策略集成能够快速适应新攻击而不发生灾难性遗忘。 4. **基于能量的多粒度检测器(M4)**:融合节点级、子图级和图级证据,将新型攻击分类为分布外样本。 ## 实验验证与性能 研究者在**5个基准测试**和**4种多智能体拓扑结构**上进行了100轮部署实验。结果显示,OpenEvoShield 显著优于静态和持续基线方法,能够检测出绝大多数未见过的攻击类型,同时保持较低的误报率。 ## 行业意义 该工作首次将**非平稳环境下的持续学习**引入 LLM-MAS 安全领域,为应对真实世界中攻击策略与系统行为双重演变提供了理论框架和实用方案。随着多智能体系统在金融、自动驾驶、医疗等领域的深入应用,类似 OpenEvoShield 的持续防御机制将成为保障系统安全的关键技术。

Anthropic1个月前原文

## 突破数据瓶颈:自对弈框架 FormulaSPIN 让 AI 自学写公式 电子表格软件全球用户数以亿计,但编写公式始终是普通用户的一大障碍。现有方法依赖静态监督数据,在有限标注上很快达到性能天花板。近期一篇被 **ACL 2026** 主会接收为 Oral 的论文提出了 **FormulaSPIN**,一种基于自对弈(self-play)的微调框架,无需额外数据即可实现迭代式自我改进,在 NL2FORMULA 基准上达到 **74.9% 精确匹配** 和 **87.1% 执行准确率**,超越了传统监督微调(SFT)和前沿闭源模型。 ### 为何标准自对弈会失败? 自对弈微调(SPIN)在语言模型领域已展现潜力,但直接应用于公式生成时却遭遇困境:它会对所有不匹配的输出统一惩罚,导致执行等价但形式不同的公式被错误地当作负样本,产生矛盾梯度。例如,`=SUM(A1:A10)` 和 `=A1+A2+...+A10` 在功能上等价,但 SPIN 会将后者判为错误,造成训练信号混乱。 ### FormulaSPIN 的解决方案:利用可执行性作为隐式监督 FormulaSPIN 的核心洞察在于:公式生成任务天然具备 **二进制可执行性**——公式是否正确可以通过执行结果直接验证。这一特性可以将语义错误与有效的风格变体分离开来。 框架将训练过程建模为一个 **双人博弈**: - **主玩家**(当前模型)学习偏好真实标注公式而非旧版本生成的公式; - **执行反馈** 将输出按粒度排序,构建自适应课程(curriculum),先纠正语义错误,再优化风格。 此外,论文引入 **ExecVote** 机制:在语义层面进行投票,自然处理多个有效表述。例如,对于计算总和的请求,`SUM` 和 `+` 运算符的不同写法都能被认可,从而提升模型对多样性的包容度。 ### 实验结果:SOTA 且无需偏好标注 在多个基准测试上,FormulaSPIN 均取得最优结果: - **NL2FORMULA** 数据集:精确匹配 74.9%,执行准确率 87.1%; - 与使用额外偏好标注(如人类反馈)训练的模型性能相当; - 显著优于传统 SFT 方法以及 GPT-4 等闭源模型。 ### 行业意义与未来展望 这项工作展示了自对弈在数据稀缺任务上的巨大潜力。传统上,训练高质量公式生成模型需要大量人工标注的(自然语言,公式)对,成本高昂且难以覆盖长尾场景。FormulaSPIN 通过利用执行结果作为天然监督信号,大幅降低了对人工标注的依赖。 论文作者指出,该框架不仅限于电子表格领域,未来可推广到其他可执行领域(如代码生成、数据库查询等)。随着 AI 办公助手竞争日趋激烈,这种能自我进化的模型可能成为下一波生产力工具的核心引擎。

Anthropic1个月前原文