随着人工智能体(AI Agent)在动态环境中自主交互、追求目标并不断适应,传统以最终性能为唯一标尺的评估方式已不足以揭示其内在行为机制。近期,一篇被ICML 2026 Position Track接收的论文《Position: Behavioral Systems Require Behavioral Tests》提出,AI系统应被视为行为系统,其评估应借鉴行为科学的方法,通过系统性观察、扰动和解释行为过程来深入理解智能体。 论文作者Manuel Cherep、Nikhil Singh和Pattie Maes指出,当前评估主要关注任务完成度、准确率等结果指标,却忽视了产生这些结果的行为过程。例如,两个智能体可能达到相同得分,但一个通过合理规划,另一个则依赖随机试探。这种“只看结果不看过程”的做法,不仅掩盖了系统缺陷,也限制了AI的可解释性和可控性。 为此,论文提出了一套行为测试的研究议程,包括:从动作序列中重建决策策略、构建能够分离行为差异的测试环境,以及探索多智能体系统中的涌现动态。这些方法旨在将AI评估从“性能导向”转向“行为导向”,从而建立一门“AI行为科学”。 这一观点与心理学和动物行为学中的经典范式不谋而合。行为科学通过受控实验、干预和观察来推断内部机制,而AI系统同样需要这样的“行为实验”来验证其认知过程。论文强调,随着AI在自动驾驶、医疗诊断等高风险领域的应用,仅靠结果评估已无法满足安全性和可靠性的要求,必须深入理解其行为逻辑。 尽管该论文尚处于立场声明阶段,未提供具体实验数据,但其提出的框架为AI评估领域开辟了新方向。未来,我们或许能看到更多基于行为测试的评估标准,这将对AI研发和监管产生深远影响。对于AI从业者而言,这提醒我们:评估AI,不仅要看它“做了什么”,更要看它“如何做”。
随着开源权重基础模型(OWFM)的迅速普及,AI 社区不得不重新审视现有的治理框架。最近一篇被 ICML 2026 接收的立场论文指出,当前广泛使用的模型卡片(Model Cards)在告知下游开发者与用户安全风险方面存在显著不足,并提出一种结合模型卡片、可接受使用政策(AUP)和许可证的多层次治理方案。 ## 模型卡片的局限 研究者分析了 Hugging Face 上 500 个模型卡片,发现现有模板往往缺乏对 OWFM 特有安全挑战的充分描述。例如,模型卡片通常不会明确说明模型的“血统”(即训练数据来源与继承关系)、对齐过程的可追溯性,以及实际运行中观察到的行为偏差。这些信息对于下游开发者评估模型风险至关重要,但现有框架常常遗漏,导致下游用户难以做出知情决策。 ## 现有治理的“安全缺口” 论文指出,当前治理机制存在一个“安全缺口”:模型卡片提供的信息过于静态,无法反映模型在真实场景中的动态表现;AUP 虽然设定了使用边界,但往往缺乏可执行性;而标准开源许可证(OSL)并不适合 OWFM,甚至可能削弱 AUP 的法律效力。这种断裂使得治理措施难以形成闭环,尤其在模型被二次分发和微调后,原始的安全保障很容易失效。 ## 迈向整合的安全工件 作者主张,有效的 OWFM 治理需要将模型卡片、AUP 和许可证视为一个整体,而非孤立的文档。具体而言,模型卡片应增加关于模型血统、对齐来源和实证行为的信息;AUP 应设计得更具操作性,并与许可证条款协调一致;许可证则需要针对 OWFM 的特性进行调整,确保在开放权重的同时保留必要的使用限制。这一框架旨在将信息、规范和法律的维度整合起来,形成更强的治理合力。 ## 对 AI 社区的意义 这项研究为 AI 治理提供了新的思考方向。随着开源模型成为行业主流,单纯依赖模型卡片已不足以应对日益复杂的风险。将模型卡片升级为动态的、多层次的安全工件,可能是平衡开放与安全的关键一步。不过,论文也承认,这一框架仍处于概念阶段,具体实施还需社区共同努力。
无人机螺旋桨故障若仅表现为单一诊断信号,其影响往往分散在多个飞行日志通道中,给安全与可靠性带来隐患。针对这一问题,arXiv 最新论文提出了一种基于飞行日志的**变形人工年龄评分(AAS)决策支持原型**,用于无人机螺旋桨健康监测。该研究由 Seyma Yaman Kayadibi 完成,论文编号 arXiv:2608.18088,于 2026 年 6 月 5 日提交。 研究团队利用 **2024 DronePropA 公共数据集**中的历史真实飞行日志,从原始 MATLAB 矩阵中提取了六项健康相关指标:**轨迹跟踪误差、姿态不稳定性、推力指令负担、电机指令不平衡、ESC 指令不稳定性和电池压力**。这些指标相对于健康基线进行归一化,并通过候选评分策略、变形充分性关系和冗余调整的 AAS 公式进行评估。值得注意的是,此处的 AAS 并非时间意义上的年龄,而是作为结构策略充分性和负担度量。 在受控回顾性评估中,研究者使用了一个健康基线和三个缺陷螺旋桨案例,所有案例均采用相同的速度剖面和轨迹。健康案例被分配至常规监测;**严重度 1** 的案例主要表现出 ESC 指令不稳定性,被分配至维护审查;**严重度 2** 的案例在电机指令和 ESC 指令负担上达到最大值,**严重度 3** 的案例则在轨迹跟踪误差上达到最大值,两者均触发强制检查。结果显示,螺旋桨故障效应可能通过不同运行通道显现,这支持了在飞行后维护优先级划分和自主系统监督中引入**多指标决策支持层**的必要性。 该研究为无人机维护提供了一种新的决策支持思路,通过融合飞行日志特征提取、变形充分性测试和冗余调整的 AAS 公式,实现了对螺旋桨健康状况的量化评估。尽管目前仍处于原型阶段,但为未来基于数据驱动的无人机健康管理提供了有价值的参考。
大型语言模型(LLM)驱动的多智能体系统(MAS)被誉为能够实现可扩展的协作,但实际应用中,增加智能体往往反而降低系统的可靠性。一篇新近发表的立场论文(arXiv:2608.18092)提出,许多MAS故障本质上源于并发控制问题:智能体并发读写共享状态,而LLM推理窗口较长,加剧了过期读取、丢失更新和不一致结果的风险。该论文主张,MAS框架应通过显式的并发控制机制(如冲突检测、隔离保证和共享资源的受控访问)来解决这些故障,并将并发控制作为一等设计考量,而非事后补救。 该论文由Xin Yang等五位作者撰写,共16页,包含1张图,于2026年6月6日提交至arXiv。论文指出,通常被归因于协调或通信故障的失效模式,可以直接映射到经典的并发异常上。例如,智能体A读取了智能体B即将更新的数据,导致A基于过期信息做出决策,这类似于数据库中的脏读;多个智能体同时写入同一变量,后写覆盖先写,造成丢失更新;不同智能体基于不同时间点的快照进行推理,最终结果相互矛盾,类似不可重复读或幻读。 论文认为,当前MAS框架往往忽视并发控制,而将其视为分布式系统的附属问题。然而,在LLM推理延迟较高的情况下,并发问题被放大,导致系统行为不可预测。因此,研究者呼吁将并发控制提升为MAS设计的核心原则,建议开发相应的机制来保证系统的稳定性和一致性。这一观点为MAS领域提供了新的思考角度,或将对未来框架设计产生重要影响。
投资管理是一个高风险领域,代理型AI系统不仅要生成合理的文本,还必须检索时点数据、组装正确的计算输入、调用专业方法,并生成可审计的结构化输出。为此,研究者推出了**FinSkillBench**——一个专门评估语言模型代理在投资管理任务中有效运用金融领域技能的基准测试套件。 ## 基准构成与评估方法 FinSkillBench覆盖**三个领域**:投资组合构建、风险管理和基本面分析,包含**12个子任务**和**2,603个任务片段**。每个片段提供时点输入、隐藏的真实结果和特定任务的目标。 研究团队对比了**三种条件**:无技能、精选技能包(包含程序化文档和可执行组件)以及自我生成技能(代理在片段内编写并复用自身程序)。 ## 关键发现:精选技能显著提升表现 在**9个模型**的大规模评估中,精选技能持续改善性能,平均得分从**0.366**提升至**0.528**,尤其在投资组合构建和风险管理领域效果最为显著。相比之下,自我生成技能尽管计算成本更高,却几乎未带来额外收益。 ## 独立验证与结论 独立测试使用**Hermes Agent**框架,涵盖**8个模型**和**5,280个片段**,在三个领域均复现了相同趋势,但技能效果的大小因子任务和工具而异。 这些结果表明,在投资管理代理中,**获取可靠的程序化技能可能与模型选择同等重要**,而天真的自我生成技能往往无效。研究者已公开基准、评估工具、精选技能包和完整轨迹,以支持进一步研究。
随着机器学习模型规模的不断扩大,模型参数、梯度和KV缓存等数据的存储与传输已成为系统性能的关键瓶颈。量化技术通过降低数据精度来缓解这一问题,但传统方法往往在精度和压缩率之间难以两全。近日,来自哈佛大学、VMware Research等机构的研究者提出了一种名为**熵约束自适应随机量化(ECASQ)**的新方法,在保持无偏性的同时,显著提升了量化压缩的效率。相关论文已提交至arXiv(编号:2608.18147)。 ### 从ASQ到ECASQ:为何需要熵约束? 自适应随机量化(ASQ)是一种先进的量化方法,它针对给定输入优化均方误差(MSE),同时保证无偏性,适用于模型、梯度、KV缓存压缩以及最近邻搜索等场景。然而,ASQ在选取量化值时并未考虑后续的无损熵编码阶段,导致压缩率仍有提升空间。ECASQ正是为了解决这一缺陷而设计:它在熵预算和无偏性约束下,联合选择自适应量化值,以最小化MSE,从而在压缩率和精度之间找到更优的平衡点。 ### 算法创新:动态规划与近似求解 研究团队将ECASQ问题形式化,并提出了两种求解算法: - **最优动态规划算法**:时间复杂度为O(sd²),空间复杂度为O(d²),适用于长度为d的向量,最多支持s个量化值。 - **GPU友好的近似动态规划算法**:时间复杂度同样为O(sd²),但空间复杂度降至O(d),更适合大规模并行计算。 近似算法有个重要保证:其解对应的MSE不会超过使用每条目少一位熵的最优解。此外,研究者还提供了一种迭代细化过程,在实验中能够获得接近最优的结果,同时保持显著的速度优势。 ### 实验与前景 在实验中,ECASQ在多种数据压缩任务中均表现出色,尤其在高压缩率场景下,其精度损失远小于传统方法。这一进展对于分布式训练、边缘推理以及大模型部署等场景具有重要意义。未来,ECASQ有望成为AI基础设施中的标准工具,帮助开发者在不牺牲模型质量的前提下,大幅降低存储和带宽成本。 值得注意的是,该论文目前仅为预印本,尚未经过同行评审,但其提出的思路和算法已引发学界关注。随着后续研究的深入,ECASQ或将在实际系统中得到广泛应用。
**企业AI智能体在持续学习时,遗忘通常被视为一种失败。** 然而,一篇最新研究论文提出了不同观点:在客户、政策、工具、工作流、法规和市场条件不断变化的非平稳环境中,一味地保留旧知识可能适得其反,导致过时信息影响决策,造成负迁移和运营风险。为此,研究者提出“可逆遗忘”框架,为AI智能体提供更精细的知识管理方案。 ## 从“不可遗忘”到“可逆遗忘” 传统持续学习强调保留所有已学知识,以应对环境变化。但该论文指出,这种目标对企业AI智能体并不完整。例如,金融领域,某种市场制度下的有效知识,在另一种制度下可能有害,而当相似条件重现时又可能重新有用。因此,简单的永久删除或无限保留都非最优解。 ## 三种记忆状态与迟滞控制器 论文提出的“可逆遗忘”框架包含三种操作状态:**活跃(active)**、**休眠(dormant)**和**退休(retired)**。活跃知识用于当前决策;休眠知识暂时不参与,但可被重新激活;退休知识则被永久移除。框架的核心是一个**迟滞可逆记忆控制器(Hysteretic Reversible Memory Controller)**,它通过累积相关性证据,利用不对称阈值防止状态振荡,在影子模式下测试重新激活,并通过策略控制退休过程。 这种设计旨在减少过时信息的影响,同时不将暂时性抑制与永久性擦除混为一谈。 ## 现实意义与挑战 该框架为企业AI智能体提供了一种更安全的知识管理方式。例如,在法规更新或市场突变时,AI可以暂时休眠旧规则,待新规则稳定后再决定是否恢复。然而,论文目前仅提出概念框架,尚未给出具体实现细节或实验验证。如何准确评估知识相关性、如何设置阈值,仍有待探索。 尽管如此,这一思路为持续学习领域提供了新视角:**遗忘并非缺陷,而是智能系统适应变化的重要能力**。未来,企业AI或能更灵活地管理知识生命周期,平衡稳定与适应。
视觉自回归模型的训练常依赖在线策略蒸馏(OPD),即让学生模型从自身生成的轨迹中学习,以提升其性能。然而,传统的自回归解码逐token生成,导致每次在线训练步骤的开销巨大。最新研究提出了一种名为HB-SJD的批量推测雅可比解码后端,旨在显著加速这一过程,同时保持生成质量。 ## 背景:在线策略蒸馏的瓶颈 在线策略蒸馏通过让学生模型在训练过程中不断生成新数据,再基于这些数据优化自身,实现更高效的模型压缩。但问题在于,学生模型的每次前向传播只能生成一个token,这种序列化的解码方式使得整个训练过程耗时严重。尽管已有推测解码等方法尝试并行生成,但它们通常依赖于额外的草稿模型,增加了系统的复杂性。 ## HB-SJD:无需辅助模型的并行解码 HB-SJD基于推测雅可比解码(SJD),它利用雅可比迭代的原理,允许在不借助辅助模型的情况下并行处理多个token。HB-SJD将其扩展至批量场景,支持多个图像样本同时解码,每个图像根据其自身的生成进度独立推进,同时在不同序列位置进行批量验证。当某个图像完成生成后,HB-SJD会自动切换至更紧凑的执行模式,以降低后续迭代的计算成本。 ## 实验验证与优势 在LlamaGen模型上的实验表明,HB-SJD显著减少了回放生成和端到端训练的时间,同时保持了蒸馏后学生模型的生成质量。该方法仅替换了学生模型的回放后端,不改变教师模型、蒸馏目标或优化过程,因此可以轻松集成到现有的OPD流程中。 ## 意义与展望 HB-SJD为视觉自回归模型的高效训练提供了新思路,尤其适用于对实时性要求较高的应用场景。未来,该技术有望进一步扩展到其他模态或更复杂的模型结构,推动AI模型压缩与部署的实用化进程。
在细粒度图像识别任务中,类别标签往往具有层级结构。例如,识别一种鸟类时,模型可能对“鹰”这一粗粒度概念很有把握,但在区分金雕、白头鹰等具体物种时却犹豫不决。这种结构化的不确定性,要求模型不仅能表达对细粒度类别的置信度,还需刻画对中间层级概念的认知状态。然而,现有方法各有短板:平面证据分类器只能在叶子类别上用一个“空值”表示整体无知,而层次分类器虽能传递点概率,却缺乏对证据量的刻画。 针对这一痛点,复旦大学的研究团队提出了一种名为 **H²EDL(Hyper Evidential Deep Learning for Hierarchical Classification)** 的新框架。其核心洞察在于:**类别树本身就是一个天然的“超域”**。树中的每个子树和叶子节点构成一个线性大小的焦点族,而每个分支节点上的一个局部狄利克雷意见,就能以闭式解推导出所有复合类别的质量分布。 H²EDL 的巧妙之处在于,它用同一组参数提供了两种互补的视角。从预测角度看,它是一个保持跨层级一致性的层次分类器;从概率角度看,它定义了一个有效的树结构超意见——每个节点上的质量代表“信念到达该节点,但不足以进一步细分为子类”的程度。这种设计让模型既能表达“知道是鹰,但不清楚具体种类”的中间状态,又避免了传统超证据网络需要人工标注复合标签或依赖非结构化权重模式的局限。 在 **FGVC-Aircraft** 和 **DERM12345** 两个数据集上的实验表明,与交叉熵基线相比,H²EDL 将校准误差降低了约一半,且层级越深、训练预算越大,改进越明显。这意味着模型不仅能做出准确预测,其置信度也更可靠,对于医疗影像诊断、自动驾驶等高风险场景尤为重要。 H²EDL 的提出,为层级分类中的不确定性建模提供了一个优雅而高效的解决方案。它首次将超证据学习与树结构结合,无需额外标注即可捕获结构化的认知不确定性,有望推动细粒度识别系统在实际应用中更安全、更可信。
近年来,机器学习在医学领域的应用日益广泛,并取得了一定成功。然而,围绕机器学习的诸多不确定性,使其认识论和方法论基础难以确立。学术界常将医学与机器学习进行类比,主张以后者的标准来规范前者的认识论和方法论。但这一类比往往流于表面,缺乏深入剖析。 来自意大利和英国的研究者Emanuele Ratti与Lena Zuchowski在发表于《Studies in History and Philosophy of Science》的论文中,借助哲学家Mary Hesse的工具,将这一类比刻画为**临床转化过程与机器学习系统构建过程之间的生成性类比**。他们不仅明确了临床转化中通常被隐含提及的认识论和方法论依据,还展示了这些依据如何类推到机器学习语境中。 研究者将临床转化中的依据解释为**可靠主义**(reliabilist)意义上的,并由此提出一种新的机器学习可靠主义(ML reliabilism)。这种新观点与现有的AI哲学中的可靠主义既有区别又相互兼容。 这一研究的意义在于,它并非简单地套用医学标准,而是通过严谨的哲学分析,为机器学习系统的可靠性提供了新的理论支撑。在AI信任危机频发的当下,这一视角有助于我们重新思考如何构建值得信赖的AI系统,也为AI方法论的研究开辟了新的方向。
自闭症谱系障碍(ASD)是一种以社交互动和沟通障碍为特征的发育性疾病,其病因目前尚不明确。近年来,机器学习(ML)技术在自闭症早期诊断和治疗中展现出巨大潜力。一篇发表于arXiv的综述文章系统评估了2017至2023年间55项相关研究,揭示了该领域的技术趋势、关键挑战与未来方向。 ## 技术趋势:监督学习主导,深度学习崛起 综述指出,**监督学习方法**在自闭症诊断中占据主导地位,这与ASD诊断需求高度契合——诊断通常需要明确的标签(如患病与否)。然而,随着数据可用性的增加,**深度学习**的应用正在迅速扩展。未来,结合无监督学习、深度学习和模糊逻辑的**混合方法**可能成为研究热点,有望处理更复杂的数据模式。 ## 关键挑战:数据整合与多模态融合 当前模型面临的核心挑战在于**整合复杂数据**,如遗传信息和临床数据,以提升诊断准确性和治疗效果。传统单一数据源(如行为问卷)难以全面捕捉ASD的复杂性。为此,综述强调,引入**可穿戴设备和生物传感器**等创新数据源,能够实现连续、非侵入式的监测,为理解ASD提供更全面的视角。 ## 未来方向:跨学科合作与多模态数据 综述认为,解决现有挑战需要**跨学科合作**,包括计算机科学、医学、心理学等领域专家的共同努力。同时,扩大针对ASD的**专用数据集**至关重要,这将使未来的ML模型能够整合更广泛的多模态数据,从而更全面地应对ASD的复杂性。 ## 小结 机器学习在自闭症诊疗中的应用正处于快速发展阶段,尽管面临数据整合等挑战,但技术创新与跨学科协作有望带来突破。对于研究者而言,关注混合方法、多模态数据融合以及新型数据采集技术,将是推动该领域前进的关键。
在科学发现中,模拟数据与实验数据之间的鸿沟一直是机器学习应用的难题。领域自适应(Domain Adaptation)技术为此而生,其核心假设是:模拟与实验两个域仅在“干扰”(nuisance)上存在差异,而目标量的分布保持一致。然而,在物理学中,这一假设往往不成立:模拟可能对物理本身存在错误描述,而目标量(如能谱、红移分布)的分布恰恰是实验要测量的对象。 最近,来自俄罗斯科学院核研究所与莫斯科物理技术学院的 Ivan Kharuk 在 arXiv 上提交了一篇题为《Safe Domain Adaptation for Physics: Overcoming Nuisances, Label Shifts, and Simulation Priors》的论文,系统性地探讨了这些失配带来的后果,并提出了一种新的自适应方法。 研究团队以一个玩具空气簇射基准(toy air-shower benchmark)为实验平台,该基准可以独立或组合地开启三种失配:探测器响应干扰、物理模拟偏移、以及能谱偏移。他们发现,标准的对抗性域自适应(adversarial adaptation)能够有效处理条件偏移,但当两个域的能谱分布不同时,标准方法会将它们“对齐”,从而将原本不可控的偏差替换为锚定在模拟先验上的偏差。换句话说,模型会错误地将模拟的能谱分布强加给实验数据,掩盖真实的物理差异。 为解决这一问题,作者提出了“自适应域自适应”(adaptive domain adaptation)方法。该方法通过重新加权模拟事件,使域自适应仅聚焦于真正的物理失配,而避免将模拟先验的错误信息传递到目标域。此外,由于预测的能谱依赖于模型训练配置,论文还提供了一种无标签的模型选择规则,帮助用户在不依赖真实标签的情况下,选择接近最优操作点的配置。 这一工作对高能物理、天体物理等领域具有重要意义。在这些领域,模拟是理解探测器响应和物理过程的关键工具,但模拟与真实数据之间的差异常常被低估。该研究不仅揭示了标准域自适应方法在物理场景中的局限性,还提供了一种更为安全、可靠的替代方案。未来,这一方法有望应用于更复杂的物理实验数据分析,如宇宙射线观测、暗物质搜索等,帮助研究者更准确地从数据中提取物理规律。
蝙蝠作为生态系统健康的关键指示物种,在欧洲受到广泛保护,因此可靠的数量监测是保护工作的优先事项。然而,蝙蝠隐秘的夜行性生活使得被动声学监测成为必要,但自动识别面临挑战:回声定位叫声因行为和环境而异,且物种间存在重叠。为此,研究人员提出了一个深度学习框架 ChiroEcho,该框架联合预测物种和属,并在推理时将属的预测与地理物种分布相结合。当预测的属在某一区域只有一种物种时,该框架能够解析出训练分类中未出现的物种,从而将地理信息视为扩展分类器有效分类的手段,而非限制。研究使用了涵盖 35 种欧洲蝙蝠的录音,评估了封闭集分类,检验了稀疏物种性能估计的不稳定性,并进行了受控的留出验证实验。稀有物种分析显示,有限的评估数据可能掩盖物种级性能;而留出实验表明,属的预测和位置信息可以恢复物种头无法获得的标签。地理分辨将操作覆盖范围从 35 种扩展到 48 种欧洲本土蝙蝠中的 41 种,覆盖率从 73% 提升至 85%。据作者所知,这是报道的欧洲蝙蝠自动分类中最广泛的操作覆盖。更广泛地说,该框架为通过结合粗粒度预测和透明外部约束来解析未见过的细粒度类别提供了原理验证。
在固定截止日期和设计资源被占用的双重压力下,Stampli 借助 Codex 和 ChatGPT Work 将原本数周的发布准备工作压缩至数天,实现了从创意到市场的加速转化。 ## 挑战:时间紧、资源缺 Stampli 是一家智能采购到付款平台,其新产品 Deep Finance™ 旨在将平台数据转化为面向 CFO 等高管的花费智能洞察。然而,新产品的发布涉及产品开发、定位、设计、沟通、赋能和运营等多线并行,且设计资源和外部承包商早已被其他项目占用。面对固定的发布期限,团队急需一种能打破资源瓶颈、加速生产流程的解决方案。 ## 解法:Codex 与 ChatGPT Work 的组合拳 Stampli 的市场营销团队利用 Codex 将产品上下文、会议记录、决策信息和消息指南整合到一个共享系统中。通过 OpenAI 工具,他们将原本预计 **243 小时** 的生产工作压缩至约 **77 小时**,同时确保所有面向客户的内容都经过完整的人工审核和最终批准。 这一发布案例并非偶然,而是 Stampli 产品营销团队日常工作的缩影:他们每天结合 ChatGPT Work 和 Codex,保持产品知识的时效性,挖掘业务洞察,并加速将创意推向市场。 ## 成果:六周从原型到发布 Deep Finance 从初始原型演示到公开上市发布,仅用了约 **六周** 时间。期间,团队用 Codex 将不断演进的产品决策转化为可评审的资产,包括七篇系列博客、发布邮件、网络研讨会及其配套幻灯片、社交和付费创意、PR Newswire 新闻稿、Deep Finance 网页以及销售赋能材料。 Codex 还参与了发布主视觉动画的创作,通过探索、迭代和封装,完成了约 **90%** 的动画打磨工作,之后再由承包商接手。 ## 行业启示:AI 赋能下的敏捷营销 Stampli 的案例展示了 AI 工具在市场营销和产品发布中的巨大潜力。当传统资源受限时,AI 不仅能压缩时间成本,还能提升团队的技术能力边界,使非技术团队也能快速响应客户需求。正如 Stampli CEO Eyal Feldman 所言:“Codex 缩短了客户需求、团队响应和真实使用反馈之间的距离。通过将技术能力扩展到每个团队,它帮助我们以 10 倍速从需求到可部署解决方案。” 这种模式正在改变企业产品发布的游戏规则,尤其对于资源有限的中型企业,AI 工具或许将成为其保持竞争力的关键杠杆。未来,随着 AI 工具的进一步普及,我们有望看到更多企业采用类似策略,将创意快速转化为市场成果。
近日,Anthropic 的编程工具 Claude Code 在 GitHub 上收到一项功能请求,希望其支持 AGENTS.md 文件。该提案获得了社区广泛关注,在 Hacker News 上引发热议,获得 342 分和 212 条评论。 ## 背景:AGENTS.md 的崛起 AGENTS.md 是一个统一的 Markdown 文件,旨在帮助编码代理(coding agents)理解代码库。目前,Codex、Amp、Cursor 等工具已开始采用这一标准(参见 agents.md)。相比之下,Claude Code 目前依赖的 CLAUDE.md 文件被认为过于特定于 Claude Code,不利于与其他开发者协作,尤其是那些不使用 Claude Code 的开发者。 ## 社区声音:协作与标准化 在 GitHub 问题 #6235 中,用户 DylanLIiii 提出了这一请求,并获得了不少支持。评论者普遍认为,支持 AGENTS.md 将提升 Claude Code 与其他 AI 编程工具之间的互操作性,促进团队协作。一位开发者评论道:“当我们切换工具时,不希望重写配置文件。”另一位则指出:“标准化是趋势,AGENTS.md 正在成为事实标准。” ## 行业分析:AI 编程工具的标准化竞赛 这一事件折射出 AI 编程工具领域的一个关键趋势:标准化。随着越来越多的 AI 编码助手涌现,开发者希望在不同工具间无缝切换,而配置文件的一致性是其中的重要环节。AGENTS.md 的兴起,类似于早期代码编辑器中 `.editorconfig` 的标准化,但针对的是 AI 代理。 对于 Anthropic 而言,支持 AGENTS.md 不仅是满足用户需求,更是在战略上顺应生态发展。如果 Claude Code 固守 CLAUDE.md,可能在协作场景中处于劣势,尤其是在团队采用多工具混合工作流的情况下。 ## 未来展望 目前,该问题仍处于开放状态,Anthropic 尚未回应。但鉴于社区呼声高涨,我们有理由期待 Claude Code 将在未来版本中考虑支持 AGENTS.md,或至少提供某种兼容机制。 对于开发者而言,无论工具如何演进,拥抱开放标准总是明智之举。AGENTS.md 或许就是下一个你需要在项目中加入的文件。
**快讯**:陷入破产困境的美国廉航Spirit Airlines(精神航空)被曝正计划将员工数据出售给科技巨头谷歌,此举在内部引发轩然大波,空乘人员纷纷表达愤怒与担忧。 据Ars Technica报道,Spirit Airlines在破产重组过程中,拟将包含员工个人信息的数据资产打包出售给谷歌。这一交易被工会和员工视为“出卖”行为,尤其是在公司已经面临大规模裁员和削减福利的背景下,更显得雪上加霜。 **数据交易细节**:虽然具体交易金额和数据类型尚未完全披露,但据知情人士透露,此次出售的数据可能包括员工姓名、联系方式、职位、薪资记录甚至部分健康信息。这些数据对于谷歌而言,可能用于改进其人力资源算法或拓展企业服务,但对于员工而言,则意味着个人隐私的失控。 **员工反应**:空乘人员协会(AFA)代表Spirit航空的空乘人员表示,他们对公司未征求员工同意便将敏感数据出售给第三方感到“极度失望”。一位不愿具名的空乘人员指出:“我们已经在破产中失去了太多,现在连我们的个人信息都要被当成资产变卖,这让人无法接受。” **行业背景**:这一事件折射出破产企业在资产处置中的灰色地带。按照美国破产法,企业可以将包括数据在内的无形资产纳入清算范围,但通常需要遵守隐私保护法规。然而,员工数据是否属于可随意转让的“资产”,在法律和伦理上仍有争议。 **后续影响**:目前,工会正在寻求法律途径阻止这一交易,并呼吁监管机构介入调查。同时,此事也引发了更广泛的讨论:在数据为王的时代,个人信息的保护边界在哪里?企业破产时,员工权益又该如何保障? **小结**:Spirit航空的数据出售案,不仅是企业破产重组中的一桩插曲,更是数据伦理与劳工权益碰撞的典型案例。随着事件的发酵,预计将引发更多关于数据主权和公司责任的反思。
上周,我探访了位于马萨诸塞州剑桥市的初创公司 **Generalist AI**,亲眼目睹了机器人手臂如何凭借极短的教学视频,即兴完成各种任务。最令我震惊的是,当工具被替换时,机器人竟能随机应变——比如用香蕉代替刷子清扫物品,或用左手替代右手调整角度。这种能力,正如其CEO Pete Florence所说,让人联想到GPT-3时代的惊喜:无需专门训练,即可通过提示完成新任务。 ## 机器人即学即用:从视频到物理直觉 Generalist AI 的机器人核心在于理解物理世界,而非简单模仿动作。它们通过观看视频,学习物体间的相互作用,并具备将知识迁移到新场景的能力。例如,机器人能学会拉开钱包拉链取钱,即使面对不同款式的钱包也能应对自如。这种物理智能的涌现,让研究人员不禁将其与婴儿的学习方式类比——人类幼儿通过不断试错,快速建立对世界的认知,而机器人的即兴表现,正是这种能力的雏形。 ## 从GPT-3到物理智能:AI的下一个前沿 Florence将机器人的表现比作GPT-3带来的范式转变:大语言模型通过提示即可执行新任务,而Generalist AI试图将这种灵活性引入物理世界。这不仅是技术突破,更可能开启机器人应用的新时代——从工厂到家庭,机器人无需繁琐编程,即可适应多变环境。尽管当前演示尚显初级,但其潜力不容小觑。 ## 未来展望:物理智能的无限可能 此次探访让我看到,AI的进步不再局限于数字世界,物理智能正成为新战场。Generalist AI的路径或许预示着,未来的机器人将像人类一样,从经验中学习,在不确定性中创造解决方案。尽管挑战犹存,但这份即兴能力,正是通往通用人工智能的关键一步。
尽管技术进步,AI在现实世界中的声誉却日益恶化。近期多项调查显示,美国民众对AI的担忧情绪上升,超过半数表示对AI在日常生活中的应用感到担忧多于兴奋。科技公司为平息公众对数据中心建设的反对,不得不提供就业保障、清洁水投资等优惠条件。消费者并未看到AI改善生活,却要承担其成本,这种负面情绪正成为行业面临的商业问题。
OpenAI 于 2026 年 8 月 19 日宣布,将继续为符合条件的 API 客户提供 **零数据保留(Zero Data Retention,ZDR)** 承诺,并预览全新的 **私有安全处理(Private Safety Processing)** 技术,旨在应对跨交互的安全风险,同时不损害客户的数据隐私。 ## 零数据保留:不变的核心承诺 ZDR 是 OpenAI 对 API 客户的一项明确承诺:在处理请求后,OpenAI 不会保留客户的提示词和模型响应。客户内容对 OpenAI 人员不可见,且企业客户数据默认不用于模型训练,除非客户明确选择加入。 ## 安全挑战:单一交互的局限 随着模型承担更长时间、更复杂的任务,一些严重的安全风险可能只有在跨多个交互的上下文中才会显现。例如,恶意行为者可能反复探测安全防护、跨账户协调,或将威胁伪装成常规研究。在代理式任务中,系统可能因未及时停止而偏离用户意图,产生对齐风险。传统的安全系统仅对单个交互进行评估,难以捕捉这些模式。 ## 私有安全处理:兼顾安全与隐私 为了在 ZDR 下解决上述挑战,OpenAI 推出了 **私有安全处理**。该技术旨在识别相关交互之间的模式,而无需让 OpenAI 人员访问底层内容。对于 ZDR 部署,客户内容存储在客户控制的设施上;同时,OpenAI 也在开发一种选项,将内容存储在 OpenAI 的基础设施上,但使用客户控制的密钥进行加密。 在这两种方案中,自动化系统都能识别潜在滥用行为,并返回有限的安全信号,而不会将底层提示词或响应暴露给 OpenAI 人员。 ## 行业背景与意义 近期,一些前沿模型的部署要求客户允许 AI 提供商保留敏感内容以进行安全监控。然而,对于许多组织而言,这一要求与其安全义务或对服务对象的承诺相冲突。OpenAI 的私有安全处理旨在继续提供 ZDR,同时强化安全防护,为那些对数据隐私有严格要求的组织提供了新的可能性。 尽管该技术仍处于预览阶段,其具体实现细节和实际效果尚待验证,但这一方向表明,AI 行业正在努力平衡安全与隐私这两个关键需求。未来,随着代理式 AI 的普及,类似的技术或将成为标配。
谷歌本周三宣布在Search和Gemini中推出一系列全新学习工具,包括AI生成的交互式视觉内容、3D模拟、专门的学生中心、定制化练习测验等。此举标志着谷歌加大力度,让Gemini成为学生学习和研究时首选的AI助手,与OpenAI及教育科技初创公司Knowt和Gauth展开竞争。 在Search方面,学生现在可以生成定制工具和模拟,以帮助理解复杂主题。例如,学习pH值的学生可以搜索“pH scale”,在AI Overview中获得交互式视觉内容,使基础知识更易理解。进一步,他们可以提出更专业的问题,如将柑橘类水果绘制在pH标尺上,AI Mode将创建定制交互体验。 用户现在可以直接在Search中获取定制练习测验,涵盖科学、数学、人文、外语等。例如,输入“创建一份SAT最常考词汇的测验”即可生成交互式测验。未来几周,Lens将推出新的交互式学习体验,学生可通过Google应用中的Lens相机图标上传问题照片,AI将解释概念、识别潜在错误并提供指导。此外,学生还可以上传PDF、文档、幻灯片等文件,Search将生成学习文档,如基于手写笔记和讲座幻灯片的一页关键概念概述。 Gemini方面,谷歌推出新功能,让学生能在Gemini Live中启动多步骤研究报告,并进行对话式讨论。用户可要求Gemini研究主题,然后在后台处理时关闭聊天或做其他事情,完成后会收到通知,并可通过语音讨论结果或提问。此外,Gemini还能生成功能性的3D模拟,帮助用户更好理解复杂概念。 这些新功能是谷歌在AI教育领域的最新布局,旨在通过更直观、交互的方式提升学习效率。随着AI在教育中的应用日益广泛,谷歌正努力通过整合Search和Gemini,提供一站式学习解决方案,以应对来自OpenAI等竞争对手的挑战。