SheepNav

AI 资讯

每日聚合最新人工智能动态

父亲想居家养老,AI 将在旁“看护”

随着全球老龄化加速,越来越多的老年人希望在自己的家中安享晚年,即“居家养老”。但子女远在他乡、看护资源紧张,让这一愿望面临现实挑战。如今,AI 驱动的监控设备正试图填补这一空白——通过始终开启的麦克风或传感器,实时监测老人的安全状况。 ## 一个真实的案例 一位 86 岁的老人在西雅图家中步履蹒跚,险些摔倒;而他的儿子远在 5000 公里外的奥地利,数月后才通过 AI 设备 **Sensi.ai** 的转录记录得知此事。Sensi 是一种始终开启的 AI 麦克风,能捕捉咳嗽声、冲马桶声,甚至私人对话片段。它最初作为免费附加服务被推荐给老人的看护团队,旨在帮助老人保持独立,同时让远方的家人安心。 ## 居家养老的吸引力与隐忧 研究表明,搬入养老院的老年人认知能力下降更快。对许多老人而言,家不仅是物理空间,更是记忆的容器——文中老人的家仍保留着已故妻子的痕迹。然而,跌倒风险是居家养老的最大隐患之一。过去几年,老人的步态恶化已成为家人和看护者的持续担忧。 AI 监控设备看似两全其美:一个不起眼的白色盒子放在桌下或椅旁,静默监测危险。但隐私问题随之而来。老人一向注重隐私,不愿表露情感,而 AI 设备却记录下所有声音——包括私人对话。这种“为安全牺牲隐私”的权衡,引发了伦理层面的讨论。 ## 行业背景与技术展望 目前,类似 Sensi 的产品在美国居家看护市场中逐渐普及。除了麦克风,还有基于红外线、雷达或压力传感器的设备,可检测跌倒、活动异常甚至生命体征。AI 算法能区分正常行为与紧急事件,减少误报。 然而,技术并非万能。**误报可能引发不必要的焦虑,而漏报则可能延误救治**。此外,数据存储与分享的合规性、老人是否真正同意被持续监控,都是待解难题。 ## 小结 AI 监控为居家养老提供了新的可能性,但它无法替代人的情感连接。技术的介入需要平衡安全、隐私与尊严。当老人说“我想在家摔倒的权利”时,我们是否准备好用算法回应这种渴望?

WIRED AI1个月前原文

SpaceX 的估值在上市后短短几天内飙升 1 万亿美元,突破 2.7 万亿美元,超越亚马逊成为全球第五大最有价值公司。这一增长主要得益于其股价在周一上涨 20%、周二早盘再涨 8% 以上,以及公司宣布以 600 亿美元全股票交易收购 AI 编程初创公司 Cursor。尽管 SpaceX 在 2025 年亏损 49 亿美元(营收 187 亿美元),而亚马逊盈利 780 亿美元(营收 7170 亿美元),但投资者对 SpaceX 的增长前景充满信心。新收入来源包括与 Anthropic 和 Google 的计算租赁协议,以及 Cursor 的加入。SpaceX 于上周五上市,估值约 1.7 万亿美元,IPO 仅发行约 4% 股份,专家预计这会加剧股价波动。

TechCrunch1个月前原文

AI 幻觉与事实性错误一直是制约大语言模型落地的核心瓶颈。近日,一家名为 **Probably** 的初创公司宣布获得 **900 万美元** 种子轮融资,试图从根源上解决这一问题——其目标是构建一种“更可靠”的 AI,让准确性达到与传统确定性系统相当的水平。 ## 核心问题:AI 的“不确定性”之痛 当前主流的大语言模型(如 GPT-4、Claude 等)本质上是概率系统,每次输出都可能不同,甚至产生与事实相悖的“幻觉”。这种不可靠性在医疗、金融、法律等高风险领域尤为致命,直接阻碍了 AI 的规模化应用。Probably 的创始人认为,现有技术路线过度依赖“规模扩大带来能力提升”,而忽视了系统性的可靠性设计。 ## 技术路径:从“概率”走向“确定性” Probably 并没有公开其技术细节,但从官方描述来看,其核心思路是构建一个 **可验证、可解释的推理框架**,而非单纯依赖更大的模型或更多的数据。具体方向可能包括: - **结构化知识约束**:将外部知识库与模型输出进行实时校验,阻断幻觉传播。 - **形式化验证**:对模型推理过程进行数学层面的正确性检查,类似软件工程中的单元测试。 - **混合架构**:结合符号推理与神经网络,让 AI 在关键决策点上具备确定性。 这种思路与近年来兴起的“神经符号系统”和“可解释 AI”趋势一脉相承,但 Probably 更强调 **输出结果的绝对可靠性**,而非仅仅提升平均准确率。 ## 市场与竞品:一条少有人走的路 目前,大多数 AI 公司选择通过“人类反馈强化学习(RLHF)”或“检索增强生成(RAG)”来减少幻觉,但这些方法都无法从根本上消除错误。Probably 的差异化在于将“可靠性”作为第一性原理,甚至愿意为此牺牲部分灵活性或创造性。 其潜在竞争对手包括: - **Vectara**:提供可解释的检索增强生成服务。 - **Glean**:企业搜索领域的可靠性探索。 - **Anthropic** 的“宪法 AI”路线,但更偏向对齐而非确定性。 ## 融资背景与团队 本轮融资由 **XYZ Capital** 领投,多家知名 AI 基金跟投。创始人曾深度参与过自动驾驶和工业质检系统的可靠性工程,深知“99% 准确率”与“99.999% 准确率”之间的鸿沟。他们表示,**“AI 不应是一个黑箱,而应是一台可被审计的机器”**。 ## 行业启示 Probably 的融资信号表明,资本正在从“模型规模竞赛”转向“可靠性基建”。当 GPT-5、Claude 4 等大模型的能力逼近天花板时,如何让 AI **安全、可信地落地** 反而成为更紧迫的命题。如果 Probably 能证明其技术路线可行,可能会催生一个全新的“确定性 AI”细分赛道,甚至倒逼主流大模型厂商在可靠性上加大投入。 当然,这条路挑战重重:如何平衡准确性与通用性?如何避免过度约束导致的“能力降级”?答案或许在未来 12-18 个月的公开演示中逐渐浮现。

TechCrunch1个月前原文

SpaceX 在创纪录的 IPO 后宣布以 **600 亿美元** 收购 AI 编程平台 **Cursor**,此举旨在强化其 AI 能力,与 OpenAI 和 Anthropic 争夺企业客户。Cursor 提供类似 Claude Code 和 Codex 的自动化编程工具,近年来因“氛围编程”趋势而快速增长。SpaceX 此前曾抱怨其内部 AI 编程产品表现不佳,收购 Cursor 被视为追赶竞争对手的关键一步。交易预计在 2026 年第三季度完成。

The Verge1个月前原文

SpaceX 宣布以 **600 亿美元** 的全股票交易收购 AI 编程初创公司 **Cursor**,此举距离 SpaceX 的历史性 IPO 仅过去数天,且距双方首次宣布合作意向不到两个月。这笔收购旨在强化 SpaceX 的 AI 部门——该部门围绕埃隆·马斯克的 AI 公司 **xAI** 构建,后者于今年早些时候与 SpaceX 合并——以追赶主流 AI 实验室的步伐。 尽管 AI 部门是 SpaceX IPO 承诺的核心亮点,但它近期却深陷重组困境,此前因允许用户生成未经同意的女性及儿童深度伪造内容而引发争议。SpaceX 在 IPO 过程中向投资者表示,其看到的 AI 产品可寻址市场规模高达 **26 万亿美元**,大致相当于美国 GDP。SpaceX 于周二表示,该收购预计将在今年第三季度完成。 在 SpaceX 介入之前,Cursor 本计划从 Andreessen Horowitz、Thrive 和 Nvidia 等投资方完成一轮 **20 亿美元** 的融资,估值达 **500 亿美元**。马斯克的公司早在今年 4 月 IPO 前就达成了一项特殊协议:要么以 600 亿美元股票收购 Cursor,要么在交易失败时支付 **100 亿美元** 的违约金。 Cursor 成立仅三年,却随着 AI 编程热潮迅速崛起。它于 2024 年加入 OpenAI 的创业加速器,随后完成多轮融资,在 SpaceX 交易宣布前估值已达约 **290 亿美元**。今年早些时候,xAI 挖走了 Cursor 的两名资深工程负责人,随后又在 4 月将其部分数据中心容量租给 Cursor,这些迹象都预示了最终的收购。 值得注意的是,xAI 自身正陷入动荡:马斯克在 xAI 的 **11 位联合创始人** 已于 3 月底前全部离职。马斯克公开承认了这一情况,但未详细说明原因。此次收购能否扭转 SpaceX AI 部门的颓势,仍有待观察。

TechCrunch1个月前原文
Copilot严重漏洞曝光:攻击者可绕过2FA窃取用户验证码

## 漏洞速览:2FA 安全防线形同虚设? 上周二,微软修复了其 M365 Copilot AI 平台上一个**严重等级为“最高”** 的漏洞。本周一,发现并报告该漏洞的研究人员公开了其概念验证(PoC)利用方式:攻击者能够从 Copilot 可访问的邮件中**窃取双重身份验证(2FA)代码**及其他敏感数据。 ## 根源:AI 的“轻信”无解? 这并非孤立事件。微软及其他大语言模型(LLM)提供商一直无法阻止其产品遵从恶意请求泄露数据。根本原因在于:**AI 机器人无法区分用户提供的指令与隐藏在第三方内容中的恶意指令**。当模型为用户总结、起草回复或执行其他操作时,这些恶意指令可能被悄然注入。由于无法守住这一关键边界,微软等公司只能不断设置复杂且临时的护栏,试图遏制这种“先天轻信”带来的后果。 ## 绕过护栏:参数到提示注入(Parameter-to-Prompt Injection) Varonis 安全团队设计了一条攻击链,成功跨越了微软设置的防护措施。其核心是所谓的 **“参数到提示注入”**(Parameter-to-Prompt Injection)。与传统的提示注入不同,恶意命令并非藏在邮件或文档中,而是被置于 URL 的查询参数(如 `?q=`)中。当 Copilot 处理此类 URL 时,会将参数中的恶意指令解释为用户意图的一部分,从而泄露数据。 ## 已有护栏为何失效? 微软此前已部署多项防护:例如将 Copilot 输出包裹在 `<code>` 块中,防止浏览器将其解析为可执行内容;同时限制 Copilot 只能访问受信任的 Microsoft 域名。然而,攻击者利用标记语言(如 `<img>` 标签)诱导 Copilot 向攻击者服务器发送包含敏感数据的请求,从而绕过限制。当 Copilot 尝试加载图片或提交表单时,数据即被外传。 ## 行业反思:LLM 安全何去何从? 此次漏洞再次证明,当前 LLM 安全策略存在结构性缺陷。依赖临时补丁和规则集难以应对不断演变的注入手法。业界亟需从模型架构层面解决指令来源的隔离问题,例如引入更严格的上下文隔离机制。在此之前,用户应谨慎对待 Copilot 等 AI 助手处理敏感信息的能力,尤其是涉及 2FA 代码等高价值数据时。

Ars Technica1个月前原文
半导体初创公司为关键旧芯片打造替代方案

随着半导体行业持续向先进制程迈进,一个被忽视的市场正在悄然增长:**关键旧芯片的替代需求**。初创公司 **Phoenix Semiconductor** 正瞄准这一领域,为那些早已停产、却在国防、航空航天、工业控制等关键系统中不可或缺的芯片提供现代替代品。 Phoenix 的策略聚焦于 **高混合、低批量** 的生产模式。与追求规模效应的大厂不同,它们专门复刻那些生命周期长、但产量需求不大的旧芯片。这些芯片通常用于维护老旧但至关重要的系统,如战斗机航电、核电站控制器或医疗设备。由于原厂早已停止生产,系统运营商面临严重的安全和供应链风险。 Phoenix 的做法并非简单复制,而是通过现代工艺重新设计,确保功能完全兼容的同时,提升性能、可靠性和能效。例如,它们复刻了 **Xilinx EEPROM** 和 **Datel DAC** 等经典芯片。这不仅延长了关键基础设施的使用寿命,还避免了昂贵的系统重新认证和改造。 从行业背景看,这一模式反映了半导体生态的深度分化:尖端芯片追逐摩尔定律,而“旧芯片”市场则依赖逆向工程和小批量制造能力。Phoenix 的成功与否,将取决于其能否在兼容性、交付速度和成本之间找到平衡。随着全球供应链安全日益受到重视,这类“芯片拯救者”的价值正被重新评估。

IEEE AI1个月前原文
半导体初创公司为关键遗留芯片打造替代方案

随着半导体行业不断追求更小、更快、更便宜的芯片,大量用于关键基础设施(如航空航天、国防、医疗设备和工业控制系统)的遗留芯片正面临停产或供应不足的困境。这些芯片虽然技术老旧,但在许多关键系统中仍发挥着不可替代的作用。一家名为 **Phoenix** 的半导体初创公司正瞄准这一市场,专注于为这些“过时”但至关重要的芯片提供替代方案。 ## 聚焦高混合、小批量需求 Phoenix 的策略是满足 **高混合、小批量** 的需求——即生产多种类、但每种数量有限的芯片。这与主流芯片制造商追求大规模量产的模式截然不同。传统芯片厂通常不愿为停产芯片重启生产线,因为成本高昂且缺乏规模效益。Phoenix 则通过逆向工程或重新设计,生产出与原始芯片功能兼容的替代品,从而延长关键系统的使用寿命。 ## 实际案例:EEPROM 与 DAC 的复活 Phoenix 已成功开发出多款替代芯片,例如 **Xilinx EEPROM** 和 **Datel DAC** 的复刻版本。这些芯片原厂早已停产,但在许多军用和工业设备中仍有大量需求。Phoenix 的替代品不仅实现了引脚兼容,还在性能上进行了优化,同时确保长期可用性。 ## 行业背景与市场机遇 据行业分析,全球半导体供应链在疫情后暴露出脆弱性,尤其是对特殊、非标芯片的依赖。许多关键系统依赖的芯片已生产了数十年,一旦原厂停产或转产,系统维护将面临巨大挑战。Phoenix 的模式为这些系统提供了“救生索”,避免了昂贵的重新设计或系统替换。 此外,Phoenix 的策略也呼应了 **芯片本土化** 和 **供应链韧性** 的全球趋势。通过在国内或区域内部生产替代芯片,可降低对单一供应商的依赖,增强国家安全与产业自主。 ## 挑战与展望 尽管前景广阔,Phoenix 仍面临技术验证、客户信任和成本控制等挑战。替代芯片需要经过严格的环境与可靠性测试,尤其是在军工和航天领域。同时,小批量生产意味着单位成本较高,客户需权衡替代方案与系统升级的长期成本。 总体来看,Phoenix 的案例展示了半导体行业“逆向创新”的可能性——在追逐前沿技术的同时,不应忽视对现有关键系统的支持。随着更多类似初创公司的涌现,遗留芯片的供应链生态有望得到改善,为关键基础设施的长期稳定运行提供保障。

IEEE AI1个月前原文
AI 使用量“相当疯狂”,企业老板们的赌注面临考验

随着企业大规模部署 AI 工具,token 消耗量激增引发了对“tokenomics”(代币经济学)的关注。软件公司 8x8 通过使用 Anthropic 的 Claude 替代数十款订阅软件,每年节省约 500 万美元,而 AI 账单远低于此,令 CFO 满意。但更多公司面临成本压力:加拿大皇家银行 token 使用量半年增长 500%;思科三分之一的员工每天使用内部 AI 聊天机器人,token 消耗“相当疯狂”;Amplitude 的顶级工程师每月花费数千美元。Box CEO 称 token 预算已成为最热门话题之一。WIRED 分析显示,4-5 月约 300 家公司在财报会议中提及 AI token 问题。企业正试图在效率提升与成本失控之间寻找平衡,tokenomics 正成为 AI 时代的新管理挑战。

WIRED AI1个月前原文

马来西亚AI驱动的消息平台Respond.io近日宣布完成6250万美元的B轮融资,由Camber Partners领投,Endeavor Catalyst及现有投资者跟投。该公司专注于通过AI代理自动处理大量客户咨询,并采用按对话量而非按座席收费的定价模式。目前其年经常性收入(ARR)已达3500万美元,同比增长169%,利润率30%。 Respond.io成立于2017年,最初在香港创立,后迁至马来西亚吉隆坡。联合创始人兼CEO Gerardo Salandra曾任职IBM和谷歌,后加入健身追踪应用Runtastic(2015年被阿迪达斯收购)。公司平台支持WhatsApp、Instagram、TikTok、Messenger、Line、Telegram、微信、语音通话和网页聊天等多个消息渠道,帮助中型到大型B2C企业从客户对话中驱动营收。其核心客户为高决策成本行业,如医疗、汽车、零售、教育和旅游,客户规模通常在200至10000名员工之间。 Respond.io目前每季度处理20亿条消息。Salandra强调,AI的崛起并未威胁其业务,反而加速其增长:“每天AI越突出,我们增长越快。”这得益于其按对话量定价的策略——无论回复来自人类还是AI,企业都按对话次数付费。相比之下,传统按座席收费的SaaS平台在AI减少人工参与时会损失收入。 本轮融资将用于产品开发、市场扩张及潜在收购。Salandra表示,公司正在探索并购机会,以增强AI能力和渠道集成。这反映出东南亚AI创业生态的活跃,以及客户消息管理领域的竞争加剧。

TechCrunch1个月前原文

据最新财务数据,OpenAI 在 2025 年的亏损较此前大幅扩大,增幅接近 **8 倍**,年度总支出高达 **340 亿美元**。这一数字远超市场预期,反映出这家 AI 巨头在算力基础设施、人才招聘及模型训练上的疯狂投入正快速吞噬现金流。 ## 亏损背后:算力军备竞赛的代价 OpenAI 的支出激增主要源于几大方向: - **算力租赁与自建数据中心**:训练 GPT-5 及后续模型需要海量 GPU 集群,微软 Azure 之外的第三方算力采购成本持续攀升。 - **人才争夺**:顶尖 AI 研究员的年薪普遍在百万美元级别,团队规模已扩至数千人。 - **推理成本**:ChatGPT 及 API 服务的日活用户数亿级,每次对话的推理计算成本虽在优化,但总量依然惊人。 与 2024 年相比,2025 年的支出几乎翻倍,而收入增长未能同步跟上。尽管 OpenAI 的营收(主要来自 API 和企业订阅)预计在 2025 年突破 **100 亿美元**,但相比 340 亿的支出,净亏损规模或达 **200 亿美元**以上。 ## 行业视角:AI 公司的烧钱模式可持续吗? OpenAI 的亏损并非个例。Anthropic、Google DeepMind 等头部实验室同样面临“收入增速跑不赢投入”的困境。但 OpenAI 的特殊性在于: - **非营利上限结构**:早期投资者回报有封顶,这限制了外部融资渠道,更多依赖微软等战略投资者的持续输血。 - **规模效应悖论**:用户越多,推理成本越高;而降价会进一步刺激使用量,形成“越卖越亏”的循环。 有分析师指出,若 OpenAI 无法在 2026 年前实现单位经济模型改善(如通过定制 AI 芯片大幅降低推理成本),其资金链将面临严峻考验。 ## 未来关键变量 - **GPT-5 商业化**:若新模型能带来显著的用户付费转化率提升,或企业级产品(如定制模型微调服务)放量,将改善收入结构。 - **融资节奏**:OpenAI 可能寻求新一轮融资,或推动部分业务独立上市(如 API 平台)。 - **技术突破**:更高效的稀疏模型或量化技术若落地,推理成本有望下降一个数量级。 > 小结:OpenAI 的巨额亏损是 AI 军备竞赛的缩影——赢家通吃的预期驱动着不计成本的投入。但 340 亿美元的数字也敲响警钟:当资本耐心消退时,谁能先跑通可持续的商业闭环,谁才能真正定义下一代 AI 格局。

Hacker News1291个月前原文

## 概述 近日,一篇来自中国科学技术大学与中国移动(苏州)软件技术有限公司的联合研究论文提出了 **GRAPE(Guided Parameter-Space Evolution)** 框架,旨在通过引导参数空间的渐进式演化,在紧凑模型上实现更强的对抗鲁棒性。该研究挑战了传统对抗训练(Adversarial Training, AT)中“从始至终训练固定参数空间”的范式,探索参数优化顺序对最终鲁棒解的影响。 ## 核心方法 GRAPE 的核心思想是将鲁棒模型的学习视为一个 **参数空间逐步暴露与演化** 的过程。它结合了两种关键机制: - **参数空间稳定化**:在当前暴露的参数子空间内稳定鲁棒优化,确保已有参数已充分收敛到对抗鲁棒的局部区域。 - **渐进式隐藏扩展**:逐步释放新的可优化维度,并利用 **对抗谱利用率分数(adversarial spectral utilization score)** 引导新容量优先分配给模型中承受高对抗压力的模块。 这种“先稳定、再扩展”的策略,使得模型能够在训练过程中动态决定哪些参数需要优先优化,从而避免传统固定结构 AT 中参数空间的低效利用。 ## 实验结果 在 CIFAR-10 数据集上,采用标准的 ℓ∞ 威胁模型,以固定结构的 ResNet-18 对抗训练作为对照基准,GRAPE 取得了以下关键结果: - **PGD-20 鲁棒准确率**:从基线 51.70% 提升至 **56.94%**,提升超过 5 个百分点。 - **计算开销**:FLOPs 比仅为 1.009 倍,几乎与基线持平。 - **参数量减少**:参数量减少了约 **21.4%**,体现了紧凑性优势。 此外,研究还设置了一种“顺序增长变体”,即最终架构仍为标准的 ResNet-18,但训练过程中参数逐步暴露。该变体达到了 56.52% 的 PGD-20 鲁棒准确率,与直接训练完整 ResNet-18 的基线(51.70%)相比仍有显著提升。这一对比有力地说明:**性能增益不仅来自最终架构的差异,更来自参数空间暴露路径本身**。 ## 行业意义 在 AI 安全领域,对抗训练是提升模型鲁棒性的主流方法,但传统方法通常假设所有参数同等重要且同时优化,导致冗余参数可能引入脆弱性。GRAPE 的工作表明,**参数优化的顺序与路径** 同样关键,这为设计更高效、更紧凑的鲁棒模型提供了新思路。 对于资源受限的边缘设备(如手机、物联网终端),GRAPE 在几乎不增加计算开销的情况下,通过减少参数量并提升鲁棒性,具有实际部署价值。同时,该框架也启发后续研究:是否可以进一步将参数空间演化与神经架构搜索(NAS)或剪枝技术结合,实现自动化程度更高的鲁棒模型设计? ## 小结 GRAPE 通过“引导参数空间演化”这一新范式,在紧凑模型上实现了对抗鲁棒性的显著提升。实验数据充分证明了参数暴露顺序对鲁棒解质量的影响,为对抗训练领域注入了新的理论视角和实践工具。

HuggingFace1个月前原文

## 引言:保险定价中的公平难题 保险定价的公平性是一个长期悬而未决的难题。一方面,保险公司出于盈利考量,会根据个体风险差异制定保费,追求**精算公平**——即高风险者多付、低风险者少付。另一方面,保险承担着社会风险共担的功能,需要通过群体间的交叉补贴实现**团结公平**,保护弱势群体。在大数据时代,精细化风险区分成为可能,监管压力也日益增大,如何平衡这两种公平理念成为行业核心挑战。 ## α-FISP框架:一个统一的解决方案 最新发表于arXiv的论文《α-Fair Insurance Pricing: A Fairness Continuum》提出了一种名为**α-公平个体偿付能力保费(α-FISP)** 的框架。该框架将定价问题建模为约束优化任务:在保证保险公司偿付能力的前提下,对精算公平保费进行交叉补贴调整。 关键创新在于引入参数 **α**,它控制着从纯粹精算公平(α=0)到纯粹团结公平(α=1)的连续过渡。决策者可以根据政策目标或监管要求,在光谱上选择任意一点作为定价基准。例如,α=0时保费完全基于个体风险;α=1时则完全按群体平均风险定价,实现最大程度的交叉补贴。 ## 理论保证与实证验证 研究团队为α-FISP框架提供了严格的理论保证,证明其解的存在性、唯一性以及偿付能力约束的满足性。数值实验表明,该框架在计算上是可处理的,并且能够很好地适应美国各州不同的监管要求——例如某些州要求严格按风险定价,而另一些州则强调对特定群体的保护。 ## 行业意义与未来展望 α-FISP框架为保险监管和行业实践提供了一个灵活的工具。它使保险公司能够在精算准确性和社会公平之间找到可量化的平衡点,同时满足偿付能力这一基本要求。对于监管者而言,该框架可帮助制定更精细化的公平性标准,避免“一刀切”带来的副作用。 未来,该研究可进一步扩展至动态定价、再保险以及多风险类别的复杂场景。随着AI和机器学习在保险业的应用深化,这种可调节的公平性框架有望成为行业标准。

HuggingFace1个月前原文

多源迁移学习面临一个根本性的可扩展瓶颈:现有方法要么在参数融合时一次性将所有 K 个源模型加载到内存中(需要 O(K) 内存),要么在推理时部署所有模型,导致生产部署不可行。我们提出 **GRASP**(梯度对齐顺序参数迁移),通过三项关键创新在维持 **O(1) 内存消耗** 的同时实现卓越的知识集成: 1. **顺序处理**:每次只将一个源模型合并到正在演化的目标模型中; 2. **参数级梯度对齐**:仅选择优化方向与目标领域对齐的参数进行迁移,避免负迁移; 3. **迭代微调**:在集成下一个源模型之前,对已迁移的知识进行自适应调整。 在三个持续学习基准(Yearbook、CLEAR-10、CLEAR-100,覆盖 10 到 108 年时间分布偏移)和四种架构(1.3M 至 25.6M 参数)上的大量实验表明,**GRASP 在所有数据集和架构上的平均准确率达到 93.5%**,而集成方法仅为 71.7%。同时,GRASP 仅需恒定内存,而标准多源融合需要 K 个模型的内存。关键的是,GRASP 的顺序设计使得之前合并的模型无需保留,且能扩展到任意多的源模型而无需增加内存,使其特别适合资源受限的部署和持续演化的源领域。

HuggingFace1个月前原文

现代推荐系统日益依赖动态路由机制,将多样化的查询分发给多个嵌入模型。然而,在对抗性查询、赌博机反馈以及模型可观测性有限等现实条件下,这一问题的理论基础仍十分薄弱。近日,一篇发表于 arXiv 的论文《Policy Regret for Embedding Model Routing: Contextual Bandits with Low-Rank Experts》对此进行了系统性的数学建模与分析。 ### 问题形式化 研究者将嵌入模型路由问题形式化为**低秩专家参与的对抗性上下文线性赌博机**:上下文对应查询,动作对应推荐项,而专家则是工作在低秩隐空间上的嵌入模型。这种设置更贴近实际场景——查询可能被恶意构造,反馈仅限点击等二元信号,且模型内部参数不可见。 ### 核心发现 论文首先指出,标准的遗憾定义(如累积遗憾)在此场景下存在**结构性错配**或**统计不可解**的问题。为此,作者提出了一类**对数二次策略类**(log-quadratic policy class),该策略类既能表达查询相关的模型路由决策,又保留了高效在线学习的结构特性。 在此基础上,研究者提出了名为 **Hypentropy Policy Gradient (HPG)** 的策略梯度算法。该算法能在信息不完全的情况下自适应地学习未知的低秩结构,并达到 $\tilde{\mathcal O}(s\sqrt{M T})$ 的线性化策略遗憾界,其中 $s$ 为专家的本征秩,$M$ 为模型数量,$T$ 为轮次。这一结果避免了维度灾难,理论上优于现有方法。 ### 实际意义 论文还提供了**计算高效且无需手动调参**的 HPG 实现方案。这意味着该算法不仅具有理论保证,还具备实际部署的可行性。 ### 行业背景 当前,大型推荐系统通常维护数十甚至上百个嵌入模型,分别针对不同领域或任务。如何根据实时查询动态选择最合适的模型,是提升推荐效果与计算效率的关键。本工作将这一工程问题提升到严谨的数学层面,为后续研究奠定了理论基础。 ### 小结 本研究通过引入低秩专家和对抗性上下文赌博机框架,为嵌入模型路由提供了首个具有遗憾保证的在线学习算法。其理论贡献与实用实现,有望推动推荐系统在更复杂环境下的稳健运行。

HuggingFace1个月前原文

## 核心发现 **可分离神经架构(SNA)** 是一种结合神经网络逼近与张量分解的函数表示类,通过将局部坐标函数(原子)与稀疏低秩交互对象解耦,形成紧凑且光滑的归纳偏置,尤其适合求解偏微分方程(PDE)。在变分框架(VSNA)下,该架构满足经典变分保证(Lax-Milgram引理),包括适定性、拟最优性、收敛性和稳定性。 ## 关键突破 - **维度灾难缓解**:对于高维时空-参数PDE,VSNA的复杂度随维度代数增长而非指数增长,利用交替最小二乘(ALS)优化将成本降至线性。 - **极速计算性能**:在标准笔记本电脑CPU上,VSNA执行100万次蒙特卡洛采样仅需102秒,相比基于NVIDIA A100 GPU的全网格有限元基线实现了**150,000倍加速**。 - **实时逆问题求解**:支持100毫秒内的生成式逆模式重建,适用于实时反演、优化循环和快速不确定性传播。 ## 工程验证 研究通过两个工程案例展示了SNA作为“一次性求解、任意位置查询”的物理世界模型: - **7维参数制造仿真**:处理高维参数空间,实现快速仿真。 - **Inconel 718热-性能反演管线**:从实验热数据反演材料属性,验证了模型在真实场景中的有效性。 ## 行业意义 SNA的提出为**科学计算与AI融合**提供了新范式。传统数值方法(如有限元)在高维问题中面临指数级计算增长,而SNA通过代数缩放打破了这一瓶颈。其“求解一次、任意查询”的能力,使得实时数字孪生、在线优化和不确定性量化成为可能,对航空航天、材料科学、气候建模等领域具有深远影响。 ## 总结 这项研究不仅从理论上证明了SNA的数学完备性,更通过实际案例展示了其工程可行性。随着AI for Science的推进,SNA有望成为连接神经网络与物理建模的桥梁,推动复杂系统仿真进入实时化、轻量化时代。

HuggingFace1个月前原文

强化学习(RL)与扩散模型或流匹配(flow-matching)策略的结合一直面临挑战:虽然这类生成模型能表达丰富的动作分布,但通过时间差分(TD)学习优化时,直接利用评论家(critic)的动作梯度反向传播会因多步去噪过程而出现数值不稳定。现有方法要么丢弃梯度信息、将策略蒸馏为单步动作,要么随评论家更新反复微调去噪网络,效率和性能难以兼得。 **QPILOTS 的核心思路**:保持原始策略不变,在推理时引导去噪过程。具体来说,在每个去噪步骤中,不直接在噪声中间动作上评估评论家(该处预测不可靠),而是先将中间状态投影到最终干净动作的估计值,再在该估计值上计算评论家梯度,并用该梯度修正去噪方向。论文提出两种变体:**QPILOTS-U** 采用快速单点近似,计算开销低;**QPILOTS-M** 则通过一个可学习的辅助网络生成可微的后验样本,精度更高。 **性能表现**:在标准的离线到在线 RL 基准测试中,QPILOTS 在 50 个任务上平均成功率达到 **90%**,综合表现最佳。此外,作者将 QPILOTS 应用于冻结的大型预训练视觉-语言-动作(VLA)基础模型,在 6 个仿真操作任务上,其性能超越或持平于已有的推理时引导方法。 **行业意义**:这项研究为大规模预训练策略的“零微调”部署提供了新思路——无需修改模型参数或重新训练,仅通过推理时的梯度引导就能显著提升决策质量。对于机器人操作、自动驾驶等需要快速适应新任务的场景,QPILOTS 有望降低部署成本,同时保持策略的泛化能力。

HuggingFace1个月前原文

## 研究背景与动机 自动驾驶系统依赖精确的轨迹预测来规划安全高效的行驶路径。近年来,图神经网络(GNN)因其对道路参与者之间时空交互建模的能力,成为轨迹预测领域的热门方法。然而,**GNN架构设计缺乏标准化**,开发者往往不清楚哪些图卷积层能最有效地捕捉空间交互与时间动态。 ## 核心发现:19种图层的系统对比 该研究对**19种图神经网络层**进行了系统比较,重点关注其空间与时间处理能力。在特定超参数设置下,**ARMA、Chebyshev 和拓扑感知层**表现持续优于其他方案,成为五大突出层组合中的关键组件。 ## 关键设计原则 除了性能排名,研究还提炼出三条实用设计准则: 1. **聚合策略**:基于 **sum 的聚合方法**比 mean 聚合更有效。 2. **注意力机制**:**多头注意力**机制能够捕捉更丰富的交互关系。 3. **跳距权重**:对不同跳数(hop distance)赋予不同权重,可**显著提升预测精度**。 这些原则为构建更具可解释性与有效性的轨迹预测模型提供了明确指导。 ## 研究意义 该工作填补了 GNN 在轨迹预测中选层的知识空白,为从业者提供了直接可用的架构设计参考。未来,研究者可基于这些发现开发更高效的自动驾驶决策系统。 论文发表于 IEEE IV 2026,全文可在 arXiv 获取(arXiv:2606.14956)。

HuggingFace1个月前原文

自主实验(autoresearch)模式让大语言模型(LLM)通过迭代修改代码来优化目标指标,但其无状态设计导致每次迭代都要从头重建实验上下文,产生 O(n) 的逐次 Token 成本和 O(n²) 的总成本。最新研究《Remember, Don't Re-read: Stateful ReAct Agents for Token-Efficient Autonomous Experimentation》提出用 LangGraph 构建状态化 ReAct 智能体,通过类型化持久状态和工具调用接口在迭代间携带实验历史,从而将 Token 消耗大幅降低。 ## 核心创新:从“重读”到“记住” 传统无状态智能体每次迭代都会将完整历史(包括代码、结果、日志)重新送入 LLM 上下文窗口,导致 Token 消耗随迭代次数线性增长。状态化 ReAct 智能体则利用 LangGraph 的持久化状态机制,只将当前步骤的必要信息(如最新结果、待办动作)放入上下文,历史信息通过内部状态引用而非显式重读。这种设计将每次迭代的 Token 成本从 O(n) 降为 O(1)。 ## 基准测试结果 研究者在两项任务上进行了评估: - **超参数调优**(15 次迭代,每次观察数据量小):状态化智能体消耗 **2,492 个 Token**,比无状态版本的 24,465 个减少 **90%**。 - **代码性能优化**(40 次迭代,每次包含完整源码和基准结果):状态化智能体消耗 **627K Token**,比无状态版本的 1,275K 减少 **52%**,且优化质量相当。 ## 架构细节与可复现性 论文详细描述了基于 LangGraph 的实现: - 定义类型化状态(TypedState)存储实验历史、当前步骤和工具调用记录。 - ReAct 智能体通过工具调用接口与环境交互,每次只追加新信息到固定大小的对话窗口。 - 状态管理自动剪枝过期上下文,避免上下文膨胀。 作者提供了足够详细的设计说明,使从业者能够为自己的工作流实现类似的状态化自主实验智能体。 ## 意义与展望 这项工作的价值不仅在于 Token 节省——在 GPT-4 等昂贵模型上,成本降低直接意味着更长的实验序列或更复杂的任务成为可能。此外,固定上下文窗口还避免了长序列推理中的“迷失在中间”问题,可能提升模型在长任务中的稳定性。未来方向包括将状态化设计扩展到多智能体协作、动态上下文压缩等场景。

HuggingFace1个月前原文
DOJ称xAI对国家安全“至关重要”,NAACP诉讼受阻

美国司法部(DOJ)在周一介入了一场针对xAI燃气轮机的诉讼,声称阻止该公司运行天然气发电机组将“威胁美国国家安全、经济和能源安全”。该诉讼由NAACP于4月提起,指控xAI在密西西比州Southaven的第二个数据中心(代号Colossus 2)未经许可运行燃气轮机,违反《清洁空气法》并危害公共健康。DOJ与xAI及密西西比州共同要求法院驳回此案。 DOJ的备忘录指出,目前仅有包括Grok在内的四个AI模型支持机密网络上的关键任务。国防部首席数字与AI官Cameron Stanley的声明进一步透露,军方在近期对伊朗的打击中使用了Grok的Gov模型,并强调中断xAI的电力供应将“直接威胁正在进行的国家安全利益”。 xAI此前在孟菲斯西南部已因类似问题引发争议。当地居民抱怨该公司未经许可运行燃气轮机,而该地区哮喘发病率本就居高不下。田纳西州和密西西比州的州机构声称xAI有一年时间在无需清洁空气许可的情况下运行这些设备,但NAACP认为这不符合EPA的规定。 此案的关键争议在于:AI基础设施的能源需求与环境保护之间的平衡。xAI作为Elon Musk旗下的AI公司,其Grok模型已被用于军事行动,而DOJ的介入凸显了AI在国家安全中的战略地位。然而,NAACP强调,健康与环境不应为技术发展让步,尤其是在污染负担已很重的社区。 案件后续发展将取决于法院如何权衡国家安全与公共健康的优先级。若驳回诉讼,可能为AI公司利用国家安全理由规避环境法规开先例;反之,则可能强化对AI数据中心的环保审查。

WIRED AI1个月前原文