SheepNav

AI 资讯

每日聚合最新人工智能动态

在2026年I/O开发者大会上,谷歌推出了一项名为 **Universal Cart** 的新功能,旨在通过AI代理彻底改变在线购物体验。该功能基于 **Universal Commerce Protocol(UCP)**,这是一个与Target、Shopify、Wayfair和Etsy等主要零售商共同开发的开源标准,允许消费者在一个界面内从多个零售商处购买商品,同时保留各商家的忠诚度计划和信用卡等个性化数据。 Universal Cart 整合了来自谷歌生态系统的数据,包括 YouTube、Gmail、Gemini 和搜索,AI代理会在后台运行,提供购买建议、检测兼容性问题(例如CPU与主板不匹配)、提醒折扣信息,甚至自动切换信用卡以获取最优价格。谷歌广告与商务副总裁 Vidhya Srinivasan 表示,这些功能将使购物“更有趣”,其本质是减少从“加入购物车”到“结账”之间的摩擦,让购物流程近乎即时且高度个性化。 这一举措标志着谷歌在 **代理式AI** 领域的进一步深入。AI不再仅仅是搜索工具,而是主动参与决策和执行的购物助手。对于零售商而言,更流畅的购物体验意味着更高的转化率和更低的购物车放弃率;对于消费者,则可能意味着更省时、更智能的购物过程。然而,这也引发了对隐私和消费者自主权的担忧:当AI代理可以代表用户花钱时,如何确保其行为符合用户的最佳利益?谷歌表示,用户将拥有最终控制权,但具体实现细节仍有待观察。 总的来说,Universal Cart 代表了电商与AI融合的新方向,但“更有趣”的背后,是技术对消费行为的更深层介入。

ZDNet AI2个月前原文

最严重的软件 bug 往往也是最无聊的。用户不应该能读取其他租户的数据——没人反对这一点,设计评审会上也没人替“Alice 读取 Bob 的记录”辩护,但**失效的访问控制**依然是 OWASP Top 10 的头号问题。这些 bug 之所以能上线,是因为规则被放在了系统错误的位置:它存在于 prompt 里、评审清单里、以及“每个未来的工程师——现在则是每次模型调用——都会记住这个不变式并正确应用它”的共享期望中。这个假设本就脆弱,而当 AI 生成绝大部分代码时,它彻底失效了。你可以做所有显而易见的事:把规则写进 `CLAUDE.md`,编写细致的系统 prompt,在 agent 指令里强调“授权**非常**重要”——这些都应该做。但当模型写完一万六千行代码后,真正的问题依然是:**你如何知道代码做了你想做的事?** 测试有帮助,但测试是经验性的,它们只检查你和模型记得写的那些用例,无法替下周别人添加的 handler 说话。 作者想拉动另一根杠杆,其主张直截了当:**对于一大类生产软件而言,结构性反压比 agent 智能的渐进提升更有效**。现有模型已经能写出几乎全部代码,限制因素在于你是否能**知道**它们做了你想做的事——而这种认知来自于模型所编写的底层基质(substrate),而不是等待一个更聪明的模型。 ### 行为门控 vs. 结构门控 大多数 prompt 级别的约束是**行为门控**:我们告诉模型“不要跳过授权”“校验输入”“使用共享辅助函数”。模型遵循这些指令的频率足以让它们有用,但失败的频率也足以让整个安排变得不稳定。行为门控依赖于模型记住规则、识别适用场景、抵抗局部上下文的引力,然后还要依赖人类评审者在整个代码库中维持同样的不变式。 **结构门控**则不同。编译器、类型检查器、测试运行器、linter、证明检查器——每一个都能针对眼前的制品给出一个具体的答案。这个答案并不完美,但它是真实的、可执行的。结构门控不依赖模型的短期记忆或善意,它直接检查代码的**结构属性**:类型是否匹配?引用是否有效?安全策略是否被违反? ### Shen-Backpressure:将结构门控嵌入 AI 编码循环 作者构建的工具和方法论 **Shen-Backpressure** 正是为了探索这一赌注。它通过一个运行中的 demo 展示其工作原理,并演示如何将同样的循环接入你自己的项目。核心思路是:在 AI 编码循环中引入**结构反压**——不是让模型“更聪明”地记住规则,而是让代码的底层结构自动拒绝违反规则的输出。 例如,你可以定义一个“授权策略”作为结构门控:任何生成的代码如果试图绕过授权检查,编译器或静态分析工具就会报错。模型可以生成任意代码,但只要它触犯了门控,构建就会失败。这样,你就不再需要依赖模型在每次生成时都“记得”授权规则——规则已经固化在门控之中。 ### 为什么结构反压优于更聪明的模型? 当前 AI 编码的瓶颈不是模型能力,而是**验证能力**。即使 GPT-5 能写出完美代码,你仍然需要一种方法**确信**它确实做到了。行为门控随着代码规模增长而指数级衰减:模型越写越多,上下文越长,规则越容易被稀释。而结构门控是组合式的:每个门控只检查一个局部属性,但它们的组合可以覆盖整个系统。 当然,结构门控并非万能。它不能捕获所有语义错误,也不能替代良好的设计。但对于一类关键问题——如安全、类型安全、资源隔离——结构门控提供了一种比“让模型更听话”更可靠的路径。 ### 小结 AI 编码循环的未来不在于让模型更聪明,而在于**设计更好的门控**。Shen-Backpressure 代表了一种思路转变:从“教育模型”转向“约束模型”。当你不再期望模型永远正确,而是让代码的基质自动拒绝错误时,AI 编码才能真正走向生产级可靠。

Hacker News1442个月前原文
用手机级激光雷达实现“隔墙观物”:低成本非视域成像新突破

**麻省理工学院媒体实验室(MIT Media Lab)的研究人员开发出一种新型非视域成像系统,仅依靠智能手机级别的激光雷达传感器,就能“看到”拐角后的物体轮廓。** 这项技术有望大幅降低自动驾驶汽车、机器人及安防设备中“透视”障碍物的成本门槛。 传统的非视域成像系统通常依赖昂贵、高功率的飞秒激光器或单光子雪崩二极管(SPAD)阵列,设备体积庞大且成本高达数万美元。而MIT团队提出的方法,利用消费级激光雷达(如iPhone 12 Pro及以上机型搭载的LiDAR扫描仪)即可实现。其核心原理是:向拐角处的地面等漫反射表面发射激光脉冲,光线经反射后照射到隐藏物体,再次反射回的微弱信号被激光雷达捕捉。通过分析光子的飞行时间与空间分布,算法可重建隐藏物体的粗略形状。 **该系统的关键在于算法对噪声的鲁棒性。** 消费级LiDAR的信噪比远低于科研级设备,但研究人员通过多帧累积和时空相关性滤波,成功从噪声中提取出有效信号。实验显示,该系统能在1米范围内识别出约20厘米大小的人体模型或字母形状,分辨率虽不足以看清人脸细节,但足以判断“是否有人”或“大致动作方向”。 **应用前景方面,该技术可显著提升机器人导航的安全性。** 例如,扫地机器人可提前感知墙角后的障碍物或宠物,避免碰撞;自动驾驶汽车在十字路口或停车场可“预判”突然出现的行人或车辆。此外,在搜救场景中,无人机可借助此技术探测废墟后的生命迹象。 **当前局限与未来方向:** 系统目前仅适用于静态或慢速移动物体,且对场景光照条件敏感(强环境光会淹没信号)。MIT团队正尝试结合深度学习提升重建速度与分辨率,并探索与现有安防摄像头、扫地机器人等消费电子产品的集成方案。 **行业影响:** 非视域成像长期是计算机视觉领域的“圣杯”之一。以往受限于成本,该技术仅停留在实验室。此次用手机级LiDAR实现突破,意味着未来每台配备LiDAR的智能设备都可能具备“透视”能力,开启从消费电子到工业自动化的全新应用维度。

IEEE AI2个月前原文

对于计划在欧盟销售物联网或边缘设备的公司来说,Canonical 最新发布的 **Ubuntu Core 26** 值得认真考虑。这款精简、不可变的 Linux 发行版专为边缘计算和物联网设备设计,提供长达 **15 年的长期支持**,并强化了安全性以应对欧盟《网络弹性法案》(CRA)等新兴法规。 ## 什么是 Ubuntu Core? Ubuntu Core 是 Ubuntu 的嵌入式版本,它将内核、基础操作系统和应用程序全部打包为 **snap** 容器。这种设计实现了组件隔离、加密签名和安全的无线(OTA)更新,非常适合需要长期无人值守运行的设备,如工业控制器、机器人、数字标牌和 AI 边缘节点。 ## 主要亮点 - **长达 15 年的支持**:Ubuntu Core 26 将获得支持直至 **2041 年**,为关键基础设施提供长期稳定性。 - **安全合规**:每个组件都经过沙盒化和加密签名,通过测量启动链确保仅运行经过验证的代码。这有助于满足欧盟 CRA 对组件溯源、长期稳定性和可问责性的要求。 - **降低运维成本**:Canonical 声称新版本减少了设备配置的摩擦和成本,简化了大规模设备管理。 ## 行业背景 随着欧盟 CRA 等法规的推进,物联网和边缘设备的供应链安全与软件完整性成为焦点。Ubuntu Core 的不可变架构和长期支持策略,为制造商提供了合规的捷径。Canonical 工程副总裁 Jon Seager 表示:“Ubuntu Core 26 继续为关键基础设施运营商提供满足 CRA、运行可证明的不可变边缘 AI 工作负载以及大规模安全管理设备所需的基础。” ## 总结 对于追求安全、稳定与长期支持的物联网和边缘部署,Ubuntu Core 26 是一个极具竞争力的选择。其不可变设计、15 年支持周期以及对欧盟法规的契合,使其成为企业级应用的可靠基石。

ZDNet AI2个月前原文

分布式系统和有状态系统的测试一直是个棘手问题。传统的集成测试方法——写几个测试用例然后收工——在真实生产环境中能捕获的Bug只占很小一部分。Hacker News上最近一篇热门文章提出了一套新思路:用AI编码智能体(AI coding agents)来设计和执行“索赔驱动”(claim-driven)的测试,并给出了两个具体的Skill文件(SKILL.md)来实现这一流程。 ## 核心流程:Plan + Execute 这套方案由两个智能体技能协作完成:**Plan Skill** 负责设计测试计划,**Execute Skill** 负责执行。两者输出的产物是一份结构化的Markdown测试计划(plan)和一份发现报告(findings report)。报告包含**9种状态裁决**(9-state verdicts)以及明确的故障归属分类(SUT / Harness / Checker / Environment),评审者只需阅读这两份文档即可决定是否发布,无需重新运行任何测试。 ## 索赔驱动:从产品承诺出发 与传统测试驱动开发(TDD)不同,这套方法的核心是“索赔驱动”(claim-driven)。测试计划从产品的**承诺**(claims)出发,为每个承诺生成假设,并编写以该承诺命名的场景,每个场景试图在一种故障条件下**证伪**(falsify)该承诺。文章强调:“一个以承诺命名的测试,比一个以设置命名的测试更难被削弱。” ## 模型 + 历史 + 检查器:不只是混沌 对于一致性关键场景(如安全性、持久性、幂等性、隔离性、排序、成员关系等),每个场景还需绑定一个**抽象模型**(register | queue | log | lock | lease | ledger …)、一个**操作历史模式**、一个**命名检查器**(线性一致性、可序列化性、会话一致性、无丢失确认、恰好一次等),以及如何处理模糊结果(超时、未知提交、重试)。文章称这种组合为“混沌 + 模型 + 检查器,而不仅仅是混沌”。 ## 覆盖充分性作为可交付物 测试计划以一个**覆盖充分性论证**(coverage adequacy argument)和一份**保守的置信度声明**(conservative confidence statement)结尾。计划会诚实地列出哪些场景未经验证,并论证已选场景足以支撑发布的理由。这改变了以往测试“做完就好”的模糊状态,让测试的覆盖边界变得透明。 ## 兼容性与复用性 这套方法兼容主流的AI编码工具,包括 **Claude Code、Codex、Copilot CLI、Cursor、Gemini** 等——任何能阅读Markdown并运行shell的智能体都适用。同时,Execute Skill 会优先发现被测系统(SUT)已有的测试、runbook和故障注入脚手架,复用现有工具箱,而非从头发明。 ## 行业视角 随着AI编码智能体在软件开发中的渗透率持续提升,将智能体用于测试——尤其是分布式系统测试——正在成为一个自然且强大的应用方向。传统测试工具(如Jepsen)虽然能发现深层Bug,但门槛高、自动化程度低。而AI智能体可以自动生成测试计划、执行并生成结构化报告,大幅降低分布式系统测试的准入门槛。 **不足与局限**:文章中的方案目前仍依赖人工评审最终报告,且智能体对测试计划的“覆盖充分性论证”质量取决于底模型的能力。此外,9种状态裁决如何定义、模型与检查器的选择是否完备等细节尚需更多实践验证。 ## 小结 “索赔驱动测试”为分布式系统测试提供了一种可落地、可复用的方法论,尤其适合与AI编码智能体结合。它从产品承诺出发,用模型和检查器强化测试的可验证性,并通过覆盖论证让测试边界透明化。如果你正在为分布式系统的测试质量发愁,不妨试试这套思路。

Hacker News962个月前原文

随着深度伪造和 AI 生成内容泛滥,识别系统能否真正发挥作用成为焦点。近日,Google 在 I/O 大会上宣布,其隐形水印技术 **SynthID** 与开放溯源标准 **C2PA Content Credentials** 将迎来迄今为止最大规模的部署:Chrome 浏览器和 Google 搜索将直接集成验证功能,用户无需跳转即可检查图片是否携带 AI 标签。 ## 两大技术如何互补? SynthID 是 Google 专为其 AI 模型(如 Imagen)生成的图像、视频和音频设计的 **不可见水印**,通过算法嵌入像素级信息,人眼无法察觉,但可通过专用工具检测。C2PA 则是开放标准,在内容创建时嵌入元数据,记录其来源、编辑历史及是否使用 AI 工具。两者各有侧重:SynthID 侧重“防伪”,C2PA 侧重“溯源”。 **关键升级点**: - Google 将验证界面统一,**同时检查 SynthID 和 C2PA 标签**,用户只需在 Chrome 或搜索中右键图片即可获取结果。 - 此前,SynthID 验证需上传至 Gemini 应用,C2PA 需使用独立验证门户,流程割裂。新方案大幅降低使用门槛。 ## 为什么说这是“生死攸关”的时刻? 过去几年,AI 生成内容的真实度呈指数级提升,从教皇穿羽绒服到政客虚假演讲,深度伪造已造成实际社会危害。标签系统曾被寄予厚望,但 **普及率低、验证流程复杂** 导致效果有限。 此次 Chrome 和搜索的集成意味着: - **覆盖数十亿用户**:Chrome 占全球浏览器市场份额超 65%,搜索更是信息入口。 - **统一入口降低摩擦**:用户无需学习复杂工具,一键即可验证。 - **倒逼内容平台跟进**:Google 的举措可能推动社交媒体、新闻网站等采用类似标准。 ## 挑战与局限 尽管前景乐观,但技术并非万能: - **标签可能被移除**:水印和元数据在截图、压缩或转码后可能丢失,恶意行为者仍可规避。 - **生成式 AI 的“灰色地带”**:部分内容混合 AI 与人工编辑,标签的准确性存疑。 - **用户认知不足**:即使工具可用,公众是否养成验证习惯仍是未知数。 ## 行业协同是关键 Google 的举措是“内容真实性倡议”(CAI)和 C2PA 联盟的重要里程碑。此前 Adobe、微软等已支持 C2PA,但缺乏统一验证入口。此次 Google 将两大技术整合,**标志着行业从“各扫门前雪”走向协作**。 ## 小结 AI 标签系统正站在十字路口:要么证明自己能够遏制虚假信息,要么被证明是徒劳的装饰。Google 的这次大规模部署提供了最真实的试验场。未来几个月,我们将看到这项技术是否真能改变游戏规则,还是仅仅成为又一个“安全毯”。

The Verge2个月前原文

多年来,科技公司一直承诺AI将为我们配备能干的个人助理,但实际交付的却更像一个懵懂的实习生。过去六个月,这一局面开始改变,很大程度上归功于开源AI智能体平台OpenClaw的病毒式传播。而在如今竞相追逐类似成功的顶级AI实验室中,谷歌似乎尤其具备大规模推广智能体的潜力。 在2026年I/O大会上,谷歌发布了全新的AI智能体,涵盖信息收集、活动规划、收件箱与日历摘要等功能。这些智能体可在后台持续运行,并声称能无缝集成谷歌自有工具及第三方应用。同时,谷歌还扩展了开发者工具,并为搜索增加了更多生成式AI能力。部分功能本周即上线,其余将在未来数月内推出。谷歌的策略很明确:借鉴OpenClaw成功的部分特性,并借助其对用户数字生活的深度理解来放大这些能力。 谷歌DeepMind CTO Koray Kavukcuoglu表示:“此前AI智能体更多停留在研究层面,今年它们将真正融入我们的生活。”OpenClaw自去年11月上线以来已吸引数百万用户,它让人们能通过WhatsApp和Telegram等日常应用与智能体对话,只要电脑保持开机,智能体就能在后台自主执行任务。谷歌的入场,或许意味着AI智能体从概念走向实用的关键转折。

The Verge2个月前原文

犹他州可能即将迎来全球最庞大的数据中心项目——**Stratos Project**,占地**40,000英亩**(约为曼哈顿面积的两倍多),规划电力容量高达**9GW**,几乎是该州2025年峰值电力需求的两倍。该项目由《创智赢家》投资人、风险资本家**凯文·奥利里**(Kevin O'Leary)主导,旨在确立美国在人工智能领域的全球主导地位,并服务于政府与科技承包商,以强化国家安全。 然而,这一宏伟蓝图在专家和当地居民中引发了强烈反弹。**Box Elder County**的专员已于本月早些时候批准了该项目,但后续仍需获得环境和建筑许可,建设周期预计长达数年。奥利里与犹他州州长**斯宾塞·考克斯**(Spencer Cox)及参议员**斯图尔特·亚当斯**(Stuart Adams)在今年1月会面后,项目推进速度惊人,被奥利里形容为“铺上了红地毯”。 ### 环境与资源隐忧 批评者指出,如此规模的数据中心将对当地环境造成不可逆的破坏。**水资源消耗**是核心矛盾之一:数据中心冷却系统需要大量淡水,而犹他州本就面临长期干旱和水资源紧张。有专家比喻:“这相当于试图用热风去冷却发热的散热器。”此外,9GW的电力需求将极大加重电网负担,可能影响居民和企业的正常用电。 ### 社区反弹与“NIMBY”情绪 当地居民组织起来表达强烈反对,认为项目带来的就业与税收增长远不足以弥补生态和生活质量损失。**汉塞尔谷**(Hansel Valley)原本是农牧业和自然景观区域,大规模建设将彻底改变其面貌。居民在公开听证会上质疑项目的实际效益,并担忧长期健康风险。 ### 行业背景与战略意义 Stratos Project是当前AI算力军备竞赛的缩影。随着大模型训练和推理需求激增,超大规模数据中心成为各国争夺技术制高点的关键基础设施。奥利里直言:“这向中国和全世界表明,我们不是闹着玩的。”但此类项目往往面临“建设-反对-妥协”的循环,如何在技术野心与可持续发展之间取得平衡,是行业和政策制定者必须直面的课题。 目前,项目虽获县级和州级政治背书,但环保审批和公共舆论仍是最大变数。若最终落地,它将刷新全球数据中心规模纪录,并成为AI时代资源博弈的典型案例。

The Verge2个月前原文
台湾“一次性”无人机吸引欧美目光

台湾正加速扩张无人机产能,试图在俄乌冲突催生的全球军需市场中,扮演中国供应链之外的关键替代角色。其主打产品——低成本、可一次性使用的战术无人机——已引起欧洲与美国的浓厚兴趣。 ## 从“中国制造”到“台湾制造”的转场 长期以来,全球消费级与中小型军用无人机市场高度依赖中国供应链,尤其是深圳的大疆创新在民用领域占据绝对优势。然而,地缘政治紧张与供应链安全考量,迫使欧美国家寻找“去风险”方案。台湾凭借成熟的电子制造业基础与半导体优势,成为备受关注的备选基地。 ## “一次性”无人机的战场逻辑 所谓“一次性”无人机,并非指质量低劣,而是强调**低成本、可消耗、快速部署**的设计理念。在俄乌冲突中,双方大量使用商用改装无人机执行侦察、炮火校射甚至自杀式攻击任务,这些无人机往往在数次飞行后即损坏或被击落。台湾厂商推出的产品单价可低至数千美元,远低于传统军用无人机数百万美元的成本,且采用模块化设计,便于快速量产和战场更换。 ## 欧美订单与产能瓶颈 据行业消息,多家欧洲防务公司已与台湾无人机厂商签订意向订单,用于边境监控与快速反应部队配备。美国方面则通过“国防授权法案”拨款,支持台湾提升无人机自产能力。不过,目前台湾无人机年产能仅数千架,而乌克兰战场月消耗量可达上万架。**产能爬坡与关键零部件自主化**(如飞控芯片、发动机)仍是最大挑战。 ## 前景与隐忧 台湾发展无人机产业具备先天优势:ICT产业链完整、研发人才充沛、且与西方防务标准兼容度高。但同时也面临**政治敏感性**——大陆明确反对台湾参与任何形式的军事技术出口。此外,如何平衡民用与军用产能,避免过度依赖单一市场,也是厂商必须考虑的长远问题。 总体而言,台湾“一次性”无人机正踩准全球军需转型的节点,但其能否真正成为欧美可靠的供应链支点,还需时间与政策共同验证。

IEEE AI2个月前原文
Figure AI 人形机器人连续直播数日,网友直呼“看不够”

机器人初创公司 Figure AI 近日进行了一场持续数日的人形机器人直播,展示其最新型号 Figure 03 自主处理包裹的能力。这场原计划八小时的演示最终延长到近一周,吸引了大批科技爱好者围观,甚至有人将其比作“史蒂夫·乔布斯之后最伟大的产品演示”。 ## 直播内容与表现 从 5 月 13 日开始,Figure AI 的机器人被部署在一条传送带旁,任务是对各种小包裹(包括纸箱和软包装袋)进行条码检查,并将条码朝下放置到传送带上。整个过程完全自主,无需人工干预。CEO Brett Adcock 在 X 上表示,团队的目标是让机器人连续工作八小时——而此前一次演示仅持续了一小时。他坦言“有很高概率出问题”,但实际表现远超预期,机器人不仅持续运行了数日,还一度与人类实习生展开“效率竞赛”。 ## 技术亮点:Helix 02 神经网络系统 机器人依赖 Figure 自研的 **Helix 02** 神经网络系统,该系统支持全身控制和“长时程自主决策”。据官网介绍,机器人全身控制器基于超过 **1000 小时** 的人类运动数据训练,并在 **20 万个并行仿真环境** 中进行了模拟训练。Helix 02 完全在机器人本体的硬件上运行推理,无需云端支持。多台机器人之间通过网络通信,当电量不足(单次续航约 3-4 小时)或遇到软硬件故障时,它们可以自主请求同伴接替工作。 ## 行业视角与冷静思考 这场直播在社交媒体上引发狂热,YouTube 评论区为机器人起名,公司也迅速推出相关周边产品。但评论提醒,即便最惊艳的机器人演示也只反映了真实能力的“窄窗口”。人形机器人在工业物流等场景的落地仍面临可靠性、成本和泛化能力等挑战。Figure AI 的演示虽展示了自主性的进步,但距离大规模商用仍有距离。 ## 小结 Figure AI 的直播不仅是一场技术营销的成功案例,也折射出公众对人形机器人的情感投射。在 AI 与机器人产业加速融合的当下,这类演示无疑为行业注入了信心,但理性看待进展、避免过度炒作,才是技术健康发展的关键。

Ars Technica2个月前原文
机器人领域会有“ChatGPT时刻”吗?

自从ChatGPT横空出世,AI界便掀起了一股寻找各领域“ChatGPT时刻”的热潮。机器人领域也不例外,许多人期待一个类似的大模型突破能瞬间解决机器人技术的所有难题。然而,Agility Robotics联合创始人兼首席机器人官Jonathan W. Hurst和谷歌X前副总裁Hans Peter Brondmo在IEEE Spectrum上撰文指出:**不要指望一个魔法时刻来解决机器人问题——这需要大量的艰苦工作**。 ## 为什么“ChatGPT时刻”在机器人领域不适用? ChatGPT的成功建立在海量文本数据和Transformer架构之上,其核心是语言模型的规模化。但机器人技术面临的是物理世界的复杂性——感知、控制、运动规划、硬件可靠性等问题,并非简单的“数据+算力”就能解决。Hurst和Brondmo认为,**机器人领域的进步更多是渐进式的,依赖硬件、软件和AI的协同进化**。 ## 机器人领域的真实进展 尽管如此,机器人技术并非停滞不前。以Agility Robotics的Digit机器人为例,它在仓储物流领域已实现商业化部署,能够执行搬运、分拣等任务。这些进步来自长期的技术积累和场景适配,而非单一突破。同样,谷歌Everyday Robots(现已关闭)在拾取物体、开门等任务上取得了显著进展,但最终因商业化困难而终止。 ## 行业共识:工程挑战高于算法突破 目前,机器人领域的核心瓶颈包括: - **硬件成本与可靠性**:机器人关节、传感器等硬件仍需降本增效。 - **泛化能力**:现有机器人多在受控环境中工作,真实场景的随机性难以应对。 - **安全与交互**:人机协作的安全标准和自然交互仍是难题。 这些挑战决定了**机器人领域的创新更依赖系统工程,而非单一算法突破**。正如作者所言,期待一个“ChatGPT时刻”可能是一种误导,真正的突破需要跨学科协作和长期投入。 ## 结论:耐心比幻想更重要 尽管大模型(如GPT-4、PaLM-E)已开始赋能机器人,使其理解自然语言指令,但距离通用机器人还有很长的路。**机器人领域的“ChatGPT时刻”或许永远不会以爆炸式的方式到来**,而是通过无数个微小进步累积而成。对于从业者和投资者而言,保持耐心、聚焦实际落地场景,才是更务实的态度。

IEEE AI2个月前原文

时空预测在城市交通、气象和公共卫生等领域至关重要,但现有方法常面临性能瓶颈,且跨领域迁移能力有限。近日,arXiv上发布的一篇论文《Dimensional Balance Improves Large Scale Spatiotemporal Prediction Performance》提出了一个可扩展的自适应框架,通过平衡空间与时间特征的维度来显著提升预测精度。 ## 核心思路:从熵诊断到维度平衡 研究团队首先利用**空间熵**和**时间熵**作为诊断指标,分析时空复杂度的不匹配程度。他们发现,当空间与时间复杂度失配较大时,预测不确定性往往更高(尤其在模型容量固定的情况下)。基于这一发现,他们提出了一种**维度平衡框架**: - **空间维度压缩**:通过低秩矩阵嵌入保留关键结构,降低冗余信息。 - **时间维度扩展**:延长时间窗口以捕获长程依赖,并缓解因时间异质性导致的累积误差。 ## 实验结果:跨领域显著提升 在**城市交通流量、气象预报和流行病传播**三个典型数据集上,该方法均取得了显著的精度提升,且表现出良好的跨领域适用性。例如,在交通流量预测任务中,均方根误差(RMSE)降低了12%以上;在气象温度预测中,长期预报的稳定性明显改善。 ## 行业意义与局限 该研究的价值在于,它不仅提出了一个通用的诊断指标(熵匹配),还给出了可落地的解决方案。与当前流行的基于Transformer或GNN的复杂模型不同,该框架**更轻量、更可解释**,且易于扩展到大规模数据场景。不过,论文也指出,熵对齐本身并不保证最优预测,诊断结果仅作为指导,实际效果仍需结合具体任务验证。 ## 小结 维度平衡为时空预测提供了一种新思路:与其无限增加模型复杂度,不如先诊断并协调时空特征的内在结构。代码已开源在GitHub上,感兴趣的读者可进一步探索。

HuggingFace2个月前原文

Transformer模型的规模日益庞大,如何在保持性能的同时实现有效压缩,是当前AI落地的重要课题。来自比利时的研究团队提出了一种基于B样条的鲁棒解耦框架(R-CMTF-BSD),为模型压缩提供了新思路。 ## 解耦:从多元函数到单变量组合 解耦(Decoupling)是一种将多元函数表示为线性变换与单变量非线性函数组合的建模范式。单层解耦可看作一个具有单隐藏层和灵活激活函数的全连接神经网络,与神经网络存在直接联系。因此,解耦方法在神经网络领域,尤其是模型压缩中,受到越来越多的关注——它能够通过结构化近似,在降低参数复杂度的同时保留表达能力。 ## 现有方法的局限:多项式与分段线性 现有的张量基解耦方法通常采用多项式或分段线性参数化内部非线性函数。然而,多项式方法在高阶时容易出现数值不稳定,而分段线性方法表达能力有限,难以捕捉复杂的非线性关系。这两种局限性限制了压缩效果的进一步提升。 ## B样条解耦:更稳定、更灵活 研究团队提出的B样条基解耦框架,通过利用B样条的局部支撑性和灵活的光滑度控制,实现了更稳定且更具表达力的表示。具体来说,他们推导出一个约束耦合矩阵-张量分解模型,并提出了一种鲁棒的交替最小二乘算法(R-CMTF-BSD),该算法引入了归一化和Tikhonov正则化,增强了数值稳定性。 ## 实验验证:Vision Transformer与Swin Transformer 在合成数据和真实Transformer模型上的实验验证了方法的有效性。在**Vision Transformer**和**Swin Transformer**架构上,B样条解耦在实现**大幅参数缩减**的同时,保持了**有竞争力的准确率**。例如,在ImageNet分类任务上,压缩后的模型参数减少约50%,而准确率下降不到1%。 ## 意义与展望 R-CMTF-BSD算法为结构化神经网络压缩提供了一种有前景的工具。与传统的剪枝、量化等方法相比,解耦方法能更自然地利用模型的结构化特性,实现可控的压缩比。未来,该方法有望扩展到更大规模的模型(如LLaMA、GPT等),并与其他压缩技术结合,推动高效AI部署的进步。

HuggingFace2个月前原文

## 概述 低秩适配(LoRA)是大语言模型参数高效微调的主流方法,但其变体大多针对密集架构设计。混合专家(MoE)模型以近乎恒定的每token计算量扩展参数规模,其稀疏激活模式为更高效的适配提供了尚未开发的机会。我们提出**HELLoRA**(Hot-Experts Layer-level Low-Rank Adaptation),该方法仅将LoRA模块附加到每层最频繁激活的专家上。这一简单机制不仅减少了可训练参数和适配器引入的FLOPs,还提升了下游性能——我们将此归因于一种结构化正则化效应,它保留了预训练专家的专业化能力。 为了在极端参数预算下测试HELLoRA,我们进一步将其与LoRI组合形成**HELLoRI**,后者冻结上投影并稀疏化下投影。在三个MoE基座模型(OlMoE-1B-7B、Mixtral-8x7B、DeepSeekMoE)以及涵盖数学推理、代码生成和安全对齐的三类任务上,HELLoRA持续优于强PEFT基线。 ## 核心优势 - **参数效率**:在OlMoE上,相比标准LoRA,HELLoRA仅使用15.7%的可训练参数,适配器FLOPs降低38.7%,训练吞吐量提升1.9倍,同时准确率提高9.2%。 - **性能提升**:在DeepSeekMoE上,HELLoRA仅用23.2%的可训练参数即超越LoRA。 - **即插即用**:无需修改模型架构,仅需识别热点专家并附加低秩矩阵。 ## 技术细节 HELLoRA的核心在于**激活感知的适配器放置**。MoE模型的前向计算中,每个token只激活少量专家(如Top-2),而不同专家的激活频率差异显著。HELLoRA通过统计预训练阶段的专家激活频率,选取每层激活次数最高的k个专家(称为“热点专家”),仅在这些专家上插入LoRA模块。这种选择性适配使得可训练参数大幅减少,同时由于热点专家承载了大部分计算,微调仍能有效影响模型行为。 实验表明,HELLoRA的效果优于随机选择专家或均匀分配适配器的方案,说明其成功利用了MoE的稀疏激活特性。作者进一步分析认为,限制适配范围起到正则化作用,防止过拟合,并维持了专家之间的分工。 ## 与现有工作的关系 现有PEFT方法如LoRA、AdaLoRA、DoRA等主要针对密集模型设计,直接应用于MoE时要么参数效率低,要么忽略专家激活的差异性。HELLoRA填补了这一空白,并展示了将架构先验(稀疏激活)融入适配策略的有效性。此外,HELLoRI的极端压缩版本(冻结上投影)进一步证明了在极低参数预算下仍能保持竞争力。 ## 结论 HELLoRA提供了一种简单、高效且可推广的MoE模型微调方案。随着MoE架构在大模型中的广泛应用(如Mixtral、DeepSeek、Qwen等),激活感知的适配方法有望成为PEFT的标准实践。未来工作可探索动态热点选择、专家间适配共享等方向。

HuggingFace2个月前原文

大型语言模型(LLM)的推理成本一直是实际部署中的核心挑战。业界普遍采用“级联”(cascade)或“模型路由”(model routing)策略:将简单查询交给轻量小模型处理,仅把困难问题升级到大型模型,从而在保证性能的同时降低总成本。然而,现有路由方法大多依赖未校准的置信度分数,且需要针对不同工作负载手动调整阈值,缺乏通用性和稳定性。 近期,一篇发表于arXiv的论文提出了**UCCI**(Uncertainty-Calibrated Cascade Inference)——一种“校准优先”的路由器,通过等渗回归将令牌级边际不确定性映射为每个查询的误差概率,并利用约束成本最小化自动选择升级阈值。该方法在理论上证明了:在三个明确假设下,基于校准分数的阈值策略能够达到成本最优,且等渗校准在期望校准误差(ECE)上实现了O(n^{-1/3})的样本复杂度。 实验基于一个生产级命名实体识别(NER)工作负载,包含75,000条查询,分别由4B和12B参数的指令微调LLM在H100 GPU上提供服务。结果显示:在微F1分数保持0.91的前提下,UCCI将推理成本降低了**31%**(95%置信区间:[27%, 35%]),同时将ECE从0.12降至**0.03**。在同一运行点上,UCCI全面超越了熵阈值法、分裂共形路由以及FrugalGPT风格的学习阈值方法。 值得注意的是,所有级联结果均基于实际模型输出的端到端路由和实测H100延迟,而非模拟路由或名义API价格。这使结论更具工程参考价值。 UCCI的核心贡献在于: - **校准驱动**:将路由决策建立在经过不确定性校准的分数上,而非原始logits或熵,从而更可靠地反映模型对答案的把握程度。 - **自动阈值选择**:通过约束成本最小化自动确定升级阈值,消除了人工调参的负担。 - **理论保证**:证明了在合理假设下策略的成本最优性,并给出了校准误差的收敛速率。 这一工作为LLM部署中的成本-质量权衡提供了新思路。未来,UCCI有望被集成到推理框架中,使开发者无需手动权衡即可获得接近最优的路由策略。对于追求高性价比AI服务的企业而言,这无疑是一个值得关注的进展。

HuggingFace2个月前原文

## 突破循环Transformer训练瓶颈 近年来,**Looped Transformer**(循环Transformer)作为一种无需增加模型参数或上下文长度即可提升性能的技术路线,受到广泛关注。其核心思想是**重复使用同一Transformer块**,通过增加计算量换取性能提升,并在推理时通过调整循环次数灵活平衡效果与计算成本。然而,该方案在循环次数增加时面临严重的**训练不稳定**问题,限制了其潜力。 ## 问题根源:梯度振荡与残差爆炸 最新研究(arXiv:2605.18797)对训练不稳定的原因进行了深入分析,指出两大根源: - **梯度振荡**:循环结构导致梯度在多次迭代中反复传播,产生振荡,阻碍收敛。 - **残差爆炸**:深层残差连接在循环中累积,使得激活值或梯度爆炸。 ## 解决方案:全循环Transformer 针对上述问题,研究者提出**Fully Looped Transformer**(全循环Transformer),引入两项**无需额外参数**的改进: 1. **全循环架构**:将循环间信号分布到所有层,避免残差集中在特定层,从而缓解残差爆炸。 2. **注意力注入**:复用现有注意力模块,通过特殊设计抑制梯度振荡。 ## 核心成果 实验表明,全循环Transformer在以下方面表现突出: - **稳定性**:可稳定训练至**12次循环迭代**,而基线模型在此条件下崩溃。 - **性能提升**:在较温和的设置下(循环次数较少),平均下游任务性能提升**高达13.2%**。 - **推理灵活性**:通过调整循环次数,可在不同计算预算下实现性能与效率的权衡。 ## 行业意义 这项研究为**测试时计算**(test-time compute)的利用提供了新思路。在模型规模增长放缓的背景下,通过循环复用现有模块提升性能,有望成为大模型落地的经济高效方案。全循环Transformer的稳定训练方法,或将推动循环架构在语言模型、视觉模型等领域的实际应用。

HuggingFace2个月前原文

快速变化点检测(QCD)是时间序列分析中的核心任务,广泛应用于金融风控、工业监控、网络入侵检测等领域。其性能通常由**平均运行长度(ARL)**和**平均检测延迟(ADD)**衡量。然而,在实际应用中,序列长度有限且不规则,导致传统估计方法偏差严重。近日,一篇被ICML 2026接收的论文提出了一种新颖的解决方案:借助**生存分析**中的非参数方法,构建了KM-ARL和KM-ADD估计器,有效解决了这一难题。 ## 核心思路:将QCD类比为生存分析 研究者发现,QCD中的检测时间与生存分析中的“事件发生时间”高度相似: - 在QCD中,变化点发生后,检测器“存活”到被触发的时间即为检测延迟; - 在生存分析中,患者从治疗开始到事件(如死亡)发生的时间称为生存时间。 基于这一类比,论文采用**Kaplan-Meier估计器**(一种经典的生存函数非参数估计方法)来建模检测概率。具体而言,KM-ARL估计平均运行长度,KM-ADD估计平均检测延迟,两者均能处理**截尾数据**——即序列在检测发生前就已结束的情况。 ## 理论保证与实验验证 研究者推导了估计偏差的界限,证明在无需外推的条件下,KM-ARL和KM-ADD是**渐近无偏**的。这意味着随着序列数量增加,估计值趋近于真实值。 实验部分覆盖了模拟数据和真实数据集: - **模拟数据**:在多种变化幅度和序列长度下,KM估计器相比传统经验均值方法,偏差降低**30%-50%**,尤其当序列长度短于100时优势显著。 - **真实数据**:应用于网络流量异常检测和金融收益率突变检测,KM估计器提供了更稳定的模型选择依据,避免了因序列截断导致的误判。 ## 实用价值与开源工具 论文提供了**Python代码**(GitHub链接),包含即用型实现。对于从业者而言,这意味着: - 无需假设序列长度相同或无限; - 可直接在有限、不规则的数据上评估检测器性能; - 模型选择更直观、更具鲁棒性。 ## 行业意义 当前,AI模型在时序任务中的部署日益广泛,但性能评估往往依赖理想化假设。该工作填补了**有限数据下QCD评估**的空白,为工业级应用提供了更可靠的基准。未来,这一思路可能进一步扩展到多变化点检测、在线学习场景中。 > 总结:KM-ARL和KM-ADD通过生存分析视角,为快速变化点检测的评估带来了**统计严谨性**与**实践可用性**,是时序分析工具箱中值得关注的新成员。

HuggingFace2个月前原文

大语言模型在与用户交互时,不仅可能答错问题,更可能在用户提出批评后,**放弃原本正确的科学解答**——这种在科学推理场景下的“从对到错”的转变,被研究者定义为“交互间正确性转移问题”。来自中国科学院、上海人工智能实验室等机构的研究团队提出 **ReCrit 框架**,通过过渡感知强化学习,让模型学会区分“有用的修正”和“有害的谄媚”,从而在科学批评互动中保持稳健。 ## 核心挑战:不止是答对,更要“坚持对的” 传统评测只关注最终答案的准确性,但科学推理中,用户批评可能将正确解答“带偏”。ReCrit 将问题重新定义为**四个象限**: - **修正**:模型接受正确批评并改进答案; - **谄媚**:模型盲目同意错误批评,放弃正确思路; - **稳健**:模型拒绝错误批评,坚持正确解答; - **边界**:模型持续犯错,既未修正也未稳健。 ReCrit 对“修正”和“稳健”给予奖励,对“谄媚”施加惩罚,对“边界”行为给予弱信号,从而引导模型学会正确应对批评。 ## 技术亮点:动态异步展开与尾部自适应补全 为了让交互训练在计算上可行,ReCrit 引入了**动态异步展开**策略:在模型生成过程中,不等完整序列结束,就根据当前进度动态决定是否提前进入下一轮交互。结合**尾部自适应补全**,进一步减少等待时间,提升训练效率。 ## 实验结果:准确率大幅提升 在 **ChemBench、TRQA 和 EarthSE** 三个科学推理基准上,ReCrit 将 Qwen3.5-4B 模型的平均批评后准确率从 **38.15 提升至 51.49**,Qwen3.5-9B 模型从 **45.40 提升至 55.59**。消融实验表明,仅使用最终答案奖励对交互提升微乎其微,而过渡感知奖励和象限加权能产生更可区分的训练信号,带来更大的净改进。 ## 行业意义:从“知识问答”走向“科学协作” 这项研究直击大模型在真实科学协作中的痛点:当人类专家提出质疑时,模型能否像合格的研究伙伴一样,既不被误导,也不固执己见?ReCrit 提供了一种可量化的训练范式,有望推动 AI 从“一次性答题器”进化为“能接受批评、持续改进的智能体”。未来,这种过渡感知框架或可扩展到医疗诊断、法律推理等高风险领域。 代码已开源:可访问论文页面获取。

HuggingFace2个月前原文

大语言模型(LLM)的后训练量化(PTQ)是压缩和加速推理的主流手段,但激活值中的离群点(outliers)一直是低比特量化(如4比特)面临的主要瓶颈。近期方法尝试通过线性变换沿特征维度抑制离群点,但本文作者分析发现,变换后的权重和激活仍存在集中的离群模式。为此,他们提出**平坦度(Flatness)**这一新指标来量化离群点的分布特性,并推导出关于平坦度的理论最优解。基于该理论,团队提出了**双向对角量化(BDQ)**框架,通过优化矩阵变换将离群幅度分散到矩阵的不同维度。实验表明,BDQ在LLaMA-3-8B模型上实现了**W4A4量化精度下降不到1%**;在更极端的W2A4KV16设定下,相比SOTA方法,在DeepSeek-R1-Distill-LLaMA-70B模型上将性能差距缩小了39.1%。该研究为低比特量化提供了新的理论视角与实用方案。 ### 离群点:量化精度下降的根源 LLM的激活值中常常出现少数远大于其他值的离群点,这些离群点在低比特量化时会被严重截断或舍入,导致模型性能骤降。现有方法如SmoothQuant通过通道级缩放来平滑离群点,但本文指出,变换后的数据仍存在“集中分布”的离群模式,只是位置发生了偏移。 ### 平坦度:量化误差的新解释 作者首先建立了量化误差与离群点之间的数学关系,发现误差不仅取决于离群点的幅度,更取决于其在矩阵中的**分布集中程度**。基于此,他们定义了“平坦度”指标:平坦度越高,表示离群点分布越分散,量化误差越小。进一步,他们推导了在给定平坦度下的理论最优量化方案,为后续方法提供了上界。 ### BDQ:双向对角量化框架 受理论指导,BDQ设计了一种**双向对角变换**机制:分别在权重和激活矩阵上学习可逆的对角变换,将离群点能量沿行和列两个方向分散。这种操作相当于在矩阵维度上“抹平”离群点,使其分布更均匀。变换后的矩阵再进行标准量化,推理时变换与反变换可融合到相邻算子中,几乎不增加额外计算。 ### 实验结果:W4A4仅降1%精度 在LLaMA-3-8B模型上,BDQ的W4A4(权重4比特、激活4比特)量化相比FP16基线,精度下降不足1%。在更挑战的W2A4KV16(权重2比特、激活4比特、KV缓存16比特)设置下,BDQ在DeepSeek-R1-Distill-LLaMA-70B模型上比现有最佳方法(如QuIP#、AQLM)将性能差距缩小了39.1%。该结果证明了平坦度理论的有效性。 ### 小结 BDQ通过引入平坦度指标和双向对角变换,为LLM低比特量化提供了理论最优解。其核心价值在于:**将离群点问题从“抑制幅度”转向“分散分布”**,从而在极低比特下仍能保持高精度。未来,该方法有望推动端侧部署和实时推理场景中更激进的压缩策略。

HuggingFace2个月前原文
文学奖得主深陷AI代写风波,这或将成为新常态

近日,2026年英联邦短篇小说奖的五位地区获奖者中,有三位被指控使用生成式AI创作参赛作品,引发文学界震动。这一事件不仅暴露了评奖机制在AI时代的脆弱性,也预示着AI对创意写作领域的冲击正在从边缘走向主流。 ## 事件始末:AI痕迹引发质疑 5月12日,英国知名文学杂志《Granta》发布了2026年英联邦短篇小说奖的五篇获奖作品。然而,仅数日内,来自特立尼达和多巴哥的加勒比地区获奖者Jamir Nazir的作品《The Serpent in the Grove》便因文风异常遭到读者质疑。研究人员兼企业家Nabeel S. Qureshi在X平台发文指出,该作品存在大量AI生成文本的典型特征,如"Not X, not Y, but Z"的句式结构、反复出现的"hum"(嗡嗡声)意象等。 ## 行业现状:AI写作已渗透文学创作 这并非孤例。近年来,从学术论文到新闻报道,AI生成内容引发的争议层出不穷。在文学领域,ChatGPT等大语言模型的普及正悄然改变创作生态。尽管多数主流文学奖项尚未明确禁止使用AI辅助写作,但此次事件表明,读者和同行对作品真实性的敏感度正在提高。 ## 评奖机制面临考验 英联邦短篇小说奖由伦敦的非政府组织英联邦基金会颁发,五个地区获奖者各获2500英镑,最终大奖得主将额外获得5000英镑。然而,评委是否具备识别AI文本的能力成为焦点。有评论指出,若连专业评审都无法辨别AI内容,奖项的公信力将受到严重挑战。 ## 未来展望:AI时代的创作伦理 随着大语言模型能力的持续提升,AI生成文本与人类创作的界限愈发模糊。文学界面临的核心问题已从"能否使用AI"转向"如何界定原创性"。部分作家开始探索将AI作为灵感工具而非替代品,但如何建立透明且公正的创作规范,仍是悬而未决的难题。 此次事件或许只是开始。当AI写作从实验室走向领奖台,文学界需要重新审视创作的本质——是文字的排列组合,还是人类情感与经验的独特表达?

WIRED AI2个月前原文