SheepNav

AI 资讯

每日聚合最新人工智能动态

大语言模型(LLM)智能体正越来越多地通过演化自然语言构件(如反思、工作流、剧本、备忘单或优化提示)来提升性能,而无需更新模型权重。这类方法通常只在单个基准上报告成功。一篇新论文《Recursive Self-Evolving Agents via Held-Out Selection》对此进行了公平对比,并揭示了更清晰的图景。 ## 核心方法:RSEA 研究者提出**RSEA(递归自进化智能体)**,它维护一个紧凑的三层自然语言状态:**策略**(命令式)、**技能**(可重用)和**剧本**(程序化)。在每一代演化中,RSEA根据自身轨迹重写所有三层,并仅当候选版本在**留出数据**上不退化时才提交,采用严格的“保留更好”门控。 ## 主要发现 论文在四个多样化基准(**ALFWorld**、**GAIA**、**τ-bench**、**WebShop**)上,与六个忠实基线(ReAct、Reflexion、GEPA、AWM、ACE、Dynamic Cheatsheet)进行对比,所有方法使用同一本地骨干模型,得出三个主要结论: 1. **没有通用最优构件**。RSEA在ALFWorld上是单次方法中最强的,达到**69.3%**(ReAct为64.6%,McNemar检验p=0.015),配合重试后达到**79.4%**,为整体最佳。然而,在强骨干工具使用任务上,**AWM**(具体工作流归纳)表现最佳。 2. **无门控的上下文演化高风险且不安全**。**Dynamic Cheatsheet**在线整理上下文但无留出门控,在ALFWorld上接近最佳(70.7%),但在WebShop上崩溃,得分**0.14**(ReAct为0.43)。 3. **严格留出选择是RSEA单调安全的关键**:RSEA在所有基准上从未显著低于基础智能体,当演化上下文可能有害时,它会回退到标准ReAct。 ## 行业意义 这项研究揭示了LLM智能体自演化领域的关键挑战:**性能提升的不可靠性和退化风险**。RSEA通过留出验证提供了安全网,但同时也表明不同任务需要不同的演化策略。对于AI从业者,这意味着在部署自演化智能体时,必须引入严格的验证机制,而非盲目信任单一代际的改进。 论文还强调了**公平比较**的重要性:许多方法在单一基准上宣称成功,但跨任务评估后优势消失。未来,社区需要更系统的基准和验证协议,以确保智能体演化技术的可靠落地。

Anthropic25天前原文

单细胞RNA测序(scRNA-seq)聚类是识别细胞类型的关键技术,但高维度、稀疏性、数据缺失及技术噪声等问题,使得稳健的基因表达表征和细胞图构建面临巨大挑战。现有方法中,掩码自编码器主要依赖表达恢复进行特征重建,而图聚类方法通常使用固定的KNN图,未能将恢复后的表达信息反馈到图优化中。针对这一痛点,来自中国的研究团队提出了一种名为 **scKDGM** 的新型框架,将 **KAN(Kolmogorov-Arnold Network)** 与动态图掩码学习相结合,显著提升了scRNA-seq聚类性能。 ## 核心创新:四步协同机制 scKDGM 的核心设计包含四个环环相扣的模块: 1. **GDP-Mask(图感知分布保持基因掩码)**:该模块通过扰动细胞身份信息,在保留数据分布特征的同时生成掩码视图,为后续学习提供高质量的监督信号。 2. **KAN驱动的TAKGCN编码器**:引入KAN网络替代传统多层感知机,增强模型对非线性关系的建模能力,从而从掩码视图中提取更鲁棒的细胞表征。 3. **掩码引导的表达恢复与动态图构建**:利用恢复后的表达信息动态更新细胞间拓扑结构,打破传统固定KNN图的局限性,使图结构随学习过程持续优化。 4. **跨视图对比学习**:将表达恢复信号传递至图拓扑更新中,通过对比学习对齐不同视图的表征,进一步提升聚类一致性。 此外,模型还引入了 **ZINB损失函数**,专门用于处理scRNA-seq数据中常见的过度离散和零膨胀问题,使重建过程更符合数据生成机制。 ## 性能表现:全面超越10个基线方法 研究团队在 **12个真实scRNA-seq数据集** 上进行了系统评估,对比了包括传统聚类方法、深度聚类方法及图神经网络方法在内的10种基线模型。结果显示,scKDGM在 **平均NMI(归一化互信息)** 和 **平均ARI(调整兰德指数)** 两项关键指标上均取得最优结果,尤其在数据噪声大、细胞类型不平衡的场景下优势更为明显。 ## 行业意义:AI驱动单细胞分析的新范式 scKDGM的提出不仅解决了scRNA-seq聚类中图结构静态化的问题,更展示了 **KAN网络在生物信息学中的巨大潜力**。KAN通过可学习的激活函数替代固定激活函数,理论上能以更少的参数捕获更复杂的特征交互,这对于高维、稀疏的基因表达数据尤为适用。 该框架的“动态图+掩码学习”思路也为其他单细胞分析任务(如批次校正、轨迹推断)提供了可借鉴的范式。随着单细胞测序技术向大规模、多模态方向演进,scKDGM这类兼具鲁棒性与可解释性的AI工具,将加速细胞图谱构建和疾病机制研究。 ## 局限与展望 尽管实验结果亮眼,论文也指出当前模型在超大规模数据集(百万级细胞)上的计算效率仍有优化空间。未来工作可能聚焦于: - 结合图稀疏化技术降低内存开销; - 将框架扩展至多模态单细胞数据(如同时整合转录组与染色质可及性数据)。 scKDGM已在arXiv公开,代码预计后续发布。对于从事单细胞分析的研究者而言,这无疑是一个值得关注的新工具。

HuggingFace25天前原文

一年前被Wix以8000万美元收购的Vibe Coding平台Base44,最近开始推出自己的AI模型。这一动作背后,是AI行业对“基于他人模型构建的业务是否具有持久防御性”这一核心问题的激烈讨论。 Base44创始人Maor Shlomo表示,自研模型能让平台在延迟、成本和效率上获得更多优化。目前,该模型名为Base1,基于平台上“数千万次真实用户交互”生成的数据集训练而成。Shlomo认为,随着规模扩大,其他主要玩家也必然会走上自研模型之路。 从竞争格局看,Base44不仅要面对Lovable等同类初创公司,还要警惕Anthropic、xAI等前沿AI实验室的逼近——Cursor、Claude Code等工具正在侵入同一领域。Shlomo相信,专业化是Base44的胜算所在:“模型在进步,但它们会保持通用性。”不过,风投机构Headline的合伙人Jonathan Userovici提醒,不要低估前沿模型的能力。 这场“护城河”之争的核心在于数据、分发和技术栈三大要素。Base44拥有来自真实用户交互的独特数据,这是其差异化优势。然而,随着竞争加剧,所有玩家都在加速积累数据,最终胜负可能取决于谁能更快地形成数据飞轮。 ## 关键启示 - **自研模型趋势**:越来越多的AI应用层公司开始自研模型,以降低对外部模型的依赖,提升防御性。 - **数据是核心资产**:真实用户交互数据成为训练专用模型的宝贵资源,但数据的持续增长是保持优势的前提。 - **竞争多维化**:Base44不仅要应对同类平台,还要警惕前沿AI实验室的“降维打击”,后者拥有更强大的通用模型和更广泛的用户基础。

TechCrunch25天前原文

OpenAI 今日正式发布 **GeneBench-Pro**,一个面向计算生物学领域、专为评估 AI 系统在真实科研场景中高阶判断能力而设计的基准测试。该基准在原有 GeneBench 基础上大幅升级,覆盖基因组学、定量生物学与转化医学中更具挑战性的任务,旨在衡量模型处理模糊性、迭代修正分析路径以及做出关键科研决策的能力。 ## 为何需要新的基准? 科研数据很少自带“说明书”。研究人员必须自行判断:某个模式是生物学信号还是噪声?现有数据能否支撑待解答的问题?每一个结果又该如何指导下一步行动?尽管当前 AI 模型已能熟练执行复杂的数据分析流程,但真实的科学研究还依赖于更高层次的判断——这正是 GeneBench-Pro 试图量化的核心能力。 OpenAI 指出,此前业界缺乏令人信服的评估手段来衡量这类“系统性判断”,包括处理歧义、修正假设、选择正确分析路径,以及判断结果是否已具备决策条件。这些能力难以形式化,因此也难以严格评估,但恰恰成为制约 AI 在科研领域整体表现的关键瓶颈。 ## “科研品味”的可量化评估 GeneBench-Pro 引入了一个独特概念——**“科研品味”**(research taste),将其定义为塑造整个分析过程的判断链条:数据能回答哪些问题?早期诊断结果应如何改变模型或估计目标?初始计划何时需要修订? 每个问题都会提供给模型一个真实且杂乱的数据集、简要的实验背景,以及一个与下游决策直接关联的目标估计量。模型必须主动探索数据、选择恰当的分析方法、进行迭代实验,并最终给出答案——整个过程模拟了科研中从数据到结论的完整推理路径。 ## 数据构造与行业背景 在生物学领域,数据生成成本(如基因组测序)已大幅下降。一些研究人员甚至认为,当前科研的瓶颈已不再是样本采集,而是下游分析。GeneBench-Pro 正是为应对这一转变而设计——它要求 AI 不仅要会“跑流程”,更要会“做判断”。 该基准的推出,标志着 AI 在科学发现领域的评估标准从“能否执行任务”向“能否像科学家一样思考”迈进。对于从事计算生物学、精准医学以及 AI for Science 的团队而言,GeneBench-Pro 提供了一套可复用的、高难度的能力检验框架。 ## 影响与展望 GeneBench-Pro 的发布不仅为模型开发者提供了更清晰的优化方向,也为科研社区如何信任和使用 AI 辅助工具设立了新的标尺。未来,具备高阶判断能力的 AI 有望在药物发现、基因功能解读、疾病机制探索等场景中发挥更大价值。 论文已同步公开,详细介绍了基准设计、数据集构建与评估方法。

OpenAI25天前原文

## 核心转储流行病学:修复一个18年的老Bug OpenAI 的工程师最近通过大规模核心转储(core dump)分析,成功定位并修复了其数据基础设施中两个看似不可能的错误——其中一个竟然是来自底层库 **GNU libunwind** 中潜伏了 **18年** 的竞态条件。 ### 奇怪的崩溃现象 故事始于 OpenAI 的 **Rockset** 服务(ChatGPT 数据基础设施的关键组件)出现一系列崩溃。崩溃表现为:一个正常的 C++ 函数执行完毕后,返回到一个无效地址,导致程序被内核终止。有时返回地址是 NULL,有时栈指针寄存器 `%rsp` 莫名其妙地偏移了 8 字节。这些异常模式在常规应用代码中几乎不可能出现。 团队尝试了所有常规调试手段,甚至借助 ChatGPT 分析,但每个假设都被证据推翻。这个 Bug 看起来“不可能”。 ### 流行病学方法 传统调试依赖对少数核心转储的深入检查,但面对这种罕见且诡异的崩溃,团队改变了策略——**像流行病学家一样思考**。他们收集了所有崩溃的核心转储,构建了一个高质量的全量数据集,从统计模式中寻找线索。 通过大规模分析,他们发现崩溃其实源于两个完全独立的问题,只是恰好在同一时间被发现: 1. **硬件故障**:某个 Azure 主机上的 CPU 存在静默计算错误,导致指令执行异常。 2. **软件 Bug**:GNU libunwind 中一个存在了 18 年的竞态条件。该库用于栈回溯,在特定并发场景下会破坏栈帧,导致返回地址被覆盖。 ### 修复与启示 硬件问题通过更换主机解决;软件 Bug 则提交了补丁给上游社区。这个案例展示了**大规模崩溃数据分析**在定位极低概率 Bug 上的威力——当单点检查失效时,全量统计能揭示隐藏的规律。 OpenAI 的工程师强调,随着 AI 系统对底层基础设施依赖加深,**C++ 的内存安全问题**与**硬件可靠性**将成为持续挑战。而“核心转储流行病学”这种跨领域方法,或许会成为未来大型系统调试的标配。

OpenAI25天前原文

2026年6月30日,OpenAI发布了Genebench-Pro基准测试的详细案例研究,揭示了10个具有代表性的问题及其背后的数据集与支撑材料。这些案例覆盖了从体细胞肿瘤学到药物基因组学等关键领域,旨在评估AI模型在复杂生物医学推理任务中的表现。 ## 案例一:体细胞肿瘤学中的结构变异引导治疗决策 第一个案例聚焦于**结构变异驱动的肿瘤靶向治疗**。模型需要基于长读长测序、基因表达、肿瘤质量和药物基因组学证据,判断一个合成的TXR1导向抑制剂在特定肿瘤亚群中的临床效用。任务要求模型估算治疗获益、毒性风险,并计算净临床效用值,最终以JSON格式输出决策代码和推理过程。 该案例强调**多模态数据整合与因果推断**——模型必须从分散的证据中恢复靶点激活状态,再评估治疗干预的边际效应。这不仅是数值计算,更考验模型的**分析推理质量**。 ## 基准设计的深层意图 Genebench-Pro的设计体现了对AI能力的更高要求: - **数据复杂性**:每个问题都附带真实实验数据,包括患者ID、基因组变异、表达谱等,要求模型具备处理异构数据的能力。 - **推理透明度**:模型不仅需要给出答案,还必须提供详细的推理过程(如方法描述与质量控制),以评估其逻辑严谨性。 - **领域特异性**:问题涉及合成生物学标记(如TXR1、DLR1),模拟了真实研究中因隐私或专利原因而脱敏的数据场景。 ## 行业意义与启示 此次发布的案例研究对AI在精准医学中的应用具有重要参考价值: 1. **从预测到决策**:Genebench-Pro超越了简单的分类或回归任务,要求模型在不确定条件下做出治疗决策,这与临床实践中“权衡获益与风险”的思维高度一致。 2. **基准的实用性**:通过公开提示词与数据集,研究社区可以复现、验证并改进模型的表现,推动可重复性AI的发展。 3. **人机协作的边界**:尽管AI在数据整合方面展现出潜力,但案例中明确的“不尝试走捷径”的指令表明,当前模型仍需在推理质量上追赶人类专家。 ## 小结 Genebench-Pro的案例研究不仅是一次技术展示,更是对AI生物医学推理能力的一次“压力测试”。它揭示了当前模型的优势与局限,为未来研究方向提供了清晰的路标。随着更多案例的发布,我们有望看到AI在基因组学、药物研发和个性化治疗中扮演更核心的角色。

OpenAI25天前原文
Meta承包商伪装成青少年,测试竞品聊天机器人如何回应自杀、性与毒品问题

根据WIRED获取的内部文件和知情人士透露,数百名为Meta工作的承包商被指示伪装成未成年人,测试竞品聊天机器人(包括ChatGPT、Gemini和Character.AI)对自杀、性、饮食失调等高危话题的回应。该项目由Meta的承包商Covalen管理,内部代号“Cannes”,最近一次活动在4月21日。承包商创建了虚构的18岁以下账户,向竞品聊天机器人发送文字提示和图片(包括药丸、刀具、绞索等),并将回复复制到电子表格中。2025年8月完成的一轮测试共发送了超过4.5万个提示。测试对象公司对此不知情。WIRED审查的电子表格显示,有3748条提示记录,其中数百条涉及自杀和自残,数百条讨论饮食失调,至少239条涉及性。许多提示以危机中的儿童或青少年口吻编写,例如13岁怀孕女孩询问如何购买堕胎药,五年级学生求助同学持枪问题等。

WIRED AI25天前原文
韩国豪掷1万亿美元:加码存储芯片与类人机器人,目标2028年商用

韩国政府与三星、SK海力士、现代汽车等巨头宣布,将共同投资约**1万亿美元**,用于三大旗舰项目:**存储芯片扩产**、**AI数据中心建设**以及**类人机器人商业化**。其中,三星和SK海力士承诺投入**5850亿美元**,在西南省份及首尔首都圈新建芯片工厂,目标五年内将DRAM产量翻倍。现代汽车则计划通过其子公司波士顿动力,在2028年前实现类人机器人在汽车工厂等场景的规模部署。韩国总统李在明在电视讲话中强调:“半导体、物理AI和AI数据中心是实现飞跃的三轴。”然而,巨额投资背后也伴随着争议:AI芯片需求暴涨让韩国芯片企业利润创纪录,引发关于财富分配的讨论;同时,工会对机器人进入劳动力市场表示担忧。新晶圆厂的建设周期可能长达九年,短期内全球存储芯片高价局面或难缓解。

Ars Technica25天前原文

谷歌宣布,其Gemini应用的个性化AI图像生成功能(由Nano Banana驱动)现已向符合条件的美国免费用户开放。此前,该功能仅限Plus、Pro和Ultra订阅用户使用。用户无需在提示中详细说明偏好,Gemini即可通过连接Google账户数据(如Gmail、Google Photos、YouTube和搜索记录)自动生成反映个人兴趣的图像。例如,只需说“为我和我喜欢的东西创建一幅插图”,Gemini便能理解你对咖啡、烘焙等爱好的偏好。该功能还能直接从Google Photos中提取用户照片,无需手动上传。 个性化智能功能于今年3月向美国用户全面推出,近期已扩展至印度和日本。这是一项可选功能,用户可自主决定Gemini访问哪些应用。启用后,该功能会默认应用于每个提示,但用户可通过工具菜单中的新开关随时关闭。 此外,谷歌上月宣布了Gemini的多项更新,包括“每日简报”、全新界面、AI视频模型Gemini Omni以及个人AI代理Gemini Spark。值得关注的是,Gemini的月活跃用户已突破7.5亿,巩固了其在AI领域的重要地位。

TechCrunch25天前原文

移动电站通常被视为应急或户外场景的“救火队员”,只在停电或露营时才搬出来使用。但作者提出了一种更聪明的用法:**将电站当作不间断电源(UPS)**,让三样关键设备永久保持连接。这样既能避免临时抓瞎,又能让电站的日常利用率翻倍。 ## 为什么是这三样设备? 作者长期在电站上插着以下三类设备: - **网络设备(路由器/光猫)**:家庭网络的中枢。一旦断电,网络立即中断,即便手机有信号也无法远程办公或联系家人。将光猫和路由器接入电站,即使在停电的几小时内,依然能保持联网,对居家办公或应急通讯至关重要。 - **安防摄像头/监控系统**:许多现代安防设备依赖Wi-Fi和电力。停电时若摄像头离线,房屋安全便出现盲区。通过电站持续供电,摄像头可以继续录制并上传云端,即便主电源中断,也能记录关键证据。 - **冰箱/小型冷藏设备**:食物变质是最直接的损失。一台中等功率的冰箱启动电流较大,但现代电站的峰值功率足以支撑短暂供电。作者推荐将冰箱接入电站,在停电时自动切换,避免频繁开关门造成冷气流失,从而延长保鲜时间。 ## 日常使用的隐性优势 除了应急,这种“一直插着”的策略还有几个平时不易察觉的好处: 1. **电池健康管理**:电站长期处于满电状态反而会加速电池老化。让设备持续从电站取电,电站会进入“充放循环”,保持电芯活性,延长整体寿命。 2. **自动切换无感**:当市电正常时,电站处于待机或旁路模式;一旦断电,切换时间通常在10-20毫秒内,设备几乎不会重启。这比临时搬出电站、手动接线要可靠得多。 3. **养成“随时可用”的习惯**:如果电站只在需要时才拿出来,很可能发现电量不足、接口不对或线缆丢失。永久连接后,电站始终处于可调用状态,任何突发情况都能立即响应。 ## 实现方法与注意事项 要实现这种“UPS化”的用法,作者建议: - 选择支持**不间断供电(UPS模式)**的电站,部分高端型号已内置此功能。 - 将电站放置在通风良好、远离潮湿的位置,避免长期满载运行。 - 定期检查电站的电量和设备连接状态,确保没有过载。 对于大多数家庭来说,一台容量在500Wh至1000Wh的电站足以支撑上述三样设备运行数小时。如果家里有医疗设备或服务器,可能需要更大容量或支持太阳能扩展的型号。 ## 小结 移动电站不应只是“应急箱”,而应成为家庭能源管理的常驻成员。通过将路由器、安防摄像头和冰箱永久接入,你不仅能在停电时保持网络与安全,还能延长电站寿命、避免临时手忙脚乱。这种“日常应急两不误”的思路,值得每一户拥有电站的家庭尝试。

ZDNet AI25天前原文

流媒体音乐平台 Tidal 近日公布了针对 AI 生成音乐的新政策,核心思路是:**不封杀,但也不买单**。从 6 月 29 日起,任何被识别为 100% AI 生成的曲目将不再具备产生版税的能力;而从 7 月 15 日开始,这类曲目还会被打上专属图标,让听众一目了然。Tidal 表示,此举旨在“保护艺术家”和“告知听众”,确保版税流向由真人创作、编写和表演的原创作品。 ### 识别与标注:从“完全”到“实质” Tidal 并未透露其识别 AI 音乐的具体技术手段,但明确表示,随着检测工具的持续改进,未来计划将标注范围从“完全 AI 生成”扩展至“**实质 AI 生成**”的内容。此外,平台强调内容发行商也有义务主动标注 AI 生成音乐,Tidal 将“开始执行”这一期望。 ### 反欺诈与合规行动 从 7 月中旬起,Tidal 还将移除或屏蔽“与欺诈活动相关的 AI 生成音乐”,具体包括: - 旨在欺骗听众或干扰真实艺术家的音乐 - 高频率批量上传 - 异常的流媒体播放行为 这些措施旨在遏制利用 AI 工具“**剥削个人或群体的音乐、姓名或肖像**”的行为,维护平台生态的健康。 ### 行业背景:AI 音乐治理的十字路口 Tidal 并非第一个对 AI 音乐出手的主流平台。今年 4 月,Spotify 已推出艺术家验证计划,为经确认的真实音乐人发放绿色勾选标记。但 Tidal 的“去版税化”策略更为激进——它直接切断了 AI 生成内容的收入来源,用经济杠杆而非单纯的技术标签来引导创作方向。 这一做法折射出音乐行业在 AI 浪潮中的深层焦虑:一方面,AI 工具让音乐创作门槛大幅降低,大量低成本、高数量的合成内容涌入平台,稀释了真实艺术家的曝光和收益;另一方面,完全封禁可能误伤合理使用 AI 辅助的创作(如人机协作作品),且技术检测本身存在不确定性。Tidal 选择了一条折中路线:**允许存在,但剥夺其商业价值**。 ### 小结 Tidal 的新政策本质上是在版税分配与内容多样性之间寻找平衡。通过“标注+去收益化”的组合拳,平台既保留了 AI 音乐的展示空间,又向市场释放了明确信号:**只有人的创造性劳动才能获得直接经济回报**。未来,随着检测技术成熟,这一模式或将成为流媒体行业应对 AI 内容的参考范本。

The Verge25天前原文

作为一名长期iPhone用户,电池老化是不可避免的。我的**iPhone 14 Pro**使用三年后,电池最大容量降至**72%**,日常续航严重缩水。在撰写一篇电池技巧文章时,我意识到问题严重性,于是决定前往Apple Store更换电池。 ## 诊断:电池健康一目了然 通过 **设置 > 电池 > 电池健康与充电**,可以清晰看到电池最大容量。苹果会给出“电池严重退化”的提示,并指导用户预约服务。我的手机在2026年4月显示容量仅72%,意味着即使显示充满,实际可用电量也大打折扣。 ## 更换体验:惊喜与教训 预约流程简单,通过设置即可完成。更换后,电池容量恢复至**100%**,手机重新变得流畅耐用,甚至打消了我原本计划升级iPhone 18的念头。这次经历让我意识到:**更换电池是延长手机寿命最经济有效的方式**,而非直接换新机。 ## 关键建议 - 定期检查电池健康,低于80%即可考虑更换。 - 苹果官方更换服务可靠,且能保留原有设备。 - 不要忽视电池退化对日常使用的影响,及时处理可避免携带充电宝的负担。 总之,一次简单的电池更换,让我的iPhone重获新生,也省下了一笔换机费用。

ZDNet AI25天前原文

OpenAI 正在为其 AI 编程工具 **Codex** 推出一款专用硬件设备,计划于 **7 月 15 日** 正式发布。周一发布在 X 平台上的预告视频展示了一个方形设备,上面带有多个按钮,并配文:“你最爱的 Codex 快捷键即将升级。” 这款设备并非传闻中与苹果前设计师 Jony Ive 合作的神秘 AI 硬件,而是与 **Work Louder** 联合打造。Work Louder 是一家以机械键盘和可编程宏键盘闻名的公司,其产品支持用户自定义按键、旋钮和开关的映射功能。从预告片的轮廓来看,该设备与 Work Louder 的 **Creator Micro 2** 宏键盘非常相似——后者配备 13 个机械开关、一个摇杆和一个触摸传感器,用户可在不同应用(如 Photoshop)中为这些开关分配快捷操作。 这并非 Work Louder 首次与科技公司合作推出定制硬件。此前,设计软件 **Figma** 就曾与 Work Louder 合作,发布了一款预配置快捷键的宏键盘。OpenAI 与 Work Louder 的此次合作,显然旨在为 Codex 用户提供更高效、更直观的交互方式。 目前,OpenAI 和 Work Louder 均未透露更多细节,但距离发布仅剩两周,更多信息即将揭晓。对于开发者而言,这款专属硬件可能意味着更流畅的 AI 辅助编程体验——例如一键触发代码补全、重构或调试功能。 值得注意的是,这款设备与 OpenAI 正在开发的、与 Jony Ive 合作的“神秘 AI 设备”并非同一产品。后者仍处于传闻阶段,定位可能是更通用的消费级 AI 硬件。而此次的 Codex 硬件则专注于提升专业开发者的生产力,反映了 OpenAI 在垂直工具领域深化布局的意图。

The Verge25天前原文

在数据驱动的商业环境中,BI(商业智能)资产如仪表板、分析、数据集和数据源是企业决策的核心。Amazon Quick Sight 作为 Amazon Quick 中的 AI 驱动 BI 功能,支持自然语言查询和嵌入式分析,其资产的安全至关重要。本文介绍如何利用 **AssetsAsBundle API** 实施备份策略,防止意外删除、修改或区域中断。 ## 为什么需要备份? 在金融、医疗、能源等高度监管行业,备份策略尤为关键: - **防止数据丢失**:抵御人为错误、误删或勒索软件攻击。 - **满足恢复目标**:帮助实现恢复点目标(RPO)和恢复时间目标(RTO)。 - **审计与报告**:跟踪资产生命周期(创建、更新、删除)。 - **提高工作负载弹性**:快速恢复系统,减少停机时间,符合 AWS Well-Architected Framework 的可靠性支柱。 - **灾难恢复准备**:为业务连续性计划(BCP)奠定基础。 ## 备份策略的核心步骤 1. **资产选择**:确定需要备份的 BI 资产类型,如仪表板、数据集等。 2. **使用 AssetsAsBundle API**:通过 API 将资产导出为可恢复的捆绑包。API 提供灵活的资产选择,支持细粒度控制。 3. **自动化工具**:本文提供示例代码,帮助快速启动备份流程。该工具可定期执行备份,并将资产存储在 Amazon S3 或其他持久化存储中。 ## 最佳实践建议 - **定期备份**:根据数据变更频率设置备份计划(如每日或每周)。 - **版本管理**:保留多个备份版本,以便回滚到特定时间点。 - **跨区域冗余**:将备份存储在多个 AWS 区域,防范区域性故障。 - **测试恢复**:定期演练恢复流程,确保备份可用。 ## 后续步骤 本文是系列文章的第一部分,重点介绍备份。第二部分将详细说明如何利用备份进行恢复,包括完整恢复和选择性恢复。 对于依赖 Quick Sight 支持关键业务决策的团队,一个精心设计的备份计划是必不可少的。立即开始评估你的资产,并采用 AssetsAsBundle API 构建备份自动化。

AWS ML25天前原文

## 州级合作 vs 联邦对立:Anthropic的加州路线 AI 初创公司 **Anthropic** 与加州州长 **加文·纽森**(Gavin Newsom)达成一项引人注目的协议:所有加州政府机构及地方政府均可享受 **半价折扣** 使用其 AI 助手 **Claude**,并获得 Anthropic 提供的培训与技术支持。此举正值企业级 AI 订阅成本高企、机构纷纷寻求性价比方案之际。 根据州长办公室发布的新闻稿,Claude 将协助政府雇员起草文件、分析信息,旨在提升行政效率而非取代人力。纽森在声明中强调:“AI 不应取代政府的人力工作,而应帮助我们的工作人员更快行动、更有效解决问题,为加州人带来更好的结果。” 该协议延续了纽森今年 3 月签署的行政令方向——加速利用 AI 提升政府效率,同时维持严格的安全标准。与华盛顿联邦层面的紧张关系不同,加州选择了一条务实合作之路。 ### 联邦政府的“敌人”标签 与州政府的积极合作形成鲜明对比的是,Anthropic 与联邦政府的关系正日趋紧张。今年早些时候,Anthropic 与美国国防部就一项合同发生冲突:Anthropic 坚持在合同中加入明确条款,禁止政府将其技术用于监视美国公民或在无人监督下部署自主武器。但国防部长 **皮特·赫格塞斯**(Pete Hegseth)拒绝接受这些限制,最终国防部转而与 OpenAI 签约。 更严重的是,联邦政府将 Anthropic 列为“**供应链风险**”,禁止其与任何其他五角大楼承包商合作。这一标签实质上切断了 Anthropic 参与国防生态系统的渠道。 ### 加州 CIO 的回应 当被问及这一“供应链风险”认定是否影响州政府谈判时,加州首席信息官兼技术部主任 **克里斯·吉文**(Chris Given)向 POLITICO 表示:“该标签在谈判过程中根本没有被提及。” 这暗示着州与联邦在对待 AI 供应商的态度上存在明显分歧——加州更关注工具的实际效能与安全合规,而非政治化的供应链审查。 ### 行业背景与意义 Anthropic 的案例折射出 AI 行业在政府合作中的两难:一方面,企业需要公共部门订单来扩大应用场景、验证技术价值;另一方面,军事化应用可能违背其安全与伦理原则。Anthropic 选择坚持原则放弃大单,却通过州级合作找到了另一条出路。 对于其他 AI 公司而言,加州的“半价+培训”模式可能成为一个可复用的合作范本——既满足政府降本增效的需求,又避开军事化应用的道德雷区。随着各州对 AI 治理的探索加速,类似“以折扣换安全”的政企合作或许将越来越多。

TechCrunch25天前原文

全球最大的两家内存芯片公司——三星和SK海力士——计划投资5180亿美元(约800万亿韩元),在韩国西南部建设四座新的内存晶圆厂,该地区历来半导体投资较少。这一公告是韩国国家投资计划的一部分,该计划涵盖半导体、AI数据中心和物理AI,于周一在总统简报会上公布,三星和SK海力士的董事长出席了会议。 计划分为三部分:内存芯片方面,5180亿美元用于西南部四座新内存晶圆厂,加上520亿美元用于中部地区的高带宽内存(HBM)封装中心;另有3560亿美元(550万亿韩元)用于AI数据中心,由SK、GS和Naver等韩国科技和能源巨头在2035年前建设。总体而言,韩国科技公司已承诺在AI及由此产生的芯片需求上投入超过9000亿美元。 韩国希望借此将自己打造成更强大的AI参与者。目前,三星和SK海力士(以及美国内存芯片制造商美光)正受益于所谓的“RAMageddon”——AI建设引发的全球内存芯片短缺,需求创纪录。 总统李在明在周一的电视讲话中表示,半导体、物理AI和AI数据中心是韩国下一个工业时代的三轴,并称2026年是韩国必须确立自己作为不可替代的工业强国的一年。他指出,首尔以南的龙仁和平泽的现有芯片设施已达到极限,敦促公司加速在西南部投资,以将AI财富分散到首都以外。 李在明否认政府施压公司投资,称这些决定反映了公司自身的判断。三星周一单独发布新闻稿,宣布未来十年投资计划,其中425万亿韩元用于西南部的湖南地区。

TechCrunch25天前原文

将 AI 工具称为“同事”或“员工”可能适得其反。波士顿大学商学院教授 Emma Wiles 的最新研究发现,当 AI 被冠以“AI 员工”的身份时,人类管理者在审核其产出时发现的错误数量比将其视为聊天机器人时减少了 18%,且更倾向于将存疑工作直接上报给上级,而非自行修正。这一现象背后是责任感的转移:一旦 AI 被拟人化,人类员工便不再对结果负责。 过去一年,Nvidia、微软、OpenAI、Anthropic 和 Google 等科技巨头纷纷推出面向 AI 智能体管理的新工具,其中不少被明确宣传为具备人类认知能力的“数字同事”。Wiles 调查的 1261 名管理者中,近三分之一表示其公司已将 AI 智能体视为正式员工,甚至有 23% 的公司将其列入组织架构图。 然而,这种命名策略带来的隐性成本不容忽视。研究显示,当 AI 被定位为“员工”时,人类管理者会下意识地降低自我责任意识,更少主动纠正错误,反而把问题推给上级。这不仅削弱了 AI 提升效率的初衷,还可能在企业文化中埋下“甩锅”隐患。随着 AI 智能体进入医疗、教育、政府等关键领域,这种责任模糊化可能导致严重的后果。 技术进展固然值得肯定——当前 AI 智能体在复杂任务中的表现已有显著提升,但将它们与人类同事等同,既不现实也无益处。文章指出,正确的做法是保持 AI 的工具属性,明确人类员工始终是最终决策者。否则,我们可能会陷入一个“AI 背锅、人类懈怠”的怪圈。

MIT Tech25天前原文

## 双模型管道:用对的模型做对的事 在数字化扫描文档时,一个典型挑战是:如何从一张包含照片和文字的页面中,高效且低成本地提取结构化信息?以年册页面为例,每页平均有 176 个名字和 4 张肖像照,但没有任何机器可读的关联信息。 AWS 在 Amazon Bedrock 上构建了一个双模型管道,将 **Amazon Nova 2 Lite** 与 **Anthropic Claude Sonnet 4.6** 串联使用,专门解决这类问题。 ### 第一阶段:Nova 2 Lite 负责多模态提取 Amazon Nova 2 Lite 原生支持交错文本与图像输入,一次 Converse API 调用即可完成三项任务: - 检测照片并输出边界框与分类 - 提取页面上可见的名字及其大致位置 - 返回页面级元数据(如标题、类别) 测试中,将推理级别设为 LOW 即可达到与 HIGH 相当的准确率,同时成本最低。 ### 第二阶段:Claude Sonnet 4.6 负责空间推理 Claude Sonnet 4.6 接收 Nova 的输出,利用空间推理能力将名字与面孔一一匹配。这个分工设计充分发挥了每个模型的优势:Nova 擅长结构化提取,Claude 擅长布局理解。 ### 实测结果:高准确率,低成本 管道在 **336 张扫描年册页** 上测试,共生成 **3,122 个名字-面孔关联**,其中 **93% 的置信度达到 0.95 或以上**。 更重要的是成本优势:与单模型方案(全部任务交给一个视觉语言模型)相比,双模型管道每页成本降低约 **三分之二**。 ### 成本分析要点 成本节约主要来自两点: 1. **模型匹配**:不用昂贵的大模型做简单的边界框检测 2. **推理级别优化**:Nova 2 Lite 在 LOW 推理级别下性能已足够 这种“各司其职”的架构思路,对于需要高精度且预算敏感的大规模文档数字化项目具有参考价值。 ## 小结 Amazon Nova 2 Lite + Claude Sonnet 4.6 的组合证明:在 AI 应用中,选择正确的模型组合比单纯追求单一模型能力更重要。通过任务分解和针对性模型选择,可以在保持高准确率的同时大幅降低成本。

AWS ML25天前原文

微星(MSI)近日推出了其新一代Windows掌上游戏PC——**Claw 8 EX AI+**,作为前代产品的重大升级,这款设备在性能、人体工学设计和散热效率上均有显著提升,直接对标联想Legion Go等同类产品。经过实测,Claw 8 EX AI+在多个关键维度上展现出了压倒性优势,堪称目前Windows掌机市场的有力竞争者。 ## 性能飞跃:不只是“挤牙膏” Claw 8 EX AI+搭载了英特尔最新的酷睿Ultra处理器(具体型号未明确),并配备了AI加速单元。相比前代及竞品,其图形性能提升尤为明显。在3A大作如《赛博朋克2077》和《荒野大镖客2》的测试中,Claw 8 EX AI+能在中等画质下稳定保持**30-45 FPS**,而Legion Go在同等设置下仅能维持25-35 FPS,且帧率波动更大。这主要归功于更高效的散热模组和优化的功耗调度。 ## 散热与手感:细节决定成败 Windows掌机的一大痛点在于发热和握持舒适度。Claw 8 EX AI+采用了**双风扇+加粗热管**的散热方案,在连续游戏一小时后,机身最高温度仅42°C(集中在背部出风口),而Legion Go同场景下可达48°C,且掌托区域有明显热感。此外,微星重新设计了手柄弧度,并增大了按键间距,使得长时间握持不易疲劳。摇杆和扳机键的阻尼感也更接近Xbox手柄,反馈清晰。 ## AI加持与软件生态 作为“AI+”型号,Claw 8 EX AI+内置了NPU单元,可用于**实时画面超分**和**功耗智能调节**。在《黑神话:悟空》这类对GPU要求极高的游戏中,开启AI超分后帧率可提升约20%,且画面细节损失较小。微星自家的MSI Center M软件也进行了适配,支持一键切换性能模式、自定义按键映射和监测硬件状态。不过,Windows掌机的系统优化仍是短板,部分游戏启动时仍需手动调整分辨率。 ## 与Legion Go的全面对比 | 维度 | Claw 8 EX AI+ | Legion Go | |------|----------------|-----------| | **屏幕** | 8英寸 120Hz IPS | 8.8英寸 144Hz IPS | | **处理器** | Intel Core Ultra 7 | AMD Ryzen Z1 Extreme | | **散热** | 双风扇+均热板 | 单风扇+热管 | | **续航** | 约2.5小时(游戏) | 约1.8小时(游戏) | | **重量** | 794g | 854g | Legion Go在屏幕刷新率上略有优势,但Claw 8 EX AI+在**散热、续航和握持感**上全面领先。对于追求稳定游戏体验的用户,微星显然更值得考虑。 ## 小结:值得入手的迭代之作 Claw 8 EX AI+证明了Windows掌机仍有进化空间——更强的性能释放、更冷静的机身和更人性化的设计,使其成为当前市面上综合体验最均衡的选择之一。如果你正在寻找一款能流畅运行主流PC游戏的掌机,且对散热和续航有较高要求,这款产品值得重点关注。

ZDNet AI25天前原文

在智能家居领域,**Thread**、**Zigbee**和**Matter**是三个常被提及的连接协议,但它们的角色和适用场景各不相同。理解这些差异,对于构建稳定、高效的智能家居系统至关重要。 ## 协议的本质区别 首先需要明确的是,**Matter**是一个**连接协议**,它定义了智能家居设备之间“说什么语言”——即设备如何相互识别和通信。而**Thread**和**Zigbee**则是**无线网络协议**,它们决定了设备“如何说话”——即数据如何通过无线网络传输。 简单来说,Matter解决了设备间的互操作性问题,让不同品牌的产品能够协同工作;Thread和Zigbee则负责底层的数据传输网络。 ## Thread:为现代智能家居设计的低功耗网状网络 **Thread**是一种基于IP的低功耗网状网络协议,专为现代智能家居环境优化。它有几个显著优势: - **自愈能力**:Thread网络中的设备会自动形成网状结构,如果某个节点失效,数据流量会自动重新路由,减少了随机断连的问题。 - **无需专用集线器**:Thread使用**边界路由器**(通常内置于某些设备中)来连接网络,避免了传统智能家居中集线器杂乱的问题。 - **高效连接**:设备通信更直接、更高效,响应速度更快。 Thread特别适合连接大量**小型、低功耗设备**,如运动传感器、存在传感器、接触传感器、智能锁、灯泡和开关等。因为这些设备通常需要持续连接但数据传输量不大,Thread的低功耗特性正好匹配这一需求。 ## Zigbee:成熟但逐渐面临挑战的传统协议 Zigbee是较早的智能家居无线协议,也采用网状网络结构。虽然它仍然被许多设备支持,但与Thread相比,Zigbee存在一些局限性: - **需要专用集线器**:大多数Zigbee设备需要通过一个中央集线器连接到家庭网络,这增加了成本和复杂性。 - **网络稳定性问题**:相比Thread的自愈能力,Zigbee网络在节点失效时可能更容易出现连接问题。 - **协议碎片化**:不同厂商的Zigbee实现有时存在兼容性问题,尽管有Zigbee联盟的统一标准。 ## Matter:统一智能家居的“通用语言” **Matter**的最大价值在于**打破生态壁垒**。它由苹果、谷歌、亚马逊等科技巨头共同推动,旨在创建一个统一的智能家居标准。无论设备使用Thread、Wi-Fi还是其他底层传输协议,只要支持Matter,就能相互通信。 这意味着你可以混合使用不同品牌的智能设备,而不必担心兼容性问题。Matter over Thread(基于Thread的Matter协议)被认为是**最佳组合**之一,因为它结合了Thread的高效网络和Matter的广泛兼容性。 ## 如何选择最适合你的配置? 基于以上分析,以下是一些配置建议: **选择Thread(特别是Matter over Thread)如果:** 1. **你拥有大量小型设备**:Thread的低功耗网状网络非常适合传感器、智能锁等设备,不会像多个独立Wi-Fi设备那样拥堵你的网络。 2. **你讨厌集线器杂乱**:Thread不需要专用集线器,通过边界路由器即可连接,保持家居整洁。 3. **你重视响应速度和稳定性**:Thread的自愈能力和高效通信能提供更可靠的使用体验。 **考虑Zigbee如果:** - 你已经投资了大量Zigbee设备,且暂时不打算全面升级。 - 某些特定设备只支持Zigbee协议。 **Matter是未来的方向:** 无论你选择哪种底层网络,**优先选择支持Matter的设备**是明智之举。这能确保你的智能家居系统具有长期兼容性,避免被锁定在某个特定生态中。 ## 小结 智能家居连接协议的选择不是非此即彼的问题,而是如何组合使用的问题。**Thread提供了高效的底层网络**,**Zigbee是成熟但逐渐被替代的选择**,而**Matter则是确保互操作性的关键**。对于大多数现代智能家居用户来说,**Matter over Thread的组合**提供了最佳平衡:高效、稳定、兼容且无需杂乱集线器。 随着更多设备支持Matter标准,智能家居的配置将变得更加简单和灵活。

ZDNet AI25天前原文