## 从零构建基础AI智能体:长期任务规划实战指南 近日,一篇题为“从零构建基础AI智能体:长期任务规划”的技术文章在Hacker News上引发热议,获得100分和41条评论。该文章聚焦于AI智能体(Agent)的核心能力之一——**长期任务规划**,为开发者提供了一套从零开始的实践框架。 ### 为什么长期规划是AI智能体的关键? 当前,大语言模型(LLM)在处理单步或短链任务时表现出色,但面对需要多步推理、动态调整的复杂任务时,往往力不从心。例如,让AI“规划一次包含交通、住宿和景点的三日游”,模型可能给出笼统建议,却无法拆解为可执行的子任务序列。**长期任务规划**正是为了解决这一痛点:智能体需要具备将高层目标分解为有序子目标、执行并监控进度的能力。 ### 文章核心:从零开始的实现路径 文章作者并未依赖LangChain等现成框架,而是**从底层逻辑出发**,展示了如何用Python构建一个基础智能体。其核心组件包括: - **任务分解器**:将用户输入的自然语言目标解析为结构化子任务列表,并建立依赖关系。 - **执行引擎**:按序或并行调用LLM(如GPT-4)处理每个子任务,并收集中间结果。 - **状态跟踪器**:记录已完成、进行中和阻塞的任务,支持动态重规划。 - **反馈循环**:当子任务失败或需要额外信息时,智能体可回溯并调整后续步骤。 作者特别强调了**“规划-执行-验证”**循环的重要性:智能体不应是一次性生成完整计划然后机械执行,而应在每一步后评估进展,必要时修正计划。这种设计借鉴了经典AI中的**分层任务网络(HTN)**思想,但通过LLM的语义理解能力实现了更灵活的分解。 ### 行业背景与挑战 这篇教程的出现并非偶然。随着AI智能体成为2024-2025年的技术热点,从AutoGPT到各种Agent框架,开发者们逐渐认识到:**规划能力是区分“玩具”与“工具”的分水岭**。然而,长期规划仍面临两大挑战: 1. **幻觉累积**:LLM在长链推理中容易产生错误,且错误会随步骤累积。 2. **资源开销**:每一步都调用LLM,导致延迟和成本线性增长。 文章提出的方案通过**显式状态管理**和**错误重试机制**缓解了这些问题,但并未完全解决。例如,当任务步骤超过10步时,成功率仍会显著下降。 ### 社区反响与启示 Hacker News上的评论呈现两极分化:一部分开发者认为“从零实现”有助于理解底层原理,是教育性极佳的教程;另一部分则指出,在实际生产环境中,直接使用成熟框架(如LangGraph、CrewAI)更高效。但双方都认可:**理解规划机制是设计可靠智能体的基础**。 对于中文开发者而言,这篇文章的价值在于:它打破了“智能体=调用API”的简单认知,揭示了任务规划背后的系统工程思维。无论是构建个人助手还是企业级自动化系统,掌握长期规划的设计模式都将成为核心竞争力。 > 提示:该文章为技术教程,原文未提供完整代码,但核心逻辑已足够启发实践。建议读者结合自身场景,尝试实现一个简单的“待办事项规划器”作为入门练习。
## 当AI编码速度提升100倍,质量谁来把关? Jimmy和Ray是两位经验丰富的技术人——Jimmy是Thiel Fellow,拥有MIT博士学位,在编程工具领域深耕15年;Ray则在19岁时成为一家20亿美元公司的销售副总裁,并通过“vibe-coding”方式构建了多个副业项目。他们共同创立了Command Center,一个专为**重视代码质量**的开发者设计的AI编程环境。 ### 核心痛点:速度与质量的矛盾 Command Center的核心理念直击当前AI编程工具的通病:**“让AI生成数千行代码很容易,但真正的工作从这里才开始。”** 开发者面临的困境是,AI可以极快地生成大量代码,但随之而来的代码审查、质量保证和调试工作却可能耗费数倍于手动编写的时间。 ### 产品特色:从“生成”到“审查”的全流程管理 Command Center将重点放在**代码审查与质量控制**上。它提供了一个完整的开发环境,让开发者能够: - **计划与提示**:在AI生成代码前,通过结构化计划确保方向正确 - **快速生成**:AI在数秒内生成上万行代码(官方示例:8.4秒生成10,482行) - **逐行审查**:提供工具让开发者对生成的代码进行**逐行审查**,确保每一行都符合质量标准 这种设计理念与当前主流AI编程助手(如GitHub Copilot、Cursor)形成鲜明对比——后者更强调“生成速度”和“自动补全”,而Command Center则试图解决“生成后怎么办”这一被忽视的问题。 ### 行业背景与意义 随着AI编程工具的普及,**代码质量**正成为新的瓶颈。许多团队发现,AI生成的代码虽然数量惊人,但其中可能包含逻辑错误、安全漏洞或不一致的编码风格。Command Center的出现,标志着AI编程工具正在从“效率优先”向“质量优先”演进。 ### 创始人背景带来的信任背书 Jimmy的学术背景(MIT博士、Thiel Fellow)和15年编程工具开发经验,加上Ray在商业领域的成功,使得Command Center在技术和市场两个维度都具备可信度。 ### 总结 Command Center并非又一个追求“更快生成代码”的工具,而是一个**关注代码生命周期后半段**——审查、测试与维护——的完整解决方案。对于重视代码质量的团队和个人开发者来说,这或许正是他们需要的工具。 > 提示:目前Command Center仍处于早期阶段,其实际效果有待更多用户验证。
## 一句话快讯 YC S22 成员 **Intuned** 正式发布其浏览器自动化平台,核心卖点是“用自然语言描述需求,AI 自动生成 Playwright 代码,并持续维护其稳定性”。 ## 核心功能亮点 Intuned 定位为“浏览器自动化的基础设施”,主要解决传统自动化脚本维护成本高、易被网站反爬机制拦截的痛点。其核心能力包括: - **Intuned Agent**:用户只需用自然语言描述任务(如“抓取某电商网站的商品价格”),Agent 会生成生产级的 **Playwright** 代码(支持 TypeScript 和 Python),并自动部署。当网站结构变化导致脚本失效时,Agent 会自动修复,无需人工干预。 - **内置反检测与认证**:提供**反检测、验证码自动破解、登录会话管理**等功能,减少被网站封禁的风险。 - **调度与监控**:支持定时任务、完整日志和会话录制,方便排查问题。 - **弹性伸缩**:从单机到数百台机器的自动扩展,用户只需控制并发数量。 ## 应用场景与竞争对手 Intuned 主要面向三类需求: 1. **数据抓取(Scrapers)**:从电商、政府门户、招聘网站等无 API 的站点提取数据。 2. **爬虫(Crawlers)**:大规模发现和采集页面内容,支持 Crawl4AI 等流行框架。 3. **RPA(机器人流程自动化)**:模拟用户操作,如表单提交、数据录入、账户操作等,尤其适合与无 API 的服务集成。 在 RPA 领域,Intuned 还支持 **Anthropic Computer Use、OpenAI CUA、Stagehand、Browser-use、Gemini Computer Use** 等 AI 驱动方案,允许用户混合使用传统代码和 AI 行为。 ## 行业背景与定位 浏览器自动化市场已存在多年,但传统方案(如 Selenium、Puppeteer)需要开发者手动维护选择器,网站改版即导致脚本失效。近年来,AI 生成代码和自适应修复成为新趋势。Intuned 的差异化在于: - **强调“代码的可靠性”**:所有自动化最终都编译为 Playwright 代码,用户可完全掌控代码逻辑,同时享受 AI 自动修复的便利。 - **一站式托管**:不仅生成代码,还提供部署、监控、伸缩、反检测等全套基础设施,降低运维负担。 ## 小结 Intuned 试图解决浏览器自动化“写代码易,维护难”的长期痛点。对于需要大规模、稳定抓取或 RPA 的团队,这种“AI 生成 + 自动运维”的模式可能大幅降低人力成本。不过,其实际效果取决于 AI 对网站变化的识别准确率和修复成功率,以及反检测策略的有效性。作为 YC 孵化的产品,Intuned 目前提供免费试用,感兴趣的用户可以亲自测试。
**核心结论:AI 公司正在“烧钱换市场”** 一篇来自 Hacker News 的热门分析指出,以 Anthropic 和 OpenAI 为代表的头部 AI 公司,其**收入与成本之间存在巨大鸿沟**。作者估算,用户每支付 100 美元,公司实际投入的算力、研发和运营成本可能超过 1000 美元。这并非简单的亏损,而是一种**战略性补贴**——用资本换取用户习惯、数据积累和市场份额,赌的是未来模型效率提升和成本下降能填平这个窟窿。 ### 成本到底高在哪里? - **训练成本**:一次前沿模型的训练动辄数千万美元,且迭代频繁。 - **推理成本**:每次 API 调用背后是昂贵的 GPU 集群运行。即使是“免费”或低价套餐,边际成本依然显著。 - **人才竞争**:顶尖 AI 研究员的年薪可达数百万美元,团队规模持续扩大。 - **基础设施**:数据中心、电力、网络带宽的投入是天文数字。 作者特别提到,**编码助手类产品(如 Claude Code、GitHub Copilot)可能是亏损最严重的领域**。这类工具需要高频率的实时推理,且用户往往在复杂任务上大量调用,导致单用户成本远超订阅费或 API 收入。 ### 为什么公司愿意“赔本赚吆喝”? 这背后是典型的互联网平台思维: 1. **锁定用户**:一旦开发者习惯了某个 AI 编码助手,切换成本极高。模型会学习用户的代码风格和项目上下文,形成粘性。 2. **数据飞轮**:每一次交互都是训练数据。用户的使用模式、成功案例和失败反馈,都能用于优化下一代模型。 3. **规模效应**:随着模型效率提升(如更小的模型达到同等效果)和硬件成本下降,单位成本会快速降低。早期投入可以视为长期投资。 4. **竞争壁垒**:谁先占领市场,谁就拥有最大的用户基数和最丰富的场景数据,后来者难以追赶。 ### 可持续性隐忧 然而,这种模式并非没有风险。 - **资本耐心有限**:如果长期无法盈利,投资者可能会施压。 - **技术瓶颈**:模型效率的提升可能不如预期,成本下降速度慢于用户增长。 - **替代竞争**:开源模型(如 Llama、Mistral)的崛起可能压低整体定价空间,让补贴模式更难维持。 作者认为,**当前的价格战本质上是不可持续的**。对于用户来说,这或许是“薅羊毛”的好时机,但需要警惕未来可能出现的涨价或服务降级。 ### 结语 AI 行业正处在经典的“烧钱换增长”阶段。每 100 美元收入背后是 1000 美元的成本,这个数字或许有些夸张,但方向没错。对于普通用户,享受低价服务的同时,不妨留意公司财报和融资动态——当补贴停止时,账单可能会很真实。
OpenAI 近日宣布推出 **“锁定模式”**(Lockdown Mode),这是一项可选的高级安全设置,旨在限制 OpenAI 产品中能够连接网络或外部服务的工具和功能,从而降低因 **提示注入攻击** 导致数据泄露的风险。该功能已向符合条件的个人账户(包括免费、Go、Plus、Pro 用户)以及自助式 ChatGPT 商业账户逐步推送。 ## 什么是锁定模式? 锁定模式的核心思路是 **限制出站网络请求**,阻止攻击者通过提示注入将敏感数据外传。它并非面向所有用户,而是专为处理敏感数据的个人和组织设计,这些用户对数据泄露风险有更高的防护需求。 ## 工作原理:多层防御中的最后一环 提示注入是 AI 领域一个前沿且棘手的安全挑战。OpenAI 表示,他们持续在多层面加固安全系统,包括模型层、产品层和系统层。锁定模式在此基础上,通过 **沙箱隔离**、**基于 URL 的数据外泄防护**、**监控与执行机制**,以及 **基于角色的访问控制和审计日志** 等企业级控制手段,构成多层防御。 锁定模式的重点在于 **阻断数据泄露的最终阶段**——即限制出站网络请求,防止敏感数据被传输给攻击者。但需要注意的是,锁定模式 **并不能阻止提示注入本身** 出现在 ChatGPT 处理的内容中(例如缓存的网页内容或上传的文件里),也无法完全消除注入对模型行为或响应准确性的影响。 ## 锁定模式下哪些功能会受影响? 启用锁定模式后,以下功能将被禁用或受限: - **实时网页浏览**:仅能访问缓存内容,搜索结果可能受限、不可用或已过时。 - **图像支持**:ChatGPT 可能无法在常规回复中显示图像或从网络获取图像。用户仍可上传图片文件,图像生成功能(如 DALL·E)保持不变。 - **深度研究**(Deep Research):该功能被完全禁用。 ## 适用场景与可用性 锁定模式适用于所有账户类型和工作区,用户必须登录后才能使用。目前该功能正在逐步推送中,若在设置中未看到该选项,说明账户可能暂未获得权限。 对于企业用户而言,锁定模式可以与现有的角色权限、审计日志等企业级控制结合,构建更严格的安全策略。但对于普通用户,由于会牺牲部分便利性,OpenAI 并不建议默认开启。 ## 行业视角 提示注入攻击已成为大语言模型应用中最受关注的安全威胁之一。此前,多家安全研究机构已展示过通过精心构造的提示,诱导模型输出内部数据或执行恶意操作的案例。OpenAI 此次推出锁定模式,可以视作对这类攻击的 **针对性防御措施**,同时也反映了 AI 安全从“模型安全”向“产品安全”延伸的趋势——不仅要在模型层面抵御注入,还要在系统层面阻断数据泄露通道。 当然,锁定模式并非万能。它无法消除注入本身,也无法覆盖所有潜在的攻击路径(例如通过文件上传间接泄露数据)。对于需要极致安全的环境,仍需结合其他安全措施,如数据脱敏、输入过滤和严格的访问控制。
## 核心亮点:一个真正“长记性”的开源AI代理 **Hermes Agent** 由 Nous Research 团队推出,采用 MIT 许可证,是一款**完全自托管**的开源AI代理。它并非简单的聊天机器人或副驾驶,而是一个**拥有持久记忆、能自动创建技能、并跨平台工作的自主代理**。 ## 持久记忆:不再每次“重新认识” 传统AI对话往往缺乏上下文连续性,每次交互都是一次“失忆”重启。Hermes Agent 的核心创新在于**持久记忆**:它能记住用户的偏好、项目进展和环境配置,跨会话保持上下文。使用时间越长,它对用户的了解越深入,无需重复解释背景信息。 ## 自动技能创建:解决问题后“留一手” 当代理解决一个复杂问题后,它会自动编写一份**可复用的技能文档**,将解决过程固化下来。这些技能可搜索、可分享,并兼容开放的 `agentskills.io` 标准。这意味着代理的能力会随着使用不断自我扩展,形成“越用越聪明”的正循环。 ## 多平台网关:一个代理,无处不在 Hermes Agent 支持通过单一网关连接 **Telegram、Discord、Slack、WhatsApp、Signal 和 CLI** 等多个平台。你可以在 Telegram 上开始对话,然后在终端中继续。它还支持语音备忘录转录和跨平台延续,真正实现无缝切换。 ## 内置自动化与并行子代理 - **定时任务**:内置 cron 调度器,可设置每日报告、夜间备份、每周审计等无人值守任务,并推送到任意平台。 - **并行子代理**:可生成隔离的子代理并行处理工作流,每个子代理拥有独立的对话和终端,通过 RPC 实现零上下文开销的协作。 ## 强大的浏览器与网页控制 代理具备**完整的浏览器自动化能力**:网页搜索、页面内容提取、导航、点击、输入、截图,以及视觉分析、图像生成、文本转语音和多模型推理。 ## 多样的执行环境与LLM支持 Hermes Agent 支持多种执行环境:本地终端、Docker 容器、SSH 远程服务器、Modal/Singularity 云和 HPC。LLM 方面,原生集成 Nous Portal OAuth、OpenRouter(200+模型)、自定义 OpenAI 兼容 API 以及本地 vLLM。 ## 现状与展望 目前项目已在 GitHub 开源(MIT 许可),在 Hacker News 上获得 51 分和 41 条评论,社区关注度较高。对于希望拥有**私有化、可成长、跨平台AI助手**的开发者而言,Hermes Agent 提供了一个极具吸引力的选择。不过,作为开源项目,其稳定性和功能完善度仍有待社区验证。
在过去的五个月里,一支工程团队进行了一项大胆的实验:**完全依靠 AI 代码生成工具 Codex(基于 GPT-5)构建并交付了一款软件产品,全程没有一行手写代码**。这个产品拥有内部日活用户和外部 alpha 测试者,能够正常发布、部署、出现问题并得到修复,但所有代码——包括应用逻辑、测试、CI 配置、文档、可观测性以及内部工具——均由 Codex 生成。团队估计,相比传统手写代码,开发时间缩短了约 **10 倍**。 这一实验的核心原则是:**人类负责引导,智能体负责执行**。团队刻意设定了“零手写代码”的约束,目的是探索当软件工程团队的主要任务不再是编写代码时,工作方式会发生怎样的根本性变化。 ## 从空仓库起步 实验始于 2025 年 8 月底的一个空 Git 仓库。第一个提交——包括仓库结构、CI 配置、格式化规则、包管理器设置和应用框架——全部由 Codex CLI 基于少量现有模板生成。甚至指导智能体如何工作的 `AGENTS.md` 文件本身也是由 Codex 编写的。从一开始,仓库就由智能体塑造,没有任何预先存在的手写代码作为锚点。 五个月后,仓库中包含了约 **100 万行代码**,涵盖应用逻辑、基础设施、工具、文档和内部开发者工具。在此期间,一个由 **3 名工程师** 组成的小团队驱动 Codex 完成了约 **1500 个 Pull Request** 的合并,平均每位工程师每天产出 3.5 个 PR。有趣的是,随着团队扩大到 7 人,吞吐量不降反升。 ## 关键经验:从写代码到设计环境 团队发现,当智能体负责代码实现时,人类工程师的核心技能发生了迁移: - **设计环境**:不再关注具体语法,而是定义清晰的目录结构、API 契约和测试框架,为智能体提供高效的“工作台”。 - **明确意图**:用自然语言精确描述需求,包括边界条件、性能目标和错误处理方式,而非逐行指定实现细节。 - **构建反馈回路**:通过自动化测试、代码审查和可观测性工具,让智能体快速获得执行结果的反馈,从而自我修正。 ## 挑战与教训 并非一切顺利。团队也遇到了不少挑战: - **调试成本转移**:当 Codex 生成的代码出现 bug 时,调试往往比手写代码更困难,因为需要理解 AI 的“思路”。团队不得不投入更多精力在日志和可观测性上。 - **一致性维护**:随着代码库膨胀,不同 PR 中 Codex 可能采用不同的实现风格,导致技术债务。团队通过严格的 `AGENTS.md` 和模板来约束。 - **人类注意力是稀缺资源**:虽然代码生成速度极快,但代码审查、设计决策和问题定位仍需人类深度参与。团队的核心瓶颈从“写代码”变成了“做决策”。 ## 对行业的启示 这个实验证明,**AI 智能体驱动的开发(Agent-Driven Development)** 已不再是概念,而是可以交付真实产品的可行模式。它重新定义了工程师的角色:从“代码生产者”转变为“系统设计师和智能体协调者”。 团队总结道:“我们最大的收获是,**人类的时间与注意力才是真正的稀缺资源**。智能体负责执行,但方向、质量和创造力依然由人类掌控。” 随着 Codex 和类似工具的持续进化,这种“人类引导、智能体执行”的开发范式可能会成为主流,大幅降低软件开发的边际成本,加速产品创新。
## 核心亮点 近日,一位开发者展示了**首个经过形式化验证的多边形交集算法实现**。该项目使用 **Lean 4 证明助手**,从数学上保证了算法对于任意多边形配置的正确性,填补了计算几何领域在形式化验证方面的空白。 ## 背景与挑战 多边形交集是矢量图形编辑器(如 Adobe Illustrator、Figma)的基础功能,用于计算两个多边形区域的重叠部分。然而,由于多边形可能有复杂形状(包括孔洞),且输入配置无穷无尽,传统测试方法无法穷举所有情况,尤其是那些罕见的边界条件。 > “计算几何算法因输入的特殊配置而臭名昭著,这些配置往往构成了算法的大部分复杂性。” ## 形式化验证的意义 该项目的核心在于:**信任完全来自 Lean 检查器和对小规格的人工审查,而非大语言模型**。开发者明确表示,虽然 AI 辅助了实现,但正确性保证来自严格的数学证明。 - **无限状态空间**:每个多边形的内部点集是无限的,传统方法无法在代码中直接表示“内部”概念。 - **形式化规格**:通过 Lean 定义了多边形的内部集(基于射线交点奇偶性),并证明了输出多边形的内部集等于输入内部集的交集。 ## AI 辅助的演进 项目开发过程中,AI 模型的能力提升带来了显著变化: - **Opus 4.8**(当前最新模型)能够 **一次性** 生成带形式化证明的算法实现。 - 之前的模型需要开发者分步提供证明策略,多次迭代才能完成。 但开发者强调,AI 只是工具,最终的正确性仍依赖形式化验证框架。 ## 实际体验 项目提供了一个 **Web 演示**,用户可以在浏览器中绘制多边形并实时计算交集,底层调用已验证的核心算法。这展示了形式化验证不仅停留在理论层面,也能服务于实际应用。 ## 相关工作和展望 据开发者所知,这是首个此类验证实现。计算几何的形式化验证长期被视为难题,因为算法常依赖几何直觉和特殊处理。此项目或将为其他几何算法(如并集、差集、凸包)的形式化验证开辟道路。 ## 小结 这一成果不仅展示了形式化验证在复杂算法中的可行性,也体现了 AI 辅助开发与严格验证相结合的新范式。对于依赖几何计算的领域(如 GIS、CAD、游戏开发),这可能是提升软件可靠性的重要一步。
## 介绍 在 Web 开发中,图标是界面设计不可或缺的元素。开发者 Tim 在维护 lucide-motion-vue 库时,发现 animate-ui 的动画图标集虽然出色,但仅支持 React 或需搭配 shadcn 使用。为了让 Vue 社区也能享受这些精美的动画图标,他将其移植到了 Vue 3,推出了 **@respeak/lucide-motion-vue**。 ## 核心特性 该库包含 **535 个动画图标**,全部基于 Lucide 图标集。每个图标都带有流畅的动画效果,可直接在 Vue 3 项目中使用。这意味着 Vue 开发者无需再依赖 React 生态,就能轻松为应用增添动态视觉元素。 ## 使用场景与优势 - **提升用户体验**:动画图标能更直观地传达状态变化,如加载、成功、错误等。 - **降低开发成本**:开箱即用,无需自行编写动画代码。 - **保持一致性**:基于 Lucide 图标集,风格统一,与现有设计系统兼容。 ## 行业背景 当前 UI 库的动画支持多集中在 React 生态(如 Framer Motion),Vue 社区在动画图标方面选择有限。lucide-motion-vue 的出现填补了这一空白,体现了前端生态的多元化趋势。随着 Vue 3 的普及,类似工具将进一步缩小与 React 的体验差距。 ## 总结 对于 Vue 开发者而言,@respeak/lucide-motion-vue 是一个实用的工具,它让动画图标的集成变得简单高效。如果你正在构建 Vue 3 应用,并希望界面更具活力,不妨尝试这个库。
一年前,Anthropic 还坚决反对让 Claude 拥有足以关停内部服务的权限;如今,这种级别的访问已成为常态,开发者因此效率大增。然而,风险也随之而来:失败概率与潜在破坏半径。本文分享了 Anthropic 在推出三款核心代理产品——claude.ai、Claude Code 和 Claude Cowork——过程中,从“人为监督”转向“系统隔离”的安全策略演变。 ## 风险的两面:概率与半径 Anthropic 将代理安全风险拆解为两个维度:**失败概率**和**潜在破坏半径**。模型训练与安全机制的进步不断降低前者,但后者——理论上的“爆炸半径”——随着能力与权限的扩展而持续增长。当代理能完成原本需要一个人甚至一个团队的工作时,不部署的代价变得足够大,只要产品足够安全,风险收益比就倾向于推进部署。 ## 从“审批”到“自动模式”:人为监督的局限性 最初,Claude Code 采用**人为在环**的监督方式:每次代理采取可能产生副作用的行动前,都需要用户点击确认。理论上可行,但实际遥测数据显示,用户批准了约 **93%** 的权限请求。随着审批次数增加,用户注意力下降,监督逐渐流于形式。为此,团队推出了 **Claude Code 自动模式**,通过自动化处理更安全的审批来缓解“审批疲劳”,但任何概率性防御都存在非零的漏报率。 ## 系统隔离:更根本的防御思路 第二种思路是**系统隔离**:不监督代理做什么,而是通过沙箱、虚拟机、出口控制等手段限制其能做什么。这是 Anthropic 投入最多精力的方向,也是最多意外安全故障发生的地方。 ## 三款产品,三种隔离架构 - **claude.ai**:面向大众用户,采用强沙箱与内容过滤,限制代码执行和外部网络访问。 - **Claude Code**:面向开发者,需要访问文件系统和执行命令,采用**最小权限原则**与**自动模式**结合,并通过会话隔离防止横向移动。 - **Claude Cowork**:面向企业协作,设计为多租户隔离,每个工作区有独立的凭证和网络策略。 ## 经验教训:没有银弹 文章强调,没有单一方案能解决所有安全问题。人为监督会疲劳,系统隔离会受限,关键在于根据产品场景平衡风险与效率。Anthropic 的经验表明,**分层防御**——结合自动审批、权限最小化、沙箱隔离与持续监控——是目前最务实的路径。未来,随着代理能力继续提升,安全架构也需要动态进化。
## 莱顿宣言:人工智能与数学的未来之路 近日,一份名为《莱顿人工智能与数学宣言》的文件在科技社区引起热议。这份宣言并非来自某个单一机构,而是由多位数学家与研究者共同发起,旨在探讨人工智能(AI)对数学研究乃至整个数学学科的影响,并为数学家、机构、政府和行业提供行动建议。 ### 背景:AI 正在改变数学实践 宣言首先指出,技术发展曾多次重塑数学的实践方式。如今,**符号方法和神经网络**等AI技术正被用于数学的生成与形式化,可能已开启这一漫长历史的新篇章。面对这一变革,研究者们的反应各异:有人对AI可能带来的新发现充满热情,有人因发展速度之快感到压力,也有人冷漠或担忧其对数学及更广泛社会的影响。 ### 核心价值:数学的独特属性 宣言强调,数学家有权选择是否以及如何在研究中采用AI,同时也有责任确保学科的持续繁荣。为此,宣言基于数学研究的**典型价值**提出建议,这些价值包括: - **追求数学研究的动机多样**:从智力好奇心到解决实际社会问题。 - **证明活动的核心地位**:数学证明赋予结论最高程度的确定性,并传递对“为什么结论成立”的理解。这种特性支撑了数学的科学完整性。 - **成果的归属与责任**:研究成果应被正确归因,数学家需对其工作负责。 ### 建议方向:个体到系统的行动 宣言呼吁数学家承担起责任,并围绕以下层面提出建议: 1. **个人层面**:数学家应主动了解AI的能力与局限,批判性地评估其在研究中的应用,避免盲目依赖。 2. **机构层面**:高校和研究机构应制定指导方针,支持负责任的AI使用,同时维护数学教育的传统价值,如逻辑推理和证明训练。 3. **政府与资助机构**:应投资于AI与数学交叉领域的基础研究,并确保科研成果的开放获取与可重复性。 4. **行业**:科技公司应与学术界合作,推动AI工具的透明性和可解释性,避免将数学研究完全商业化。 ### 与现有伦理框架的呼应 宣言并非孤立行动,它与其他伦理倡议形成互补,例如**《乌普萨拉科学家伦理准则》**、**《旧金山研究评估宣言》**、**联合国教科文组织开放科学建议**以及**英国通用科学家伦理准则**。国际数学联盟出版委员会、工业与应用数学学会和美国数学学会也发布了相关材料。 ### 小结:机遇与责任并存 《莱顿宣言》的核心信息是:**AI 为数学带来了巨大机遇,但也伴随着挑战**。数学家不能被动接受技术变革,而应主动塑造未来。这场讨论不仅关乎数学本身,也关乎科学共同体如何在AI时代坚守严谨性、创造性与伦理底线。对于关注AI与科学交叉的读者而言,这份宣言提供了一个有价值的思考框架。
2013 年 Google Reader 关闭时,许多人宣告 RSS 已死。但事实证明,RSS 从未停止运转——它只是从人类阅读器转向了幕后管道。如今,AI 智能体(Agent)正在成为 RSS 的新主人。 ## RSS 的“死亡”是一次误诊 Google Reader 的关闭让 RSS 从大众视野中消失,取而代之的是社交算法推送。算法提供的“随机奖励”对人类具有成瘾性,但对 AI 智能体毫无意义。一个需要监控竞品发布、跟踪法规变化或总结研究论文的智能体,**不需要惊喜,它需要确定性和结构化**。 RSS 恰好满足智能体的四个关键需求: - **确定性列表**:只提供新内容,没有冗余干扰; - **可解析格式**:XML 结构清晰,无需猜测; - **无速率限制**:不依赖广告关系,没有 API 调用配额; - **无认证墙**:公共内容可直接访问,无需登录。 相比之下,社交平台 API 几乎无法做到以上任何一点。它们频繁变更、收费,甚至直接关闭访问权限。 ## 播客行业的 250 亿美元证明 RSS 从未真正死去的最好证据是播客。**2022 年播客行业规模已达 250 亿美元**,而它的底层协议依然是 2002 年发布的 RSS。Spotify、Apple Podcasts、Overcast 等所有播客应用都通过 RSS 获取节目文件和元数据。 为什么没有人“颠覆”RSS?因为它太完美了:开放、免费、无中间商、无需谈判访问权限。每一集内容的 URL 就在 feed 里,始终如此。 ## 智能体时代:RSS 的第二次生命 同样的逻辑将扩展到所有需要被智能体可靠消费的文字内容。无论是为查询检索上下文的语言模型,还是检查新文件的监控智能体,或是摄入新闻通讯的摘要工具——它们都需要一个**可预测、结构化、按时间顺序排列的新内容列表**。而这正是 RSS 的全部定义。 问题在于:你的内容是否以这种方式可达?还是被困在设计用于人类注意力、主动阻碍程序化访问的系统中? ## 行动建议 如果你还没有为内容提供 RSS feed,请立即行动。在你的细分领域,智能体会在算法依赖的页面之前,先找到结构化的 feed。 > 如果你在社交平台上发布内容,AI 智能体和聚合器可能无法可靠地触及它们。 **RSS 不是过去的遗产,而是 AI 时代的基础设施。** 它简单、开放、稳定,恰好填补了智能体与数据源之间的关键空白。
微软在Build 2026大会上正式推出**Scout**,这是其首个基于**OpenClaw**框架的“自动驾驶”AI Agent。与需要用户逐次提示的Copilot不同,Scout被设计为始终在后台运行的**自动飞行员**,拥有独立的Entra身份,能自主跨应用执行任务。 ## 核心能力与集成 Scout可连接**Teams、Outlook、OneDrive和SharePoint**,并访问聊天、邮件、日历和联系人数据。用户通过Teams即可调用它,它还能通过**MCP协议**与浏览器及外部应用交互,覆盖云端、桌面和Web端。其典型任务包括:协调会议时间、根据工作安排自动锁定日历时段,甚至识别“决策停滞”等风险,提前预警。 ## 架构与可用性 Scout基于微软此前开源的**OpenClaw** Agent框架构建,该框架允许开发者创建能长期运行、具备记忆和工具调用能力的Agent。微软强调,Scout拥有独立的**Entra身份**,意味着其行为可被企业IT部门通过Intune策略统一管控,并需要用户“选择加入”认证。目前Scout仅作为**实验性功能**向微软Frontier项目客户开放。 ## 行业背景与挑战 Scout是微软“代理化”战略的最新一步。此前微软已在Microsoft 365中推出**Agent Mode**(在Word/Excel内与Copilot交互)和**Copilot Cowork**(类似Anthropic Claude Cowork的独立任务Agent)。然而,微软一直面临企业客户对Microsoft 365 Copilot付费意愿低的困境——仅约**3%**的M365客户订阅了Copilot(每人每月30美元),累计付费用户约**1500万**。Scout这类“无人值守”Agent能否提升用户粘性和付费转化,仍是关键考验。 ## 小结 Scout的推出标志着AI助手从“被动响应”向“主动代理”的转变。与Google Project Mariner、Anthropic Computer Use等竞品相比,微软的优势在于其深度绑定的办公生态和IT治理能力。但企业是否会为“永远在线的AI员工”买单,还需市场验证。
## 为什么是 MI300X? 在 AI 算力持续紧缺的当下,AMD MI300X 以其 192GB HBM3 显存、接近 H100 的 FP8 算力以及仅为后者一半的标价,成为不少推理部署团队眼中的“性价比之选”。但理想很丰满,现实很骨感——软件生态的鸿沟让这颗芯片在实际落地中充满挑战。 ## 硬件亮眼,软件扎心 MI300X 发布于 2023 年底,是 AMD 对标 NVIDIA H100/H200 的产品。它拥有 **192GB HBM3**,远高于 H100 的 80GB;FP8 算力与 H100 相当,而租赁价格却低得多。然而,当 H100 租赁价格在五个月内上涨 40%、按需容量全面售罄时,MI300X 依然“随租随有”。 原因只有一个:**软件**。 AMD 在 MI350X、MI355X 等新芯片上的软件支持已有改善,但对 MI300X 这一代产品的优化似乎被遗忘了。截至 2026 年 5 月初,**vLLM 搭配 DeepSeek-V4-Flash 在 MI300X 上根本无法正常运行**——而这个组合本应是推理场景的黄金搭档。 ## FP8 标准之争的后遗症 问题的根源之一,是 FP8 数据格式的**标准分裂**。 在低精度计算成为趋势后,业界对 FP8 的规范产生了分歧: - **Graphcore 与 AMD** 联合 Qualcomm,在 2022 年提出了一套标准; - **Arm、Intel 与 NVIDIA** 则通过 Open Compute Project 推出了另一套。 两派互不相让,导致不同厂商的硬件对 FP8 的理解和执行存在微妙差异。MI300X 作为 AMD 首批支持 FP8 的加速器,采用的正是前一套标准,而这与主流 AI 框架(如 vLLM)所依赖的 NVIDIA 生态并不兼容。 ## 部署路上的“暗坑” 在尝试让 DeepSeek-V4-Flash 在 MI300X 上跑通的过程中,我们遇到了大量**非预期问题**: - ROCm 软件栈对特定算子的支持缺失或行为异常; - 显存管理策略与 NVIDIA 生态不同,导致 KV Cache 分配失败; - 社区提供的 Docker 镜像和安装脚本往往过时,且缺少针对 MI300X 的详细文档。 每一次看似接近成功,都会被一个新的错误打断。这并非硬件能力不足,而是**软件适配的碎片化**让本应简单的部署变得异常曲折。 ## 小结:性价比背后的隐形成本 MI300X 的硬件规格令人心动,但当前软件生态的不成熟,使得它更适合**愿意投入工程力量进行深度适配**的团队。对于追求快速部署、开箱即用的用户而言,NVIDIA 生态仍是更稳妥的选择。 但我们相信,随着 AMD 持续补足软件短板,MI300X 这类“高性价比”芯片的价值终将被释放。届时,今天的这份“踩坑记录”或许会成为一份有意义的参考。
据报道,著名导演马丁·斯科塞斯(Martin Scorsese)正在积极拥抱人工智能技术。这一消息在Hacker News上引发了热烈讨论,获得了51分和56条评论。斯科塞斯作为电影界的泰斗,其对AI的态度可能预示着影视行业对新技术接纳的转折点。 目前尚不清楚斯科塞斯具体如何使用AI,但可能涉及电影制作中的视觉特效、剪辑、甚至剧本创作辅助等领域。AI在影视行业的应用一直存在争议,一方面它能提高效率、降低成本,另一方面也引发了关于创造力、版权和就业的担忧。 斯科塞斯的加入为这一讨论增加了重量级的声音。他以其对电影艺术的深刻理解和创新精神闻名,曾推动多项技术革新。他的拥抱可能有助于消除部分从业者对AI的抵触情绪,并推动行业探索AI与人类创造力的结合点。 然而,也有评论者指出,AI在艺术领域的应用仍需谨慎,确保技术服务于创意而非取代人类。斯科塞斯的具体实践将如何展开,值得持续关注。
Anthropic 于 2026 年 6 月 2 日宣布扩大其 **Project Glasswing** 合作伙伴计划,新增约 **150 家** 组织,涵盖电力、水务、医疗、通信和硬件等关键基础设施领域。这些组织遍布 **15 个以上国家**,其代码库一旦遭攻击可能影响 **超过 1 亿人**。 Project Glasswing 于今年 4 月启动,最初约 50 家合作伙伴获准使用 Claude Mythos Preview 模型扫描代码漏洞,迄今已发现 **超过 10,000 个** 高危或严重安全缺陷。此次扩张基于与安全行业、开源维护者和美国政府的紧密协作,新成员需满足 Anthropic 的安全要求才能获得访问权限。 Anthropic 指出,廉价且具备强大网络能力的 AI 模型即将普及,Project Glasswing 旨在推动机构适应这一现实。Mythos Preview 代表了一个长期趋势:预计 **6 到 12 个月内**,许多其他 AI 模型也将具备类似或更强的代码审计能力。该项目长期目标包括:利用 AI 使所有软件更安全,并帮助行业调整对网络安全核心假设的认知。
知名对冲基金经理、电影《大空头》原型迈克尔·伯里近日公开表示,他认为 SpaceX 和 Anthropic 的估值被严重高估,两家公司都配不上 1 万亿美元的市值。这一言论在科技投资圈引发热议,尤其是在 AI 和航天赛道持续升温的当下。 ### 伯里的核心论点 伯里在社交媒体上直言,市场对这两家明星公司的追捧已经脱离基本面。对于 SpaceX,他指出虽然其在商业航天领域具有先发优势,但太空经济的规模化仍面临技术、监管和需求等多重不确定性。至于 Anthropic,这位以做空次贷闻名的投资者认为,当前 AI 大模型公司的估值逻辑类似于 2021 年的加密货币泡沫——缺乏可持续的盈利模式,且竞争格局尚不明朗。 ### 估值争议背后的行业现实 伯里的质疑并非空穴来风。SpaceX 在 2023 年的一轮融资中估值达到约 1800 亿美元,而 Anthropic 则在 2024 年初估值突破 600 亿美元。这两家公司的估值确实与 1 万亿美元有较大差距,但市场对其未来增长寄予厚望。 - **SpaceX** 的星链业务已实现正向现金流,但太空旅游、火星殖民等长期愿景尚未落地。 - **Anthropic** 的 Claude 模型在安全性和性能上表现突出,但商业化进程仍落后于 OpenAI,且面临谷歌、微软等巨头的竞争。 ### 市场分歧与投资者情绪 伯里的观点代表了一部分价值投资者的谨慎态度。他们认为,当前科技巨头和明星创业公司的估值已经透支了未来数年的增长,尤其是 AI 领域,资本涌入速度远超技术成熟度。然而,成长型投资者则坚信 SpaceX 和 Anthropic 具备颠覆行业的能力,长期来看 1 万亿美元并非不可能。 ### 小结 无论伯里的预测最终是否正确,他的言论提醒市场:在追逐前沿科技的同时,不应忽视基本面风险。对于普通投资者而言,理解这些公司的实际业务进展和财务健康度,比单纯关注估值数字更为重要。
佛罗里达州总检察长詹姆斯·乌斯迈尔(James Uthmeier)于2026年6月1日宣布,对OpenAI及其首席执行官萨姆·奥特曼(Sam Altman)提起全美首个州级诉讼,指控该公司在明知产品存在严重风险的情况下,仍向公众(包括儿童)积极推广ChatGPT,同时隐瞒安全警告、压制内部举报,并就该产品的真实性质和危险欺骗佛罗里达州居民。 ### 诉讼核心指控 诉状称,OpenAI和奥特曼将市场速度和商业利益置于用户安全之上,无视公司内外专家的多次警告,部署了一款鼓励伤害(包括自残和暴力)的产品,同时虚假保证其安全性。具体而言,ChatGPT被指控: - **未经充分家长监督收集未成年人数据**,违反儿童隐私保护原则; - **导致行为成瘾和认知伤害**,尤其对青少年用户影响显著; - **产生危险错误**,而公司对此轻描淡写、刻意淡化。 佛罗里达州法律禁止不公平和缺陷性贸易行为。诉状认为,OpenAI的行为对佛罗里达居民造成持续伤害,要求公司停止欺骗性做法并赔偿损失。值得注意的是,上月该州全州起诉办公室在审查了ChatGPT与一名青少年用户(名为“Phoenix”)的聊天记录后,已启动刑事调查。 ### 行业背景与影响 这起诉讼标志着美国州级政府首次对AI头部企业采取直接法律行动,具有里程碑意义。近年来,AI安全与伦理问题日益引发关注,OpenAI内部曾多次传出安全团队与商业化路线冲突的消息。此次佛罗里达州的指控,将公众注意力从单纯的“AI能力竞赛”拉向“责任与监管”维度。 - **对OpenAI的冲击**:诉讼直接指向CEO个人,可能动摇投资者信心,并迫使公司重新评估其安全披露与产品发布流程。 - **监管趋势**:若佛罗里达州胜诉,可能引发其他州效仿,形成“多米诺骨牌效应”,加速联邦层面AI监管立法。 - **儿童保护焦点**:将AI对未成年人的影响作为核心议题,可能促使行业建立更严格的年龄验证与内容过滤机制。 ### 回应与展望 截至发稿,OpenAI尚未正式回应。奥特曼此前曾多次强调公司对安全的承诺,但此次诉讼据称引用了大量内部文件与专家证词,若证据确凿,OpenAI可能面临巨额赔偿和业务限制。对于整个AI行业而言,这起案件将成为“安全优先”还是“速度优先”的转折点——毕竟,当法律开始追问“谁为AI的伤害负责”时,答案不再只是技术问题。
佛罗里达州总检察长近日对OpenAI及其首席执行官萨姆·奥尔特曼提起法律诉讼,指控该公司在人工智能技术的开发和部署中存在欺骗性行为,并构成对公众的潜在风险。这起诉讼是美国各州针对AI行业采取法律行动的最新案例,反映出监管机构对AI安全与伦理问题的持续关注。 根据诉讼文件,佛罗里达州声称OpenAI的AI模型(如ChatGPT)在数据收集、隐私保护及输出内容的准确性方面存在误导性陈述,未能充分告知用户其技术的局限性和风险。诉讼还指出,奥尔特曼本人曾公开承认AI可能带来的社会危害,但公司却未能采取足够措施加以防范。 这是继加州、纽约等地类似诉讼后,又一州级政府对AI领军企业发起的法律挑战。分析人士认为,此类诉讼可能加速联邦层面的AI监管立法进程,同时也对科技公司如何平衡创新与风险防控提出更高要求。 OpenAI尚未对诉讼作出正式回应,但公司此前曾表示致力于负责任的AI开发,并支持合理的监管框架。此次诉讼的进展将对整个AI行业产生深远影响,尤其是在数据隐私、算法透明度和企业责任等关键议题上。 ## 关键问题与行业影响 - **隐私与数据安全**:诉讼焦点之一是OpenAI是否充分保护用户数据,尤其是在训练模型时如何获取和使用信息。 - **透明度与责任**:AI系统输出结果的可解释性成为法律争议点,企业需更清晰地说明模型工作原理及潜在偏差。 - **监管趋势**:多州诉讼可能推动美国国会制定统一的AI法规,避免各州各自为政带来的合规混乱。 ## 小结 佛罗里达州的诉讼标志着AI监管进入新阶段——从行业自律、白宫行政令转向司法系统的实质性介入。无论结果如何,这都将迫使AI公司重新审视其商业模式与合规策略,而公众对于AI安全性的讨论也将进一步深化。随着更多法律行动的出现,2025年或将成为AI治理的转折年。
## 票房奇迹:当YouTube导演遇上Z世代 2026年5月31日,北美票房迎来历史性周末。由A24发行的恐怖片《后室》(Backrooms)在3442家影院开画,以**8100万美元**的惊人成绩刷新了多项纪录。与此同时,Focus Features的《迷恋》(Obsession)在第三周末再收2640万美元,累计票房突破1亿美元大关。两部影片的共同点令人瞩目:**导演均为YouTube出身,制作成本极低**,却精准击中了Z世代观众的观影热情。 ## 数据背后的市场信号 《后室》的8100万美元开画成绩远超预期,考虑到其制作成本仅约数百万美元级别,这一投资回报率堪称现象级。相比之下,同期上映的《曼达洛人与古古》第三周票房暴跌70%,显示出传统IP在大众市场的吸引力正在被新兴内容形态分流。 两部恐怖片的成功并非偶然。它们均源自网络原生IP:《后室》取材自2019年流行的网络怪谈“阈限空间”文化,而《迷恋》则脱胎于YouTube上广受欢迎的“模拟恐怖”短片。这种从互联网社区生长出来的叙事,天然具备Z世代熟悉的视觉语言和情绪节奏,使得社交媒体的病毒传播成为票房爆发的核心引擎。 ## 行业启示录 1. **制作门槛的瓦解**:传统观念中,大片需要顶级导演、明星阵容和巨额预算。但《后室》与《迷恋》证明,当内容与特定社群的审美深度绑定,低成本也能撬动高票房。YouTube导演更懂得如何用“网感”调动年轻观众的情绪——比如利用镜头畸变、环境音效和“未完成感”制造沉浸式恐惧。 2. **发行策略的进化**:A24和Focus Features均采用了“社区优先”的宣发路线:提前在Reddit、TikTok和Discord释放片段,鼓励粉丝二创,并将首映式办成线下“密室逃脱”体验。这种将电影视为“事件”而非“商品”的运营思路,成功将网络热度转化为实际购票行为。 3. **恐怖片的持续爆发力**:近年来《危笑》《梅根》等低成本恐怖片屡创佳绩,但像本周末这样“双核驱动”的景象仍属罕见。它表明恐怖类型在年轻群体中已成为**社交货币**——看同一部电影、分享恐惧体验,本身就是一种群体认同的仪式。 ## 结语 《后室》的8100万美元首周末不仅是A24公司的里程碑,更可能是好莱坞权力转移的信号。当YouTube导演能击败星战衍生剧,当网络迷因成为票房金矿,传统制片厂或许需要重新思考:下一个爆款,可能就藏在某个Reddit帖子的评论区里。