SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Hacker News清除筛选 ×

在 YC S26 的 Launch HN 上,Hoplite 团队带来了一个全新的云端编码代理部署平台,旨在简化开发者的工作流程。Hoplite 的创始人是 Bence 和 Ryan,他们指出,该平台的核心优势在于其强大的 QA 功能套件,使得功能测试变得异常简单。 ## 从本地到云端:无缝迁移 Hoplite 的亮点之一是在上手过程中,它能够自动迁移用户的本地设置,包括会话、记忆、MCP 服务器等,让开发者无需重新配置即可在云端继续工作。这种无缝迁移体验,大大降低了进入云端开发的门槛,尤其对于依赖个性化配置的开发者来说,无疑是一个福音。 ## 聚焦 QA:提升开发效率 在软件开发中,质量保证(QA)往往耗时且繁琐。Hoplite 专门针对这一痛点,提供了一套工具,使编码代理能够更高效地测试功能。这意味着开发者可以将更多精力投入到核心逻辑实现上,而将重复性的测试任务交给云端代理,从而显著提升开发效率。 ## 行业背景与展望 随着 AI 编程助手的兴起,云端开发环境已成为趋势。Hoplite 的出现,不仅是对现有工具链的补充,更是对“AI 驱动开发”理念的一次有力实践。它通过整合本地配置和提供强大的 QA 能力,有望成为开发者工具箱中的重要一环。 目前,Hoplite 仍处于早期阶段,但其愿景清晰:让云端编码代理的部署像本地开发一样简单。对于希望探索云端开发新范式的团队而言,Hoplite 值得关注。

Hacker News8127天前原文

OpenAI 今日发布了一项令人瞩目的研究成果,宣布在数学和理论计算机科学的十个长期未解问题上取得了新进展。这些问题涵盖了高维几何、编码理论、算术电路复杂度、群论、算子代数、量子复杂度、格密码学和极值组合学等多个领域,其中许多问题已悬而未决数十年。这些突破性成果由 OpenAI 内部版本的 Astra 模型完成,该模型是下一代主要模型,其解决问题所需的计算成本约为 2,000 美元(按 Sol API 费率计算)。 ## 背景:加速科学发现的使命 OpenAI 一直致力于为科学家和数学家提供加速发现的工具。近期,他们推出了“ChatGPT for Academic Researchers”计划,为 10 万名科学家和数学家提供免费使用最佳 ChatGPT 模型的机会。此外,OpenAI 在模型开发过程中会持续评估模型在开放研究问题上的表现。今年五月,他们曾分享了一个 AI 生成的关于 Erdős 单位距离猜想的反例,这项工作已经激发了数学和理论计算机科学的进一步发展。 ## 十项成果概览 本次发布的十项成果具体包括: - **高维球堆积**:在 Cohn–Elkies 阈值以下获得了新的球堆积密度上界。 - **二元码和球码**:在任意给定最小距离下,二元码最大规模的指数级改进界限,高维球码也有类似结果。 - **非 sofic 群**:构造证明了非 sofic 群的存在,解决了群论中的一个核心开放问题。 - **Connes 刚性猜想**:反驳了一个长期存在的猜想,该猜想认为某些群由其 von Neumann 代数唯一确定。 - **算术电路复杂度**:在计算永久式(permanent)方面获得了新的下界。 此外,还有关于量子复杂度、格密码学和极值组合学等方面的进展。所有这些问题在其各自的数学界都具有重要意义,其中几个问题在整个数学界都广受关注。 ## 方法与验证 这些成果由 Astra 模型(内部版本)取得,人类研究者与模型合作将论证整理成论文。随后,模型将每个论证形式化为 Lean 证书,确保其严谨性。OpenAI 还发布了每个解决方案的模型思维过程叙述,以便研究者了解模型的推理路径。 ## 意义与展望 这些突破展示了 AI 在数学和理论计算机科学领域的巨大潜力。通过自动化推理和探索,AI 能够帮助人类解决那些长期悬而未决的问题,加速科学发现的过程。OpenAI 表示,他们希望这些工具能赋能更多研究者,推动数学和相关领域的进展。 尽管这些成果尚未经过同行评审(除部分外),但它们已经引起了学术界的广泛关注。未来,随着 AI 模型的不断进步,我们有望看到更多类似的突破,为人类知识的前沿拓展做出贡献。

Hacker News62627天前原文

Nightcrawler 是一款完全运行在智能手机上的自主渗透测试代理。它利用设备内置的小型 AI 模型(LFM2.5-1.2B-Instruct-Heretic,12亿参数),通过本地 GPU 推理,自主决定下一步操作——探测哪个主机、使用哪个工具、寻找什么漏洞。整个过程无需云连接或外部 API,完全离线运行。 ## 核心工作原理 Nightcrawler 的工作流程分为几个阶段: - **WiFi 破解(可选)**:如果未预连 WiFi,它可以利用外接 USB WiFi 适配器自主破解 WPA2 网络。 - **侦察**:通过隐蔽扫描发现网络上的设备。 - **枚举**:探测发现的服务(Web 服务器、文件共享、SSH、DNS 等)。 - **利用**:测试已知漏洞和默认凭据。 - **报告**:生成结构化的渗透测试报告,包含发现和修复建议。 该代理像一位耐心的人类渗透测试员一样运作——它轮流扫描主机,每轮只执行一个小操作,并在数小时内逐步积累知识。与传统漏洞扫描器一次性轰炸所有主机不同,这种方式更难被检测。 ## 关键概念 - **Drop box**:留在目标网络上自主执行测试的设备。 - **Scope**:授权测试的网络/主机范围。 - **Rules of Engagement (ROE)**:规定允许操作范围的法律文件。 - **Stealth**:避免被网络监控(IDS/IPS)检测的技术。 - **MCP**:模型上下文协议,AI 工具使用的标准接口。 - **C2**:命令与控制,用于监控和引导代理的 Web 仪表板。 ## 架构概览 系统架构基于 OnePlus 8 手机,核心组件包括: - **LFM2.5 模型**:运行在 GPU 上,通过 :8080 端口提供推理服务。 - **Agent Loop(main.py)**:负责决策循环,决定下一步行动。 - **工具集**:包括 nmap、hydra 等常见渗透工具。 Nightcrawler 的演示视频可在 Instagram 上观看,展示了它在一加 8 手机上的实际运行效果。 ## 意义与展望 Nightcrawler 的出现将渗透测试的门槛大幅降低——过去需要专业设备和云服务器的工作,现在只需一部手机即可完成。尽管当前版本仍处于早期(v0.1.0),但其自主性和隐蔽性已经显示出潜力。未来,随着端侧 AI 模型的进步,这类工具可能会在红队行动和安全评估中扮演更重要的角色。

Hacker News11927天前原文

据最新报道,OpenAI 支持的超级政治行动委员会(Super PAC)正在资助一个由 AI 生成的新闻网站,该网站专门发布攻击 AI 行业批评者的内容。这一消息在 Hacker News 上引发热议,获得 202 分和 101 条评论。 该新闻网站名为“Model Republic”,其内容由 AI 生成,旨在为 OpenAI 及其盟友辩护,同时贬低那些对 AI 安全、伦理和监管提出质疑的声音。这种做法引发了关于 AI 行业透明度、政治游说以及生成式 AI 在信息传播中角色的广泛讨论。 **背景与动机** OpenAI 作为 AI 领域的领军企业,一直致力于推动 AI 技术的商业化和社会应用。然而,随着 AI 的快速发展,来自学术界、民间社会和政策制定者的批评声也日益增多,主要关注点包括 AI 的潜在风险、数据隐私、就业影响以及算法偏见等。为了应对这些批评,OpenAI 通过其超级 PAC 资助“Model Republic”,试图塑造公众舆论,影响政策制定。 **争议与批评** 这一做法引发了多方批评。批评者认为,利用 AI 生成的内容来攻击反对者,是一种不透明的信息战策略,可能误导公众,并进一步侵蚀对 AI 行业的信任。此外,匿名或伪装的 AI 生成内容可能加剧虚假信息的传播,使得公众难以辨别真伪。 Hacker News 的讨论中,许多用户表达了对这一行为的担忧,认为这凸显了 AI 行业在道德和治理方面的挑战。有评论指出,OpenAI 作为行业领导者,应当以身作则,促进开放和诚实的对话,而不是通过资助攻击性内容来压制批评。 **行业影响与未来展望** 这一事件可能对 AI 行业的公信力产生深远影响。随着 AI 生成内容的能力不断增强,如何确保其使用符合道德和法律规范,成为亟待解决的问题。监管机构可能会加强对 AI 政治游说和内容生成的监督,而公众对 AI 的信任也可能因此受到考验。 对于 OpenAI 而言,此举虽然可能在短期内削弱批评声浪,但长期来看,可能损害其品牌形象,并加剧社会对 AI 的警惕。在 AI 伦理日益受到重视的当下,企业需要更加审慎地处理与批评者的关系,以建立可持续的信任基础。 总之,“Model Republic”事件揭示了 AI 行业在政治和舆论战场上的新动向,也为 AI 治理提出了新的课题。未来,如何在技术创新与社会责任之间取得平衡,将是所有 AI 企业必须面对的挑战。

Hacker News21328天前原文

**Sprocket** 是一个开源的 AI 代理,由一位 16 岁的开发者独立打造,其独特之处在于它不仅能处理软件开发,还能胜任硬件设计任务,甚至能自主从网站上购买所需的硬件部件或 SaaS 订阅。该项目的目标是成为“全球最好的硬件和软件开发平台”。 ## 核心能力 - **软硬兼修**:Sprocket 是目前唯一能同时处理硬件和软件开发的 AI 代理。 - **智能检索**:它会从网络上获取最佳上下文,确保操作的可靠性。 - **自主购物**:只需用户指令,Sprocket 就能从任意网站购买物品,从硬件零件到软件订阅都不在话下。 - **硬件设计**:能生成详细的原理图、物料清单(BOM)和装配说明。 ## 运行方式 Sprocket 提供了多种运行方式,且不影响其性能: 1. **免安装运行**:通过 `npx @spikonado/sprocket` 即可在浏览器中直接使用。 2. **桌面应用**:可从 GitHub Releases 下载对应系统的安装包。 3. **CLI 工具**:通过 `npm i -g @spikonado/sprocket` 安装后,使用 `sprocket` 命令启动,并支持 `--web` 参数强制在浏览器中打开。 ## 工作区管理 Sprocket 支持工作区概念,可以记住附加的目录和本地服务器会话,状态保存在 `$HOME/.sprocket` 目录(可通过环境变量 `SPROCKET_DATA_DIR` 覆盖)。开发人员可以轻松切换不同项目。 ## 开发者友好 对于开发者而言,Sprocket 提供了丰富的 CLI 命令和环境变量,如 `sprocket serve` 可启动本地服务器,`--api-only` 模式便于 API 开发。开发环境要求包括 Bun 1.3.9+、Node.js 24.14+ 和 Rust 工具链。 ## 行业影响 Sprocket 的出现可能预示着 AI 代理在硬件领域的应用将迎来突破。传统上,硬件开发需要大量手动操作和专业知识,而 Sprocket 的自动化能力有望降低门槛,加速原型迭代。尽管它由一位少年开发,但其功能深度和开放性(开源)已引起社区关注,未来有望成为创客和专业工程师的得力助手。

Hacker News12428天前原文

在 Hacker News 上,一篇题为“人工智能:Ars Notoria 与瞬间知识的承诺”的帖子引发了热议,获得了 137 分和 34 条评论。文章将现代人工智能与中世纪的神秘学实践 Ars Notoria 相提并论,探讨了人类对“瞬间获取知识”的永恒渴望。 Ars Notoria 是 13 世纪流传的一种魔法仪式,据称通过祈祷和冥想,能在短时间内获得所有学科的知识。它本质上是借助超自然力量,绕过长期学习的过程。而今天,AI 模型如 GPT-4 等,同样承诺通过简单的提示词,就能生成代码、撰写文章、解答复杂问题,仿佛知识可以即时下载。 这种对比揭示了人类对认知捷径的迷恋,但也引发了深刻的思考:AI 带来的“知识”是否等同于真正的理解?Ars Notoria 被视为迷信,而 AI 则被奉为科学,但两者在认知层面可能共享某种幻觉——即知识可以脱离上下文、体验和批判性思维而存在。 文章提醒我们,AI 的输出基于训练数据中的统计规律,而非真正的推理或理解。它可能产生看似合理但实则错误的答案,即“幻觉”。因此,依赖 AI 获取知识,就像依赖魔法仪式一样,可能带来虚假的确定性。 在 AI 快速渗透教育、科研和日常决策的今天,这种类比具有现实意义。我们应当把 AI 视为辅助工具,而非知识的终极来源。真正的学习依然需要时间、努力和批判性思考。正如中世纪的学者最终放弃 Ars Notoria,我们也应警惕对 AI 的过度依赖。 帖子在 Hacker News 上引发了关于 AI 本质、知识获取方式以及技术局限性的讨论。评论者指出,AI 的“知识”缺乏因果逻辑和验证机制,而 Ars Notoria 的实践者至少还需依赖信仰。无论如何,这篇帖子提供了一个独特的视角,促使我们反思技术时代的认知边界。

Hacker News14028天前原文

## 快评:DeepSeek V4 Flash 0731 发布,性价比再成焦点 近日,DeepSeek 发布了其最新模型 **DeepSeek V4 Flash 0731**,在 Hacker News 上引发热议(80 分,17 条评论)。作为 V4 系列的高性价比版本,Flash 0731 在保持强大智能水平的同时,进一步优化了性能与价格平衡,瞄准了中小企业和开发者市场。 ### 智能与性能:轻量但不妥协 据公开信息,V4 Flash 0731 在多项基准测试中表现出色,尤其在**代码生成、逻辑推理和长文本处理**方面,其能力已接近甚至部分超越前代旗舰模型。这得益于 DeepSeek 在**模型架构和训练策略**上的持续创新,使得 Flash 版本在**推理速度**上大幅提升,同时降低了**显存占用**,更适合在边缘设备或资源受限的环境中部署。 ### 价格策略:击穿行业底线? 价格方面,V4 Flash 0731 延续了 DeepSeek 一贯的激进定价策略。据官方 API 定价显示,其输入和输出价格均远低于同类竞品,例如 GPT-4o mini 和 Claude 3 Haiku。这使得**大规模 AI 应用的成本门槛**进一步降低,对创业公司和独立开发者尤为友好。 ### 行业影响:AI 应用普及加速 V4 Flash 0731 的发布,可能预示着 AI 行业将迎来新一轮**价格战**,并推动 AI 应用从“能用”向“好用”转变。对于开发者而言,这意味着可以更自由地试验和迭代,而无需担心成本失控。 ### 小结 DeepSeek V4 Flash 0731 在智能、性能和价格之间找到了一个极具吸引力的平衡点,有望成为 2025 年 AI 开发者的新宠。不过,实际表现仍需在真实场景中检验,我们也将持续关注其生态发展和用户反馈。

Hacker News5911个月前原文

DeepSeek 官方于 2026 年 7 月 31 日发布了 DeepSeek-V4-Flash API 的公开测试版。此次更新在模型架构和规模上与预览版保持一致,但通过重新训练显著增强了智能体(Agent)能力,在多项基准测试中大幅超越 V4-Pro-Preview。 ## 核心亮点:智能体能力飞跃 根据官方公布的基准测试结果,DeepSeek-V4-Flash 在多项智能体任务中表现亮眼: - **Terminal Bench 2.1**:82.7 - **NL2Repo**:54.2 - **Cybergym**:76.7 - **DeepSWE**:54.4 - **Toolathlon verified**:70.3 - **Agent Last Exam**:25.2 - **Automation Bench (Public)**:25.1 - **DSBench-FullStack**(内部全栈开发测试集):68.7 - **DSBench-Hard**(内部硬问题测试集):59.6 这些分数反映了模型在代码生成、工具调用、全栈开发等复杂任务上的强大能力。官方测试使用了即将发布的 **DeepSeek Harness** 最小模式作为框架,并采用最大努力级别,`topp=0.95`,`temperature=1.0`。 ## API 使用与兼容性 调用方式保持不变,只需将模型名称设置为 `deepseek-v4-flash` 即可使用最新版本。该模型**原生支持 Responses API 格式**,并针对 Codex 进行了特别适配,具体配置可参考官方文档。 ## 重要说明 - 本次更新仅针对 **DeepSeek-V4-Flash API**,**DeepSeek-V4-Pro API** 以及 APP/WEB 端模型均未变化。 - 官方表示 **DeepSeek-V4-Pro** 的正式发布将很快到来。 ## 行业背景与展望 DeepSeek 此次快速迭代,反映了当前 AI 行业对智能体(Agent)能力的高度重视。从代码生成到复杂任务自动化,智能体正成为各大模型厂商竞争的焦点。DeepSeek-V4-Flash 在多个基准上的亮眼表现,不仅展示了其技术实力,也为开发者提供了更强大的工具。随着 V4-Pro 的即将发布,DeepSeek 有望在智能体领域进一步巩固其地位。

Hacker News7451个月前原文

在 Android 上打开别人发来的文件,往往意味着要安装体积庞大的办公套件,或者授权各种敏感权限。Gander 的出现,或许能让你彻底告别这种不安。这是一款**开源、完全离线**的文件查看器,**APK 仅约 15 MB**,却能打开 PDF、Word、Excel、PPT、图片、视频、音频、Markdown 和代码等几乎所有常见格式,而且**不申请任何权限**——甚至连网络权限都没有,从根源上杜绝了数据外泄的可能。 ## 零权限,私密性拉满 Gander 的核心理念是“私密即设计”:**没有 INTERNET 权限,没有广告,没有追踪,没有账户**。它无法联网,自然也无法“打电话回家”。文件解析全部在本地完成,既保护了隐私,也意味着你可以在无网络环境下安心使用。 ## 一个应用,通吃所有格式 Gander 集成了多种成熟的离线渲染引擎,覆盖了日常几乎所有的文件类型: - **文档**:PDF(基于 Pdfium)、Word(.docx) - **表格**:Excel(.xlsx、.xls 等,基于 SheetJS) - **幻灯片**:PowerPoint(.pptx) - **图片**:JPG、PNG、GIF、SVG、HEIC 等,支持深度缩放和平滑滚动 - **音视频**:MP4、MP3、MKV 等,基于 Media3 ExoPlayer - **Markdown 和代码**:渲染为格式化 HTML,支持全文搜索 对于老旧的二进制 .doc 和 .ppt,由于没有可靠的离线渲染方案,Gander 会给出提示并建议重新保存为 .docx/.pptx。 ## 便捷操作,不牺牲体验 尽管权限为零,Gander 依然提供了流畅的操作体验: - **最近文件**:带缩略图预览(图片、视频帧、PDF 首页) - **文件夹浏览**:通过一次性系统授权访问,无需存储权限 - **分享与打开**:支持从任意应用分享文件到 Gander,或从文件管理器直接打开 - **文档内搜索**:在 Word、Excel、幻灯片、Markdown 和代码中查找关键词 - **分享与定位**:可将当前文件分享到其他应用,或跳转到其在文件管理器中的位置 界面采用 Material 3 设计,支持深色模式和全面屏,兼容 Android 8.0 及以上设备。 ## 获取方式 Gander 是开源项目,你可以在 GitHub 的 Releases 页面下载 APK。arm64 版本几乎覆盖所有 2017 年后的手机,老旧或 x86 设备可选择通用版。 如果你厌倦了臃肿的办公套件,或者对文件隐私格外敏感,Gander 值得一试。它用极小的体积,证明了“少即是多”的可行性。

Hacker News2081个月前原文

在人工智能快速发展的今天,我们与AI的交互方式大多仍停留在聊天窗口。但两位年轻开发者Akilan和Miguel正在尝试改变这一现状——他们创建的MarbleOS项目,灵感源自Xerox PARC的图形界面革命、1984年的Macintosh以及后来的NeXTSTEP,这些历史性的设计奠定了现代操作系统的基础。 在图形界面(GUI)出现之前,人们操作计算机只能通过命令行的方式,比如输入`C:\> DIR`这样晦涩的指令。而MarbleOS的愿景,就是为AI代理(Agent)打造一个类似当年GUI革命的全新交互范式。 ## 从聊天到工作台:重新定义AI交互 MarbleOS的核心思路是:**将AI的工作过程可视化、结构化**。它不再只是让用户与AI进行对话,而是提供一个工作区,让文件、工具、任务和输出都**清晰地展示在界面上**,而不是埋藏在无尽的聊天记录中。 这种设计理念直击当前AI交互的痛点。目前,无论是ChatGPT还是其他AI助手,用户都依赖对话流来管理任务,当任务变得复杂时,聊天线程会变得混乱不堪,难以追踪进度、管理文件或复用结果。MarbleOS试图将AI的使用体验从“聊天”升级为“协作”,让用户能像使用现代操作系统一样,直观地管理AI的工作。 ## 站在巨人的肩膀上 MarbleOS的灵感来源颇具深意。Xerox PARC在1970年代开发的图形用户界面,让计算机从专业实验室走向了普通大众;1984年的Macintosh将GUI普及到个人电脑;而NeXTSTEP则带来了面向对象的操作系统和开发环境,成为后来macOS的基石。这些先驱者证明了:**一个好的界面能极大降低技术的使用门槛**。 如今,AI代理正处在类似命令行时代的早期阶段——功能强大但交互原始。MarbleOS希望填补这一空白,为AI代理设计一个直观、高效的“图形界面”,让非技术用户也能轻松驾驭AI的复杂能力。 ## 当前状态与未来展望 目前,MarbleOS已经开放了**beta版本下载**,并提供了多个演示视频。从其展示的内容来看,用户可以在工作区内创建任务、调用工具、查看输出,所有操作都一目了然。这种设计特别适合需要多步骤、多工具协作的复杂任务,比如数据分析、软件开发或内容创作。 不过,MarbleOS仍处于早期阶段,其实际体验和生态构建尚待验证。但这一方向无疑值得关注——**当AI代理成为日常工具时,我们与它们的交互方式将成为决定生产力高低的关键**。MarbleOS的尝试,或许正是开启AI时代GUI革命的钥匙。

Hacker News1371个月前原文

## 蒸馏实验:用DeepSeek V4 Flash训练GPT-OSS 最近,一项实验将**DeepSeek V4 Flash**作为教师模型,对**GPT-OSS-120B**进行蒸馏,专攻金融推理任务。结果显示,蒸馏后的模型在8K token预算下,于**FinanceReasoning**基准上取得**83.61%**的准确率,超越了Kimi K3(81.93%)和Inkling(65.13%)。研究团队已开源20B权重的蒸馏版本。 ## 审查机制的“遗传”问题 有趣的是,蒸馏过程并未完整继承教师模型的审查机制。DeepSeek V4 Flash在内容过滤上较为严格,而GPT-OSS作为开源模型,本身设计上更注重开放性。蒸馏后的模型在保留金融推理能力的同时,**审查强度显著降低**。这引发了AI安全领域的讨论:蒸馏是否会成为绕过内容限制的途径? ## 行业背景与意义 当前,大模型蒸馏技术日益成熟,成为提升小模型性能的主流手段。此案例表明,蒸馏不仅能迁移知识,还可能**改变模型的行为特征**。对于金融等垂直领域,高精度推理能力至关重要,但审查机制的弱化也可能带来合规风险。研究团队强调,他们主要关注技术可行性,并提醒社区注意模型行为的一致性问题。 ## 开源与未来方向 20B权重已在Hugging Face上公开,供研究使用。团队下一步计划探索**多教师蒸馏**,并结合RLHF优化,以平衡能力与安全性。

Hacker News1691个月前原文

OpenAI 于 2026 年 7 月 30 日宣布,其最新模型系列 GPT-5.6 在性能与成本上实现重大突破。通过优化模型架构与推理效率,GPT-5.6 Luna 降价 80%,Terra 降价 20%,同时 Sol 在 API 中推出 Fast 模式,速度提升 2.5 倍。这一举措旨在降低企业部署 AI 工作流的门槛,让更强大的智能以更低成本普及。 ## 核心降价与性能提升 - **Luna 降价 80%**:作为最快且最经济的模型,Luna 现以极低成本提供高质量输出,适合高吞吐量、多步骤工作流。其性能可比肩一年前的顶尖模型,但单任务成本仅为后者的 6%,速度提升近 9 倍。 - **Terra 降价 20%**:作为日常工作的平衡模型,Terra 成本进一步降低,适合通用任务。 - **Sol 推出 Fast 模式**:在 API 中以标准处理 2 倍的价格提供 2.5 倍速度,智能水平不变,且向后兼容旧版 Priority 请求。 ## 行业背景与意义 此次降价是 OpenAI 长期效率优化的结果,涵盖模型训练、推理部署和工程实现的全链路改进。在 AI 行业竞争白热化的当下,价格战已成为常态,但 OpenAI 选择通过技术降本而非单纯补贴,展现了更强的可持续性。 对于企业而言,Luna 的成本优势意味着更多 AI 应用场景从概念验证走向规模化落地,例如客服自动化、代码生成、数据分析等。以 Replit、Notion、Ramp 等客户为例,它们已开始利用 GPT-5.6 优化工作流,实现成本与效率的双赢。 ## 匹配智能与结果 OpenAI 强调,高效使用 AI 的关键在于根据任务重要性、错误成本、紧迫性和规模,匹配最合适的模型。Luna 适合高吞吐、低延迟场景;Terra 适合日常办公;Sol 则适合对速度有极致要求的任务。这种分层定价策略让企业能灵活优化成本与性能。 ## 展望 随着 GPT-5.6 的降价,AI 的普惠化进程加速。未来,更多中小企业将能以可负担的成本接入前沿 AI 能力,推动行业创新。OpenAI 表示,这仅是开始,未来将持续在性能与成本边界上探索。

Hacker News6081个月前原文

在近期一场备受瞩目的全球会议上,美国政府与OpenAI联合展示的非洲地图出现了明显错误,引发了与会者和在线观众的广泛批评。这一事件不仅暴露了技术应用中数据准确性的问题,也再次将人工智能在地理信息处理上的偏见与局限性推至风口浪尖。 ## 错误地图引发争议 据现场与会者透露,该地图在标注非洲国家边界、名称及区域划分时存在多处严重错误,包括错误拼写、位置偏移以及遗漏某些地区。这一失误在会议大屏幕上展示时被立即捕捉,并在社交媒体上迅速传播,成为科技界热议的话题。 ## 数据质量与AI偏见 OpenAI作为人工智能领域的领军企业,其模型在处理地理信息时出现如此低级的错误,令人对其训练数据的可靠性和算法的鲁棒性产生质疑。地理数据往往涉及复杂的历史、政治和文化背景,而AI模型若仅依赖有限的公开数据源,极易产生偏差。此次事件也凸显了AI在全球化语境下,对非西方地区的理解仍存在显著短板。 ## 政府与科技合作的警示 美国政府在此次会议中与OpenAI联合展示,本意可能是展现科技与公共治理的融合,但地图错误却适得其反,成为合作中的尴尬注脚。这一事件提醒我们,在政府与科技企业合作推进数字化项目时,必须对数据来源进行严格审查,并建立多学科交叉的验证机制,以避免因技术失误导致外交或政策层面的负面效应。 ## 行业反思与改进方向 此次事件并非孤例,此前已有多个AI系统在地理、历史等领域出现错误标注的案例。业内专家指出,AI模型需要更全面的训练数据,尤其是纳入本地化、多语种的权威数据源,同时应引入人工审核环节,确保关键信息的准确性。此外,模型在输出涉及主权和边界的内容时,应内置敏感性检测,避免因技术疏漏引发国际争议。 ## 结语 一张错误的地图,虽看似小事,却折射出AI技术在地理信息处理上的深层挑战。随着AI在政府、教育、媒体等领域的应用日益广泛,确保其输出内容的准确性和文化敏感性,已成为不容忽视的课题。此次事件也为所有AI开发者敲响警钟:技术无国界,但数据与标注必须严谨。

Hacker News521个月前原文

**Gemini Robotics 2** 是谷歌 DeepMind 最新发布的机器人智能系统,旨在通过“全身智能”让机器人更好地感知、理解并与物理世界交互。与先前版本相比,Gemini Robotics 2 在运动控制、物体操作和环境适应能力上实现了显著提升,标志着机器人从“专用工具”向“通用智能体”迈出关键一步。 ## 什么是“全身智能”? 传统机器人往往依赖于预设程序或单一传感器输入,执行任务时动作僵硬,难以应对复杂多变的环境。Gemini Robotics 2 引入的“全身智能”理念,强调机器人需要协调全身的传感器、关节和算法,像人类一样综合视觉、触觉、力觉等多模态信息,从而做出连贯、灵活的动作。例如,当机器人搬运一个易碎物品时,它不仅用视觉判断位置,还会通过力反馈调整抓取力度,同时调整身体姿态以保持平衡。 ## 核心技术突破 1. **多模态感知融合**:系统整合相机、触觉传感器、惯性测量单元等多种数据源,构建统一的时空表示,使机器人能实时理解自身状态与周围环境。 2. **全身运动规划**:采用强化学习和模型预测控制相结合的方法,在模拟环境中训练机器人完成复杂动作,如爬楼梯、穿越狭窄通道,并平滑迁移到现实世界。 3. **自适应抓取与操作**:通过大规模仿真训练,机器人掌握了数百种物体的抓取策略,包括不规则形状、软性材料和透明物体,成功率较上一代提升约 30%。 ## 行业背景与影响 当前,人形机器人赛道竞争激烈,特斯拉 Optimus、波士顿动力 Atlas 等都在探索通用机器人能力。但多数系统仍依赖远程操控或高度工程化的环境。Gemini Robotics 2 强调的“全身智能”直接回应了机器人从实验室走向家庭、工厂、仓库等非结构化场景的核心挑战——鲁棒性和适应性。 DeepMind 并未披露 Gemini Robotics 2 的硬件平台细节,但指出该系统兼容多种机器人形态,包括双足人形和四足机器狗。这种平台无关性意味着其软件栈可能成为机器人操作系统的“智能层”,加速行业标准化。 ## 未来展望 尽管 Gemini Robotics 2 在仿真中表现亮眼,但现实世界部署仍面临电池续航、计算功耗和安全性等工程难题。不过,其多模态融合与全身协调设计,为机器人实现“感知-决策-执行”闭环提供了可行路径。随着大模型与机器人技术的交叉加深,我们有理由期待更智能、更灵活的机器人助手出现在日常生活之中。

Hacker News6191个月前原文

## 一句话总结 **Tokenless** 是一个智能 API 网关,通过动态路由、并行推理和早期淘汰机制,在不牺牲输出质量的前提下将 AI 推理成本降低一半以上。 ## 核心机制:用“并行试探”替代“盲目选择” 传统 LLM 调用通常固定使用某个模型(如 GPT-4o 或 Claude Opus),但 Tokenless 的做法完全不同: - 当用户发起请求时,Tokenless 会**同时向多个候选模型发送请求**(如 GPT-4o、Claude Sonnet、Gemini Flash 等)。 - 它实时监控每个模型的推理过程,一旦某个模型**明确给出正确方向的输出**,就立刻**选择该模型并取消其余请求**。 - 用户**只需为最终选中的模型付费**,其他模型的早期推理成本由 Tokenless 承担(因其推理量极小且可被缓存复用)。 这相当于用“并行试探”代替“事前猜测”,用少量额外计算换取模型选择的最优解。 ## 实测数据:质量持平,成本腰斩 Tokenless 在公开的 Agent 基准测试(如 τ³-Banking、Terminal-Bench、DeepSWE)上展示了惊人的性价比: | 方案 | 解决率 | 平均每任务成本 | |------|--------|----------------| | Tokenless Pro | 40.2% | $0.57 | | GPT-5.6 Sol | 33.0% | $1.50 | | Claude Opus 5 | 32.8% | $1.64 | | Tokenless Ultra Saver | 30.9% | $2.25 | | Claude Fable 5 | 26.8% | $2.58 | | Gemini 3.6 Flash | 24.5% | $3.32 | **Tokenless Pro 在解决率最高(40.2%)的同时,成本仅为 GPT-5.6 Sol 的 38%**,比 Claude Opus 5 便宜近 65%。 ## 落地方式:零代码替换,兼容 OpenAI/Anthropic 接口 Tokenless 提供与 OpenAI 和 Anthropic 完全兼容的 API 端点,用户只需将代码中的 base_url 替换为 Tokenless 的地址,即可立即开始使用。无需修改模型调用逻辑,也无需调整 prompt。 ## 团队背景与融资 Tokenless 由 Rohit、Andrew 和 Kev 三位联合创始人共同打造,团队来自 **Google DeepMind、普林斯顿大学和 UC Berkeley**,并获得 **Y Combinator** 投资。 ## 成本节省测算:以每月 4 万美元支出为例 根据 Tokenless 官网提供的计算器,假设当前每月 LLM 支出为 $40K,使用 Tokenless 后: - 新月度账单:约 $26K(节省 $14K,即 35%) - 请求重路由比例:42% - 未来 12 个月累计节省:约 $344K(假设 AI 支出以每月 11% 的增速增长) > 注意:上述测算基于公开 Token 价格和可配置路由假设,实际节省因流量模式而异。 ## 行业意义:AI 成本优化进入“路由时代” 随着大模型数量激增,企业面临的选择成本越来越高。Tokenless 的思路代表了一种新范式:**不再依赖单一模型,而是通过智能路由动态组合多模型能力**。这不仅降低了成本,也降低了供应商锁定风险。 对于 AI 应用开发者、SaaS 公司和内部 AI 平台团队来说,Tokenless 提供了一个即插即用的成本优化工具。随着模型推理价格持续下降,这种“模型路由”策略可能会成为标准实践。 ## 如何体验 - 官网:[usetokenless.com](https://usetokenless.com) - 支持预约演示,团队会针对实际流量进行成本测算 - 也支持直接替换两行代码自行验证

Hacker News711个月前原文

近日,一款名为 **TurboFieldfare** 的开源推理引擎在 Hacker News 上引发关注。它专为在 **M 系列 Mac** 上运行 **4-bit 量化的 Gemma 4 26B-A4B-IT** 模型而设计,仅需约 **2GB 内存**,即可实现本地高效推理。该项目完全使用 **Swift 和 Metal** 编写,充分利用 Apple 芯片的 GPU 能力,为端侧 AI 部署提供了新思路。 ## 核心亮点:极低内存占用 Gemma 4 26B 是 Google 最新发布的大语言模型,拥有 260 亿参数。在传统环境下,即使是半精度(16-bit)加载也需要约 52GB 显存,而 TurboFieldfare 通过 **4-bit 量化** 将模型体积压缩至约 2GB,同时保持可用的推理质量。这意味着即便是入门级 M1 MacBook Air(8GB 统一内存),也能流畅运行这一级别的模型。 ## 技术实现:Swift + Metal 深度优化 项目作者表示,TurboFieldfare 没有依赖现有的 ML 框架(如 MLX 或 Core ML),而是直接使用 **Metal 着色器** 编写自定义推理 kernel,针对 M 系列芯片的架构特点进行了逐层优化。这种“从零开始”的方法虽然开发成本高,但能最大程度地压榨硬件性能,实现低延迟推理。此外,Swift 的强类型和内存管理特性也帮助减少了不必要的开销。 ## 应用场景与意义 端侧 AI 一直是行业追求的方向,因为它能保障数据隐私、离线可用并降低云端依赖。TurboFieldfare 的出现,让 **Mac 用户** 可以像运行普通应用一样,在本地体验前沿大模型。对于开发者而言,它也是一个极好的研究平台——可以深入理解模型量化和推理加速的底层细节。 ## 局限与展望 目前 TurboFieldfare 仍处于早期阶段,仅支持 **Gemma 4 26B-A4B-IT** 这一特定模型,且未提供完整的 API 或聊天界面。作者表示后续计划增加更多模型支持、优化 token 生成速度,并考虑开源更多工具链。对于追求极致效率的 AI 发烧友来说,这无疑是一个值得关注的项目。 > 项目地址:GitHub 搜索 TurboFieldfare 即可找到。

Hacker News9151个月前原文

Hacker News 的魅力不仅在于用户分享的链接,更在于围绕这些链接展开的讨论。但长期以来,许多用户习惯性地将文章和评论分别打开在两个标签页中,来回切换,体验割裂。一位开发者受此困扰,动手编写了一个用户脚本(userscript),试图让阅读与讨论合二为一。 这个脚本的核心思路非常直接:**在文章页面内直接嵌入对应的 HN 评论线程**。用户无需再额外打开评论标签页,也无需手动寻找“讨论”链接。脚本会自动识别当前页面是否来自 HN,并利用 HN 的 API 获取评论数据,然后以浮动侧边栏或内嵌区域的形式展示在文章旁。如此一来,阅读正文与浏览评论可以并行进行,大大减少了上下文切换的成本。 从技术实现上看,这类脚本通常依赖于 **GreaseMonkey** 或 **Tampermonkey** 等用户脚本管理器,通过匹配 HN 的域名和 URL 模式来触发。脚本会解析页面上的 HN 链接或通过 API 查询当前文章的 HN 提交,再渲染评论树。由于 HN 的 API 开放且结构简单,实现并不复杂,但需要考虑评论的实时更新、性能优化以及不同网站布局的兼容性。 这一小工具折射出的是更广泛的用户需求:**内容与讨论的深度融合**。在 Reddit、Twitter 等平台,评论本身就是内容的一部分;而在 HN 这类以链接聚合为主的社区,评论往往被当作“附属品”,需要额外跳转。脚本的出现,本质上是在填补平台原生体验的空白。类似的做法在社区中并不少见,例如有些浏览器扩展会将 HN 评论直接嵌入到新闻网站的文章中,或者将 Reddit 讨论与文章并列展示。 对于重度 HN 用户而言,这种改进虽小,却能显著提升信息消费效率。尤其是当文章较长或讨论热烈时,能够一边阅读一边浏览评论观点,甚至直接参与讨论,体验会流畅得多。当然,这也带来一些取舍:例如页面加载时间可能增加,评论区域可能干扰阅读排版,以及需要信任第三方脚本的安全性。 总的来说,这个用户脚本是典型的“小工具解决大痛点”案例。它没有引入复杂的新功能,而是针对一个日常操作中的微小不便,给出了轻量而优雅的解决方案。对于经常在 HN 上“双开标签页”的用户,这或许就是那个能省下几秒、却让整个浏览体验更连贯的小改进。

Hacker News4331个月前原文

OpenAI 近日在 Hacker News 上以 288 分和 62 条评论的热度发布了 **Codex Security**,这是一款专注于代码安全漏洞查找、验证与修复的 CLI 工具和 TypeScript SDK。该工具旨在帮助开发者在本地仓库、代码审查变更以及 CI 流程中自动执行安全扫描,并持续追踪发现结果。 ## 核心功能与工作流 Codex Security 提供命令行和编程接口两种使用方式。开发者可以通过简单的命令完成安装、登录和扫描: ```bash npm install @openai/codex-security npx codex-security login npx codex-security scan . ``` 扫描结果会生成报告,并存储在 Codex Security 工作台状态目录中。如果默认目录无法写入,可通过环境变量 `CODEX_SECURITY_STATE_DIR` 指定其他可写路径。 ## 认证与 CI 集成 工具支持两种认证方式:**ChatGPT 登录**(交互式)和 **API Key**(适合 CI 环境)。在 CI 中,只需设置 `OPENAI_API_KEY` 环境变量即可跳过登录步骤。如果同时存在两种凭证,交互式扫描会询问用户选择,而非交互式(如 CI)则默认优先使用 API Key。用户也可通过 `--auth chatgpt` 或 `--auth api-key` 参数显式指定。 ## 环境要求与 SDK 使用 Codex Security 要求 **Node.js 22+** 和 **Python 3.10+**。除了 CLI,还提供了 TypeScript SDK,让开发者能以编程方式集成安全扫描功能: ```typescript import { CodexSecurity } from "@openai/codex-security"; const security = new CodexSecurity(); const result = await security.run("."); console.log(result.reportPath); await security.close(); ``` ## 行业背景与意义 在 AI 辅助编程日益普及的当下,代码安全漏洞的检测与修复成为关键挑战。OpenAI 此前已推出 Codex 系列模型用于代码生成,而 **Codex Security 则进一步将 AI 能力应用于安全领域**,帮助开发者在开发早期发现并修复漏洞,降低安全风险。该工具的发布也反映了业界对于“安全左移”(Shift Left Security)趋势的持续关注,通过将安全检查集成到 CI 流程中,实现自动化、持续化的安全防护。 目前 Codex Security 尚处于早期阶段,但其背后是 OpenAI 在代码理解与生成方面的深厚积累。对于使用 OpenAI 生态的开发者而言,这是一个值得关注的安全补充工具。更多详细信息可参考官方文档。

Hacker News5971个月前原文

Anthropic 的研究人员利用其前沿 AI 模型 **Claude Mythos Preview**,在密码学领域取得两项重要发现:一是改进了对后量子数字签名方案 **HAWK** 的攻击,二是找到了一种针对轮数缩减版 **AES** 的新型攻击方法。这些发现属于研究层面的重大进展,目前尚未影响任何生产系统。该成果标志着 AI 从发现代码实现错误向发现算法本身数学缺陷的跃迁,对后量子密码标准化和对称密码安全性评估具有深远意义。 ## 从软件漏洞到数学弱点 此前,Claude Mythos Preview 已展示出自主发现并利用软件漏洞的能力,包括多个主流密码学库中的实现错误。而本次突破在于,Claude 首次能够发现 **算法本身的数学缺陷**,而非仅仅代码层面的实现错误。密码学算法是数字安全的基石,例如数字签名方案用于验证网站身份,对称密码用于加密通信内容。一旦这些算法存在根本性弱点,可能危及数十亿用户的数据安全。 ## 两项关键发现 ### 1. 改进攻击:后量子签名方案 HAWK **HAWK** 是一种为后量子时代设计的数字签名方案,旨在抵御量子计算机的攻击。2022 年,美国国家标准与技术研究院(NIST)曾公开征集能够抵抗量子计算的额外密码系统。Claude 发现的改进攻击显著削弱了 HAWK 的安全性,尽管目前该方案尚未广泛应用于生产环境,但这一发现为后量子密码标准化工作提供了重要警示。 ### 2. 新型攻击:轮数缩减版 AES **AES** 是使用最广泛的对称密码算法。Claude 识别出一种针对轮数缩减版 AES 的新攻击方法。轮数缩减版通常用于学术研究或轻量级场景,但这一发现可能推动对完整 AES 算法安全边界的再评估。 ## 行业影响与展望 这两项成果目前均为研究性质,不直接影响任何实际系统。然而,它们明确展示了 **强大 AI 模型在密码分析中的潜力**:AI 不仅能发现已知算法的实现漏洞,还能主动探索算法结构的数学弱点。随着后量子密码标准化进程加速,AI 辅助的密码分析可能成为评估新算法安全性的常规手段。Anthropic 表示,将继续与密码学界合作,确保这些发现能提升而非削弱整体安全水平。

Hacker News2321个月前原文

## 当形式化验证遇上AI生成代码:3D网格交集实现的新范式 近日,一个名为“Formally verified 3D CSG”的项目在Hacker News上引发关注。该项目号称是**首个经过形式化验证的3D构造实体几何(CSG)操作实现**——具体来说,是一个在Lean 4中实现的**网格交集**算法。其核心亮点在于:人类审查者只需阅读93行形式化规范,并运行Lean检查器,即可认证内核的正确性,而无需信任由AI编写的1000多行实现代码。 ### 信任的转移:从AI代码到规范 在AI辅助编程日益普及的今天,生成的代码是否可靠始终是悬在开发者头上的“达摩克利斯之剑”。该项目通过一种巧妙的方式规避了这一问题:AI不仅编写了实现代码,还**自主撰写了超过60,000行的Lean证明**,但这些证明同样无需人工审查。Lean检查器在编译时确保实现与规范一致,**零信任**被置于任何大语言模型(LLM)之上。开发者只需聚焦于那93行简洁的规范——它精确描述了结果网格的表面,并保证了三角剖分的实际良构性条件。 ### 性能的权衡:正确性优先 当然,这种严格的形式化验证并非没有代价。根据项目披露,其内核计算两个各含7万个三角形的斯坦福兔子网格的交集需要**24秒**,远慢于当前最先进的网格交集实现。项目明确表示,其优先目标是**最小化人类审查正确性的工作量**,而非追求极致性能。不过,作者指出这种性能差距并非形式化验证的根本局限——原则上,形式化验证软件可以达到与传统软件相同的速度。 ### 背景与形式化 三角网格通常被视为3D空间中实体的边界表示,但实际应用中往往存在自交、非流形等问题。该项目的形式化规范不仅定义了精确的表面,还保证了实用的良构性条件,如闭合性、无自交等。这意味着输出网格在数学上是可靠的,尽管在网格细化程度等其他未形式化的标准上可能并非最优。 ### 行业意义 这一项目为AI代码的可信性提供了新思路:**将AI作为黑盒生成器,而将信任锚定在形式化规范和证明检查器上**。对于需要高安全性的领域(如CAD、医疗影像、机器人仿真),这种方法可能比依赖代码审查或测试更为可靠。同时,它也展示了Lean 4在复杂几何计算验证中的潜力。 ### 结语 虽然当前性能尚不实用,但该项目无疑为形式化验证与AI生成代码的结合树立了一个里程碑。它提醒我们:在追求AI效率的同时,**形式化方法仍然是确保关键系统正确性的“黄金标准”**。随着形式化验证工具链的成熟和AI证明能力的提升,未来或许会出现更多“规范可信、实现黑盒”的可靠系统。

Hacker News1151个月前原文