深度随机神经网络(如深度随机向量函数连接网络 dRVFL 及其集成版本 edRVFL)在分类任务中表现出色,但现有模型对所有训练样本一视同仁,这限制了它们在含有噪声和异常值的真实世界数据集上的鲁棒性。此外,污染特征在隐藏层间的传播会损害模型的决策能力。针对这些问题,研究人员提出了一种基于直觉模糊集理论的新框架,通过区分干净样本、噪声和异常值,显著提升了模型性能。 ## 核心思路:从均匀对待到自适应加权 传统 dRVFL 和 edRVFL 模型在训练时对所有样本赋予相同的权重,这导致模型容易受到噪声和异常值的干扰。新提出的 **IF-dRVFL** 和 **IF-edRVFL** 框架引入直觉模糊集理论,利用样本的邻域信息,在核空间中为每个样本计算隶属度(membership degree)和非隶属度(non-membership degree)。 - **隶属度**:基于样本到其所属类别质心的距离计算,距离越近,隶属度越高,表示该样本越能代表其类别。 - **非隶属度**:衡量样本在局部邻域内的异质性,非隶属度高的样本更可能是噪声或异常值。 通过综合考虑这两个指标,模型能够为训练样本分配自适应权重,从而有效区分干净样本、噪声和异常值。 ## 实验验证:在噪声环境下表现优异 研究团队在 **UCI** 和 **KEEL** 基准数据集上进行了大量实验,包括在有无高斯噪声的情况下。实验结果表明,**IF-dRVFL** 和 **IF-edRVFL** 在分类准确性和鲁棒性上均优于现有的模糊和非模糊方法。特别是在噪声环境下,新模型的优势更加明显,这得益于其对样本质量的精确感知。 ## 意义与展望 这项研究为深度随机神经网络提供了一种新的鲁棒性增强策略。通过引入直觉模糊集理论,模型不仅能够处理噪声和异常值,还保持了较高的计算效率。此外,该框架的代码已公开,便于其他研究者复现和进一步探索。 未来,该工作可能扩展到更复杂的任务,如回归、聚类,以及与其他深度学习架构的结合。同时,如何进一步优化非隶属度的计算效率,也是值得研究的方向。
在追求大语言模型推理效率的过程中,低精度数据类型已成为降低计算与存储成本的关键手段。然而,现有大多数格式仅优化了标量数值的保真度,却未充分考虑乘积运算带来的数值偏差。为此,研究者提出了一种名为 **CurveFP** 的新型数据类型家族,通过代数设计实现乘积封闭性,在保持数值精度的同时简化了硬件实现路径。 ## 设计思路:从标量优化到算术协同设计 CurveFP 的核心创新在于**封闭乘积码本**。它将量化后的数值幅度分布在一系列交错的对数曲线上,并采用紧凑的块缩放因子。通过引入**有理基数**,CurveFP 能够在动态范围与局部分辨率之间灵活调节,而统一的曲线索引则保证了任何非零乘积在代数上都是封闭的——即乘积结果仍落在同一码本中。这一特性使得乘积运算简化为精确的符号异或(XOR)与整数索引更新,大幅简化了浮点乘法的复杂度。 ## 量化配置与性能表现 CurveFP 提供了两种实例化配置:**CurveFP8(E4C3/E5C2)** 用于训练阶段,**CurveFP7(E3C3)** 用于紧凑部署。实验结果显示: - **推理质量**:在 4 个 7B~9B 参数模型上,CurveFP7 使用比 FP8 少一位的位宽,困惑度(perplexity)仍优于张量级 FP8,且与原生精度差距保持在 1.32% 以内。 - **数值精度**:在 36 组前向与反向 GEMM 对比中,CurveFP8 的操作数 NMSE(归一化均方误差)均低于 FP8。 - **预训练效果**:在 3 个 128.3M 参数的对照实验中,所有模式均完成 3B token 的预训练。CurveFP8 的平均 BF16 推理困惑度为 22.5366,优于 FP8 的 22.5407,且在所有种子中格式引入的惩罚更低。 - **下游任务**:在 36 组 WikiText-103 困惑度比较中,CurveFP8 训练的检查点在全部 12 组种子-格式对比中表现更优,PG-19 与任务级指标则各有胜负。 ## 意义与展望 CurveFP 的价值不仅在于数值效率,更在于**算术协同设计**的视角:它不再将数据类型视为静态的存储格式,而是将其与运算逻辑深度融合。这种设计有望为未来低精度推理芯片提供更简洁的乘法路径,减少硬件开销,同时保持接近 FP8 的数值行为。尽管目前结果基于中等规模模型,但其在 7B~9B 模型上的优势暗示了在更大规模上的潜力。后续研究可探索其与剪枝、蒸馏等技术的结合,进一步释放效率红利。
随着大语言模型(LLM)在现实世界任务中的广泛应用,外部工具的调用已成为其能力扩展的关键一环,而工具文档的质量直接影响智能体的任务执行效果。然而,现有研究大多将工具文档视为固定输入,鲜有深入探讨不同信息字段对智能体性能的影响。针对这一空白,来自复旦大学等机构的研究团队提出了一种自适应工具文档优化框架 **DocsChisel**,通过动态调整文档内容,显著提升了 LLM 智能体的任务成功率。相关论文已发表于 arXiv(编号:2608.10037)。 ## 研究背景:工具文档为何重要? LLM 智能体在执行复杂任务时,往往需要调用外部 API 或工具,而工具文档作为连接模型与工具的桥梁,其信息完整性、准确性和可读性直接影响模型对工具功能的理解与使用。以往研究多聚焦于改进智能体的工具选择与调用策略,却忽视了文档本身的可优化空间。尽管已有如 EasyTool、DRAFT 等工作尝试通过重写或压缩来优化文档,但关于不同信息字段在不同场景下的实际效用,仍缺乏系统性认识。 ## 核心发现:文档信息字段的异质性 研究团队首先进行了一项大规模实证研究,分析了现有工具文档中信息字段的分布情况,发现不同文档在字段类型和内容上存在显著差异。更为关键的是,**信息字段的有效性高度依赖于具体任务领域、LLM 基础模型以及智能体范式**。例如,某些字段在代码生成任务中至关重要,但在问答任务中可能冗余;同一字段在不同 LLM 上的表现也可能截然相反。这意味着,不存在一种通用的固定文档模板能够适配所有智能体设置。 ## DocsChisel:从失败中学习,迭代优化 基于上述发现,研究者设计了 **DocsChisel** 框架,其核心思想是“从失败中学习”。具体而言,DocsChisel 会分析目标智能体在任务执行过程中的失败轨迹,识别由文档问题引发的错误,进而针对每个工具动态地添加、删除或修改信息字段。这种迭代优化机制使得文档能够适应特定智能体的需求,而非一刀切。 ## 实验表现:性能大幅提升,开销可控 在多项基准测试中,DocsChisel 与现有最优方法(如 EasyTool、DRAFT)进行了对比。结果显示,**DocsChisel 将智能体的任务成功率平均提升了 95.89%**(相对于原始文档),并且比现有基线方法**平均高出 75.15%**。同时,其优化过程所需的时间和 Token 开销均处于可接受范围,展示了良好的实用性与扩展性。 ## 总结与展望 DocsChisel 的提出为 LLM 智能体的工具文档优化提供了新思路,强调文档的“个性化”与“动态性”。未来,随着智能体应用场景的不断丰富,这种自适应文档优化机制有望成为提升 LLM 系统整体性能的重要一环。研究者也指出,当前框架主要针对单轮优化,未来可探索多智能体协作场景下的文档协同优化。
近年来,基于大语言模型(LLM)的智能体工作流(Agentic Workflows)逐渐成为构建可靠自动化系统的关键抽象。然而,设计高质量的工作流仍然高度依赖人工经验和领域知识,这成为该技术大规模落地的瓶颈。针对这一问题,复旦大学的研究团队提出了**FlowScout**,一种从历史任务记录中自动生成工具集成型代理工作流的执行引导框架。相关论文已提交至arXiv(编号:2608.10039)。 ## 现有方法的局限 目前,已有研究尝试从历史任务解决记录中自动生成代理工作流,但这些方法主要生成**以LLM为中心**的工作流,即真实工具的执行被抽象并由LLM节点模拟。这种方式虽然降低了建模难度,却导致生成的工作流在实际运行中稳定性和可用性不足。工具调用的真实反馈缺失,使得工作流难以适应真实环境中的不确定性和错误。 ## FlowScout的核心设计 FlowScout将代理工作流表示为有向图,包含LLM节点、工具调用节点以及依赖边。其构建过程分为两个阶段: - **初始骨架挖掘**:从历史记录中提取常见的工具协调模式,构建初始工作流。 - **拓扑优化**:基于蒙特卡洛树搜索(MCTS),利用执行反馈不断调整工作流拓扑,以提升整体性能。 这种设计使得生成的流程不仅包含LLM的决策,还真实地集成了工具调用,从而更贴近实际应用场景。 ## 实验结果:显著提升 研究团队在四个代表性任务域上对比了FlowScout与三个基线方法(PM4Py、ReAct和AFlow)。实验结果显示: - **工具调用正确性**提升至少**92.69%**; - **执行质量**提升至少**17.66%**; - 多次运行之间的性能波动也更低,说明FlowScout生成的流程具有更好的稳定性。 这些数据表明,FlowScout在生成可靠、稳定的工具使用流程方面具有显著优势。 ## 意义与展望 FlowScout的提出,为自动构建高质量代理工作流提供了一条新路径。它通过引入执行反馈机制,弥补了以往方法中工具执行被抽象化的缺陷,使得生成的工作流更贴近实际部署需求。未来,该方法有望在RPA、智能客服、数据分析等需要复杂工具调用的场景中发挥重要作用。不过,论文目前尚未公开代码,实际应用效果仍需进一步验证。
随着大语言模型(LLM)越来越多地被用于代表用户执行任务,如何确保模型真正理解并遵循用户的潜在偏好,已成为一个关键挑战。然而,现有的评估基准大多聚焦于风格模仿或通用工具调用,很少触及决策层面的个性化。为此,研究人员推出了 **UserToolBench**,一个专门测试工具使用型 LLM 在个性化决策能力上的新基准。 ## 核心设计:隐藏用户画像,考验真实决策 UserToolBench 的独特之处在于“用户画像隐藏”设计。模型在测试时无法直接看到用户的显式画像,而必须从多轮交互历史中**推断用户的潜在偏好**,并在信息不完整时主动判断是否需要澄清,最终生成符合用户意图的工具调用轨迹。这种设计更贴近真实应用场景——用户不会总是清楚地表达自己的全部需求。 该基准基于隐私清洗后的真实交互轨迹构建,融合了结构化人物画像、公共 API 风格的工具生态以及长周期多轮对话。具体数据规模包括:**10 个用户画像、36 个工具集、1,065 轮对话、170 个独立工具**,并覆盖三类任务:信息缺失场景、单工具调用、多工具协调。 ## 实验结果:现有模型仍有明显短板 研究团队对当前主流的工具使用型 LLM 进行了测试,结果显示,这些模型在个性化委托任务上仍存在显著困难。主要瓶颈集中在三个方面: - **多工具协调**:在需要调用多个工具并协调其顺序和参数时,模型表现不佳。 - **缺失约束推断**:当用户没有明确给出某些条件时,模型难以从上下文中推断出隐含约束。 - **长周期行为一致性**:在多轮对话中,模型容易偏离用户偏好,无法保持行为的一致性。 这些发现表明,仅让模型输出听起来像特定用户的文本是远远不够的,真正的个性化要求模型能够**为用户做出正确的决策**。 ## 意义与启示 UserToolBench 的提出为个性化评估提供了新思路:从“风格模仿”转向“决策正确性”。这对于 AI 助手、智能代理等应用的发展具有重要意义。未来,工具使用型 LLM 需要在理解用户深层需求、主动澄清歧义以及跨任务保持一致性方面做出更多改进。 该研究由多所机构的研究人员合作完成,论文已提交至 arXiv(编号:2608.10042),目前正在同行评审阶段。
在机器学习领域,从成对比较中学习物品奖励是一个基础且广泛研究的问题,其应用涵盖推荐系统、社会选择以及大型语言模型的微调等。然而,当这些比较数据来自众包平台(如Amazon Mechanical Turk、Scale AI)时,一个现实挑战是工人可能因领域知识有限或追求利益最大化而提供不可靠的标注,甚至故意“灌水”。传统方法往往假设工人具有一致的可靠性,但现实中并非如此。针对这一问题,一篇被UAI 2026接收的论文提出了一种联合学习框架,旨在同时估计物品奖励和工人可靠性,从而在噪声数据中提取真实信号。 ## 核心思想:引入工人能力参数 该研究采用**Boltzmann-rational模型**,它是Bradley-Terry-Luce模型的扩展,通过引入工人能力参数来刻画不同工人的可靠性。在这个模型下,每个工人的比较结果不仅取决于物品之间的真实差异,还受到其自身能力的影响。作者的目标是设计一种算法,能够从这些带有噪声的成对比较中,同时推断出物品的潜在奖励值和每个工人的可靠性水平。 ## 技术亮点:Polya-Gamma变量与EM算法 为了实现这一目标,研究者提出了一种基于**EM(期望最大化)算法**的解决方案。关键创新在于引入**Polya-Gamma潜变量**,将逻辑似然函数转换为条件高斯形式,从而简化了优化过程,并在E-step中得到一个简洁的Q函数。这一技巧将问题转化为一个**矩阵感知(Matrix Sensing)问题**,使得算法能够利用成熟的优化理论,并提供了**理论收敛保证**。这意味着,在合理条件下,算法能够稳定地收敛到最优解,为实际应用提供了可靠性。 ## 实验验证:鲁棒性与实用性 论文在真实世界和合成数据集上进行了大量实验,结果表明所提算法在多个基线上具有显著优势,并且对**垃圾信息(spammers)和对抗性工人**表现出很强的鲁棒性。即使在工人故意提供错误比较的情况下,算法仍能准确估计物品奖励,这在实际众包场景中尤为重要。实验还验证了算法在奖励学习任务中的有效性,例如在偏好排序和模型微调中的应用。 ## 行业意义与未来方向 这项研究对于依赖众包数据的人工智能应用具有重要价值。在大型语言模型的强化学习微调(如RLHF)中,人类反馈的质量直接影响模型性能。通过联合建模工人可靠性,可以更有效地筛选高质量反馈,减少噪声干扰,从而提升模型的对齐效果。此外,该方法的矩阵感知形式也为其他类似问题提供了新思路。未来,研究者可以探索更复杂的模型,如考虑工人偏好的动态变化,或将其扩展到更广泛的反馈类型。 总之,这项研究为解决众包比较数据中的可靠性问题提供了一套优雅且实用的解决方案,有望在推荐系统、人机协同和AI对齐等领域产生深远影响。
联邦学习(Federated Learning)面临的核心挑战之一是如何在数据分布、感知模态、模型架构、潜在空间维度乃至本地学习目标各异的异构系统中,让各智能体有效学习并交换信息丰富的表示。传统方法往往假设存在一个共享的全局潜在空间,但在现实场景中这一假设往往不成立。近期,arXiv 上发布的一项研究提出了一种名为 **Sheaf-based Federated Representation Learning(SFRL)** 的新框架,通过引入可学习的层(sheaf)限制映射,以几何对齐的方式实现全局一致性,无需共享潜在空间。该研究由 Gabriele D'Acunto 等多位学者合作完成,论文编号为 arXiv:2608.10016。 ## 核心思想:用层结构对齐潜在表示 SFRL 的灵感来源于数学中的层论(sheaf theory),它不要求所有智能体拥有相同的潜在空间,而是通过**正交变换和等距嵌入**来对齐相邻智能体的潜在表示。具体来说,每个智能体维护自己的本地模型,同时通过一个基于**层拉普拉斯算子(sheaf Laplacian)的二次粘合正则项**来约束相邻表示的一致性。该正则项的权重由可学习的限制映射决定,这些映射能够根据观测数据自适应调整几何结构,从而适应异构环境。 ## 算法设计:Sheaf-FRL 的交替优化 为了高效求解 SFRL,研究者提出了 **Sheaf-FRL 算法**,该算法在本地模型的梯度更新与边限制映射的闭式 Procrustes 更新之间交替进行。Procrustes 分析是一种经典的正交对齐技术,这里用于调整限制映射以最小化对齐误差。此外,正则项的评估仅基于一小部分共享的 pilot 样本,从而保证了可扩展性和通信效率。理论分析表明,Sheaf-FRL 在确定性和随机设置下均能收敛到一阶稳定点。 ## 应用验证:语义通信中的协作分类 在实验部分,研究者将 SFRL 应用于**语义通信**场景下的协作分类任务,并考虑了模型和数据异构性。结果表明,与基线方法相比,Sheaf-FRL 在不同程度的本地分布偏移下均能取得更高的本地及通信后分类精度,并且对潜在空间维度压缩表现出更强的鲁棒性。这意味着 SFRL 不仅提升了异构环境下的学习性能,还为带宽受限的通信系统提供了更高效的表示传输方式。 ## 意义与展望 这项研究为异构联邦学习提供了一种新的几何视角,突破了传统方法对共享潜在空间的依赖。通过层结构自适应地建模数据几何,SFRL 有望在分布式感知、边缘智能、多机器人协作等领域发挥重要作用。未来,研究者计划探索更复杂的层结构以及动态网络拓扑下的扩展,进一步推动该框架在实际系统中的应用。 对于关注联邦学习、多智能体系统或表示学习的读者而言,这篇论文提供了一个值得深入研究的理论工具和算法框架。
近期,游戏开发公司Saber Interactive陷入了一场关于AI取代人类编剧的争议。前首席编剧Stella Sacco在Bluesky上发文称,她在开发《Rideshare模拟器》期间被公司用ChatGPT取代,且游戏中的乘客语音也由AI生成。然而,Saber CEO Matthew Karch则坚决否认,声称“Saber和Unigine都没有用AI取代任何编剧”,游戏故事“完全由真人撰写”,仅有一个实验性免费模式因无限乘客数量而“必然”使用AI。 Sacco对此反驳称,如果游戏中既有她撰写的部分,又有AI生成的内容,那么AI确实被使用了,而她确实被取代了。她还透露,公司早在2023年12月就已告知她这一决定。 这场争议不仅关乎个人职业命运,更折射出AI在游戏产业中日益增长的渗透力。Saber自2001年成立以来一直倡导使用AI工具提升游戏体验,但此次事件引发的核心问题是:AI究竟是辅助工具还是替代者?当AI能够生成文本和语音时,编剧的角色边界在哪里? 目前,《Rideshare模拟器》的Steam页面尚未披露任何关于生成式AI使用的信息,这也引发了关于透明度的讨论。随着AI技术不断进步,游戏行业如何在创新与伦理之间找到平衡,将成为未来必须面对的课题。
近日,有消息称OpenAI和Anthropic的模型在提供“深度思考”(deep_think)工具时,会意外泄露其隐藏的思维链(Chain of Thought,CoT)内容。这一现象引发了AI安全与隐私领域的广泛关注。思维链是指模型在生成最终答案前,内部进行的一系列推理步骤,通常被视为模型的“私有思考过程”。此前,OpenAI和Anthropic等公司均表示会努力隐藏模型的内部推理细节,以防止用户诱导模型产生不安全行为或泄露敏感信息。然而,此次事件表明,当模型被赋予特定工具(如deep_think)时,其隐藏的思维链可能会被意外触发并暴露。 ## 事件背景 据Hacker News上的讨论,用户在使用某些提示词或工具时,模型会返回包含思维链内容的输出。这些内容通常以“内部推理”或“思考过程”的形式出现,有时甚至包括模型对自身指令的解读、对隐私政策的内部讨论等。这一现象不仅发生在OpenAI的GPT系列模型上,也出现在Anthropic的Claude模型中,引发了人们对模型安全机制有效性的质疑。 ## 安全影响 思维链的泄露可能带来多重风险。首先,攻击者可能利用泄露的思维链来逆向工程模型的内部决策逻辑,从而设计更有效的对抗样本或越狱提示,绕过安全限制。其次,思维链中可能包含训练数据中的敏感信息,导致隐私泄露。此外,如果模型在思考过程中表现出偏见或不当倾向,这些内容一旦公开,可能对模型提供商造成声誉损害。 ## 行业反应与应对 目前,OpenAI和Anthropic尚未就此事发表官方声明。但社区中已有讨论认为,模型提供商可能需要重新评估其安全机制,尤其是在工具调用场景下。一些研究人员建议,在模型输出中增加对思维链内容的过滤或脱敏处理,或者限制工具对内部推理的访问权限。然而,如何在保持模型透明度和保护内部安全之间取得平衡,仍是一个待解的难题。 ## 小结 此次事件再次提醒我们,AI模型的安全与隐私保护是一个持续博弈的过程。随着模型能力的增强和工具生态的扩展,新的漏洞和风险将不断出现。对于开发者和研究者而言,深入理解模型的内部机制,并设计更稳健的安全策略,将是未来重要的课题。
美国风险投资公司 Accel 宣布,其新设立的印度基金已获得超额认购,规模达 **5.5 亿美元**,并在数周内完成募集。这一速度令人瞩目,距其上一支 6.5 亿美元印度基金的关闭仅过去 **19 个月**。 ## 快速募资背后的信号 Accel 此次募资的快速完成,反映了全球投资者对印度初创企业生态的持续看好。尽管全球科技投资整体趋于谨慎,但印度市场凭借其庞大的数字消费群体、不断深化的技术人才库,以及日益成熟的创业环境,依然是资本追逐的热点。Accel 作为早期投资印度科技公司的先驱之一,其募资节奏的加快,可能预示着印度创投市场的新一轮活跃。 值得注意的是,Accel 在上一支基金中仍有 **超过 55%** 的资金尚未部署。这意味着,新基金的设立并非源于资金紧张,而是出于战略布局的考量。Accel 可能希望借此进一步扩大其在印度的投资版图,尤其是在人工智能、SaaS、金融科技等前沿领域。 ## 投资策略与市场影响 Accel 在印度的投资策略一贯注重早期阶段,曾成功投资了 Flipkart、Swiggy 等知名企业。新基金的到位,将使其能够继续支持印度初创企业从种子期到成长期的全程发展。对于印度创业者而言,Accel 的持续加码无疑是一个积极信号,表明顶级风投对印度市场的长期信心。 然而,新基金的快速募集也可能加剧印度早期投资的竞争。随着更多资本涌入,项目估值可能进一步推高,这对创业者和投资人而言既是机遇也是挑战。 ## 展望与不确定性 Accel 尚未公布新基金的具体投资重点和团队调整计划,但可以预见,其将继续深耕印度市场,并可能在人工智能等新兴技术领域加大布局。不过,全球宏观经济的不确定性,以及印度本土政策环境的变化,仍可能对投资节奏产生影响。 总体而言,Accel 此次超额认购的印度基金,不仅是对其自身投资策略的肯定,也是印度科技生态活力的又一佐证。未来,随着这些资本的逐步部署,印度初创企业有望迎来新一轮的创新浪潮。
**OpenAI 与 AWS 合作推出 Daybreak Red 和 Daybreak Blue 两款专用网络防御模型,现已通过 Amazon Bedrock 向合格客户开放。** 这两款模型旨在帮助企业更高效地应对网络安全挑战,从漏洞发现到事件响应,提供更智能的解决方案。 ## 模型亮点 - **Daybreak Red**:专注于攻击性安全测试,能够模拟攻击行为,帮助组织在真实攻击发生前发现系统弱点。 - **Daybreak Blue**:侧重于防御性安全操作,协助安全团队分析威胁情报、快速响应安全事件,并优化防护策略。 两款模型均基于 OpenAI 的先进 AI 技术,并针对网络安全场景进行了专门优化。 ## 安全与隐私保障 **一个关键特性是零操作员访问(zero-operator access)**,该机制在芯片层面强制执行,确保运行过程中 AWS 和 OpenAI 的员工都无法访问客户代码和漏洞数据。这种设计充分保护了数据隐私与安全,尤其适合处理高度敏感的安全信息。 ## 行业意义与落地场景 随着网络攻击日益复杂,传统防御手段往往力不从心。Daybreak 系列模型的推出,为安全团队提供了 AI 驱动的辅助工具,有望显著提升威胁检测与响应效率。 在实际应用中,企业可以利用 Daybreak Red 定期进行渗透测试,而 Daybreak Blue 则可以集成到安全运营中心(SOC)中,辅助分析师处理告警、关联威胁情报,甚至自动生成初步响应建议。 ## 可用性与展望 目前,这两款模型已通过 Amazon Bedrock 向符合条件的客户开放。AWS 与 OpenAI 的此次合作,不仅扩展了生成式 AI 在安全领域的应用边界,也为未来更智能的网络安全防御体系奠定了基础。 对于希望提升安全能力的企业而言,现在可以开始评估 Daybreak 模型在自身环境中的表现,探索其如何与现有安全工具链协同工作。 (注:本文基于 AWS 官方公告,具体功能与适用性建议直接咨询 AWS 或 OpenAI 获取最新信息。)
想象一下,你通过“氛围编程”快速打造的应用原型,被提交到一个服务平台上,经过验证、测试后,以可重复的自动化方式批量生产并交付给广大用户——这正是“软件工厂”在 AI 时代重新焕发生机的图景。 ## 软件工厂的回归 这个概念并不新鲜,早在 2008 年微软就曾大力倡导。彼时,软件开发正走向组件化和可复用,但受限于编码瓶颈,软件工厂未能成为主流。如今,随着 AI 基础模型和智能体(Agent)的编码能力突飞猛进,软件工厂再次成为焦点。 CloudBees 首席执行官 Moritz Plassnig 指出,过去即便有自动化和 DevOps 实践,编码仍是许多组织的瓶颈。招聘工程师既困难又昂贵,限制了软件交付的速度。而现在,AI 生成代码的能力让编码不再是主要约束,软件工厂的复兴因此有了坚实的技术基础。 ## AI 驱动的软件工厂如何运作 现代的软件工厂并非简单的自动化流水线,而是将整个软件开发生命周期拆解为可重复的模块,由 AI 模型和智能体协同完成。开发者提交原型后,系统会自动进行验证、测试,并通过预设的流程进行大规模部署和交付。这种模式不仅提高了交付效率,也改变了开发者的角色——从写代码的“工匠”转变为定义流程和审查结果的“架构师”。 Plassnig 强调,开发者工艺不会消失,但工程师的职责会更侧重于设计、监督和优化自动化流程,而非逐行编写代码。这意味着 IT 专业人员的技能要求正在升级,需要具备更强的系统思维和 AI 工具驾驭能力。 ## 为什么现在需要软件工厂 随着 AI 加速应用迭代,每日发布更新成为常态,传统的手工操作模式显然无法应对如此高频率的交付需求。软件工厂提供的自动化、标准化流程,正是应对这一挑战的关键。它能让组织在保证质量的前提下,以更快的速度响应市场变化,同时降低对稀缺工程师资源的依赖。 不过,软件工厂的落地仍面临挑战。如何确保 AI 生成代码的质量?如何定义合理的自动化边界?这些问题都需要在实践中不断探索。但可以确定的是,软件工厂的回归并非简单重复历史,而是 AI 时代软件工程范式的一次深刻变革。
OpenAI 于本周二正式推出 ChatGPT 的 Linux 桌面应用,以预览版形式向全球用户开放。这一举措填补了 ChatGPT 在 Linux 平台上的空白,使得该应用现已覆盖所有主流桌面操作系统。 长期以来,Linux 开发者社区对 ChatGPT 桌面版的呼声颇高。此次发布不仅满足了这部分用户的需求,还整合了 Codex 功能,让 Linux 用户能够使用 ChatGPT、ChatGPT Work 以及 Codex 等工具。 支持的系统包括 Ubuntu 24.04 和 26.04 LTS、Debian 13、Fedora 43 和 44 的桌面版本。尽管 Linux 发行版众多,OpenAI 选择的这些版本作为基础,许多下游发行版或变体也将兼容。 值得注意的是,OpenAI 的竞争对手 Anthropic 已在一个月前发布了 Claude 的 Linux 桌面应用,支持 Ubuntu 22.04 及以上、Debian 12 及以上。OpenAI 此举显然是在追赶竞争对手的脚步,力求在开发者社区中保持竞争力。 这一发布对 AI 行业意义重大。Linux 是许多开发者、数据科学家和系统管理员的首选系统,提供原生桌面应用可以提升用户体验,促进 AI 工具在专业领域的采用。同时,这也反映了 AI 公司对开发者生态的重视,通过覆盖更多平台来扩大用户基础。 目前,ChatGPT Linux 应用仍处于预览阶段,可能存在不稳定因素,但 OpenAI 的快速迭代和反馈机制有望在正式版中解决这些问题。对于 Linux 用户而言,这无疑是一个值得期待的好消息。
AI生成传单常常惨不忍睹,但掌握正确的提示词,效果可以天差地别。以下8个技巧与提示词,帮你用AI做出让人愿意多看一眼的传单。 ### 1. 明确目标与受众 AI不知道你的传单是给谁看的,所以提示词里必须说清楚。比如:“面向25-35岁城市白领的瑜伽班传单,强调减压与健康。” **示例提示词**:“设计一张A4传单,推广社区瑜伽课,目标人群是上班族,主打‘缓解工作压力’,风格清新自然。” ### 2. 提供具体内容,而非泛泛而谈 别只说“设计一张传单”,把标题、副标题、日期、地点、联系方式都写进提示词。AI能根据这些信息自动排版,减少后续修改。 **示例提示词**:“传单标题为‘夏日音乐节’,副标题‘7月20日-22日,中央公园’,包含演出阵容、票价和购票二维码,背景为夕阳下的舞台。” ### 3. 指定风格与氛围 AI有无数种风格,明确指定可以避免“四不像”。比如“复古手绘风”、“极简现代风”、“高对比度街头风”。 **示例提示词**:“用复古手绘插画风格设计咖啡店开业传单,主色调为暖黄色和深棕色,营造温馨怀旧的感觉。” ### 4. 控制文字数量 传单不是文章,文字越少越好。提示词里限定“最多3个标题行,正文不超过50字”,AI会自动精简。 **示例提示词**:“设计促销传单,文案精简,突出‘5折’和‘限时3天’,其余信息用图标代替。” ### 5. 利用AI的排版能力 AI擅长生成对称或网格布局,善用“居中排版”、“分栏”、“留白”等指令,让传单看起来专业。 **示例提示词**:“设计活动传单,使用居中对称布局,信息分三栏:时间、地点、嘉宾。” ### 6. 迭代优化,而非一次成型 第一次生成的传单往往有瑕疵,别放弃。继续追加提示词,比如“把标题放大”、“背景换成浅色”、“增加一个卡通吉祥物”。 **示例提示词**:“在现有基础上,将主标题字号增大40%,背景改为浅蓝色,并添加一个戴着耳机的卡通人物。” ### 7. 结合人工调整 AI生成后,用设计工具微调细节,比如字体、颜色、对齐。AI负责灵感,你负责完美。 **示例提示词**:“生成后,我会用Canva调整间距和字体,因此请确保各元素独立分层。” ### 8. 善用AI的批量生成能力 让AI一次生成多个版本,比如“生成5种不同风格的传单,分别对应简约、活泼、商务、文艺、科技感”,然后挑选最合适的。 **示例提示词**:“为新产品发布会设计5款传单,风格分别为:极简黑白、渐变科技、手绘涂鸦、杂志风、3D立体。” ## 总结 AI传单不好看,多半是提示词没写到位。把上面8个技巧用到你的提示词里,AI就能成为你的设计助手。记住:**明确目标、具体内容、指定风格、精简文字、善用排版、迭代优化、人工微调、批量生成**——这八步,足以让AI产出令人惊喜的传单。
谷歌近日宣布,其AI助手Gemini的月活跃用户数已突破10亿,成为公司历史上达到这一里程碑速度最快的产品。这一数字涵盖了Gemini应用、谷歌助手集成以及企业版等多种使用场景。 ## 增长动力与背景 Gemini的快速增长并非偶然。自2023年底发布以来,谷歌将其深度整合进搜索、安卓系统及Workspace等核心产品中,利用庞大的用户基础进行推广。此外,多模态能力的持续升级——从文本到图像、音频和视频的理解——也为它赢得了更广泛的应用场景。相比之下,ChatGPT达到10亿用户耗时更长,尽管其早期增长同样迅猛。 ## 市场与竞争格局 在AI助手赛道,用户规模是衡量影响力的关键指标。谷歌此举意在展示其技术实力和生态优势,尤其是在与OpenAI、微软等竞争对手的较量中。然而,用户数并不直接等同于盈利能力,如何将流量转化为可持续的商业模式仍是挑战。此外,随着模型发布节奏放缓,Gemini能否保持用户粘性也值得关注。 ## 潜在风险与未来展望 尽管增长亮眼,但Gemini也面临诸多挑战:一是AI监管趋严,隐私和数据安全问题可能影响用户信任;二是竞争加剧,开源模型和垂直领域助手的崛起可能分流用户;三是技术迭代的瓶颈,若创新停滞,用户新鲜感可能消退。 总体而言,10亿用户是里程碑,但也是新的起点。谷歌需要持续优化产品体验,探索差异化功能,并确保负责任地部署AI,才能在激烈的市场中巩固领先地位。
AI聊天领域的竞争正在进入一个全新的阶段。就在最近,谷歌CEO桑达尔·皮查伊在X上宣布,其AI助手Gemini的月活跃用户数已达到**10亿**,并且是谷歌历史上增长最快的产品。而在此之前,OpenAI的ChatGPT也刚刚跨过了这一里程碑,尽管官方公告显得有些低调。 ## 双双破亿,但增长节奏不同 谷歌的皮查伊在X上发文称,Gemini每月有**10亿人使用**,这标志着谷歌旗下第14个达到10亿用户的产品。谷歌发言人亚历克斯·约瑟夫表示,Gemini在上周就已达到这一数字,并在8月11日正式对外公布。值得注意的是,这一数据仅指Gemini应用本身,不包括谷歌将其嵌入其他产品的用户,但**预装在Android手机上的Gemini**似乎被计算在内。Gemini负责人乔什·伍德沃德还透露,Gemini在iOS上的活跃用户已超过1亿。 相比之下,OpenAI的ChatGPT在8月6日的一篇博客中“轻描淡写”地提到“超过10亿人正在使用ChatGPT”,并未大张旗鼓。OpenAI发言人林赛·麦卡勒姆证实,ChatGPT的月活跃用户数在更早前就已突破10亿,并在7月达到每周10亿用户。不过,这一里程碑的达成速度似乎有所放缓——OpenAI曾在今年2月公布ChatGPT的周活跃用户为9亿,五个月后达到10亿,对于曾被誉为“增长最快软件”的ChatGPT来说,这一增速的下降颇为明显。 ## 用户数据背后的复杂图景 直接比较月活与周活并不容易,但最直观的解读是:**ChatGPT的体量更大,而Gemini的增长势头更猛**。谷歌在2月宣布Gemini月活为7.5亿,7月底财报电话会上报告为9.5亿,如今达到10亿,增长轨迹清晰可见。而ChatGPT虽然仍是聊天机器人领域的领导者,但外部数据早在6月就预测其月活可能已破10亿,官方直到8月才确认。 此外,Anthropic的Claude虽然增长迅速,但该公司不公开用户数据,外界估计其用户数仍在数千万级别,尚难与两大巨头抗衡。 ## 竞争格局:双雄争霸,还是变局前夜? 从目前的态势看,AI聊天应用已进入**双寡头时代**。谷歌凭借Android系统的预装优势,为Gemini带来了巨大的流量入口,而OpenAI则依靠ChatGPT的品牌效应和技术积累,维持着用户粘性。然而,增速的差异可能预示着未来的变局:Gemini的快速崛起意味着谷歌在AI消费端的布局正在奏效,而ChatGPT的增长放缓则可能让OpenAI面临压力。 对于普通用户而言,10亿用户意味着AI聊天已成为主流应用,而不仅仅是极客的玩具。未来,谁能更好地平衡创新与商业化,谁能在多模态、个性化等方向上持续突破,或许将决定下一个10亿用户的归属。
谷歌CEO桑达尔·皮查伊在X上宣布,Gemini应用已成为公司增长最快的产品之一,月活跃用户数近期突破10亿。这一里程碑使Gemini与OpenAI的ChatGPT并驾齐驱——后者在6月刚刚达到月活10亿。皮查伊还指出,Gemini是谷歌第14个达到10亿用户的产品。 ## 增长背后的驱动力 谷歌一直在将Gemini深度整合到其产品生态中,包括搜索、Workspace、Android以及独立应用。其中,搜索中的AI模式表现尤为亮眼,全球月活跃用户已超过10亿。但需要注意的是,今天宣布的10亿数据仅指Gemini应用,不包括其他渠道的AI用户。 ## 用户如何使用Gemini 谷歌还分享了用户的使用习惯:**63%的Gemini用户使用语音功能直接与助手对话**,这表明语音交互正在成为主流。此外,**Gemini每天生成超过1.5亿张图片**,显示出其多模态能力的广泛应用。 ## 跨平台与生态扩展 Gemini的增长不仅限于谷歌自家产品。**在iOS平台上,Gemini的活跃用户已超过1亿**。这一里程碑紧随谷歌2026年第二季度财报电话会议之后,当时公司庆祝月活跃用户超过9.5亿,日活跃用户在过去一年中翻了三倍。 ## 未来展望 这一消息也恰逢谷歌即将举办的Made by Google活动,预计Pixel设备将搭载更多Gemini驱动的功能。与此同时,谷歌继续推出新模型和功能,包括专为改进编码和自主AI代理任务设计的**Gemini 3.5 Flash**。 谷歌在AI领域的快速追赶,不仅体现了其技术实力,也反映出AI助手市场的激烈竞争。随着Gemini用户基数的扩大,谷歌正试图在AI赛道上占据更有利的位置。
**OpenAI 再失一位核心高管。** 公司特别项目负责人、前首席运营官 Brad Lightcap 在任职八年后宣布离职。他在内部备忘录中表示将开启“新的事业”,并称未来几周仍会协助交接。 Lightcap 的职责在过去一年半中经历了多次调整。2025年3月,他的 COO 职责扩展至监督公司日常运营与全球部署。2026年1月,他退出企业产品与工程领导,但仍负责商业职能。4月,他正式卸任 COO,转而负责“特别项目”,直接向 CEO Sam Altman 汇报,其大部分原职责由首席营收官 Denise Dresser 接任。 Lightcap 并非近期唯一离开的高管。7月,AGI 负责人 Fidji Simo 因健康原因离职;4月,CMO Kate Rouch 也因健康问题卸任。此外,公司总裁 Greg Brockman 接管产品业务,并承诺削减“支线任务”。 这一系列变动正值 OpenAI 经历重大重组,业界关注其领导层稳定性。Lightcap 在备忘录中未透露新去向,但表示将从“不同视角”支持公司使命。
OpenAI 又失去一位核心高管。长期担任首席运营官(COO)的 **Brad Lightcap** 于本周二宣布离职,他在内部信中表示将“开启新事业”,并称“从不同的角度帮助大家推进使命”让他感到兴奋。 Lightcap 自 **2018 年**加入 OpenAI,起初担任首席财务官(CFO)四年,随后在 **2022 年**升任 COO,直至今年早些时候在管理层调整中转为负责特别项目。在加入 OpenAI 之前,他曾与 CEO Sam Altman 在风险投资公司 Y Combinator 共事。 在致员工的信中,Lightcap 回顾了在 OpenAI 的岁月,称自己“有幸搭建了大部分运营和业务团队的初版”,包括财务、法务、人事、公司事务、市场拓展和政府关系等。他表示,看着这些团队在优秀领导者带领下走向成熟,是这段旅程中最有意义的经历之一。 对于未来,Lightcap 语焉不详,但暗示了新的方向:“过去几个月,我一直在思考下一个前沿,以及什么会阻碍使命的成功。我相信,进入下一阶段,世界需要做好几件重要的事情。我很快会分享更多,但我比以往任何时候都更相信 OpenAI,并期待从不同视角帮助大家推进使命。” Lightcap 的离职正值 OpenAI 准备进行备受瞩目的 IPO,公司高层近期经历了一轮洗牌。**今年 7 月**,负责 AGI 开发的二号人物 Fidji Simo 宣布卸任;此外,前 Sora 视频生成器负责人 Bill Peebles、科学部门副总裁 Kevin Weil 等高管也相继离开。 此次人事变动对 OpenAI 而言,既是挑战也是机遇。一方面,核心高管的流失可能影响公司的战略稳定性和市场信心;另一方面,新血液的注入也可能带来新的视角和动力。在 AI 行业竞争白热化的当下,OpenAI 能否保持其领先地位,将取决于它如何应对这一轮组织变革。
**AI初创公司River AI在成立仅两个月后,便获得了高达11亿美元的融资,** 这一轮融资由General Catalyst和AMP PBC领投,Nvidia、AMD Ventures、Y Combinator和淡马锡参投。River AI由xAI联合创始人Igor Babuschkin创立,其愿景是彻底重塑AI,打造个人可训练的智能体,而非追求替代人类工人。 ## 从零开始重塑AI Babuschkin在DeepMind和OpenAI等机构拥有丰富经验,他计划从模型训练方式开始,端到端重建AI技术栈,包括训练、模型、产品层以及新型硬件,使个人AI能够贴近用户生活。他设想中的智能体更像“守护天使”,而非简单的任务执行工具。 ## 初期产品与API River AI已推出API,按每百万token计费,价格取决于所使用的开放模型。该API支持强化学习和低秩适配(LoRA)微调,旨在让开发者将开放模型训练成真正属于自己的模型,从而摆脱对提示工程的依赖。 ## 市场时机与未来展望 这轮巨额融资正值企业希望控制自身AI模型命运、采用混合模型(包括开放权重模型)的时期。River AI承诺通过其“neocloud”服务,让企业无需基础设施团队即可在15至20分钟内完成复杂的强化学习运行,成本比闭源方案节省2至4倍。 虽然如此年轻的初创公司获得如此规模的融资令人瞩目,但River AI的理念恰好迎合了市场需求,其未来发展值得关注。