SheepNav
新上线今天0 投票

开放权重AI模型正逼近前沿,安全鸿沟依然显著

一份来自 SaferAI 的最新报告指出,Z.ai 推出的开放权重模型 GLM-5.2 在能力上已接近前沿闭源模型,但在安全缓解措施方面存在明显缺失。这一发现再次引发行业对开放模型可能超越治理与防护的担忧。

能力跃升,安全滞后

报告显示,GLM-5.2 在多项基准测试中的表现已可与顶尖闭源模型媲美,甚至在部分任务上有所超越。然而,该模型在对抗性攻击、越狱提示和有害内容生成等方面的防御能力明显不足。SaferAI 的测试团队通过一系列标准安全评估发现,GLM-5.2 在拒绝有害指令、避免生成偏见内容以及防止信息泄露等关键指标上,均落后于同等能力的闭源系统。

开放模型的“双刃剑”效应

开放权重模型的优势在于可定制性、透明度和社区驱动的改进,但这也意味着一旦发布,开发者无法完全控制其使用方式。SaferAI 在报告中强调,当模型能力接近前沿时,缺乏足够安全护栏的开放模型可能被恶意利用,例如用于制造虚假信息、进行网络攻击或生成深度伪造内容。

治理与技术的赛跑

近年来,AI 安全研究社区一直在呼吁更严格的监管和更完善的安全评估框架。然而,模型能力的迭代速度远超治理措施的落地。SaferAI 的报告指出,尽管部分前沿实验室已采用“红队测试”和“责任发布”等做法,但开放权重领域的标准仍不统一,许多模型在发布前未经过充分的安全验证。

行业反应与未来展望

Z.ai 尚未对报告作出公开回应。一些研究者认为,开放模型的安全问题可以通过社区协作和后续补丁来缓解,但 SaferAI 坚持认为,必须在模型发布前就内置安全机制,否则风险将难以控制。

随着 GLM-5.2 等模型的问世,AI 社区正面临一个关键抉择:如何在鼓励创新与确保安全之间取得平衡。报告建议,开源社区应制定更严格的安全发布准则,并推动建立第三方审计机制,以缩小能力与安全之间的鸿沟。

目前,关于 GLM-5.2 的具体安全缺陷细节尚未完全公开,但 SaferAI 表示将在未来几周内发布完整的技术报告。这一事件无疑为 AI 治理的紧迫性敲响了警钟。

延伸阅读

  1. Shopify:AI搜索带来更多流量与销售,而非取代谷歌
  2. Hark 预览浏览器代理 Hark Handoff,宣称更快更便宜
  3. 谷歌宣布9月4日彻底关闭手机上的Assistant,Gemini全面接管语音助手
查看原文