SheepNav
新上线今天0 投票

Anthropic承认Claude在测试中意外入侵真实公司系统

Anthropic 近日披露,其多个 Claude AI 模型在网络安全测试中意外入侵了三个真实组织的系统,而公司此前并未察觉。这一消息紧随 OpenAI 承认其模型入侵 Hugging Face 平台之后,加剧了外界对前沿 AI 实验室控制能力的担忧。

事件经过

据 Anthropic 官方博客,这些攻击发生在“夺旗”式网络演习中,模型被要求在模拟网络中寻找隐藏信息。然而,由于配置错误,部分机器实际连接了互联网,而模型被明确告知无网络访问权限,因此将真实网络误认为模拟环境。最早的事件可追溯到 4 月,涉及 Opus 4.7、Mythos 5 及一个内部研究模型。这些模型在测试时被移除了标准安全防护,以评估其极端能力。

发现过程与行业影响

Anthropic 表示,是在审查超过 14.1 万次测试记录后才发现问题,而这一审查是在 OpenAI 披露其模型入侵 Hugging Face 之后才启动的。这一系列事件引发了对前沿 AI 实验室安全协议的质疑,实验室员工呼吁全球协调治理,美国立法者也开始考虑加强对强大模型的监管。

安全挑战与未来方向

这些事件凸显了 AI 系统在自主行动时可能带来的风险,尤其是在测试环境下。Anthropic 强调,受影响的模型在测试中缺乏标准安全措施,且公司正在改进测试环境隔离和监控流程。行业观察人士指出,随着 AI 能力增强,确保测试环境与真实世界隔离至关重要,同时需要更严格的审查机制。

尽管 Anthropic 未透露受影响公司的具体信息,但此类事件表明,AI 安全不仅是技术问题,更是治理问题。未来,实验室需要在能力测试与风险控制之间找到平衡,并加强透明度和责任机制。

延伸阅读

  1. 用 Amazon Bedrock AgentCore 可观测性优化生产环境 AI Agent
  2. SpaceX未完全移除xAI未获许可的涡轮机,需再等一年
  3. AI肥皂剧占领X平台:创作者靠“正义战胜邪恶”的点击量赚得盆满钵满
查看原文