新上线今天0 投票
Amazon Bedrock 推出自动策略细化功能,简化 AI 安全验证
在 AI 安全领域,确保模型输出符合预期是一个持续挑战。今天,亚马逊云科技宣布在 Amazon Bedrock 中推出 Automated Reasoning 策略的自动细化功能,旨在简化安全策略的调试流程。此前,开发者需要手动进行诊断、编辑、重测的循环,这一过程繁琐且耗时。现在,新的细化引擎可以自动诊断失败的测试,并提出基于形式逻辑的修复建议,但所有变更都需要人工批准后才会生效。
Automated Reasoning 检查是 Amazon Bedrock Guardrails 的一部分,它通过形式验证来证明答案的正确性。在从自然语言到形式逻辑的明确转换中,其验证准确率据称可达 99%(根据 GA 公告)。其工作流程包括两步:首先,将自然语言输入/输出转换为变量;然后,将策略中的形式规则应用于这些变量。当测试失败时,根本原因通常出在这两个步骤之一,而新的细化模式正是针对这些不同环节设计的。
此次发布引入了两种细化模式:
- 迭代细化(Iterative Refinement):针对规则问题,自动调整形式逻辑规则。
- 模糊变量细化(Ambiguous Variable Refinement):针对语言问题,解决变量描述或翻译中的歧义。
该功能提供了完整的 API 工作流,支持启动、轮询和检索结果,同时也在控制台中提供了可重复的操作流程,帮助用户将失败的策略转化为通过的策略。
这一更新显著降低了策略调优的技术门槛,使得开发者可以更高效地构建和验证 AI 应用的安全边界。值得注意的是,虽然自动细化能够提出修复建议,但最终的控制权仍掌握在开发者手中,每一次修改都需要人工确认,这确保了安全策略的变更始终是审慎和可追溯的。对于依赖 AI 生成内容的企业而言,这无疑是一个提升安全性和合规性的重要工具。

