SheepNav
精选昨天0 投票

让自我进化变得可审计:LLM智能体在信贷流程中的合规边界与准入闸门

当智能体开始“改写自己”,合规审查还剩下什么?

自我改进型 LLM 智能体可以根据新规则调整信贷流程,但问题在于:一个能够重写自己的智能体,会同时摧毁监管者赖以审查的证据链——一次具名的变更、一份可复现的测试记录、一个明确的审批动作。如果智能体的每一轮“进化”都不可追溯,那么合规就无从谈起。

arXiv 上最新发布的一篇论文(编号 2610.10629,作者 Ravil Akhtyamov)提出了一个清晰的边界主张:自我进化只有在被限制在运行时“harness”(指令文本、工具调用逻辑与原子能力组合)内、且模型权重保持冻结时,才具备可审查性。换句话说,模型本身不动,改变的是它“怎么做事”的那一层外壳。这样一来,每一次适配都是一份带有原因和测试的 diff。

双环引擎与准入闸门

论文给出了一个建立在该边界之上的双环引擎,核心是一个在部署前写入哈希链记录的“准入闸门”。研究团队在仿真环境中对该闸门进行了测量——用的是模拟智能体和种子搜索提案器,而非真实语言模型。

在三种监管重新解释族、三种严重程度、每种 10 个随机种子的设置下:

  • 带闸门的回路在 7,449 个候选变更中仅放行 144 个,且没有一个在留出历史上恶化误差;
  • 在全部低、中严重度单元中,假阳性率被恢复到 oracle 水平,同时未漏报增加。

作为对照,当闸门被替换为无界系统常用的检查方式(只看近期轨迹中更少的错误)时,同样的回路放行了 309 个有害变更,并在 90 次运行中有 49 次将漏报率留在 10% 以上——假阳性下降的原因仅仅是筛查被放松了。

规则必须能重标历史

一个值得注意的发现是:在基于转变前标签进行评估时,闸门拒绝了每一个候选。这意味着,一次监管重新解释必须被编码为一条能够重新标注历史的规则,否则它无法通过准入。参数性和范围性偏移可以局部修复;结构性偏移只能通过替换原子能力来修复。而在最高结构性严重度下,闸门固定的容差设置在一半的种子中阻止了正确的替换。

与监管框架的对照

论文将上述机制映射到 欧盟《人工智能法案》 中关于高风险信贷评分的条款,并指出 2026 年 4 月发布的美国模型风险指引将智能体式 AI 排除在其适用范围之外。这一对照凸显出一个现实张力:技术层面已经开始尝试为自我进化建立可审计的边界,而部分监管框架尚未把这类系统纳入视野。

论文共 14 页、5 张表,代码、配置与逐次运行输出已以 v0.6.0 版本发布,并附有 Zenodo DOI。

延伸阅读

  1. AI 拒绝机制的双刃剑:安全的屏障还是潜在的灾难?
  2. 让 AI 智能体在你的屏幕上画箭头、方框和文字:bigarrow 登陆 Hacker News
  3. OpenAI解雇三名安全研究员,当事人发公开信否认指控并警告寒蝉效应
查看原文