SheepNav
精选今天0 投票

RadOnc-Agent:用LLM串联放疗全流程的智能体框架

放疗AI的碎片化困境

放射治疗是一条典型的长链条临床路径:从治疗决策、靶区勾画、计划设计,到剂量验证、疗效评估与随访,每个环节都已经有AI工具介入。但问题在于,这些能力分散在不同的临床阶段、软件环境和数据模态中,彼此割裂。一个环节的输出往往无法顺畅地流入下一个环节,与放疗本身纵向连续的工作流形成鲜明反差。

arXiv 上新发布的论文 RadOnc-Agent 正是针对这一痛点提出的解决方案。

框架设计:四个阶段 + 26个可调用函数

研究团队(Caiwen Jiang、Shuoyang Wei、Songlin Zhao、Junyu Li、Jingyuan Chen、Wei Liu)将放疗流程形式化为四个临床阶段,并通过对话式接口提供 26 个可调用函数。

其核心是一个大语言模型控制器,负责三件事:

  • 将临床意图映射为受 schema 约束的函数调用
  • 维护患者与工作流的上下文状态
  • 把请求路由到对应的专科服务

换句话说,LLM 在这里扮演的不是诊断者,而是协调者——它不直接做医学判断,而是决定"该调用哪个工具、带着什么上下文去调用"。

评测数据:从合成场景到真实病历

论文的验证规模值得关注,分为三个层次:

评测类型 规模 结果
单函数请求 2,600 条(7,800 次重复执行) 选中目标函数 98.79%
预设跨阶段合成场景 200 个(600 次执行) 完成率 96.50%
真实患者工作流 60 份去标识病历、120 个实例(360 次干净执行) 完成率 96.67%

真实患者数据覆盖了"决策到计划"与"计划到自适应"两类流程,说明测试并非只停留在玩具场景。

消融实验揭示的关键机制

更有信息量的是对比消融实验:

  • 移除纵向状态:跨阶段完成率从 96.50% 降至 84.00%。这说明让模型"记住"前面阶段发生了什么,是跨阶段协作的关键,而非可有可无的装饰。
  • 关闭 schema 与身份校验:在重放/测试评估中,后端调度错配率从 0% 飙升到 95.28%。这一数字相当惊人——没有结构化约束,LLM 几乎会把请求发错地方。

这两组数据共同指向一个工程结论:在医疗这类高风险场景中,LLM 智能体的可靠性更多来自外部约束机制,而非模型本身的聪明程度。

边界声明:技术可行性 ≠ 临床有效性

论文作者在摘要中明确划出边界:这些发现仅确立了 LLM 编排架构在协调异构放疗能力与信息方面的技术可行性,并不证明临床正确性、临床实用性或前瞻性收益。

这一表态相当克制,也符合当前医疗AI研究的规范要求。对于关注AI Agent落地的读者来说,RadOnc-Agent 的价值或许不在于"AI能治癌",而在于它示范了一种模式:用LLM做编排层,用schema和状态管理做安全网,把散落的专科AI能力整合成一条可追溯的工作流。这一思路对影像、病理、药物研发等同样碎片化的领域,都具有参考意义。

延伸阅读

  1. Anthropic 发布 Claude Haiku 5.5:史上最便宜、最快的小模型,成本直降 75%
  2. 今日速递:减肥药或能延缓衰老,二氧化碳电池储能新突破
  3. OpenAI 为青少年推出大学规划工具,并组建青少年 AI 顾问委员会
查看原文