ClinLens:面向纵向多模态临床数据科学的长期编码智能体评测基准
临床数据科学智能体需要将异构的纵向医疗记录转化为可审计的分析结果,但现有基准大多局限于医学问答、结构化表格推理或通用科学数据仓库。为此,研究者提出了 CLINLENS——一个包含 200 个可执行任务的基准,覆盖 MIMIC 数据库中的五类资源:结构化电子健康记录、临床笔记、心电图、胸部 X 光片和超声心动图。
设计框架:4×5 分类法
CLINLENS 采用 4×5 分类法,将任务按四个患者时间范围与五种分析能力交叉组合。每个任务都基于“程序优先反向合成”方法构建:先提供有界半原始数据包,再配以评估者私有的参考工作流,检查所需产物、队列与时间语义以及最终答案。这种设计确保了任务的可执行性与评估的客观性。
性能差距:运行成功不等于分析正确
在固定的 126 个任务子集上,研究者测试了 24 种模型-脚手架配置,最强的配置实现了 56.3% 的 scope-macro STRICTPASS,尽管所有配置的 EXECSUCCESS 都达到了 100%。作为对照,单独配置的编码智能体解决了 126 个任务中的 83 个,而五个针对 GPT-4o-mini 调整的生物医学系统最多只达到 2.9% 的 scope-macro STRICTPASS。
这些结果揭示了 可运行提交与正确临床分析之间的巨大鸿沟。即使代码能成功执行,也不意味着分析结果符合临床逻辑。
行业启示
CLINLENS 的发布为 AI 医疗领域提供了更贴近真实临床场景的评测标准。它强调长期编码任务和纵向数据整合,对智能体在复杂、多模态医疗数据上的推理能力提出了更高要求。未来,医疗 AI 系统需要从“能跑通”转向“能分析对”,才能真正辅助临床决策。
该研究来自 arXiv 预印本(arXiv:2607.26155),由 Yuan Zhu、Ethan B. Liu、Frank Nie 和 Jindong Han 共同完成。