SheepNav
精选今天0 投票

BrainBench:评估大语言模型在脑电信号综合理解上的能力

脑电图(EEG)分析不仅仅是给记录贴上预定义的标签,它需要将自然语言指令、信号处理、定量证据和科学解释连接起来的工作流程。研究人员将这种能力称为“综合EEG理解”。然而,现有的评估主要针对孤立的解码任务或特定系统的演示,使得大语言模型(LLM)在此方面的能力未能得到充分量化。

为此,研究团队提出了 BrainBench——一个统一的基准,用于评估指令条件下的综合EEG理解能力。该基准包含四个子集:基础分析睡眠评估神经认知评估生理整合,覆盖了 17个数据集多个任务超过数十万个真实数据实例。系统需要根据指令和EEG记录(可选生理信号)执行分析,并生成科学依据的报告及所需的人工产物。输出通过数值、分类、集合、序列、语义和人工产物验证进行评估。

研究团队在 两种执行范式 下评估了多个代表性LLM:CodeAct 的自主代码执行和 BrainAgent 的结构化代理分析,总执行次数超过 10万次。结果显示,不同模型、子集、难度级别和执行范式之间的性能差异显著,表明EEG能力不仅取决于模型本身,还取决于其操作化方式。

BrainBench为推进基于LLM的EEG理解提供了一个可复现的测试平台。代码和基准将很快发布,评估结果也会持续更新。

这项研究的出现,标志着AI在脑科学领域的应用迈出了重要一步。传统的EEG分析依赖于专家手动处理,而LLM的引入有望实现自动化、智能化的解读,从而加速神经科学研究和临床诊断。然而,如何确保LLM生成的报告具有科学严谨性,以及如何在不同设备、不同受试者之间保持一致性,仍是未来需要解决的挑战。

延伸阅读

  1. MatrAIx:用83亿个数字人模拟真实世界,革新AI系统评估
  2. 对抗鲁棒性的溯因融合:无需领域知识,提升预训练感知模型性能
  3. FinPerMA:面向LLM智能体的理论驱动、事件锚定个性化记忆基准
查看原文