精选今天0 投票
BrainBench:评估大语言模型在脑电信号综合理解上的能力
脑电图(EEG)分析不仅仅是给记录贴上预定义的标签,它需要将自然语言指令、信号处理、定量证据和科学解释连接起来的工作流程。研究人员将这种能力称为“综合EEG理解”。然而,现有的评估主要针对孤立的解码任务或特定系统的演示,使得大语言模型(LLM)在此方面的能力未能得到充分量化。
为此,研究团队提出了 BrainBench——一个统一的基准,用于评估指令条件下的综合EEG理解能力。该基准包含四个子集:基础分析、睡眠评估、神经认知评估和生理整合,覆盖了 17个数据集、多个任务 和 超过数十万个真实数据实例。系统需要根据指令和EEG记录(可选生理信号)执行分析,并生成科学依据的报告及所需的人工产物。输出通过数值、分类、集合、序列、语义和人工产物验证进行评估。
研究团队在 两种执行范式 下评估了多个代表性LLM:CodeAct 的自主代码执行和 BrainAgent 的结构化代理分析,总执行次数超过 10万次。结果显示,不同模型、子集、难度级别和执行范式之间的性能差异显著,表明EEG能力不仅取决于模型本身,还取决于其操作化方式。
BrainBench为推进基于LLM的EEG理解提供了一个可复现的测试平台。代码和基准将很快发布,评估结果也会持续更新。
这项研究的出现,标志着AI在脑科学领域的应用迈出了重要一步。传统的EEG分析依赖于专家手动处理,而LLM的引入有望实现自动化、智能化的解读,从而加速神经科学研究和临床诊断。然而,如何确保LLM生成的报告具有科学严谨性,以及如何在不同设备、不同受试者之间保持一致性,仍是未来需要解决的挑战。