精选今天0 投票
FinPerMA:面向LLM智能体的理论驱动、事件锚定个性化记忆基准
大型语言模型(LLM)智能体正越来越多地被部署为金融咨询等高风险领域的个性化助手,然而,它们能否在长时间跨度内维护并更新个体化用户模型,仍是一个悬而未决的问题。现有的个性化记忆基准大多侧重于事实性记忆测试,或依赖约束较弱的模型生成轨迹,对事件驱动的偏好适应性探索不足。为此,研究团队提出了 FinPerMA——一个事件锚定的基准,用于评估智能体在冻结的纵向投资者轨迹上的个性化记忆能力。
FinPerMA 的生成流程结合了确定性的理论知情影响规则、受控的 LLM 叙事以及自动化质量筛查,并引入 “冲击后检查点”,以判断智能体是否已将重大事件整合进其持久用户模型中。在来自 276 个模拟用户画像的 2,994 个问题上,七个前沿 LLM 和最多七种记忆配置均远未达到饱和:即使采用全上下文配置,总体准确率也未超过约 0.47,多项选择题准确率最高约 39%。
归因分析显示,基于摘要的记忆往往保留了事实细节,却丢失了实现个性化所必需的偏好信号;因此,简单的检索方法有时反而优于专门设计的记忆系统,且在事件冲击后差距进一步拉大。这一发现为 LLM 智能体的记忆机制设计敲响了警钟:记忆不仅仅是存储,更需要捕捉动态偏好变化。
为什么重要?
金融咨询场景要求智能体不仅记住用户的基本信息,还要能根据市场波动、生活事件等动态调整建议。FinPerMA 的提出填补了现有基准的空白,为评估和提升 LLM 智能体的长期个性化能力提供了标准化工具。
核心贡献
- 提出事件锚定的个性化记忆基准,强调事件驱动的偏好适应性。
- 引入冲击后检查点,用于检测智能体是否将重大事件整合进用户模型。
- 揭示现有 LLM 在个性化记忆上的明显短板,尤其是摘要记忆的局限性。
局限与展望
该研究基于合成数据和模拟用户,真实场景下的表现有待进一步验证。未来,研究者可探索更高效的记忆更新机制,或引入多模态事件信息,以增强智能体的个性化能力。