新上线今天0 投票
UserToolBench:面向工具使用大模型的个性化决策新基准
随着大语言模型(LLM)越来越多地被用于代表用户执行任务,如何确保模型真正理解并遵循用户的潜在偏好,已成为一个关键挑战。然而,现有的评估基准大多聚焦于风格模仿或通用工具调用,很少触及决策层面的个性化。为此,研究人员推出了 UserToolBench,一个专门测试工具使用型 LLM 在个性化决策能力上的新基准。
核心设计:隐藏用户画像,考验真实决策
UserToolBench 的独特之处在于“用户画像隐藏”设计。模型在测试时无法直接看到用户的显式画像,而必须从多轮交互历史中推断用户的潜在偏好,并在信息不完整时主动判断是否需要澄清,最终生成符合用户意图的工具调用轨迹。这种设计更贴近真实应用场景——用户不会总是清楚地表达自己的全部需求。
该基准基于隐私清洗后的真实交互轨迹构建,融合了结构化人物画像、公共 API 风格的工具生态以及长周期多轮对话。具体数据规模包括:10 个用户画像、36 个工具集、1,065 轮对话、170 个独立工具,并覆盖三类任务:信息缺失场景、单工具调用、多工具协调。
实验结果:现有模型仍有明显短板
研究团队对当前主流的工具使用型 LLM 进行了测试,结果显示,这些模型在个性化委托任务上仍存在显著困难。主要瓶颈集中在三个方面:
- 多工具协调:在需要调用多个工具并协调其顺序和参数时,模型表现不佳。
- 缺失约束推断:当用户没有明确给出某些条件时,模型难以从上下文中推断出隐含约束。
- 长周期行为一致性:在多轮对话中,模型容易偏离用户偏好,无法保持行为的一致性。
这些发现表明,仅让模型输出听起来像特定用户的文本是远远不够的,真正的个性化要求模型能够为用户做出正确的决策。
意义与启示
UserToolBench 的提出为个性化评估提供了新思路:从“风格模仿”转向“决策正确性”。这对于 AI 助手、智能代理等应用的发展具有重要意义。未来,工具使用型 LLM 需要在理解用户深层需求、主动澄清歧义以及跨任务保持一致性方面做出更多改进。
该研究由多所机构的研究人员合作完成,论文已提交至 arXiv(编号:2608.10042),目前正在同行评审阶段。