多模态大模型能否解码创意跳跃?C4框架问世,专测跨概念理解能力
在人工智能的版图中,创意能力始终是一块难以精确测量的高地。与那些有明确对错、可以量化评分的任务不同,创意往往缺乏显式的目标和奖励信号,这让评估变得异常棘手。然而,创意在设计、沟通、教育以及人机协作中又扮演着至关重要的角色。近日,一篇发表于arXiv的论文提出了一个名为 C4 的新评估框架,旨在填补这一空白,专门用于测试多模态大语言模型(MLLMs)的跨概念理解能力。
从“理解”到“解码”:创意的认知基础
论文作者指出,跨概念理解是支撑“接受性创意”(receptive creativity)的核心认知能力。它指的是,一个观察者能够从看似不相关、但存在意义关联的概念组合中,解读出创作者的意图。例如,当我们看到一幅将“时间”具象化为“流水”的画作时,能立刻领会其中的隐喻。
为了将这一抽象概念操作化,研究团队提出了一种新颖的视角:将项目构建视为“跨概念编码”,而将模型推理视为“跨概念解码”。这就好比,创作者在编码一个只有“懂行”的人才能解开的谜题,而模型的任务就是解开这个谜题。
C4框架:以成语为载体的创意测试
基于这一思路,团队构建了 C4(Chengyu-based Cross-Concept Creativity) 评估框架,其载体是中文成语。成语本身就是高度凝练的跨概念表达,一个四字短语往往浓缩了一个故事、一种哲理或一幅画面,非常适合用来测试模型对“言外之意”的把握。
C4框架的巧妙之处在于其显式的结构和可量化的难度。它通过一个人工标注并经过第三方审查的跨概念网络,将目标概念与可具象化的替代概念连接起来,形成“桥梁路径”。每个测试项的难度由路径中的桥梁数量和深度决定,这使得评估具备了清晰的难度梯度。
C4-Eval:数据与结果
基于该框架,研究团队发布了 C4-Eval 评估集,包含184个合成项目和37个人类创作的成语谜题。每个项目被实例化为五种任务设置,最终产生了884个主要答案恢复案例。
在对十个主流MLLM的测试中,结果显示:
- 最强的闭源模型在主要任务上的准确率分别达到50.7% 和48.0%;
- 开源模型的表现则明显逊色,准确率低得多。
有趣的是,当提供候选约束时,模型的准确率大幅提升;但提供桥梁提示或要求解释推理过程,对性能的提升却相当有限。这表明,当前MLLMs在解码通过跨概念关系编码的创意意义时,存在明显的短板。
小结:创意的“最后一公里”
这项研究不仅提供了一个全新的评估工具,更揭示了当前MLLMs在高级认知能力上的真实边界。理解成语背后的隐喻,看似简单,却需要模型具备联想、抽象和背景知识的综合能力。C4框架的推出,为未来模型在创意维度的改进提供了清晰的标尺。或许,让机器真正“读懂”人类的创意表达,仍是通往通用人工智能道路上需要跨越的一道重要关卡。