PRISM:通过结构化多模态数据合成实现优先级感知的规则内化
多模态指令跟随是当前 AI 研究的热点,但现实世界的指令往往包含多个重要性不同的要求,而现有训练数据大多只关注单一问题。针对这一差距,来自多所机构的研究团队提出了 PRISM 框架,通过结构化数据合成,让模型学会理解并执行带优先级的规则,在少量数据下大幅提升多规则指令跟随能力。
从“生成者”到“执行者”:规则理解的新视角
传统上,模型被视为根据规则生成答案的“生成者”,评估标准是与标准答案的匹配度。而 PRISM 提出了 规则理解(Rubric Comprehension)的新范式,将模型视为规则的“执行者”:给定一张图片和一组有优先级的规则,模型需要先逐条验证每条规则,再给出整体判断。这种设定更贴近真实场景,例如在医疗影像分析中,医生可能要求模型先关注病灶区域,再考虑其他特征。
PRISM:四阶段数据合成框架
为了支持这一新范式,团队设计了 PRISM,一个四阶段的数据合成流程:
- 生成人物-任务对:模拟不同用户角色和任务场景,确保数据多样性。
- 前缀引导的规则集:通过前缀提示生成规则,每条规则带有明确的优先级。
- 质量过滤:使用自动化指标过滤低质量规则,保证数据可靠性。
- 结构化验证轨迹:生成模型逐步验证规则的推理轨迹,作为监督信号。
通过这一流程,团队构建了 PRISM-Eval 评估基准,其 Loose 和 Strict 指标采用确定性匹配,无需额外的判别模型,评估过程更客观、可复现。
实验效果:小数据,大提升
在 仅 10,000 条合成样本 的训练下,PRISM 将 Qwen3-VL-4B 在 PRISM-Eval 上的严格准确率从 9.5% 提升至 30.1%,同时保持了在通用基准上的平均性能。更重要的是,这种提升可以迁移到另外四种开源多模态大模型上,涵盖密集和 MoE 架构,表明结构化规则监督是提升多规则、优先级感知指令跟随能力的可扩展路径。
意义与展望
PRISM 的价值在于,它提供了一种低成本、可扩展的数据合成方法,使模型能够更好地处理复杂指令。未来,这一框架有望应用于更多场景,如自动驾驶、智能客服等,让 AI 更精准地理解人类意图。不过,研究团队也指出,当前实验规模有限,更广泛的适用性仍需进一步验证。
对于关注多模态 AI 发展的读者,PRISM 提供了一种新的思路:与其让模型在答案生成上精益求精,不如教会它如何遵循规则。