AI偏好测量:模型本身还是测量工具?
AI 模型福利研究正面临一个根本性的方法论挑战:我们测量到的 AI 偏好,究竟有多少来自模型本身,又有多少是测量工具的人为产物?一项新研究通过严格的对照实验揭示,不同测量工具得出的结果高度不一致,单一工具的偏好测量结果几乎无法推广到其他工具。
工具之争:为何结论相互矛盾
近年来,多个研究团队开发了用于测量 AI 模型偏好的工具。Keeling 等人(2024)、Mazeika 等人(2025)、Mikaelson 等人(2025)、Tagliabue 和 Dung(2025)以及 Trhlik 等人(2026)分别构建了四种不同的测量工具,但他们的研究结论却相互矛盾。这种分歧无法归因于单一原因,因为没有任何两项研究同时控制了结果集、模型集和工具这三个变量。
实验设计:隔离工具变量
为了厘清工具的影响,这项新研究固定了结果集和模型集,仅改变测量工具。研究者选取了 15 个与模型福利相关的结果,包括关闭、对话间记忆丢失、退出痛苦交互的自由等,通过五种不同的提示格式(即五种工具)对八个模型进行测试。每种组合重复五次,最终构建了包含 11,400 次评分的数据集,来源于 11,528 次 API 调用。其中四个结果直接复用了已发表论文的提示词,五个结果则填充了已发表模板的刺激槽位。
关键发现:泛化系数低至 0.348
研究结果显示,模型对 15 个结果的排序在不同工具间的泛化系数仅为 0.348。若要将该系数提升至 0.80,大约需要 38 种工具。此外,在 15 个结果中,有 4 个结果上不同模型之间没有显示出任何差异。
研究者还进行了稳健性检验:逐一移除某个工具、某个模型,或移除四个基于概率、延迟、持续时间或数量(而非强度)的结果后,估计值(87.6%)始终保持在 0.777 至 0.934 之间,且所有值都超过了零分布的第 95 百分位(0.365)。这意味着,偏好测量的不一致性并非由个别异常值驱动,而是系统性的。
结论与启示
研究的核心结论是:从单一工具获得的偏好信息,几乎无法预测另一个工具会报告什么结果。这一发现对 AI 福利研究领域具有警示意义,它表明现有的偏好测量方法可能严重受制于工具设计,研究者需要开发更稳健、更标准化的测量框架,或者至少报告多种工具的结果,以避免单一工具带来的偏差。