谁定义的"标准答案"?以人为本的AI需要拥抱人类判断的模糊性
在机器学习的主流范式里,"标准答案"(ground truth)通常被当作唯一且确定的。标注者之间的分歧往往被多数投票聚合掉,或者直接归为噪声丢弃。但一篇被 NeurIPS 2026 Trustworthy AI for Good Workshop 接收的立场论文提出了不同看法:对于大量以人为本的任务,人类理解本身就是模糊的,同一输入存在多个同时合理的解读。把这种模糊性压缩成单一目标,等于丢掉了关于人类感知、判断与经验多样性的关键信息。
被"聚合"掉的人类分歧
论文 Whose Ground Truth? Embracing Ambiguity in Human-Centered AI 由 Jingyao Wu、Mohammad Tariqul Islam、Per Rådberg Nagbøl、Julie Gerlings、Giovanni Leoni、Georgiana Fryza、Lars Pilegaard Thomsen、Jakob Mainz 等八位作者合作完成,发布于 arXiv(编号 2610.10805)。
作者指出,传统 AI 系统大多建立在"存在一个确定的标准答案"这一假设之上。当不同标注者给出不同标签时,常见做法是聚合(如多数投票)或将其视为噪声处理。这套流程在图像分类等任务上行之有效,但一旦任务涉及人的主观体验——比如情绪识别、内容审核、医疗判断、教育评价——分歧本身可能恰恰是有价值的信息,而非需要消除的误差。
从"唯一答案"到"解读空间"
论文的核心主张是:应当转向对合理解读空间的建模,而不是追求单一目标值。换句话说,模型要学习的不是"这个人到底在想什么",而是"哪些人类判断是合理的,以及它们的分布是怎样的"。
这里有一个关键的区分:作者强调必须把有意义的模糊性与标注噪声分开。前者反映真实的人类多样性,后者源于标注错误或流程缺陷。混为一谈会导致两种失败——要么把有价值的多样性当噪声抹掉,要么把真正的错误当作合理的多元解读而保留下来。
影响的不只是建模
论文将这一视角贯穿到 AI 系统的多个环节:
- 表示(represented):模型输出应能承载多种可能解读,而非强行收敛到一点
- 学习(learned):训练目标需适配分布式的、多峰的标签结构
- 评估(evaluated):评价指标要能衡量对合理判断空间的覆盖,而非仅看与单一答案的吻合度
- 部署(deployed):系统在真实场景中应如何呈现和传递不确定性
- 治理(governed):当多个解读都合理时,责任归属与决策依据如何界定
为什么现在值得关注
随着 AI 系统越来越多地与人交互、并对人做出决策,"谁的标准答案"这个问题不再是学术细节。情绪识别系统把某人的表情判为"愤怒",内容平台判定某条发言是否"有害",招聘工具评估候选人是否"匹配"——这些任务中的判断往往高度依赖语境和个体差异。
如果训练数据里少数标注者的真实感受被多数投票淹没,系统学到的可能是一种被平均化的、并不代表任何具体人群的"共识"。论文认为,承认并建模这种模糊性,是构建更以人为本的 AI 的必要一步。
需要说明的是,这是一篇立场论文(position paper),重点在于提出研究议程与方向,而非给出完整的实证方案。它更像是一份呼吁:在追求性能指标之外,AI 社区需要重新审视那个被默认接受的假设——标准答案只有一个。