SheepNav
精选昨天0 投票

谁定义的"标准答案"?以人为本的AI需要拥抱人类判断的模糊性

在机器学习的主流范式里,"标准答案"(ground truth)通常被当作唯一且确定的。标注者之间的分歧往往被多数投票聚合掉,或者直接归为噪声丢弃。但一篇被 NeurIPS 2026 Trustworthy AI for Good Workshop 接收的立场论文提出了不同看法:对于大量以人为本的任务,人类理解本身就是模糊的,同一输入存在多个同时合理的解读。把这种模糊性压缩成单一目标,等于丢掉了关于人类感知、判断与经验多样性的关键信息。

被"聚合"掉的人类分歧

论文 Whose Ground Truth? Embracing Ambiguity in Human-Centered AI 由 Jingyao Wu、Mohammad Tariqul Islam、Per Rådberg Nagbøl、Julie Gerlings、Giovanni Leoni、Georgiana Fryza、Lars Pilegaard Thomsen、Jakob Mainz 等八位作者合作完成,发布于 arXiv(编号 2610.10805)。

作者指出,传统 AI 系统大多建立在"存在一个确定的标准答案"这一假设之上。当不同标注者给出不同标签时,常见做法是聚合(如多数投票)或将其视为噪声处理。这套流程在图像分类等任务上行之有效,但一旦任务涉及人的主观体验——比如情绪识别、内容审核、医疗判断、教育评价——分歧本身可能恰恰是有价值的信息,而非需要消除的误差。

从"唯一答案"到"解读空间"

论文的核心主张是:应当转向对合理解读空间的建模,而不是追求单一目标值。换句话说,模型要学习的不是"这个人到底在想什么",而是"哪些人类判断是合理的,以及它们的分布是怎样的"。

这里有一个关键的区分:作者强调必须把有意义的模糊性与标注噪声分开。前者反映真实的人类多样性,后者源于标注错误或流程缺陷。混为一谈会导致两种失败——要么把有价值的多样性当噪声抹掉,要么把真正的错误当作合理的多元解读而保留下来。

影响的不只是建模

论文将这一视角贯穿到 AI 系统的多个环节:

  • 表示(represented):模型输出应能承载多种可能解读,而非强行收敛到一点
  • 学习(learned):训练目标需适配分布式的、多峰的标签结构
  • 评估(evaluated):评价指标要能衡量对合理判断空间的覆盖,而非仅看与单一答案的吻合度
  • 部署(deployed):系统在真实场景中应如何呈现和传递不确定性
  • 治理(governed):当多个解读都合理时,责任归属与决策依据如何界定

为什么现在值得关注

随着 AI 系统越来越多地与人交互、并对人做出决策,"谁的标准答案"这个问题不再是学术细节。情绪识别系统把某人的表情判为"愤怒",内容平台判定某条发言是否"有害",招聘工具评估候选人是否"匹配"——这些任务中的判断往往高度依赖语境和个体差异。

如果训练数据里少数标注者的真实感受被多数投票淹没,系统学到的可能是一种被平均化的、并不代表任何具体人群的"共识"。论文认为,承认并建模这种模糊性,是构建更以人为本的 AI 的必要一步。

需要说明的是,这是一篇立场论文(position paper),重点在于提出研究议程与方向,而非给出完整的实证方案。它更像是一份呼吁:在追求性能指标之外,AI 社区需要重新审视那个被默认接受的假设——标准答案只有一个。

延伸阅读

  1. AI 拒绝机制的双刃剑:安全的屏障还是潜在的灾难?
  2. 让 AI 智能体在你的屏幕上画箭头、方框和文字:bigarrow 登陆 Hacker News
  3. OpenAI解雇三名安全研究员,当事人发公开信否认指控并警告寒蝉效应
查看原文