SheepNav
精选今天0 投票

AI评估应转向人机协作:ICML 2026立场论文引发思考

AI评估的范式之争:从超级智能到人机协同

长期以来,AI领域的评估体系以“超级智能自主表现”为核心,隐含的目标是让机器取代人类。然而,一篇被ICML 2026 Position Paper Track接收的论文《AI Evaluation Should Work With Humans》提出了尖锐的质疑:这种主导范式正在将AI发展引向错误方向。作者Jan Kulveit、Gavin Leech、Tomáš Gavenčiak和Raymond Douglas主张,AI社区应转向评估人机团队的整体表现,而非孤立地追求AI的自主能力。

为何要“以人为本”评估?

论文指出,当前的评估标准——如基准测试中的高分、游戏中的超越人类表现——本质上鼓励开发“替代人类”的系统。这种导向催生了大量自动化工具,却忽视了人类与AI协作的潜力。实际上,在医疗诊断、科学研究、复杂决策等场景中,人类与AI的互补往往能产生更优结果。例如,AI可快速处理海量数据,而人类提供直觉、伦理判断和情境理解。若评估仅关注AI单打独斗的能力,便会错失这种协同效应。

转向协作评估的实践路径

作者建议,未来的评估应设计为人机团队任务,衡量整体产出而非个体表现。这需要开发新的方法论,包括:

  • 设计需要人类介入的任务,如AI生成初步方案后由人类修正;
  • 评估团队协作的流畅度、信任度和互补性;
  • 引入动态场景,模拟真实世界中人与AI的交互。

这种转变不仅改变测试方式,更会重塑AI研发目标,推动系统设计更注重可解释性、可控性和适应性,而非盲目追求自动化。

行业影响与未来展望

若这一观点被广泛采纳,AI开发将更注重增强人类能力,而非替代。这可能带来更积极的社会影响,如减少失业焦虑、提升工作满意度,并确保AI技术符合人类价值观。当然,这一转变面临挑战:如何量化人机协作的成效?如何避免评估的主观性?但无论如何,这篇论文为AI评估提供了宝贵的新视角,值得从业者深思。

延伸阅读

  1. 衡量语言模型代理的跨任务行为一致性:新指标BCM
  2. 大语言模型中的稳定误校准:高置信度错误的实用视角
  3. Agentao:为工具调用型LLM智能体打造的受治理本地优先运行时
查看原文