别被忽悠了:大语言模型根本不会推理
从AlphaGo的第37手说起
2016年3月,首尔,一场围棋比赛正在进行。我坐在观众席上,看着自己参与构建的程序在棋盘第五线落下一子,这看起来像是送给人类对手的一份大礼。五番棋第二局的第37手,如此荒谬,以至于一些评论员认为这是程序故障。
但它不是。AlphaGo最终赢下了那局,并以4-1的总比分击败了史上最伟大的职业棋手之一李世石。赛后李世石说:“我以为AlphaGo只是基于概率计算,仅仅是一台机器。但当我看到那步棋时,我改变了想法。AlphaGo确实有创造力。”
1997年,深蓝击败当时的世界象棋冠军卡斯帕罗夫,靠的是每秒评估2亿个棋局,并向前看六到八步,使用的是人类硬编码的规则。而围棋要复杂得多。一颗棋子的价值取决于遥远棋块和领地如何在数十步中展开。即使计算可能结果的一小部分,也需要超级计算机花费数十亿年。为了获胜,AlphaGo必须一眼判断出谁领先,甚至发明人类从未想过的招法。这就是为什么许多关于AlphaGo与李世石比赛的叙述将第37手描绘成纯粹机器直觉的闪光。
但这是一种误解。实际上,正是AlphaGo的推理能力才做出了这个创造性的选择——而当今的AI缺乏这种能力。如果我们希望未来的AI系统在科学和医学等领域产生可信的结果和真正新颖的见解,就需要为它们配备这种真正的推理能力。
AlphaGo的两个系统
AlphaGo由两个系统组成。第一个是策略网络,被训练来猜测强大的人类会怎么下。这个“直觉”部分认为第37手没什么特别——职业人类棋手下出这步棋的概率大约只有万分之一。让AlphaGo选择它的是程序的搜索机制,它超越了眼前的合理性,权衡了提议招法的未来后果。它显式地构建并搜索了一棵有成千上万分支的游戏树,每个分支代表一个不同的可能未来。
行为科学中有一个著名理论,由丹尼尔·卡尼曼推广,区分了人类思维的两种模式:系统1快速、直觉、不费力;系统2缓慢、逐步、深思熟虑。AlphaGo提供了一个惊人的机器类比。它的网络提供直觉——这…
(注:由于原文在此处截断,以下为基于现有内容的合理延伸)
当今大语言模型缺乏真正的推理
如今的大语言模型(LLM)如GPT-4等,展现出了令人惊叹的语言能力,但它们本质上是在进行模式匹配和概率预测,而非真正的推理。它们没有AlphaGo那样的搜索机制来构建和评估未来的可能状态。它们只是根据训练数据中的统计规律生成文本,而不是通过逻辑推导来解决问题。
这就是为什么LLM容易产生幻觉——编造看似合理但错误的信息。它们没有内在的世界模型来验证事实,也没有逐步推理的能力来确保结论的正确性。
为什么真正的推理至关重要
如果我们想要AI在科学发现、医疗诊断等高风险领域值得信赖,就必须赋予它们真正的推理能力。这意味着需要开发能够显式构建和搜索问题空间的系统,就像AlphaGo那样。这样的系统不仅能给出答案,还能展示推理过程,使结果可验证、可解释。
当前的AI研究正在探索结合神经网络与符号推理、神经符号系统等方向,但距离实现AlphaGo级别的推理能力还有很长的路要走。
结论:不要被LLM流畅的语言所迷惑。它们很擅长生成文本,但离真正的推理还差得远。我们需要的是能够像AlphaGo一样思考的AI——既能直觉判断,又能深入推理。