“现在的大语言模型没有目标,也完全不具备真实体验。”7月24日下午,图灵奖得主、强化学习领域奠基人之一理查德·萨顿教授,在“强化学习暑期学校”结业仪式上表示。该暑期学校由上海创智学院、上海交通大学人工智能学院与Openmind研究院联合主办。作为Openmind研究院首席科学家,这也是他首次在中国系统、完整地讲授其强化学习学术体系。
【现有AI忽略了与真实世界交互】
究竟什么是智能?萨顿认同“人工智能”术语创立者约翰·麦卡锡的阐述——智能是实现目标所需能力的计算层面。他强调,人工智能是依托技术手段获得上述能力,而非依靠生物自然演化形成的系统。
萨顿认为,人类心智与机器心智本质上属于同一范畴。尽管当前的机器心智还十分初级,但他主张以长远眼光审视未来。他再次提及之前的预判,到2040年,人类只有五成概率能够洞悉心智的本质。
在萨顿看来,心智的核心在于体验交互,而当下主流人工智能范式完全忽略了这一点。他所定义的体验,是指与真实世界进行交互。心智存在的全部意义,就是从现实世界中获取反馈。但如今,反馈往往被简化为“奖励信号”,系统的目标就是最大化这个标量数值,这套简化逻辑并不贴合真实心智。他直言,现在的大语言模型并不在意人类的真实诉求,只专注于模仿人类文本。大语言模型没有目标,也完全不具备真实体验。而真正的心智,会主动掌控、理解自身体验,主动预测并干预外部世界。
“人工智能不需要复刻生物形态,但必须复刻核心底层能力,即实现目标、预测环境、主动调控世界的能力。”萨顿特别提到,不应使用“复刻模仿”这个词,因为这个词带有贬低意味,“我们不是单纯模仿,而是提炼底层通用原理,甚至用机器实现比生物更强的性能。”
【“目标”只存在于观察者视角里】
如何赋予人工智能系统以目标?萨顿给出了他的思考——目标是人类主观赋予的解读,用来解释行为结果。如果只描述系统内部机械运作原理,就不会用到“目标”这一叙事逻辑。
他以恒温器为例加以说明。人们会从结果叙事视角出发,将恒温器的行为解读为“维持室温恒定”。然而,维修工人看待恒温器,会抛开“控温目标”这套叙事,直接拆解机械原理——金属片受热形变,到达阈值就联动锅炉启停。萨顿以此指出,“目标”只存在于观察者的视角里,并非系统固有属性。
这套逻辑同样适用于人类。他认为,观察人类行为时,可以从神经、生理机械层面分析,也可以构建目标叙事——例如追求财富、名望,或与亲友安稳度日。两种解读方式都准确,只是适配不同使用场景。由此,萨顿引向一个核心判断:智能不是非黑即白的二元判断,不能简单判定“恒温器有没有智能”“生物有没有智能”。智能是程度概念,取决于观察者的评判视角与使用目的,而非系统本身自带标签。
【心理学是独家研究优势】
基于上述判断,萨顿提出接下来应重点推进两个方向。第一,给人工智能系统赋予内在目标,让它们拥有主动和环境交互的能力。不必专门搭建虚拟环境,直接搭建与真实物理世界的交互接口即可。第二,可以参考动物的自然智能。动物的行为都有明确导向——觅食、躲避天敌、保障自身安全,但目前的AI完全不具备这种原生驱动。
萨顿与深度学习之父杰弗里·辛顿都有心理学研究背景。他认为,自然生物心智是现存最优质的智能样本,人类与各类动物都是绝佳参照。过去百余年,真正系统研究学习机制的是心理学家。他们长期观测动物学习行为,从外在行为观测到解剖大脑研究内部机理,总结出大量基础、通用的学习底层规律,强化学习正是脱胎于此。“相比其他人工智能研究者,我一直把心理学视作我的独家优势——借鉴百年积累的理论,转化为算法思路。”萨顿非常建议人工智能研究者学习一些心理学。
在“强化学习暑期学校”开课仪式上,萨顿曾用“雄心”与“谦逊”两个关键词寄语学员。他认为,远大志向和谦逊并不冲突,但二者需要平衡。过度谦逊会安于现状,不去攻克有价值的难题;雄心过盛则会滋生傲慢,无视自身与理论的局限。
“我在阿尔伯塔大学时常和同事说,对待理论要保有探索把玩的心态,这一点至关重要。放开思路推演各种可能性,永远对基础核心问题保持好奇心。”他坚信,人类拥有理解一切事物的能力,不存在认知边界,终能破解包括心智本质在内的难题,只是无法一蹴而就。