“现在的大语言模型没有目标,也完全不具备真实体验。”图灵奖得主、强化学习领域奠基人之一理查德·萨顿教授在近期举行的“强化学习暑期学校”结业仪式上表示。该暑期学校由上海创智学院、上海交通大学人工智能学院与Openmind研究院联合主办。这也是身为Openmind研究院首席科学家的萨顿首次在中国系统、完整地讲授其强化学习学术体系。在萨顿看来,心智的核心在于体验交互,而当下主流人工智能范式完全忽略了这一点。他所定义的体验,是指与真实世界进行交互。心智存在的全部意义,就是从现实世界中获取反馈。但如今,反馈往往被简化为“奖励信号”,系统的目标就是最大化这个标量数值,这套简化逻辑并不贴合真实心智。他直言,现在的大语言模型并不在意人类的真实诉求,只专注于模仿人类文本。而真正的心智,会主动掌控、理解自身体验,主动预测并干预外部世界。(解放日报)