“强化学习之父”为何说别怕AI变聪明?

2026-07-21 23:40:00  阅读 7665 次 评论 0 条
摘要:

2026年7月17日,“强化学习之父”理查德·萨顿在WAIC2026主论坛演讲称,当前AI进步被夸大,本质是大规模模式识别。他觉得真正智能源于与真实世界交互,强化学习能让AI从经验中成长,引发行业对AI发展方向的思考。

核心论点:计算与智能的分野

当前AI本质是大规模模式识别

2026年7月17日,在上海世博中心的WAIC2026主论坛上,“强化学习之父”理查德·萨顿指出,社会对AI能力的认知存在夸大。当下AI的显著突破,如语言运用、图像和视频生成,本质仍属大规模模式识别,并非真正智能。目前多数AI能力基于大规模计算和模式识别,大模型只是“知识重组引擎”,而非“知识发现引擎”。

智能与计算不能混淆

萨顿强调,不能将智能和计算混为一谈。当前AI发展处于“人类数据时代”,大型语言模型通过预测人类语言下一个词进行训练,是对海量人类书写记录的统计拟合。虽然GPT-4等模型能完成多种任务,但识别模式不等于产生思想,预测下一个词不等于理解世界,与真正智能有根本差距。

强化学习:通向真正智能之路

强化学习的基本逻辑

真正的智能应像婴儿一样通过与环境互动习得。强化学习的基本逻辑是,AI智能体在环境中行动,依据行动结果获得奖惩信号,进而调整策略,循环往复找到最优行为方式。像AlphaGo和AlphaZero通过大量自我对弈经验,在特定领域展现超越人类的能力,证明了强化学习的有效性。

从数据驱动转向经验驱动

萨顿认为当前AI基于人类数据驱动已达极限,高质量数据源渐少,应迈入“经验时代”。新的数据来源是智能体与环境互动产生的经验。AI转向从经验学习,能持续获取新知识,变得更强大,向真正自主智能迈进。

“强化学习之父”为何说别怕AI变聪明?

对世界模型的新思考

避免陷入低级物理模拟器误区

7月19日在WAIC2026的“思想者论坛”上,萨顿指出对世界模型的定义有误。当前行业将世界模型做成“低级物理模拟器”的理解狭隘,人类的转移模型应承载高阶世界知识。比如“如果我接受了这份工作,我会幸福吗”这类问题,才是模型应回答的。

OaK架构助力高级抽象

为实现高级抽象,萨顿提出OaK架构,通过时间抽象(选项)与状态抽象(知识),让AI能进行“跳跃式”宏观规划。在该架构中,智能体针对每个与人类生活相关的状态特征,学会控制和达成该特征的技能,构建自身心智,但目前还无法立即实现这一架构。

尽管萨顿的观点引发争议,但他对AI从“人类数据时代”向“经验时代”转型的论断,促使行业重新审视AI发展方向,思考如何让AI通过强化学习和自主探索获得真正智能。这一理念为AI未来发展提供了新视角,推动研究者探索更接近人类智能的路径,对AI产业技术影响深远,意义重大。

“强化学习之父”为何说别怕AI变聪明?

相关问答

萨顿为什么认为当前AI的进步被夸大了?

他觉得当下AI的显著突破,如语言运用、图像和视频生成,本质是大规模模式识别,大模型是“知识重组引擎”,依赖人类已有知识,并非真正智能。

强化学习如何让AI实现智能?

强化学习中,AI智能体在环境行动获奖惩信号调整策略,像婴儿般通过与环境互动试错、反馈和修正,找到最优行为方式来实现智能。

萨顿提出的OaK架构有什么作用?

OaK架构通过时间抽象与状态抽象,助力AI实现“跳跃式”宏观规划,让智能体针对状态特征学会相关技能,构建自身心智。

AI从“人类数据时代”向“经验时代”转型的原因是什么?

当前AI基于人类数据驱动已达极限,高质量数据源减少,而经验时代的新数据来源是智能体与环境互动产生的经验,能让AI持续学习变强。

为什么说将世界模型做成“低级物理模拟器”的理解是狭隘的?

人类的转移模型应承载高阶世界知识,像“接受工作是否幸福”这类问题才是模型该回答的,“低级物理模拟器”无法满足此需求。

萨顿对大语言模型的发展路线持什么态度?

萨顿时常批评大语言模型的发展路线,他认为其架构缺乏从实际互动中持续学习的能力,只是模仿人类数据,而非通过与世界直接互动理解世界并实现目标。

本文地址:https://www.caiair.com/post/qianghua-xuexi-zhifu-ai-814137-149604.html
简短标题:“强化学习之父”为何说别怕AI变聪明?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化