(来源:机器之心)
LLM 由训练竞赛转入长期运行阶段之后,递归式自我改进(RSI)正在取代「更大参数量+更多数据」的规模路径,成为头部实验室的核心战略方向。2026年以来越来越多的机构将资金投向自我进化系统,其中 AI Build AI 作为该方向的代表性议题,受到的关注度相对突出,指向的是 AI 直接参与 AI 研发这一自动化环节的扩展,出现 BigBang-V1、HiSME、Soft-SVeRL等相关工作。在此前提下,RSI 的战略权重上升,研发范式由规模扩展向自我进化机制迁移。
目录
01. RSI 的能力边界在哪里?
「AI Build AI 」已渗透进研发循环的哪些环节?...
02.近期 RSI 工作如何突破「内省阈值」?
内省阈值是什么?自我改进的极限卡在哪?...
03.AI 何时才能自己改进自己,从而训练出下一代 AI?
当前「弱RSI」距离「强RSI」还有多远?...
RSI 的能力边界在哪里?
1、过去几年,大语言模型(LLM)的能力不断得到提升,OpenAI、Google DeepMind、Anthropic、Meta、阿里巴巴等头部实验室,都已不再满足于「必须由人类工程师反复重新训练」的静态基础模型,而是把资金投向能自我进化的 AI 系统。[1-1][1-2][1-3]
① 2026年上半年,田渊栋联合 Richard Socher(CEO)、Tim Rocktäschel 等科学家创办 Recursive Superintelligence(RSI),目标在于用 AI 让 AI 自我进化、自我迭代,找到新的模型训练范式。
② 2026 年 8 月,Google 联合创始人 Sergey Brin 明确推动资源投入递归式自我改进,目标让 AI 参与下一代 AI 的创造。[1-4]
③ 同月,在 Google 工作 27 年的 Jeff Dean 离职并与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 等共同创办 Discovery Loop,尝试自动化「提出实验—实现—运行—评估—调整」的完整研究循环,践行RSI的工程化探索。[1-5]
2、在RSI的热度下,许多工作探索了大语言模型能够通过自我反思来精化自身推理、优化自身提示词 、生成并评估自身的训练数据 以及在运行时修改自身源代码,以实现不依赖人类工程师逐轮重新训练、通过与环境的迭代交互自主地改进自身的智能体。[1-1]
3、为判断当前业界在RSI方向的探索进展,以及自进化AI的能力边界,有工作引述知名研究者Roman V. Yampolskiy于2015年提出的分类框架,通过「自我修改」「弱 RSI」「强 RSI」三个级别和配套的能力预期来判断人工智能自我改进机制的完成度。[1-6]
① 集智俱乐部(Swarma Research)的研究者于7月发布「SELF-REFERENCE」工作,引用 Yampolskiy 的三级分类法来划分RSI发展进程与边界。[1-1]
② 「自我修改」阶段指改变系统代码,但不一定提升性能;「弱 RSI」阶段固定算法框架内优化性能,收益不可避免地递减;「强 RSI」改进的是「改进能力」本身,可能启动无界的反馈循环。[1-1][1-6]
4、 相较于早期工作对「自我修改」能力的探索,2026 年以来,BigBang-V1、HiSME 等工作开始聚焦「AI Build AI」方向,即让人工智能直接参与自身的训练与改进环节。
① 早期「自我修改」类工作如self-modifying code、polymorphic code以及metamorphic code等并不涉及底层算法的变更,其改动仅限于代码的外在形态,主要目的在于代码混淆,即防范逆向工程或规避检测机制。[1-6]
② 「AI Build AI」相关工作关注在既定算法框架内对某一具体环节实施优化,以期在框架不变的条件下实现性能增益。该「框架内优化」的属性,使其更接近于 Yampolskiy 所定义的「弱 RSI」。
近期工作如何突破 RSI 的「内省阈值」?
1、在梳理 RSI 能力边界的基础上,「Self-Reference」工作提出了「内省阈值」(introspection threshold)的概念,用以衡量一个系统是否真正具备可持续自我改进的能力...[1-1]
关注👇🏻「机器之心PRO会员」,前往「收件箱」查看完整解读