Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨
创始人
2026-08-29 17:33:18
0

(来源:机器之心)

近年来,大语言模型(LLM)智能体在长程任务中展现出强大潜力,但现有智能体框架在记忆的使用方式与迭代方式上仍面临显著挑战。

传统方法多在任务开始前根据任务检索记忆或在交互过程中通过上下文来检索经验,随着任务的推进,在任务开始阶段一次性检索的记忆已无法反映当前的问题,膨胀的上下文中又混杂着过期信息与执行噪声,检索因此越来越不可靠。检索之所以不可靠,根源并不在于缺少有用的经验,而在于缺少一个紧凑而可靠的任务状态,去把已积累的经验与当前的执行需求持续对齐。

而近期的递归式自我改进(RSI)在长程任务中也面临同样的挑战,记忆的迭代几乎只由下游任务的分数决定,无法精准定位到产生问题的具体组件,因此更新往往是粗粒度的且缺乏针对性,而面对长程任务中的推理轨迹,不断增长的上下文长度也让智能体难以在分析并在其中准确找到最有效的改进策略。

在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升

  • 论文标题:Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses

  • 代码仓库:https://github.com/Gen-Verse/Recuris

  • 论文链接:https://arxiv.org/abs/2608.24876

Recuris 与既有记忆方法的差别体现在两个维度上:记忆怎么被使用,以及记忆怎么被迭代

Recuris 与既有记忆方法的两个范式差别

记忆怎么用:既有框架对着不断膨胀的对话历史做记忆的注入或检索,在长程任务中容易产生幻觉,导致技能调用错位;Recuris 在执行事件上取用技能,并由检查器把环境返回转成经过验证的状态更新,而不是听信对话里的一句「已完成」。记忆怎么迭代:既有框架从单次任务成败出发重写整个记忆;Recuris 读取结构化轨迹,把失败定位到具体组件、只修改引起问题的组件,并且只有通过验证集的门控后才被接受。

性能表现:

从 3B 小模型到 Claude Opus 5 全面暴涨

研究团队在四个长程基准(τ²-Retail、τ²-Airline、SkillFlow、Terminal-Bench 2.1)与十个模型上进行了评测。

Recuris 在从 3B 开源模型到前沿模型上的表现

从 3B 的小模型到 Claude Opus 5 和 GPT-5.6-Sol 这样的前沿模型上,Recuris 均展现出了大幅的性能提升。同时在长程任务上,这一优势不随交互轮次的增加而衰减,并大幅降低了长程执行中常见失败模式的发生率。

长程可靠性:

优势不随任务变长而衰减

长程能力的常见评价困难在于,「任务变长」和「智能体提前放弃」会互相混淆。因此研究团队按任务本身需要多少轮才能完成把 τ²-Retail 分成四个分位。

按任务固有长度分位的长程表现

Recuris 在全部四个分位上都领先基线,幅度 +17.0 至 +44.7,不随任务变长而单调下滑

结构化轨迹让失败可以被定位

递归改进的前提是知道该修哪里。研究团队没有停留在观察记忆,而是主动向记忆中注入已知故障,再让一个固定的裁判从三种证据中判断是哪个组件出了问题:只看最终成败、看原始轨迹、或看 Recuris 产出的结构化轨迹 Γ。故障池按类别均衡构造,因此一个「永远答同一个组件」的裁判会得到 33.3%。

只看成败的定位准确率 13.0%,低于常答同一答案的基线;看原始轨迹 37.0%,仅比基线高不到四个点;而看结构化轨迹达到 64.8%,接近基线的两倍

演化出的记忆能迁移:

跨任务,也跨模型

跨任务:记忆从 16 个失败任务中蒸馏而来,在从未参与过的 86 个任务上仍带来 +9.01 至 +17.44 的提升。这一结果验证了 Recuris 的核心假设:结构化的失败轨迹中蕴含的信息足以支撑跨任务迁移。

演化出的记忆在留出任务上的表现

跨模型:一份记忆只在部署模型上演化一次,随后原封不动交给从未参与演化的前沿模型,同样也能产生明显提升,进一步证明了框架的泛化性。

关键技术解析

论文给出的判断是:长程场景下真正的瓶颈并非「没有可用的经验」,而是缺少一个紧凑而可靠的任务状态,用来把已积累的经验与当前的执行需求持续对齐。Recuris 的三项核心技术都围绕这一判断展开。

Recuris 架构总览

经验记忆 — 工作记忆耦合(EM–WM Coupling)

工作记忆(WM)正是那个缺失的状态表示。它持续追踪智能体的当前进展与未解决的目标,并据此从经验记忆(EM)中选取最合适的技能;技能执行后,环境反馈验证进展并更新状态,闭合成一个循环:

任务状态 → 技能选择 → 执行反馈 → 更新的任务状态

具体而言,技能调用发生在执行事件上:草拟一次状态改变调用,或到达一个交互轮次的边界,而不是对着膨胀的历史上下文做相似度匹配。智能体动作之后,检查器依据环境返回的工具回执验证进展,只有被证据支持的状态变更才会被提交:调用了技能、或尝试了一次工具调用,都不算真正完成

结构化轨迹与组件级失败定位

既有方法大多只能从最终成败中学习,这类信号说明「出了问题」,却无法指出该修的是存储的技能、追踪的任务状态、技能调用机制,还是进度验证器。EM–WM 耦合把任务状态、被调用的技能、动作与观测显式串联起来,把执行过程本身变成了关于「记忆如何影响行为」的证据

EM–WM 耦合 → 结构化证据 → 失败定位 → 靶向记忆演化

它把「这次任务失败了」变成「是哪一个组件让它失败」,从而使局部修补成为可能,而不必整体重写记忆。

有界的、验证门控的递归演化

一个固定的 Meta-Agent 读取结构化轨迹,把每个诊断出的失败归因到某个记忆组件,并只修改被引发问题的组件;一个固定的门控只在补丁修复了目标任务、且不在留出集上造成回退时才准入。被接受的更新改变未来的执行模式,产生新的优化信息,进而支撑下一轮更新。

递归演化的动态

主要作者介绍

余昭辰:新加坡国立大学博士生,研究方向为大语言模型推理、智能体系统与自我改进。

杨灵:普林斯顿大学博后研究员,研究方向为大语言模型和强化学习。

王梦迪:现任普林斯顿大学电子与计算机工程系终身教授,并创立并担任普林斯顿大学「AI for Accelerated Invention」中心的首任主任。她的研究领域涵盖强化学习、可控大模型、优化学习理论以及 AI for Science 等多个方向。

颜水成:新加坡国立大学教授,IEEE / ACM / AAAI / IAPR Fellow,研究方向涵盖计算机视觉、机器学习与多模态大模型。

本工作合作者包括斯坦福大学博后吴英成,牛津大学博后尹榛菲等

相关内容

2026 年 9 月短途登...
在高频商务差旅与短途出行中,行李箱早已不再是单纯的收纳工具属性,成...
2026-08-29 18:32:36
赞!爱心助学 筑梦启航
近日我县开展多项公益助学活动为学子追梦之路保驾护航在全县营造崇学重...
2026-08-29 18:29:03
逐“绿”而兴!泾县这波操作...
近年来,我县以绿为笔,从林场改革到碧水守护,从鲟鱼游弋到宣纸飘香,...
2026-08-29 18:28:57
中国足协:不与U23国足主...
来源:央视新闻客户端中国足协29日发布公告称,近期网传的中国足协不...
2026-08-29 18:28:52
【每周科普】追求原生态买土...
(来源:双台子微)每次逛菜市场或刷短视频,是不是总被“土法”“古早...
2026-08-29 18:28:40
广西13条河流18个水文站...
(来源:经济日报)转自:经济日报广西壮族自治区水文中心29日提供的...
2026-08-29 18:28:29
机器人游戏哪些人气高 十大...
探索游戏世界中的机械奥秘,本文带你揭示机器人游戏十大耐玩排行榜的热...
2026-08-29 18:28:24
单机游戏推荐哪个 十大必玩...
探索游戏世界的新巅峰!《单机游戏推荐:十大必玩经典之作》带你领略单...
2026-08-29 18:28:19
隐藏物体游戏哪个最好玩 最...
探寻乐趣巅峰:最新隐藏物体游戏盘点揭示,众多玩家翘首以盼的宝藏之作...
2026-08-29 18:28:14

热门资讯

2026 年 9 月短途登机高... 在高频商务差旅与短途出行中,行李箱早已不再是单纯的收纳工具属性,成为个人效率、专业形象与出行体验的重...
赞!爱心助学 筑梦启航 近日我县开展多项公益助学活动为学子追梦之路保驾护航在全县营造崇学重教的浓厚氛围8月27日,泾县红十字...
逐“绿”而兴!泾县这波操作亮了... 近年来,我县以绿为笔,从林场改革到碧水守护,从鲟鱼游弋到宣纸飘香,系统推进特定区域生态产品价值实现机...
中国足协:不与U23国足主帅安... 来源:央视新闻客户端中国足协29日发布公告称,近期网传的中国足协不与U23国足主帅安东尼奥续约的传言...
【每周科普】追求原生态买土榨花... (来源:双台子微)每次逛菜市场或刷短视频,是不是总被“土法”“古早”“纯天然”的花生油吸引?商家主打...
广西13条河流18个水文站出现... (来源:经济日报)转自:经济日报广西壮族自治区水文中心29日提供的信息显示,29日8时,广西仍有郁江...
机器人游戏哪些人气高 十大耐玩... 探索游戏世界中的机械奥秘,本文带你揭示机器人游戏十大耐玩排行榜的热门风采。从策略构建到动作竞技,这些...
单机游戏推荐哪个 十大必玩单机... 探索游戏世界的新巅峰!《单机游戏推荐:十大必玩经典之作》带你领略单机游戏的魅力。无论是深度剧情的沉浸...
隐藏物体游戏哪个最好玩 最新隐... 探寻乐趣巅峰:最新隐藏物体游戏盘点揭示,众多玩家翘首以盼的宝藏之作究竟哪个最引人入胜?本文带你深度解...
基于文字游戏有哪些好玩 高人气... 文章导读:探索文字游戏的魅力世界,本文将带你领略那些深受玩家喜爱的高人气基于文字冒险。无论是富有策略...