MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架

来源:AI创业之家 更新时间2026-08-05 10:32:39 点击数:

MemHarness是什么

MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经验与当前状态不匹配反而导致负迁移。MemHarness 受人类记忆重构机制启发,在检索与动作之间插入显式的批判与重构环节,结合当前上下文对历史经验进行保留、改写或丢弃,通过 GRPO 端到端训练,无需额外人工标注。

MemHarness

MemHarness的主要功能

  • 记忆检索:Agent 根据当前观测生成查询,从 Milvus 向量记忆库中召回 top-k 相关历史经验及其来源状态。
  • 批判与重构:统一策略模型对比记忆来源状态与当前状态,批判其适用性,将经验改写为状态对齐的指导信息,或判定为不适用而舍弃。
  • 动作生成:基于重构后的指导信息或自主推理,生成可执行的环境动作。
  • 经验回写与剪枝:每轮交互后将轨迹摘要为经验写入记忆库,进行语义去重,定期按经验效用剪枝低价值记忆。
  • 端到端训练:通过 GRPO 联合优化检索、重构与动作生成,无需重构阶段的独立标注数据。

MemHarness的技术原理

  • 五阶段决策流程:MemHarness 将记忆引导的决策分解为环境观测、经验检索、记忆批判、上下文记忆重构与动作生成五个连续阶段,模拟人类检索—评估—重构的认知过程,取代传统 Agent 直接回放记忆的静态范式。

  • 上下文记忆重构机制:策略模型将任务描述、当前历史、检索到的经验及其来源状态拼接为重构上下文,通过对比历史来源状态与当前状态识别差异,保留可迁移知识、改写不匹配内容,或输出 <EMPTY> 标记拒绝该记忆并回退到自主推理。

  • 统一策略模型架构: 检索查询生成、记忆批判重构与可执行动作生成三个阶段共享同一个策略模型参数,无需为重构模块单独训练价值网络或监督数据,使记忆利用与决策推理在同一模型内紧密耦合。

  • GRPO 端到端训练:由于重构指导信息没有真值标注,MemHarness 采用 GRPO 对检索—重构—行动全链路进行端到端优化;奖励由稀疏任务结果与格式奖励组成,通过组归一化优势将轨迹级信用分配给所有 token,同时训练思考、重构与动作生成能力。


首页 AI对话 资讯 我的