跳到正文
罗西的思考 / wechat· 罗西的思考·发布时间:评分29
图文

MemPO 源码学习笔记(5):用 GRPO 训练智能体记忆

[Agent Memory / 强化学习] MemPO源码学习笔记 ---(5)--- GRPO

内容导读

作者从源码解释 MemPO 如何训练长任务中的智能体记忆:除了最终答案奖励,还比较完整轨迹与记忆上下文对正确答案的预测能力,为每轮记忆增加质量信号。结果优势与记忆优势相加,后者仅作用于记忆片段,再通过统一的 PPO 更新训练模型。GRPO 用同题多条轨迹的组内统计替代价值评估网络,但记忆评分会额外增加一次前向计算。

继续看关键要点
  • 结果优势按同一问题的轨迹分组归一化;记忆优势则汇总同一问题下跨轨迹、跨轮次的记忆奖励,归一化范围更大。
  • 奖励和优势只决定更新方向与强度,不直接参与梯度计算;梯度来自 PPO 更新时当前策略模型的前向计算。这一区分有助于理解记忆评分如何影响训练。

来源:罗西的思考 / wechat · mp.weixin.qq.com