罗西的思考 / wechat· 罗西的思考·发布时间:
图文MemPO 源码学习笔记(4):Rollout 多轮轨迹与记忆奖励的实现细节
[Agent Memory / 强化学习] MemPO源码学习笔记 ---(4)--- Rollout实现细节
内容导读
作者拆解 MemPO 的多轮对话轨迹生成与记忆奖励计算:先生成完整轨迹,再构造“系统提示+原始问题+当前摘要”的上下文,与完整历史对比预测正确答案的概率,用来衡量摘要保留了多少有效信息。计算只关注核心答案的模型 token,并分别过滤两种上下文中概率不超过 50% 的部分。作者指出,两路可能因此使用不同的答案片段,导致摘要的得分虚高;这些过滤只影响记忆奖励,不影响最终答案的对错判定。
继续看关键要点
- 答案掩码硬编码排除末尾 4 个模型 token,依赖特定分词结果;更换分词器时可能错位,影响奖励计算。
- 每个问题生成 16 条独立轨迹,用于 GRPO 组内统计;作者将其解释为统计稳定性与计算开销的折中,该数量可配置。
- 首轮没有历史可总结,因此不收集记忆数据;若轨迹被截断、最后一段记忆缺少结束位置,则丢弃该轮记忆数据。
来源:罗西的思考 / wechat · mp.weixin.qq.com