MemPO
-
MemPO 源码拆解:Rollout 如何为 Agent 记忆训练构造时间线与奖励信号
MemPO 通过 Rollout 生成多轮轨迹,并截取 full_traj 与 mem_traj 两类上下文,用答案概率差计算记忆奖励,再将结果纳入 PPO 优势更新,使 Agent 记忆写入成为可训练策略。
MemPO 通过 Rollout 生成多轮轨迹,并截取 full_traj 与 mem_traj 两类上下文,用答案概率差计算记忆奖励,再将结果纳入 PPO 优势更新,使 Agent 记忆写入成为可训练策略。