大模型后训练
-
NVIDIA 提出 FlashREINFORCE:用单轨迹异步训练解决长程 Agent 强化学习瓶颈
长程 Agent 训练正在暴露 GRPO 的同步与成本瓶颈。NVIDIA 提出的 FlashREINFORCE 通过每个 prompt 单轨迹采样、异步批处理和样本均值优化,尝试解决长尾轨迹、方差控制与工具调用行为坍缩问题。
长程 Agent 训练正在暴露 GRPO 的同步与成本瓶颈。NVIDIA 提出的 FlashREINFORCE 通过每个 prompt 单轨迹采样、异步批处理和样本均值优化,尝试解决长尾轨迹、方差控制与工具调用行为坍缩问题。