GRPO
-
NVIDIA 提出 FlashREINFORCE:用单轨迹异步训练解决长程 Agent 强化学习瓶颈
长程 Agent 训练正在暴露 GRPO 的同步与成本瓶颈。NVIDIA 提出的 FlashREINFORCE 通过每个 prompt 单轨迹采样、异步批处理和样本均值优化,尝试解决长尾轨迹、方差控制与工具调用行为坍缩问题。
-
Snowflake开源文本到SQL与Arctic推理模型:破解企业AI部署两大难题
在当今数据驱动的时代,企业对于人工智能(AI)的依赖日益加深,以期从海量数据中挖掘出有价值的洞察。然而,尽管AI技术取得了长足进步,企业在实际部署过程中仍面临诸多挑战。其中,文本到…