🛰️ Daily AI Frontier
‹ back to 2026-08-19

以GLM-5为例,探究九章智算云强化学习系统如何落地“训推一致”

雷峰网 (AI科技评论) Efficiency & Systems 2026-08-19
Representative image for 以GLM-5为例,探究九章智算云强化学习系统如何落地“训推一致”

TL;DR - 九章智算云以GLM-5等模型为例,介绍其将强化学习中的生成、环境执行与训练整合到统一基础设施,以实现“训推一致”。其核心价值是动态平衡训练和推理吞吐、复用运行状态,从而提高单位算力的有效Token产出。

  • 统一调度Generator、Environment和Trainer,根据各阶段瓶颈动态分配GPU,以减少训练等待、Rollout积压和Policy Staleness。
  • 通过DingoFS、DFKV、零拷贝链路和RDMA,将KV Cache、轨迹、奖励及模型权重作为可迁移、可复用的状态资源。
  • PD分离、Chunked Prefill、Speculative Decoding和KV Cache复用共同降低生成成本;文中称部分前沿模型首日速度提升1.5倍。
  • 系统目标从单点GPU利用率转向匹配Trainer与Generator吞吐,并优化有效Token产出率及其向模型能力的转化效率。

view merged work →