以GLM-5为例,探究九章智算云强化学习系统如何落地“训推一致”
TL;DR - 九章智算云以GLM-5等模型为例,介绍其将强化学习的生成、环境与训练环节整合到统一基础设施中,实现“训推一致”。其目标是动态平衡吞吐、状态与算力,提高单位GPU的有效Token产出率。
- 统一调度Generator、Environment和Trainer,动态匹配生成与训练吞吐,减少GPU闲置、Rollout积压和策略陈旧。
- 通过DingoFS、DFKV、零拷贝及RDMA,将KV Cache、模型权重和轨迹数据作为可迁移、可复用的状态资源。
- PD分离、Chunked Prefill和推测解码等推理优化被纳入RL闭环,使推理效率直接转化为训练效率。
- 文中称MiniMax M2.1 229B和Qwen3-Coder-Next 80B首日速度提升1.5倍,并在流量变化下较静态预测器再提升1.25倍。