🛰️ Daily AI Frontier
‹ back to 2026-07-22

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

arXiv cs.CL Efficiency & Systems Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhichen Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zeng, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo 2026-07-22

TL;DR - SLAI T-Rex is a full-stack framework for post-training trillion-parameter DeepSeek-V4 MoE models on Ascend NPU SuperPODs. It improves training efficiency while enabling a solver-grounded model specialized for operations research tasks.

  • Achieves 34.22% Model FLOPs Utilization, a 2.93× improvement over the open-source baseline recipe.
  • Optimizes model parallelism, computation-communication orchestration, and low-level kernel execution while maintaining training stability.
  • Builds CPT and SFT pipelines using domain resources and solver-verified synthetic documents, including 10K SFT samples.
  • The specialized DeepSeek-V4-Flash model reaches 71.81% average zero-shot Pass@1, exceeding GPT-5.4-Mini by 3.98 percentage points and its base model by 11.27 points.

view merged work →