国产GPU迎来里程碑!摩尔线程S5000具身训练性能比肩国际一线
据消息人士透露,9月23日,在摩尔线程承办的"MUSA开源技术沙龙:RLinf × MUSA Meetup"活动中,该公司展示了其MTT S5000芯片在具身智能领域强化学习任务中的实际运行数据。
实验设定了248个并行训练环境,并在配方参数及随机种子保持一致的控制条件下进行对比。结果显示,S5000所产生的训练收敛轨迹与当前国际一线GPU产品高度一致,二者之间的逐步相关系数达到了r=0.976。上述成果基于RLinf框架下对WoVR工作负载的完整移植与复现验证。
研究团队运用GRPO算法生成动作序列,借助WAN世界模型依据所生成的动作预测后续执行状态,再通过网络结构对结果正误进行判别并输出奖励信号以驱动模型迭代——整个强化学习后训练流程完全不依赖物理机器人的介入。

在LIBERO-Spatial平台的实体机器人评测中,分别由两种不同硬件平台训练所得的策略,其任务成功率实现了有效对齐。
RLinf开源项目的核心维护者、清华大学深圳国际研究生院助理研究员于超在该活动上披露,RLinf官方持续集成流水线自0.3版起已将MTT S5000纳入标准测试矩阵,任何提交至主干的代码都必须先在国产化算力平台上通过自动化检验方可合并。
这标志着国产计算平台与国产具身强化学习生态已跨越单纯的兼容性适配,迈入协同深度开发的崭新阶段。
RLinf是目前国内首个专为具身智能打造的覆盖"仿真—训练—推理"全流程的大规模强化学习基础设施,由清华大学与无问芯穹共同推出。于超指出,图形渲染能力是最终选定摩尔线程的核心因素之一,"在国内范围内,除海外头部GPU企业外,能够提供成熟渲染支撑的计算供应商屈指可数,摩尔线程正是其中之一"。
在底层工程层面,摩尔线程针对单次迭代耗时做了三方面改进:将图像预处理逻辑从CPU侧转移至GPU侧执行、对去噪迭代中的冗余数值校验进行了合并精简、把关键路径上的Python标量运算替换为设备端张量操作。
经过上述优化,单步总耗时由原来的2549秒缩减至1888秒,降幅约为26%;GPU空闲等待比例也从18.5%大幅压低至3.1%。算子层面的基准测试表明,S5000在通用矩阵乘法(GEMM)及注意力机制两项指标上的吞吐效率可达同级别国际主流GPU产品的1.6到2倍。
落地应用层面,依托π0.5架构构建的"策略自我演化数据闭环",使双臂机械臂完成GPU模块装配任务的实体成功率从原先不足两成稳步攀升至92%,同时精细化作业所需时间缩短了将近四成。
另一款名为极佳视界GigaBrain-0.7的系统则通过离线强化学习将四项精密操作的平均通过率从30%拉升至57.5%,引入在线强化学习后进一步突破至满分。
摩尔线程高级副总裁杨上山强调,具身智能场景对计算资源的需求是多维叠加的——既要支撑"决策大脑"训练的AI算力,也少不了搭建高保真虚拟空间所需的渲染与仿真算力,而这恰恰是全功能GPU最擅长发挥价值的领域。

