群发资讯网

Miles v0.1: 生产级RL强化学习后训练框架 在超大规模大模型(如万亿参

Miles v0.1: 生产级RL强化学习后训练框架
在超大规模大模型(如万亿参数 MoE)的后训练与强化学习(RL)中,系统面临巨大挑战:推演(Rollout)需多轮交互与工具调用,训练(Training)需高吞吐,两者难以兼顾导致硬件利用率低、系统气泡多,且数值对齐困难。

分享一下全栈生产级系统Miles v0.1,基于 slime 设计,核心理念为“可验证、简洁、可定制”。

架构解耦与协同:推演侧基于 SGLang,训练侧支持 Megatron-LM 与 PyTorch FSDP 双后端,通过数据缓冲与权重同步机制实现异步高效循环。

功能丰富:支持全参数 RL、LoRA RL、同策略蒸馏、监督微调及扩散模型,确保推演与训练的真实对齐。

在 64 块 NVIDIA GB300 GPU 上,完成 GLM-5.2 744B-A40B 模型终端编码任务的异步智能体 RL,中位步长时间仅 263 秒(前 30 步),展现了极高的工程效率。

radixark/miles
大模型 深度学习 算法 机器学习 计算机视觉 带你一起读论文 文献综述 人工智能发展