作者:昇腾实战派

背景

本博客旨在对已发表在社区的强化学习相关的博客进行整理归类,方便用户导航使用。一下文章所用的机器均为昇腾相关设备。

强化学习系列将划分为【核心算法和理论】、【框架能力与架构】、【NPU模型部署实践与调优】、【特性适配案例】五大类

核心算法和理论

veRL框架下DAPO强化学习算法的实现解析
视觉推理洞察
强化学习场景分布式框架ray相关方案介绍
DAPO + TransferQueue:优化大规模策略优化算法的数据中转与性能
训练中的 Bridge 技术解析:Mbridge 与 Megatron-Bridge

框架能力与架构

veRL 训推一致性工作及重要性采样代码演进分析
veRL异卡方案
veRL异步异卡方案考古
基于VeRL的ReactAgentLoop实践
VeRL engine_worker使能记录
VeRL 强化学习框架中的数据流与 PPO 损失计算详解
VeRL 强化学习训练框架代码架构解析
VeRL-DAPO精度问题数值计算分析
Fully Async 代码走读

参考配置

使用Ascend verl每日镜像进行大语言模型训练指南
VeRL-Megatron训练性能优化配置参考
SGLang 与 VeRL 框架下大模型训练的高性能配置优化指南

NPU模型部署实践与调优

基于VeRL框架的GSPO算法在Atlas 800T A2服务器上实践
Qwen2.5-VL-7B模型GRPO训练实践指南
【VeRL】Qwen3-235B-A22B 强化学习昇腾Atlas 800T A2复现与部署实践
【VeRL】Qwen3-235B 长序列强化学习训练性能优化实践
【VeRL】Qwen3-30B-A3B-DAPO NPU实践指导
Qwen3-30B-A3B 模型在异步训练场景下的性能优化实践
MindSpeed-RL GRPO 昇腾全共卡方案实践总结
基于昇腾平台的SAPO训练实践
Verl Full Async架构昇腾实践
【VeRL】Dense模型DAPO算法性能优化方案
基于VeRL GPT-OSS-20B MoE模型 DAPO 强化学习训练适配流程
Qwen3.5-35B-VeRL-FSDP 功能适配实践
Qwen3.5-35B-VeRL 训练性能优化实践

特性适配案例

veRL partial rollout方案
veRL fully async training 全异步方案
从服务化推理和统一训练架构,到veRL异步profiling改造
VeRL 强化学习场景下NPU环境profiling使用指南

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐