Skip to main content
sf methods 才是「你连的这台服务器实际发布了什么」的权威答案。下面的表是一张地图,不是版本锁定。 控制台的方法页展示同一份 catalog 并把参数铺开,第一次提交前看那个更省事。

NeMo-RL

默认框架,覆盖完整后训练链路。当前 catalog 发布:nemo-rl@0.7.0

verl

字节 verl 同步 trainer。catalog 发布:verl@0.9.0。入口和参数路径的版本差异写在版本矩阵里(Recipe)。 下面这些 RL 方法跑的都是同一个官方入口(verl.trainer.main_ppo),区别只在 recipe 钉死的 advantage estimator。 这是刻意的:estimator 不是可以写在 config.yaml 里的超参——写了会在提交时被拒,因为「配置和方法悄悄不一致」比报错更糟。 loss 变体——GSPO、CISPO、GMPO、clip-cov / kl-cov、GPG——不是独立方法:它们是上面任一 RL recipe 的 policy_loss_mode 参数。 rollout 校正(TIS / IcePop)同理:每个 verl RL 方法都带 rollout_is* 参数——rollout 引擎和训练器从来就不是同一个策略。

TRL

Hugging Face TRL + Accelerate。catalog 发布:trl@1.10.0

OpenRLHF

DeepSpeed ZeRO + vLLM hybrid engine(colocate)。catalog 发布:openrlhf@0.11.0。镜像要自建(deploy/docker/Dockerfile.openrlhf),配 FORGE_IMAGE_OPENRLHF 或 runtime 注册表。上游官方 Dockerfile 不会放出带包本体的现成镜像。

评测和 custom

按框架的走法:NeMo-RLverlTRLOpenRLHF

怎么起手

常见流水线:SFT → DPO 或 GRPO → evalkit/benchmark流水线