Skip to main content
OpenRLHF 0.11.0 作为一等框架。方法有:openrlhf/sftdpormgrpopporeinforce-baseline。配置走 CLI flag,不是 Hydra。
上游的 Dockerfile 装了依赖栈但没有openrlhf 包,也没有发布可直接用的训练镜像。 管理员必须先设 FORGE_IMAGE_OPENRLHF,或者登记 openrlhf-0.11.0 这个 runtime id,提交才能工作。Ray 版本由那个镜像固定——上游 0.11.0 用的是 ray==2.55.0。不要把 TRL 或 verl 的版本抄过来; 不一致的症状是「集群起来了但 worker 注册不上」。

创建和提交

绑定(recipe): GRPO 会设 algo.advantage.estimator=group_normtrain.colocate_all=true,以及 vLLM/DeepSpeed sleep。所有 role 共卡(colocate hybrid engine)。拓扑会展开成各 role 的 num_nodes / num_gpus_per_node recipe 里的 no_std_norm 是 Dr.GRPO 口径。 openrlhf/reinforce-baseline 是 REINFORCE++-baseline(全局 batch 归一化 + 组均值)。其它框架没有这个估计器。

镜像冒烟

运维:./deploy/docker/build-runtimes.sh openrlhfscripts/image_smoke.py。用户只需要部署侧已经发布过镜像。