openrlhf/sft、dpo、rm、grpo、ppo、
reinforce-baseline。配置走 CLI flag,不是 Hydra。
创建和提交
GRPO 会设
algo.advantage.estimator=group_norm、train.colocate_all=true,以及 vLLM/DeepSpeed sleep。所有 role 共卡(colocate hybrid engine)。拓扑会展开成各 role 的 num_nodes / num_gpus_per_node。
recipe 里的 no_std_norm 是 Dr.GRPO 口径。
openrlhf/reinforce-baseline 是 REINFORCE++-baseline(全局 batch 归一化 + 组均值)。其它框架没有这个估计器。
镜像冒烟
运维:./deploy/docker/build-runtimes.sh openrlhf 和 scripts/image_smoke.py。用户只需要部署侧已经发布过镜像。