开始之前
必需
由管理员创建,或者你的部署接了单点登录。你还需要控制台地址。
必需
登录后
sf status 会把两者都打印出来。本站里所有 profile 名字——h200:8 之类——都是示意;
请用你自己 sf status 打印出来的那些。必需
脚手架训的是
Qwen/Qwen2.5-1.5B,作业启动时从 Hugging Face 拉。
内网环境下由管理员把部署指向内部镜像,见离线内网部署。
没配的话,作业会启动、卡在下载权重,最后超时。可选
只有
sf dataset push 和「训练后自动评测」需要它。这条路径没有它也能走通。2
登录
--device-flow;CI 里用 --token。凭据存在 ~/.forge/。
控制台登录页。用户名密码,或者部署接了单点登录时用 SSO。
3
创建实验
experiments/my-grpo/,里面有 config.yaml、README.md 和 recipe.lock.json。4
调参并校验
改 按方法声明检查类型、取值范围和 batch size 整除关系。拼错的参数在这里几秒内就失败,
而不是排完队之后。
experiments/my-grpo/config.yaml。最常改的几个键——学习率、batch size、序列长度——
都放在脚手架的最上面。5
提交
--profile 是唯一的资源参数:h200 用注册表的默认形状,
h200:4 要四张卡,h200:16 要两个满节点。工作树不干净会被拒绝,除非加 --allow-dirty——这样结果才追溯得到确切的 commit。QUEUED → SUBMITTED → PENDING → RUNNING。
QUEUED 表示已准入但还没上集群,见作业状态。6
在控制台里看
打开控制台,进 Jobs,点开你那个作业。

GRPO 训练过程中的曲线页:reward、accuracy 和训练标量。
确认成功
按顺序对照下面几项。有一项对不上就停在那里——后面每一步都假设前一步真的成功了。
第一个点出现了,这条路径就走通了。
如果日志显示在训练而曲线一直是空的,说明回传调用没有发生。catalog 方法的话这是 ingest 配置问题;
自己的训练器的话,通常是
starforge.report 根本没被调用。见 回传。
下一步
提交的完整用法
提交路径上的每一个参数:资源、覆盖、数据、镜像、后续动作。
用自己的训练器
catalog 里没有你要的方法时怎么办。
Sweep
一条命令,多个变体,在控制台里成组展示。
评测
用 GSM8K、MMLU、C-Eval 等给这次 run 打分。