Skip to main content
十五分钟,从零到一次能看着跑的训练。下面这条路径是确定的:照抄就能跑通。

开始之前

必需
由管理员创建,或者你的部署接了单点登录。你还需要控制台地址。
必需
登录后 sf status 会把两者都打印出来。本站里所有 profile 名字——h200:8 之类——都是示意; 请用你自己 sf status 打印出来的那些。
必需
脚手架训的是 Qwen/Qwen2.5-1.5B,作业启动时从 Hugging Face 拉。 内网环境下由管理员把部署指向内部镜像,见离线内网部署。 没配的话,作业会启动、卡在下载权重,最后超时。
可选
只有 sf dataset push 和「训练后自动评测」需要它。这条路径没有它也能走通。
1

装 CLI 并创建项目

不要 clone 平台仓库——创建项目的是 sf init。它在磁盘上放了什么见 sf init。 之后用 sf update 升级,不要手工重装。
2

登录

会打开浏览器。SSH 会话加 --device-flow;CI 里用 --token。凭据存在 ~/.forge/
打印你的账号、配额,以及这套部署真正拥有的 profile 名。记下来——下一步要用。
StarForge 控制台登录页

控制台登录页。用户名密码,或者部署接了单点登录时用 SSO。

3

创建实验

生成 experiments/my-grpo/,里面有 config.yamlREADME.mdrecipe.lock.json
4

调参并校验

experiments/my-grpo/config.yaml。最常改的几个键——学习率、batch size、序列长度—— 都放在脚手架的最上面。
按方法声明检查类型、取值范围和 batch size 整除关系。拼错的参数在这里几秒内就失败, 而不是排完队之后。
5

提交

会打印一个作业 id。--profile 是唯一的资源参数:h200 用注册表的默认形状, h200:4 要四张卡,h200:16 要两个满节点。工作树不干净会被拒绝,除非加 --allow-dirty——这样结果才追溯得到确切的 commit。
状态依次是 QUEUEDSUBMITTEDPENDINGRUNNING。 QUEUED 表示已准入但还没上集群,见作业状态
6

在控制台里看

打开控制台,进 Jobs,点开你那个作业。
StarForge 作业曲线页

GRPO 训练过程中的曲线页:reward、accuracy 和训练标量。

确认成功

按顺序对照下面几项。有一项对不上就停在那里——后面每一步都假设前一步真的成功了。 第一个点出现了,这条路径就走通了。 如果日志显示在训练而曲线一直是空的,说明回传调用没有发生。catalog 方法的话这是 ingest 配置问题; 自己的训练器的话,通常是 starforge.report 根本没被调用。见 回传

下一步

提交的完整用法

提交路径上的每一个参数:资源、覆盖、数据、镜像、后续动作。

用自己的训练器

catalog 里没有你要的方法时怎么办。

Sweep

一条命令,多个变体,在控制台里成组展示。

评测

用 GSM8K、MMLU、C-Eval 等给这次 run 打分。