experiments/<名字>/,包含 config.yaml(调参入口)、README.md 与 recipe.lock.json(方法锁)。先用 sf init 创建仓库,再在仓库内运行下面的命令。磁盘布局和上传排除项:实验仓库布局。继承细节:config.yaml。
新建实验
- 从方法目录创建
- Fork 现成实验
config.yaml:只写差异
实验 config 用defaults 继承官方基底,只写你要改的键:
experiments/my-grpo/config.yaml
硬件与分布式细节(并行度、显存调优、NCCL)不写在实验 config——它们由提交时的
--profile 从服务端注册表下发。同一个实验换卡型无需改配置。本地校验
- 键合法性:struct 模式,拼错的配置键立即报错;
- 类型与区间:学习率、batch 等按声明的类型与取值范围检查;
- 批大小关系:GRPO 等方法校验 rollout batch 与 train batch 的整除关系(可整除但不等长按 off-policy 给警告,不能整除报错);
- 数据声明:verl / TRL 必填的
--model/--train-data缺失提前发现。
sf submit 会自动跑同一套校验,--no-validate 可跳过(不建议)。
查看方法与超参
/methods)有同一份目录的可视化版本。
在控制台对比多次作业
项目详情的作业区是高密度对比矩阵:- 左侧作业名称与状态固定,右侧指标/配置列可横向滚动;
- 行、列均使用虚拟化,数百个 run × 数百列也只渲染视口附近单元格;
- 默认显示全部最新指标和跨 run 有变化的配置,常量配置可从“列”面板打开;
- 支持作业搜索、状态筛选、列搜索/隐藏/置顶,并可勾选 2–4 个 run 进入评审对比。