Skip to main content
后训练很少是一步:先 SFT 打底,再 DPO 或 GRPO 对齐,然后导出和评测。 --init-from 就是让某一阶段从上一阶段的产物开始。 每次 run 的 checkpoint 都会自动登记,下一阶段按 run id 引用它,血缘端到端可查—— 所以半年后「这个是从什么训出来的」有一个不依赖任何人记忆的答案。

从上一阶段起训:—init-from

服务端解析引用、校验产物存在与归属,把实际路径注入作业。控制台作业详情的血缘视图能看到整条链。

训练成功后自动执行:—then

训练成功后平台自动提交后处理作业(秒级到分钟级,不再为它付一次 RayCluster 冷启动)。

导出 HuggingFace 格式:sf export

--checkpoint-format 支持 nemo-dcp / nemo-megatron / verl-fsdp / verl-megatron / huggingface。推 Hub 时服务端注入当前用户的 HF token(见 HuggingFace 集成),repo 名做过校验防注入。

原生评测:sf eval

按 recipe 声明的框架原生评测入口执行:
sf eval框架原生评测(复用训练框架的推理路径);跨模型可比的标准基准(GSM8K / MMLU / C-Eval…)用 sf bench,分数入库统一看板。见 Benchmarks

清理:sf clean

删除该实验在集群上的 checkpoint 与日志,不可恢复。作业记录与指标保留在平台。

一条完整流水线示例