PENDING 这类后端字符串会映射到下面这张表。没有一种「未知但看起来像成功」的状态。
各状态含义
QUEUED 不是「已经在 Slurm/K8s 上排队等卡」。那种情况是 PENDING。仪表盘上一直排队,先看配额和调度窗口,不要先 kubectl get pods。
暂停、继续、重试
sf job pause/ 控制台暂停:停掉运行中的进程,台账行保留,状态PAUSED。sf job resume:状态回到QUEUED。调度器会重新投放,不是附着到旧容器上。- 控制台「重试」/
sf job retry:FAILED或STOPPED的训练作业可以直接重试,不必重新sf submit。 用同一个 run_id 重新排队 —— 输出目录不变,框架从最近 checkpoint 继续,台账仍是同一行, 重试次数累加。走的是和继续完全一样的那条路,配额、容量、可用时段闸门再走一遍。 FAILED之后的自动重试有预算和冷却。次数写在作业详情里。不想再跑就停掉。
GPU 时间
排队不计费。计量从PENDING 之后真正占卡开始(容器起来、有 start_time)。口径是 gpu_seconds(墙钟时间 × 卡数),控制台用量页能看到。