--profile 表达式。你说「哪种卡、几张」,拓扑细节(几节点 × 每节点几卡、并行度调优、NCCL 环境)由服务端注册表补齐——客户端与服务端不可能写出互相矛盾的资源声明。
Profile 与 Series
FORGE_HARDWARE_SERIES / FORGE_CLUSTER_PROFILES 覆盖),随 profile 下发的还有进程环境(NCCL / Ray 内存阈值 / PyTorch 分配器)与框架覆盖项(并行度全 1、vLLM gpu_memory_utilization 等)——这些不在实验 config 里,换卡型不用改实验。
多资源池(异构训练)
RL 训练的 train 与 rollout 可以钉在不同卡型上(如 H100 训练 + H20 采样),--profile 重复出现并带角色前缀:
--constraint 来自卡型的 slurm_constraint。各池 gpus_per_node 必须一致。Slurm 遇到没声明 constraint 的卡型直接拒。local 和 agent(Phase 1,一作业一节点)不支持多池。
配额
管理员按用户设置软配额,提交与出队时执法:
超配额的提交会进入队列等待(而不是直接拒绝),控制台 用量 页与
sf status 都能看到当前水位。
时段窗口
管理员可按卡型设置每日可运行时段(如白天推理优先、夜间训练放开)。窗口关闭时:- 新作业不出队(窗口剩余时间不足配置阈值也不放行);
- 运行中的作业收到宽限期后被暂停,保留 checkpoint;
- 窗口再次打开后自动恢复续训。
GPU 台账
每个作业记录gpu_seconds(实际占卡时长 × 卡数),日报与用量页按此计量。仿真模式(无 GPU 的测试环境)下记账语义不变——见 E2E 闭环测试。