卡型 series
一类卡的规格与调度参数(内置 h200 / h100 默认,FORGE_HARDWARE_SERIES JSON 覆盖):
Profile
卡型 + 默认形状 + 调优覆盖(内置默认,FORGE_CLUSTER_PROFILES 覆盖):
name/series/num_nodes/gpus_per_node:形状即配额与训练的权威拓扑;env:进程环境(NCCL、Ray 内存阈值、PyTorch 分配器)——多节点须与 ray start 同一份;overrides:框架覆盖项(并行度、vLLM 显存比、micro batch)。只放所有实验共有的键(CLI override 是 struct 模式,改不存在的键会报错)。
FORGE_HWCONFIG_REFRESH_INTERVAL 拉取)。
用户配额
FORGE_QUOTA_ENFORCE=0 可整体降为「只记录不拦截」(试运行期用)。
存储配额
--max-storage-gb 限制该用户全部 run 目录(工作目录 + checkpoint + 日志)的合计占用。
计量口径是 runs/<用户>/;缓存(权重 / 数据集 / 语料)属于平台共享,不归到个人 ——
一个作业拉下来的权重,后面每个作业都在用。
两者管的是不同的事:配额是「谁占得太多」,水位线是「盘要满了」。
时段窗口
按卡型限制每日可运行时段(管理 → 平台设置 → 时段):
窗口重开后被暂停的作业自动续训。