用户管理
配额
存储配额与 GPU 配额的语义不同。GPU 是预扣:提交时就为这个作业留出卡数。
存储只能事后测量 —— 训练进程往盘上写不会通知平台,作业也说不出自己会写多少,
所以没有可预扣的量。规则是「已经超了就不再放新作业出队」,在跑的作业不受影响。用量由后台周期扫描得出(
FORGE_STORAGE_SCAN_INTERVAL_S,默认 600 秒),
因此是最终一致的:两次扫描之间可能短暂超出。扫描卡住时配额闸自动让行 ——
与其让所有人提交不了,不如在看板上把「数据陈旧」显示出来。维护模式
排空集群 → 升级 → 恢复,作业从 checkpoint 续训不丢进度:维护模式是总闸:drain 后新作业不出队、运行中作业被暂停(保留 checkpoint)。resume 后一切自动恢复,无需逐个操作。
sf admin
Manage users and quotas
sf admin disable
Disable or enable a user
sf admin maintenance
Drain, upgrade and resume the cluster
sf admin maintenance drain
Enter maintenance mode and drain
sf admin maintenance resume
Leave maintenance mode
--help 外没有其他选项。
sf admin maintenance status
Show maintenance state and safety
--help 外没有其他选项。
sf admin set-quota
Set a user’s compute and storage quota
sf admin set-role
Change a user’s role
除
--help 外没有其他选项。
sf admin user-add
Create a local account
sf admin users
List every user
--help 外没有其他选项。