/deployments)面向长期内网服务,与带 TTL 的 Playground 相互独立。每个部署拥有稳定端点、不可变 Revision 和独立访问 Token;暂停后会释放 GPU,但保留这些身份信息。
受管部署及其 revision 与端点。
创建部署
创建向导分为名称、模型、运行配置和确认四步。模型来源支持:- StarForge 训练 run 的
hf_export;普通 checkpoint 需先执行sf export; - Hugging Face 仓库,可选使用当前用户已连接的 HF 凭据访问私有模型;
- 管理员允许的共享目录。
状态与自愈
状态依次为Deploying、Warming、Ready,异常时显示 Degraded 或 Failed,暂停后为 Suspended。Ready 表示运行时存活、健康检查成功、/v1/models 包含预期模型名,并完成最小生成预热。
单副本运行时丢失或连续健康检查失败后,控制器会按退避策略重建。暂停会停止运行时并释放 GPU;恢复会基于当前 Revision 重新创建。
调用稳定端点
创建部署后只显示一次初始 Token。后续可在 设置 → 部署 Token 创建、撤销或轮换 Token。Responses API
Ready 部署同时保证 OpenAI Responses API 的创建与 SSE 流式输出可用。稳定网关也允许 GET、POST 和 DELETE,因此查询、取消、删除、input items 等辅助端点会按引擎原生能力透传;当前 vLLM 基线保证创建、查询和取消,较新的 SGLang 还提供更完整的状态端点。response_id / conversation_id 可能失效;需要跨重建持久化的应用应保存完整 input items,并以 store: false 调用。
OpenAI 托管的 web search、file search、code interpreter 等内置工具不会由本地引擎自动获得;函数工具、reasoning 和结构化输出能力取决于模型、引擎版本及所选 parser。