模型部署配置
1. 功能概述
模型部署是大模型服务平台的推理服务上线模块,用于将模型文件与推理引擎模板结合,部署为可对外提供服务的在线推理实例。平台支持两种模型来源:从平台模型仓库中选择已有模型文件,或直接通过 OCI 地址拉取外部模型;同时支持自定义副本数、覆盖启动配置,实现推理服务的快速创建、运行管理与全生命周期运维。
2. 操作入口与列表说明
- 登录大模型服务平台,在左侧主导航栏点击 模型部署,进入模型部署管理列表页。
- 页面右上角点击 新建模型部署,即可打开部署配置弹窗。
- 列表字段说明:
- 名称、模型文件、推理引擎:展示部署服务的基础标识与依赖资源。
- 副本、CPU / 内存、AI 加速卡:展示部署实例的算力资源配置。
- 状态:展示服务当前运行状态(创建中、运行中、异常、已停止等)。
- 部门 / 项目、创建时间:展示归属信息与创建时间。
- 操作列:支持对单个部署进行查看、启停、删除等操作。
- 列表顶部功能:
- 刷新按钮:同步最新的部署状态与数据。
- 删除模型部署:勾选多个部署后,可批量删除。
- 筛选 / 搜索框:按条件快速检索目标部署服务。
3. 新建模型部署
点击「新建模型部署」后,按以下步骤完成配置,带 * 标识为必填项。
3.1 基本配置
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 部署名称 | 必填 | 输入推理部署服务的名称,用于标识与管理该服务。 |
| 副本数 | 必填 | 设置推理服务的实例副本数量,默认为 1;增加副本可提升服务并发处理能力。 |
| 推理引擎 | 必填 | 下拉选择已创建的推理引擎模板。部署默认复用所选引擎的镜像、启动参数、资源规格等全部配置;架构信息会根据所选引擎自动带出。 |
提示:如需自定义本次部署的启动命令、参数、环境变量,可展开「高级配置」进行覆盖,不会修改原推理引擎模板。
3.2 模型文件配置
支持两种模型来源方式,二选一配置。
方式一:从模型仓库选择
适用于模型文件已导入平台模型仓库的场景。
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 模型仓库 | 必填 | 下拉选择模型所在的仓库:公共仓库 / 私有仓库。 |
| 模型文件 | 必填 | 下拉选择对应仓库内的目标模型文件。 |
方式二:手动输入 OCI 地址
适用于模型存放在外部镜像仓库,无需提前导入平台仓库的场景。
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 模型文件地址(OCI URI) | 必填 | 输入模型的 OCI 标准地址,示例:oci://hub.ecns.io/models/qwen2.5-0.5b-instruct:latest |
3.3 SERVED_MODEL_NAME
- 选填项,填写后会作为环境变量
SERVED_MODEL_NAME注入部署容器。 - 生效条件:必须在推理引擎的「启动参数」中引用该变量,例如配置
--served-model-name ${SERVED_MODEL_NAME},才会动态替换为实际值。 - 作用:实现部署时动态指定服务对外暴露的模型名称,无需修改引擎模板。
3.4 高级配置(覆盖启动命令 / 参数 / 环境变量)
点击展开「高级配置」,可针对本次部署自定义运行配置,配置仅写入本次部署,不会修改原推理引擎模板;留空则沿用所选推理引擎的默认值。
表格
| 配置项 | 说明 |
|---|---|
| 启动命令 | 自定义服务启动命令,格式要求:每行一个参数,每行内不要包含空格。平台默认模型权重文件存放路径为 /mnt/models。点击右侧「格式化」可自动规范命令格式。 |
| 启动参数 | 自定义服务启动参数,格式要求:每行一个参数,每行内不要包含空格。注意:平台固定使用 8000 端口,请勿修改端口参数,否则服务无法正常暴露。${SERVED_MODEL_NAME} 变量在此处引用生效。 |
| 环境变量 | 点击「添加」可新增自定义环境变量,以「变量名 = 值」的形式配置,为部署实例注入运行所需的环境配置。 |
3.5 提交部署
所有配置确认无误后,点击弹窗右下角 创建,系统开始创建部署实例;点击 取消 放弃创建并关闭弹窗。
4. 部署服务管理
在模型部署列表页,可对已创建的服务进行管理:
- 状态查看:实时查看服务的运行状态,部署完成后状态变为「运行中」即可对外提供推理服务。
- 服务启停:在操作列可对单个服务执行启动、停止操作,调整服务运行状态。
- 批量删除:勾选多个部署服务,点击顶部「删除模型部署」批量释放资源;也可在操作列删除单个服务。
- 详情查看:点击部署名称可进入详情页,查看服务端点、配置信息、运行日志等。
5. 注意事项
- 架构匹配:所选推理引擎的架构必须与模型文件的运行架构一致,否则会导致部署失败。
- 配置作用范围:高级配置仅对本次部署生效,不会修改原推理引擎模板;若需通用配置,请直接修改对应推理引擎。
- 端口限制:推理服务固定使用 8000 端口,禁止在启动参数中修改端口值,避免服务无法正常访问。
- 资源配额:副本数与资源规格请根据平台资源配额与业务并发需求合理设置,资源不足会导致部署启动失败。
- OCI 地址连通性:使用手动输入 OCI 地址方式时,请确保平台网络可正常访问对应的镜像仓库地址。
- 变量生效条件:
SERVED_MODEL_NAME必须在启动参数中通过${SERVED_MODEL_NAME}引用才会生效,仅填写变量值不引用无法生效。