Loading
close

推理实例部署

time 更新时间:2026-10-08 16:41:12

模型部署配置

1. 功能概述

模型部署是大模型服务平台的推理服务上线模块,用于将模型文件与推理引擎模板结合,部署为可对外提供服务的在线推理实例。平台支持两种模型来源:从平台模型仓库中选择已有模型文件,或直接通过 OCI 地址拉取外部模型;同时支持自定义副本数、覆盖启动配置,实现推理服务的快速创建、运行管理与全生命周期运维。

2. 操作入口与列表说明

  1. 登录大模型服务平台,在左侧主导航栏点击 模型部署,进入模型部署管理列表页。
  2. 页面右上角点击 新建模型部署,即可打开部署配置弹窗。
  3. 列表字段说明:
    • 名称、模型文件、推理引擎:展示部署服务的基础标识与依赖资源。
    • 副本、CPU / 内存、AI 加速卡:展示部署实例的算力资源配置。
    • 状态:展示服务当前运行状态(创建中、运行中、异常、已停止等)。
    • 部门 / 项目、创建时间:展示归属信息与创建时间。
    • 操作列:支持对单个部署进行查看、启停、删除等操作。
  4. 列表顶部功能:
    • 刷新按钮:同步最新的部署状态与数据。
    • 删除模型部署:勾选多个部署后,可批量删除。
    • 筛选 / 搜索框:按条件快速检索目标部署服务。

3. 新建模型部署

点击「新建模型部署」后,按以下步骤完成配置,带 * 标识为必填项。

3.1 基本配置

表格

配置项 必填性 说明
部署名称 必填 输入推理部署服务的名称,用于标识与管理该服务。
副本数 必填 设置推理服务的实例副本数量,默认为 1;增加副本可提升服务并发处理能力。
推理引擎 必填 下拉选择已创建的推理引擎模板。部署默认复用所选引擎的镜像、启动参数、资源规格等全部配置;架构信息会根据所选引擎自动带出。

提示:如需自定义本次部署的启动命令、参数、环境变量,可展开「高级配置」进行覆盖,不会修改原推理引擎模板。

3.2 模型文件配置

支持两种模型来源方式,二选一配置。

方式一:从模型仓库选择

适用于模型文件已导入平台模型仓库的场景。

表格

配置项 必填性 说明
模型仓库 必填 下拉选择模型所在的仓库:公共仓库 / 私有仓库。
模型文件 必填 下拉选择对应仓库内的目标模型文件。

方式二:手动输入 OCI 地址

适用于模型存放在外部镜像仓库,无需提前导入平台仓库的场景。

表格

配置项 必填性 说明
模型文件地址(OCI URI) 必填 输入模型的 OCI 标准地址,示例:oci://hub.ecns.io/models/qwen2.5-0.5b-instruct:latest

3.3 SERVED_MODEL_NAME

  • 选填项,填写后会作为环境变量 SERVED_MODEL_NAME 注入部署容器。
  • 生效条件:必须在推理引擎的「启动参数」中引用该变量,例如配置 --served-model-name ${SERVED_MODEL_NAME},才会动态替换为实际值。
  • 作用:实现部署时动态指定服务对外暴露的模型名称,无需修改引擎模板。

3.4 高级配置(覆盖启动命令 / 参数 / 环境变量)

点击展开「高级配置」,可针对本次部署自定义运行配置,配置仅写入本次部署,不会修改原推理引擎模板;留空则沿用所选推理引擎的默认值。

表格

配置项 说明
启动命令 自定义服务启动命令,格式要求:每行一个参数,每行内不要包含空格。平台默认模型权重文件存放路径为 /mnt/models。点击右侧「格式化」可自动规范命令格式。
启动参数 自定义服务启动参数,格式要求:每行一个参数,每行内不要包含空格。注意:平台固定使用 8000 端口,请勿修改端口参数,否则服务无法正常暴露。${SERVED_MODEL_NAME} 变量在此处引用生效。
环境变量 点击「添加」可新增自定义环境变量,以「变量名 = 值」的形式配置,为部署实例注入运行所需的环境配置。

3.5 提交部署

所有配置确认无误后,点击弹窗右下角 创建,系统开始创建部署实例;点击 取消 放弃创建并关闭弹窗。

4. 部署服务管理

在模型部署列表页,可对已创建的服务进行管理:

  1. 状态查看:实时查看服务的运行状态,部署完成后状态变为「运行中」即可对外提供推理服务。
  2. 服务启停:在操作列可对单个服务执行启动、停止操作,调整服务运行状态。
  3. 批量删除:勾选多个部署服务,点击顶部「删除模型部署」批量释放资源;也可在操作列删除单个服务。
  4. 详情查看:点击部署名称可进入详情页,查看服务端点、配置信息、运行日志等。

5. 注意事项

  1. 架构匹配:所选推理引擎的架构必须与模型文件的运行架构一致,否则会导致部署失败。
  2. 配置作用范围:高级配置仅对本次部署生效,不会修改原推理引擎模板;若需通用配置,请直接修改对应推理引擎。
  3. 端口限制:推理服务固定使用 8000 端口,禁止在启动参数中修改端口值,避免服务无法正常访问。
  4. 资源配额:副本数与资源规格请根据平台资源配额与业务并发需求合理设置,资源不足会导致部署启动失败。
  5. OCI 地址连通性:使用手动输入 OCI 地址方式时,请确保平台网络可正常访问对应的镜像仓库地址。
  6. 变量生效条件:SERVED_MODEL_NAME 必须在启动参数中通过 ${SERVED_MODEL_NAME} 引用才会生效,仅填写变量值不引用无法生效。
此篇文章对你是否有帮助?
没帮助
locked-file

您暂无权限访问该产品