推理引擎配置
1. 功能概述
推理引擎是大模型服务平台中用于定义模型推理运行环境的基础模板,通过配置镜像、启动参数、算力资源等信息,为后续模型部署提供标准化的推理运行环境。您可以通过创建推理引擎,自定义适配不同框架、不同算力需求的推理运行方案。
2. 操作入口
- 登录大模型服务平台,在左侧主导航栏点击 推理引擎,进入推理引擎管理列表页。
- 点击页面右上角的 创建推理引擎 按钮,即可打开创建配置弹窗。
3. 配置项详解
创建推理引擎的配置项分为基础信息、资源限制、运行架构、镜像选择、启动命令、启动参数、环境变量七大类,带 * 标识为必填项。
3.1 基础信息
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 名称 | 必填 | 输入推理引擎的名称,建议使用便于识别的命名,描述引擎用途或框架类型。 |
| 描述 | 选填 | 补充输入推理引擎的详细说明、适用场景等描述信息。 |
| 引擎可见性 | 必填 | 单选:- 私有引擎:仅创建者及被授权的用户可见、可使用- 公有引擎:平台内所有用户均可见、可使用 |
| 类型 | 必填 | 下拉选择推理引擎的技术框架类型,例如 vLLM 等,平台将基于该类型过滤匹配的镜像。 |
3.2 资源限制
用于指定推理引擎实例运行时分配的算力资源规格。
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| CPU | 必填 | 设置实例分配的 CPU 核数,单位:核,示例值:8。 |
| 内存 (Gi) | 必填 | 设置实例分配的内存容量,单位:Gi,示例值:10。 |
| AI 加速卡型号 | 选填 | 下拉选择适配的 AI 加速卡(如 GPU 型号),用于提升推理性能;无加速卡需求可留空。 |
3.3 架构
- 必填,单选:X86 架构 / ARM 架构
- 注意:所选架构必须与后续选择的镜像架构保持一致,否则无法匹配到可用镜像。
3.4 镜像
镜像为推理引擎运行的基础操作系统与环境包,平台会根据您选择的引擎类型、架构自动过滤匹配的镜像。
- 若提示「暂无匹配的引擎镜像」,请检查架构选择是否正确,或确认平台是否已上传带有对应引擎标签(如 vllm)的镜像。
- 需先完成引擎类型、架构的选择后,再选择对应的引擎镜像。
3.5 启动命令
用于定义推理引擎服务的启动入口指令:
- 格式要求:每行填写一个参数,每行内不要包含空格。
- 示例默认命令:
vllm serve /mnt/models - 说明:平台默认模型权重文件存放路径为
/mnt/models。 - 点击右侧 格式化 按钮,可自动规范命令格式。
3.6 启动参数
用于配置推理服务的运行参数:
- 格式要求:每行填写一个参数,每行内不要包含空格。
- 示例默认参数:
--served-model-name ${SERVED_MODEL_NAME} --port 8000 --enable-prompt-tokens-details - 关键说明:
- 平台固定支持 8000 端口,请勿修改
--port后的端口值,否则服务无法正常暴露。 ${SERVED_MODEL_NAME}为平台内置变量,在模型部署时会自动替换为实际的模型名称,无需手动填写具体值。
- 平台固定支持 8000 端口,请勿修改
- 点击右侧 格式化 按钮,可自动规范参数格式。
3.7 环境变量
- 点击 添加 按钮,可新增环境变量的键值对,为推理引擎运行注入自定义环境配置(如路径、密钥、功能开关等)。
4. 操作步骤
- 进入【推理引擎】列表页,点击右上角 创建推理引擎。
- 按照上述说明,依次完成所有必填项(带 *)的配置,按需配置选填项。
- 确认所有配置无误后,点击弹窗右下角的 创建 按钮,完成推理引擎创建。
- 创建成功后,返回推理引擎列表页,即可查看新建的引擎,后续可在模型部署时选择该引擎作为运行环境。
- 若需放弃创建,点击 取消 按钮即可关闭弹窗。
5. 列表管理说明
在推理引擎列表页,您还可以进行以下操作:
- 查看所有引擎的名称、类型、所属部门 / 项目、创建时间等信息。
- 通过筛选条件快速查找目标引擎。
- 勾选单个或多个引擎后,点击 删除推理引擎 进行批量删除。
- 在操作列对单个引擎进行管理操作。
6. 注意事项
- 镜像架构必须与所选 CPU 架构(X86/ARM)一致,且镜像需带有对应引擎类型的标签(如 vllm),否则无法匹配到可用镜像。
- 启动命令与启动参数均需严格遵循「每行一个参数、参数内无空格」的格式要求,建议使用格式化功能校验格式。
- 推理服务端口固定为 8000,禁止私自修改端口参数,避免服务无法正常访问。
- 请根据模型体积、并发推理需求合理配置 CPU、内存、加速卡资源,资源不足会导致服务启动失败或推理性能低下。
- 公有引擎会对全平台用户开放,请勿在引擎中配置敏感信息。
模型仓库配置
1. 功能概述
模型仓库是大模型服务平台的模型文件存储与管理中心,提供公共仓库与私有仓库两类存储空间,支持从 ModelScope、Hugging Face 远程导入模型,以及本地文件夹上传模型两种入库方式,同时支持仓库容量配置、下载代理设置、断点续传等能力,为后续模型部署提供稳定的文件存储支撑。
2. 操作入口
- 登录大模型服务平台,在左侧主导航栏点击 模型仓库,进入模型仓库管理页面。
- 页面左侧为「仓库列表」,展示所有可访问的仓库;右侧为选中仓库的模型文件与任务列表,支持查看、筛选与管理操作。
3. 仓库列表说明
平台默认提供两类仓库,不同仓库的访问范围与初始容量不同:
表格
| 仓库类型 | 仓库标识 | 默认容量 | 访问范围 |
|---|---|---|---|
| 公共仓库 | model-public | 500 GiB | 平台内所有用户可见、可使用,共享模型存储空间 |
| 私有仓库 | model-xxxxxx(唯一 ID) | 100 GiB | 仅创建者及被授权用户可见、可使用,专属私有存储空间 |
每个仓库卡片展示信息:仓库名称、仓库 ID、已使用容量 / 总容量、最近更新时间,卡片右上角提供 容量设置 入口。
4. 仓库容量设置
您可根据业务需求调整每个仓库的总存储容量:
- 在左侧仓库列表中,点击目标仓库卡片右上角的 容量设置,弹出容量设置弹窗。
- 在「容量限制(GiB)」输入框中填写目标总容量,单位为 GiB。
- 点击 保存 生效,点击 取消 放弃修改。
说明:该容量为仓库工作空间的总存储上限,已使用容量不可超过设置的总容量;调小容量前请确保仓库新容量不低于仓库内文件总大小。
5. 创建导入任务(远程拉取模型)
通过导入任务,可从 ModelScope、Hugging Face 等开源模型平台远程拉取模型文件到当前仓库。
5.1 操作入口
选中目标仓库后,点击页面上方的 创建导入任务 按钮,打开创建配置弹窗。
5.2 配置项详解
带 * 标识为必填项。
基础信息
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 来源类型 | 必填 | 下拉选择模型来源:- ModelScope:魔搭社区(国内平台,推荐)- Hugging Face:Hugging Face 模型平台 |
| 模型文件名称 | 必填 | 模型在当前仓库中的显示名称;粘贴原始链接后可自动解析填充,也可手动修改。 |
| 原始链接 | 必填 | 输入对应平台的模型详情页原始链接,例如 https://www.modelscope.cn/models/Qwen/Qwen2.5-0.5B-Instruct。点击右侧 解析链接,系统自动校验链接有效性并解析模型大小,结果显示在「解析状态」区域。 |
| 限速(MB/s) | 选填 | 设置下载最大速度,单位为 MB/s。留空或填写 0 表示不限速;任务运行中暂停后可修改限速。 |
下载代理
用于网络受限环境下的模型下载,单选「不启用」或「启用」:
- 不启用:直接通过公网下载模型,默认选项。
- 启用:需配置代理参数:
- 代理地址:输入代理服务器地址,支持
http:///https://协议,可携带用户名和密码,示例:http://user:pass@proxy.example.com:8080。 - 附加代理参数:支持配置
HTTP_PROXY、HTTPS_PROXY、ALL_PROXY、NO_PROXY环境变量,点击 新增参数 可添加多条,格式为「参数名 = 参数值」。
- 代理地址:输入代理服务器地址,支持
存储容量预览
可视化展示当前仓库的已使用容量、本次新增容量与总容量,便于提前判断存储空间是否充足,避免因容量不足导致任务失败。
其他信息
- 解析状态:显示链接解析结果与校验状态,链接解析成功后会展示模型文件大小。
- 描述:选填,补充模型的用途、版本、说明等信息。
5.3 任务提交
所有配置确认无误后,点击弹窗右下角 创建导入任务,系统后台自动开始下载模型;点击 取消 关闭弹窗。
6. 创建上传任务(本地模型上传)
通过上传任务,可将本地的模型文件夹上传至平台仓库,支持大文件断点续传。
6.1 操作入口
选中目标仓库后,点击页面上方的 创建上传任务 按钮,打开上传配置弹窗。
6.2 配置项详解
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 模型文件名称 | 必填 | 模型上传后在仓库中的显示名称。 |
| 描述 | 选填 | 模型文件的补充说明信息。 |
| LoRA 微调模型 | 选填 | 勾选后,该模型将被标记为 LoRA 微调权重,可在模型部署的 LoRA 微调模型列表中被选择。 |
| 本地文件夹选择 | 必填 | 点击选择区域,选取本地的模型文件夹。特性:1. 支持数百 GB 超大模型上传2. 支持暂停、继续与断点续传3. 上传后目录结构原样保存4. 中断后重新选择同一文件夹即可续传 |
| 存储容量预览 | - | 展示当前仓库存储使用情况,确认容量充足后再提交。 |
6.3 任务提交
配置完成后,点击 创建并上传 开始上传;点击 关闭 放弃上传并关闭弹窗。
7. 模型列表与任务管理
在页面右侧的模型列表中,可查看当前仓库内所有模型文件与任务:
- 列表字段:名称、来源、模型文件地址、状态、大小 / 进度、操作。
- 支持通过右上角筛选框快速搜索目标模型。
- 点击页面左上角刷新按钮,可同步最新的任务进度与状态。
8. 注意事项
- 容量限制:请确保仓库剩余容量充足,模型文件大小超出剩余容量会导致导入 / 上传失败。
- 网络要求:远程导入模型时,请确保原始链接可正常访问;启用代理请提前验证代理地址的连通性。
- 断点续传:本地上传中断后,请勿修改本地文件夹的路径与内容,重新选择同一文件夹即可继续上传。
- 公共仓库规范:公共仓库为全平台共享空间,请勿上传敏感、未授权或违规的模型文件。
- LoRA 标记:「LoRA 微调模型」仅为分类标记,仅勾选后可在部署微调场景中被检索,普通基础模型无需勾选。
模型广场配置
1. 功能概述
模型广场是大模型服务平台的模型资产统一管理与分发入口,支持按模型能力检索、浏览全平台可用的模型资产,并可快速创建可直接用于部署的模型资产。平台提供两种模型创建方式:绑定模型仓库中已有的模型文件,或直接从 ModelScope 等远程源导入新模型文件并同步生成模型资产。
2. 操作入口与列表说明
- 登录大模型服务平台,在左侧主导航栏点击 模型广场,进入模型广场列表页面。
- 页面顶部提供筛选与搜索能力:
- 筛选维度:提供商、模型类型、任务类型,支持下拉选择对应条件过滤模型。
- 搜索框:输入关键词快速检索目标模型。
- 刷新按钮:点击同步最新的模型资产数据。
- 页面右上角点击 新建模型,即可打开模型创建弹窗。
- 列表区域展示所有可见的模型资产,包含模型名称、提供商、类型、任务类型等信息,支持按条件筛选与查看。
3. 新建模型
创建模型分为「绑定已有模型文件」和「导入新模型文件」两种方式,均需先完成基础信息配置。
3.1 基础信息配置(通用)
两类创建方式均需配置以下基础信息,带 * 为必填项。
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 名称 | 必填 | 输入模型资产的显示名称,建议命名清晰可识别。 |
| 模型图标 | 选填 | 点击 上传图标 上传自定义模型图标。格式要求:支持 PNG、JPG、WebP 格式;文件大小最大 256 KB;像素尺寸不超过 512×512。 |
| 模型可见性 | 必填 | 单选:- 私有模型:仅创建者及被授权用户可见、可使用- 公有模型:平台内所有用户均可见、可使用 |
| 描述 | 选填 | 输入模型的功能说明、适用场景、版本信息等描述内容。 |
3.2 方式一:绑定已有模型文件
适用于模型文件已上传 / 导入至模型仓库,需将其封装为可部署的模型资产的场景。
配置项说明:
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 仓库 | 必填 | 下拉选择模型文件所在的仓库:公共仓库 / 私有仓库。 |
| 模型文件 | 必填 | 下拉选择对应仓库中已存在的模型文件。 |
| 提供商与模型分类 | - | 用于模型分类检索与能力标识:- 提供商:模型所属的厂商或组织机构,如 Meta、Qwen、DeepSeek 等- 来源名称:模型的原始官方名称,如 Llama-3-8B-Instruct- 模型类型:模型能力类型,如 llm(大语言模型)、embedding(向量嵌入)、reranker(重排序)等- 任务类型:支持的任务场景,如 text-generation(文本生成)、multimodal(多模态)等 |
| 推理引擎 | 选填 | 为模型绑定默认的推理引擎模板,部署时可直接复用该引擎配置。 |
配置完成后,点击弹窗右下角 创建模型,即可生成模型资产并展示在模型广场列表中。
3.3 方式二:导入新模型文件
适用于需要从远程平台拉取模型文件,同时完成模型资产创建的场景。系统会自动将模型文件导入目标仓库,并同步生成模型资产。
配置项说明:
表格
| 配置项 | 必填性 | 说明 |
|---|---|---|
| 导入目标仓库 | 必填 | 选择模型文件导入的目标仓库:公共仓库 / 私有仓库。 |
| 来源类型 | 必填 | 选择模型来源平台,支持 ModelScope 等。 |
| 原始链接 | 必填 | 粘贴对应平台的模型详情页原始链接,示例:https://www.modelscope.cn/models/Qwen/Qwen2.5-0.5B-Instruct点击右侧 解析链接,系统自动校验链接有效性并解析模型信息。可点击「打开 ModelScope 模型列表」跳转至模型库选择目标模型。 |
| 下载代理 | 必填 | 单选:- 不启用:直接通过公网下载,默认选项- 启用:网络受限环境下使用,需配置: ① 代理地址:支持 http:// 或 https:// 协议,可包含用户名和密码 ② 附加代理参数:支持配置 HTTP_PROXY、HTTPS_PROXY、ALL_PROXY、NO_PROXY 环境变量,点击「新增参数」可添加多条 |
| 限速(MB/s) | 选填 | 设置下载最大速度,单位 MB/s;留空或填写 0 表示不限速,任务运行中可暂停修改。 |
| 存储容量 | - | 预览目标仓库的已用容量与总容量,确保存储空间充足。 |
配置完成后,点击 创建模型,系统将自动启动模型文件导入任务,并在导入完成后生成对应的模型资产。
4. 模型列表管理
在模型广场列表页,您可以进行以下操作:
- 通过「提供商」「模型类型」「任务类型」下拉筛选,快速定位对应能力的模型。
- 在搜索框输入关键词,模糊搜索匹配的模型资产。
- 点击列表中的模型,可查看模型详情、进行部署等后续操作。
5. 注意事项
- 可见性规范:设置为「公有模型」的资产将对全平台用户开放,请勿在模型信息与文件中包含敏感、未授权内容。
- 文件完整性:绑定已有模型文件前,请确认模型仓库中的文件完整可用,避免部署失败。
- 导入容量:选择导入新模型文件时,请确保目标仓库剩余容量充足,超出容量将导致导入失败。
- 网络连通性:远程导入模型时,请确保原始链接可正常访问;启用代理请提前验证代理地址的连通性。
- 图标规范:上传的模型图标请遵守格式与大小限制,不符合要求的图片将无法上传成功。