在使用大模型服务前,请先完成以下准备工作。
推理镜像准备
通过 ctr 或 docker 命令将推理镜像上传到容器镜像服务,建议在工作空间创建 engines 共享空间统一存放。omni 为多模态推理引擎镜像,模型输出为语音、图片、视频的均属多模态;模型输出为文字时,无论输入是文字、语音还是图片,均不属多模态,应使用非 omni 镜像。镜像清单如下表,环境需要时拉取、重新打 tag 后 push 到目标环境;需打标签的镜像在容器镜像服务镜像详情页面设置。
推理镜像清单
| 镜像地址 | 需打标签 | 适用环境 |
|---|---|---|
| vllm/vllm-openai:v0.29.0 hub.easystack.cn/engines/vllm-openai:v0.29.0 |
vllm、nvidia | 英伟达 GPU |
| vllm/vllm-omni:v0.28.0 hub.easystack.cn/engines/vllm-omni:v0.28.0 |
vllm、nvidia | 英伟达 GPU(多模态) |
| harbor.sourcefind.cn:5443/dcu/admin/base/vllm:0.18.1-ubuntu22.04-dtk26.04-py3.10 hub.easystack.cn/engines/vllm:0.18.1-ubuntu22.04-dtk26.04-py3.10 |
vllm、hygon | 海光 HCU |
| quay.io/ascend/vllm-ascend:v0.23.0 hub.easystack.cn/engines/vllm-ascend:v0.23.0 |
vllm、huawei-ascend | 昇腾 NPU |
| quay.io/ascend/vllm-omni:v0.28.0 hub.easystack.cn/engines/ascend-vllm-omni:v0.28.0 |
vllm、huawei-ascend | 昇腾 NPU(多模态) |
| lmsysorg/sglang:v0.5.19-runtime hub.easystack.cn/engines/sglang:v0.5.19-runtime |
sglang、nvidia | 英伟达 GPU(SGLang) |
说明:
访问hub.easystack.cn需要联系EasyStack相关人员下载
项目命名空间与配额
项目管理员登录后进入《模型广场》,初始化项目所需 namespace;随后在《配额设置》中为项目设置所需配额,使用安全容器服务的配置。
模型文件准备
模型文件有两种获取方式:一是在线导入,例如使用 https://www.modelscope.cn/models/Qwen/Qwen2.5-0.5B-Instruct 直接导入;二是手动上传,下载模型包(如 http://fs.easystack.cn/models/Qwen2.5-0.5B.tar.gz)后解压,在《模型仓库》创建上传任务上传到环境。新建模型时选择“绑定已有模型文件”。