Loading
close

基本概念

time 更新时间:2026-10-08 16:41:12
  • 模型

    大模型服务中用于描述一项模型能力的资产档案,记录名称、图标、可见性、提供商、模型类型与任务类型等信息,是模型部署的起点。

    模型与模型文件分离:同一份模型文件可以建立多个模型档案用于不同场景,一个模型档案也可以随时改绑其他模型文件。

    模型按能力划分模型类型与任务类型,两者用于在模型广场中按维度检索,也决定了后续部署时可选的推理镜像与启动参数。

    按可见性分为私有模型和公有模型,公有模型是其他项目都可以检索和复用。

  • 模型文件

    模型的实际权重与配置文件集合,存放在模型仓库中,供模型档案绑定后用于部署。

    模型文件支持两种获取方式:从 ModelScope 等模型社区在线导入,或将本地模型文件夹上传。上传方式下目录结构原样保存,支持数百 GB 级模型,并支持暂停、继续与断点续传。

    若上传时标识为 LoRA 微调模型,该模型文件可在创建模型部署时从 LoRA 微调模型列表中选择。

  • 模型仓库

    用于存放模型文件的存储空间,分为公共仓库和私有仓库。公共仓库面向项目内共享,私有仓库仅供本人使用。

    每个仓库有独立的容量上限,公共仓库默认为 500 GB,私有仓库默认为 100 GB,均可按需调整。

    模型文件的下载或上传以任务形式管理。一次导入或上传对应一条任务记录,可查看来源、模型文件地址、状态、大小与进度。容量不足时,导入与上传任务无法提交。

  • 推理镜像

    承载推理框架的容器镜像,是推理引擎运行时的实际执行环境。推理镜像不在大模型服务内维护,需提前上传到容器镜像服务。创建推理引擎时,该字段在界面中显示为「镜像」。

    镜像必须携带两类标签才能被大模型服务识别:一类是引擎标签,取值为 vllm 或 sglang,对应推理引擎的类型;另一类是加速卡厂商标签,取值为 nvidia、hygon 或 huawei-ascend,对应所使用的加速卡。两类标签缺一不可,只打其中一类时,创建推理引擎时无法匹配到镜像。

    说明:
    推理镜像可分为 Omni 与普通 vLLM 两类,选择时主要依据模型的输出能力和模型架构,而不是输入模态。

    • 需要生成非文本内容的模型,如语音、图片、视频,通常使用 vLLM-Omni。例如文本转语音(TTS)、文生图、文生视频,以及同时输出文字+语音的 Omni 模型。
    • 只输出文本或向量的模型,通常使用普通 vLLM。因此即使输入包含图片、音频或视频,只要模型最终进行的是文本生成/识别,例如 VLM、OCR、ASR,一般仍走普通 vLLM 的多模态输入能力,而不需要 vLLM-Omni。
      最终仍需以对应版本的 模型支持列表和模型架构 为准,因为个别模型可能由于特殊 pipeline 或非自回归组件而必须使用 Omni。
  • 推理引擎

    一套可复用的推理配置模板,包含推理名称、类型、可见性、镜像、启动命令、启动参数、环境变量,以及 CPU、内存、AI加速卡等算力规格。

    推理引擎本身不运行,只作为创建模型部署时的规格来源。一次配置可被多个模型部署引用。

    推理类型支持 vLLM 和 SGLang 两种类型,默认为 vLLM。引擎按可见性分为私有引擎和公有引擎,公有引擎可被项目内其他用户复用。

    说明:

    • 创建推理引擎时资源规格不受项目配额限制,但是模型部署时会检查配额,如果配额不足,模型部署会失败。
  • 模型部署

    推理引擎与模型文件组合而成的在线推理服务实例,是模型真正对外提供推理能力的载体。

    创建部署时选定推理引擎与模型文件,部署默认继承引擎的镜像、启动参数与资源规格,无需重复填写。若某个部署需要不同的启动配置,可在高级配置中单独覆盖启动命令、启动参数与环境变量。

    说明:

    • 部署级的高级配置只作用于本次部署,不会修改推理引擎。
  • 副本

    一个模型部署同时运行的实例数量,用于提升并发处理能力与服务可用性。

    副本数在创建部署时指定,默认为 1。多个副本同时承载请求,并共同占用所在项目的算力配额。

  • AI 服务提供者

    可供模型网关调用的后端服务。

    按后端来源分为两类:内部指向云内的模型部署,创建时只需选择已部署的模型,访问地址由平台自动带出;外部指向第三方 AI 服务,需要手动填写访问地址与访问密钥,并选择对应的 API 规范与厂商。

  • 模型网关

    对外统一发布模型访问入口的功能模块。业务系统通过网关域名调用模型,无需感知后端的部署位置与具体实现。

    网关按模型分发请求:调用请求中的模型名称决定该请求被转发到哪个后端服务。因此新增或更换后端时,业务系统侧的调用方式不变。

  • 路由

    模型网关中的一条发布规则,由二级域名、对外模型名称与后端服务组成,即业务系统实际调用的地址。

    一条路由可以承载多个模型,每个模型可以挂载多个后端,从而形成主用与兜底关系:后端按优先级排序,优先级数值越小越优先;优先级相同时按权重分流。路由还可以设置 IP 访问控制(黑白名单),限定允许或禁止调用的来源地址。

  • 套餐

    模型调用的限流与授权载体。套餐同时定义两件事:调用的速率上限,以及可访问的路由范围。

    限速从两个维度设置:请求限速和 Token 限速。两者均可选择预设值或自定义,填写 0 表示不限。

说明:

  • 套餐只定义速率上限与授权范围,需由 API Key 绑定后才对调用生效。一个套餐可被多个 API Key 绑定。
  • API Key

    调用模型服务的鉴权主体,绑定套餐后生效。业务系统携带密钥发起调用,网关据此识别调用方身份、校验授权范围并施加限速。

    API Key 与其下挂载的密钥分属两层:API Key 承载套餐绑定、负责人与归属部门、项目等信息;密钥是实际用于调用的凭据,前缀为 sk-beacon-。

    一个 API Key 可以持有多把密钥,用于在不中断服务的前提下完成密钥轮换。密钥仅在签发时完整显示一次,平台不提供再次查看。

  • Token

    模型处理文本的基本计量单位,是调用计量的统计口径,也是限速的依据之一。

    Token 消耗按请求逐条记录,分为输入 Token、缓存命中 Token 与输出 Token 三类,三者之和为总 Token。其中缓存命中 Token 单独计量,可用于评估推理缓存的收益。

    Token 用量按部门、项目、用户、API Key、入口域名与模型等维度归集,支持导出报表,用于成本核算与分摊。

此篇文章对你是否有帮助?
没帮助
locked-file

您暂无权限访问该产品