场景

推理服务部署

在 GPU 实例中自行部署推理框架;多副本负载均衡由用户自建

最后更新:2026-08-27

1. 部署架构

  • 单实例推理:适合开发验证,通过 Jupyter、SSH 或已开放的连接方式启动 vLLM、TGI、TensorRT-LLM 等框架(软件与许可由用户自行准备)。
  • 多副本:可创建多个相同模板实例,并在实例前自行部署负载均衡 / 反向代理;当前平台不提供托管「推理网关」,也不自动把市场节点组成同构推理集群。
  • 平台 API:若使用开放服务目录中的托管推理 SKU,请按《平台算力 API》文档调用,与自建实例推理是两条路径。
  • 冷启动:首次拉取模型权重耗时较长,建议使用带本地缓存的环境或预热脚本;实际耗时取决于镜像、网络与主机磁盘。

2. 性能优化

  • 量化:INT8/INT4 量化可显著降低显存与提升吞吐,需验证精度是否满足业务要求(属框架侧实践)。
  • 批处理:动态 batching 提升 GPU 利用率;注意 P99 延迟与 batch 窗口的权衡。
  • 关键业务可选用 critical SLA,以缩短主机离线判定宽限并提高调度优先级;迁移仍依赖有效检查点与可用供给,不承诺固定完成时间。

3. 安全与访问

  • 勿将推理 API 直接暴露公网而无鉴权;推荐自建反向代理 + API Key 或 mTLS。
  • 模型与提示词可能含敏感信息,停止实例前清除磁盘缓存,并自行备份重要产物。
返回文档中心

需要更多帮助? 联系客服