场景
推理服务部署
在 GPU 实例中自行部署推理框架;多副本负载均衡由用户自建
最后更新:2026-08-27
1. 部署架构
- 单实例推理:适合开发验证,通过 Jupyter、SSH 或已开放的连接方式启动 vLLM、TGI、TensorRT-LLM 等框架(软件与许可由用户自行准备)。
- 多副本:可创建多个相同模板实例,并在实例前自行部署负载均衡 / 反向代理;当前平台不提供托管「推理网关」,也不自动把市场节点组成同构推理集群。
- 平台 API:若使用开放服务目录中的托管推理 SKU,请按《平台算力 API》文档调用,与自建实例推理是两条路径。
- 冷启动:首次拉取模型权重耗时较长,建议使用带本地缓存的环境或预热脚本;实际耗时取决于镜像、网络与主机磁盘。
2. 性能优化
- 量化:INT8/INT4 量化可显著降低显存与提升吞吐,需验证精度是否满足业务要求(属框架侧实践)。
- 批处理:动态 batching 提升 GPU 利用率;注意 P99 延迟与 batch 窗口的权衡。
- 关键业务可选用 critical SLA,以缩短主机离线判定宽限并提高调度优先级;迁移仍依赖有效检查点与可用供给,不承诺固定完成时间。
3. 安全与访问
- 勿将推理 API 直接暴露公网而无鉴权;推荐自建反向代理 + API Key 或 mTLS。
- 模型与提示词可能含敏感信息,停止实例前清除磁盘缓存,并自行备份重要产物。