场景

AI 模型训练

按市场供给选 GPU 与模板,用工作区与检查点保住进度,按 SLA 与余额策略跑长任务

最后更新:2026 年 8 月 26 日

1. 推荐配置

  • GPU 选型:在 GPU 市场按型号、显存与价格筛选;A100/H100 等是否可选取决于当前主机供给,不以文档承诺固定库存。
  • 环境模板:优先选用当前已启用的 CUDA / 开发机类模板(如自由开发机),再在实例内自行安装所需 PyTorch、CUDA 工具与依赖;框架与驱动版本以模板详情和实例实际环境为准,勿默认存在「PyTorch 2.x + CUDA 12」专用训练镜像。
  • 显存余量:按模型参数量预留约 1.2~1.5 倍安全余量;显存不足时可换更大显存主机,或自行量化 / 减小 batch。
  • 实例粒度:市场实例通常按单卡调度。若需单机多卡,须确认目标主机是否提供多卡且创建参数支持,不能默认一键多卡。
  • 大模型微调:建议创建时选择保障版(protected)或关键版(critical)SLA。主机离线时,仅在存在有效检查点且有可迁移、具备检查点能力的目标主机时,平台才会尝试迁移;无检查点不能保全内存态训练进度。
  • 分布式训练:多实例 NCCL / 组网需用户自行确认互通、拓扑与启动方式;平台不自动把任意市场节点组成同构训练集群。

2. 数据与存储

  • 工作区:训练数据与代码优先放在实例挂载的工作区(容器内通常为 /workspace),可通过客户端或工作区同步上传;重要数据请同时保留外部副本。
  • 检查点:将 checkpoint 写到工作区子路径,并确保实例侧能上报/保留可恢复的检查点信息。停止后约 24 小时内、在余额充足且有 workspace/checkpoint 的前提下可尝试恢复;超时或缺少路径则无法恢复。
  • 超大权重:体积很大的 checkpoint 建议自行压缩后同步到您的外部对象存储或本机;平台不提供名为 SUANLI_DATA_URI 的自动挂载环境变量。
  • 勿依赖容器可写层:TB 级数据或仅存在容器可写层的文件,在容器重建后不可恢复。

3. 训练最佳实践

  • 框架侧:使用 mixed precision(bf16/fp16)降低显存;用 torch.save 或 Hugging Face Trainer 的 save_steps 定期落盘(属训练脚本实践,非平台代管)。
  • 观察运行:结合实例状态、事件与日志判断是否在跑;若 GPU 长期空闲,可换更小规格或检查数据管道,以控制成本。
  • 时长与余额:创建实例时填写计划时长(planned_duration_seconds),并在账户通知偏好中开启低余额提醒,避免余额耗尽被自动停机。
  • SLA 诚实预期:standard 主机离线通常停止且不自动迁移;protected/critical 依赖有效检查点与可用供给,不承诺固定迁移完成时间。
返回文档中心

需要更多帮助? 联系客服