TensorRT 多 GPU 推理能力已在 Dynamo-Triton 中集成

NVIDIA Generativ4 天前

生成式 AI 模型对计算能力和显存容量的需求持续增长,越来越多场景已经超出单块 GPU 能够提供的范围。

NVIDIA TensorRT 多设备推理是一项新能力,允许单个 TensorRT 网络跨多块 GPU 执行,同时继续保留 TensorRT 的推理优化能力。

核心信息

  • 单个 TensorRT 网络可以在多块 GPU 上运行。
  • 多设备执行使用基于 NCCL 的分布式 collective 通信机制。
  • 该能力面向需要更高算力或更大显存空间的生成式 AI 推理场景。
  • 从 TensorRT 11.0 开始,该能力获得完整支持。

对模型服务的意义

对于部署大模型或复杂生成式 AI 工作负载的团队来说,多 GPU 推理可以降低单卡资源限制带来的部署压力。通过在 TensorRT 推理优化基础上引入跨设备执行,模型服务系统可以更直接地利用多 GPU 资源,而不必完全依赖单卡承载整个网络。

该能力已集成到 NVIDIA Dynamo-Triton 相关模型服务方案中,目标是简化多 GPU 推理部署流程。

评论

请登录后发表观点

暂无数据