登录社区云,与社区用户共同成长
邀请您加入社区
摘要: NVIDIA Run:ai v2.23与Dynamo深度集成,通过智能多节点调度优化大规模语言模型(LLM)推理效率。Dynamo专为分布式推理设计,支持分离式预填充与解码、动态GPU调度及KV缓存卸载,但多组件协调仍是挑战。Run:ai的Gang调度确保原子化部署,拓扑感知调度优化组件放置,减少跨节点延迟。实战指南详细演示了如何在Run:ai环境部署Dynamo,结合Kubernetes