Posts by Schwinn Saereesitthipitak
精选
2026年 5月 27日
NVIDIA Dynamo Snapshot:面向 Kubernetes 上推理工作负载的快速启动
在生产环境中的推理部署里,需求会随时间波动,因此推理副本需要弹性扩缩容。然而,在 Kubernetes 上冷启动推理工作负载可能需要几分钟。
4 MIN READ