Zheng Luo

Zheng Luo 是 NVIDIA Dynamo 团队的高级软件工程师,负责研究用于大语言模型推理的分布式系统。他目前的工作重点是降低 LLM 推理启动延迟,并在广泛使用的开源推理框架中实现这些优化。此前,他开发并运营了一个为前沿模型服务的大规模推理集群。Zheng 拥有加州大学尔湾分校的硕士学位和上海复旦大学的学士学位。

Posts by Zheng Luo

数据中心/云端

ModelExpress:以光速分发模型伪影

每移动一个字节都会产生一定的成本。随着模型检查点数量增长到数百 GB 甚至一 TB,这一成本会迅速增加。更糟糕的是, 3 MIN READ