Tejash Shah

Tejash Shah 是 NVIDIA AI 平台软件团队的首席产品经理,负责管理 ML 框架、JAX 和 ML 编译器 XLA。

Posts by Tejash Shah

智能体/生成式 AI

借助 NVIDIA Transformer 引擎在 JAX 中加速无模型 MoE 训练

多专家模型 (MoE) 已成为大规模 AI 模型训练中的关键架构趋势之一。DeepSeek、Qwen 和 Mixtral 是 MoE… 4 MIN READ
模拟/建模/设计

借助主机卸载减少基于 JAX 的 LLM 训练中的高带宽内存瓶颈

在充分利用计算能力之前,大语言模型 (LLM) 训练工作负载越来越多地遇到 GPU 显存限制。模型权重、梯度、优化器状态、 3 MIN READ
数据中心/云端

在 NVIDIA Blackwell 上使用 NVFP4,使用 JAX 和 MaxText 更快地训练模型

对前沿 LLM 进行预训练,可归结为吞吐量。当数千个加速器的训练规模达到数万亿词元时, 3 MIN READ
智能体/生成式 AI

在 JAX 和 XLA 中加速长上下文模型训练

大语言模型(LLM)的上下文窗口正在迅速扩展,近期的模型已支持128K、256K甚至更长的词元序列。然而, 3 MIN READ
开发工具与技巧

通过 Python API 利用 CuTe DSL 实现 CUTLASS C++ 级性能

CuTe,是 CUTLASS 3.x 的核心组件,它提供了统一的代数体系,用于描述数据布局和线程映射, 4 MIN READ
数据中心/云端

使用 JAX 和 XLA 优化推理工作负载的低延迟通信

在生产环境中使用大语言模型 (LLM) 进行推理需要满足严格的延迟限制。此过程的关键阶段是 LLM 解码, 2 MIN READ