Posts by Tejash Shah
智能体/生成式 AI
2026年 9月 14日
借助 NVIDIA Transformer 引擎在 JAX 中加速无模型 MoE 训练
多专家模型 (MoE) 已成为大规模 AI 模型训练中的关键架构趋势之一。DeepSeek、Qwen 和 Mixtral 是 MoE…
4 MIN READ
模拟/建模/设计
2026年 7月 10日
借助主机卸载减少基于 JAX 的 LLM 训练中的高带宽内存瓶颈
在充分利用计算能力之前,大语言模型 (LLM) 训练工作负载越来越多地遇到 GPU 显存限制。模型权重、梯度、优化器状态、
3 MIN READ
数据中心/云端
2026年 6月 8日
在 NVIDIA Blackwell 上使用 NVFP4,使用 JAX 和 MaxText 更快地训练模型
对前沿 LLM 进行预训练,可归结为吞吐量。当数千个加速器的训练规模达到数万亿词元时,
3 MIN READ
智能体/生成式 AI
2026年 2月 3日
在 JAX 和 XLA 中加速长上下文模型训练
大语言模型(LLM)的上下文窗口正在迅速扩展,近期的模型已支持128K、256K甚至更长的词元序列。然而,
3 MIN READ
开发工具与技巧
2025年 11月 13日
通过 Python API 利用 CuTe DSL 实现 CUTLASS C++ 级性能
CuTe,是 CUTLASS 3.x 的核心组件,它提供了统一的代数体系,用于描述数据布局和线程映射,
4 MIN READ
数据中心/云端
2025年 7月 18日
使用 JAX 和 XLA 优化推理工作负载的低延迟通信
在生产环境中使用大语言模型 (LLM) 进行推理需要满足严格的延迟限制。此过程的关键阶段是 LLM 解码,
2 MIN READ