Farshad Ghodsian

Farshad Ghodsian 是 NVIDIA 的高级技术营销工程师,专注于大规模 AI 训练和推理、性能优化见解、新模型发布和 AI 工程支持。他在 AI 基础设施、分布式训练、GPU 加速计算和云原生 MLOps 的交叉领域积累了丰富的经验,将前沿研究转化为面向开发者、企业团队和业务领导者的实用见解。加入 NVIDIA 之前,Farshad 曾在领先的半导体和咨询公司担任技术职务,帮助顶级技术客户构建和管理大规模生成式 AI 和 MLOps 平台。

Posts by Farshad Ghodsian

精选

在 NVIDIA GB300 NVL72 上进行 MoE 预训练创下世界纪录

前沿模型预训练已融合多专家模型 (MoE) ,这从根本上改变了对大规模 AI 训练的限制。随着每 token 的计算量下降, 3 MIN READ
精选

深入了解 NVIDIA Rubin GPU 架构:助力代理式 AI 时代

最初是离散 AI 模型训练和面向人类的聊天界面,后来演变为始终在线的 AI 工厂,致力于大规模生产智能。现在, 4 MIN READ
精选

NVIDIA Vera CPU 提升 AI 工厂吞吐量,加速代理式工作负载

代理式系统通过结合推理、工具使用、代码执行、检索、编排和结果处理的多步骤工作流,将模型推理转化为行动。随着这些系统在整个 AI 工厂中的扩展, 2 MIN READ
数据中心/云端

使用 Noniform Tensor Parallelism 提高大规模 LLM 训练的效率

大规模训练 LLM 会带来独特的基础架构挑战,尤其是在作业跨越数千个 GPU 并长时间运行的情况下。这些作业运行的时间越长, 2 MIN READ
精选

NVIDIA Blackwell 凭借业界领先的规模和性能超越 MLPerf 训练 6.0

NVIDIA 对 MLPerf Training v6.0 进行了彻底的测试,这是 MLCommons 联盟开发的最新版行业标准 AI… 3 MIN READ
数据中心/云端

在 NVIDIA NCCL 2.28 中使用新的 Device API 和基于拷贝引擎的集合通信实现通信和计算的融合

NVIDIA 集合通信库(NCCL)的最新版本引入了突破性的通信与计算融合技术,可显著提升多 GPU 和多节点系统中的通信吞吐量,降低延迟, 3 MIN READ