基于 Semantic ID(SID)的生成式推荐,将推荐过程转化为短序列自回归生成。这类负载不同于 Chat LLM 的常规生成:输入 Context 较长,通常只 Decode 3~5 个 token,却需要同时维护数百条 Beam。针对这一特点,GR-Inference 对调度、KV Cache、Decode Attention、Beam Search 和受限生成进行了系统优化。本文重点介绍其系统与 Kernel 设计,并给出端到端性能结果。
SID-GR 的推理瓶颈
SID-GR 先将真实 Item 编码为多级离散 ID,再由模型生成短 SID 序列并映射回 Item。其推理负载主要有三个特点:
Context 较长:用户行为历史会带来较多输入 token,增加 Prefill 计算量。
Decode 很短:SID 层级较少,通常只需解码少量 token。
Beam 大且动态:为满足结果多样性,Beam Width 较大,并在 Decode 过程中逐步扩展。
系统优化设计
GR-Inference 以 Request 为单位调度并管理状态与资源,仅在 GPU Decode 阶段按 Batch × Active Beam Width 展开计算。这样既保留了 Beam 级并行,又避免重复保存共享状态。
ContextKV:每个 Request 只保存一份 Prefill 阶段生成的长 KV,供所有 Beam 共享。
BeamKV:仅保存各 Beam 在 Decode 阶段新增的短 KV,并随 Beam 扩展。
BeamPath:用索引记录 Beam 的分叉和重排,避免复制长 Context。
Beam Width 从 20 增至 900 时,只有短 BeamKV 和 BeamPath 增长,长 ContextKV 不变。Continuous Batching 根据当前及下一步 Beam Width 动态组批;Decode CUDA Graph 按 Batch Bucket × Beam Bucket 预捕获,回放时仅更新少量元数据,从而提高 GPU 利用率并降低 Kernel Launch 开销。

图 1:GR-Inference 架构与请求级状态管理。
ALT 文本:请求依次经过 Serving、Control & Scheduling、GR Runtime 和 Execution Backend。资源层以 Request 为单位保存 ContextKV,并维护 BeamKV、BeamPath 和可选的 GPU SID Trie。
Kernel 优化设计
GR Decode Attention Kernel:通用 Attention 会为每条 Beam 重复读取共享 Context。该 Kernel 通过 Tensor Core MMA 和 Split-KV 处理长 ContextKV,用 CUDA Core 沿 BeamPath 读取短 BeamKV,再以 Log-Sum-Exp 合并结果,减少重复访问并保留各 Beam 的 Decode 历史。
Item-constrained 融合 Kernel:SID Trie 以 CSR 形式常驻显存。该 Kernel 融合 Prefix Traversal、合法 Token Gather 和局部 Top-K,避免 CPU 查询 Trie 或构造全词表 Mask。整个流程在 GPU 上完成,可减少同步,并支持动态 Beam 和 Decode CUDA Graph。
端到端性能测试
测试使用 NVIDIA GPU 和 Qwen3-0.6B BF16,固定 Beam Width 为 900,以平均端到端延迟不超过 100 ms 为 SLA。
在各输入长度的可比测试点上,GR-Inference 均保持领先,吞吐达到三套 SGLang Beam Search 实现的 1.50~2.53 倍。

图 2:固定 Beam Width 900、全词表 logprob 配置下,满足 100 ms SLA 的峰值吞吐。
ALT 文本:在各可比输入长度下,GR-Inference 的峰值吞吐均高于三套 SGLang Beam Search 实现。
Item-constrained 配置下,GR-Inference 仍具吞吐优势;评分语义不同,结果仅供参考。
小红书工业落地
GR-Inference框架结合小红书搜索生成式召回场景进行二次开发和定制优化,实现召回阶段新增一路自回归SID召回通道,在耗时达标的情况下,实现了GPU资源的高效利用,最终项目完成落地,点击率提升0.03pt,有效点击率提升0.2%,离线Recall@1000召回率提升5.7%。
唯品会工业落地
GR-Inference 已在唯品会生成式检索场景成功落地:在满足时延要求的前提下,显著提升 GPU 资源利用效率;项目顺利上线后,转化率、UV 金额等核心业务指标均取得千分点量级提升。
总结与展望
GR-Inference 的核心,是利用“长 Context 可在请求内共享,而各 Beam 仅保留短 Decode 历史”这一特点。请求级状态管理、分离式 KV、专用 Decode Attention 和 GPU SID Trie 共同提升了端到端性能。后续可进一步评估更多模型、多 GPU并行策略、低精度量化和MegaKernel等方向的探索和支持。