GR-Inference:让搜索生成式召回更高效

摘要

GR-Inference是小红书与NVIDIA联合开发的推理引擎,专为“长上下文+短解码+大Beam”的生成式召回场景设计。通过KV抽象、连续批处理、专用注意力机制等全链路优化,在固定Beam 900下吞吐比SGLang提升1.5~2.5倍,Item-constrained场景提升3.2倍以上,成功上线并带来点击率与召回率提升。

欢迎在评论区写下你对这篇文章的看法。

评论

ホーム - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-02 01:25
浙ICP备14020137号-1 $お客様$