类库 › llm-inference-engineering
amitshekhariitbhu

amitshekhariitbhu/llm-inference-engineering

这是一个LLM推理工程学习资源库,系统讲解从KV Cache、PagedAttention到vLLM和SGLang等核心技术。通过博客和视频形式,帮助开发者深入理解自回归模型、预填充与解码优化及GPU加速原理,提升大语言模型推理性能。

评论

首页 - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-22 11:51
浙ICP备14020137号-1 $访客地图$