类库
› llm-inference-engineering
amitshekhariitbhu/llm-inference-engineering
这是一个LLM推理工程学习资源库,系统讲解从KV Cache、PagedAttention到vLLM和SGLang等核心技术。通过博客和视频形式,帮助开发者深入理解自回归模型、预填充与解码优化及GPU加速原理,提升大语言模型推理性能。
这是一个LLM推理工程学习资源库,系统讲解从KV Cache、PagedAttention到vLLM和SGLang等核心技术。通过博客和视频形式,帮助开发者深入理解自回归模型、预填充与解码优化及GPU加速原理,提升大语言模型推理性能。