类库
› time-to-first-token
patchy631/time-to-first-token
这是一个为期10周的LLM推理服务优化学习路线图。通过每天30分钟,构建并部署一个OpenAI兼容的推理服务,涵盖vLLM、量化、推测解码及基准测试,旨在帮助工程师掌握生产环境下的LLM推理实战技能。
这是一个为期10周的LLM推理服务优化学习路线图。通过每天30分钟,构建并部署一个OpenAI兼容的推理服务,涵盖vLLM、量化、推测解码及基准测试,旨在帮助工程师掌握生产环境下的LLM推理实战技能。