Agent Skills
› sgl-project/sglang
sgl-project/sglang
GitHub指导在SGLang中添加轻量级JIT CUDA内核的教程,涵盖从需求定义到代码实现的完整流程。
安装全部 Skills
npx skills add sgl-project/sglang --all -g -y
集合内 Skills (24)
指导在SGLang中添加轻量级JIT CUDA内核的教程,涵盖从需求定义到代码实现的完整流程。
需要为SGLang添加新的CUDA计算内核
区分JIT与AOT编译策略
遵循SGLang内核开发规范
npx skills add sgl-project/sglang --skill add-jit-kernel -g -y
提供向sgl-kernel添加AOT CUDA/C++内核的逐步教程,涵盖实现、注册、构建及测试基准流程。
需要添加新的CUDA内核
sgl-kernel开发指南
AOT内核集成
npx skills add sgl-project/sglang --skill add-sgl-kernel -g -y
持续监控并修复指定PR的GitHub Actions CI工作流,自动诊断失败原因、推送小幅度代码修复或重试任务,直至选定的CI检查全部通过。
用户要求监控或修复PR的CI状态
需要自动化重试失败的GitHub Actions流程
npx skills add sgl-project/sglang --skill babysit-pr-to-pass-ci -g -y
SGLang CI工作流编排指南,涵盖阶段排序、快速失败、门控及故障调试。用于修改CI流程、添加阶段或排查流水线问题。
修改CI工作流配置
调试CI流水线失败
理解测试分发与门控逻辑
npx skills add sgl-project/sglang --skill ci-workflow-guide -g -y
用于清理 SGLang 服务器启动日志中的噪音,包括第三方库警告、弃用消息及重复打印。通过捕获日志并与参考日志对比,分类处理并修复代码或调整日志级别,确保输出简洁清晰。
用户要求清理服务器启动日志中的噪音
需要移除不需要的警告或弃用消息
npx skills add sgl-project/sglang --skill clean-startup-log -g -y
用于计算混合注意力模型(如Mamba)的最佳内存池分配比例,解决并发限制与资源瓶颈问题。
询问最佳 --mamba-full-memory-ratio 设置
解释并发量受限原因
配置状态池与KV池大小
npx skills add sgl-project/sglang --skill compute-mamba-ratio -g -y
用于向SGLang Cookbook添加新模型文档的自动化技能。通过实例化模板生成配置文件、基准数据和MDX页面,并更新导航及首页卡片,实现多阶段交互式内容创建。
需要为SGLang Cookbook添加新模型的文档
用户请求使用 /cookbook-add-model 命令
npx skills add sgl-project/sglang --skill cookbook-add-model -g -y
将旧的 SGLang Cookbook 模型页面迁移至配置驱动模板,严格保留原始参数与基准数据。适用于现有模型的格式转换,而非新增模型。
用户请求迁移或转换现有的 Cookbook 模型页面
需要将遗留的 monolithic 生成器页面转为 config-driven 格式
npx skills add sgl-project/sglang --skill cookbook-migrate-model -g -y
用于审查SGLang Cookbook的PR,验证模型配置、基准测试及MDX页面是否符合规范,确保引擎文件未被意外修改。
需要审查Cookbook相关的Pull Request
验证模型添加或文档更新的合规性
npx skills add sgl-project/sglang --skill cookbook-review-pr -g -y
指导在SGLang中使用@debug_kernel_api装饰器调试CUDA崩溃,捕获崩溃前张量输入以定位非法内存访问或数值异常。
遇到CUDA崩溃错误
需要分析Kernel执行前的输入数据
npx skills add sgl-project/sglang --skill debug-cuda-crash -g -y
针对SGLang分布式推理中多GPU挂起、死锁或超时问题的调试指南。涵盖通过py-spy、NCCL日志和CUDA coredump定位阻塞点,以及使用二分法查找状态分歧的方法。
SGLang分布式推理运行时出现挂起或冻结
多GPU集体通信操作(如AllReduce)超时或死锁
需要定位不同Rank间的状态分歧点
npx skills add sgl-project/sglang --skill debug-distributed-hang -g -y
规范SGLang环境变量管理,要求统一在Envs类定义并使用typed descriptor,禁止散用os.getenv。涵盖命名、注册决策及废弃旧前缀SGL_*的规则,确保配置集中与类型安全。
添加或重命名SGLANG_环境变量
审查或修改python/sglang/srt/environ.py文件
迁移遗留的SGL_别名
npx skills add sgl-project/sglang --skill env-var-conventions -g -y
启动SGLang服务器,进行准确性验证,生成Chrome兼容的性能分析追踪文件并返回路径。
需要分析SGLang服务器性能时
获取模型推理追踪数据时
npx skills add sgl-project/sglang --skill generate-profile -g -y
用于编写、校准和调试 SGLang 中预填充与解码阶段的 KL 一致性测试,通过对比 logprob 检测算子批不变性及缓存状态问题,定位精度偏差。
添加模型 KL 测试
选择或辩护 kl_div 阈值
调查过高的 KL 数值
npx skills add sgl-project/sglang --skill kl-consistency-test -g -y
定义SGLang中Scheduler、TokenizerManager和ModelRunner三大类的代码风格规范,强调核心文件应保持为仅负责组件构建、连接、委托和协调的“冻结”编排层,禁止包含领域逻辑。
修改或审查 Scheduler、TokenizerManager、ModelRunner 类
检查核心文件是否混入了非编排逻辑
npx skills add sgl-project/sglang --skill large-class-style -g -y
统一LLM性能分析技能,支持SGLang、vLLM等框架。通过triage工作流分析trace文件或实时 profiling,输出kernel、重叠机会和融合模式三表报告,用于GPU性能瓶颈诊断。
需要分析LLM推理性能时
查看torch profiler生成的trace数据时
npx skills add sgl-project/sglang --skill llm-torch-profiler-analysis -g -y
提供机械重构(文件拆分、函数移动等)的机器可验证方案,通过字节级重现和对比证明变更纯粹性,支持拆分、构建证明及验证流程。
进行代码结构重组或大规模重命名
审查机械式重构提交的正确性
需要自动化验证代码迁移而非人工检查
npx skills add sgl-project/sglang --skill mechanical-refactor-verify -g -y
提供SGLang脚本化运行时测试的规范,指导何时添加API及避免直接调用私有方法。
编写或审查SGLang脚本化运行时测试代码
决定是否为运行时组件新增封装API
npx skills add sgl-project/sglang --skill scripted-runtime-notes -g -y
用于排查 SGLang CI 中持续失败的测试,通过提取失败特征、二分法定位回归提交、检查硬件特异性及远程复现,辅助定位代码或环境导致的回归根因。
CI 测试在 main 分支上持续失败
需要查找引入回归的具体 PR
怀疑是 Runner 或 GPU 特有的问题
需要在远程服务器复现 CI 失败
npx skills add sgl-project/sglang --skill sglang-bisect-ci-regression -g -y
自动化执行 SGLang 版本发布时的 PR Cherry-Pick 流程。通过 Slash 命令接收目标分支和 PR 列表,校验参数后触发 GitHub Actions 工作流逐个应用变更,并监控运行状态,最终报告每个 PR 的合并结果或失败原因。
需要批量将已合并的 PR 应用到特定 release 分支时
SGLang 发布经理请求执行 cherry-pick 操作时
npx skills add sgl-project/sglang --skill sglang-cherrypick -g -y
针对SGLang服务问题的重放优先调试技能,用于健康检查失败、延迟回归或崩溃等场景。通过收集基线、保存故障请求并回放来定位问题,避免直接性能分析,输出诊断结论与下一步建议。
服务器健康检查失败
延迟或吞吐量回归
队列增长或超时
分布式挂起或崩溃
npx skills add sgl-project/sglang --skill sglang-prod-incident-triage -g -y
解析SGLang运行时上下文架构,涵盖配置发布、命名空间配置袋及进程状态管理。指导开发者正确访问ServerArgs与动态配置,避免直接修改全局状态,适用于涉及sglang服务器参数、模型覆盖及前向传播状态的代码开发与测试。
修改sglang server_args或模型覆盖逻辑
处理模块级全局状态或前向传播状态
开发或调试SGLang运行时配置相关功能
npx skills add sgl-project/sglang --skill sglang-runtime-context -g -y
规范 SGLang 投机解码代码标识符命名,涵盖动词形式、bonus token 术语及计数前缀规则。
添加或重命名投机解码相关标识符
审查 python/sglang/srt/speculative/ 下代码命名
npx skills add sgl-project/sglang --skill speculative-naming -g -y
指导编写 SGLang CI/UT 测试,涵盖 CustomTestCase 规范、CI 注册、服务器夹具、模型选择及 Mock 边界。
创建新测试
添加 CI 测试用例
编写单元测试
为 SGLang 功能添加测试
npx skills add sgl-project/sglang --skill write-sglang-test -g -y


