Agent Skills
› pegainfer-project/pegainfer
pegainfer-project/pegainfer
GitHubvLLM推理服务压测工具,用于评估多轮对话场景下的TTFT、吞吐等性能指标。支持安装配置、参数选择及结果分析。
Install All Skills
npx skills add pegainfer-project/pegainfer --all -g -y
Skills in Collection (6)
vLLM推理服务压测工具,用于评估多轮对话场景下的TTFT、吞吐等性能指标。支持安装配置、参数选择及结果分析。
vllm bench
多轮压测
chat serving benchmark
concurrency sweep
install vllm-bench
npx skills add pegainfer-project/pegainfer --skill vllm-bench -g -y
vllm-bench用于对OpenAI兼容或vLLM服务端点进行基准测试,支持多轮对话负载测试。涵盖安装、参数配置、后端选择及指标解读,帮助评估TTFT、吞吐量等性能。
进行多轮对话压测
测量TTFT/TPOT/吞吐量
配置vllm-bench参数
验证本地vLLM服务性能
npx skills add pegainfer-project/pegainfer --skill vllm-bench -g -y
指导使用NVIDIA Nsight Systems对Rust+CUDA推理引擎进行GPU性能分析,涵盖环境检查、Trace捕获及性能瓶颈诊断。
GPU性能分析
nsys追踪捕获
内核耗时分析
TPOT/TTFT回归诊断
npx skills add pegainfer-project/pegainfer --skill nsys-profiling -g -y
用于规范非 trivial 任务的完整生命周期管理,强制先读文档再行动,需人工审批计划,执行后记录经验教训,避免重复错误。
用户给出涉及代码编写、调试、部署等具体执行任务时
需要复用或创建项目文档以记录任务背景、计划和复盘结果时
npx skills add pegainfer-project/pegainfer --skill project-doc -g -y
指导开发者使用 NVIDIA Nsight Systems 对 Rust+CUDA 推理引擎进行 GPU 性能剖析,涵盖环境检查、Trace 捕获及内核耗时分析,旨在定位性能瓶颈与回归问题。
GPU 性能剖析
nsys trace 捕获与分析
解码/预填充延迟诊断
TPOT/TTFT 回归排查
npx skills add pegainfer-project/pegainfer --skill nsys-profiling -g -y
用于使用 NVIDIA Nsight Systems 对 GPU 工作负载进行性能剖析。涵盖捕获追踪、分析内核耗时、检测延迟问题及诊断性能回归,帮助定位优化点。
用户请求进行 GPU 性能剖析或追踪
用户提供 nsys 输出数据并寻求解读
npx skills add pegainfer-project/pegainfer --skill nsys-profiling -g -y


