Agent Skills
› vllm-project/vllm-omni
vllm-project/vllm-omni
GitHub指导将扩散模型集成至 vLLM-Omni,涵盖从 Diffusers 或自定义仓库迁移、Transformer 适配及多 GPU 并行加速支持。
安装全部 Skills
npx skills add vllm-project/vllm-omni --all -g -y
集合内 Skills (9)
指导将扩散模型集成至 vLLM-Omni,涵盖从 Diffusers 或自定义仓库迁移、Transformer 适配及多 GPU 并行加速支持。
集成新的扩散模型到 vLLM-Omni
将 diffusers pipeline 移植到 vllm-omni
创建 DiT transformer 适配器
启用多 GPU 并行性和缓存加速
npx skills add vllm-project/vllm-omni --skill add-diffusion-model -g -y
用于将HuggingFace TTS模型集成到vLLM-Omni,支持流式输出、CUDA图加速及多种架构适配,提供详细的开发工作流与规范。
添加新的TTS模型
调试TTS集成行为
构建音频输出管道
npx skills add vllm-project/vllm-omni --skill add-tts-model -g -y
针对vLLM Omni扩散模型工作负载的性能诊断与优化技能,涵盖并行策略选择、Profiling分析、GPU资源利用率优化及量化设计。
分析性能剖析轨迹或trace.json
选择并行策略如USP/CFG/HSDP
调查GPU空闲或气泡问题
设计算子或量化优化方案
npx skills add vllm-project/vllm-omni --skill diffusion-perf-opt -g -y
用于审计 vLLM-Omni 代码库,识别并评估可简化的冗余、重复或过度防御性代码。通过对比架构文档与实现,提供精简方案以降低维护成本,而非常规审查或性能优化。
需要简化代码结构时
进行架构和维护成本审计时
识别冗余或重复实现时
npx skills add vllm-project/vllm-omni --skill find-simplifications -g -y
用于在提交PR前进行代码自审,检查死代码、标题格式及特定策略合规性,支持快速和完整两种模式,不直接操作GitHub。
precheck
self review
pre-submit check
check my PR before I open it
npx skills add vllm-project/vllm-omni --skill precheck-pr -g -y
用于vLLM-Omni模型量化工作,涵盖FP8、INT8等格式选择、配置构建、加载调试及性能验证。
选择或添加量化方法
调试量化加载问题
验证内存、速度及输出质量
npx skills add vllm-project/vllm-omni --skill quantization -g -y
指导升级vllm-omni的NPU模型运行器以对齐最新vllm-ascend代码,同时保留Omni特定逻辑。通过识别标记块确保多模态模型在昇腾NPU上的功能兼容性。
需要更新NPU模型运行器以适配新版本底层框架
同步上游Ascend NPU实现并合并Omni特有增强逻辑
npx skills add vllm-project/vllm-omni --skill vllm-omni-npu-model-runner-upgrade -g -y
用于vllm-omni项目的测试生成与执行,涵盖L1-L4分级策略、标记选择及CI集成,提供本地和CI风格的pytest命令。
创建回归测试
添加L1-L4覆盖率
选择pytest标记
验证Issue或PR修复
npx skills add vllm-project/vllm-omni --skill vllm-omni-test -g -y
用于审查 vLLM-Omni 项目的 Pull Request 和本地分支。以维护者视角进行精准、基于证据的代码审查,识别合并阻塞项、兼容性风险及正确性缺陷,并推荐相关代码负责人。
需要人工审查 PR 或本地分支时
检查代码正确性、测试覆盖或分布式变更时
npx skills add vllm-project/vllm-omni --skill review-pr -g -y


