Agent Skills
› vllm-project/llm-compressor
vllm-project/llm-compressor
GitHub该技能用于创建和管理用于测试与开发的小型模型。通过检查配置、缩减参数量、微调及验证,生成架构保留但规模约1B的轻量级模型,支持多模态处理与快速实验。
Install All Skills
npx skills add vllm-project/llm-compressor --all -g -y
Skills in Collection (3)
该技能用于创建和管理用于测试与开发的小型模型。通过检查配置、缩减参数量、微调及验证,生成架构保留但规模约1B的轻量级模型,支持多模态处理与快速实验。
需要为大型模型创建小型替代品以加速测试或开发
进行模型架构实验或参数敏感性分析
快速验证新模型配置是否可正常加载和微调
npx skills add vllm-project/llm-compressor --skill create-tiny-model -g -y
根据用户选择的FP8量化方案(如FP8_BLOCK、FP8_DYNAMIC或MXFP8),生成Python示例脚本并保存压缩张量检查点,支持标准及超大模型路径。
fp8
FP8_DYNAMIC
FP8_BLOCK
MXFP8
fp8 example
quantize to fp8
npx skills add vllm-project/llm-compressor --skill fp8 -g -y
生成NVFP4量化示例脚本,保存压缩张量检查点。基于校准数据使用oneshot路径,处理模型类型调整并输出Python文件。
nvfp4
NVFP4
fp4
nvfp4 example
quantize to nvfp4
w4a4
npx skills add vllm-project/llm-compressor --skill nvfp4 -g -y


