Agent Skills
› vllm-project/llm-compressor
vllm-project/llm-compressor
GitHub用于创建和管理用于测试开发的小型模型。支持检查配置、保存精简版模型、分析张量、微调及验证结构,适用于各类基础模型的多模态与文本场景。
Install All Skills
npx skills add vllm-project/llm-compressor --all -g -y
Skills in Collection (3)
用于创建和管理用于测试开发的小型模型。支持检查配置、保存精简版模型、分析张量、微调及验证结构,适用于各类基础模型的多模态与文本场景。
需要快速创建小型模型进行测试
调试模型架构或参数规模
验证模型微调流程
检查模型配置文件和张量
npx skills add vllm-project/llm-compressor --skill create-tiny-model -g -y
生成FP8量化示例脚本并保存压缩张量检查点。支持FP8_BLOCK、FP8_DYNAMIC和MXFP8方案,适配不同硬件架构。根据模型类型选择oneshot或model_free_ptq路径,应用模板与调整参数,最终输出标准化Python代码。
fp8
FP8_DYNAMIC
FP8_BLOCK
MXFP8
fp8 example
quantize to fp8
npx skills add vllm-project/llm-compressor --skill fp8 -g -y
生成NVFP4(W4A4)量化示例脚本并保存压缩检查点。通过共享文档收集模型信息,配置GPTQ参数及校准数据集,自动建议最优设置以平衡精度与效率。
nvfp4
NVFP4
fp4
nvfp4 example
quantize to nvfp4
w4a4
npx skills add vllm-project/llm-compressor --skill nvfp4 -g -y


