Agent Skills
› meituan-longcat/WBench
meituan-longcat/WBench
GitHub用于运行 WBench 22项指标评估流水线,对模型视频进行评分并生成报告。支持预计算、GPU/VLM指标计算及报告聚合。适用于用户要求评测模型、跑分或生成评估报告的场景。
Install All Skills
npx skills add meituan-longcat/WBench --all -g -y
Skills in Collection (3)
用于运行 WBench 22项指标评估流水线,对模型视频进行评分并生成报告。支持预计算、GPU/VLM指标计算及报告聚合。适用于用户要求评测模型、跑分或生成评估报告的场景。
用户请求评估或打分模型(如 evaluate kling3)
用户要求运行评测指标(如 跑一下 hyworld1.5 的评测)
用户指定仅计算特定指标(如 只算 video_quality)
npx skills add meituan-longcat/WBench --skill wbench-evaluate -g -y
为注册模型生成 WBench 视频。支持文本及相机/动作模型,分别处理全部289个或仅导航类158个用例。通过 generate.py 运行,输出合并的多轮视频文件,支持断点续跑和单用例测试。
用户要求为特定模型生成视频
提到 'generate kling videos' 等生成指令
提及 '用 wan 生成' 或 '跑 camera_preview'
npx skills add meituan-longcat/WBench --skill wbench-generate -g -y
将模型结果打包为WBench提交包,生成meta.json、turns.json及视频文件。支持自评估(含report.json)或仅上传视频路径。可选推送至HuggingFace私有数据集,确保符合格式规范。
准备提交
构建 meta.json/turns.json
上传视频到 WBench-examples HF dataset
npx skills add meituan-longcat/WBench --skill wbench-submit -g -y


