Agent Skills
› meituan-longcat/WBench
meituan-longcat/WBench
GitHub运行 WBench 评估流水线,对模型视频进行22项指标评分。涵盖预处理、GPU计算、VLM API评测及报告生成,输出详细评测结果与汇总报表。
Install All Skills
npx skills add meituan-longcat/WBench --all -g -y
Skills in Collection (3)
运行 WBench 评估流水线,对模型视频进行22项指标评分。涵盖预处理、GPU计算、VLM API评测及报告生成,输出详细评测结果与汇总报表。
用户要求评估或打分模型
用户请求运行特定指标计算
用户需要生成评测报告
npx skills add meituan-longcat/WBench --skill wbench-evaluate -g -y
用于为注册视频模型批量生成评测视频。支持文本条件及相机/动作模型,按类型筛选用例(如导航案例),提供单例冒烟测试、后台断点续跑及输出验证流程,确保多轮对话视频正确合并与格式合规。
生成模型视频
运行视频评测用例
用 wan/kling 生成全部 case
跑 camera_preview 的 navi case
npx skills add meituan-longcat/WBench --skill wbench-generate -g -y
用于打包模型评测结果并提交至WBench排行榜。支持生成meta.json、turns.json及视频文件,可选择自评估或官方评估路径,并上传至HuggingFace数据集。
准备提交评测结果
构建 meta.json/turns.json 包
上传视频到 WBench-examples HF dataset
npx skills add meituan-longcat/WBench --skill wbench-submit -g -y


