Agent Skills
› Purewhiter/mobilegym
Purewhiter/mobilegym
GitHub用于在编写代码前设计基准测试任务,强制产出功能审计表和充分性检查,回答判定预测问题以确保任务逻辑严密、可验证。
安装全部 Skills
npx skills add Purewhiter/mobilegym --all -g -y
集合内 Skills (3)
用于在编写代码前设计基准测试任务,强制产出功能审计表和充分性检查,回答判定预测问题以确保任务逻辑严密、可验证。
设计新的bench_env任务套件
向现有套件添加新任务
评审移动应用基准测试任务提案
npx skills add Purewhiter/mobilegym --skill designing-bench-task -g -y
指导为 bench_env 任务编写离线判题测试,规范正例需自然语言、反例需覆盖具体失败模式及边界情况,提升 Agent 测试覆盖率与真实性。
添加新任务
收紧判题覆盖率
npx skills add Purewhiter/mobilegym --skill testing-bench-task -g -y
用于编写或审查基准测试任务中的判定器(judge)逻辑,确保准确判断Agent是否完成任务。通过CRUD模型分类任务类型并选择正确检查策略,避免误判和漏判。
新增基准测试任务
编辑判定方法
诊断判定器的假阳性/假阴性问题
npx skills add Purewhiter/mobilegym --skill writing-bench-task-judge -g -y


