Agent Skills › Purewhiter/mobilegym

Purewhiter/mobilegym

GitHub

用于在编写代码前设计基准测试任务,强制产出功能审计表和充分性检查,回答判定预测问题以确保任务逻辑严密、可验证。

3 个 Skill 787

安装全部 Skills

npx skills add Purewhiter/mobilegym --all -g -y
更多选项

预览集合内 Skills

npx skills add Purewhiter/mobilegym --list

集合内 Skills (3)

用于在编写代码前设计基准测试任务,强制产出功能审计表和充分性检查,回答判定预测问题以确保任务逻辑严密、可验证。
设计新的bench_env任务套件 向现有套件添加新任务 评审移动应用基准测试任务提案
.claude/skills/designing-bench-task/SKILL.md
npx skills add Purewhiter/mobilegym --skill designing-bench-task -g -y
指导为 bench_env 任务编写离线判题测试,规范正例需自然语言、反例需覆盖具体失败模式及边界情况,提升 Agent 测试覆盖率与真实性。
添加新任务 收紧判题覆盖率
.claude/skills/testing-bench-task/SKILL.md
npx skills add Purewhiter/mobilegym --skill testing-bench-task -g -y
用于编写或审查基准测试任务中的判定器(judge)逻辑,确保准确判断Agent是否完成任务。通过CRUD模型分类任务类型并选择正确检查策略,避免误判和漏判。
新增基准测试任务 编辑判定方法 诊断判定器的假阳性/假阴性问题
.claude/skills/writing-bench-task-judge/SKILL.md
npx skills add Purewhiter/mobilegym --skill writing-bench-task-judge -g -y

首页 - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-17 19:21
浙ICP备14020137号-1