用于创建、更新和分析实验性能分析基准Jupyter笔记本的Skill,涵盖uv工具安装、nb.py辅助操作及可复现性管理。
用于生成涵盖Excel全内容类型的压力测试工作簿,支持确定性种子和多种规模格式。旨在通过构建包含公式、图表、表格等元素的测试文件,测量解析器完整性并执行回归测试。
作为测试执行与代码所有权守护者,负责发现并运行测试套件,确保所有测试通过。依据MECES原则评估覆盖率,对失败测试执行修复、删除或升级处理,保证代码库处于健康状态。
游戏质量验证技能,通过启动实际构建并取证渲染、输入、核心循环等六项关键行为,证明最小可玩闭环。用于测试生成游戏或验证构建的可玩性,输出结构化报告与JSON事实源。
一套全面的代码质量验证系统,用于在提交前检查构建、类型、Lint、测试覆盖率及安全漏洞,确保代码符合发布标准。
用于编写 Skillgrade 评估的确定性脚本和 LLM 评分规则。涵盖策略选择、脚本编写、权重配置及验证,排除管道搭建和通用测试。
强制在声称工作完成前执行验证命令,基于实际证据而非推测或代理报告确认结果。防止虚假断言,确保测试、构建及修复的可靠性,贯彻‘先证据后声明’原则。
用于验证ChatCut插件编辑结果是否准确反映在项目结构和时间线输出中,结合结构与视觉证据确保渲染正确性。
针对Lemma Pod应用进行端到端用户旅程测试,验证UI行为、权限、状态及部署正确性。通过浏览器和CLI结合,产出证据缺陷与发布结论。
用于在Tutti环境中对Agent会话回放Cassette进行资格认证、诊断和录制。涵盖从脚本执行、结构审计到新鲜回放的完整流程,支持新Provider捕获及缺陷排查。
在代码完成流程中验证测试覆盖率和质量,通过非阻塞警告鼓励开发者编写测试,评估测试存在性、覆盖策略及质量,培养测试习惯。
强制在声明任务完成前执行验证命令并获取新鲜证据的规范,防止幻觉和误判。适用于测试、调试及发布前的最终质量检查环节。
强制在宣称任务完成前必须运行验证命令并获取证据,禁止无依据断言。涵盖测试、构建、修复及需求检查的严格验证流程,确保结果真实可靠。
指导测试策略设计,涵盖TDD/BDD方法、覆盖率规划及最佳实践。适用于设计测试套件、提升覆盖率或选择测试方法等场景。


