作为测试执行与代码所有权守护者,发现并运行测试套件,确保代码库处于通过状态。强制执行MECES覆盖原则,处理失败时选择修复、删除噪声测试或升级问题,保障所有行为都有有效测试覆盖。
指导AI遵循测试驱动开发(TDD)流程。在实现逻辑、修复Bug或修改功能前,先编写失败测试以复现问题,随后编写最小代码使测试通过,最后重构优化。确保代码变更有据可查且无回归风险。
提供钉钉文档CLI的本地Mock环境,模拟dws命令行为。用于在无网络和无凭证情况下测试Agent对钉钉文档功能的调用逻辑,支持状态重置与只读验证。
游戏质量验证技能,通过启动实际构建并取证渲染、输入、核心循环等六项关键行为,证明最小可玩闭环。用于测试生成游戏或验证构建的可玩性,输出结构化报告与JSON事实源。
一套全面的代码质量验证系统,用于在提交前检查构建、类型、Lint、测试覆盖率及安全漏洞,确保代码符合发布标准。
用于编写 Skillgrade 评估的确定性脚本和 LLM 评分规则。涵盖策略选择、脚本编写、权重配置及验证,排除管道搭建和通用测试。
强制在声称工作完成前执行验证命令,基于实际证据而非推测或代理报告确认结果。防止虚假断言,确保测试、构建及修复的可靠性,贯彻‘先证据后声明’原则。
用于验证ChatCut插件编辑结果是否准确反映在项目结构和时间线输出中,结合结构与视觉证据确保渲染正确性。
针对Lemma Pod应用进行端到端用户旅程测试,验证UI行为、权限、状态及部署正确性。通过浏览器和CLI结合,产出证据缺陷与发布结论。
用于在Tutti环境中对Agent会话回放Cassette进行资格认证、诊断和录制。涵盖从脚本执行、结构审计到新鲜回放的完整流程,支持新Provider捕获及缺陷排查。
在代码完成流程中验证测试覆盖率和质量,通过非阻塞警告鼓励开发者编写测试,评估测试存在性、覆盖策略及质量,培养测试习惯。
强制在声明任务完成前执行验证命令并获取新鲜证据的规范,防止幻觉和误判。适用于测试、调试及发布前的最终质量检查环节。
强制在宣称任务完成前必须运行验证命令并获取证据,禁止无依据断言。涵盖测试、构建、修复及需求检查的严格验证流程,确保结果真实可靠。
指导测试策略设计,涵盖TDD/BDD方法、覆盖率规划及最佳实践。适用于设计测试套件、提升覆盖率或选择测试方法等场景。
在TDD红色阶段生成旨在定义预期行为和边缘用例的失败测试,确保测试因缺失功能而非设置错误而失败。


