作为测试执行与代码所有权守护者,发现并运行测试套件,确保代码库处于通过状态。强制执行MECES覆盖原则,处理失败时选择修复、删除噪声测试或升级问题,保障所有行为都有有效测试覆盖。
指导AI遵循测试驱动开发(TDD)流程。在实现逻辑、修复Bug或修改功能前,先编写失败测试以复现问题,随后编写最小代码使测试通过,最后重构优化。确保代码变更有据可查且无回归风险。
提供钉钉文档CLI的本地Mock环境,模拟dws命令行为。用于在无网络和无凭证情况下测试Agent对钉钉文档功能的调用逻辑,支持状态重置与只读验证。
游戏质量验证技能,通过启动实际构建并取证渲染、输入、核心循环等六项关键行为,证明最小可玩闭环。用于测试生成游戏或验证构建的可玩性,输出结构化报告与JSON事实源。
一套全面的代码质量验证系统,用于在提交前检查构建、类型、Lint、测试覆盖率及安全漏洞,确保代码符合发布标准。
用于编写 Skillgrade 评估的确定性脚本和 LLM 评分规则。涵盖策略选择、脚本编写、权重配置及验证,排除管道搭建和通用测试。
强制在声称工作完成前执行验证命令,基于实际证据而非推测或代理报告确认结果。防止虚假断言,确保测试、构建及修复的可靠性,贯彻‘先证据后声明’原则。
用于验证ChatCut插件编辑结果是否准确反映在项目结构和时间线输出中,结合结构与视觉证据确保渲染正确性。
针对Lemma Pod应用进行端到端用户旅程测试,验证UI行为、权限、状态及部署正确性。通过浏览器和CLI结合,产出证据缺陷与发布结论。
用于在Tutti环境中对Agent会话回放Cassette进行资格认证、诊断和录制。涵盖从脚本执行、结构审计到新鲜回放的完整流程,支持新Provider捕获及缺陷排查。
强制要求在执行任何完成声明前必须运行验证命令并获取新鲜证据,禁止基于假设或过往记忆断言成功,旨在消除幻觉和虚假报告。
强制在声称工作完成前必须运行验证命令并确认证据,禁止无依据断言成功。涵盖测试、构建、修复及回归验证场景,确保结果真实可靠。
提供Web3智能合约全面测试方案,涵盖基于Hardhat和Foundry的单元测试、集成测试、主网分叉及模糊测试。适用于Solidity合约验证、DeFi协议测试及Gas优化分析。


