专注于编写高质量测试、调试失败及管理不稳定用例的专家技能。涵盖单元测试至E2E的分层策略、边界模拟规则及测试设计原则,确保测试行为而非实现细节,提升代码质量与可维护性。
指导采用测试驱动开发模式,先写失败测试再实现代码以修复Bug或新增功能。通过红绿重构循环确保逻辑正确性并防止回归,适用于任何行为变更场景。
用于编写、审查和运行 CubeSandbox SDK 兼容性 E2E pytest 测试用例。涵盖用例开发、代码审查、执行及调试,支持生命周期、网络策略等场景的端到端验证。
提供钉钉文档CLI的本地Mock环境,模拟dws命令行为。用于在无需真实凭证和网络的情况下测试和验证钉钉文档工作流,支持JSON输出、状态重置及干跑模式,确保开发安全与效率。
用于为项目配置性能基准测试和CodSpeed集成。自动检测语言与构建系统,选择合适框架(如Rust/Criterion、Python/pytest等)或通用执行模式,生成基准代码并连接CI以追踪性能变化。
验证代码实现是否与变更工件(规范、任务、设计)一致。通过解析 OpenSpec 状态和上下文文件,检查任务完成度、需求覆盖及设计一致性,生成包含关键问题和建议的验证报告,确保归档前质量。
迭代式构建LangSmith在线评估器。通过检查Trace数据、访谈用户确定评估维度,随后设计并实现LLM裁判或代码类评估器,全程需用户确认配置与方向,确保评估逻辑符合业务质量要求。
提供现代Android应用测试策略指导,涵盖单元测试、Hilt集成测试及Roborazzi截图测试。包含依赖配置、JUnit4/Compose规则使用及Gradle运行命令,旨在确保UI无回归且逻辑正确。
用于验证重构阶段是否符合规范并记录进度。按顺序执行构建、测试、回归和审查检查清单,任一失败即停止;全部通过后更新进度文档、路线图状态及提交建议,不执行合并操作。
在游戏目标运行时验证构建质量,检查核心循环、叙事分支及多语言等玩家可感知特性。依据 assuranceProfile 输出机器事实与人读报告,区分证据强度与体验承诺,确保游戏完整可玩且符合设计规范。
执行深度、多轮且降低差异性的仓库级安全扫描。通过重复发现、语义合并结果,并统一进行验证、攻击路径分析及报告生成,以构建规范化的威胁模型。
用于在实现完成后对变更进行最终验证、审计与归档。通过状态守卫确保流程正确,执行测试、完整性及一致性检查,生成报告并标记关闭,适用于发布收尾阶段。
在Orca环境中控制iOS模拟器,支持触控、手势、输入、权限及无障碍树等操作。提供CLI解析与版本指南加载逻辑,优于原生simctl,适用于Agent驱动的移动应用测试与调试。
指导如何通过构建、启动并自动化驱动 LiveMarkDownEditor WPF 应用,以端到端方式验证 UI 行为(如布局、焦点、命令可用性),弥补无头测试的不足。


