用于 Three.js 浏览器游戏的 QA 验证与发布流程。涵盖依赖安装、构建类型检查、多端响应式测试、Canvas 像素级检查、自动化 Bot 试玩、视觉回归基线及风险报告,确保游戏达到发布标准。
通过普通任务板运行代表性能力冒烟测试,验证 lane、adapter 等变更后的功能正常性。要求执行实际 CLI/MCP 操作及负向检查,严格依据回执和产物判定结果,确保安全性与准确性。
通过执行快速探针验证第三方库、API或构建后端的实际行为,防止基于错误假设的集成 bug。适用于新依赖接入、客户端参数选择及上游契约审查。
提供 CLI 运行时验证方案,通过 DB 路径隔离和 runpy 执行真实命令,确保测试数据不污染生产库。涵盖数据播种、功能流检查及错误路径处理,解决硬编码路径导致的潜在风险。
指导采用测试驱动开发(TDD)流程,强调先写失败测试再实现代码。适用于新功能开发、Bug修复及行为修改,通过红绿重构循环确保逻辑正确性与回归安全。
通过启动无背景知识的子代理对截图进行独立视觉审查,以发现人工检查易忽略的视觉缺陷,确保在修复或验证视觉问题前的客观性。
安全漏洞筛选与验证技能,通过7问题门控和4个预提交检查点评估发现的有效性。确保仅提交经过严格验证、符合范围且具备实际影响的漏洞,剔除无效或已知项,提高报告质量并降低N/A比例。
提供 Pipeline Studio 应用的 Playwright E2E 测试编写与调试指南,涵盖环境配置、CLI 交互探测、选择器探索及 playwright-cli 自动化调试工作流。
指导测试驱动开发实践,强调先写失败测试再实现代码的循环。用于功能开发、修复回归及评估测试价值,规范测试边界与命名,确保代码质量与可维护性。
基于 Aider Polyglot 语料库运行、校准和比较编码代理评估。支持 Capstan 与 OpenCode 的公平基准测试,提供复现性执行流程、资源测量及诊断功能。
分析现有XML站点地图或生成新站点地图,验证格式、URL及结构。支持发现候选文件、执行多项校验(如大小限制、HTTP状态、lastmod准确性等),并识别常见质量问题与扩展类型规范。
用于驱动Silo桌面应用进行运行时验证,通过RPC桥接执行操作并捕获屏幕证据。严格遵循在临时沙箱环境中操作的原则,避免影响用户真实数据,并通过合并命令减少Agent交互轮次以提升效率。


