通过专用 Python 包装器安全执行 Gradle 构建、测试及诊断,规范输出管理并防止并发冲突,适用于构建验证与故障排查。
TDD技能指导测试驱动开发流程,强调通过公共接口验证行为而非实现细节。涵盖良好测试标准、Seam选择、反模式识别及红绿重构循环规则,确保测试具备可维护性并聚焦关键路径。
基于 Playwright 的 Web 应用测试工具包,支持本地前端功能验证、UI 调试、截图及日志查看。提供辅助脚本管理服务器生命周期,指导用户通过侦察后行动模式编写自动化测试脚本。
用于测试Stripe支付集成,包括模拟触发Webhook事件、监听和转发实时日志以及管理支付资源。支持JSON结构化输出,便于Agent自动化调用以验证API交互和排查问题。
指导编写和运行Verl-Omni CPU测试,涵盖无GPU环境下的适配器、奖励及配置测试。提供CI触发机制、本地复现技巧及配置构造等最佳实践,用于添加测试或修复失败。
用于在用户明确请求时运行性能基准测试,通过预检环境、分类意图并确认后执行A/B对比或发布级评估,生成持久化报告以验证性能影响。
验证V9部署就绪状态及变更后的回归问题,覆盖安装脚本、Ansible角色、Helm图表和中间件拓扑。在Codex修改相关文件后运行标准本地验证流程,确保部署包可交付且无回归缺陷。
指导使用kata CLI/TUI工具,通过tmux模拟真实终端环境验证界面变更。涵盖构建、CLI管道输出及TUI交互流程测试,确保ANSI颜色、窗口大小调整和快捷键响应的正确性。
定义编写和审查测试的规范,涵盖何时测试、优先使用不变量测试而非示例、文件结构及具体规则,指导使用bun:test和Playwright。
作为盲测评分子Agent,通过隔离上下文仅读取脚本和评分标准,对内容维度进行0-5分打分。严格拒绝访问任何含实绩或后视数据的路径,防止主对话污染,为校准模型提供纯净评分锚点。
基于 Playwright 的视觉回归测试工具,通过对比变更前后的 UI 截图,检测布局偏移、颜色变化及响应式问题,确保前端样式修改未引入视觉缺陷。


