用于在开发变更执行完毕时,通过状态检查、自动化验证(测试/构建/代码审查)及完整性审计,生成最终报告并归档发布。确保交付物质量与合规性。
配置并运行 Skillgrade 评估流水线,涵盖环境安装、eval.yaml 初始化与配置、多场景评估执行及 CI/CD 集成。用于 Agent Skills 的能力验证与回归测试。
指导通过 REST API 直接调用 Replay QA,涵盖认证、项目创建(基于录制或实时探索)、轮询及缺陷检索。
提供Terragrunt配置的全面验证、Linting、测试及安全扫描能力,支持HCL语法检查、依赖图分析及合规性审计,适配0.93+版本。
提供 SWE-bench Lite 基准测试指南,涵盖环境配置、Docker沙箱设置、多智能体工作流配置及执行评估,辅助用户运行 agtx agent 工作流的性能评测。
提供Bats框架编写Shell脚本单元测试的指导,涵盖测试结构、夹具、最佳实践及CI/CD集成,支持TDD和边缘情况验证。
用于在本地 Linux 虚拟机中运行临时测试和调试探针,解决 Docker 无法复现的内核或发行版行为问题。支持持久化 Lima 调试与隔离 Tart 环境,涵盖系统调用追踪、构建及测试流程。
用于验证脚手架发布就绪状态的聚合检查技能,整合医生检查、见证验证、硬编码路径扫描、MCP配置及GCP密钥管理验证。
扫描包清单与锁文件,识别过时依赖及已知CVE漏洞。按风险等级(补丁、次要、主要)分类更新建议,并依据规则决定自动修补或人工升级,辅助依赖维护流程。
生成服务负载与性能测试计划,包含场景定义、k6/Locust脚本骨架、阈值表及CI集成步骤。用于明确性能验收标准,消除歧义,确保工程师能基于SLO获得明确的通过/失败结果。
在提交、推送或创建PR前执行检查,确保文件状态正确、无遗漏、验证通过且PR元数据规范,防止错误合并。


