提供基于 Playwright 的本地 Web 应用测试工具包,支持启动服务器、验证前端功能、调试 UI 行为及捕获截图。通过决策树指导静态/动态页面的自动化测试流程,强调使用黑盒脚本管理服务器生命周期。
强制AI在声明任务完成前必须执行并展示最新验证证据(如测试日志、构建输出),杜绝无依据的成功断言,确保结果真实可靠。
面向SOC日常操作的快速安全扫描技能,覆盖事件、身份、终端等7大领域。通过并行查询生成威胁仪表盘及下钻建议,适用于新手入门或日常巡检场景。
指导为AReaL项目添加单元测试,涵盖测试类型识别、文件结构创建、编写规范及CI策略配置。适用于新增功能测试或提升覆盖率场景。
bili_webOS发版前验证方法论,涵盖五层自动化管线、真机CDP测试及旧设备兼容。强调正对照验证纪律与深链调试工具,确保TV端功能稳定与正确性。
用于 Terragrunt 0.93+ 配置的全面验证、Linter 检查、安全扫描及依赖分析,支持 HCL 格式化、输入校验与 Dry-run 测试。
指导代理进行授权XXE漏洞测试的领域边界、转向策略及证据标准,涵盖经典、盲注及参数实体等变体,确保测试在预授权范围内合规执行。
强制在声称工作完成前运行验证命令并提供证据,禁止无验证的断言。适用于测试、构建、修复等场景,确保所有成功声明基于实际输出而非推测或代理报告。
Web与AI安全测试知识库,支持渗透、红队及漏洞挖掘。融合WooYun、先知、GAARM及OWASP数据,提供Payload引用、幻觉防护及授权边界控制,专注实战测试场景。
指导用户运行、配置和评估 SWE-bench Lite 基准测试,涵盖环境搭建、参数配置及结果报告,适用于 agtx agent 工作流性能评测。
定义 Edmund 编辑器的测试证据标准,基于 Swift Testing 框架。明确不同变更类型所需的验证强度(如单元测试、窗口测试、重放脚本等),防止因无头测试掩盖真实缺陷,确保修复具备充分证明。
指导测试驱动开发(TDD)实践,强调通过公共接口验证行为而非实现细节。倡导垂直切片工作流,反对先写所有测试再实现的横向切片模式,旨在编写高内聚、易维护的集成测试。
用于验证DART 3D场景和物理仿真的正确性,通过文本指标与视觉检查结合的方式,检测动力学、碰撞及GUI输出问题。


