分析检查点规范与现有测试,识别并补充缺失的边界用例(如空值、极值、格式异常等),确保测试覆盖完整且符合规范定义。
vllm-bench 是用于基准测试 OpenAI 兼容或 vLLM 服务端的 Rust 工具,支持多轮对话、并发压测及 TTFT/TPOT/吞吐量等指标测量。
用于运行语音模型性能与质量基准测试,支持ASR、TTS、VAD及说话人分离。报告WER、RTF、内存和吞吐量等指标,帮助评估不同引擎或变体的表现。
对 Obsidian 知识库执行只读健康检查,检测死链、孤立页面及元数据问题。通过解析引擎输出报告,严格区分事实与修复建议,禁止自动修改文件,确保审计安全。
提供Giskard OSS仓库PR合并就绪工作流,指导执行格式化、代码检查及单元测试以确保CI通过。适用于准备或更新Pull Request、验证分支状态及运行预推送检查的场景。
验证已安装插件的完整性,比对清单SHA256与磁盘文件,检测篡改或损坏。适用于用户询问插件状态、报告故障或需要验证完整性时触发。
提供 Playwright 测试开发的全方位指南,涵盖 E2E、组件、API 及可视化测试。支持修复不稳定测试、调试失败、实现 POM 模式、配置 CI/CD 及优化性能,辅助编写和维护高质量自动化测试套件。
面向R语言的TDD工作流技能,基于testthat框架,强制测试先行开发模式。涵盖单元测试、集成测试及快照测试,要求80%以上代码覆盖率,适用于新功能编写、Bug修复与重构场景。
Rust RTK过滤器开发的TDD工作流,强制Red-Green-Refactor循环。强调使用真实数据构建测试夹具、确保至少60%的Token节省率,并利用insta进行输出快照测试,以规范代码质量与效率。
强制在声称工作完成前执行验证命令并检查输出,禁止无证据断言成功。确保测试、构建或修复结果真实可靠,防止未经验证即提交或报告通过。
监控网站SEO状态变化,通过对比基线检测排名下降、页面掉权、标题元描述被覆盖或Schema消失等回归问题。适用于迁移、重构或发布后检查SEO是否受损。
用于在本地构建、运行 OpenFront 浏览器游戏并进行自动化测试。支持启动开发服务器,通过无头 Chromium 驱动 UI 交互(如截图、读取状态),以及执行端到端的 WebGL 游戏流程测试。
用于在嵌入式浏览器中进行工作流验证、问题复现和回归测试。提供可重复的证据优先调试循环,规范工具使用与证据捕获,区分产品缺陷与等待或定位失败。


