用于终端代理(Con)的基准驱动改进循环。通过运行算子配置、评分、记录迭代并执行产品变更,实现持续优化。适用于迭代窗格感知、SSH/tmux行为及编码流程等场景。
为原生 Android 应用分析和创建测试策略,包括安装测试库、搭建测试基础设施及生成单元测试、UI 测试等框架的集成方案。
用于 Okojo 运行时/编译器开发及 Test262 合规性修复。涵盖实现决策、本地测试循环运行、字节码与 V8 行为对比调试,以及标准对齐的 Bug 修复工作流。
用于自动化浏览器交互,支持网页导航、DOM快照分析、表单填写、截图及数据提取。适用于Web应用测试、信息抓取和前端页面操作场景。
作为测试架构师,生成需求到测试的追溯矩阵,分析覆盖率并做出质量门禁决策(通过/关注/失败/豁免)。
执行仓库架构分析,支持全量或增量检查模式,并可选启用LLM规则。通过npx运行工具,提示用户选择模式及是否消耗token,最后汇总违规数量与变更情况。
分析检查点规范与现有测试,识别并补充缺失的边界用例(如空值、极值、格式异常等),确保测试覆盖完整且符合规范定义。
vllm-bench 是用于基准测试 OpenAI 兼容或 vLLM 服务端的 Rust 工具,支持多轮对话、并发压测及 TTFT/TPOT/吞吐量等指标测量。
用于运行语音模型性能与质量基准测试,支持ASR、TTS、VAD及说话人分离。报告WER、RTF、内存和吞吐量等指标,帮助评估不同引擎或变体的表现。
对 Obsidian 知识库执行只读健康检查,检测死链、孤立页面及元数据问题。通过解析引擎输出报告,严格区分事实与修复建议,禁止自动修改文件,确保审计安全。
提供Giskard OSS仓库PR合并就绪工作流,指导执行格式化、代码检查及单元测试以确保CI通过。适用于准备或更新Pull Request、验证分支状态及运行预推送检查的场景。
验证已安装插件的完整性,比对清单SHA256与磁盘文件,检测篡改或损坏。适用于用户询问插件状态、报告故障或需要验证完整性时触发。
提供 Playwright 测试开发的全方位指南,涵盖 E2E、组件、API 及可视化测试。支持修复不稳定测试、调试失败、实现 POM 模式、配置 CI/CD 及优化性能,辅助编写和维护高质量自动化测试套件。
面向R语言的TDD工作流技能,基于testthat框架,强制测试先行开发模式。涵盖单元测试、集成测试及快照测试,要求80%以上代码覆盖率,适用于新功能编写、Bug修复与重构场景。


