通过普通任务板运行代表性能力冒烟测试,验证 lane、adapter 等变更后的功能正常性。要求执行实际 CLI/MCP 操作及负向检查,严格依据回执和产物判定结果,确保安全性与准确性。
通过执行快速探针验证第三方库、API或构建后端的实际行为,防止基于错误假设的集成 bug。适用于新依赖接入、客户端参数选择及上游契约审查。
提供 CLI 运行时验证方案,通过 DB 路径隔离和 runpy 执行真实命令,确保测试数据不污染生产库。涵盖数据播种、功能流检查及错误路径处理,解决硬编码路径导致的潜在风险。
针对 Ollama、llama.cpp 等真实推理运行时执行冒烟测试,验证集成完整性与发布就绪状态。通过绑定回环地址、使用经校验的轻量模型及严格清理机制,确保生产环境下的进程行为、端点路由及缓存安全性,替代 Mock 测试以捕获真实数据漂移与异常。
针对 Node.js/Express 等后端应用的专项漏洞扫描技能,覆盖原型链污染、SSTI、命令注入及路径遍历等高危风险,提供从指纹识别到 RCE 利用链的完整检测流程。
对 traceway-cli 进行端到端集成测试,验证真实数据端点、TTY渲染及覆盖率报告。仅在用户明确要求时执行,严格只读且禁止自动触发。
提供IntelliJ IDEA代码库中编写JUnit 5测试的规范,涵盖注解使用、生命周期钩子、共享Fixture模式及资源清理等最佳实践。
用于生成包含各类Excel内容的压力测试工作簿,以验证解析器的完整性和回归测试。覆盖单元格、公式、图表、表格等特性,支持确定性生成和多格式输出。
指导如何调查和优化 DeepSeek Harness 性能,通过测量用户路径、分析瓶颈并提供基于证据的修复方案,涵盖冷启动、历史加载及浏览器响应等场景。
在 OpenMausBot 服务器和对话变更发布前,通过隔离的模拟引擎实例进行验证,确保功能正常。该技能强调使用官方文档提供的共享控制工具,严禁直接调用 API或操作用户生产环境,以保障测试的安全性和准确性。
该技能用于在 Codex 中执行受控的 Sol/Luna 实现工作流。通过 Git 测试蒸馏门控和可选的只读 Luna 审查,确保临时测试在硬化阶段前不被永久采纳,保障代码质量与流程规范。
执行 Omnigent 负载测试,模拟真实主机会话并分析延迟分布。用于压力测试、基准测试及评估系统并发处理能力,区别于单请求微基准测试。


