一种基于 Git 的测试蒸馏流程,通过 Sol 执行构建与集成,Luna 进行只读审查,确保临时测试在硬强化阶段前被过滤,实现代码变更的可验证性。
自动化执行 Omnigent 系统负载测试,收集并发主机、会话等参数,启动本地测试栈并生成结果文件,最终解析延迟分布与吞吐量数据以评估系统性能。
指导Archestra后端单元测试编写,涵盖Vitest双项目隔离策略、MSW HTTP边界模拟及模块Mock规范,旨在提升测试性能与可靠性。
专注于编写高质量测试、应用分层模拟策略及系统调试故障的专家技能。涵盖单元测试、集成测试与E2E测试的设计原则,强调行为断言、边界处理及不稳定测试管理,确保核心业务逻辑的可靠性。
用于 CubeSandbox SDK 兼容性 E2E 测试用例的编写、审查与执行。涵盖生命周期、网络策略等场景,提供从需求分析到 pytest 执行的标准化工作流。
验证代码实现是否完整、正确且一致地匹配变更规范(规格、任务、设计)。通过解析OpenSpec制品,检查任务完成度、需求覆盖及设计一致性,生成包含严重警告和建议的报告。
用于定义、构建、运行和审计 Harbor 评估任务。通过迭代检查代理仓库和用户提供的轨迹,创建并验证评估用例,适用于代理评估、基准测试及验证器设计等场景。
提供Android应用构建、测试与自动化脚本,支持语义化UI导航、日志监控及模拟器生命周期管理,专为AI Agent优化。
用于验证重构阶段是否符合规范并记录进度。按顺序执行构建、测试、回归和审查检查清单,任一失败即停止;全部通过后更新进度文档、路线图状态及提交建议,不执行合并操作。
指导在 VS Code 仓库中运行单元测试,优先使用 runTests 工具获取结构化输出,或回退至平台特定的 shell 脚本执行测试。
提供Windows 95虚拟机在Electron中的自动化探测能力,用于测试v86更新、SMB变更及引导稳定性。支持自动启动、键盘输入模拟、屏幕截图和日志记录,辅助快速回归测试与故障排查。
该技能用于系统性地对 Web 应用进行 QA 测试并修复发现的 Bug,通过调用上游 gstack 克隆的 qa 模块执行。
提供在 Android 模拟器中通过 ADB 执行应用启动、UI 自动化交互(点击/滑动)、截图及日志捕获的 QA 流程,用于验证功能流和复现 UI 缺陷。
用于设计和运行可重复的评估,验证 Lemma Agent、函数和工作流的实际行为。涵盖契约定义、基线快照、用例构建及结果审查,确保在真实身份和权限下的正确性与安全性。


