用于编写或审查DeepSeek Harness插件、外部包及仓库变更的测试用例。指导选择最小充分测试集,涵盖版本迁移验证、Docker发布冒烟测试及多种测试层级,确保功能正确性与兼容性。
Playwright命令行工具,用于自动化浏览器交互、网页测试及脚本执行。支持页面导航、元素操作(点击/输入)、截图、状态管理及多标签页控制,适用于Web应用的功能验证与调试。
针对 traceway-cli 的集成测试技能,在用户显式请求时运行端到端验证。补充 Go smoke suite 未覆盖的真实数据详情、TTY 渲染及自适应指标发现,生成覆盖率报告,严格遵循只读安全约束。
自动监控PR状态直至通过CI检查并回复Review评论。通过后台轮询获取检查结果,智能分类失败原因(如基础设施或测试断言),并在无明确授权时不合并PR,确保流程安全高效。
指导如何更新 Python conda 环境测试中 Miniconda 的固定版本,包括定位配置文件、选择新版本及处理大版本变更。
生成用于压力测试的Excel工作簿,覆盖Workbook、Sheet及各类对象层级的内容类型。旨在测量解析器完整性并支持回归测试,包含多种格式支持和确定性种子生成。
基于GUI黑盒测试的前端验收与验证技能,通过真实交互、只读DOM检查和截图验证前端行为,严格禁止修改代码或注入JS,适用于功能验收、Bug复现及视觉检查。
用于运行和审阅 ReadAware Agent 的行为评测,诊断具体场景并维护测试数据。涵盖选择工作范围、执行评测、结构化审阅及结果汇总,区分确定性与语义评估,确保模型行为验收的准确性与可追溯性。
专注于设计、审查和诊断 DeepSeek Harness CI 中因并发、共享资源或异步清理导致的非确定性测试失败。提供资源原子分配、进程状态隔离及执行拓扑建模策略,以解决 CI 环境下的测试不稳定问题。
通过执行行为检查、可重复工件及独立GPT-6 Luna模型验证代码变更,合并低信号测试。提供从设置检查器到定义检查策略再到执行候选方案的完整流程,实现基于证据的测试精简与质量保障。
提供只读运维仪表盘,监控本地会话、CLIProxy网关、模型目录及认证池状态。用于查看实时指标和诊断问题,不执行任何配置修改或服务重启操作。
自动化执行 Omnigent 并发负载测试,收集参数并运行本地栈,最终读取结果文件分析延迟分布、吞吐量及失败情况,适用于压测和基准评估场景。


