轻量级集成健康状态面板,快速展示各配置集成的运行状态(正常/未配置/缺失),无网络调用,支持文本或JSON输出。
执行 Omnigent 负载测试,模拟多轮真实对话以评估系统并发能力与延迟分布。收集参数运行 Locust,解析结果并解释吞吐量、失败率及延迟百分位数。
用于编写、调试和运行 Archestra Playwright E2E 测试,涵盖 API/UI 夹具配置、WireMock 模拟服务及本地/CI 环境搭建。
专注于编写高质量测试、应用分层 mocking 策略及系统化调试失败。涵盖单元测试到 E2E 的层级划分、边界处理、Flaky 测试管理及测试金字塔实践,确保行为正确性与代码可维护性。
TDD技能,要求先写失败测试再实现代码。适用于新逻辑开发、Bug修复及功能修改,通过红绿重构循环确保代码质量与正确性。
用于编写、审查和执行 CubeSandbox SDK 兼容性端到端测试用例。涵盖生命周期、网络策略及后端兼容性等场景,提供从用例开发到执行验证的完整工作流指导。
钉钉文档 CLI 的本地 Mock 工具,用于在无网络和凭证环境下模拟 dws 命令。支持文档读写、搜索等操作,提供 JSON 输出和验证接口,适用于 Agent 测试与开发调试。
提供量化策略回测最佳实践,涵盖样本量评估、窗口选择及过拟合防范。用于判断回测结果可靠性,指导参数优化与实盘部署决策。
在本地运行完整生产形态的开发实例,集成LLM、Postgres和Slack Bot,支持多工作区并行且不冲突。用于端到端QA、分支测试及Slack内交互验证。
验证代码实现是否与变更规范、任务和设计文档一致,通过完整性、正确性和一致性维度生成报告,确保交付质量。
用于定义、构建、运行和审计 Harbor 评估任务,涵盖 Agent 评测、基准测试及验证器设计。通过迭代方式创建测试用例并独立评分。
提供Android应用全面测试策略指导,涵盖单元测试、Hilt集成测试及基于Roborazzi的截图测试,包含依赖配置与最佳实践。
用于验证重构阶段是否符合规范并记录进度。按顺序执行构建、测试、回归和审查检查清单,任一失败即停止;全部通过后更新进度文档、路线图状态及提交建议,不执行合并操作。


