执行 Omnigent 负载测试,模拟真实主机会话并分析延迟分布。用于压力测试、基准测试及评估系统并发处理能力,区别于单请求微基准测试。
指导判断测试必要性及层级选择,防止无效测试。涵盖后端路由集成、前端MSW集成及单元测试策略,强调测试应能捕获真实缺陷而非断言字面量。
用于验证 OpenChatCut 项目中代理编辑结果是否生效的技能。通过 L0-L2 不同级别,结合静态检查、编辑器运行及桌面应用测试,利用 read_project、view_timeline_frames 等工具确认时间线和素材帧的准确性。
测试专家技能,指导编写高质量单元测试、集成测试和E2E测试。涵盖分层 mocking 策略、AAA 模式、失败调试及不稳定测试管理,确保测试行为而非实现细节,提升代码质量与可靠性。
指导采用测试驱动开发(TDD)流程,先写失败测试再实现代码。适用于新功能开发、Bug修复及现有功能修改,确保通过测试验证逻辑正确性并防止回归。
用于 CubeSandbox SDK 兼容性 E2E pytest 用例的编写、审查、执行与调试。涵盖生命周期、网络策略等场景,遵循特定工作流与规范。
钉钉文档CLI模拟工具,提供无网络凭据的本地环境用于测试Agent对dws命令的调用行为,支持文档读写、搜索及状态重置等Mock功能。
提供钉钉文档CLI的本地Mock环境,支持无网络和无凭证下的文档操作测试。适用于验证命令交互、状态管理及数据读写逻辑,确保开发调试安全隔离。
针对Polymarket临近截止日期的市场概率漂移策略,通过回测历史价格行为分析时间衰减影响,提供谨慎的仓位建议与退出时机。
将当前代码分支在本地启动完整的生产级开发实例(含LLM、Postgres、Slack Bot等),支持多开发者并行运行且互不冲突,用于端到端QA和集成测试。
用于为项目配置性能基准测试和CodSpeed集成。支持多语言框架检测、热点路径识别及自动化基准测试设置,旨在建立性能监控与追踪体系。
验证代码实现是否与变更工件(规格、任务、设计)一致。通过检查任务完成度、需求覆盖和设计一致性,生成包含关键问题的验证报告,确保在归档前实现完整且正确。
用于在 LangSmith 中迭代构建在线评估器。通过检查追踪数据、访谈用户并确定评估方向,最终生成 LLM-as-judge 或代码类型的评估逻辑,以验证应用质量。
提供现代Android应用测试策略指导,涵盖单元测试、Hilt集成测试及Roborazzi截图测试。包含依赖配置、用例编写及运行命令,旨在保障UI与逻辑正确性。
用于验证重构阶段是否符合规范并记录进度。按顺序执行构建、测试、回归和审查检查清单,任一失败即停止;全部通过后更新进度文档、路线图状态及提交建议,不执行合并操作。


