专注于编写高质量测试、调试失败及管理不稳定用例的专家技能。涵盖单元测试至E2E的分层策略、边界模拟规则及测试设计原则,确保测试行为而非实现细节,提升代码质量与可维护性。
用于编写、审查和运行 CubeSandbox SDK 兼容性 E2E pytest 测试用例。涵盖用例开发、代码审查、执行及调试,支持生命周期、网络策略等场景的端到端验证。
提供钉钉文档CLI的本地Mock环境,模拟dws命令行为。用于在无需真实凭证和网络的情况下测试和验证钉钉文档工作流,支持JSON输出、状态重置及干跑模式,确保开发安全与效率。
用于为项目配置性能基准测试和CodSpeed集成。自动检测语言与构建系统,选择合适框架(如Rust/Criterion、Python/pytest等)或通用执行模式,生成基准代码并连接CI以追踪性能变化。
用于升级 Go ai-sdk 仓库中 Vercel AI SDK 的对齐基线。通过检查上游变更、重新生成一致性预期、修复实现差异并更新测试覆盖,确保本地实现与最新稳定版 npm 包保持一致。
迭代式构建LangSmith在线评估器。通过检查Trace数据、访谈用户确定评估维度,随后设计并实现LLM裁判或代码类评估器,全程需用户确认配置与方向,确保评估逻辑符合业务质量要求。
提供Android应用构建、测试及自动化脚本,支持无障碍UI导航、日志监控和模拟器生命周期管理,专为AI Agent优化。
用于验证重构阶段是否符合规范并记录进度。按顺序执行构建、测试、回归和审查检查清单,任一失败即停止;全部通过后更新进度文档、路线图状态及提交建议,不执行合并操作。
用于在 VS Code 仓库中运行集成测试,涵盖 Node.js 和扩展宿主测试两类,说明脚本用法及 --run、--grep、--suite 等参数过滤逻辑。
提供Windows 95虚拟机的自动化探针工具,用于在Electron环境下测试v86更新、SMB变更及引导稳定性。支持无头运行、键盘模拟、日志追踪和自动判定成功失败,适用于回归测试与版本二分排查。
TDD(测试驱动开发)技能的别名,指向完整的测试驱动开发流程。用于触发红绿重构循环的开发模式,引导用户执行标准的测试驱动开发实践。
用于验证Dynamo分布式推理部署中RDMA/NVLink互联状态。通过检查环境变量、节点能力及NIXL可达性,确保KV传输路径正确,适用于部署后验证或性能异常排查。
用于设计、运行和审查 Lemma 智能体、函数及工作流的重复性评估。涵盖定义评估契约、快照目标状态、构建可重放测试用例,以验证行为正确性、安全性及回归问题,区别于前端或技能触发测试。


