用于运行 ApexGuru 性能扫描,检测 Salesforce Apex 项目中的性能反模式(如循环内 SOQL/DML),并生成包含修复建议的详细报告。
执行真实用户视角的QA流程,包括自动化测试、UX缺陷挖掘及Bug审查会议。生成结构化Bug报告、HTML仪表盘及YES/NO发布建议,实现与工程追踪器的双向同步,辅助团队进行版本验收。
用于编译 Articraft 记录、启动本地查看器及 API,检查关节资产可视化效果,并执行前端和 API 的代码质量检查与测试。
提供基于测试金字塔的风险驱动测试策略,涵盖单元到E2E各层职责、覆盖率目标及CI集成规范,助力早期发现缺陷并规模化质量保障。
指导如何为 bench_env 任务编写高质量的离线裁判测试用例,涵盖正负样本设计、模式选择及边界覆盖,确保测试能真实暴露 Agent 缺陷。
针对JavaScript/TypeScript应用的测试专家技能,涵盖单元测试、集成测试和E2E测试的编写与优化。支持调试运行时错误、逻辑缺陷及性能安全问题,提供系统性代码分析和覆盖率提升方案。
ProofShot 是用于 UI 视觉验证的 CLI 工具,支持录制视频、截图及错误报告。适用于构建或修改 UI 组件后的自动化测试与人工复核,确保前端界面正确性。
用于为AI应用编写测试夹具,模拟LLM响应、工具调用序列及多轮对话。支持多种提供商和多媒体端点,通过匹配规则定义响应,适用于调试、混沌测试及记录回放场景。
用于通过PilotDeck的browser-use插件进行浏览器自动化,包括本地Web UI冒烟测试、截图、导航、点击、输入及DOM检查。优先使用现有缓存,仅在确实需要交互式浏览器且缺失时安装Chrome for Testing。
为新增的SSIM视频相似度测试生成并上传参考文件(mp4或pt)。在Modal L40S上运行测试,下载产物,人工验证质量后,仅将新文件上传至HuggingFace数据集,确保CI环境可用。
用于为功能、缺陷修复等场景设计高价值测试策略,生成覆盖矩阵与验证方案,识别风险并避免低信号测试。
用于重放客户端工具调用固定场景,验证 Chat2API 对 Cherry Studio 等特定客户端的流式与非流式行为是否符合预期。
定期审计研究知识库,检测过期档案、论点偏离和孤立页面,生成0-100健康评分及改进建议。
用于验证 HuggingFace 与 Megatron/MCore checkpoint 在 TP/PP 设置下行为一致性的双语指南。提供 pytest 测试套件及转换脚本,支持模型格式转换、一致性校验及无损重分片。


