提供 SWE-bench Lite 基准测试指南,涵盖环境配置、Docker沙箱设置、多智能体工作流配置及执行评估,辅助用户运行 agtx agent 工作流的性能评测。
定义 Edmund 编辑器验证与 QA 标准,基于 Swift Testing 框架构建证据层级。指导如何根据变更类型(如逻辑、渲染、IME)选择从单元测试到视觉对比的合适测试手段,确保修复有效并满足发布要求。
提供Solidity智能合约的全面测试策略,涵盖Hardhat和Foundry工具链。支持单元测试、集成测试、主网分叉模拟、模糊测试及Gas优化验证,用于确保DeFi协议和区块链合约的安全性与正确性。
指导测试驱动开发(TDD),强调通过公共接口验证行为而非实现细节。提倡垂直切片方法,避免一次性编写所有测试的横向切片反模式,确保测试具有可维护性并能反映真实业务逻辑。
用于验证DART 3D场景和物理仿真的正确性。通过文本指标(轨迹、碰撞)为主,无头渲染图像为辅的方式,检测动力学、几何穿透等缺陷,支持实现、调试及审查任务。
对知识库进行健康检查,检测断链、孤立页面、矛盾声明、过时内容及缺失交叉引用等问题,并生成按严重程度分类的可操作修复报告。
驱动红绿重构TDD开发循环,指导先写失败测试再实现代码及重构。包含ATDD模式及集成测试容器生命周期管理,确保高质量交付。
强制执行验证优先的开发纪律,要求编码前确认实际数据,实施组件与功能双重测试,并强制提供DEMO证据以确保质量。
用于执行 Keychat 项目的测试任务。支持运行全部测试、仅 Flutter/Dart 测试或指定文件,并清晰报告测试结果。
审计 TanStack AI 适配器与上游文档的功能差异及模型列表更新,生成 Markdown 报告。支持按提供者、功能、模型或活动覆盖范围进行特定分析,也可执行全量扫描。
提供基于 Effect 平台的 HTTP API 端到端测试指南。涵盖测试服务器搭建、HttpClient 注入、Layer 组合顺序及路径参数处理等核心模式与常见陷阱,辅助开发者编写高质量的 HTTP 服务测试用例。
Peekaboo 是 macOS UI 自动化 CLI,支持屏幕捕获、元素定位、输入驱动及应用窗口管理。通过快照缓存和 JSON 输出实现脚本化操作,涵盖点击、拖拽、快捷键及视觉分析等功能,适用于桌面端自动化测试与交互任务。
在本地Windows ARM64 QEMU虚拟机中运行Nub测试和调试探针,通过SSH执行二进制文件和脚本,用于交互式架构兼容性检查。


