盲重发现操作的检查清单与辅助工具,通过分离_blind/和_curated/目录确保语音独立性验证。用于在存在历史发现的场景中进行假设探索,防止数据污染实验结果。
确保产品事实(如功能描述、字段名)在代码、文档、UI等多处保持一致。通过枚举变更表面、优先生成而非手动维护、编写漂移测试,避免信息不同步,适用于涉及跨仓库或跨文件的内容/格式变更场景。
指导采用测试驱动开发(TDD)流程,强调先写失败测试再实现代码。适用于新功能开发、Bug修复及行为修改,通过红绿重构循环确保逻辑正确性与回归安全。
指导编写高鲁棒性测试的规范,强调断言真实行为而非实现细节。适用于新增测试、回归测试、修复脆弱或易碎测试,以及重构后验证行为一致性的场景。
指导测试驱动开发实践,强调先写失败测试再实现代码的循环。用于功能开发、修复回归及评估测试价值,规范测试边界与命名,确保代码质量与可维护性。
基于 Aider Polyglot 语料库运行、校准和比较编码代理评估。支持 Capstan 与 OpenCode 的公平基准测试,提供复现性执行流程、资源测量及诊断功能。
分析现有XML站点地图或生成新站点地图,验证格式、URL及结构。支持发现候选文件、执行多项校验(如大小限制、HTTP状态、lastmod准确性等),并识别常见质量问题与扩展类型规范。
强制在声明任务完成前执行实时验证,确保基于最新代码的测试结果或构建日志作为完成依据,防止未经证实的断言。
独立检查器,基于隔离资源对交付物进行严格验证。支持审查、行为测试及技术决策评估,不修改产物,仅返回结构化 verdict 及证据,确保结果可信且可追溯。
用于编写和审查DeepSeek Harness插件测试的指南,涵盖版本迁移、Docker冒烟测试及多级测试策略,确保变更正确性。
对抗性审查技能,预设构建物存在缺陷,通过隔离上下文的多视角子代理进行实证复现与攻击性测试,旨在发现代码、安全及逻辑漏洞,区别于静态代码审查。
提供使用 IDE Starter 和 UI Driver 框架编写 UI 测试的指南,涵盖导入、测试结构、页面对象模式及元素选择器,适用于创建或修改 UI 测试用例的场景。


