强制要求先写失败测试再实现代码的TDD流程,涵盖红绿重构循环,确保测试有效性与代码质量。
通过普通任务板运行代表性能力冒烟测试,验证 lane、adapter 等变更后的功能正常性。要求执行实际 CLI/MCP 操作及负向检查,严格依据回执和产物判定结果,确保安全性与准确性。
通过编写一次性探测脚本验证第三方库、API或构建后端的真实行为,防止因错误假设导致的集成Bug。适用于新依赖集成、客户端参数选择及上游契约审查等场景。
提供 CLI 运行时验证方案,通过 DB 路径隔离和 runpy 执行真实命令,确保测试不污染生产数据。涵盖数据种入、输出流校验及异常处理,解决硬编码 DB 导致的副作用问题。
针对 Ollama、llama.cpp 等真实推理运行时执行冒烟测试,验证从拉取到服务的全链路行为。使用真实模型权重与二进制文件,检测 mocks 无法覆盖的数据漂移、进程管理及清理问题,确保发布就绪。
用于运行和校准基于Aider Polyglot语料的编程Agent评估,支持Capstan与OpenCode的多轮对比、性能测量及公平基准测试。
用于编写或审查 DeepSeek Harness 插件测试的指南。涵盖版本迁移、Docker 冒烟测试及多级验证策略,强调最小充分测试集与真实运行时验证,确保插件变更正确性及兼容性。
用于 traceway-cli 的端到端集成测试技能。在用户显式请求时,对实时服务器执行只读验证,覆盖真实数据详情、TTY渲染及自适应指标发现,并生成覆盖率报告,严格禁止任何写操作。
对比分析Python类型推断工具(ty, pyrefly, basedpyright等)的输出结果。通过运行代码片段或文件,生成包含各工具诊断差异、退出码和耗时的汇总报告,辅助开发者理解类型检查行为及分歧。
基于反馈和测试迭代优化Excel解析管道,采用TDD方法修复解析、Schema及归一化等缺陷,确保输出符合黄金标准并提升覆盖率。
提供mlx-serve性能基准测试的方法论,涵盖llmprobe工具使用、对比陷阱规避及性能声明规范。指导在运行基准测试或发布性能数据前,确保测量一致性、消除热效应干扰并正确归因引擎差异。


