用于为项目配置性能基准测试及CodSpeed集成。支持多语言框架自动检测与设置,帮助开发者建立性能监控体系,识别热点路径并追踪代码性能变化。
用于迭代式创建LangSmith在线评估器。通过检查Trace数据、访谈用户确定评估标准,并构建LLM或代码型评估器,旨在优化大模型应用的质量监控与评估流程。
用于验证重构阶段是否符合规范并记录进度。按顺序执行构建、测试、回归和审查检查清单,任一失败即停止;全部通过后更新进度文档、路线图状态及提交建议,不执行合并操作。
管控代码实现阶段,依据执行契约进行TDD开发、批量实施及变更隔离。强制分支预检与测试优先,确保逻辑正确性与规范合规,防止范围蔓延。
对网文项目进行只读诊断,检查目录结构、文件完整性、JSON/SQLite数据、RAG配置及依赖项,确保各阶段产物合规。
用于在VS Code仓库中运行集成测试,涵盖Node.js和扩展宿主测试的执行脚本、参数过滤及两者区别。
提供Windows 95在Electron中的自动化探测工具,用于测试v86更新、SMB变更及引导稳定性。支持自动启动、键盘输入模拟及详细日志输出,辅助回归分析与版本对比。
遵循测试驱动开发(TDD)流程,先写失败测试再实现代码。适用于新功能、Bug修复及逻辑修改,通过红绿重构循环确保代码正确性并防止回归。
用于在Android模拟器中通过adb驱动执行功能测试、UI交互复现、截图及日志捕获的QA技能。
用于设计、运行和审查 Lemma 智能体、函数及工作流的重复性评估。涵盖定义评估契约、快照目标状态、构建可重放用例,以验证行为正确性、安全性及回归问题。
代码修改后强制执行的自检流程,基于29条规则防止已知Bug。涵盖预修改扫描、按变更类型定位规则、面包屑自动播种及完整性检查,支持失败恢复与优雅降级。
指导编写符合仓库风格的测试用例,根据缺陷位置选择单元、冒烟或TUI测试层级,断言行为而非实现细节,确保独立且覆盖边界情况,最终运行并诚实报告结果。


