用于在LangSmith中迭代构建在线评估器。通过检查追踪数据、与用户沟通确定评估标准,进而设计并生成LLM或代码类型的评估器,支持配置审批与API调用验证。
提供Android应用构建、测试及自动化脚本,支持基于无障碍的UI导航、日志监控和模拟器生命周期管理,专为AI代理优化。
作为构建执行者,依据执行契约管控代码实现。强制执行TDD、分支隔离及测试验证,确保开发纪律与质量,防止偏离规范。
自动化执行VS Code性能与内存调查流程,包括场景定义、Playwright驱动测试、堆快照采集及结果验证,为后续对象级分析提供数据。
提供Windows 95虚拟机的自动化探针工具,用于在Electron环境中无头启动、监控引导状态及SMB交互。适用于测试v86更新、键盘输入稳定性、系统引导成功率及回归分析。
管理tdd-guard系统的初始化、配置与故障排除。用于新仓库TDD环境搭建、测试框架报告器接入、误报处理及强制/暂停执行策略调整,确保开发流程符合测试驱动规范。
监控 SendGrid 邮件程序健康度,通过 SEQ API 获取评分及五项指标(打开率、退信率等),诊断发送信誉与投递问题。需满足 Pro 计划及最低发送量要求,用于优化收件箱放置率。
用于设计、运行和审查 Lemma 智能体、函数及工作流的重复性评估。涵盖评估契约定义、基线与候选版本对比、确定性检查、权限与安全测试及回归分析,确保行为符合预期并保留完整证据。
提供Go语言测试最佳实践,涵盖表格驱动测试、子测试、基准测试及模糊测试。遵循TDD方法论,指导编写可靠且可维护的测试代码,提升代码质量与覆盖率。
用于录制、审计和重放确定性Tutti AgentGUI会话回放Cassette。涵盖场景设计、执行记录、差异诊断与证据验证,确保Provider帧及语义状态一致性。
安全终端执行器,强制将网络请求封装为带超时保护的Node.js脚本,防止命令卡死。支持快速通道处理简单健康检查,提供五步工作流确保执行安全与可追溯。
指导 Edmund 编辑器验证与质量保证,明确 Swift Testing 框架下的证据层级。涵盖单元测试、窗口测试、回归脚本及视觉 QA,确保修复具备充分证明,防止因头测局限导致的漏报。


