提供Windows 95虚拟机的自动化探针工具,用于在Electron环境中无头启动、监控引导状态及SMB交互。适用于测试v86更新、键盘输入稳定性、系统引导成功率及回归分析。
用于在真实浏览器中端到端测试Web应用,通过Playwright驱动流程、断言UI、捕获控制台/网络/性能证据及视觉输出,管理本地服务生命周期并收集调试数据。
用于药物发现中的化合物库筛选与优先级排序,提供类药性规则、结构警报及化学基团检测等过滤功能。
用于配置和运行 Agent Skill 的评估流水线。涵盖安装、初始化 eval.yaml、执行不同规模的测试(冒烟/回归)、查看结果及集成 CI/CD,旨在自动化验证 Agent 技能质量。
提供 Zoom 会议/视频加入前的设备就绪检查能力,涵盖浏览器、音视频设备及网络诊断。用于在用户加入前执行预检流程,根据结果决定阻断、警告或收集遥测数据,确保会话环境合规。
验证插件编辑是否准确反映在项目结构和时间线输出中。通过读取项目结构及检查渲染后的视觉帧(像素级)来确认变更生效,确保无虚假完成报告。
用于设计、运行和审查 Lemma 智能体、函数及工作流的重复性评估。涵盖评估契约定义、基线与候选版本对比、确定性检查、权限与安全测试及回归分析,确保行为符合预期并保留完整证据。
技能目录路由检查器,通过TF-IDF分析描述重叠与范围越界,防止技能冲突导致路由错误。在添加或修改SKILL.md时自动运行,确保每个技能描述唯一且触发词准确归属。
提供Go语言测试最佳实践,涵盖表格驱动测试、子测试、基准测试及模糊测试。遵循TDD方法论,指导编写可靠且可维护的测试代码,提升代码质量与覆盖率。
用于验证BetterCmdTab macOS应用代码变更的端到端运行时证据。通过构建Debug/Release版本,启动独立进程模拟用户交互,捕获界面与行为变化以确认修改生效。
用于执行简单的上传测试或基础数据检查。通过调用inspect_schema和run_sql_readonly进行只读查询,并以自然语言总结结果,旨在验证数据源连通性和基本功能。
用于端到端验证jlens-qwen36 UI和服务变更的技能。通过启动服务器并驱动无头浏览器(Playwright/Chromium)执行聊天、干预搜索和A/B对比等自动化流程,确保功能正确性。
用于录制、审计和重放确定性Tutti AgentGUI会话回放Cassette。涵盖场景设计、执行记录、差异诊断与证据验证,确保Provider帧及语义状态一致性。
自动化Web应用测试技能,基于Playwright进行浏览器交互与DOM断言,结合tesseract.js实现OCR截图验证。支持冒烟、全量及回归测试,具备项目类型自动检测能力,适用于前端UI渲染正确性验证。


