用于在用户加入会议或视频会话前,执行浏览器支持、摄像头、麦克风、网络等预检诊断,决定拦截、警告或收集遥测数据,并辅助调试设备权限与环境问题。
用于验证ChatCut插件编辑结果是否准确反映在项目结构和时间线输出中,结合结构与视觉证据确保渲染正确性。
用于设计和运行可重复的评估,验证 Lemma Agent、函数和工作流的实际行为。涵盖契约定义、基线快照、用例构建及结果审查,确保在真实身份和权限下的正确性与安全性。
技能目录路由校验工具,通过TF-IDF和余弦相似度检测描述重叠与范围越界,防止技能误触发。在提交或编辑SKILL.md时自动运行,确保路由准确性。
用于验证BetterCmdTab macOS应用代码变更的端到端运行时证据。通过构建、启动隔离进程并模拟真实用户交互,确认产品文件变更是否产生预期的可观测结果,为发布提供决策依据。
用于端到端验证 jlens-qwen36 UI 和服务器变更的技能。通过启动本地服务器,利用 Playwright 在无头浏览器中自动化驱动界面交互,覆盖聊天、干预搜索及 A/B 对比等核心流程,确保功能正确性。
用于在Tutti环境中对Agent会话回放Cassette进行资格认证、诊断和录制。涵盖从脚本执行、结构审计到新鲜回放的完整流程,支持新Provider捕获及缺陷排查。
自动化Web应用测试技能,基于Playwright和tesseract.js执行冒烟、全量及截图回归测试。支持自动检测项目类型以避免无效运行,通过pipeline.json配置目标URL与DOM选择器,验证UI渲染正确性及页面元素存在性。
指导为 Rust 项目编写符合仓库风格的测试,涵盖单元、冒烟及 TUI 测试层级选择。强调行为驱动、独立性及按回归成本选择最低测试级别,确保捕获真实缺陷。
提供ML模型基准测试的严谨评估方法论,涵盖数据划分、基线验证、数据泄漏检测及多种子鲁棒性分析,确保实验结果的可复现性与公正性。
PR 提交前的本地验证流程,按成本从低到高依次执行范围检查、类型检查、前后端测试、构建及代码规范检查,确保 PR 质量与合规性。
在代码完成流程中验证测试覆盖率和质量,通过非阻塞警告鼓励开发者编写测试,评估测试存在性、覆盖策略及质量,培养测试习惯。


