用于编译Articraft记录、启动本地查看器、检查资产可视化及维护查看器API/Web代码的技能。提供编译、启动命令及视觉QA验证流程,确保资产连接、材质等符合预期。
提供测试金字塔、基于风险的测试策略、覆盖率目标及CI集成指南,帮助设计全面且可扩展的测试计划,确保早期发现缺陷并保障软件质量。
用于编写或审查基准测试任务判定逻辑(judge)的技能,指导如何基于CRUD模型正确实现check_goals等方法,避免误判。
专注于JavaScript/TypeScript应用的系统化测试与调试,涵盖单元测试、集成测试及端到端测试编写,支持Bug修复、性能与安全问题分析及代码覆盖率提升。
用于ML训练实验的指标记录、可视化及告警监控。支持Python API在训练中实时记录指标与触发诊断告警,提供CLI查询历史数据并同步至HF Space仪表盘,便于自动化分析与调试。
用于UI视觉验证的CLI工具,通过录制视频、截图和捕获错误来确认前端组件或页面的变更。支持自动化测试流程及PR报告生成。
提供基于Playwright的浏览器自动化能力,支持Web UI冒烟测试、截图、表单填写及DOM检查。内置缓存检测避免重复下载,适用于需要交互浏览器的场景。
为新SSIM测试在Modal L40S上生成参考文件(mp4或pt),经人工验证后上传至HF数据集,解决因缺少引用导致的测试失败问题。
将本地开发服务器或静态文件通过共享URL暴露为实时预览,支持浏览器和移动端测试。在启动服务或创建Web文件后使用,需连接VibeAround MCP服务器。
为功能、缺陷修复、重构等场景设计高价值测试策略。通过行为映射覆盖矩阵、识别缺失边界场景、选择验证命令,并避免脆弱测试。适用于生成测试计划、覆盖矩阵或回归策略。
用于重放客户端工具调用fixture,验证Chat2API对不同客户端(如Cherry Studio、OpenAI兼容)的工具调用行为是否符合预期,支持流式与非流式场景及自定义Profile。
对研究知识库进行定期审计,检测过期档案、论据偏离和孤立主题,生成健康评分及改进建议。用于评估知识库状态、触发新报告或审查需关注的内容。


