用于机器学习训练实验的指标记录、可视化及告警监控。支持通过Python API在训练中实时记录指标和触发诊断告警,或通过CLI检索数据并同步至HF Space仪表盘,适用于自动化实验迭代与调试场景。
用于UI视觉验证的CLI工具,通过录制视频、截图和错误报告来确认前端组件或页面的变更效果。支持自动化测试流程及PR提交证明,确保视觉功能正确无误。
用于编写 aimock 测试夹具,模拟 LLM 响应、工具调用及错误注入等场景。支持多提供商适配、多媒体端点、WebSocket 及混沌测试,通过匹配规则与响应定义实现 AI 应用的自动化测试与调试。
提供基于Playwright的浏览器自动化能力,支持UI冒烟测试、截图、表单填写及DOM检查。强调优先使用缓存避免重复下载,仅在真正需要交互场景时使用,静态内容推荐HTTP工具。
为新增的SSIM测试生成并上传参考数据。在Modal L40S上运行测试,下载生成的mp4或pt文件供用户验证质量,随后仅上传该测试的文件至HF数据集,防止覆盖现有数据。
用于设计高价值测试策略,通过行为映射、识别边界场景和选择验证命令来优化覆盖矩阵。适用于生成测试计划、回归策略及QA清单,避免脆弱测试。
用于重放客户端工具调用场景,验证流式与非流式行为,支持Cherry Studio等特定客户端的协议期望。
定期审计研究知识库,检测过期档案、论点偏离和孤立页面,生成0-100健康评分及改进建议。支持手动触发或查看自动周报,适用于知识状态审查。
用于验证 HuggingFace 与 Megatron/MCore 模型检查点在 TP/PP 设置下的行为一致性,提供 pytest 测试套件及双向转换脚本,确保模型部署与重分片的正确性。
定义Playwright自动化测试中的等待策略,主张全局隐式等待覆盖99%场景,显式等待仅用于大文件上传等慢路径,禁止硬等待。
提供测试编写指南,涵盖.sqltest、TCL及Rust集成测试类型与用例。说明如何运行测试套件、转换旧格式及遵循关键规则,确保功能变更通过测试验证。
专注于AI驱动测试自动化、现代框架及质量工程策略的专家技能。支持TDD、自愈测试、跨平台自动化及CI/CD集成,旨在构建可扩展的高质测试体系。


