提供科学图表生成的通用质量检查清单,涵盖标签重叠、分辨率、色盲友好性及格式规范,用于自动化检测与修复绘图问题。
用于单细胞/单核RNA测序数据的质控、注释和可视化。支持动态阈值选择、scDblFinder双体检测、环境RNA过滤及UMAP降维,确保流程可追溯并适配不同数据集特性。
用于执行简单的上传测试或基础数据检查。通过调用 inspect_schema 和 run_sql_readonly 验证数据源,并以简洁语言总结只读查询结果,旨在进行运行时冒烟测试。
提供ML模型基准评估的严谨方法论,涵盖数据划分、基线验证、数据泄漏检测及多种子鲁棒性分析。用于确保实验结果的可复现性与公正性,防止过拟合和报告偏差。
提供LLM应用的全方位评估策略,涵盖自动化指标、人工评估及LLM-as-Judge方法。用于系统测量性能、对比模型或提示词效果、检测回归问题及建立生产环境基准,确保AI应用质量与可靠性。
设计LLM提示词回归测试套件,通过构建黄金用例集、设定评分标准和CI门禁,确保在提示词修改、模型升级或上下文变更时不破坏生产功能。
用于强化 MLSys 性能声明的可复现性,涵盖系统层全链路环境固化、区分 ML 随机性与系统噪声、规范测量实验设计及方差报告。
用于重建、验证或运行 Core AI 模型库中的模型。通过读取目录和配方,一键导出并检查模型包是否与源模型一致,支持转换、验证及依赖检查等流程。
指导用户在 TradingView 回放模式下进行模拟交易练习。通过逐步回看历史K线,执行买卖操作并跟踪盈亏,帮助用户手动复盘和训练交易策略。
用于对模型生成的视频执行WBench 22项指标评测,涵盖预计算、GPU度量、VLM API及报告生成。适用于用户请求评估模型、运行评分或生成评测报告的场景。
用于在提交至EHR前验证FHIR资源是否符合US Core/USCDI规范。通过运行HL7官方校验器或访问在线工具,检查meta.profile声明、must-support元素及常见合规缺口,并将结果转为OperationOutcome,确保数据被Epic/Cerner等系统接受。
维护语义图谱工作流,涵盖论文、引用、推荐及作者网络工具。支持适配器测试与无API密钥的模拟环境,确保合同、模块、测试及发布门控的正确性。
基于scverse最佳实践对单细胞RNA-seq数据进行质量控制,支持MAD过滤、低质量细胞筛选及可视化,适用于标准或自定义QC工作流。
Trackio用于ML训练实验追踪,提供Python API记录指标与警报,CLI检索数据,支持HF Space实时同步、Webhook告警及JSON自动化输出。
用于机器学习训练实验的指标记录、可视化及告警监控。支持通过Python API在训练脚本中记录指标和触发诊断告警,或通过CLI查询历史数据并同步至HF Space仪表盘,实现自动化实验迭代。


